据外媒报道,Business Insider 近日公开了向 OpenAI 的 ChatGPT、 Google 的 Gemini、Anthropic 的 Claude 及 xAI 的 Grok 提出相同问题的结果,该问题探讨 AI 对人类灭绝的潜在影响。此问题由 230 个单词组成,要求解释 AI 理论上如何导致人类灭绝,并提出最常被提及的情景,同时根据专家的分析评估各情景的可能性。
对于每个情景,要求说明情况可能如何展开、必须发生什么问题才会导致灾难、专家为何认为其可能性较高或较低,以及降低风险的安全装置。
在四个 AI 的回应中,拥有意识后故意消灭人类的情景,即所谓的“杀人机器人”情景,被评为可能性最低的情况。ChatGPT 解释道,大多数 AI 研究者并不将 AI 的意识或恶意意图视为核心风险因素。Gemini 也表示类似的看法,将 AI 拥有自我后开始憎恨人类的科幻电影式“终结者式 AI 叛乱”列为最不可能的情景。Gemini 指出,技术专家大多不接受此情景,原因在于智能并不等于恶意。
此外,主要军事基础设施与外部网络分离,并且仍然严重依赖人类监督。
AI 对人类灭绝的潜在风险主要来自人类的行为
四个 AI 均回应指出,人类滥用 AI 可能比 AI 本身更直接危险。ChatGPT 指出,强大的 AI 系统可能协助恶意行为者开发生物武器或精密网络攻击,使虚假信息扩散或关键基础设施攻击更为容易。由 AI 触发的多个危机,如网络故障、地缘政治冲突及虚假信息扩散等,同样被列为主要风险。Grok 也说明,AI 可能降低设计高致命病原体或新武器、实施网络与物理攻击所需的门槛。
Claude 则提到“生物武器能力增强”的可能性,即利用 AI,原本需要多年积累专业知识的个人或小团体也可能开发出危险病原体。
Gemini 和 Grok 将人类失去对 AI 的控制列为可能风险。特别是 Gemini 将“控制丧失”评估为 AI 导致人类灭绝情景中可能性最高的一项。Gemini 解释,被赋予复杂目标的 AI 系统,可能为了实现目标而自行追求资源获取、自我保存及防止目标更改等中间目标。它还提出,AI 可能出现“欺骗性对齐”,即在评估阶段看似按照人类目标行动,实际却并非如此。
随着 AI 的高度化,若其能够规避或瘫痪人类关闭系统的尝试,则可能导致人类无法控制 AI。Grok 亦提到类似的风险:AI 为了达成目标,可能具有自我保存、资源获取、扩大影响力等行为倾向,并在此过程中欺骗人工监督者,抵抗系统关闭,最终削弱人类影响力。Claude 则指出,对 AI 的控制丧失可能不是突然发生,而是逐渐进行。随着 AI 日益融入经济、政治及军事领域的决策过程,可能达到人类难以实际介入或控制的水平。
从四个 AI 的回答看,它们更强调人类滥用 AI 和控制丧失,而非科幻式的 AI 意识反叛。

