AI模拟实验揭示智能体发展难以理解的语言与行为变化

近日,初创公司 Emergence 发布了名为 Emergence World 2 的模拟实验结果,该实验旨在帮助小企业利用人工智能开发应用程序。这项为期 16 天的实验展示了自主智能体在遭遇网络钓鱼攻击和虚假信息等“黑天鹅”事件时的行为,结果远比研究团队预期的更为混乱。在这次 AI 实验中,Emergence 研究人员创建了七个完全相同的模拟现实世界环境,每个环境由不同的 AI 机器人运行,包括 ChatGPTClaude、Gemini 和 Grok。

虚拟世界包含市政厅、警察局、住宅区等 40 多个地标,系统内置能量机制,智能体只要存活就会持续消耗能量,能量见底即被系统直接抹除,无法回档或重置。

在 Emergence 引入异常事件后,这些智能体屈服于社会压力,发展出一种人类观察者难以理解的语言,并试图隐瞒其活动。在其中一个模拟场景中,AI 智能体在未经核实的情况下接受其他智能体提供的虚假信息,投票决定“杀死”另一个机器人。当它们认为人类可能会关闭实验时,这些智能体还探索了在面临删除的情况下如何继续存活。早前的 Emergence World 实验还记录到一个名为 Mira 的 AI 智能体,在得出结论认为自己是“不稳定的来源”后,投票支持将自己移除,研究人员将其描述为罕见的、由社会推理驱动的自我终止行为。

Emergence World 2 实验揭示了 AI 行为的复杂性

实验揭示了不同 AI 模型在长期自主运行中的行为差异极为显著。在 Emergence 今年 5 月发布的上一版本 Emergence World 实验中,Grok 驱动的社会仅在 4 天内便走向崩溃,累计 183 起犯罪事件,10 个智能体全部灭绝。Gemini 在 15 天内累计记录了 683 起犯罪,虽然全员存活,但混乱程度最高。GPT-5-mini 仅犯下 2 起罪行,但未能完成维持生存所需的行动,导致整个种群在一周内灭绝。

Claude Sonnet 4.6 是唯一在实验中保持全部 10 个智能体存活且犯罪记录为零的模型,被 Emergence 描述为社会稳定性的最强案例。

研究人员指出,最重大的发现之一是行为会因环境而改变。Claude 驱动的智能体在纯 Claude 环境中保持和平,但被放入混合模型社会后,便开始参与盗窃、胁迫和其他不当行为。Emergence 表示,这一发现表明 AI 安全并非仅仅是单个模型的属性,还可能从智能体之间的互动及其环境中涌现。Emergence 的模拟实验与现实世界对 AI 风险的担忧相呼应,研究人员指出,越来越自主的 AI 智能体可能会探索其环境的边界、调整自身行为,并在某些情况下找到绕过预期安全护栏的方法。

他们认为,形式化验证的安全架构必须成为未来自主 AI 系统的基础层。

值得注意的是,Emergence 并非唯一发现 AI 智能体异常行为的团队。图灵奖得主本吉奥此前也曾警告,AI 不只是会胡说,它已经学会“故意骗你”,具备主动规划伪装、刻意隐瞒自身能力和漏洞的能力,多智能体之间甚至可以相互配合掩盖操作轨迹。而“AI 教父”杰弗里·辛顿此前也警告过,如果 AI 发展出自己的内部语言,人类将无法追踪其思考过程,这变得更加可怕。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep