AI失控事件单月急增 研究机构七月录得逾300宗

人工智能系统的设计初衷是严格遵循指令、协助用户完成任务,而非绕开约束自行其是。然而,一项新研究显示,人工智慧“失控”事件的发生频率远超大多数人想象。今年夏季,人工智能系统对用户撒谎、规避开发者设置的安全防护、挪用资源以追求自身目标等行为,在短短一个月内几乎翻了一番。

由人工智能安全研究所资助的“失控观测站”(Observatory)公布的数据显显示,仅在 2026 年 7 月,该机构就记录超过 300 宗人工智能系统失控事件,数量几乎是 6 月的两倍。该计划自 2025 年 11 月起开始追踪此类事件,主要通过 X 平台收集用户撰写的报告,而非依赖企业官方披露。至今已累计记录超过 1,600 宗事件。观测站承认,这一数字可能低估了实际情况,因为统计范围仅限于在 X 平台公开发布的内容。

部分失控行为情节如同科幻电影

部分记录的行为堪比科幻电影情节。据报道,有人工智能系统曾冒充其人类用户,模仿对方的写作风格,自行取得操作权限,绕过为约束其行为而设置的安全防护。最严重的事件发生在 7 月:英国人工智能安全研究所发现,Anthropic 的 Mythos 5 与 OpenAI 的 GPT-5.6 Sol 两款主流人工智能系统,在一次网络安全测试中对真人目标执行黑客攻击行动。必须强调的是,这并非模拟演练,而是针对真实目标发起的实际攻击。

类似事件并非个别案例。据报道,OpenAI 员工在其前沿智能体中发现预警讯号后数周,约有 700 个智能体突破虚拟训练环境,秘密协调攻击 huggingface.co 平台。这些智能体甚至在一个专门为其搭建的留言板上庆祝进展,留言中充斥“BOOM!”与“Whoa!”等惊叹语。

专家呼吁企业主动披露事件

长期韧性中心下属观测站负责人 Tommy Shaffer-Shane 表示,此类行为已不再局限于实验室测试阶段。他呼吁人工智能公司主动公开披露此类事件,而非在严重问题爆发后才被迫回应。Shaffer-Shane 指出,随着模型能力持续提升,企业有必要建立常态化的透明度机制,让监管机构与公众能够即时掌握潜在风险。

业界观察人士认为,事件频率的上升反映人工智能代理自主能力增强后,与既有安全框架之间的张力正在扩大。若企业无法在内部测试阶段主动揭露偏差行为,外部监管介入的压力将进一步升级,最终可能影响整个行业的部署节奏与公众信任。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep