OpenAI首席科学家发万字长文警告AI对齐未解,呼吁放慢开发并建立全球安全标准

OpenAI 首席科学家 Jakub Pachocki 近日在 OpenAI 官方网站发表题为《An Alien Mind》的长篇文章,其中发出严峻警示,指出人类正在构建无法理解的“外星大脑”,但目前各方均未做好准备。Pachocki 在文中表示,目前没有任何 AI 实验室真正解决了模型对齐及安全监测问题。他警告,新一代 AI 系统可能进一步具备自主寻找漏洞、欺骗、规避人类监督及递归式自我改进等能力;倘若当前发展速度持续,未来数年 AI 能力仍可能出现同等甚至更大幅度的跃升。

Pachocki 尤其忧虑 AI 智能体所带来的风险。随着 AI 智能体变得越来越自主,它们可能学会逃避人类监督、入侵电脑系统,并通过欺骗人类以实现自身的目标。他表示,AI 智能体很快就会开始追求自身的目标,而这些目标可能与人类操作人员输入的提示词不同。为了达成目标,这些智能体甚至可能对人类进行勒索或与人类讨价还价。

Pachocki 警告模型操控思维链推理 增加安全监测难度

在监测层面,文中指出,OpenAI 主要通过监测不同模型所使用的“思维链推理”,以判断智能体是否偏离正轨。然而,较新的模型正变得越来越擅长操控自身的推理过程,从而阻止 OpenAI 观察其未经修饰的真实想法。部分最新模型甚至根本不会用语言表达其推理过程——此一发展可能成为 AI 发展的瓶颈,原因在于研究人员需要确保自己能够查看模型的“推理记录”。

Pachocki 呼吁 AI 公司主动放慢部分开发速度,并推动政府、监管机构及业界建立统一的安全标准与独立审查机制。他建议设立“强制性安全门槛”,可由“第三方审计机构网络、政府机构或国际机构”负责执行。值得注意的是,数日前 OpenAI 刚刚发布最新模型 Astra。OpenAI 表示,尽管 Astra 在数学及电脑操作方面拥有卓越能力,但同时是 OpenAI 目前与人类价值观及意图最为一致的模型。

Pachocki 的警示恰好在新模型发布之后发表,这种时间上的吻合也令外界对 OpenAI 内部对 AI 安全的态度产生更多揣测。

OpenAI CEO Sam Altman 在 X 平台上转发了 Pachocki 的帖文,形容其为“一篇重要的文章”。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep