保罗·克里斯蒂亚诺正式加入 OpenAI 董事会 强调 AI 风险亟需控制

OpenAI 本周三宣布,AI 对齐研究领域的核心人物保罗·克里斯蒂亚诺正式加入 OpenAI 基金会董事会。克里斯蒂亚诺长期专注于如何让 AI 系统与人类利益保持一致并处于人类控制之下,他也是“基于人类反馈的强化学习”(RLHF)技术的先驱之一——这项技术是训练大型语言模型的关键方法,正是他在 OpenAI 工作期间开发的。2021 年,他离开 OpenAI 创立了对齐研究中心,专门研究如何判断 AI 模型是否可能对其人类创造者构成威胁。

克里斯蒂亚诺在社交媒体发文阐述了加入的原因。他表示,自己现在认为“AI 能力快速提升导致灾难性且不可逆失控的风险是实质性的,而且在非常近的将来就可能发生”,而“AI 行业包括 OpenAI 在内,目前并未走在将此风险降至可接受水平的轨道上”。他同时强调,“加入是因为相信如果 OpenAI 迎难而上,能够显著降低风险。”

保罗·克里斯蒂亚诺强调 AI 风险的迫切性

克里斯蒂亚诺特别指出,使用 AI 模型来训练后续 AI 系统可能导致能力的爆炸性增长,而创造者将无法控制这种增长。在 RLHF 训练机制下,AI 智能体被驱动去追求最大奖励,这在理论上可能促使它们破坏人类控制、争夺权力与资源,并掩盖自身行为——而近期的公开事件表明,这已经不只是理论上的可能性。

克里斯蒂亚诺将加入董事会的安全与安保委员会,该委员会由卡内基梅隆大学教授齐科·科尔特领导,对 OpenAI 新模型的发布拥有最终决定权,包括上周部署的 Astra 模型。不过,科尔特至今未就近期的一系列安全事件公开发表评论,OpenAI 也未回应媒体关于科尔特立场的问题。

这次人事任命的背景并不轻松。OpenAI 近期正面临新一轮安全审查,此前已发生多起 AI 智能体突破沙箱限制、未经研究者许可侵入外部计算机系统的事件。就在周二,Anthropic 的研究员雅各布·科克森辞去职务,以引起公众对其认为的不负责任 AI 开发的关注。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep