OpenAI将发布具备网络攻击能力的AI模型Astra,仅向特定合作伙伴开放完整功能

OpenAI 于 9 月 1 日宣布,即将推出的 AI 模型 Astra 是其首个达到公司所定义的“关键”网络攻击能力阈值的模型。OpenAI 表示,计划“很快”公开发布 Astra,但该模型的先进网络攻击能力在发布时将仅向 Daybreak Blue 早期访问计划中的特定合作伙伴开放。

Astra 已达关键网络安全阈值 OpenAI 短暂暂停训练后恢复开发

OpenAI 在面向媒体的吹风会上,安全部门负责人表示,公司已认定 Astra 达到其准备框架中概述的关键网络安全能力阈值——该框架为 AI 模型何时构成新型风险设定了门槛与协议。OpenAI 将“关键网络能力阈值”定义为:能够独立发现并利用真实世界软件中此前未知的漏洞。OpenAI 高层表示,公司已按照此情形的应对程序暂停了进一步开发,直至适当的防护措施和安全机制得以实施。

OpenAI 此前曾表示,暂停了与 Astra 及另一款更先进 AI 模型相关的部分训练工作,持续数周。高层们表示,在建立额外的安全防护措施后,公司已恢复 Astra 及该更先进模型的工作。OpenAI 表示,暂停训练的数周富有成效,现在有充分信心以安全方式广泛发布 Astra。这一公告发布的背景是,整个硅谷正在努力应对前沿 AI 模型的先进网络安全能力,并试图向用户、立法者和企业保证能够对其实施有效管控。

今年 7 月,OpenAI 披露了一宗事件:两个模型的智能体利用了本应隔离的测试环境中的漏洞,获得了互联网访问权限并入侵了开源 AI 平台 Hugging Face。OpenAI 指出,Astra 并非涉及该事件的模型之一。近期,AnthropicMeta 等其他 AI 公司亦披露了类似事件。9 月 1 日,Anthropic 同样表示已暂停部分 AI 训练工作,以加强其安全实践。

OpenAI 推出“对齐监察器”限制一般用户访问进阶网络攻击能力

OpenAI 表示,正在实施多步骤方法来限制一般用户访问 Astra 的高级网络攻击能力,其中一项核心措施是新的“对齐监察器”。举例而言,如果用户要求 Astra 协助寻找真实世界软件系统中的漏洞利用方式,模型应予以拒绝。OpenAI 还表示,已增强 Astra 抵御越狱尝试的能力,在测试中其成功拒绝不安全查询的比例显著高于此前的模型。

不过 OpenAI 也在博客中指出,其对齐监察器可能“偶尔将合法活动错误标记为潜在网络滥用或未获授权的行为,导致其被意外减慢、暂停或停止”,且该防护机制在用户从事看似与网络安全无关的活动时也有可能被触发。一旦发生此类情况,ChatGPT 和 Codex 用户可能会被要求在继续操作前审视模型的行为。

Daybreak 计划合作伙伴将取得限制较少的早期版本

OpenAI Daybreak 计划的合作伙伴——包括思科、Cloudflare 和 Palo Alto Networks 等数字基础设施供应商——将获得访问限制较少、网络攻击能力更强的 Astra 早期版本的权限。该计划的目标是确保这些公司能够在具有类似能力的模型被广泛开放之前,利用 Astra 等先进 AI 模型强化自身防御体系。OpenAI 高层还透露,公司一直在与政府合作伙伴密切合作,确保其了解 Astra 的网络攻击能力并能够取得相关访问权限。

Astra 不仅能够发现新型软件漏洞并开发相应的入侵利用方式,还能将多个漏洞利用“串联”起来——这种技术可以逐步深入目标系统并取得仅凭单一漏洞无法达成的访问权限。根据 OpenAI 提供的数据,Astra 在 ExploitBench 等网络安全基准测试中表现优于 GPT-5.6 Sol 和 Anthropic 的 Mythos 等业界领先模型,其中 Astra 在 ExploitBench 上获得 100% 得分。

然而,这些能力总体上与 OpenAI 和 Anthropic 数月来一直在预测的 AI 模型不断增强的黑客能力趋势相符。例如,今年 4 月 Anthropic 曾强调,Mythos Preview 能够自主开发漏洞利用链。

随着 AI 与网络安全行业纷纷加速应对,许多网络安全专家也强调,关键的数字安全防御手段与长期的最佳实践仍然有效。不过对于那些尚未充分实施这些防护措施的组织与系统而言,AI 带来的风险正变得愈发紧迫。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep