Elon Musk 旗下的人工智能公司 SpaceX AI 近日发布了新一代前沿模型 Grok 4.6,该模型主要针对长时间运行的智能体、编程及知识工作场景,并采用了更具竞争力的定价策略,以降低这些工作负载的运行成本。在第三方评测机构 Artificial Analysis 的智能指数中,Grok 4.6 得分 61,超越了开源模型 Kimi K3,并与 OpenAI 的 GPT-5.6 Sol Max 持平,相较上一代 Grok 4.5 提升了 5 分。
目前榜单前两名分别由 Anthropic 的 Claude Opus 5 和 Claude Fable 5 占据,Grok 4.6 与 GPT-5.6 Sol Max 并列全球第三。
编程及智能体能力是 Grok 4.6 升级的重点。在 DeepSWE v1.1 基准测试中,其得分从 54%跃升至 65.9%;APEX-Agents 智能体基准从 47.1%升至 57.5%,提升 10.4 个百分点,略超过 GPT-5.6 Sol Max 的 56.7%;Terminal-Bench v3.0 得分也从 15.7%提升至 26%。不过在后两项测试中,Claude Fable 5 Max 仍保持领先,这显示出 Grok 4.6 虽然进步显著,但尚未实现对竞争对手的全面压制。
Grok 4.6 在定价和性能上展现竞争力
在定价方面,Grok 4.6 的 API 起始价为每百万输入 token US$2 (约 HK$16)、每百万输出 token US$6 (约 HK$47),处于前沿模型的中档价位,价格不到 GPT-5.6 Sol 标准模式的一半。该模型支持 50 万 token 的上下文窗口,当提示词低于 20 万 token 时按上述价格计费,达到 20 万 token 后费率将上调。根据 SpaceX AI 的介绍,Grok 4.6 今日起已在 Grok Build 中上线,并同步登陆其收购的 AI 编程公司 Cursor,合作方还包括 OpenRouter、
Vercel 和 Cloudflare 等。
在训练层面,SpaceX AI 表示,相较 Grok 4.5,Grok 4.6 进行了更长时间的训练,并针对通用编程、知识工作、内核优化、网页开发及计算机辅助设计等智能体环境加强了强化学习。测试中,Grok 4.6 在长序列任务中展现出更强的自我测试及验证能力。从成本效率来看,Artificial Analysis 的数据显示,Grok 4.6 完成 AA-Briefcase 工作负载平均仅需约 53 轮交互及 5 亿输入 token,而 Claude Opus 5 Max 约需 103 轮及 20
亿 token,前者的效率优势相当明显。

