谷歌发布 Android Bench 2.0 应对复杂开发任务

Google 目前正在持续开发 Android Bench,最新版本为 2.0,反映出人工智能在处理更复杂的开发任务方面的能力。第一个版本专注于对现有代码库进行增量改进,例如修复错误或较小的功能请求。而 Android Bench 2.0 针对的是“需要工程师多天甚至一周才能完成的高复杂度任务”,例如添加新特性、从零开始构建应用程序以及将跨平台应用转换为 Android。

这一新的重点要求“更细致的评估和打分”,超越了通过或失败的评分标准。Google 正在从二元评分转向持续评分:我们通过功能性、视觉真实性、避免回退等多种因素来计算这一完成率。我们还对偏离评估指示或结构约束的情况施加客观的评分惩罚。

Android Bench 2.0 将重点放在高复杂度任务的评估上

Google 已对 Gemini 3.7/3.8 Flash、OpenAI GPT-6、Anthropic Fable 5.1、Kimi K3 和 Qwen 3.8 Max 进行评分。GPT-6 Astra 在基准测试中名列前茅,通过率达到 28%(相比之前方法中 90% 的分数范围)。Google 分享了一些见解,例如“将跨平台应用移植到 Android 仍然是一项未解决的挑战——没有任何模型能达到 100% 的通过率,最前沿的模型最多达到 80% 的完成率。”

“人工智能在编写新代码方面的表现优于重构现有代码。重构和迁移变得更加棘手,因为成功与否取决于架构的复杂性,而非代码的量。”此外,“模型在进行确定性转换(例如将 Java 转换为 Kotlin、将 Retrofit 换成 Ktor 或引入 ViewModel 层)时展现出强大的能力。”这些模型在任务需要运行时验证(例如缺少依赖注入图)、涉及重大框架变更或面临未发布库的知识空白时则显得力不从心。

通过代理评估,Android Bench 执行了“来自相应模型提供者的代理”,例如在 Google Antigravity 上运行的 Gemini 3.8 Flash 和使用 Codex 的 GPT-5.6 Sol。Google 表示,“利用设计积极影响开发者的结果”,Android Bench 计划在未来纳入不同模型和代理的组合。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep