自然语言处理领域国际顶级学术会议 EMNLP 2026 公布论文录用结果,小米 Xiaomi 共有 8 篇最新研究成果成功入选,覆盖移动智能体、大模型训练与推理效率、智能研发与主动智能等多个方向。EMNLP 2026 将于 2026 年 10 月 24 日至 29 日在匈牙利布达佩斯举行。
在移动智能体方向,小米与高校合作团队带来三项重要成果。其中 GSAR 论文提出全新的强化学习奖励机制,让 AI 助手在与应用程序的反复互动中自动生成难度递增的任务和执行路径,并能够自动判断操作是否达成目标,摆脱对人工规则的依赖。实验显示,GSAR 判断任务是否完成的准确率超过 90%,在 AndroidWorld 等主流基准上明显提升了 AI 助手的实际操作能力。
另一项 GUI-PRA 研究将“打分员”升级为主动取证的智能体,在 AndroidWorld 和 Mobile-MiniWoB++ 两大基准上比传统打分方法平均提升约 5.0 和 6.5 个百分点。此外,MaP 通过统一训练目标串联单步决策、状态判断与跨步规划三种能力,在 AndroidControl-High 基准上将任务成功率从 72.9% 提升至 74.2%,在 AndroidControl-Low 基准上从 89.0% 提升至 90.9%。
大模型训练与推理效率取得多项进展
在大模型效率方向,团队同样取得多项进展。Informed Masking 方法针对扩散大语言模型的强化学习训练效率问题,通过识别句子中的“高难度题”与“合适练手题”,让训练资源更聚焦。在接入三种最新的 dLLM 强化学习方法并应用于 LLaDA-8B-Instruct 后,该方法在数学和规划类基准上分别带来最高 2.01%、8.52% 和 5.77% 的相对平均提升。
ECHO 方法则解决大模型“逐字生成”的速度瓶颈,通过早期层与完整模型的协同工作,在不增加任何参数的情况下实现 2.4 至 3.01 倍的推理加速。BORA-BUDGET 研究关注“何时值得深度思考”的问题,在 Qwen3-8B 的 MATH500 测试中仅用 3534 个 token 就达到 91.40% 的准确率,而全量深度思考模式需要 4293 个 token 才能达到 93.33%,为低成本部署提供了新路径。
智能研发与主动智能方向成果显著
在智能研发与主动智能方向,ECO-SCE 框架通过分析代码层面的改动,提前筛掉大概率没有收益的方案。接入 OpenEvolve 后,该方法在 7 个基准任务上平均节省 70.88% 的 GPU 时间,其中 6 个任务性能不降反升。PRPF 框架则让手机助手具备主动预判能力,在 ProactiveMobile 基准上将任务成功率从 20.82% 提升到 41.15%,同时将误触发率从 13.76% 降至 7.21%,推理算力开销降低 69.3%。
小米方面表示,AI 正在成为连接手机、汽车与智能家居的重要技术能力,模型是否足够高效、智能体是否足够可靠、系统是否能够理解环境与用户需求,都将直接影响下一阶段的智能体验。此次入选 EMNLP 2026 的多篇论文,体现小米围绕大模型、智能体、主动智能等方向的持续探索。从基础研究到工程能力积累,再到人车家全生态中的具体应用,小米正不断完善 AI 技术体系,让不同方向的研究彼此支撑、相互协同。
| 项目 | 成果 |
|---|---|
| GSAR 任务完成判断准确率 | 超过 90% |
| GUI-PRA 基准提升(AndroidWorld) | 平均提升约 5.0 个百分点 |
| GUI-PRA 基准提升(Mobile-MiniWoB++) | 平均提升约 6.5 个百分点 |
| MaP(AndroidControl-High) | 任务成功率由 72.9% 提升至 74.2% |
| MaP(AndroidControl-Low) | 任务成功率由 89.0% 提升至 90.9% |
| Informed Masking 最高相对提升 | 2.01%、8.52%、5.77% |
| ECHO 推理加速 | 2.4 至 3.01 倍 |
| BORA-BUDGET(MATH500) | 3534 个 token 达 91.40%;4293 个 token 达 93.33% |
| ECO-SCE GPU 时间节省 | 平均节省 70.88% |
| PRPF 任务成功率 | 由 20.82% 提升至 41.15% |
| PRPF 误触发率 | 由 13.76% 降至 7.21% |
| PRPF 推理算力开销 | 降低 69.3% |

