小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,该消息于 9 月 11 日公布。根据小米技术官方微博的资料,该模型专门针对多人同时说话的复杂语音场景,重点解决语音识别中的“鸡尾酒会”难题,即在嘈杂环境下从多名说话者中识别并转录指定目标用户的语音内容。
据小米介绍,Xiaomi-CocktailASR-1 采用端到端 LLM 架构,利用目标说话人的一段参考音频作为声纹提示,在多人重叠发言的情况下,能够提取并仅转录目标说话人的内容。官方指出,该模型基于大规模多说话人数据训练,并在 AliMeeting、AMI、LibriMix 等多个主流多说话人测试集上达到最佳性能。
Xiaomi-CocktailASR-1 具备多说话人语音识别能力
同时,其在单说话人场景下的识别表现也可与主流单人 ASR 模型相媲美,能够通过同一模型兼顾单人与多人场景,无需在不同语音识别模型之间切换。此外,该模型还具备负样本拒识能力,对于音频中不存在目标说话人的情况,模型可输出空文本,以降低非目标语音带来的误识别和误触发风险。
小米同时提到,Xiaomi-CocktailASR-1 支持思维链推理模式,能为识别结果提供具备可解释性的推理过程。目前,Xiaomi-CocktailASR-1 的模型权重与推理代码已经开源。

