ITCOW牛新网 9月11日消息,小米技术正式发布并开源工业级目标说话人语音识别大模型Xiaomi‑CocktailASR‑1,旨在解决语音识别领域的“鸡尾酒会难题”,也就是多人同时说话时识别效果大幅下降的问题。

模型采用端到端LLM架构,输入一段目标人物的参考音频作为声纹提示,就可以在多人混杂说话的嘈杂环境中,只提取转录目标说话人的语音内容。在多项多说话人公开测试集上取得SOTA最优效果。
该模型兼顾单人语音识别,单人场景识别效果对标主流标准ASR模型;拥有干扰拒识能力,如果目标说话人没有出现,模型会直接输出空文本,减少误识别误触发。还支持思维链推理,能够输出识别的推理过程,提升结果可解释性。
目前模型的相关代码与权重已经上传GitHub以及HuggingFace平台,开发者可以直接获取使用。