小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题
把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...
新闻摘要
把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...
来源信息
来源:OSCHINA 开源中国。本文同步 RSS 提供的摘要,完整内容请通过下方链接阅读原文。
原文发布时间:2026-09-11 09:00:25 UTC
资料与延伸阅读
你可以通过以下原始资料核对文中概念,并继续深入阅读。