人工智能 / 新闻摘要

小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

展示麦克风阵列的实物照片,多个麦克风呈特定排列,用于声学采集。
主题资料配图,非新闻现场照片 · 配图:这就是一个麦克风阵列的样子

新闻摘要

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

来源信息

来源:OSCHINA 开源中国。本文同步 RSS 提供的摘要,完整内容请通过下方链接阅读原文。

原文发布时间:2026-09-11 09:00:25 UTC

资料与延伸阅读

你可以通过以下原始资料核对文中概念,并继续深入阅读。

  1. OSCHINA · 阅读原文
  2. 配图:这就是一个麦克风阵列的样子
← 更多人工智能文章返回顶部 ↑