小米開源工業級目標說話人語音識別大模型 CocktailASR-1

2026年9月11日 10:336900 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文小米開源工業級目標說話人語音識別大模型 CocktailASR-1發布於AI新閒資訊時間 :Sep 11, 2026閱讀 :1分鐘在嘈雜的人群中精準鎖定並聽清某個人的聲音,人類的聽覺系統能夠輕而易舉地做到這一點,但對於傳統的自動語音識別(ASR)模型來說,多人同時講話的“雞尾酒會難題”卻長期是一個未被徹底攻克的行業痛點。為了解決這一長期困擾業界的難題,小米近日正式開源了工業級目標說話人語音識別大模型 CocktailASR-1。該模型徹底改變了傳統語音識別的任務輸入方式,採用基於參考聲紋的目標說話人識別機制。

用戶只需提供一段參考音頻,模型便會利用聲紋嵌入精準定位目標說話人,在多人混合音頻中只轉錄該特定人物的語音,而其他人說話的內容、混響以及背景噪聲均會被自動過濾,從而將複雜的混合音頻任務轉化為高效的目標說話人識別。在底層架構設計上,CocktailASR-1採用了一個端到端的大語言模型架構,具體由 D2V2音頻編碼器、Adapter 以及大模型解碼器串聯組成,且所有權重均整合在同一個檢查點中。在實際使用時,輸入格式為將參考音頻與目標單聲道音頻進行拼接,中間插入一秒靜音作為分隔。這種設計讓模型具備極高的通用性,無論是單人還是複雜的多元場景,無需切換模型即可一氣呵成。

多項基準測試數據驗證了該模型的強悍實力。在模擬多說話人測試中,其在 LibriMix2mix 和 LibriSpeechMix2mix 數據集上的字錯率(WER)分別壓低至4.11% 和2.90%。相比之下,同賽道的多款知名模型在混合場景下表現全軍覆沒,例如在 LibriMix3mix 測試中,部分競品的字錯率高達76% 到121% 不等,而 CocktailASR-1的字錯率僅為12.29%,展現出了顛覆性的降維打擊優勢。即便是面對更具挑戰的真實會議錄製場景,如 AMI SDM 和 AliMeeting Far,該模型也大幅領先現有的各類解決方案。

而在單人場景下,其在 LibriSpeech、WenetSpeech 以及 CommonVoice-zh 等數據集上也實現了全面超越。除了突破性的識別精度外,該模型在工程落地和實用性方面還具備兩大亮點功能。首先是強大的負樣本拒識能力。當參考音頻對應的人並不參與當前對話時,模型能夠直接輸出空文本,從而有效防止智能音箱、車載語音助手等智能設備被旁人的聲音誤觸發。測試顯示其在多個數據集上的負樣本拒識率表現優異。其次,模型支持思維鏈推理功能,能夠在輸出最終答案前通過特定的標籤展示其判斷說話人的推理過程,雖然該功能對精度影響極小,但極大提升了系統的可解釋性與調試便利性。

目前,CocktailASR-1的相關代碼已在 GitHub 按照 Apache2.0協議正式開源,且具備極簡的依賴環境,僅需 torch、torchaudio、transformers 和 soundfile 等基礎庫即可輕鬆從 HuggingFace 加載並部署使用。小米此次在語音技術底層邏輯上的全新轉向,標誌著語音識別正從傳統的“捕獲所有聲音”正式邁向聚焦於“鎖定一個聲音”的全新發展階段。相關推薦支付寶“碰一下”推出無界經營,智能體“圖圖” 服務線下經營支付寶“碰一下”發佈面向品牌商的無界經營智能體“圖圖”,依託百萬級商家設備網絡,連接4億消費者與百萬門店,助力品牌線下增長。

繼線下觸點AI升級及門店智能體“曉雨”後,支付寶再次以AI重構線下經營,實現全球首個大規模線下人、貨、場AI全面升級。Sep 11, 202686.1kAnthropic 披露:今年已阻止多起利用 AI 研發生物武器的嘗試《金融時報》報道,Anthropic稱今年已阻止多起科學家利用其AI開展可能助研生物武器的研究,列舉五起案例,涉事者繞過管控、混淆目的以規避安全防護。事件凸顯AI對公共安全的潛在威脅。Sep 11, 2026105.

7k告別卡頓與機械感:OpenAI 推出全雙工語音模型 GPT-Live-1OpenAI推出全雙工語音模型GPT-Live-1,採用單一模型架構取代傳統“語音轉文字—推理—文字轉語音”級聯流程,顯著降低延遲,實現類人流暢交互。該模型已上線API,面向開發者,能更穩健應對停頓、打斷和話題轉換等複雜對話場景。Sep 11, 2026130.2kDeepSeek V4.1-Flash登陸WorkBuddy,開啟限時免費試用AI服務平臺WorkBuddy宣佈全面上線DeepSeek最新V4.1-Flash模型,並開啟兩週免費試用,降低開發者與用戶體驗門檻。

該模型已登陸DeepSeek API,具備原生多模態支持能力,用戶調用時只需將模型設置項調整為對應標識即可。此舉體現大模型領域迭代持續加快。Sep 11, 2026177.9kCursor發佈Projects功能,一人指揮數千個AI智能體承包大型開發9月10日,Cursor推出Projects(beta版),標誌軟件開發“第三紀元”加速到來。該功能面向功能開發、大規模遷移、完整應用構建等大型複雜任務,引入“協調者智能體”調度數千個子智能體並行執行,讓開發者擺脫繁瑣的智能體管理,直接指揮任務本身,核心架構圍繞這一協調模式展開。Sep 11, 2026134.

0k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

56 分鐘前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

6 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前