NVIDIA 推出 NemotronLabs VoiceChat 11B:開源全雙工語音模型,輪替延遲約 450 毫秒,支援即時工具呼叫

2026年8月9日 23:58
站內 AI 整理稿

NVIDIA 近日正式發表一款名為 NemotronLabs VoiceChat 11B 的開源全雙工語音模型,專為即時語音互動場景設計。這款模型擁有 110 億個參數(11B),並在單一神經網路內同時處理語音理解與語音生成,大幅簡化傳統語音管線的複雜度。官方公布的數據顯示,其輪替延遲約為 448 毫秒,能讓使用者感受到接近自然對話的流暢節奏。相較於過去需要串接語音辨識、自然語言理解、文字轉語音等多個獨立模組的架構,NemotronLabs VoiceChat 11B 採用端到端設計,不僅減少延遲,也降低系統整合的難度。

NemotronLabs VoiceChat 11B 最突出的特色在於支援使用者隨時插話打斷,對話不會因此中斷或停頓。這項功能對於需要高互動性的語音助理或客服系統特別實用,使用者可以在機器人說話的過程中直接提出問題或改變指令,模型能夠即時調整回應方向,維持對話的連續性。傳統語音系統往往需要等待完整句子結束才能處理新的輸入,而全雙工架構讓模型同時具備接收與輸出的能力,實現真正的雙向即時互動。更關鍵的是,NemotronLabs VoiceChat 11B 能在對話不中斷的情況下即時執行工具呼叫(tool calling)。

這意味著使用者可以在語音指令中直接要求模型查詢資料庫、觸發外部服務或執行特定 API 操作,而所有動作都在同一場對話中完成,不需要切換到其他介面或等待語音回覆結束。NVIDIA 表示,這款模型是開源全雙工語音模型中首款具備即時工具呼叫能力的代表,有助於開發者建立反應更靈敏、互動更自然的語音應用。從技術角度來看,NemotronLabs VoiceChat 11B 的基礎架構繼承了 NVIDIA 在大型語言模型與語音處理領域的累積。模型訓練資料涵蓋多種語音場景,並經過最佳化以在消費級與伺服器級 GPU 上都能運行。

由於採用開源授權,開發者不僅可以直接下載模型權重,還能根據自身需求進行微調或客製化,同時受益於開源社群的協作與調整。NVIDIA 也釋出了相關的推理程式碼與範例,降低部署門檻。這款模型的應用場景相當廣泛。在智慧客服領域,NemotronLabs VoiceChat 11B 能同時處理大量來電,並在對話中即時調用後端系統查詢訂單、庫存或客戶資料,無需等待客服人員手動操作。在智慧家庭助理方面,使用者可以用自然語音連續下達多個指令,例如「先播放音樂,然後幫我查一下明天的天氣,順便設定一個早上七點的鬧鐘」,模型能夠依序執行並在過程中保持對話連貫。

此外,教育、醫療、車載語音等領域也都能從中獲得低延遲、可中斷的全雙工互動體驗。NVIDIA 強調,NemotronLabs VoiceChat 11B 的開源釋出將加速語音互動技術的普及。過去開發者若要自建全雙工語音系統,往往需要整合多個專利元件或依賴封閉平台,成本與技術門檻都相當高。如今有了這款開源模型,新創團隊與中小型企業也能夠快速建構具備專業水準的語音應用。同時,學術研究機構也能基於此模型進行語音理解、對話管理與多模態學習等方向的實驗。

值得注意的是,NemotronLabs VoiceChat 11B 的輪替延遲約 448 毫秒,這個數值是從模型開始處理輸入到首次輸出語音的時間差,也就是「聽到話 → 開始回話」的週期。在實務上,人類對話的反應時間通常落在 200 到 500 毫秒之間,因此 448 毫秒已經相當接近自然對話的節奏。加上支援插話打斷,使用者體驗比傳統語音系統更為順暢。當然,實際延遲仍會受到硬體規格、網路環境與其他服務呼叫的影響,但官方基準測試顯示其表現已達到商用級別。NVIDIA 也特別提到,這款模型在隱私與安全方面有額外考量。

由於全雙工語音系統需要持續監聽,開發者可以透過本地端部署,避免將語音資料上傳至雲端,滿足監管需求。同時,模型內建了拒絕不當指令的機制,有一的謢欄避免誤用。開源社群可進一步貢獻更強健的內容過濾與安全對策。整體而言,NemotronLabs VoiceChat 11B 的問世標誌著語音互動技術又向前邁進一大步。從單向的「喚醒→說話→聽取→回覆」模式,進化到雙向持續對話,並且能在對話中即時調用外部工具,這將讓語音助理真正成為一個可以主動協作任務的工作夥伴,而非只能被動應答的簡單介面。隨者開源生態系擴張,預計在未來數月內將有更多基於此模型的應用與服務上線,推動智慧語音裝置與互動系統的普極化。

Related

相關文章

鈦媒體模型更新

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告

AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

剛剛

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷

Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。

剛剛

Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕

月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。

19 分鐘前4700
雷峰網模型更新

光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態

8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

5 小時前