NVIDIA 推出 NemotronLabs VoiceChat 11B:開源全雙工語音模型,輪替延遲約 450 毫秒,支援即時工具呼叫
NVIDIA 近日正式發表一款名為 NemotronLabs VoiceChat 11B 的開源全雙工語音模型,專為即時語音互動場景設計。這款模型擁有 110 億個參數(11B),並在單一神經網路內同時處理語音理解與語音生成,大幅簡化傳統語音管線的複雜度。官方公布的數據顯示,其輪替延遲約為 448 毫秒,能讓使用者感受到接近自然對話的流暢節奏。相較於過去需要串接語音辨識、自然語言理解、文字轉語音等多個獨立模組的架構,NemotronLabs VoiceChat 11B 採用端到端設計,不僅減少延遲,也降低系統整合的難度。
NemotronLabs VoiceChat 11B 最突出的特色在於支援使用者隨時插話打斷,對話不會因此中斷或停頓。這項功能對於需要高互動性的語音助理或客服系統特別實用,使用者可以在機器人說話的過程中直接提出問題或改變指令,模型能夠即時調整回應方向,維持對話的連續性。傳統語音系統往往需要等待完整句子結束才能處理新的輸入,而全雙工架構讓模型同時具備接收與輸出的能力,實現真正的雙向即時互動。更關鍵的是,NemotronLabs VoiceChat 11B 能在對話不中斷的情況下即時執行工具呼叫(tool calling)。
這意味著使用者可以在語音指令中直接要求模型查詢資料庫、觸發外部服務或執行特定 API 操作,而所有動作都在同一場對話中完成,不需要切換到其他介面或等待語音回覆結束。NVIDIA 表示,這款模型是開源全雙工語音模型中首款具備即時工具呼叫能力的代表,有助於開發者建立反應更靈敏、互動更自然的語音應用。從技術角度來看,NemotronLabs VoiceChat 11B 的基礎架構繼承了 NVIDIA 在大型語言模型與語音處理領域的累積。模型訓練資料涵蓋多種語音場景,並經過最佳化以在消費級與伺服器級 GPU 上都能運行。
由於採用開源授權,開發者不僅可以直接下載模型權重,還能根據自身需求進行微調或客製化,同時受益於開源社群的協作與調整。NVIDIA 也釋出了相關的推理程式碼與範例,降低部署門檻。這款模型的應用場景相當廣泛。在智慧客服領域,NemotronLabs VoiceChat 11B 能同時處理大量來電,並在對話中即時調用後端系統查詢訂單、庫存或客戶資料,無需等待客服人員手動操作。在智慧家庭助理方面,使用者可以用自然語音連續下達多個指令,例如「先播放音樂,然後幫我查一下明天的天氣,順便設定一個早上七點的鬧鐘」,模型能夠依序執行並在過程中保持對話連貫。
此外,教育、醫療、車載語音等領域也都能從中獲得低延遲、可中斷的全雙工互動體驗。NVIDIA 強調,NemotronLabs VoiceChat 11B 的開源釋出將加速語音互動技術的普及。過去開發者若要自建全雙工語音系統,往往需要整合多個專利元件或依賴封閉平台,成本與技術門檻都相當高。如今有了這款開源模型,新創團隊與中小型企業也能夠快速建構具備專業水準的語音應用。同時,學術研究機構也能基於此模型進行語音理解、對話管理與多模態學習等方向的實驗。
值得注意的是,NemotronLabs VoiceChat 11B 的輪替延遲約 448 毫秒,這個數值是從模型開始處理輸入到首次輸出語音的時間差,也就是「聽到話 → 開始回話」的週期。在實務上,人類對話的反應時間通常落在 200 到 500 毫秒之間,因此 448 毫秒已經相當接近自然對話的節奏。加上支援插話打斷,使用者體驗比傳統語音系統更為順暢。當然,實際延遲仍會受到硬體規格、網路環境與其他服務呼叫的影響,但官方基準測試顯示其表現已達到商用級別。NVIDIA 也特別提到,這款模型在隱私與安全方面有額外考量。
由於全雙工語音系統需要持續監聽,開發者可以透過本地端部署,避免將語音資料上傳至雲端,滿足監管需求。同時,模型內建了拒絕不當指令的機制,有一的謢欄避免誤用。開源社群可進一步貢獻更強健的內容過濾與安全對策。整體而言,NemotronLabs VoiceChat 11B 的問世標誌著語音互動技術又向前邁進一大步。從單向的「喚醒→說話→聽取→回覆」模式,進化到雙向持續對話,並且能在對話中即時調用外部工具,這將讓語音助理真正成為一個可以主動協作任務的工作夥伴,而非只能被動應答的簡單介面。隨者開源生態系擴張,預計在未來數月內將有更多基於此模型的應用與服務上線,推動智慧語音裝置與互動系統的普極化。
Related
相關文章

仇太深,奧特曼炮轟A社“反人類”
量子位·2026年08月24日 16:01“Codex名字沒起好,我也沒用明白” 《奧特曼天降正義,小嘴抹毒暗諷A社“反人類”》!!這個標題有沒有港媒內味兒了(doge),您先別笑,這還真是奧特曼在最新採訪裡的大致意思。雖然沒有點名,但話裡話外就差直接報Dario Amodei的身份證號了。

消息稱字節整合 AI 生產力:TRAE、釦子併入豆包,將推統一辦公品牌“豆包工作”
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 HH_KK 的線索投遞!8 月 24 日消息,據智能湧現消息,字節跳動對旗下的辦公 AI 產品完成了一輪團隊整合:TRAE、釦子(Coze)團隊將整體併入豆包體系,其中 TRAE Work、釦子將與豆包在工作場景的產品能力進行整合;TRAE IDE 及 CLI 將作為豆包品牌下的編程產品線持續發展。

AI 大模型周榜:國產 glm-5.3-max 首秀闖入綜合榜前 15,kimi-k3-max 衝進前十
本週AI大模型Arena排行榜出現新面孔,智譜AI的glm-5.3-max首次入榜即拿下綜合榜第13名。月之暗面的kimi-k3-max排名持續攀升,成功擠進綜合榜前十,位列第10名。兩款國產大模型雙雙寫下佳績,成為本週關注焦點。

DeepSeek Harness來了:AI開始製造AI了?
DeepSeek Harness 正式推出,這項新工具被視為 AI 發展的重要里程碑,可能讓 AI 系統具備自主開發或優化其他 AI 的能力。外界關注此技術是否象徵 AI 開始「製造」AI,並可能加速人工智慧的進化與應用。目前相關細節與實際影響仍待進一步觀察。
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。
具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元
AI資訊AI新閒資訊正文具身智能資本熱浪再起,小鵬機器人首輪估值突破63億美元 發布於AI新閒資訊時間 :Aug 24, 2026閱讀 :1分鐘小鵬機器人業務完成首輪超9億美元融資,投後估值突破63億美元(約合430億元人民幣),創下中國具身智能行業單輪私募股權融資紀錄。本輪融資由IDG資本領投,高榕創投參投,並獲騰訊和阿里巴巴作為戰略投資者共同參與,小鵬集團仍保持控股地位。四家投資方均將該輪視為其在具身智能領域迄今披露的最大規模單筆投資之一。IDG資本指出,小鵬人形機器人代表當前國內產業領先水平,已具備與海外頭部企業全球競爭的技術實力。本輪融資將推動小鵬機器人業務市場化估值體系的建立,並加速其人形機器人量產進程及物理AI模型的研發迭代,助力高階通用人形機器人邁向全球商業化應用新階段。此舉亦折射出具身智能賽道正吸引頂級財務與戰略資本加速佈局,產業從技術驗證向規模化落地轉變的趨勢日益明晰。相關推薦中國開源模型出海:法律 AI 獨角獸 Harvey 基於 Kimi K3 推出 Tenet美國法律AI獨角獸Harvey宣佈基於月之暗面開放權重模型Kimi K3,通過後訓練開發出法律專用模型Harvey Tenet,標誌中國開放權重模型首次進入美國頭部垂直AI公司訓練體系。Harvey此前主要依賴OpenAI、Anthropic等閉源模型,服務超2400家機構、20多萬名律師,估值110億美元,年化收入約3.5億美元。Aug 24, 2026115.2k韓國修法為 AI 開綠燈:經監管審查後可使用限定個人數據韓國國會通過《個人信息保護法》修正案,允許AI開發商經個人信息保護委員會審查後,在限定範圍內使用個人數據,突破原先“轉作AI開發須本人同意”的剛性約束。此舉迴應業界長期抱怨,此前豁免僅限於語音反詐、自動駕駛等少數場景且期限較短,新規為AI研發擴大數據可用空間。Aug 24, 2