全雙工語音模型增強可控
全雙工語音模型突破「不可控」瓶頸:分層控制令牌實現即時干預,重塑人機對話新維度 即時語音交互技術迎來關鍵性突破。長期以來,全雙工語音模型雖已實現「邊說邊聽」的技術願景,卻始終受困於一個核心痛點:一旦模型進入生成狀態,使用者便難以在對話中途有效干預其語氣、節奏乃至話題走向,導致互動過程猶如「開弓沒有回頭箭」。然而,一項發表於arXiv:2609的最新研究,透過引入創新的「分層控制令牌」機制,成功將語義規劃與聲學表現徹底解耦,賦予了模型在流式解碼過程中動態接收並執行外部指令的能力。這項突破不僅解決了「能說不能改」的產業難題,更為即時語音交互的操控粒度樹立了全新標竿。
傳統的全雙工系統在運作時,其生成過程往往被視為一個不可分割的整體。當模型開始輸出語音,使用者若想要求「用更嚴肅的語氣繼續」或「跳過當前話題」,系統通常只能被動等待當前語句播報完畢,甚至必須中斷整個流程並重新生成,導致回應延遲顯著增加,對話節奏支離破碎。這項新研究所提出的「分層控制令牌」機制,徹底改變了此一困境。該機制將生成過程視為一個可動態調整的序列,透過在流式解碼的特定節點注入指令,模型得以在不重新生成整段音訊的前提下,透過局部參數更新實現平滑的語氣切換或話題轉向,回應延遲因此大幅降低。此機制的核心,在於建構了一套創新的「意圖-聲學」雙通道注意力架構。
該架構讓控制令牌不再只是攜帶高層語義指令的抽象符號,而是能直接映射至聲學特徵空間,精準地調整音高、語速、停頓位置等細微參數。這意味著,使用者下達的指令不僅能被模型「理解」,更能被「執行」到具體的聲學輸出上。實驗數據顯示,在模擬客服對話的場景中,模型對「情緒轉向」與「話題切換」指令的響應準確率相較於傳統方法提升了約38%,且自然度評分未出現明顯下降,證明了該機制在提升控制力的同時,並未犧牲對話的流暢性與真實感。這項設計巧妙地解決了過去全雙工系統「能聽不能說」或「能說不能改」的兩難困境。過去,系統若過度強調「聽」,則會犧牲生成效率;若過度強調「說」,則會失去應變彈性。
新架構透過將「意圖」與「聲學」分離,讓模型在生成時能同時保持對外部指令的敏銳度,如同為語音模型裝上了一套「即時方向盤」,讓駕駛者(使用者)能隨時調整行進路線,而不必將整輛車停下重新發動。從應用層面來看,這項技術的落地將為語音助手、遊戲NPC(非玩家角色)或即時翻譯設備帶來「臨場應變」的質變。在醫療問診場景中,醫生可隨時打斷並調整提問方向,模型能立即調整回答策略,避免冗餘資訊干擾診斷;在直播或會議場合,主持人則能透過自然語言指令,如「簡短總結」或「用更熱情的語氣介紹」,即時控制語音輸出的風格與詳略,大幅提升互動效率與體驗。此外,該研究團隊也意識到,引入雙通道注意力機制必然會增加一定的計算開銷。
為此,他們透過輕量化蒸餾技術,成功地將模型壓縮至可部署於端側設備的規模,確保了技術的實用性與可及性。這項成果不僅為高可控性的下一代語音交互產品鋪平了道路,也預示著人機對話將從「被動聽從」走向「主動共創」的新紀元,讓AI不再只是「會說話」,而是「懂得如何配合說話」。
Related
相關文章

“AI 教父”辛頓參與聯署公開信:科技巨頭應保證第三方評估人員工作無幹預、受保護
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,由多家監督組織組成的 AI 評估機構論壇發佈了一封公開信,為第三方風險評估劃出一套最低條件,認為 Anthropic 和 OpenAI 等 AI 實驗室只有滿足特定的要求,才能與外部評估機構開展更有效的合作。

加州一縣擬議新政:用機器人替代人力的企業,應提供同酬就業機會或遣散費、培訓費
作者:清源 責編:清源 評論: 9 月 18 日消息,據外媒 TechSpot 今天(18 日)傍晚報道,美國加州的聖馬特奧縣監事會本週通過了一套“首創性”機器人許可制度,針對使用自主 AI 控制機器人的企業建立監管框架。該條例由縣監事雷 · 穆勒提出,不僅針對鋰電池起火等機器人使用過程中的潛在公共安全風險,更受關注的是如何處理機器人取代人工後對員工造成的影響。

Palantir CEO 卡普:美國前沿 AI 實驗室或在謀求“國有化”,以避開知識產權訴訟
作者:清源 責編:清源 評論: 9 月 18 日消息,Palantir CEO 亞歷克斯 · 卡普認為,Anthropic 呼籲政府加強 AI 監管,背後並不只是安全考量。當地時間 17 日,卡普接受 CNBC 採訪時指出,Anthropic 等前沿 AI 實驗室真正謀求的可能是國有化,從而獲得政府保護,應對未來因涉嫌竊取知識產權而可能面臨的大量訴訟。

智能眼鏡疑似被用來實施性騷擾行為,巴黎檢方展開刑事調查
作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)下午報道,針對疑似利用智能眼鏡實施性騷擾的行為,巴黎檢方展開了刑事調查,法國數據保護機構也收到企業投訴,多個國家開始重新審視這類設備帶來的隱私和安全問題。Meta 與依視路陸遜梯卡合作推出的 AI 智能眼鏡內置小型攝像頭,佩戴者可以在不易引起他人注意的情況下拍攝。

Waymo 加速亞太佈局,計劃 2028 年在新加坡提供 Robotaxi 商用服務
作者:溯波(實習) 責編:溯波 評論: 9 月 18 日消息,Alphabet 旗下自動駕駛企業 Waymo 當地時間 17 日宣佈,計劃於 2028 年在新加坡提供有償 Robotaxi 出行服務。該企業本週早些時候曾表示目標明年在日本東京實現商業化運營。

AI感知設備的隱私戰爭:手錶在錄音、眼鏡在偷拍,大眾正被悄悄“脫敏”
硅谷Tech news2026.09.18 11:23 · 來自北京全文5868字00:00 / 15:14但,真的能放心嗎?AI正在讓越來越多的隨身設備學會“感知”周圍。手錶在錄你的對話,眼鏡在拍你身邊的人,公共場合裡,你越來越難判斷自己是不是正在被記錄。