MarkTechPost AI生成式AI

PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response

2026年7月31日 05:06

重點摘要

PolyAI has introduced Dialog-RSN-1, a dialog model that perceives the caller’s audio directly instead of reading a transcript.

站內 AI 整理稿

語音對話系統過去長期依賴「先轉錄、再理解」的管線架構,但這套做法在真實電話場景中始終存在瓶頸:語氣、猶豫、停頓與辨識不確定性,往往在文字轉換的瞬間就遺失了。PolyAI 近日發布的 Dialog-RSN-1 試圖改變這個局面,這是一款直接以音訊為輸入的對話模型,跳過逐字稿,讓模型直接感知來電者的語音訊號,並在單一架構內同時處理語輪轉換、語音辨識、函式呼叫與回應生成。目前這款模型已經實際投入生產環境,正在處理大量真實來電。Dialog-RSN-1 的設計採取「輸入端音訊感知」的策略,也就是模型只對輸入的音訊進行原生理解,輸出端仍然交由獨立且可控的 TTS 語音合成系統處理。

這樣一來,回應的聲音風格、語氣與發音細節可以維持在系統開發者的掌控之下,不會因為模型內部內建語音而難以調整。PolyAI 表示,這種架構與目前市場上常見的兩種路線有明顯區隔。第一種是傳統的級聯式架構,系統先透過自動語音辨識(ASR)產生最可能的文字內容,再把文字送進大型語言模型處理。問題在於,音訊中重要的副語言資訊在這一連串轉換中已經損失,而且調整語音活動偵測的結束點參數、或是對 ASR 進行偏置調整,往往難以在不同使用情境之間通用。

第二種路線則是以 GPT Realtime、Gemini Live 為代表的語音到語音模型,這類模型雖然保留完整音訊,但語音輸出被直接嵌入模型之中,限制了發音控制的彈性,而且全雙工串流模式會在整段通話期間持續占用 GPU 資源。Dialog-RSN-1 的執行方式則採取「按需探測」而非「持續串流」。系統使用高召回率的語音活動偵測器搭配計時器,決定何時該觸發模型運算。模型的回應首先輸出的第一個 token 是語輪狀態,分為 EMPTY、ONGOING 與 COMPLETE 三種,明確判斷系統是否該接話、繼續等待或結束語輪。

PolyAI 強調,廉價的聲學線索只用來決定「何時」詢問模型,真正的語輪轉換判斷,是由擁有完整對話脈絡的模型本身來做決定。部署方面,Dialog-RSN-1 目前僅透過 PolyAI 自家平台提供,沒有開放權重,也沒有公開 API。既有客戶即日起可以啟用,新客戶則可申請早期存取資格。PolyAI 鎖定的目標客群是大型、高通話量的企業,包括餐廳、保險、金融服務、醫療保健、飯店、零售、電信、旅遊與公用事業等產業;適用的場景涵蓋訂位與預約、帳單與付款、身分驗證、來電路由、訂單管理與故障排除等。

PolyAI 在 2025 年 12 月的 8,600 萬美元 D 輪融資時曾透露,目前擁有超過 100 家企業客戶、2,000 多個實際部署案例;自助開發者與中小企業並非這款模型鎖定的對象。PolyAI 在效能方面給出多項具體數據。模型在 A100 GPU 上可達成低於 300 毫秒的回應時間;在一家餐廳集團的部署中,來電處理的相對封包率(containment)提升了 11%;在一家保險公司的案例中,延遲降低了 37%。目前 Dialog-RSN-1 僅支援英文,非英文語音與豐富的網頁聊天情境,PolyAI 仍建議使用先前推出的 Raven 3.5 模型。

模型建構方式方面,PolyAI 是在開源的多模態模型基礎上進行後訓練,使用內部資料執行監督式微調與強化式微調。這套流程大體上不受基礎模型限制,PolyAI 評估了 Gemma、GPT-OSS、Qwen 與 Mistral 等多個模型家族。為了將延遲控制在 A100 上的 300 毫秒以內,候選模型落在 80 億稠密參數到 300 億稀疏參數的範圍之間。延遲優化是這款模型的一大工程重點。

PolyAI 採取多項技術來壓縮回應時間,包括在使用者說話的同時預先填充注意力快取、採用只能附加的提示模板以減少快取失效、將每位來電者固定路由到同一張 GPU 上,以及使用微調過的投機解碼模型來加速生成,其平均接受率達 3.9 個 token。此外,系統在強化式微調階段學習了自動推理能力;而轉錄動作則被安排在回應或工具呼叫之後才執行,與語音生成並行,避免拖慢主要流程的即時回應速度。評測部分,PolyAI 使用內部開發的 Dialog-Eval 基準來評估模型表現,這套基準未來計畫對外開源。

Dialog-Eval 的每個測試案例是一通電話在某個決策點被截斷,並針對單一的下一步動作進行評分,而不是評估整段對話的完整展開。PolyAI 表示,Dialog-RSN-1 是當前具備即時處理能力的模型中得分最高的;他們把級聯式架構的音訊感知分數上限估算在 77 左右,同時指出 GPT Realtime 2.1 在音訊感知案例上的得分與級聯架構大致相當。在轉錄品質方面,給定相同上下文後,gpt-4o-transcribe 的詞錯誤率從 7.8% 改善至 6.9%,而 Dialog-RSN-1 的表現又更低。

PolyAI 後續計畫公開技術報告與 Dialog-Eval 相關論文,進一步揭露模型細節與評測方法。以目前市場態勢來看,Dialog-RSN-1 代表了語音對話模型走向「音訊原生」的一個明確方向:不再把語音視為需要先轉成文字的麻煩來源,而是把音訊當作模型可以完整理解與推理的輸入素材,同時在輸出端維持合成語音的彈性,兼顧即時互動品質與實際部署需求。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前