MarkTechPost AI生成式AI

PolyAI Releases Dialog-RSN-1: An Audio-Native Dialog Model That Fuses Turn-Taking, Speech Recognition, Function Calling, And Response

2026年7月31日 05:06

重點摘要

PolyAI has introduced Dialog-RSN-1, a dialog model that perceives the caller’s audio directly instead of reading a transcript.

站內 AI 整理稿

語音對話系統過去長期依賴「先轉錄、再理解」的管線架構,但這套做法在真實電話場景中始終存在瓶頸:語氣、猶豫、停頓與辨識不確定性,往往在文字轉換的瞬間就遺失了。PolyAI 近日發布的 Dialog-RSN-1 試圖改變這個局面,這是一款直接以音訊為輸入的對話模型,跳過逐字稿,讓模型直接感知來電者的語音訊號,並在單一架構內同時處理語輪轉換、語音辨識、函式呼叫與回應生成。目前這款模型已經實際投入生產環境,正在處理大量真實來電。 Dialog-RSN-1 的設計採取「輸入端音訊感知」的策略,也就是模型只對輸入的音訊進行原生理解,輸出端仍然交由獨立且可控的 TTS 語音合成系統處理。這樣一來,回應的聲音風格、語氣與發音細節可以維持在系統開發者的掌控之下,不會因為模型內部內建語音而難以調整。PolyAI 表示,這種架構與目前市場上常見的兩種路線有明顯區隔。 第一種是傳統的級聯式架構,系統先透過自動語音辨識(ASR)產生最可能的文字內容,再把文字送進大型語言模型處理。問題在於,音訊中重要的副語言資訊在這一連串轉換中已經損失,而且調整語音活動偵測的結束點參數、或是對 ASR 進行偏置調整,往往難以在不同使用情境之間通用。第二種路線則是以 GPT Realtime、Gemini Live 為代表的語音到語音模型,這類模型雖然保留完整音訊,但語音輸出被直接嵌入模型之中,限制了發音控制的彈性,而且全雙工串流模式會在整段通話期間持續占用 GPU 資源。 Dialog-RSN-1 的執行方式則採取「按需探測」而非「持續串流」。系統使用高召回率的語音活動偵測器搭配計時器,決定何時該觸發模型運算。模型的回應首先輸出的第一個 token 是語輪狀態,分為 EMPTY、ONGOING 與 COMPLETE 三種,明確判斷系統是否該接話、繼續等待或結束語輪。PolyAI 強調,廉價的聲學線索只用來決定「何時」詢問模型,真正的語輪轉換判斷,是由擁有完整對話脈絡的模型本身來做決定。 部署方面,Dialog-RSN-1 目前僅透過 PolyAI 自家平台提供,沒有開放權重,也沒有公開 API。既有客戶即日起可以啟用,新客戶則可申請早期存取資格。PolyAI 鎖定的目標客群是大型、高通話量的企業,包括餐廳、保險、金融服務、醫療保健、飯店、零售、電信、旅遊與公用事業等產業;適用的場景涵蓋訂位與預約、帳單與付款、身分驗證、來電路由、訂單管理與故障排除等。PolyAI 在 2025 年 12 月的 8,600 萬美元 D 輪融資時曾透露,目前擁有超過 100 家企業客戶、2,000 多個實際部署案例;自助開發者與中小企業並非這款模型鎖定的對象。 PolyAI 在效能方面給出多項具體數據。模型在 A100 GPU 上可達成低於 300 毫秒的回應時間;在一家餐廳集團的部署中,來電處理的相對封包率(containment)提升了 11%;在一家保險公司的案例中,延遲降低了 37%。目前 Dialog-RSN-1 僅支援英文,非英文語音與豐富的網頁聊天情境,PolyAI 仍建議使用先前推出的 Raven 3.5 模型。 模型建構方式方面,PolyAI 是在開源的多模態模型基礎上進行後訓練,使用內部資料執行監督式微調與強化式微調。這套流程大體上不受基礎模型限制,PolyAI 評估了 Gemma、GPT-OSS、Qwen 與 Mistral 等多個模型家族。為了將延遲控制在 A100 上的 300 毫秒以內,候選模型落在 80 億稠密參數到 300 億稀疏參數的範圍之間。 延遲優化是這款模型的一大工程重點。PolyAI 採取多項技術來壓縮回應時間,包括在使用者說話的同時預先填充注意力快取、採用只能附加的提示模板以減少快取失效、將每位來電者固定路由到同一張 GPU 上,以及使用微調過的投機解碼模型來加速生成,其平均接受率達 3.9 個 token。此外,系統在強化式微調階段學習了自動推理能力;而轉錄動作則被安排在回應或工具呼叫之後才執行,與語音生成並行,避免拖慢主要流程的即時回應速度。 評測部分,PolyAI 使用內部開發的 Dialog-Eval 基準來評估模型表現,這套基準未來計畫對外開源。Dialog-Eval 的每個測試案例是一通電話在某個決策點被截斷,並針對單一的下一步動作進行評分,而不是評估整段對話的完整展開。PolyAI 表示,Dialog-RSN-1 是當前具備即時處理能力的模型中得分最高的;他們把級聯式架構的音訊感知分數上限估算在 77 左右,同時指出 GPT Realtime 2.1 在音訊感知案例上的得分與級聯架構大致相當。在轉錄品質方面,給定相同上下文後,gpt-4o-transcribe 的詞錯誤率從 7.8% 改善至 6.9%,而 Dialog-RSN-1 的表現又更低。 PolyAI 後續計畫公開技術報告與 Dialog-Eval 相關論文,進一步揭露模型細節與評測方法。以目前市場態勢來看,Dialog-RSN-1 代表了語音對話模型走向「音訊原生」的一個明確方向:不再把語音視為需要先轉成文字的麻煩來源,而是把音訊當作模型可以完整理解與推理的輸入素材,同時在輸出端維持合成語音的彈性,兼顧即時互動品質與實際部署需求。

Related

相關文章

Google Earth推出基於Nano Banana 2的全新圖像生成功能 一鍵生成逼真AI場景與歷史風貌

AI資訊AI新閒資訊正文Google Earth推出基於Nano Banana 2的全新圖像生成功能 一鍵生成逼真AI場景與歷史風貌發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘在人工智能技術加速賦能日常工具的背景下,Google Earth(谷歌地球)近日正式推出了基於Nano Banana2模型的全新圖像生成功能。通過將衛星、航空與3D實景地圖同生成式AI深度融合,該功能允許全球網頁端用戶直接在地圖上對現實地點進行視覺重塑。作為該功能的亮點,用戶只需在網頁版谷歌地球中放大至特定目標區域,點擊“創建 image”並輸入描述性指令,即可基於真實地理數據生成深度契合實際地形的定製圖像。這一技術不僅拓展了空間可視化的邊界,也為多個行業應用場景提供了全新解法。在教育領域,該功能使歷史教學擺脫了純文字的抽象感。教師帶領學生觀察世界遺產時,輸入諸如渲染公元78年龐貝古城繁華街景的指令,廢墟便能一鍵復原為充滿羅馬帝國風貌的立體場景。同時,結合 Gemini 的底層檢索能力,系統還能夠圍繞地標建築快速生成包含關鍵歷史因果的直觀信息圖。對於房地產開發與城市規劃行業,這項技術顯著降低了前期概念演示的門檻。無論是向客戶展示東京空置地塊改造為商業綜合體的未來願景,還是為買家模擬依山傍水的現代湖畔木屋,規劃者只需輸入具體需求,系統便能在原有自然地貌上實時渲染出具備高精度的3D設計效果,幫助團隊在動工前更直觀地評估方案。此外,該工具也為大眾提供了打破現實邊界的趣味體驗。用戶可以將谷歌的山景城園區一鍵轉化為充滿賽博朋克風格的科幻烏託邦,直觀感受百年後的視覺奇觀。目前,該功能已面向全球網頁端用戶正式上線。相關推薦告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考PhiZero物理世界模型革新視頻生成,破解像素預測的物理偏差。它首創“物理語言”,讓AI顯

2 分鐘前6200

告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考

AI資訊AI新閒資訊正文告別盲目像素預測:PhiZero開創“物理語言”先河,讓AI世界模型學會像人一樣思考發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘在當前的大模型浪潮中,視頻生成模型常常被視為通往具身智能的未來模擬器。然而,主流模型多采用像素空間的直接預測,容易在物理規律的穩定性和連貫性上出現偏差。針對這一行業痛點,研究團隊近日正式推出了全新的物理世界模型PhiZero。該模型摒棄了傳統的盲目預測套路,創新性地引入了“物理語言”概念,讓AI在生成視頻前先進行顯式的物理推理。作為核心創新,PhiZero提出了一種被稱為“物理語言”的離散表徵。該語言通過自監督學習方式,從海量野外視頻中提煉出狀態轉移模式,捕捉不同視覺經驗裡的動態演化規律。在此基礎上,模型構建了“先推理、後渲染”的創新架構:系統首先在物理語言空間內自迴歸地推斷未來世界的演變軌跡,隨後交由專用的擴散解碼器將其渲染為高清視頻。這種設計不僅將底層動力學推演與像素級合成分離開來,還大幅提升了模型在物理一致性上的表現。在技術實現上,該系統分為分詞器與推理器兩大核心模塊。其中,物理語言分詞器利用轉移級 Q-Former 捕獲相鄰狀態變化,並結合有限標量量化機制生成緊湊的離散符號;擴散解碼器則以首幀和離散符號為條件,恢復出細膩的視覺細節。而物理語言推理器則基於預訓練視覺語言模型進行初始化,從首幀和文本動作意圖出發,精準預測未來的物理語言序列。多項基準測試結果表明,PhiZero在 Physics-IQ Verified、PhyGround 以及 WorldModelBench 等多個物理推理和視頻生成評估中取得了領先成績。無論是碰撞引起的物體位移、重力驅動的形變,還是複雜的連鎖反應,模型均能展現出高度逼真的物理合理性。隨著具身智能與機器人技術的加速落地,PhiZero的問世為可控、可交互的世界建模開闢了

2 分鐘前6600

字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了

字節跳動正式推出 Seedance 2.5 影片生成模型,單次生成時長從 15 秒翻倍至 30 秒,並能多輪延長且維持人物、場景與風格一致。該模型強化長敘事與多模態參考能力,支援單次輸入最多 30 張圖片、10 段影片與 10 段音頻,可同時還原多人形象與聲音。Seedance 2.5 將陸續上線即夢 AI 與豆包專業版,API 也將接入火山方舟,鎖定影視、廣告、教育等多元場景。

32 分鐘前6200

阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景"最後一公里"

阿里通義千問發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打長音頻上下文記憶與內建多行業詞庫,醫療、IT等專業術語無需配置即可精準識別。該模型支援30餘種語言,並整合語音潤色功能,已在阿里雲百鍊平台開放調用。同步推出的Streaming版本鎖定即時場景,延遲僅300毫秒,系列先前於評測拿下全球第一。

32 分鐘前3600

蘋果暗示Siri AI將引入付費限制,重度用戶或需訂閱iCloud+

蘋果在庫克最後一次財報電話會議上暗示,Siri AI未來可能採用付費模式,高頻使用的重度用戶或需訂閱iCloud+服務。蘋果計劃為Siri AI免費使用設定額度,超出限制將收費,但目前具體標準尚未公布。此外,部分Apple Intelligence功能也已規劃分級策略,iCloud+訂閱用戶可獲得更高使用額度。

2 小時前4700

全模態視頻模型迎來新突破:MiniMax正式發佈H3 並承諾開源權重

MiniMax正式發布全模態生成模型H3,承諾數日內開源權重,可同時處理文本、圖像、視頻與聲音輸入並產出原生雙聲道音頻的高清影片。該模型採用整合式H3-Omni Transformer架構,提升訓練效率與壓縮率,2K解析度下每秒價格不到主流同類模型三分之一,並兼顧國產晶片相容性。

2 小時前7400