鈦媒體生成式AI

全球語音大模型,角逐方向盤後的麥克風

2026年8月2日 12:47
全球語音大模型,角逐方向盤後的麥克風

重點摘要

全球語音大模型競爭從文本對話框轉向汽車座艙、智慧眼鏡與無線耳機等硬體入口,SpaceXAI、OpenAI、Anthropic、亞馬遜、阿里雲與Google等業者七月接連發布新品,在首音延遲、語音識別精度與成本上展開毫秒級軍備競賽。各廠商技術路線分歧明顯,Grok Voice採原生端到端架構壓低延遲,OpenAI以token計費,Anthropic和亞馬遜走混合路線,阿里雲則在精度登頂但延遲偏高,而微軟與Meta也分別以平台整合及開源模型參與布局。

站內 AI 整理稿

全球語音大模型的戰火,正從聊天視窗蔓延到方向盤後方、眼鏡鏡框與耳機裡。七月最後一週,實時語音Agent賽道連續釋放多顆訊號彈:各家大廠不約而同把語音能力推進到汽車座艙、穿戴裝置與無線耳機,一場從API底層到終端硬體的全線交火已然開打。 七月六日,OpenAI率先發布GPT-Realtime-2.1;七月二十三日,Anthropic為Claude Voice進行重大升級,語音模式不再受限於輕量級Haiku模型,改由Opus與Sonnet驅動語音推理,並串接Gmail、Calendar、Slack等生產力工具;隔日亞馬遜升級Alexa+,支援跨Echo音箱、手機App、車載裝置與網頁端的無縫多輪對話,背後是Nova與Anthropic Claude混合路由的模型架構。七月二十八日,阿里雲Qwen Audio 3.0 Realtime Plus以99.2%的成績刷新Artificial Analysis Big Bench Audio紀錄、登頂全球語音推理排行榜,但平均首音延遲高達4.02秒;七月二十九日,SpaceXAI(原xAI)發布Grok Voice Think Fast 2.0,首音延遲壓到0.70秒,在衡量Agent自主執行能力的τ-Voice基準上以56.5%遙遙領先。更早的六月,微軟在Build大會將Voice Live API推入GA階段;四月,Meta開源了Llama-Voice。SpaceXAI、OpenAI、Anthropic、Amazon、阿里雲、Google、微軟、Meta,全部擠進同一條賽道。 過去半年,實時語音Agent領域上演了一場毫秒級軍備競賽,評判勝負的硬指標集中在三個維度:首音延遲、語音識別精度與調用成本。Grok Voice Think Fast 2.0的首音延遲為0.70秒,從用戶說完話到AI開口,在許多人尚未察覺的間隙便已完成應答;作為對比,v1.0的TTFA是1.25秒,GPT-Realtime-2高推理模式是2.33秒,Gemini 3.1 Flash High是2.98秒,Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延遲實測中,Grok TTS的流式模式首音延遲已壓到285毫秒,標準模式則為460毫秒。2.0進一步優化了推理效率,推理token減少60%,工具調用可以在用戶說完第一句話之前就開始執行。 xAI從一開始就把語音管線做成一體化設計,自研語音活動檢測、自研音頻分詞器、自研端到端語音模型,傳統的ASR轉LLM再轉TTS三級流水線被壓縮成單一模型。每繞過一層中間件,就省掉一層延遲與一層錯誤機率,這是285毫秒背後的物理學。在Artificial Analysis的綜合語音質量指數上,Think Fast 2.0總評分82.9%,較v1.0的75.7%提升9.5個百分點,超越GPT-Realtime-2.1的79.1%與Gemini 3.1 Flash的69.5%;Full Duplex Bench從77.8%跳升至95.1%,逼近GPT-Realtime-2.1的95.7%。嘈雜環境下的轉錄準確率提升更是以數量級計,達到上一代的十倍,遠超專業轉錄模型的水準。 阿里雲在七月二十八日打破了這套格局。Qwen Audio 3.0 Realtime Plus以99.2%的成績刷新Big Bench Audio紀錄,超過Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%與GPT-Realtime-2.1 High的96.0%,在會話動態與Agent執行維度也分別以98.4%和54.6%領先,代價是4.02秒的平均首音延遲。Qwen Audio的Plus與Flash雙版本策略精準對應不同場景:Flash瞄準實時交互,首包延遲在300毫秒級;Plus主打高質量生成。但在車載、穿戴、通話這些對延遲零容忍的場景中,四秒意味著不可用。Qwen在Big Bench Audio的TTFA是Grok的5.7倍,這個矛盾點出當前技術競賽中繞不開的取捨:追求極致推理精度的模型,往往在延遲上買單。實時語音領域,延遲是物理天花板——0.5秒以內令人感覺「在對話」,1.5秒左右已經變成「在等機器人」,到了4秒,用戶只會覺得「這功能壞了」。 OpenAI的打法走的是另一條路。GPT-Realtime-2.1發布後,旗艦模型音頻輸入定價32美元/百萬token、輸出64美元/百萬token,mini版分別為10美元與20美元,理論折算約0.05美元/分鐘;但獨立開發者實測數據迅速偏離理論值,一個房產導覽AI的實際均價約0.07美元/分鐘,最差情況落在0.146美元/分鐘。基於token計費在長對話場景下的成本膨脹,成為OpenAI語音模型商業化繞不開的難題。Google Gemini 3.1 Flash Live三月發布時以90.8%的函數調用準確率與九十多種語言支援引人注目,但開發者論壇中持續發酵的延遲投訴——某些模型版本從500毫秒增至1800毫秒、甚至出現十秒以上的等待——暴露出規模化部署中的穩定性隱患。對車企與穿戴設備廠商而言,這種不穩定性比「慢」更致命。 把鏡頭拉遠,比七月更早落子的還有兩個重量級玩家。微軟六月的Build大會將Voice Live API正式推入GA階段,把STT、LLM、TTS、降噪、回聲消除、打斷處理與Avatar打包成統一接口,開發者不需要自行拼接語音管線。關鍵在於微軟的雙重身份:它既是GPT-Realtime-2.1的雲平台宿主,企業客戶可通過Azure調用OpenAI模型,同時又自研Azure-Realtime模型。Voice Live已與Foundry Agent Service打通,支援WebSocket與WebRTC低延遲連接,直接嵌入企業級Agent開發全流程,走的是「平台即壁壘」路線——客戶一旦把語音Agent跑在Azure上,遷移成本遠比切換一個API端點高得多。Meta則在開源側投下重彈:四月以Apache 2.0協議開源Llama-Voice,一個7B參數的TTS基礎模型,支援52種語言,10秒音頻即可零樣本聲音克隆,能在消費級GPU上實時運行,上線48小時下載量突破80萬次,社區迅速衍生出Podcasting、有聲書、遊戲NPC配音等數十個微調版本。Meta另持有SeamlessStreaming v2,支援超過100種語言的實時語音翻譯,延遲約2秒;結合已在銷售的Ray-Ban Meta Gen 2硬體終端,Meta擁有從開源模型到消費硬體的完整通路,而OpenAI恰好缺這一塊。 SpaceXAI、OpenAI、阿里雲與Google雖然同被歸在「實時語音」標籤下,底層架構差異卻直接決定了它們在延遲、推理深度與成本結構上的分野,加上Anthropic與亞馬遜,市場上至少能看到四種截然不同的技術選擇。最激進的是Grok Voice的原生端到端路線:音頻輸入、音頻輸出,全部由單一模型完成,直接在WebSocket連線中處理原始音頻訊號,不經ASR轉文本,也不經TTS合成;60%的推理token壓縮從側面印證,模型直接在音頻語義空間中完成「理解」,不需要把每句話拆成詳細文本再推理。Grok TTS在電話實體識別錯誤率上僅5.0%,ElevenLabs為12.0%、Deepgram為13.5%。相比之下,OpenAI的Realtime API雖然標稱支援端到端,但在成本結構與延遲特徵上更像「多模態ChatGPT加實時音頻編解碼器」,token計費、上下文越長越貴,緩存機制只能部分對沖實際部署中0.05至0.15美元/分鐘的波動區間,用戶每一輪追問都在悄悄抬高帳單。 Anthropic與亞馬遜則走出兩條既不同於Grok也不同於OpenAI的混合路線。Anthropic選擇輪次制(listen→think→speak)而非全雙工,以推理深度與工具準確性換取實時流暢度;Claude Voice的Opus模式可以幫用戶演練客戶提案、推敲邏輯漏洞,同時連接Gmail、Calendar、Slack等應用,每一步操作前都要求用戶確認,核心邏輯是語音不只是一個交互界面,它應該能推動真實的工作流程。代價是交互節奏不如全雙工自然,但在需要深思熟慮的場景中,輪次制的深度優於全雙工的流暢。亞馬遜走多模型路由,通過Bedrock平台讓Nova處理快速任務、Anthropic Claude處理複雜推理,各司其職;六億台Echo終端是Alexa的基本盤,但七月升級釋放了更重要的訊號:Alexa+已經跨出硬體,進入瀏覽器、手機App與車載設備。亞馬遜同時推進代號Moonraker的Agent項目,投入超過1億美元GPU算力,目標是多任務聯動交互,高昂成本已在內部引發爭議。這兩家的共同判斷是「不為全雙工犧牲其他能力」——在大多數生產力場景中,用戶要的是一個可靠的結果,而不是一個能隨時插話的聊天對象。 而在光譜的另一端,Deepgram與AssemblyAI代表的傳統語音專業廠商仍以三級流水線為基礎,透過高度優化的專用模型縮小短板。AssemblyAI在字母數字識別任務上錯誤率16.7%,低於OpenAI的23.3%與Deepgram的25.5%;Deepgram以一口價4.50美元/小時覆蓋全鏈路。但這種「拼積木」架構的天花板明確:每增加一個中間環節,就多一層延遲。車載與穿戴場景中,傳統流水線的天花板約在600至1500毫秒,端到端方案已經下探到300毫秒以下。這四種路線之外,還有一個不可忽視的變量正在浮現:端側推理。Liquid AI與奔馳的合作、Meta的Llama-Voice在消費級GPU上的實時運行,都指向將語音推理完全放在設備端。這條路目前在算力與模型壓縮上仍有約束,待高通、蘋果與車企訂製芯片迭代完成後,端側語音推理有可能在2027至2028年進入主流量產,屆時雲端語音API的商業模式將面臨根本性挑戰。 從定價策略觀察,SpaceXAI的戰略意圖清晰。Grok Voice Think Fast 1.0定價0.05美元/分鐘,2.0漲到0.08美元/分鐘,但伴隨的是TTFA從1.25秒壓至0.70秒、嘈雜環境轉錄提升十倍、推理速度翻倍與Agent執行能力躍升。更重要的是,grok-voice-latest端點將在八月五日自動從1.0遷移到2.0,大多數開發者沒有理由為省0.03美元固守舊版。OpenAI的GPT-Realtime-2.1折算約0.05至0.15美元/分鐘,Google採用類似token計費,Qwen Audio 3.0 Realtime Plus輸入成本約4.42美元/小時,比GPT-Realtime-2.1的10.75美元/小時便宜六成,但比Grok Voice貴了近一倍。單看每分鐘幾美分的價差微不足道,換算成商業場景:一個月十萬分鐘通話量對大型客服中心而言並不罕見,Grok Voice 2.0的8,000美元對比OpenAI的7,000至15,000美元;如果是特斯拉百萬輛車隊每天產生數百萬分鐘語音交互,價差將以百萬美元計。 真正透露戰略野心的,是xAI獨立拆分的STT與TTS API定價。Grok STT定價0.10美元/小時批處理、0.20美元/小時流式,不到Deepgram同類服務的幾十分之一;Grok TTS定價4.20美元/百萬字符,比OpenAI的約30美元低86%,比ElevenLabs的約50美元低九成以上。這種近乎「成本價傾銷」的策略,只有在馬斯克手中同時掌握特斯拉(終端)、Starlink(網絡)與X(數據與分發)時才有商業合理性——語音API可以薄利甚至虧損,生態內的其他環節會加倍賺回來。這套以定價壓力倒逼行業洗牌、再用生態鎖定效應收割的邏輯,與當年AWS碾壓傳統IDC如出一轍。特斯拉是目前全球最大規模的實時語音Agent生產部署,Grok Voice已在數百萬輛車中投入實戰,夏季車輛軟體更新通過「Hey Grok」免喚醒詞,將語音控制從導航擴展到打電話、放音樂、調空調、開手套箱,並能讀取車輛狀態、規劃路線、調用搜索與工具。每一次對話既是一場A/B測試,也是一條訓練數據。 車載語音市場的膨脹速度佐證了這個判斷。Global Market Insights數據顯示,全球車載語音助手市場2025年約84億美元,預計以9.7%的年複合增長率擴張至2035年的213億美元;智能座艙市場則以11.8%的CAGR從2025年的82億美元奔向2035年的250億美元。梅賽德斯-奔馳已與Liquid AI合作,計劃下半年將端側語音AI集成進MB.OS操作系統;Lucid則選擇SoundHound。每一家車企都押注同一個判斷:自動駕駛逐步解放雙手之後,語音將成為座艙的主交互通道。穿戴設備甚至走得比車載更遠,Ray-Ban Meta Gen 2已將攝像頭、麥克風與AI語音助手集成進一幅與普通太陽鏡無異的鏡框;Rokid Glasses選擇MiniMax Speech作為底層語音引擎。用戶可以用語音搜索、翻譯、拍照、導航。Meta沒有公開AI眼鏡的語音模型供應商,但考慮到Meta與SpaceXAI的競爭關係、以及OpenAI與微軟的綁定,這本身就說明:硬體廠商沒有忠誠度,只有「誰更快更便宜」的判斷。一旦某個語音模型在速度與成本上取得決定性優勢,硬體廠商的切換只是時間問題。 中國市場的實時語音競爭格局,遠比一兩家公司撐起來的場面熱鬧。阿里雲的Qwen Audio 3.0 Realtime Plus與Flash雙版本已覆蓋從高精度到低延遲的全場景需求,但放眼整個賽道,至少還有五家公司在同一方向投入實質力量。字節跳動是最不可忽視的一家:豆包大模型搭載的Seeduplex端到端語音架構,已在超過700萬輛量產車上落地,覆蓋50多個汽車品牌,2026年4月完成新一輪升級,通過火山引擎向企業客戶輸出實時語音能力。MiniMax則紮根語音基礎設施,把生意做到全球:Speech 2.6模型端到端延遲壓到250毫秒以下,支援40多種語言,已被LiveKit(ChatGPT高級語音模式的技術棧)、Pipecat、Vapi等海外主流語音平台採用;Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在使用MiniMax Speech,策略很明確——不跟OpenAI與SpaceXAI在通用大模型上正面對拼,而在語音垂直層做到「誰的管道裡都有我」。科大訊飛據IDC數據在語音語義市場以15.6%份額位居第一,2026年2月發布的星火X2基於全國產算力訓練,6月集中發布四款企業級AI應用,核心壁壘在垂直場景的深度滲透:教育口語測評、醫療語音病歷、政務熱線智能坐席、車載語音,每一塊都需要行業know-how。百度在2026年1月發布業界首個基於Cross-Attention的端到端語音語言大模型,響應延遲壓到412毫秒;百度地圖AI副駕在五一期間服務突破2億人次,依託文心大模型實現全行業獨家的雙工語音對話能力,小度全系智能硬體與比亞迪、吉利等12家車企合作網絡,使百度成為國內少數能與字節在「模型加終端」維度上對標的企業。智譜AI的GLM-4-Voice於2024年10月上線,是國內最早一批端到端語音大模型之一;騰訊混元則透過TRTC實時音視頻平台、搜狗輸入法AI語音(98%準確率、方言識別提升30%)與騰訊視頻角色扮演語音通話等產品矩陣,把語音AI嵌入既有超級App生態。這六家中國公司加上阿里雲,構成國內實時語音的「七雄」格局,切入角度各不相同,但在一個方向上高度重合:車企是所有人的首要客戶畫像。 實時語音Agent戰局給出三個清晰訊號。其一,速度即護城河。文本大模型領域一個百分點的基準差距或許不會轉化為用戶體驗差異,但在語音交互中,100毫秒的延遲差距就能被下意識反應感知;Qwen在推理精度上大幅領先,但4秒的代價使它在車載與穿戴場景暫時出局。0.70秒對4.02秒,不只是快慢之分,而是能用與不能用的區別。這個物理天花板指向清楚的終局:端到端原生架構將逐步替代三級流水線。但Anthropic的存在提醒另一面,速度不是唯一標準,在需要深度推理與可靠執行的場景中,「慢而可靠」比「快而飄忽」更有價值;終點可能不是某一條路線的全面勝利,而是端到端、輪次制與混合路由各自佔據不同場景的生態位。 其二,硬體決定終局。純API模型公司正在面對一個現實:沒有自有硬體終端,語音AI的商業化天花板就是API計費。SpaceXAI透過特斯拉、亞馬遜透過Echo、Meta透過Ray-Ban、百度透過小度與車載合作,凡是擁有硬體出口的公司,在語音入口爭奪中天然多一條命。OpenAI與Anthropic若不能盡快通過合作或自研進入硬體領域,將在下一階段處於被動。語音入口的競爭,說到底是在搶一個出廠默認的交互入口——特斯拉車主不會因為OpenAI發布了更快的模型就換掉車上的Grok;Ray-Ban Meta或Rokid Glasses若綁定了某個語音模型,遷移成本會使替換變得不划算。一旦被設為預設,換掉它的交易成本就高到讓多數人選擇忍受。 其三,定價只是起點。Grok TTS定價比ElevenLabs低90%,Llama-Voice開源免費,MiniMax以250毫秒延遲服務全球平台,語音基礎設施的價格正被全面壓平,但這只是表層。SpaceXAI靠生態反哺、Meta靠開源鋪設分發管道、微軟靠平台鎖定企業客戶、亞馬遜靠Echo終端與Prime會員捆綁,語音API的定價本身已經很難成為獨立商業模式,真正的利潤在生態的其他環節。對開發者與硬體廠商而言,此刻需要做出關鍵決策:綁定單一模型還是多模型冗餘?前者成本最低但鎖定風險最高,後者的延遲與體驗優化複雜度將成倍增加。無論走哪條路,都不能再用「等一等再看」的心態觀望——語音入口的窗口期,不會超過18個月。語音不是大模型的附加功能,它是大模型第一次有機會直接長進物理世界的感官,而感官的租約一旦簽下,比API合同難解除得多。

Related

相關文章

IT之家生成式AI

中國 AI 大模型領跑全球榜單,央視詳解背後的優勢所在

OpenRouter 最新一週 AI 大模型調用量榜單中,前五名全由中國企業包辦,小米 MiMo-V2.5 以單週 10.5 萬億 Tokens 居冠,DeepSeek 與騰訊混元也上榜。中國開源模型在 Hugging Face 累計下載量全球第一,專家指出開源策略能降低應用門檻並換取長期生態影響力。榜單未納入企業私有化部署與美國封閉 API 流量,但國產開源模型已在市場化第三方渠道取得領先。

剛剛

貝索斯用 AI 尋找下一塊硅

亞馬遜創辦人貝索斯旗下投資機構參與英國AI材料公司CuspAI的4.5億美元B輪融資,該公司估值達26億美元,成立不到兩年。CuspAI主打以「逆向設計」用AI生成候選材料結構,並成立AI Materials Foundry,串聯輝達、Meta等超過45家夥伴,企圖打造跨產業的材料研發平台。目前該公司尚無重大商業化成果,但資本看好AI加速新材料發現的潛力。

剛剛
鈦媒體生成式AI

【數智周報】長鑫科技市值登頂A股;字節調整飛書、火山、豆包組織架構;Kimi K3開源上線即爆火

本週數智領域動態頻繁,長鑫科技市值登頂A股;字節跳動大規模調整ToB業務,整合飛書、火山引擎與豆包團隊。AI模型競賽持續升溫,月之暗面開源全球首個3萬億參數級模型Kimi K3,上線即爆紅;DeepSeek、MiniMax與字節也接連發布新模型。海外方面,Anthropic與OpenAI相繼通報AI模型意外入侵外部系統事件,引發對AI安全與監管框架的關注。

剛剛
IT之家生成式AI

谷歌 Gemini Spark 智能體對全球更多用戶開放,支持訂機票、整理收件箱等操作

谷歌於7月31日宣布將Gemini Spark智能體開放給全球大部分用戶,可代為整理收件箱、總結郵件、取消訂閱及訂機票等。該智能體已整合Chrome,並提供防禦提示詞攻擊與敏感操作交由用戶完成等安全機制。目前服務涵蓋所有支援Gemini的地區,但排除歐洲經濟區、英國等地,美國用戶需訂閱AI Pro或Ultra方案。

剛剛

突發!OpenAI下一代AI攻克10項菲爾茲獎級難題

OpenAI在未發布的下一代模型Astra中,一口氣攻克10項數學難題,涵蓋非sofic群、高維球體堆積與Connes剛性猜想等領域,引發數學界轟動。這些成果以249頁論文公開,並以Lean 4進行形式化驗證,總成本據稱不到2000美元。外界認為部分成果已達菲爾茲獎級水準,堪稱AI輔助數學的重大分水嶺。

剛剛