鈦媒體生成式AI

OpenAI的新語音模型,先把用戶煩到了

2026年7月9日 10:18
OpenAI的新語音模型,先把用戶煩到了

重點摘要

OpenAI 發布新一代語音模型 GPT-Live,採用全雙工架構,讓 ChatGPT Voice 能同時聽與說,實現更自然的對話互動。然而,首批用戶批評其頻繁的短回應(如「嗯嗯」)反而造成干擾,且部分功能如螢幕共享暫時無法使用。

站內 AI 整理稿

OpenAI 在 7 月 9 日凌晨的直播中,正式發表了新一代語音模型 GPT-Live,並宣布這款模型將開始驅動 ChatGPT 的語音功能。距離上一次 ChatGPT Voice 的世代更新——2024 年 5 月 GPT-4o 發表時展示的 Advanced Voice,已經過了兩年。然而,這項被寄予厚望的新功能,在首批用戶的反饋中卻出現了兩極化的評價,甚至有人直言「被煩到了」。GPT-Live 最核心的變革,在於引入了「全雙工」(full-duplex)架構。

過去的 AI 語音助手,無論是 ChatGPT、Gemini 還是其他主流產品,大多像一台反應靈敏的對講機:用戶說一句,模型回一句;模型說話時用戶可以打斷,但系統往往需要重新判斷、重新組織回答。這種模式雖然已經接近對話,卻始終不夠自然,不像真正的聊天。在真實的人類對話中,人們會停頓、猶豫、突然改口,也會在對方說話時補上一句「等等,不是這個意思」,甚至只是一聲「嗯嗯」或「我懂」就足夠了。過去 AI 語音助手最難處理的,正是這些細節。要理解 GPT-Live 的進步,必須先回顧 OpenAI 語音系統的演進。

最早的 ChatGPT Voice 採用的是「級聯語音系統」(cascaded voice system),由多個模型接力完成:先將用戶語音轉成文字,再讓大語言模型根據文字生成回答,最後將文字轉成語音。這套方案容易搭建,但語音中的語氣、停頓、情緒變化等大量資訊,在第一步轉文字時就會流失,而且多個模型串聯也導致延遲疊加,讓語音助手變得「聽一句、想一下、再念一句」。到了 GPT-4o 之後的 Advanced Voice,OpenAI 開始改用原生音頻模型直接處理聲音,保留了更多音頻細節,延遲也更低,用戶可以更自然地打斷。

但 Advanced Voice 仍然屬於「回合制語音模型」(turn-based voice model),它必須先判斷用戶是否說完,才能決定是否開始回答。用戶停頓一秒,可能是說完了,也可能只是還在想;這個邊界判斷一旦出錯,對話就會變得彆扭。GPT-Live 透過兩項架構上的改進來解決這個問題。第一項是將語音對話從「輪流發言」推進到全雙工模式。模型可以持續聽、持續判斷、持續生成語音,而不只是在用戶結束發言後才進入回答狀態。根據官方介紹,GPT-Live 每秒可以做出多次交互決策:是繼續說話、繼續傾聽、暫停、打斷對方的話語,還是調用某個工具。

這使得它能夠在用戶說話的過程中,適時給出「嗯」「哦」這類情緒性短回應,就像人與人煲電話粥時的自然互動。第二項改進則是語音交互層與後台智能之間的分工。GPT-Live 更像 ChatGPT 的實時語音交互層,負責聽、說、等待、打斷、維持對話節奏;遇到需要搜索、推理或複雜任務的問題時,它可以把任務交給背後的更強模型(例如 GPT-5.5)處理。這樣一來,語音模型不必在每一句話裡都承擔全部智能壓力,簡單問題可以快速回答,複雜問題則調用更高強度的推理。值得注意的是,GPT-Live 並非全雙工語音架構的先行者。

此前 Kyutai 的 Moshi、英偉達的 PersonaPlex,以及谷歌的 Gemini Live,都已經在類似方向上探索。GPT-Live 的獨特之處,在於將這套「邊聽邊說」的能力帶進了 ChatGPT 這個主流入口,並能與 OpenAI 的其他模型協同運作。OpenAI 在官方評估中,使用了自訂的測試標準,包含對中斷、等待、短反饋、背景噪音、語音理解等能力的測試。在 5 到 10 分鐘的匹配語音對話中,評測者明顯更偏好 GPT-Live-1 和 GPT-Live-1 mini。

此外,OpenAI 也宣稱 GPT-Live-1 在 GPQA(科學推理)、BrowseComp(網頁搜索)以及內部版本的 τ³-Voice Telecom(多輪電信客服)等任務上都超過了 Advanced Voice Mode。不過,這部分的成績很可能來自於 GPT-Live 遇到複雜任務時會調用後台更強的模型,而非語音交互層本身突然變得更聰明。網友對 GPT-Live 的評價呈現兩極分化。一部分人認為,這次更新潛力巨大,尤其是在程式編寫等場景中,可能改變許多人的使用習慣。但也有不少用戶直言,GPT-Live 那種頻頻以「嗯嗯」「明白」等短回應打斷對話的方式,反而令人感到厭煩。

此外,GPT-Live 在實時語音模式下無法查詢到 ChatGPT 的記憶,也無法在攝像頭模式與螢幕共享功能下使用。根據官方文件,GPT-Live 已向全球所有 iOS、Android 系統的 ChatGPT 用戶以及 ChatGPT.com 的用戶開放。對於 Go、Plus 和 Pro 版用戶,GPT-Live-1 將成為驅動 ChatGPT Voice 的默認模型;免費用戶則默認使用 GPT-Live-1 mini。在推出初期,GPT-Live 不支援語音通話、視頻通話或螢幕共享功能,官方表示正努力盡快添加這些功能,用戶仍可切換回舊版語音模式來使用上述功能。

OpenAI 透露,每週已有超過 1.5 億人透過 Voice 和 Dictation 與 ChatGPT 對話。這些用戶最常做的事情包括:騰不出手時問日常問題、練習外語、講睡前故事、通勤路上聊天。這些場景雖然不算炫酷,卻是語音功能最真實的使用情境。GPT-Live 的升級方向被拆解為四個面向:更自然的對話、更聰明的回答、更好的聆聽,以及可視化回答。更自然的對話,對應用戶可以中途插話、停下來想一想、要求 ChatGPT 放慢語速;模型會用短回應表示自己在聽,而不是等到用戶說完才突然開始輸出一大段回答。

更聰明的回答,則允許用戶選擇不同推理強度:Instant 用於快速回答,Medium 和 High 則留給需要更多思考的問題。更好的聆聽,則強調用戶停頓時模型應該等待,而不是急著插話;背景有噪音時,模型要更專注於用戶本人的聲音。最後,可視化回答讓 ChatGPT 可以在語音對話中展示天氣、股票、體育等視覺卡片,並繼續支援搜索、記憶、圖片和文件上傳。從首批用戶的反饋來看,GPT-Live 雖然在技術上實現了更流暢的對話,卻也暴露了「短反饋過多」的新問題。語音助手與文字助手最大的不同在於,文字可以被忽略,可以慢慢讀,也可以隨時關掉;但聲音會直接闖入人的注意力。

如果模型接話太急、短反饋太多、判斷錯停頓,用戶感受到的就不是智能,而是煩人。GPT-Live 的真正考驗,或許不在於它能不能「多會說話」,而在於它能不能「學會閉嘴」。這次更新無疑具有價值,它讓 AI 語音助手變得更順,也同時暴露了變順之後可能碰上的新問題。這些問題,很可能也是其他 AI 語音助手未來(或已經存在)的挑戰。對於技術的發展,或許我們需要多一點耐心。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前