OpenAI的新語音模型,先把用戶煩到了

2026年7月9日 08:59
OpenAI的新語音模型,先把用戶煩到了

重點摘要

OpenAI 推出了新一代語音模型 GPT-Live,採用全雙工架構讓語音對話更自然,能處理停頓與插話。不過首批用戶認為模型頻繁發出短反饋,反而造成干擾,體驗不如預期。

站內 AI 整理稿

OpenAI 在台灣時間週三凌晨的一場直播中,正式發表了新一代語音模型 GPT-Live,並宣布將以此驅動 ChatGPT 的語音功能。這是自 2024 年 5 月 GPT-4o 推出 Advanced Voice 模式以來,ChatGPT 語音功能間隔兩年後的最大幅度升級。然而,產品甫一上線,用戶的評價卻呈現明顯的兩極化:有人認為這是語音互動的重要突破,但也有不少人直言,這種「太會接話」的 AI 反而讓人感到厭煩。GPT-Live 最核心的技術變革,在於採用了全雙工(full-duplex)架構。

過往的 AI 語音助手,包括先前的 ChatGPT Voice,大多屬於半雙工或回合制模式:用戶說完一句,模型再回一句;模型講話時用戶雖然可以打斷,但系統往往需要重新判斷對話邊界,再重新組織回答。這種運作方式雖然已經接近對話,卻始終缺少真正聊天時那種自然流暢的節奏感。全雙工架構讓 GPT-Live 能夠同時保持「聽」與「說」的狀態。模型不再需要等到用戶完整結束一句話後才開始回應,而是可以持續感知對話現場,即時做出決策——是繼續傾聽、發出簡短的「嗯哼」表示理解、適時暫停等待對方把話說完,還是直接切入回答。

OpenAI 官方指出,GPT-Live 每秒可以進行多次交互決策,這使得模型能夠更準確地處理停頓、猶豫、改口,甚至是背景噪音等複雜情境。這項改進的背後,是一套更細膩的架構分工。GPT-Live 本身扮演的是實時語音交互層的角色,負責處理聽、說、等待、打斷等與對話節奏相關的任務。一旦遇到需要搜索、推理或複雜運算的問題,它會將任務轉交給背後更強大的語言模型處理,例如 GPT-5.5。換句話說,語音層不必在每一次對話中都承擔全部的「智能壓力」,簡單問題可以快速回應,複雜問題則調用更高強度的推理能力,從而在流暢度與回答品質之間取得平衡。OpenAI 表示,這項新功能即日起向全球用戶開放。

iOS、Android 以及 ChatGPT.com 的所有用戶均可使用;對於 ChatGPT Plus、Pro 以及 Go 用戶,GPT-Live-1 將成為 Voice 模式的預設模型;免費用戶則會收到 GPT-Live-1 mini 版本。值得注意的是,在推出初期,GPT-Live 尚不支援語音通話、視訊通話或螢幕共享功能,官方表示正在積極開發這些功能,用戶仍可切回舊版語音模式以使用上述功能。從官方公布的評測結果來看,OpenAI 針對中斷、等待、短反饋、背景噪音、語音理解等面向設計了一套新的評估標準。

在 5 到 10 分鐘的配對語音對話測試中,評測者明顯更偏好 GPT-Live-1 與 GPT-Live-1 mini。此外,在 GPQA(科學推理)、BrowseComp(網頁搜索)以及內部版本的 τ³-Voice Telecom(多輪電信客服)等任務上,GPT-Live-1 的表現也超越了 Advanced Voice Mode。不過,這項成績某種程度上反映的是整體「ChatGPT Voice 系統」的進步,因為 GPT-Live 在遇到高難度問題時會呼叫後台更強的模型來處理,單就語音交互層本身的智力提升程度,官方並未提供橫向對比其他競品的數據。首批使用者的回饋呈現鮮明對比。

一部分開發者與重度用戶認為,GPT-Live 的即時互動能力在程式輔助、語言學習、通勤聊天等場景極具潛力,可能改變人們與 AI 互動的習慣。然而,也有不少使用者指出,GPT-Live 過於頻繁的短反饋——例如在用戶講話的過程中不斷插入「嗯嗯」「我懂」「明白」等聲音——反而變成一種干擾。有人批評,在實時模式下無法查詢 ChatGPT 的記憶,且語音功能在啟用攝影機或螢幕共享時竟無法使用,顯得相當不便。這些批評恰恰點中了語音助手最核心的挑戰:聲音會直接闖入使用者的注意力,不同於文字可以被忽略、慢慢閱讀或隨時關閉,語音互動的節奏一旦失準,使用者感受到的不是智能,而是煩躁。

OpenAI 顯然也意識到這個問題,因此在 GPT-Live 的設計中特別強化了「更好的聆聽」能力:當用戶停頓時,模型應該等待而非急著插話;當用戶要求它先安靜聽,它必須保持沉默;在背景有車聲或旁人說話時,它也要更專注於用戶本人的聲音。根據 OpenAI 披露的數據,每週已有超過 1.5 億人透過 Voice 或 Dictation 與 ChatGPT 對話,使用場景涵蓋騰不出手時詢問日常問題、練習外語、講睡前故事,以及在通勤路上閒聊。這些看似平凡的需求,其實才是語音功能最真實的落地場景。

GPT-Live 這次的升級,與其說是追求炫酷的技術突破,不如說是 OpenAI 對 ChatGPT Voice 日常使用體驗的一次重要補課——讓語音助手學會何時開口,也學會何時閉嘴。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前