OpenAI深夜放出GPT-Live,ChatGPT終於像真人一樣說話

重點摘要
OpenAI 於 7 月 9 日深夜突然上線新一代語音模型 GPT-Live,大幅升級 ChatGPT 的語音對話功能。這款基於全雙工架構的模型讓 AI 不再只是簡單的一問一答,而是能同時聽與說,實現更像真人的對話節奏。當用戶停頓思考時,模型會耐心等待;需要插話時,也能自然回應,整體互動體驗變得輕鬆流暢。OpenAI 形容這是該公司迄今最智慧的語音模型。 GPT-Live 的核心技術突破在於架構設計。傳統語音系統採用級聯式或輪次式處理,分別面臨訊息損失與對話僵化的問題。
OpenAI 於 7 月 9 日深夜突然上線新一代語音模型 GPT-Live,大幅升級 ChatGPT 的語音對話功能。這款基於全雙工架構的模型讓 AI 不再只是簡單的一問一答,而是能同時聽與說,實現更像真人的對話節奏。當用戶停頓思考時,模型會耐心等待;需要插話時,也能自然回應,整體互動體驗變得輕鬆流暢。OpenAI 形容這是該公司迄今最智慧的語音模型。GPT-Live 的核心技術突破在於架構設計。傳統語音系統採用級聯式或輪次式處理,分別面臨訊息損失與對話僵化的問題。GPT-Live 則採用全雙工架構,能在生成回應的同時持續接收輸入,每秒鐘進行多次互動決策,包括是否開口、繼續傾聽、暫停或插話。
此外,OpenAI 將持續對話層與深度任務處理層分離,當用戶的提問需要搜尋、推理或複雜任務時,GPT-Live 會將任務委派給後端更先進的模型(目前為 GPT-5.5),同時維持對話流暢性。這項設計讓 GPT-Live 能持續接入最新模型與智能體,融合前沿智慧與自然互動。在產品規劃上,OpenAI 推出兩個版本:GPT-Live-1 與 GPT-Live-1 mini。GPT-Live-1 將作為 ChatGPT Go、Plus 和 Pro 用戶語音模式的預設模型,而 GPT-Live-1 mini 則提供給免費(Free)用戶。
即日起,全球 ChatGPT 用戶將逐步在 iOS、Android 以及 ChatGPT.com 上獲得這項更新。回顧語音 AI 的演進,OpenAI 指出先前的技術路線各有明顯取捨。最早期的級聯式系統(如最初的 ChatGPT Voice)由語音轉文字、語言模型與文字轉語音三階段串接完成,結構複雜且容易造成資訊衰減,回應也顯得生硬。後續登場的輪次式模型(如 ChatGPT Advanced Voice Mode)則將音訊處理整合在單一模型中,降低了延遲,但仍須等用戶說完才能回應,且系統往往依賴靜音偵測來判斷發言結束,導致用戶短暫思考或環境噪音容易觸發不當插話。
GPT-Live 透過兩項架構革新解決前述問題。首先是持續交互,全雙工架構讓模型能在輸出的同時持續處理輸入,實現自然來回對話,甚至支援實時翻譯。其次是深度任務委派機制,將即時對話與需要大量運算的後臺任務解耦,使模型在處理複雜查詢時仍能與用戶順暢交談。為了驗證 GPT-Live 的表現,OpenAI 建構了一套專注於對話愉悅感與流暢度的人類評估體系。在一對一對比測試中,進行 5 到 10 分鐘的對話後,無論是 GPT-Live-1 或 GPT-Live-1 mini,在整體偏好、輪次銜接、打斷情況、對話流暢度及自然程度等維度上,都顯著優於 Advanced Voice Mode。
此外,在科學推理評測 GPQA(生物、化學、物理)、智能體網頁搜尋評測 BrowseComp 以及電信客服任務評測 τ³-Voice Telecom 中,GPT-Live-1 的成績也明顯優於 Advanced Voice Mode。根據 OpenAI 數據,每週有超過 1.5 億人透過語音與聽寫等功能使用 ChatGPT。用戶常以語音模式獲得免持協助、練習外語、講睡前故事,或是在通勤時隨意閒聊。隨著 GPT-Live 上線,這些體驗將全面升級。新版 ChatGPT Voice 帶來更自然的對話節奏,用戶可以隨時打斷提問,也可以停頓整理思緒,甚至要求模型放慢語速。
模型會以「mhmm」、「got it」等細微回應讓用戶知道它正在傾聽。OpenAI 也針對 GPT-Live 重新製作了九種不同聲音。智慧程度方面,ChatGPT Voice 現在能調用最新前沿模型,在需要時提供更精準的回答。用戶可依需求選擇推理強度:Instant 適合快速回應,Medium 和 High 則適合希望模型多花時間思考的場景。傾聽能力也有明顯提升,當用戶需要思考時,ChatGPT 會安靜等待而不貿然插話,即使環境中存在車輛駛過或旁人交談等背景噪音,模型也能更專注於用戶的聲音。此外,語音對話中現在可以展示天氣、股票、體育等話題的視覺化卡片,讓部分資訊一目了然。
記憶、搜尋、圖片與檔案上傳等功能則持續支援。隨著全球逐步推送,用戶將在未來數日內陸續體驗到這項變革,ChatGPT Voice 變得更自然、更強大,也更適合日常生活中的多元場景。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。