MarkTechPost AI生成式AI

OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5

2026年7月8日 18:08

重點摘要

Today, OpenAI released GPT-Live. It is a new generation of voice models. GPT-Live now powers the ChatGPT Voice experience. The stated goal is natural, real-time conversation with AI.

站內 AI 整理稿

OpenAI 今日正式推出全新一代語音模型 GPT-Live,並同步將其整合進 ChatGPT 的語音體驗中。這套模型家族的核心理念是讓使用者與 AI 之間的對話更接近真實人際互動,能夠實現自然、即時的交流。首批上市的兩個版本分別為 GPT-Live-1 與 GPT-Live-1 mini,即日起向全球 ChatGPT 用戶開放。值得注意的是,GPT-Live 採用全雙工架構,能同時進行聆聽與發聲,並且在需要更複雜的推理或搜尋時,會將任務委派給後端的 GPT-5.5 處理,確保對話不會因深度計算而中斷。GPT-Live 最大的特色在於其全雙工設計。

所謂全雙工,指的是模型可以在說話的同時持續接收使用者的聲音訊號。因此,在對話過程中,GPT-Live 能夠自然地發出「嗯哼」、「對啊」這類輕聲回饋,也能瞬間完成你來我往的快速應答,或者在使用者思考時保持安靜。這種架構讓互動節奏不再受限於「等你說完我才回應」的僵硬模式,而是更像兩個人在真實對話中的互動方式。當使用者提出的問題涉及即時網路搜尋、複雜邏輯推理,或需要執行多步驟代理任務時,GPT-Live 不會自己硬扛這些運算,而是立刻將任務委派給背後的前沿模型——目前這個背景模型是 GPT-5.5。在 GPT-5.

5 運算的同時,GPT-Live 會維持對話的流暢性,例如告訴使用者「稍等一下,我還在處理」或是隨口聊點別的,等結果準備好再適時插入回答。這樣的設計不僅提升了反應速度,也讓使用者感覺對話從未被打斷。回顧 OpenAI 過去在語音對話上的技術演進,更能看出 GPT-Live 的突破。最早期的級聯式語音系統(Cascaded)由三個模型串連而成:先由語音轉文字模型辨識使用者的話語,再由大型語言模型產出回應文字,最後透過文字轉語音模型朗讀出來。這種方式雖然讓人們首次能與語言模型對話,但資訊在不同模型間傳遞容易失真,而且整體延遲明顯,聽起來生硬不自然。

後來的回合制語音模型(Turn-based),例如 ChatGPT Advanced Voice Mode,將音訊處理整合到單一模型內,大幅降低延遲,對話也更順暢。然而,它們仍採取「一次說一輪」的運作方式,模型必須等待使用者停止說話才開始回應。判斷使用者是否說完的依據是靜默時間,這使得短暫停頓或環境噪音常常被誤判為對話結束,導致模型在不恰當的時機插話或搶話。GPT-Live 針對上述限制提出了兩項關鍵改變。第一,採用全雙工連續處理:模型在產生輸出的同時,也能持續接收與分析輸入,每秒可做出多次互動決策——決定是要繼續聆聽、出聲回饋、保持沉默、打斷使用者、或是呼叫工具。

這不僅讓即時翻譯成為可能,也讓對話節奏更加自然。第二,引入委派機制:將連續互動與深度推理兩項任務分離,當需要搜尋、推理或更複雜的代理能力時,GPT-Live 可以直接將任務交給 GPT-5.5 等後端模型,自己則繼續維持對話的流暢,同時也便於未來隨著新模型推出而無痛升級。OpenAI 為 GPT-Live 設計了全新的人類評估指標,專注於「對話愉悅度」與「互動流暢性」。評比員在五到十分鐘的配對對話中,直接比較 GPT-Live-1、GPT-Live-1 mini 與 Advanced Voice Mode。

結果顯示,受試者對 GPT-Live 系列的整體偏好、話輪轉換、打斷處理、對話流暢度以及互動自然度,都顯著優於 Advanced Voice Mode。在自動化基準測試上,GPT-Live-1 同樣表現出色:在 GPQA(專家級科學推理)與 BrowseComp(代理式網路搜尋)中大幅領先 Advanced Voice Mode;在專為電信支援設計的 τ³-Voice Telecom 評估中(採用內部變體),GPT-Live-1 也取得明顯優勢。OpenAI 團隊指出,τ³-Voice Telecom 評估使用了由最新推理模型驅動的自定義使用者模型進行測試。

GPT-Live 可應用於多種情境:例如免持操作,在煮菜或開車時語音詢問步驟或路線;語言練習,與模型進行來回對話並獲得溫和糾正;即時翻譯,利用全雙工時機在交談中同步轉譯;通勤時提出難題,讓 GPT-5.5 在背景搜尋,下車前獲得答案;客服工作流程,處理多輪電信支援任務;以及視覺查詢,說話時顯示天氣、股價或運動賽事等資訊卡片。即日起,全球 ChatGPT 用戶在點擊語音按鈕後,即可體驗由 GPT-Live 驅動的全新對話。OpenAI 表示,目前每週有超過 1.5 億人使用 ChatGPT 的語音與聽寫功能,這次更新將直接提升這群用戶的互動體驗。

不過,首波版本尚未支援影片、螢幕共享,也還不具備完整的多語言對應能力。API 的公開釋出則規劃在稍後進行。隨著 GPT-Live 的推出,語音 AI 對話正式進入全雙工時代,人機交流的界線變得更加模糊而自然。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

7 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

8 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

12 分鐘前