OpenAI深夜放出GPT-Live,ChatGPT終於像真人一樣說話

2026年7月9日 10:42
OpenAI深夜放出GPT-Live,ChatGPT終於像真人一樣說話

重點摘要

OpenAI 於 7 月 9 日深夜突然上線新一代語音模型 GPT-Live,大幅升級 ChatGPT 的語音對話功能。這款基於全雙工架構的模型讓 AI 不再只是簡單的一問一答,而是能同時聽與說,實現更像真人的對話節奏。當用戶停頓思考時,模型會耐心等待;需要插話時,也能自然回應,整體互動體驗變得輕鬆流暢。OpenAI 形容這是該公司迄今最智慧的語音模型。 GPT-Live 的核心技術突破在於架構設計。傳統語音系統採用級聯式或輪次式處理,分別面臨訊息損失與對話僵化的問題。

站內 AI 整理稿

OpenAI 於 7 月 9 日深夜突然上線新一代語音模型 GPT-Live,大幅升級 ChatGPT 的語音對話功能。這款基於全雙工架構的模型讓 AI 不再只是簡單的一問一答,而是能同時聽與說,實現更像真人的對話節奏。當用戶停頓思考時,模型會耐心等待;需要插話時,也能自然回應,整體互動體驗變得輕鬆流暢。OpenAI 形容這是該公司迄今最智慧的語音模型。GPT-Live 的核心技術突破在於架構設計。傳統語音系統採用級聯式或輪次式處理,分別面臨訊息損失與對話僵化的問題。GPT-Live 則採用全雙工架構,能在生成回應的同時持續接收輸入,每秒鐘進行多次互動決策,包括是否開口、繼續傾聽、暫停或插話。

此外,OpenAI 將持續對話層與深度任務處理層分離,當用戶的提問需要搜尋、推理或複雜任務時,GPT-Live 會將任務委派給後端更先進的模型(目前為 GPT-5.5),同時維持對話流暢性。這項設計讓 GPT-Live 能持續接入最新模型與智能體,融合前沿智慧與自然互動。在產品規劃上,OpenAI 推出兩個版本:GPT-Live-1 與 GPT-Live-1 mini。GPT-Live-1 將作為 ChatGPT Go、Plus 和 Pro 用戶語音模式的預設模型,而 GPT-Live-1 mini 則提供給免費(Free)用戶。

即日起,全球 ChatGPT 用戶將逐步在 iOS、Android 以及 ChatGPT.com 上獲得這項更新。回顧語音 AI 的演進,OpenAI 指出先前的技術路線各有明顯取捨。最早期的級聯式系統(如最初的 ChatGPT Voice)由語音轉文字、語言模型與文字轉語音三階段串接完成,結構複雜且容易造成資訊衰減,回應也顯得生硬。後續登場的輪次式模型(如 ChatGPT Advanced Voice Mode)則將音訊處理整合在單一模型中,降低了延遲,但仍須等用戶說完才能回應,且系統往往依賴靜音偵測來判斷發言結束,導致用戶短暫思考或環境噪音容易觸發不當插話。

GPT-Live 透過兩項架構革新解決前述問題。首先是持續交互,全雙工架構讓模型能在輸出的同時持續處理輸入,實現自然來回對話,甚至支援實時翻譯。其次是深度任務委派機制,將即時對話與需要大量運算的後臺任務解耦,使模型在處理複雜查詢時仍能與用戶順暢交談。為了驗證 GPT-Live 的表現,OpenAI 建構了一套專注於對話愉悅感與流暢度的人類評估體系。在一對一對比測試中,進行 5 到 10 分鐘的對話後,無論是 GPT-Live-1 或 GPT-Live-1 mini,在整體偏好、輪次銜接、打斷情況、對話流暢度及自然程度等維度上,都顯著優於 Advanced Voice Mode。

此外,在科學推理評測 GPQA(生物、化學、物理)、智能體網頁搜尋評測 BrowseComp 以及電信客服任務評測 τ³-Voice Telecom 中,GPT-Live-1 的成績也明顯優於 Advanced Voice Mode。根據 OpenAI 數據,每週有超過 1.5 億人透過語音與聽寫等功能使用 ChatGPT。用戶常以語音模式獲得免持協助、練習外語、講睡前故事,或是在通勤時隨意閒聊。隨著 GPT-Live 上線,這些體驗將全面升級。新版 ChatGPT Voice 帶來更自然的對話節奏,用戶可以隨時打斷提問,也可以停頓整理思緒,甚至要求模型放慢語速。

模型會以「mhmm」、「got it」等細微回應讓用戶知道它正在傾聽。OpenAI 也針對 GPT-Live 重新製作了九種不同聲音。智慧程度方面,ChatGPT Voice 現在能調用最新前沿模型,在需要時提供更精準的回答。用戶可依需求選擇推理強度:Instant 適合快速回應,Medium 和 High 則適合希望模型多花時間思考的場景。傾聽能力也有明顯提升,當用戶需要思考時,ChatGPT 會安靜等待而不貿然插話,即使環境中存在車輛駛過或旁人交談等背景噪音,模型也能更專注於用戶的聲音。此外,語音對話中現在可以展示天氣、股票、體育等話題的視覺化卡片,讓部分資訊一目了然。

記憶、搜尋、圖片與檔案上傳等功能則持續支援。隨著全球逐步推送,用戶將在未來數日內陸續體驗到這項變革,ChatGPT Voice 變得更自然、更強大,也更適合日常生活中的多元場景。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

46 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前