全雙工實時語音上線,ChatGPT徹底告別“對講機”時代
重點摘要
AI資訊AI新閒資訊正文全雙工實時語音上線,ChatGPT徹底告別“對講機”時代發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘OpenAI 近日正式向全球用戶推出基於 GPT-Live 架構的全新 ChatGPT 語音體驗。這不僅是語音技術路線的一次重要更迭,更標誌著 AI 語音助手正從傳統的“對講機式”交互,全面轉向更接近真人對話的全雙工模式。
OpenAI 近日正式向全球用戶推出基於 GPT-Live 架構的全新 ChatGPT 語音體驗。這項更新不僅是語音技術路線的一次重要更迭,更標誌著 AI 語音助手正從傳統的「對講機式」交互,全面轉向更接近真人對話的全雙工模式。對於長期使用 ChatGPT 語音功能的用戶來說,這無疑是一次顛覆性的升級,意味著與 AI 對話的節奏與流暢度將徹底改寫。在此之前,無論是 ChatGPT 過往的語音模式,還是市面上多數語音助手,普遍採用的是半雙工架構——也就是類似對講機的通訊方式:使用者必須先按下按鈕、說完一整句話,然後放開按鈕等待 AI 回應。
這樣的過程雖然比純文字輸入直覺,但依然充滿了機械感與停頓落差。使用者經常會因為不確定何時該停止發言,或是感受到 AI 回應前明顯的空白而中斷對話的自然流暢性。GPT-Live 架構的核心進步,在於徹底擺脫了這類傳統語音系統的束縛。新架構允許模型在「說話、傾聽和思考」之間實現真正的並行處理。這意味著當用戶正在說話時,ChatGPT 不再需要等到你完全講完才能回應,而是能夠即時捕捉你的語氣、語速與停頓節奏,適時地給出諸如「嗯哼」或「okay」這類自然的輕聲反饋。這種互動方式,幾乎與人類日常對話中的非語言訊號一模一樣。
如果用戶在對話過程中需要思考時間,模型也會識趣地保持安靜,不會因為短暫的沉默而強行插入回應。整個交互過程不再有生硬的打斷感,也不會有那種「對話才剛開始就被 AI 搶話」的窘迫。對於需要複雜討論或深度溝通的使用場景,例如規劃行程、討論策略或進行腦力激盪,全雙工模式帶來的沉浸感與人性化體驗,是過去任何語音介面都難以比擬的。在技術底層,GPT-Live 架構引入了更為強大的推理能力。目前,該語音模式在後臺默認調用 GPT-5 模型,這意味著無論是在即時聯網搜尋,還是處理深層推理與複雜任務規劃時,ChatGPT 都能維持長時間的上下文追蹤。
用戶可以像與真人朋友對話一樣,隨時中斷、補充或修正自己的發言,而 AI 依然能準確掌握對話脈絡,不會因為被打斷而迷失方向。舉例來說,若使用者正在討論一個複雜的商業提案,先提出一個問題,又在尚未說完時突然想起另一個更重要的細節而插話修正,GPT-Live 會自動辨識出哪些話是重點、哪些是補充,並根據語意調整回應的方向。這種動態理解能力,仰賴於 GPT-5 強化的即時推理與記憶機制,而非單純的語音辨識優化。此外,全雙工模式也大幅提升了語音互動的自然度。過去用戶使用語音助理時,往往需要刻意放慢語速、說出完整的句子,甚至避免使用「呃…」、「那個…」之類的填充詞,否則會造成誤判或回應異常。
但在 GPT-Live 架構下,這些日常對話中常見的猶豫、換氣、修正都變成了可以被 AI 理解與回應的訊號,而不是需要排除的雜訊。OpenAI 在部署這項技術時,也特別注重延遲與即時性的平衡。據了解,GPT-Live 的語音響應時間已經壓縮到接近人類對話的自然延遲範圍,用戶幾乎感覺不到 AI 在「思考」的空檔。這種低延遲加上並行處理能力,讓整個交流過程宛如與真人進行面對面交談,而非操作一台機器。回顧 2024 年推出的 Advanced Voice Mode,當時雖已大幅提升語音品質與情緒表達,但本質上仍屬於改良版的半雙工信號模式——使用者說完一段話後,AI 才開始處理並回覆。
GPT-Live 則從根本改變了通訊模型,讓 AI 能夠同時處理聽、說、想三個環節。這項技術的成熟,也反映出 OpenAI 在語音 AI 領域從「模仿對話」到「參與對話」的關鍵轉折。對於一般消費者而言,這項更新的直觀感受可能只是「ChatGPT 變得更會聊天了」,但從產業角度看,全雙工即時語音的普遍化,代表 AI 語音助手不再只是被動的工具,而是具備主動理解與自然社交能力的夥伴。未來在教育、客服、心理諮商、娛樂等需要長時間語音互動的領域,應用場景將更加寬廣。目前 GPT-Live 語音功能已向全球用戶逐步開放,用戶只需更新 ChatGPT 應用程式,即可在支援的裝置上體驗全新對話模式。
OpenAI 同時強調,未來將持續優化多語系支援與特殊情境下的語音辨識準確率,讓更多非英語使用者也能享受到同等的自然互動品質。從「對講機」到「真人對話」,ChatGPT 的語音進化不僅是技術層面的躍進,更是一扇通往更人性化人機互動的大門。隨著全雙工模式正式上線,AI 語音助手終於告別了那個需要等待、被打斷、被誤解的時代,迎來了真正可以「邊聽邊想邊說」的新紀元。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。