全天候科技生成式AI

OpenAI發佈語音模型GPT-Live

2026年7月8日 01:08
OpenAI發佈語音模型GPT-Live

重點摘要

OpenAI 宣布推出全新語音模型 GPT-Live,進一步擴展其在語音互動領域的技術布局。這款模型專注於即時語音處理與生成能力,能夠支援更自然的人機對話場景。目前官方尚未公布 GPT-Live 的詳細技術規格與應用細節,外界預期該模型將可能應用於客服、語音助理、即時翻譯等需要即時語音反應的服務中。

站內 AI 整理稿

OpenAI 近日正式宣布推出全新語音模型 GPT-Live,這款模型專注於即時語音處理與生成能力,標誌著該公司在語音互動領域的技術布局再進一步。根據官方說明,GPT-Live 能夠支援更自然的人機對話場景,在語音辨識、語意理解與語音合成之間實現更低延遲的反應,讓使用者與 AI 的語音互動更貼近真實對話節奏。目前 OpenAI 尚未公布 GPT-Live 的詳細技術規格,包含模型參數量、訓練資料來源、運算資源需求等具體資訊,也尚未揭露該模型是純語音模型還是多模態架構的一部分。

外界普遍認為,這款模型的推出是 OpenAI 從文字生成領域向語音互動延伸的關鍵一步,未來可能廣泛應用於客服中心、智慧語音助理、即時翻譯等需要即時語音反應的服務中。在客服領域,傳統的語音機器人往往因為延遲過高或語意理解不夠流暢,導致用戶體驗不佳。GPT-Live 的低延遲特性與自然語音生成能力,有機會大幅改善這些痛點,讓 AI 客服能夠在毫秒級時間內回應客戶提問,並根據對話上下文調整語氣與內容。對於金融、電信、零售等大量仰賴客服的產業而言,這項技術可能帶來效率與滿意度的雙重提升。語音助理市場同樣是 GPT-Live 的潛在應用場景。

目前市面上主流語音助理如 Amazon Alexa、Google Assistant、Apple Siri 等,大多採用傳統的語音辨識與自然語言處理管道,不同層級之間存在明顯延遲與資訊斷層。GPT-Live 若能整合即時語音處理與生成,將可能使語音助理的對話變得更連貫、更自然,甚至能夠處理複雜的多輪對話與突發語境轉折。即時翻譯也是外界高度關注的應用方向。GPT-Live 的即時語音生成能力,可以讓翻譯系統在語音輸入的同時即時輸出翻譯結果,減少傳統語音翻譯服務中常見的停頓與語法錯誤。對於跨國會議、旅遊導覽、國際客服等場景,這項技術有望顯著提升溝通效率。

從 OpenAI 的產品發展脈絡來看,GPT-Live 並非突然出現。該公司過去已推出 Whisper 語音辨識模型,以及 GPT-4o 的多模態語音模式,但兩者各有側重。Whisper 專注於將語音轉換為文字,GPT-4o 則能同時處理文字、圖像與語音,但在語音生成方面仍有改進空間。GPT-Live 的推出,補足了即時語音生成這一塊拼圖,使 OpenAI 的語音技術更加完整。然而,即時語音處理與生成在技術上存在不小挑戰。語音訊號的即時擷取、噪音抑制、語意分割、以及生成語音的自然度與情感表達,都需要極高的運算效率與模型精度。

GPT-Live 能否在實際應用中達到穩定且低成本的表現,仍有待後續實際測試與用戶反饋。此外,語音互動涉及隱私與安全問題,OpenAI 是否會針對語音資料採取額外的保護措施,也將影響企業與消費者對這款模型的採用意願。業界分析指出,OpenAI 持續加碼語音技術,背後反映的是多模態 AI 的發展趨勢。文字、語音、圖像、影片等不同資訊形式的融合,被視為下一代 AI 應用突破的關鍵。GPT-Live 作為語音模塊的最新代表,未來可能與 GPT 系列的文字模型、DALL·E 的圖像生成模型進一步整合,打造出能夠同時聽、說、看、寫的通用 AI 系統。

競爭對手方面,Google 早已推出多語種語音模型與即時翻譯服務,微軟則藉由 Azure AI 語音服務提供類似功能,而新創公司如 ElevenLabs 也在語音合成領域取得進展。OpenAI 的 GPT-Live 能否在品質與成本上取得優勢,將決定其市場地位。值得注意的是,OpenAI 擁有強大的用戶基礎與品牌信任度,若能迅速將 GPT-Live 整合至 ChatGPT 或其他產品線,將有助於快速累積實際應用數據並持續優化模型。官方表示,更多關於 GPT-Live 的具體資訊與未來應用案例,預計將在後續陸續公開。這也意味著,目前外界對這款模型的諸多想像,仍需要官方進一步證實。

對於開發者與企業而言,等待 API 或試用版本的推出,才是評估 GPT-Live 實際價值的起點。整體而言,GPT-Live 的問世,不僅是 OpenAI 產品線的一次擴張,更象徵語音 AI 從「聽得懂」邁向「說得好」的新階段。當語音互動不再僵硬、延遲不再明顯,人機之間的自然對話將不再是科幻情節,而是正在發生的技術現實。未來幾個月內,隨著更多細節曝光,市場將能更清楚判斷這款模型是否足以改寫語音互動的遊戲規則。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

8 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前