OpenAI Releases GPT-Realtime-2.1 and GPT-Realtime-2.1-mini for Low-Latency Voice Agents in the API
重點摘要
OpenAI has released two new Realtime models in its API. They are named gpt-realtime-2.1 and gpt-realtime-2.1-mini. Both target low-latency voice and multimodal experiences.
OpenAI 近期在 API 中推出了兩款新的即時模型,分別命名為 gpt-realtime-2.1 與 gpt-realtime-2.1-mini。這兩款模型專為低延遲的語音與多模態應用場景設計,其中 mini 版本是此次更新的亮點:它是一款專注即時語音互動的輕量推理模型,定價與先前的 gpt-realtime-mini 完全相同,卻額外加入了推理能力,讓開發者能在保持低成本的前提下,為語音代理加入更聰明的回應邏輯。除了新模型本身,OpenAI 同時改善了所有即時語音模型的尾端延遲表現。p95 延遲(即 95% 百分位數回應時間)至少降低了 25%,這項進步主要歸功於更有效的快取機制。
快取不僅壓低了延遲,也直接降低了成本:當系統提示詞在長會話中被快取後,後續的輸入將以極優惠的價格計費。以 gpt-realtime-2.1-mini 為例,快取音訊輸入每百萬 tokens 僅收費 0.30 美元,相較之下未經快取的同類輸入收費為 10.00 美元,差距極為明顯。gpt-realtime-2.1-mini 的定位是「更快、更具成本效益」的選擇。它能透過即時連線同時處理音訊與文字輸入,並且採用單一模型架構完成語音辨識與生成,不需串接獨立的語音轉文字與文字轉語音系統。這種設計不僅降低延遲,也保留了語音中的細微語調與情感。
它支援工具使用(即函數呼叫),讓模型能在即時對話中先思考下一步、呼叫你的後端函式,再根據結果回應使用者。這樣的流程對多步驟語音任務特別有幫助。另一款新模型 gpt-realtime-2.1 則是較大型的版本,它更新了先前的 gpt-realtime-2,主要在英數字符號辨識、靜音與噪音處理、以及中斷行為上有所提升。此外,它也支援語音對語音的互動,並提供可設定的推理努力等級、指令遵循與工具使用。簡單來說,如果你的應用需要最強的即時推理、工具呼叫與指令遵循能力,就選擇 gpt-realtime-2.1;如果希望換取更快的速度與更低的成本,則該選用 gpt-realtime-2.1-mini。
這次新增的推理能力對語音代理的體驗提升至關重要。過去當模型在對話中呼叫工具時,往往會出現一段空白停頓,使用者常誤以為通話中斷而打斷流程,導致訊息混亂。有了推理與口語前導,模型可以在實際執行工具前先說出「我現在來查詢您的訂單」,然後在處理過程中持續對話,讓多步驟的語音任務保持連貫。推理努力的強度可以從 minimal、low、medium、high 到 xhigh 進行設定,預設為 low,以維持低延遲;只有面對較複雜的任務時才建議調高努力等級。在定價方面,OpenAI 公布的費率結構延續過往模式,以每百萬 tokens 為單位,依文字、音訊與圖片分別計費。gpt-realtime-2.
1-mini 的音訊輸出價格為 20.00 美元,而全尺寸的 gpt-realtime-2.1 則為 64.00 美元,兩者差距約三倍。若開發者願意在部分場景中犧牲一點能力,就能大幅降低成本,同時仍保有推理功能。文字輸入方面 mini 版本為 0.60 美元,與前一代 mini 相同;快取後更降至 0.06 美元。對於長時間的會話來說,快取帶來的節省相當可觀。具體使用場景也說明了這組模型的價值。以客戶支援為例,當使用者來電反應帳單問題時,mini 模型可以在低推理努力下快速分析問題,依序呼叫查詢帳戶與核對發票的工具,並且在每個步驟中對使用者口頭回報進度,讓對方隨時掌握狀況。
又例如預約改期,模型能夠精確捕捉日期字元,確認後再呼叫重新排程的函式,避免因猜測而執行錯誤的工具。在行動應用程式中若內建語音助理,mini 模型可以透過 WebRTC 接收麥克風串流,用一兩句簡短句子回答產品問題,低成本的特性也讓這類功能能在更大用戶規模下運作。對於需要當場記錄零件編號的技術人員,gpt-realtime-2.1 改良的英數辨識能力能準確捕捉如「8-3-5-7-1」這類編碼,並在動作前向使用者複述確認。在實作上,開發者可以透過瀏覽器 WebRTC 連線直接與 Realtime API 互動:伺服器先建立短暫有效的客戶端密鑰,瀏覽器再建立對等連線,將麥克風串流送交 API 處理。
OpenAI 建議初期將推理努力設為 low,僅在需要複雜推理時才調高,同時透過精簡的指令區分硬性規則與預設行為,並在更換模型前後進行評估測試。綜合來看,這次更新的主要優勢在於將推理能力下放至成本最低的 mini 等級,且定價未漲;同時 p95 延遲全面降低至少 25%,加上可靈活調整的推理努力,使語音對話更自然流暢。單一模型管線也避免了傳統串接架構的延遲與資訊流失。
不過,音訊 tokens 的費用仍難以直接換算為單次通話成本;更高的推理努力會同時增加延遲與輸出 tokens 數量;長時間會話若未適時修剪歷史內容,輸入成本將持續累積;而 mini 版本畢竟在部分能力上有所取捨,開發者需依實際需求選擇適合的模型。整體來說,OpenAI 的這次更新讓開發者能以更低的門檻打造具推理能力的即時語音代理,也為語音應用帶來更靈活的成本與效能平衡。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。