IT之家模型更新

OpenAI 更新 2.1 系列 GPT Realtime AI 模型,p95 延遲至少降低 25%

2026年7月8日 14:24
OpenAI 更新 2.1 系列 GPT Realtime AI 模型,p95 延遲至少降低 25%

重點摘要

首頁 > 智能時代>人工智能 OpenAI 更新 2.1 系列 GPT Realtime AI 模型,p95 延遲至少降低 25% 2026/7/8 14:24:13 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 8 日消息,OpenAI 昨日(7 月 7 日)發佈公告,宣佈在其 API 調用中,新增 gpt-realtime-2.1 和 gpt-realtime-2.

站內 AI 整理稿

OpenAI 於 7 月 7 日正式發佈公告,在其 API 服務中新增了兩款 GPT Realtime 2.1 系列模型,分別為標準版與 mini 版。官方強調,這兩款模型在即時語音與多模態交互場景下的性能獲得顯著提升,其中最關鍵的 p95 延遲至少降低了 25%,為開發者帶來更流暢、低延遲的即時對話體驗。p95 延遲(Percentile 95 Delay)是衡量系統回應速度的常用指標,代表在百分之九十五的請求中,系統都能以比該數值更短的時間完成回應。

換句話說,p95 延遲越低,表示系統在絕大多數情況下都能維持高速反應,對於語音助手、即時翻譯、客服機器人等對時間敏感度極高的應用而言,這項指標的改善至關重要。OpenAI 此次宣稱 p95 延遲下降至少四分之一,意味著開發者可以期待更接近即時通話般的自然互動。這兩款新模型主要鎖定低延遲語音智能體與多模態交互場景,能夠同時處理文字、音頻與圖片輸入,並生成對應的回應。OpenAI 表示,透過優化內部緩存機制,Realtime 語音模型成功將 p95 延遲大幅縮減,同時維持模型原有的理解與生成能力。

這項改進尤其有助於需要短時間內多次往返 API 的應用,例如即時語音對話系統,能讓使用者的每句話幾乎無縫銜接,減少等待感。在定價方面,OpenAI 同時公布了這兩款模型的 API 調用費用,按每百萬 Tokens 計費。針對文字輸入,每百萬 Tokens 收費 4 美元;若使用緩存輸入則僅需 0.40 美元;文字輸出則為每百萬 Tokens 24 美元。音頻輸入的費用較高,每百萬 Tokens 為 32 美元,緩存輸入同樣為 0.40 美元,而音頻輸出則為每百萬 Tokens 64 美元。圖片輸入的費用定為每百萬 Tokens 5 美元,緩存輸入亦為 0.40 美元。

這套定價結構讓開發者可以根據實際使用模式選擇是否啟用緩存,以有效控制成本。值得注意的是,緩存輸入的價格極具競爭力,無論是文字、音頻還是圖片,緩存輸入均統一為每百萬 Tokens 0.40 美元。這對於大量重複查詢或常見請求的應用場景特別有利,開發者可以將頻繁出現的輸入內容快取起來,大幅降低每次調用的費用,同時還能享受延遲降低的好處。這兩款模型的推出,也顯示 OpenAI 持續在即時 AI 領域深化布局。過去的 GPT Realtime API 已經讓開發者能夠建立語音對話、即時轉錄等應用,而 2.1 系列的更新則進一步提升了效能與經濟性。

官方並未透露具體的技術細節,但可以合理推測,緩存機制的改進可能涉及模型內部對常見模式的前置處理,或是在推理路徑上進行了優化,從而減少每個請求所需的計算時間。對於正在開發即時客服機器人、語音助理、教育輔導工具或遊戲互動系統的團隊來說,這次更新提供了一個更即時且成本更可控的選擇。尤其是 p95 延遲的降低,能讓使用者體驗到幾乎無延遲的回應,這在過去往往需要更昂貴的專用硬體或自建模型才能達成。OpenAI 將這項能力整合進 API 中,降低了開發門檻。此外,多模態支援的價格也值得關注。

圖片輸入每百萬 Tokens 5 美元的定價,比起純文字高出些許,但仍在合理範圍內,適合需要分析圖表、照片或手寫內容的應用。音頻處理的價格雖然較高,但考慮到即時語音處理的複雜性,以及延遲的改善,對於語音類產品而言仍具吸引力。整體而言,GPT Realtime 2.1 系列模型的推出,是 OpenAI 在即時 AI 領域的一次重要迭代。透過降低 p95 延遲與優化緩存定價,該公司不僅提升了技術表現,也回應了開發者對成本與速度的雙重需求。隨著即時語音與多模態應用日益普及,這類低延遲模型的市場需求只會持續增長。

未來,OpenAI 是否會進一步擴展 Realtime 模型的規模與功能,或推出更針對特定場景的版本,仍有待觀察。但從這次更新來看,即時 AI 的體驗正在逐步接近人類自然對話的流暢度,而開發者也能以更合理的成本打造出更具競爭力的產品。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前