OpenAI 引入兩種轉錄模型:低延遲、更好理解上下文

重點摘要
首頁 > 智能時代>人工智能 OpenAI 引入兩種轉錄模型:低延遲、更好理解上下文 2026/7/29 7:01:33 來源:IT之家 作者:故淵 責編:故淵 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平臺發佈公告,宣佈推出 GPT-Live-Transcribe 和 GPT-Transcribe 兩種轉錄模型,並支持通過 API 方式調用。
OpenAI 於 7 月 29 日在 X 平台正式宣布,推出兩款全新的語音轉錄模型,分別命名為 GPT-Live-Transcribe 與 GPT-Transcribe,並同步開放透過 API 進行調用。這兩款模型專為不同場景設計,主打低延遲即時轉錄與更精準的上下文理解能力,進一步強化 OpenAI 在語音辨識領域的技術布局。 根據官方公告,GPT-Live-Transcribe 的核心優勢在於極低的延遲,能夠實現接近即時的音頻轉文字輸出,適合用於對話、直播、會議記錄等需要快速反應的應用情境。而 GPT-Transcribe 則針對已完成音頻檔案與批次處理工作負載進行最佳化,屬於非同步轉錄方案,適合後製分析、大量資料處理等對準確度要求較高的場景。 在調用費用方面,OpenAI 公布了明確的計價標準。GPT-Live-Transcribe 的轉錄費用為每分鐘 0.017 美元,以當前匯率換算約合新台幣 0.55 元或人民幣 0.12 元;GPT-Transcribe 的轉錄費用則為每分鐘 0.03 元人民幣(約合新台幣 0.13 元)。兩者均採用量計費,讓開發者與企業可根據需求選擇合適的模型。 OpenAI 表示,相較於公司過去推出的轉錄模型,這兩款新模型在理解上下文方面有顯著提升。無論是短語、數字、專業術語,還是帶有明顯背景噪音的語音,都能在各種口音與語言的真實世界音頻中提供更準確的轉錄結果。這意味著模型能夠更妥善地處理語音中的模糊與歧義,減少因環境干擾或特殊用詞導致的錯誤。 在技術驗證方面,OpenAI 公布了一組基準測試結果。在 Context Aware ASR 評測中,GPT-Transcribe 展現了優異的語義準確率,尤其是在提供自由形式上下文的情況下,其表現遠優於無上下文支援的模型。此外,在 Common Voice 資料集的 22 種語言測試中,GPT-Transcribe 的轉錄錯誤率也達到較低水準,顯示其跨語言泛化能力值得信賴。 這兩款模型的推出,也反映出 OpenAI 持續拓展語音 AI 應用版圖的企圖心。過去,語音轉錄技術常因口音差異、背景噪音或專業術語而出現辨識瓶頸,而新模型透過上下文感知機制,能夠在轉錄過程中主動參考前後語意,進而提高整體準確度。這對於醫療、法律、客服、教育等需要高度精確文字記錄的產業尤為重要。 由於 GPT-Live-Transcribe 與 GPT-Transcribe 均透過 API 提供,開發者可以輕易將其整合進現有服務中,例如即時字幕生成、語音助手、會議記錄自動化、影音內容後製等。低延遲版本適合需要即時反饋的互動式應用,而非同步版本則可應用於大量歷史音檔的批次轉寫,兩者互補,涵蓋了從即時到離線的完整轉錄需求。 值得注意的是,OpenAI 此次並未將這兩款模型單獨包裝成獨立產品,而是以 API 服務的形式開放,延續其過去對於開發者生態的開放策略。企業與開發者可以根據自身業務需求,選擇合適的模型並自訂參數,進一步降低成本並提升效率。 市場分析人士指出,語音轉錄市場競爭激烈,包括 Google、Amazon、Microsoft 等巨頭均提供類似服務。OpenAI 此次推出的模型,憑藉其對上下文理解能力的強化,以及針對不同場景的細分方案,有望在特定應用領域取得優勢。尤其是對於需要高準確度與低延遲的即時場景,GPT-Live-Transcribe 提供了一個新的選擇。 整體而言,OpenAI 的 GPT-Live-Transcribe 與 GPT-Transcribe 不僅強化了語音轉文字的基礎能力,更透過模型分層與計價設計,讓開發者能夠更靈活地應對多元的使用情境。隨著語音互動技術日益普及,這類專業轉錄模型的推出,將加速各行業數位轉型的步伐,也為 AI 語音應用開啟更多可能性。
Related
相關文章

AI 推動軟件漏洞發現速度大幅加快,今年數量較去年預計翻番
首頁 > 智能時代>人工智能 AI 推動軟件漏洞發現速度大幅加快,今年數量較去年預計翻番 2026/7/29 7:57:15 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 29 日消息,據彭博社 28 日報道,AI 正在顯著加快軟件漏洞的發現速度。按照目前趨勢,2026 年在熱門科技產品中發現的安全漏洞數量,預計比 2025 年翻一番。
凍結百億大模型逆襲前沿旗艦
凍結百億大模型逆襲前沿旗艦。 研究人員利用 驗證記憶 ��� 實現零令牌複用。我們在 完整論文研究報告 能看到細節。九類推理任務 ⚡ 斬獲 180滿分。記憶檢索僅花費 1.4微秒 即可完成。六百萬超長上下文能在 單卡 運行。
LLM偽科學評測揭示配置漏洞
LLM偽科學評測揭示配置漏洞。 測試顯示 Grok Fast 給分 70-75 明顯偏高。官方施加 靜默補丁 ⚙️ 讓其一夜改口。同款模型在 API 與網頁端 ��� 表現撕裂。相關 論文原文詳細分析 呼籲建立 認知問責。
TRACE-Router實現任務級智能體路由
TRACE-Router實現任務級智能體路由。 任務級路由 ��� 徹底改寫了智能體調度邏輯。可在 論文詳情頁面入口 查看算法架構。系統依靠終局獎勵 🎯 綜合衡量 準確率 與延遲。在 Terminal-Bench 測試中成功降低 36% 延遲。

世界模型有觸覺了!50萬小時視頻,訓出首個隱式觸覺世界動作模型
這篇消息聚焦「世界模型有觸覺了!50萬小時視頻,訓出首個隱式觸覺世界動作模型」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
