OpenAI 引入兩種轉錄模型:低延遲、更好理解上下文

2026年7月28日 07:01
OpenAI 引入兩種轉錄模型:低延遲、更好理解上下文

重點摘要

首頁 > 智能時代>人工智能 OpenAI 引入兩種轉錄模型:低延遲、更好理解上下文 2026/7/29 7:01:33 來源:IT之家 作者:故淵 責編:故淵 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平臺發佈公告,宣佈推出 GPT-Live-Transcribe 和 GPT-Transcribe 兩種轉錄模型,並支持通過 API 方式調用。

站內 AI 整理稿

OpenAI 於 7 月 29 日在 X 平台正式宣布,推出兩款全新的語音轉錄模型,分別命名為 GPT-Live-Transcribe 與 GPT-Transcribe,並同步開放透過 API 進行調用。這兩款模型專為不同場景設計,主打低延遲即時轉錄與更精準的上下文理解能力,進一步強化 OpenAI 在語音辨識領域的技術布局。根據官方公告,GPT-Live-Transcribe 的核心優勢在於極低的延遲,能夠實現接近即時的音頻轉文字輸出,適合用於對話、直播、會議記錄等需要快速反應的應用情境。

而 GPT-Transcribe 則針對已完成音頻檔案與批次處理工作負載進行最佳化,屬於非同步轉錄方案,適合後製分析、大量資料處理等對準確度要求較高的場景。在調用費用方面,OpenAI 公布了明確的計價標準。GPT-Live-Transcribe 的轉錄費用為每分鐘 0.017 美元,以當前匯率換算約合新台幣 0.55 元或人民幣 0.12 元;GPT-Transcribe 的轉錄費用則為每分鐘 0.03 元人民幣(約合新台幣 0.13 元)。兩者均採用量計費,讓開發者與企業可根據需求選擇合適的模型。OpenAI 表示,相較於公司過去推出的轉錄模型,這兩款新模型在理解上下文方面有顯著提升。

無論是短語、數字、專業術語,還是帶有明顯背景噪音的語音,都能在各種口音與語言的真實世界音頻中提供更準確的轉錄結果。這意味著模型能夠更妥善地處理語音中的模糊與歧義,減少因環境干擾或特殊用詞導致的錯誤。在技術驗證方面,OpenAI 公布了一組基準測試結果。在 Context Aware ASR 評測中,GPT-Transcribe 展現了優異的語義準確率,尤其是在提供自由形式上下文的情況下,其表現遠優於無上下文支援的模型。此外,在 Common Voice 資料集的 22 種語言測試中,GPT-Transcribe 的轉錄錯誤率也達到較低水準,顯示其跨語言泛化能力值得信賴。

這兩款模型的推出,也反映出 OpenAI 持續拓展語音 AI 應用版圖的企圖心。過去,語音轉錄技術常因口音差異、背景噪音或專業術語而出現辨識瓶頸,而新模型透過上下文感知機制,能夠在轉錄過程中主動參考前後語意,進而提高整體準確度。這對於醫療、法律、客服、教育等需要高度精確文字記錄的產業尤為重要。由於 GPT-Live-Transcribe 與 GPT-Transcribe 均透過 API 提供,開發者可以輕易將其整合進現有服務中,例如即時字幕生成、語音助手、會議記錄自動化、影音內容後製等。

低延遲版本適合需要即時反饋的互動式應用,而非同步版本則可應用於大量歷史音檔的批次轉寫,兩者互補,涵蓋了從即時到離線的完整轉錄需求。值得注意的是,OpenAI 此次並未將這兩款模型單獨包裝成獨立產品,而是以 API 服務的形式開放,延續其過去對於開發者生態的開放策略。企業與開發者可以根據自身業務需求,選擇合適的模型並自訂參數,進一步降低成本並提升效率。市場分析人士指出,語音轉錄市場競爭激烈,包括 Google、Amazon、Microsoft 等巨頭均提供類似服務。OpenAI 此次推出的模型,憑藉其對上下文理解能力的強化,以及針對不同場景的細分方案,有望在特定應用領域取得優勢。

尤其是對於需要高準確度與低延遲的即時場景,GPT-Live-Transcribe 提供了一個新的選擇。整體而言,OpenAI 的 GPT-Live-Transcribe 與 GPT-Transcribe 不僅強化了語音轉文字的基礎能力,更透過模型分層與計價設計,讓開發者能夠更靈活地應對多元的使用情境。隨著語音互動技術日益普及,這類專業轉錄模型的推出,將加速各行業數位轉型的步伐,也為 AI 語音應用開啟更多可能性。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

5 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

7 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

11 小時前