OpenAI 給機器裝上更靈的耳朵:兩款轉錄模型上線,Whisper 被甩開一倍差距
重點摘要
AI資訊AI新閒資訊正文OpenAI 給機器裝上更靈的耳朵:兩款轉錄模型上線,Whisper 被甩開一倍差距發布於AI新閒資訊時間 :Jul 29, 2026閱讀 :1分鐘OpenAI 在 7 月 29 日甩出了兩枚新的聽覺引擎。
# OpenAI 甩出兩款全新聽覺引擎:GPT-Live-Transcribe 與 GPT-Transcribe 正式上線,轉錄錯誤率砍半碾壓 Whisper
語音辨識的技術天花板,今天被 OpenAI 再次撞開了一道裂縫。7 月 29 日,OpenAI 正式透過 API 對外發布兩款全新的聽覺模型——**GPT-Live-Transcribe** 與 **GPT-Transcribe**。這兩款模型不再甘於只做「聲音轉文字」的搬運工,而是真正開始「聽懂」一句話背後隱藏的語境與意圖。無論是濃厚的口音、冷門的專業術語、複雜的數字序列,還是背景中嘈雜的人聲干擾,新模型都展現出遠超以往的抗干擾能力與語義理解水準。業界普遍認為,這是 OpenAI 在語音技術領域一次具有分水嶺意義的迭代,也讓此前被廣泛部署的 Whisper 模型瞬間顯得力不從心。 ## 兩款模型各司其職,實時與批量場景精準分工
根據 OpenAI 官方公布的技術文檔與 API 定價策略,兩款模型雖然共享底層的核心聽覺架構,但各自的產品定位與應用場景卻有明確區隔。**GPT-Live-Transcribe** 專為低延遲的即時場景而生。它的設計邏輯像極了一位緊貼著說話人同步落筆的專業速記員——幾乎在話音落下的同一瞬間,文字便已生成完畢。這使得它極其適合應用於現場會議即時字幕、直播語音轉寫、客服通話即時分析、課堂同步筆記等對時效性要求極高的場景。在收費方面,GPT-Live-Transcribe 的價格為每分鐘 0.017 美元,按當前匯率計算約合人民幣 0.12 元。
對於需要即時回饋的商業應用而言,這個定價在業界具備相當的競爭力。**GPT-Transcribe** 則選擇了另一條賽道。它將主要精力放在已錄製完成的音頻檔案與大批量任務處理上,採用異步轉錄的非即時工作模式。這意味著用戶可以先上傳完整的錄音檔案,由模型在後端進行運算,待處理完成後再統一回傳結果。這種架構在處理大量歷史錄音、廣播節目存檔、語音信箱內容分析、學術訪談逐字稿生成等場景時具有明顯的優勢。更重要的是,它的價格被壓到每分鐘僅 0.0045 美元,約合人民幣 0.03 元,僅為即時版本的四分之一左右。對於需要成批消化海量錄音的企業級用戶而言,這幾乎是將語音轉錄的邊際成本推向了一個全新的低點。
## 語境感知能力成為核心武器
兩款模型之所以能夠在性能上實現跳躍式提升,最關鍵的技術突破來自於它們對對話「上下文」的消化與理解能力。OpenAI 在技術報告中指出,傳統的語音辨識系統往往只能逐句處理聲音訊號,忽略了一句話在整個對話脈絡中的位置與功能,這使得它們遇到同音詞、多義詞、專業縮寫等情況時容易出錯。最新發布的模型引入了名為 **Context Aware ASR** 的基準測試,專門用以評估模型在特定語境下的理解水準。測試結果顯示,GPT-Transcribe 在沒有提供自由形式上下文資訊時,語義準確率為 41.6%;然而一旦接入自由形式的上下文提示,這個數字便攀升至 45.2%,提升幅度相當顯著。
換句話說,模型開始能夠「理解」同一個詞在不同對話語境中可能指向完全不同的含義——這一步跨越,是從單純的聲音模式匹配走向真正的語義理解的關鍵里程碑。舉例而言,在沒有上下文的情況下,模型可能將專業醫療對話中的「MI」(心肌梗塞的縮寫)誤辨識為「my」;但當它隱約感知到對話場景圍繞心臟科診斷展開時,便會自動校正這一判斷。這種能力的出現,使得語音轉錄不再只是機械的符號轉換,而開始具備初步的「聽懂」基礎。## 對決 Whisper:差距被拉到一倍以上
為了直觀展示新模型的技術實力,OpenAI 同步公布了大量的橫向對比數據。而作為對照組的,正是此前在開源社區與商業應用中廣受歡迎的 Whisper 模型(whisper-1)。結果顯示,差距比不少人預想的更為懸殊。在多語言能力的測試上,OpenAI 選用了 **Common Voice** 資料集,該資料集覆蓋了多達 22 種語言。在這一基準上,GPT-Transcribe 的轉錄錯誤率被壓低至 **19.27%**,而 Whisper 的表現則停留在 **40.37%**。也就是說,新模型幾乎將錯誤率砍掉了一半以上,差距超過一倍。
這不僅意味著模型辨識準確率的提升,更代表著在非英語語系——包括中文、西班牙語、阿拉伯語等語言上,使用者將獲得更為可靠的轉錄體驗。更令人驚艷的成績出現在真實世界錄音的測試中。這項測試覆蓋了九種語言,採集的音頻來源包括街頭訪問、電話錄音、多人會議、嘈雜餐廳內的對話等極具挑戰性的場景。在這種接近現實應用條件的測試下,GPT-Transcribe 將轉錄錯誤率進一步壓縮至 **8.98%**,而 Whisper 的表現則為 15.21%。兩者之間超過六個百分點的差距,在語音辨識領域堪稱一次質的飛躍。## 當機器真正能「聽清」帶噪環境下的專業術語
第二項數據之所以格外值得關注,原因在於它直擊了語音辨識領域長期以來的痛點:真實場景中的雜訊與專業術語的辨識難題。過去很長一段時間,無論是消費級產品還是企業級解決方案,語音轉錄在安靜環境、標準口音、日常詞彙的條件下表現尚可,但只要遇到背景嘈雜、說話人口音濃重、或對話內容涉及特定行業術語(如法律、醫學、工程技術等),錯誤率便會急遽攀升。這種「實驗室裡表現優異、現實場景頻頻翻車」的困境,一直制約著語音技術在嚴肅商業場景中的全面滲透。而 GPT-Transcribe 在九種語言真實錄音中交出 8.
98% 錯誤率的成績單,意味著一台能夠「聽清」律師庭審辯論中的精確法條引用、「聽懂」醫生與患者之間夾雜大量術語的病情交流、「聽準」工程師在施工現場嘈雜背景下口述的技術參數的機器,已經從實驗室走向了可部署的 API 服務。正如 OpenAI 在技術文檔中所暗示的:語音交互那扇一直半掩的門,似乎又被推開了一道不小的縫。## 語音交互的產業化拐點正在逼近
從更宏觀的產業視角來看,OpenAI 此次的新模型發布並不是一次孤立的事件。隨即在同一天,業界也傳出了另一則具有象徵意義的消息——安徽衛視播出了國內首部全流程 AI 製作的非遺劇集《桃花潭記》,該劇全長 20 集,每集約 10 分鐘,片尾直接標註了「AIGC導演」的字樣,標誌著 AI 生成內容正式登上省級衛視的播出體系。這與 OpenAI 的聽覺引擎上線,共同指向一個趨勢:從文字到影像再到聲音,AI 正在加速滲透人類資訊流通的每一個感官通道。語音轉錄作為人機交互的底層基礎設施,其性能的提升將直接影響語音助理、即時翻譯、聽障輔助工具、內容生產管線、呼叫中心智能化等諸多領域的使用者體驗。
當錯誤率從超過 40% 被壓到 10% 以內,許多過去因為準確度不足而無法規模化部署的應用場景,如今已經具備了商業可行性。## 定價策略釋放明確信號
值得注意的是,OpenAI 在定價策略上也釋放出相當清晰的市場信號。即時轉錄每分鐘 0.12 元人民幣、異步轉錄每分鐘 0.03 元人民幣的價格,對於中小型開發者與獨立團隊來說無疑是極具吸引力的入場門票。這與過去培養使用者習慣、搶佔市場認知、加速生態建設的思路高度吻合。考慮到 Whisper 雖然是開源模型但自行部署仍需承擔運算成本與維運負擔,對於缺乏 GPU 基礎設施的團隊而言,直接調用 OpenAI 的 API 反而可能更具成本效益。
當然,也有業內人士指出,目前兩款模型僅限於語音轉文字(ASR),尚未支援語者辨識(Speaker Diarization)、情緒偵測(Emotion Detection)等附加功能。若要滿足更複雜的語音分析需求,開發者可能需要在此基礎上疊加其他模型或進行二次開發。但作為一個純粹的轉錄引擎,它的技術基準已經被拉到了前所未有的高度。## 結語:聽覺引擎第一次學會了「聽懂」
從技術演進的脈絡來看,OpenAI 這次的動作或許可以被視為一次方向的確認:單純追求語音辨識硬體層面的指標提升,正在讓位於對語義理解與語境感知的追求。**「聽清」只是起點,「聽懂」才是終點。** 當模型開始理解同一個詞在不同對話中的不同重量,當它能夠在嘈雜的現場抓住那個最關鍵的專業術語而不被雜訊淹沒,語音交互技術才真正開始走向成熟。而 OpenAI 這次「裝上更靈的耳朵」的嘗試,顯然是在這條路上踩下了相當重的一腳油門。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。