流式轉錄 AI 新標杆:微軟 MAI-Transcribe-2-Streaming 登場,2.5% 詞錯誤率、0.13 秒延遲奪冠

2026年10月1日 07:04
流式轉錄 AI 新標杆:微軟 MAI-Transcribe-2-Streaming 登場,2.5% 詞錯誤率、0.13 秒延遲奪冠
站內 AI 整理稿

作者:故淵 責編:故淵 評論: 感謝網友 xxy171070 的線索投遞!10 月 2 日消息,微軟昨日(10 月 1 日)發佈公告,宣佈推出其首個實時流式語音轉寫模型 MAI‑Transcribe‑2‑Streaming,可在講話進行時持續輸出文字,覆蓋 60 種語言,並支持自動語言檢測。費用方面,MAI‑Transcribe‑2‑Streaming 模型目前處於優惠階段,價格為每小時 0.54 美元(注:現匯率約合 3.6 元人民幣),約合每 1,000 分鐘 9 美元(現匯率約合 60.

5 元人民幣),開發者可以通過 Microsoft Foundry、MAI Playground、OpenRouter 等渠道體驗或接入。注,微軟此前已推出非流式的 MAI‑Transcribe‑2,在 Azure Speech 公共預覽階段的價格為每小時 0.10 美元(現匯率約合 0.67 元人民幣)。流式“Streaming”是實時返回相關結果,適合實時對話和字幕;而非流式是處理完成後一次性返回,適合錄音文件、會議記錄和臨床文書等完整轉寫任務。

延遲方面,MAI-Transcribe-2-Streaming 會在接收到音頻後約 100 多毫秒內生成首批“部分文本”,隨後根據更多上下文持續修正,並在語句結束後快速提交穩定結果。微軟稱,在其實時評估中,文字最快可在語音出現後約 320 毫秒顯示;在 Artificial Analysis 的測試中,模型最終轉錄延遲為 0.13 秒,最終詞錯誤率為 2.50%,位列 28 個流式語音轉文字模型之首。在實際體驗方面,語音應用無需等到用戶說完一句話,就可以提前理解意圖、啟動推理或調用工具。例如,客服智能體可以在來電者尚未說完時開始識別問題,實時字幕系統也能更接近“所說即所見”的體驗。

功能方面,MAI-Transcribe-2-Streaming 支持 60 種語言,並具備自動、連續的語言檢測能力。用戶無需在會話開始前手動指定語言,系統可以根據語音內容識別語言變化。跑分方面,在 Artificial Analysis 於 9 月 28 日公佈的流式語音轉文字排行榜中,MAI-Transcribe-2-Streaming 的最終詞錯誤率為 2.50%,低於 Grok Voice Transcribe 2.0 Streaming 的 2.73% 和 ElevenLabs Scribe v2 Realtime 的 3.59%。

微軟同時強調,該模型在最終轉錄和首次部分轉錄兩個指標上均排名第一。相關閱讀:《微軟最強轉錄 AI 模型:MAI-Transcribe-2 登場,60 語種平均詞錯誤率 5.

2%》 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:微軟,AI報告稱微軟 Copilot 承包商可完整查看用戶上傳的照片、AI 提示詞等外媒稱微軟整合 Copilot 品牌加劇混亂,引發用戶困惑生效約 6 個月後,微軟 Copilot Discord 頻道不再屏蔽 Microslop 關鍵詞微軟發佈 Ink Canvas:數字畫布承載用戶靈感,AI 降低表達門檻微軟高管內部表述曝光,稱訓練 AI 是“人類歷史上最大規模勞動竊取”微軟 Azure CTO 驚歎 AI 能力:30 分鐘跨平臺移植基礎功能、2 天實現約 90% 功能

Related

相關文章

IT之家模型更新

OpenAI 稱其遭遇有組織蒸餾,將矛頭指向月之暗面

作者:潞源 責編:潞源 評論: 感謝網友 愚公騎馬、咩咩洋 的線索投遞!10 月 1 日消息,當地時間 9 月 30 日,OpenAI 在官網發文,稱其近期遭遇一場有組織的蒸餾活動。OpenAI 在文中表示,該活動最初始於 7 月第一週,符合對抗式蒸餾(adversarial distillation)之特徵,即系統性未經授權地利用某模型輸出或推理過程,幫助訓練、復現或改進另一模型。

8 小時前
Hugging Face Blog模型更新

推出 Olmo-core 3:為大型 MoE 打造的開放、可擴展訓練基礎架構

今日我們正式釋出 Olmo-core 3,這是我們大型語言模型開發框架的重大升級,核心亮在於重新設計的開放式混合專家(MoE)訓練系統。Olmo-core 3 旨在將 MoE 訓練規模擴展至兆級參數,同時維持運算效率。該系統是下一代 Olmo 的核心基礎之一,亦體現我們持續開放每款新模型背後工具與訓練基礎架構的承諾。

11 小時前
MarkTechPost AI模型更新

NVIDIA 發布 Kumo Tabular:開放表格基礎模型,單次前向傳播即可預測新資料列

NVIDIA 推出 Kumo Tabular,這是一系列用於分類與回歸任務的新型表格基礎模型(TFM)。若您曾接觸過 TabPFN 或 TabICL,對此架構應不陌生。該模型以已標記的資料列作為上下文,並在單次前向傳播中預測新資料列,無需訓練、無需超參數調整,也無需特徵工程。Kumo Tabular 提供 Small、Medium 與 Large 三種版本,參數量約從 2,800 萬至 2.15 億不等,並透過 NVIDIA 開源的 structured-data-models(SDM)函式庫運行。此模型可直接部署,其權重採用 OpenMDW-1.1 授權,允許商業使用;SDM 程式碼則以 Apache-2.0 授權發布,需搭配 Python 3.11 以上版本與 PyTorch 2.7 以上版本,範例程式以 CUDA GPU 為目標環境。SDM 函式庫的附加價值在於,它是一個專為結構化資料設計的 GPU 原生函式庫。

19 小時前
MarkTechPost AI模型更新

Perplexity 發布 pplx-embed-v2-context-9b-preview:可檢索答案及其佐證的語境嵌入模型

Perplexity Research 與 turbopuffer 合作推出 pplx-embed-v2-context-9b-preview,這是一款專為 RAG 管線設計的語境嵌入模型。每個區塊在嵌入時都會將完整文件納入考量。真正的變革在於訓練信號:模型學習檢索答案以及驗證答案所需的上下文,而非僅擷取單一「黃金段落」。 這款模型是否可部署?可以,作為自架預覽版。權重已以 MIT 授權發布於 Hugging Face。載入時需使用 transformers>=5.4.0 並設定 trust_remote_code=True。目前尚未整合至 Perplexity API。模型卡特別註明,權重與介面可能在不提供向後相容性的情況下變更。 為什麼黃金段落不夠好?RAG 系統會將長文件分割成多個區塊。但某個區塊往往依賴於文件中其他地方定義的實體、標題或概念。語境模型正是為瞭解決此問題而設計。

22 小時前
鈦媒體模型更新

個人Agent,人邁向硅基的第一步?

字母AI2026.09.30 19:17 · 來自北京全文5353字00:00 / 15:05信奉硬件為王的蘋果,天要塌了?文 | 字母AI9月初,Meta的Muse上線,不到兩週登上美國App Store免費榜首,Sensor Tower估算截至9月24日累計下載量超過340萬次。

1 天前