微軟測試其首款自研全雙工 AI 語音 MAI Realtime 模型:支持中文等 16 種語言、2 種風格

重點摘要
微軟正在測試其首款全雙工 AI 語音模型 MAI Realtime,支援中文等 16 種語言與兩種語音風格,可實現同步聆聽與回應。該模型目前僅開放給部分合作夥伴在 MAI Playground 進行測試,正式上線時間尚未公布。
微軟正在測試其首款自研原生實時語音模型 MAI Realtime,這款模型採用全雙工交互技術,能夠同時聆聽與回應,打破傳統「輪流發話」的對話模式。根據科技媒體 TestingCatalog 於 8 月 2 日發布的報導,該模型目前已在微軟的 MAI Playground 平台上開放給部分合作夥伴進行測試,但尚未公布正式上線 Microsoft Foundry 或擴展至 Copilot 語音功能的具體時間。 MAI Realtime 最大的特色在於其雙向、全雙工的語音處理能力。傳統的語音助理往往需要使用者說完一句話後,模型才能開始回應,而 MAI Realtime 則可以在使用者說話的同時,同步進行聆聽與輸出回應。這項技術仰賴精確的端點檢測,能夠辨識說話的開始、停頓與結束,並且在使用者插話時即時調整輸出內容,讓對話更接近人類自然交流的流暢度。 在語言支援方面,MAI Realtime 涵蓋 16 種語言,包括英語、德語、西班牙語、法語、義大利語、葡萄牙語、日語、韓語、中文(繁體/簡體)、荷蘭語、印地語、印尼語、阿拉伯語、俄語、土耳其語、越南語及泰語。使用者可以手動指定對話語言,也可以啟用自動檢測功能,讓模型在對話過程中根據使用者輸入的語言即時切換,無需額外設定。 語音風格方面,目前測試階段提供兩種語音選項,分別命名為 Victoria 與 Grant。據了解,這兩種語音比微軟現有 Copilot 語音模式更加自然、擬真,能帶來更貼近真人對話的聆聽體驗。不過模型定位為純對話系統,並不支援唱歌或產生非語音音效,例如環境音或擬聲效果,用途上仍以語音互動為核心。 在測試過程中,開發者或測試人員可以透過調試面板即時檢視模型的延遲數據、思考內容以及處理步驟。此外,微軟也計畫在測試權限擴大後,向平台用戶開放樣本分享功能,讓更多開發者得以觀摩或測試模型在不同情境下的表現。 值得注意的是,微軟過去推出的 MAI 系列語音模型均為單向設計。例如用於語音合成的 MAI-Voice-2 及其 Flash 版本,以及用於語音辨識的 MAI-Transcribe-1.5,都只能分別處理輸出或輸入任務。MAI Realtime 是微軟首款同時具備語音辨識與合成能力、並能即時雙向互動的原生實時模型,標誌著微軟在語音 AI 技術上邁入新的階段。 目前外界尚不清楚 MAI Realtime 何時會正式對外發布,也無法確認它是否會整合到 Copilot 或其他微軟產品中。不過從測試規模與合作夥伴的反饋來看,微軟顯然正在積極布局更自然的語音互動體驗,尤其是針對多語言環境與即時對話場景,MAI Realtime 的出現或將為未來語音助理的互動方式帶來顯著改變。
Related
相關文章
迭代檢索超越理想證據
迭代檢索超越理想證據。 研究者在多跳問答���中測試了多款模型。發現迭代檢索能帶來更顯著的性能提升。詳見多跳問答迭代檢索對比論文的內容。分段檢索能有效(≧▽≦)降低後續推理失誤。
人類世地球系統模型發佈
人類世地球系統模型發佈。 科研人員推出了人類世🌍基座模型。模型細節在人類世地球系統模型論文中披露。它是針對多維地表記錄���進行統一訓練。該模型能在一分鐘內(⊙_⊙)適配全新變量。
OpenAI數學突破引爭議
OpenAI數學突破引爭議。 OpenAI內部模型Astra���攻克了數學難題。數學證明可信討論(AI資訊)已展開。許多學者對該成果的復現性���提出質疑。這種機器證明使得科研機制發生轉變。
克勞德讀完整部海賊王
AI資訊日報|克勞德讀完整部海賊王 克勞德讀完整部海賊王。 三月流水線���逐頁看漫畫。項目在公開研究站點上線。它整理3073條伏筆證據。結局預測���已公開受檢。

從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會
這篇消息聚焦「從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Karpathy實測Opus 5:讀一段《魔戒》,10美元直出中土世界
這篇消息聚焦「Karpathy實測Opus 5:讀一段《魔戒》,10美元直出中土世界」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。