微軟測試其首款自研全雙工 AI 語音 MAI Realtime 模型:支持中文等 16 種語言、2 種風格

重點摘要
微軟正在測試其首款全雙工 AI 語音模型 MAI Realtime,支援中文等 16 種語言與兩種語音風格,可實現同步聆聽與回應。該模型目前僅開放給部分合作夥伴在 MAI Playground 進行測試,正式上線時間尚未公布。
微軟正在測試其首款自研原生實時語音模型 MAI Realtime,這款模型採用全雙工交互技術,能夠同時聆聽與回應,打破傳統「輪流發話」的對話模式。根據科技媒體 TestingCatalog 於 8 月 2 日發布的報導,該模型目前已在微軟的 MAI Playground 平台上開放給部分合作夥伴進行測試,但尚未公布正式上線 Microsoft Foundry 或擴展至 Copilot 語音功能的具體時間。MAI Realtime 最大的特色在於其雙向、全雙工的語音處理能力。
傳統的語音助理往往需要使用者說完一句話後,模型才能開始回應,而 MAI Realtime 則可以在使用者說話的同時,同步進行聆聽與輸出回應。這項技術仰賴精確的端點檢測,能夠辨識說話的開始、停頓與結束,並且在使用者插話時即時調整輸出內容,讓對話更接近人類自然交流的流暢度。在語言支援方面,MAI Realtime 涵蓋 16 種語言,包括英語、德語、西班牙語、法語、義大利語、葡萄牙語、日語、韓語、中文(繁體/簡體)、荷蘭語、印地語、印尼語、阿拉伯語、俄語、土耳其語、越南語及泰語。使用者可以手動指定對話語言,也可以啟用自動檢測功能,讓模型在對話過程中根據使用者輸入的語言即時切換,無需額外設定。
語音風格方面,目前測試階段提供兩種語音選項,分別命名為 Victoria 與 Grant。據了解,這兩種語音比微軟現有 Copilot 語音模式更加自然、擬真,能帶來更貼近真人對話的聆聽體驗。不過模型定位為純對話系統,並不支援唱歌或產生非語音音效,例如環境音或擬聲效果,用途上仍以語音互動為核心。在測試過程中,開發者或測試人員可以透過調試面板即時檢視模型的延遲數據、思考內容以及處理步驟。此外,微軟也計畫在測試權限擴大後,向平台用戶開放樣本分享功能,讓更多開發者得以觀摩或測試模型在不同情境下的表現。值得注意的是,微軟過去推出的 MAI 系列語音模型均為單向設計。
例如用於語音合成的 MAI-Voice-2 及其 Flash 版本,以及用於語音辨識的 MAI-Transcribe-1.5,都只能分別處理輸出或輸入任務。MAI Realtime 是微軟首款同時具備語音辨識與合成能力、並能即時雙向互動的原生實時模型,標誌著微軟在語音 AI 技術上邁入新的階段。目前外界尚不清楚 MAI Realtime 何時會正式對外發布,也無法確認它是否會整合到 Copilot 或其他微軟產品中。
不過從測試規模與合作夥伴的反饋來看,微軟顯然正在積極布局更自然的語音互動體驗,尤其是針對多語言環境與即時對話場景,MAI Realtime 的出現或將為未來語音助理的互動方式帶來顯著改變。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。