微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換
重點摘要
AI資訊AI新閒資訊正文微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘科技媒體 TestingCatalog 報道,微軟正在測試其首款原生實時語音模型 MAI Realtime。
微軟首款原生全雙工語音模型「MAI Realtime」曝光,這款被視為打破傳統語音助手「對講機」模式的AI模型,正試圖讓機器與人之間的對話,從「輪流發言」進化為真正的「並行交流」。這項消息由科技媒體 TestingCatalog 率先披露,隨即引發業界高度關注,因為它不僅是微軟在語音AI領域的技術突破,更可能重新定義未來人機互動的樣貌。長期以來,無論是智慧音箱、手機語音助理還是客服機器人,使用者都必須遵循一種固定的對話節奏:先等AI說完、再開口回應,彼此之間存在明顯的「話語權」交接。這種輪次交替(turn-taking)模式雖然成熟,卻也成了人機對話自然度的最大瓶頸。
微軟此次曝光的 MAI Realtime 模型,則採用了雙向的全雙工(full-duplex)交互方式,意味著系統能在聆聽使用者說話的同時,即時產生並輸出語音回應,使用者無需等待AI把話講完就能打斷、插話,雙方的對話節奏將無限逼近真人互動。這項技術突破的核心,在於一套精密的端點檢測(endpointing)機制。該系統能夠即時辨識語音信號中的開始、停頓與結束,當偵測到使用者中途插話時,模型會立刻調整當下的輸出內容,在「聽」與「說」之間達成近乎零延遲的同步切換。
這也讓MAI Realtime成為微軟MAI語音模型家族中,首款具備雙向能力的原生模型——此前推出的 MAI-Voice-2 與 MAI-Transcribe-1.5,分別只能單向執行語音合成或語音識別任務,完全無法應付複雜的即時對話情境。在語言支援方面,MAI Realtime 展現了頗具野心的全球化布局。據悉,該模型目前支援包含中文、英語、日語、韓語、法語、德語、阿拉伯語在內的16種語言。不僅如此,系統還提供兩種語言操作模式:使用者可以主動指定對話語言,也可以開啟自動檢測功能,讓模型在對話過程中即時識別語種,並於中途無縫切換。
這項設計讓「中英夾雜」或「多語混用」的對話情境不再卡關,對跨國商務、旅行溝通與多語服務場景而言,具有相當實用的意義。語音風格方面,測試版本目前提供 Victoria 與 Grant 兩種聲音。根據實際體驗者的描述,這兩款聲音的自然度與情感表現力,都比現行 Copilot 語音模式要來得更為流暢生動。不過,這款模型的定位仍被嚴格限制在「對話系統」範疇,它不會唱歌,也無法生成咳嗽、笑聲等非語音音效。換句話說,MAI Realtime 追求的是在人類真實交談的語境中,做到高度擬真的即時互動,而非打造成一個全能的聲音表演工具。
值得一提的是,MAI Realtime 的測試版本還配備了「調試面板」,可供開發者與測試人員即時查看包括延遲數據、模型內部思考內容與處理步驟在內的技術細節。這樣的設計,不僅有助於合作夥伴深入理解模型運作機制,也為後續優化提供了關鍵的數據支撐。官方也透露,樣本分享功能可望在測試範圍擴大後,向更多平台的用戶開放。目前,微軟已經邀請部分合作夥伴,在自家的 MAI Playground 平台上進行內部測試。然而,關於何時正式上線 Azure AI Foundry、何時進一步整合至 Copilot 語音功能,官方並未給出明確時間表。
外界普遍認為,這款模型的商用化路徑仍處於早期階段,但其所揭示的技術方向,已經讓AI語音市場的競爭進入新的層次。將時間軸拉長來看,微軟這一連串動作,其實是其在AI戰略布局中的一環。從先前陸續推出的 MAI-Voice-2 與 MAI-Transcribe-1.5,到如今的 MAI Realtime,微軟正逐步搭建起從單向辨識、單向合成,到雙向即時對話的完整語音AI拼圖。而這背後,也反映出微軟執行長納德拉所強調的「多模型架構」思維,在自研模型之外,持續降低對單一AI實驗室的依賴,轉而走出一條更為自主的技術路線。與此同時,微軟在雲端運算與AI投資上的雙線布局也正同步推進。
據悉,微軟雲端年營收首度突破千億美元,而對 Anthropic 的投資更在單季貢獻了可觀收益。這些財務數據顯示,微軟正以「基礎設施+自研模型+多重夥伴」的組合拳,鞏固其在AI時代的關鍵地位。MAI Realtime 的出現,恰如其分地向業界傳遞出一個訊號:在語音互動領域,微軟不只滿足於追趕,而是準備好引領下一階段的變革。過去幾年間,語音AI的發展歷經了從「聽得懂」到「說得好」的演進,如今則正式邁向「談得來」的全新階段。當機器不再只是被動等待指令,而是能以極其自然的節奏與人類同步「對話」,這對智慧客服、虛擬助理、教育訓練、醫療照護等場景都將帶來深遠影響。
MAI Realtime 透過端點檢測、即時中斷回應與多語切換等技術,讓AI語音不再那麼像「機器」,而更像是真正能夠聆聽與回應的對話夥伴。當然,從內部測試到全面商用,MAI Realtime 仍有諸多挑戰需要克服。語音的即時性對運算資源與延遲控制的要求極高,如何在多語言環境下維持穩定表現,以及在開放場景中避免誤判或對話混亂,都是後續必然要面對的課題。但可以肯定的是,微軟已用這款產品向市場宣示,語音AI的「對講機時代」並非不可撼動,一個近乎真人同步交流的嶄新篇章,正在悄然展開。
Related
相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑
阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

Caviar 推出 24K 鍍金版 Meta 雷朋智能眼鏡 Odyssey,售價 6130 美元限量 24 副
Caviar 推出限量 24 副的 Odyssey 智能眼鏡,以 Meta Ray-Ban 為基礎,提供 24K 金與 925 銀裝飾版本,售價分別為 6130 美元與 6840 美元。該產品保留原版功能,並附帶鱷魚皮充電盒,展現奢華工藝。

Suno 平臺將為 AI 生成音樂添加隱水印,防止濫用現象發生
Suno 平台將為其AI生成的音樂加入隱藏式音頻水印與指紋識別技術,以便在其他平台上被上傳時可辨識來源。此舉是因應索尼、環球等音樂巨頭組成的聯盟,要求防止AI音樂濫用並禁止其進入全球排行榜。

AI寫的PR堆成山,Rust已忍無可忍
Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

內置 10TOPS INT8 算力:韓 Mobilint 推出 USB AI 加速器 MLD-R1
韓國NPU企業Mobilint推出USB外接AI加速器MLD-R1,內建REGULUS AI SoC,提供10TOPS INT8算力與4核Arm處理器。該裝置支援多種AI框架與作業系統,功耗僅3W,具備IP65防塵防水,適合邊緣運算場景。

AI 藝人“方桃子”帶貨美瞳廣告遭下架,聲稱“戴了一天都很舒服”
AI 虛擬藝人「方桃子」因推廣美瞳廣告,聲稱「戴了一天都很舒服」引發爭議,網友質疑其無真實眼睛無法體驗產品效果。該廣告目前已從抖音下架,可能涉及違反《中華人民共和國廣告法》中關於虛假或誤導性內容的規定。