微軟自研雙模型MAI-Image-2.5-Pro與MAI-Voice-2-Flash發佈:不蒸餾第三方,已落地Bing和PowerPoint
重點摘要
AI資訊AI新閒資訊正文微軟自研雙模型MAI-Image-2.5-Pro與MAI-Voice-2-Flash發佈:不蒸餾第三方,已落地Bing和PowerPoint發布於AI新閒資訊時間 :Jul 24, 2026閱讀 :1分鐘微軟於 7 月 23 日宣佈推出兩款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已進入公開預覽階段。
微軟於7月23日正式宣布推出兩款自研AI模型——MAI-Image-2.5-Pro與MAI-Voice-2-Flash,兩者均已進入公開預覽階段。這兩款模型分別對應高品質圖像生成與高併發語音互動場景,微軟特別強調,模型的訓練數據經過完整清理與可追溯處理,並未依賴第三方模型蒸餾技術,從底層設計開始就專為微軟生態系內的產品用戶服務。MAI-Image-2.5-Pro 是微軟目前精度最高的圖像生成模型,專注於主視覺圖片生成、細節編輯以及圖像內文字渲染等高要求應用場景,並支援自然語言編輯指令。
該模型已在 Bing Image Creator 中擔任預設圖像生成模型,同時也在 PowerPoint 中提供圖像對圖像編輯功能。與 GPT-Image-2 相比,MAI-Image-2.5-Pro 可將 GPU 成本最多降低 84%,展現出顯著的成本效益。在實際部署表現上,該模型在 OneDrive 中啟用後,相關場景的保存成功率提升了 26%,P95 延遲下降約 25%,中等負載下的生產環境效率提升 2.5 倍。定價方面,文本輸入部分每百萬 Token 收費 5 美元,圖像輸出部分每百萬 Token 收費 106 美元,為企業用戶提供透明且競爭力的計價結構。
另一款模型 MAI-Voice-2-Flash 則是針對高頻語音應用所設計,相較於上一代產品,回應速度提升約 2 倍,成本降低 32%,特別適合客服中心、語音助手等需要快速回應的場景。該模型已整合至 Dynamics 365 Contact Center,並實際服務於 T-Mobile、EasyJet 等國際客戶,GPU 成本最高可降低 89%。微軟進一步將 MAI-Voice-2-Flash 集成至 Azure Voice Live 服務,讓開發者能夠直接建構語音到語音互動的智慧型代理。同系列中還有一款 MAI-Transcribe-1.
5 模型,目前已應用於微軟醫療語音解決方案 Dragon Copilot。該模型被超過 17 萬名醫療服務提供者採用,上季度處理了 2,800 萬次患者問診記錄,支援 58 種語言,大多數語言的轉錄錯誤率相對下降 50%,大幅提升醫療記錄的準確性與效率。微軟也透露,下一代 GB200 計算集群已投入運行,將為 MAI 系列模型提供更強大的運算基礎,未來模型陣容將持續擴展。這次發布不僅展現微軟在自研AI上的技術實力,也凸顯其將模型直接落地於 Bing、PowerPoint、Azure 及 Dynamics 365 等核心產品的策略,進一步強化企業級AI應用的完整生態。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。