微軟最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 發佈:未蒸餾第三方產品,已落地 Bing 及 PowerPoint 等場景

重點摘要
好的,這是一篇根據您提供的資訊撰寫的完整新聞稿。 --- ### 微軟自研AI雙箭齊發:MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 正式亮相,強調「未經蒸餾」並已落地多項核心產品 微軟在自研人工智慧領域再次邁出重要一步,於當地時間7月23日正式宣佈推出兩款全新的 AI 模型:**MAI-Image-2.5-Pro** 與 **MAI-Voice-2-Flash**。
好的,這是一篇根據您提供的資訊撰寫的完整新聞稿。 ---
### 微軟自研AI雙箭齊發:MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 正式亮相,強調「未經蒸餾」並已落地多項核心產品
微軟在自研人工智慧領域再次邁出重要一步,於當地時間7月23日正式宣佈推出兩款全新的 AI 模型:**MAI-Image-2.5-Pro** 與 **MAI-Voice-2-Flash**。這兩款模型目前均已進入公開預覽階段,標誌著微軟在擺脫對第三方模型依賴、打造完全自主可控的 AI 技術棧上,取得了關鍵性的突破。 微軟強調,這兩款模型完全由微軟 AI 團隊自主研發,其訓練過程使用經過嚴格清理、可完整追蹤溯源且符合企業級標準的高品質數據,**明確表示不涉及對第三方模型的蒸餾**。此舉旨在從底層架構設計開始,就能更完美地服務於微軟龐大的產品生態系統,為其數十億用戶與企業客戶提供更可靠、高效且成本更低的 AI 能力。 #### 精準圖像生成:MAI-Image-2.5-Pro
作為微軟目前精度最高的影像生成模型,MAI-Image-2.5-Pro 專為對圖像品質有極高要求的應用場景所設計。其主要亮點在於卓越的細節編輯能力、主視覺圖片的精準生成,以及最重要的——**圖像內文字渲染的準確性**。過去 AI 繪圖模型在生成招牌、海報或文件截圖時,常常出現文字拼寫錯誤或字體扭曲的困擾,微軟表示 MAI-Image-2.5-Pro 已針對此痛點進行了深度優化。 此外,該模型支援使用者透過自然語言編輯指令,對生成的圖片進行二次調整。無論是調整色調、替換物件或是修改構圖,使用者僅需輸入簡單的文字描述,即可精確控制生成內容。 在定價方面,MAI-Image-2.5-Pro 的公開預覽價格採用 Token 計費制:
- **文字輸入**:每 100 萬個 Token 收費 5 美元(約合 33.9 元人民幣)。 - **圖像輸入**:每 100 萬個 Token 收費 8 美元(約合 54.3 元人民幣)。 - **圖像輸出**:每 100 萬個 Token 收費 106 美元(約合 718.8 元人民幣)。 #### 低成本高並發:MAI-Voice-2-Flash
另一款備受關注的模型是 MAI-Voice-2-Flash,這是一款針對高頻率、大規模語音交互場景進行極致優化的模型。根據微軟提供的數據,相較於前一代的 MAI-Voice-2,新模型的**速度提升了約 2 倍**,同時**成本降低了 32%**。這使得它在保持自然語調與高品質語音輸出的前提下,能為客服中心、語音助手等需要極低延遲回應的服務提供強力支援。 MAI-Voice-2-Flash 的公開預覽價格為每 100 萬個字元 15 美元(約合 101.7 元人民幣),極具市場競爭力。微軟表示,該模型已成功應用於 T-Mobile、EasyJet 等客戶的服務場景中。 #### 廣泛落地應用:從 Bing 到 Office 再到醫療
微軟並非紙上談兵,而是迅速地將這兩款自研模型部署到旗下多個旗艦產品中,展現了強大的端到端整合能力。- **Bing Image Creator**:已全面轉用微軟自研圖像模型,其中 **MAI-Image-2.5** 已成為其預設的圖像生成模型,承擔所有用戶的圖像生成與編輯需求。- **PowerPoint**:在投影片的圖像編輯功能中,MAI-Image-2.5 被用於實現圖像到圖像的編輯。微軟指出,與使用其他模型(如 GPT-Image-2)相比,**該模型最高可降低 84% 的 GPU 成本**,顯著節省了營運開支。- **OneDrive**:MAI-Image-2.
5 已成為 OneDrive 部分圖像編輯功能的預設底層模型。微軟數據顯示,部署後相關功能的保存成功率提升了 26%,P95 延遲降低了約 25%,在中等負載生產環境下,**效率提升高達 2.5 倍**。- **Dynamics 365 Contact Center**:MAI-Voice-2-Flash 已整合至企業客服智能體服務中,用於處理真實的客戶通話。微軟表示,其**最高可降低 89% 的 GPU 成本**,讓大規模部署 AI 語音客服更具經濟效益。- **Azure Voice Live 服務**:開發者現在可以利用該模型,在 Azure 上構建支援即時語音到語音交互的智能體。
#### 專業領域的深度結合:醫療語音解決方案
除了前述的通用模型,微軟也展示了其在專業領域的佈局。自研的 **MAI-Transcribe-1.5** 模型已應用於知名的醫療語音解決方案 **Dragon Copilot**。這套服務目前被超過 17 萬名醫療服務提供者使用,僅上一個季度就處理了高達 2800 萬次患者問診記錄。 MAI-Transcribe-1.5 支援多達 58 種語言。在微軟內部的多語言錄音測試中,該模型在多數語言上的語音轉錄錯誤率與語言識別錯誤率均實現了 50% 的相對下降。早期研究顯示,其所生成的醫療記錄準確性也有所提升,有望大幅減輕醫護人員的行政負擔。 #### 展望未來:持續擴展的 MAI 生態系
微軟表示,MAI 系列模型將持續擴展,並透過 **Azure AI Foundry** 平臺提供給廣大開發者使用,以滿足不同行業的定製化需求。為了支撐下一階段的模型研發,微軟 AI 團隊的下一代 GB200 AI 計算集群已經正式投入運行,這為未來更強大模型的誕生奠定了堅實的硬體基礎。 此次新模型的發佈,不僅展示了微軟在 AI 基礎模型研發上的深厚實力,更明確了其以 **「自研、落地、降本增效」** 為核心的 AI 戰略路徑。從搜尋引擎到生產力工具,再到企業級雲服務與專業醫療領域,微軟正在構建一個全面且環環相扣的 AI 應用版圖。 **廣告聲明:** 文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考。IT之家所有文章均包含本聲明。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。