移動端基準全面超越GPT與Claude!阿里發佈Qwen-UI-Agent,開啟GUI智能體新紀元
AI資訊AI新閒資訊正文移動端基準全面超越GPT與Claude!阿里發佈Qwen-UI-Agent,開啟GUI智能體新紀元發布於AI新閒資訊時間 :Aug 21, 2026閱讀 :1分鐘阿里巴巴於8月20日正式發佈了全新的GUI智能體基座模型Qwen-UI-Agent。該模型全面覆蓋移動端、電腦端、網頁端及深度搜索(DeepSearch)環境,並在多項核心圖形用戶界面基準測試中全面對標並超越業界多款旗艦模型。在具體的基準表現方面,Qwen-UI-Agent在移動端展現出強勁實力。在MobileWorld基準上得分為82.1%,分別領先GPT-5.6Sol和Claude Opus4.8達12.
0和14.6個百分點;在真實環境基準MobileWorld-Real上取得了92.2%的成績,超越了Gemini3.1Pro、Claude Opus4.8以及GPT-5.6Sol;在AndroidDaily基準上更是高達97.5%,接近滿分表現。在電腦端與瀏覽器方面,其在OSWorld-Verified上達到79.5%,超越GPT-5.5和Gemini3.1Pro;在WebArena上也以73.6%的成績位列所有對比模型第一。此外,在GUI Grounding的ScreenSpot-Pro測試中取得81.5%的分數,並刷新了其餘4個評測基準的SOTA記錄。
為了攻克從模擬到真實的落地難題,Qwen-UI-Agent搭建了覆蓋100多臺真實手機和150多款應用的真機移動環境,用於執行任務構建、軌跡採集、模型訓練與評測,並自建了包含400多項任務和100多款應用的MobileWorld-Real真機基準。除了常規的GUI點擊操作外,該模型還支持直接執行命令行操作,並在單次決策中批量輸出多個動作,其中電腦任務中的CLI動作佔比近半,約40%的動作以批量形式輸出。在安全性與長程任務處理方面,Qwen-UI-Agent將安全機制貫穿任務執行的全過程。
面對違法或高風險請求,模型會直接拒絕並終止任務;而在面對支付、數據刪除、隱私授權等敏感場景時,則會在關鍵步驟主動停手並向用戶說明情況。同時,模型支持在超過100步的超長軌跡上進行在線強化學習訓練,配合約10000個併發環境同時rollout,持續攻克高難度的長程任務。相關推薦阿里發佈AI音樂模型HappyShrimp 1.0 自然語言創作打破音樂生產門檻8月17日,阿里發佈AI音樂生成模型HappyShrimp(快樂蝦米)1.0。它突破傳統標籤式輸入門檻,用生活化自然語言即可驅動作詞、作曲、編曲、演唱全流程,讓普通用戶產出高完成度原創音樂。
不同於堆砌專業術語的工具,它將音樂理解為有語法、語義的創作。Aug 18, 2026346.7k深度綁定本土生態:傳蘋果與阿里聯手打造中國專屬大模型蘋果在華銷量承壓,正調整AI佈局,已專為中國市場訓練專屬大語言模型,並與阿里巴巴深度合作,由後者提供技術支持完成核心訓練。此前外界預計蘋果會引入國內第三方大模型。Aug 14, 2026233.3k阿里千問圖像生成模型Qwen-Image-3.0 上線 開放API且0.18 元/張起阿里巴巴千問圖像生成模型Qwen-Image-3.0上線,旗艦版Pro與標準版API開放,文生圖起售價0.18元/張。該模型在Arena.
ai文生圖榜單居國內第一,主打超長文本理解與精細化渲染,最高支持4.5k token指令,可生成分鏡、試卷、九宮格知識圖等複雜版面。Aug 5, 2026295.1k阿里超級大杯登場!Qwen3.8-Max正式發佈,編程與辦公能力全面進化阿里巴巴發佈新一代大模型Qwen3.8-Max,參數量達2.4萬億。其在編程與專業辦公等核心場景性能大幅躍升,於權威榜單Arena中綜合實力僅次於Claude系列,位居前列,標誌著國產大模型在複雜任務處理上取得重要突破。Aug 3, 2026255.8k阿里開源0.8B文檔解析模型OvisOCR2,端到端方案登頂OmniDocBench7月24日,阿里開源0.
8B參數的文檔解析模型OvisOCR2,以96.58分登頂OmniDocBench基準,首個全面超越傳統流水線,推動文檔智能範式轉折。它Jul 24, 2026328.8k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。