阿里把AI扔進100臺真機裡“軍訓”,玩轉各種屏幕!這和AI手機還有啥區別?
作者 | 陳駿達 編輯 | 李水青 8月20日報道,今天,阿里巴巴推出了一款面向數字設備執行的GUI智能體基座模型——Qwen-UI-Agent。這一模型主要面向移動端、電腦端、網頁端和深度搜索等環境,可以通過虛擬點擊、CLI執行等方式操作設備,並完成複雜任務。在項目主頁顯示的6個核心GUI基準測試中,Qwen-UI-Agent在其中5個裡取得了第一,得分要高於GPT-5.6 Sol、Claude Opus 4.8等模型,也優於字節今年6月發佈Seed 2.1 Pro。值得一提的是,這一模型的主力版本參數量僅為27B,基於Qwen 3.5系列基礎模型打造。
阿里展示了多個Qwen-UI-Agent的應用場景。用戶可以要求模型在手機上通過模擬點擊的方式打開地圖,查找附近的咖啡館,併到社交媒體平臺搜索關於咖啡館的評價,輔助用戶決策。在PC上執行任務時,Qwen-UI-Agent則會執行更多CLI動作,並在單次決策中批量輸出多個動作,完成跨網站調研產品、核對價格,生成比價方案等類型的任務。在深度搜索場景,這一模型的GUI能力和CLI能力可以協同完成任務,GUI負責網頁檢索與數據源定位,CLI負責數據下載與分析。此外,這一模型還可以被用於手機電腦跨端執行、PPT報告生成等任務,也可以主動關注設備上的消息通知等信息,並給用戶提供推薦、方案等。
阿里同步發佈了Qwen-UI-Agent模型的技術報告和項目主頁。技術報告中,阿里透露為了訓練這一模型,他們搭建了覆蓋100+臺真實手機、150+應用的真機移動環境,用於任務構建、軌跡採集、模型訓練與評測,除了27B版本之外,這一模型還提供了35B-A3B、4B參數量的版本。他們相信,GUI智能體有望成為現有數字設備上的通用執行器。技術報告: https://arxiv.org/abs/2607.28227 項目主頁: https://tongyi-mai.github.io/Qwen-UI-Agent GitHub: https://github.
com/Tongyi-MAI/MAI-UI 一、GUI智能體存在sim-to-real gap,中國應用獨特生態帶來額外挑戰 GUI智能體的理想情況是,只要有界面,它就能像人一樣看懂、點擊、輸入,替你完成複雜任務。但阿里團隊發現,當前絕大多數GUI智能體都困在模擬器裡:它們在乾淨的沙盒環境中刷分漂亮,一旦放到真實手機上,面對變化的界面、彈窗廣告、登錄過期、網絡抖動,性能就會下跌。這種“模擬環境到真實環境”的鴻溝(sim-to-real gap)在國內移動生態尤為嚴重,因為中國市場的超級應用功能深、入口雜、彈窗多,是實驗室環境根本復現不了的。
與此同時,真實用戶的需求早已不侷限於在單個App裡點幾下。一個完整的辦公或生活工作流,往往需要在手機、電腦、瀏覽器之間來回跳轉,甚至要求智能體主動感知,比如看到航班取消通知後,自動檢索替代方案、檢查日程衝突、生成恢復計劃。現有智能體大多是被動問答模式,等用戶發指令才動,既不會跨端協作,也缺乏長程任務的規劃與糾錯能力。更底層的問題是訓練效率。傳統GUI模型的數據收集高度依賴人工:人工寫任務、搭環境、標結果、分析失敗等等。隨著智能體能力邊界擴展,這套工作流已難以為繼。阿里認為,下一代GUI基座模型必須同時解決三大矛盾:模擬與真實的矛盾、單點能力與完整工作流的矛盾、人工驅動與規模化的矛盾。
這正是Qwen-UI-Agent立項的出發點。二、百臺真機搭建移動運行時,多輪RL提升任務成功率 為了打造Qwen-UI-Agent,阿里設計了一套從底層環境、動作空間、訓練範式到上層Harness的框架。首先是真機訓練環境。研究團隊搭建了由100多臺真實手機、150多款應用組成的真實移動運行時。這套系統配備了健康感知調度器,能實時監測每臺設備的應用狀態、賬戶登錄態和網絡狀況,遇到故障自動切換;還支持虛擬屏幕技術,讓單臺手機同時運行多個應用會話,把併發rollout效率提升約20倍。模型在訓練階段直接接觸的就是真實登錄態、動態內容和隨機彈窗,這在一定程度上緩解了sim-to-real gap。
其次是統一動作空間。Qwen-UI-Agent把GUI操作、CLI命令(如bash腳本)和API調用納入同一套動作體系。面對表格處理、文件批量操作等結構化任務,模型可以直接寫代碼執行。面對需要視覺確認的操作,比如在表格中填寫、頁面內搜索、地圖縮放等等,則切回GUI點擊。單次推理中,Qwen-UI-Agent還能輸出批處理動作,一次性完成多個連貫操作,大幅減少交互輪次。統計上,在OSWorld桌面任務中,CLI動作佔比超過40%,批處理動作佔比約40%。在訓練層面,團隊設計了一套“智能體驅動的數據飛輪”。
整個流程由AI自動合成任務、自動搭建環境、自動驗證結果、自動診斷失敗並規劃下一輪訓練數據,人類只負責監督和修正。訓練分三階段:監督微調(SFT)建立基礎能力;Action RL專門糾正定位錯誤、重複循環、過早終止等常見動作失誤。Online RL則在100步以上的長程軌跡中優化端到端成功率,同時調度近萬個併發環境加速rollout。比如,模型在RL後會主動驗證結果、發現錯誤後修復,而不是直接宣佈成功。最上層是Harness層,負責主動服務和跨端協作。它能讀取手機通知,主動識別航班取消等事件並生成執行計劃。也能把跨設備任務串成工作流,讓手機上的信息流轉到電腦端繼續處理。
安全性方面,面對違法或高風險請求,Qwen-UI-Agent會不執行任何界面操作,直接拒絕並終止任務;面對支付、數據刪除、隱私授權等敏感場景,則會在關鍵步驟主動停手,向用戶說明情況,待獲得明確確認後再繼續。三、模型參數效率佔優,彈窗廣告等干擾執行 在覆蓋移動端、桌面端、網頁端和GUI定位的6大核心基準測試中,Qwen-UI-Agent拿下5項第一。這一模型在移動端表現的表現相對出色,在真實設備評測集MobileWorld-Real上,它以92.2%的成功率大幅領先GPT-5.6 Sol、Claude Opus 4.8和字節 Seed 2.
1 Pro,在AndroidDaily日常任務集上達到97.5%,接近滿分。桌面端,它在OSWorld-Verified上獲得79.5%,僅次於Claude Opus 4.8。論文還揭示了幾個值得關注的量化結果與行為洞察。一是模型的參數效率。Qwen-UI-Agent的27B版本超過多個廠商的旗艦模型,而35B-A3B版本在MobileWorld-Real上仍能達到87.4%,說明這套訓練方法靠真實環境數據讓中小模型獲得了更強的任務完成率與部署性價比。二是RL訓練改變了模型的工作習慣。動作RL後,模型不僅成功率提升7%以上,推理token還減少了21.3%,同時實際執行步驟增加了8.
4%,說明它變得更果斷,少了很多無意義的自我懷疑。在線RL也帶來了變化,模型學會了“先驗證、再交卷”,在OSWorld上包含驗證動作的軌跡比例提升了14.7%,“假成功(自認為完成但實際失敗)”的比例下降了11.2%。模型還自發形成了跨模態協作模式,用命令行高效改狀態,再切回界面截圖確認效果。這篇論文還分析了基線模型在真實手機上的失敗原因。52%來自真實世界干擾,比如彈窗廣告、UI誤讀、物理控件滑不準等等,40%來自執行能力缺陷,比如找不到深層入口、陷入重複點擊循環、長程任務遺忘進度。這些發現證明了真機訓練的必要性。
結語:GUI智能體進入真實世界,落地形態仍是關鍵命題 阿里在技術報告中透露,未來他們還將探索更高效的GUI執行,並通過更好的Harness優化模型的長程能力。訓練方面,更可擴展的高保真合成環境也在探索範圍之中,阿里已構建此類環境,但將它們整合到模型訓練中的工作未能在技術報告發布前完成。GUI智能體給AI的應用場景帶來了更多想象空間,已成為國內字節、階躍等AI玩家們探索的方向之一。阿里此前也曾發佈MAI-UI等研究成果,此次新成果發佈或許意味著他們將繼續在這一方向投入資源。不過,模型能力只是第一步。Qwen-UI-Agent未來會以何種形態落地到真實世界的設備之上,是值得關注的關鍵命題。
Related
相關文章

燧原科技啟動科創板發行:擬募資60億元,9月2日申購
TechPulse2026.08.25 17:54 · 來自河北全文1176字00:00 / 03:59騰訊既是燧原科技的重要股東,也是公司第一大客戶。國產AI芯片企業燧原科技正式邁入科創板發行階段。8月25日,上海燧原科技股份有限公司披露招股意向書提示性公告。

大廠這波Agent混戰,殺死10多個AI名品
大型科技企業在人工智慧領域的競爭,正從單純的模型較勁,快速轉向更貼近實際應用的Agent(智慧體)戰場。過去一段時間,各大廠接連端出以「工作」、「效率」為核心的智慧體產品,試圖搶占使用者桌面與瀏覽器的主控權。然而這波快速推進的卡位戰,也伴隨著殘酷的淘汰,多達十餘款曾經備受關注的AI工具,在短短時間內從市場上消失,成為大廠戰略調整下的犧牲品。 這波混戰的起點,其實是AI應用從「能對話」走向「能做事」的轉折。

阿里雲 Token Plan 接入千問 App 及 PC 端,支持 Qwen3.8-Max 等模型
作者:沁滄(實習) 責編:沁滄 評論: 8 月 25 日消息,阿里雲今日宣佈,阿里雲 Token Plan 正式接入千問 App 及 PC 端。用戶只需將 API Key 綁定至千問,即可直接調用 Token Plan 訂閱額度,支持 Qwen3.

澳大利亞唱片業協會“重拳出擊”,純 AI 生成歌曲禁入官方排行榜
作者:清源 責編:清源 評論: 8 月 25 日消息,據美聯社報道,隨著生成式 AI 快速發展並開始威脅音樂人的生計,當地時間 25 日(今天),澳大利亞唱片業協會(ARIA)決定禁止完全由 AI 生成的歌曲進入官方排行榜。新規出臺前,一首由澳大利亞製作人利用 AI 生成人聲和鼓點重新制作了麥當娜的名曲《Like a Prayer》,並連續 16 周躋身澳大利亞前 20 名,也讓生成式 AI 在音樂行業中的地位成為爭論焦點。

開源國產8B模型,比肩閉源Image 2了!
商湯科技正式開源SenseNova U1.5 Lite,這是一款僅8B參數的國產生圖模型,主打4K直出與更完整、準確、穩定的表現。該模型能一次處理多張圖片與複雜指令,例如將九張食物照合成精美食譜卡片,並支援精準的局部圖像編輯,同時保留原圖其他區域的結構與空間關係。其亮點包括超長指令遵循、高品質視覺生成、可靠的原生編輯,以及優異的中英文文字與複雜佈局處理能力。

雷軍詳解新一代玄戒芯片原型機,包括高速 AI 演示終端和個人 AI 超級計算終端
作者:歸瀧 責編:歸瀧 評論: 感謝網友 Autumn_Dream 的線索投遞!8 月 25 日消息,小米創辦人、董事長兼 CEO 雷軍剛剛發文,介紹了搭載新一代玄戒芯片的兩款原型機,包括高速 AI 演示終端和個人 AI 超級計算終端。玄戒 O100 原型機:為端側大模型而生的高速 AI 演示終端。