何夕2077模型更新

千問智能體操控真機

2026年8月2日 00:00

重點摘要

阿里巴巴通義實驗室近日發布一項名為 Qwen-UI-Agent 的技術報告,展示新一代圖形介面智慧代理的完整面貌。這款以真實世界為核心的基礎模型,不再只是停留在螢幕理解與按鍵模擬,而是能直接在真實手機、電腦與瀏覽器上執行跨平台任務,甚至可以結合指令列操作,完成更複雜的工作流程。研究團隊形容,這類 GUI 代理有潛力成為數位裝置上的通用執行者,而 Qwen-UI-Agent 正是朝向這個願景邁出的具體一步。

站內 AI 整理稿

阿里巴巴通義實驗室近日發布一項名為 Qwen-UI-Agent 的技術報告,展示新一代圖形介面智慧代理的完整面貌。這款以真實世界為核心的基礎模型,不再只是停留在螢幕理解與按鍵模擬,而是能直接在真實手機、電腦與瀏覽器上執行跨平台任務,甚至可以結合指令列操作,完成更複雜的工作流程。研究團隊形容,這類 GUI 代理有潛力成為數位裝置上的通用執行者,而 Qwen-UI-Agent 正是朝向這個願景邁出的具體一步。這份技術報告由通義實驗室多位研究人員共同完成,包括周漢章、唐攀榮、張旭、孔曲雨、蔡承霖、夏天宇、張鞏傑、張嘉男、李龍、陳龍、王磊、戴高樂、李鵬翔、陳亮宇、王躍與 Steven Hoi。

論文已於 7 月 30 日公開在 arXiv 平台上,論文編號為 2607.28227,並在 7 月 31 日被提交至論文社群,隨後獲得不少關注。Qwen-UI-Agent 的最大特色在於它同時涵蓋手機、電腦、瀏覽器與 DeepSearch 等多種環境。過去許多 GUI 代理只針對單一平台設計,例如只會操作手機或只會瀏覽網頁,但 Qwen-UI-Agent 試圖用單一模型打通不同裝置之間的界線。研究團隊特別強調,模型的行動空間是統一的,也就是說,它可以在一輪生成中同時產生多個動作,而且這些動作不局限於點擊或滑動,還包括指令列操作,讓代理在面對需要系統指令或程式碼介入的任務時,也能流暢切換。

為了讓模型應付真實世界的長時間任務,研究團隊引入了 AutoResearch 風格的數據飛輪機制。這個機制讓代理本身參與任務與環境的建構,並在執行失敗時自動診斷問題,再據此規劃下一輪的迭代方向。這樣的做法大幅減少了人工介入的需求,也使模型能在不斷自我改進的循環中累積更貼近現實的訓練資料。訓練層面,Qwen-UI-Agent 採用了線上強化學習,並支援超過一百步的軌跡訓練。研究團隊表示,整個訓練過程同時運作超過一萬個並行環境來加速資料生成,這使得模型有機會接觸到非常長的任務鏈,而不像過去許多模型只能在短程操作中表現良好。

評論區也有研究者指出,過去長序列任務容易在中途跑偏或崩潰,而這套結合主動服務發起與動態診斷的做法,確實讓全端 GUI 代理從「沙箱玩具」朝「真實可用」邁進。除了基本的螢幕操作能力,Qwen-UI-Agent 還配備一層輕量級的 harness 層,用來支援主動服務發起與有狀態的工作流程。這意味著模型不只是被動等待使用者下指令,它可以在特定條件下主動啟動服務,並在跨手機與電腦的場景中維持任務狀態,讓整個執行過程更加連貫。研究團隊認為,這是走向下一代真實世界應用不可或缺的能力。在評測成績方面,Qwen-UI-Agent 在手機操作相關的基準上表現相當突出。

它在 MobileWorld 上達到 82.1%,在 MobileWorld-Real 上達到 92.2%,而在 AndroidDaily 更拿下 97.5% 的成績。這三個基準分別涵蓋虛擬模擬環境與真實裝置上的操作,其中 MobileWorld-Real 與 AndroidDaily 尤其考驗模型面對真實介面與動態內容時的穩定度,能獲得如此高的分數,顯示模型在真機操控上確實具備一定成熟度。電腦使用方面,模型在 OSWorld-Verified 上取得 79.5% 的成績,在 OSWorld-v2 上則有 40.0% 的部分進度分數。

瀏覽器操作與圖形介面定位能力方面,它在 WebArena 上達到 73.6%,在 ScreenSpot-Pro 上則有 81.5% 的表現。整體而言,研究團隊表示,這款模型在手機使用基準上創下目前的最佳成績,在電腦與瀏覽器任務上則與包括 Opus 4.8、Gemini 3.1 Pro 與 GPT-5.6 Sol 在內的前沿模型表現相近。這份技術報告發布後,在論文社群內引起不少討論。有使用者特別點出,Qwen-UI-Agent 能在維持手機任務頂尖表現的同時,在電腦與瀏覽器任務上保有競爭力,顯示統一動作空間的設計確實有助於跨平台泛化。也有人注意到,模型在 AndroidDaily 的 97.

5% 與 MobileWorld-Real 的 92.2% 令人驚豔,並表達了將相關技術整合進自身工作流程的期待。研究團隊也公開了專案頁面,提供更多模型細節與示範內容。從目前已公開的資訊來看,Qwen-UI-Agent 代表了 GUI 代理從實驗室邁向真實世界的關鍵轉折。過去的模型往往在單一虛擬環境中表現良好,一旦切換到真實裝置或跨平台場景就容易失靈,而這款模型透過統一的動作空間、大規模線上強化學習,以及主動服務機制,試圖打破這些限制。值得注意的是,這份報告目前仍以技術論文的形式呈現,實際開放原始碼與模型權重的相關資源也已逐步公開,例如 GitHub 上已有 MAI-UI 相關連結。

隨著更多開發者與研究團隊加入測試,Qwen-UI-Agent 是否能如論文所述,成為真正能長時間自主運作的通用 GUI 代理,值得持續觀察。不過從現有數據來看,這套以真實世界為中心的設計路線,確實為下一世代的人工智慧代理指出了一個具體可行的方向。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

3 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

3 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

4 小時前