千問智能體操控真機
重點摘要
阿里巴巴通義實驗室近日發布一項名為 Qwen-UI-Agent 的技術報告,展示新一代圖形介面智慧代理的完整面貌。這款以真實世界為核心的基礎模型,不再只是停留在螢幕理解與按鍵模擬,而是能直接在真實手機、電腦與瀏覽器上執行跨平台任務,甚至可以結合指令列操作,完成更複雜的工作流程。研究團隊形容,這類 GUI 代理有潛力成為數位裝置上的通用執行者,而 Qwen-UI-Agent 正是朝向這個願景邁出的具體一步。
阿里巴巴通義實驗室近日發布一項名為 Qwen-UI-Agent 的技術報告,展示新一代圖形介面智慧代理的完整面貌。這款以真實世界為核心的基礎模型,不再只是停留在螢幕理解與按鍵模擬,而是能直接在真實手機、電腦與瀏覽器上執行跨平台任務,甚至可以結合指令列操作,完成更複雜的工作流程。研究團隊形容,這類 GUI 代理有潛力成為數位裝置上的通用執行者,而 Qwen-UI-Agent 正是朝向這個願景邁出的具體一步。 這份技術報告由通義實驗室多位研究人員共同完成,包括周漢章、唐攀榮、張旭、孔曲雨、蔡承霖、夏天宇、張鞏傑、張嘉男、李龍、陳龍、王磊、戴高樂、李鵬翔、陳亮宇、王躍與 Steven Hoi。論文已於 7 月 30 日公開在 arXiv 平台上,論文編號為 2607.28227,並在 7 月 31 日被提交至論文社群,隨後獲得不少關注。 Qwen-UI-Agent 的最大特色在於它同時涵蓋手機、電腦、瀏覽器與 DeepSearch 等多種環境。過去許多 GUI 代理只針對單一平台設計,例如只會操作手機或只會瀏覽網頁,但 Qwen-UI-Agent 試圖用單一模型打通不同裝置之間的界線。研究團隊特別強調,模型的行動空間是統一的,也就是說,它可以在一輪生成中同時產生多個動作,而且這些動作不局限於點擊或滑動,還包括指令列操作,讓代理在面對需要系統指令或程式碼介入的任務時,也能流暢切換。 為了讓模型應付真實世界的長時間任務,研究團隊引入了 AutoResearch 風格的數據飛輪機制。這個機制讓代理本身參與任務與環境的建構,並在執行失敗時自動診斷問題,再據此規劃下一輪的迭代方向。這樣的做法大幅減少了人工介入的需求,也使模型能在不斷自我改進的循環中累積更貼近現實的訓練資料。 訓練層面,Qwen-UI-Agent 採用了線上強化學習,並支援超過一百步的軌跡訓練。研究團隊表示,整個訓練過程同時運作超過一萬個並行環境來加速資料生成,這使得模型有機會接觸到非常長的任務鏈,而不像過去許多模型只能在短程操作中表現良好。評論區也有研究者指出,過去長序列任務容易在中途跑偏或崩潰,而這套結合主動服務發起與動態診斷的做法,確實讓全端 GUI 代理從「沙箱玩具」朝「真實可用」邁進。 除了基本的螢幕操作能力,Qwen-UI-Agent 還配備一層輕量級的 harness 層,用來支援主動服務發起與有狀態的工作流程。這意味著模型不只是被動等待使用者下指令,它可以在特定條件下主動啟動服務,並在跨手機與電腦的場景中維持任務狀態,讓整個執行過程更加連貫。研究團隊認為,這是走向下一代真實世界應用不可或缺的能力。 在評測成績方面,Qwen-UI-Agent 在手機操作相關的基準上表現相當突出。它在 MobileWorld 上達到 82.1%,在 MobileWorld-Real 上達到 92.2%,而在 AndroidDaily 更拿下 97.5% 的成績。這三個基準分別涵蓋虛擬模擬環境與真實裝置上的操作,其中 MobileWorld-Real 與 AndroidDaily 尤其考驗模型面對真實介面與動態內容時的穩定度,能獲得如此高的分數,顯示模型在真機操控上確實具備一定成熟度。 電腦使用方面,模型在 OSWorld-Verified 上取得 79.5% 的成績,在 OSWorld-v2 上則有 40.0% 的部分進度分數。瀏覽器操作與圖形介面定位能力方面,它在 WebArena 上達到 73.6%,在 ScreenSpot-Pro 上則有 81.5% 的表現。整體而言,研究團隊表示,這款模型在手機使用基準上創下目前的最佳成績,在電腦與瀏覽器任務上則與包括 Opus 4.8、Gemini 3.1 Pro 與 GPT-5.6 Sol 在內的前沿模型表現相近。 這份技術報告發布後,在論文社群內引起不少討論。有使用者特別點出,Qwen-UI-Agent 能在維持手機任務頂尖表現的同時,在電腦與瀏覽器任務上保有競爭力,顯示統一動作空間的設計確實有助於跨平台泛化。也有人注意到,模型在 AndroidDaily 的 97.5% 與 MobileWorld-Real 的 92.2% 令人驚豔,並表達了將相關技術整合進自身工作流程的期待。 研究團隊也公開了專案頁面,提供更多模型細節與示範內容。從目前已公開的資訊來看,Qwen-UI-Agent 代表了 GUI 代理從實驗室邁向真實世界的關鍵轉折。過去的模型往往在單一虛擬環境中表現良好,一旦切換到真實裝置或跨平台場景就容易失靈,而這款模型透過統一的動作空間、大規模線上強化學習,以及主動服務機制,試圖打破這些限制。 值得注意的是,這份報告目前仍以技術論文的形式呈現,實際開放原始碼與模型權重的相關資源也已逐步公開,例如 GitHub 上已有 MAI-UI 相關連結。隨著更多開發者與研究團隊加入測試,Qwen-UI-Agent 是否能如論文所述,成為真正能長時間自主運作的通用 GUI 代理,值得持續觀察。不過從現有數據來看,這套以真實世界為中心的設計路線,確實為下一世代的人工智慧代理指出了一個具體可行的方向。
Related
相關文章

Edge AI Daily 早報(8月2日)
DeepSeek-V4-Flash上線,馬斯克關注,AI算力競爭轉向能源;OpenAI Astra攻克10道數學難題,AI獨立研究能力突破;亞馬遜500億美元投資OpenAI,鎖定雲合同;慕尼黑法院裁定Suno侵權,AI版權規則確立。
MiniMax升級全模態
MiniMax 近期浮出全模態升級的消息,相關資訊已重新整理並移除先前混入的模型思考或安全判斷文字。此次升級將產品方向推向全模態整合,讓文字、語音、影像等多種輸入輸出形式能在同一模型中協同運作。目前具體的技術架構與應用場景仍待揭露,後續落地情況值得持續追蹤。
MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
這篇消息聚焦「MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
真實會計場景評測基準發佈
人工智慧模型能否勝任專業會計師的工作,一直是業界關注的焦點。近日,由 Mercor 與 Ramp 聯手打造的「APEX-Accounting」基準測試正式對外發布,這項評測基準旨在模擬真實會計場景,全面檢驗前沿語言模型在處理帳務時的實際能力。研究團隊將其成果以論文形式發表於 arXiv 預印本平台,並公開了開發集的資料。 APEX-Accounting 不同於傳統的問答或文本理解測試,它設計了一套高度擬真的會計工作環境。
DeepSeek 推出 DeepSeek-V4-Flash-0731 重大更新,強化代理與編碼能力
DeepSeek 於 Hugging Face 發布 DeepSeek-V4-Flash-0731,並於 2026 年 7 月 31 日將官方 V4-Flash API 轉為公開測試版。模型卡明確指出此為正式版本,取代先前的預覽版,且架構與參數量不變。效能提升來自重新訓練,而非全新設計。該檢查點附帶 DSpark 推測解碼模組,與 DeepSeek-V4-Flash-DSpark 結構一致。Hugging Face 顯示該儲存庫有 304B 參數,包含在 284B 基礎模型之上的草稿模組。API 方面,deepseek-v4-flash 現原生支援 Responses API 格式,並針對 Codex 進行調整。V4-Pro API 及應用程式與網頁模型則未更新。是否可部署?可以,有兩種截然不同的方式:透過 API 即可部署。
LingBot-Map 教學:GPU 感知推理與點雲匯出
本教學實作基於 LingBot-Map 的端到端串流 3D 重建流程。首先設定輸入來源、重建參數、檢查點選擇與輸出控制,接著偵測可用 GPU,並根據偵測到的 VRAM 自動調整幀數限制、相機迭代次數、尺度幀與 KV-cache 參數。安裝儲存庫及其相依套件,下載預訓練檢查點,預處理影像或影片幀,並建構具備串流注意力與長程軌跡記憶體的 GCTStream 模型。接著執行混合精度推理,解碼預測的相機姿態與內參數,將深度圖轉換為世界座標點雲,驗證恢復的幾何結構,並視覺化重建場景。