何夕2077AI Agent

StateAct用程序狀態驅動電腦智能體

2026年7月29日 00:00

重點摘要

StateAct用程序狀態驅動電腦智能體。 論文原文完整速覽 指出 程序狀態 ��� 應當先於像素。主代理直接通過代碼 ��� 讀取文件與 DOM。少量複雜操作分發給 GUI ���️ 子代理。任務成功率升至 26.9% 且開銷大降。

站內 AI 整理稿

StateAct 提出了一種全新電腦智能體運作模式,打破過去依靠螢幕畫面像素來理解應用程式的慣例,轉而直接從程式狀態層級掌握系統現況。這項方法的核心在於強調「程式狀態」應優先於「像素資訊」,期望從根本上解決傳統做法長期存在的效率與準確度瓶頸。傳統電腦智能體的設計大多依賴截取螢幕畫面的像素資料,試圖透過視覺分析來辨識按鈕、視窗或選單位置。然而,這種方式不僅需要大量運算資源處理高解析度畫面,還容易因為主題顏色、解析度變化或版面動畫等視覺干擾,導致系統誤判應用程式的實際狀態。例如同一按鈕在啟用與禁用狀態下可能只差在細微色差,像素模型難以穩定區別,最終使任務執行中斷或出錯。

StateAct 則跳脫這套思維,直接透過程式碼層級存取應用程式的內部資訊,包括檔案結構與文件物件模型(DOM)。這意味著智能體不再需要「看」螢幕,而是像開發者工具那樣直接取得介面的完整結構化資料,包括每個元件的功能、屬性與狀態。這種做法讓主代理能精確掌握當前的系統狀況,減少因視覺模糊造成的資訊落差。在效率方面,由於不需要持續解析龐大的畫面數據,StateAct 的運算負擔明顯降低。對於許多標準化操作,主代理可以直接利用程式狀態來執行任務,例如管理檔案、調整設定或處理文字,這些動作不再經過耗時的影像辨識流程,反應速度與準確度也因此提升。面對較為複雜的操作情境,StateAct 則引入分工機制。

當任務涉及需要直接操作圖形使用者介面(GUI)的互動時,例如拖曳滑桿、點擊浮動選單或操作非標準元件,系統會將這部分工作分配給專門負責 GUI 的子代理。子代理具備處理視覺與互動細節的能力,能夠補足主代理在圖形操作上的限制。這樣的雙層分工讓整體系統在資源分配上更具彈性。簡單任務交由主代理快速處理,複雜互動才動用子代理的圖形能力,避免所有工作都經過笨重的視覺分析,進而大幅降低整體運算開銷。同時,由於主代理大多依賴精確的狀態資訊,任務的穩定性與正確性也獲得保障。研究團隊在論文中公布了具體測試結果。在標準化電腦操作測試中,StateAct 的任務成功率達到 26.

9%,相較於傳統以像素為主的智能體有明顯進步。雖然絕對數字並非極高,但考慮到任務涵蓋多種複雜情境,且運算成本同步下降,這一提升已顯示出新模式在效率與可靠性上的競爭力。更重要的是,成功率的提升伴隨著運算資源的大幅節省。論文強調,StateAct 不需要大量 GPU 或高階視覺模型來維持運作,這使得智能體在一般硬體上也能運行流暢,降低了部署門檻。對於未來需要大規模執行自動化操作的場景而言,這樣的效率改善極具實用價值。這項研究的意義不僅在於單一技術突破,更在於它改變了電腦智能體的基礎思考路徑。長期以來,學界與業界習於將螢幕畫面當作主要資訊來源,鮮少考慮直接從程式狀態切入。

StateAct 證明,跳脫視覺框架、回歸應用程式底層狀態,反而是讓智能體更輕巧、更可靠的方向。展望未來,這種程式優先的策略可望應用於機器人流程自動化、軟體測試與數位助理等領域。當 AI 不再需要依賴不穩定的視覺辨識,直接讀取應用程式的真實狀態,自動化流程的強固性將大幅提升。此外,這種做法也與無障礙技術的原則相通,為智能體帶來更通用的操作介面。當然,目前 StateAct 仍有需要克服的挑戰。並非所有應用程式都提供完整的狀態存取介面,例如老舊或不支援 DOM 的軟體,仍可能得仰賴子代理的圖形能力補足。但研究團隊表示,隨著應用開發逐漸標準化,直接讀取程式狀態的適用範圍將持續擴大。

總體而言,StateAct 為電腦智能體帶來了一項關鍵思維轉折:與其費力模擬人類的視覺觀察,不如直接利用電腦本身的運作語言來驅動行為。這項從「像素優先」轉向「狀態優先」的嘗試,不僅在測試數據上展現潛力,也為未來打造更高效、更穩定的自主操作系統奠定了基礎。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

4 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

9 小時前