全網最硬核 OpenClaw 2.0 實測:從 ToC 到 ToB 的試探,Agent 網關能重塑工作流邊界嗎?

本文作者: 李娜 2026-09-30 16:22 導語:OpenClaw 2.0 讓 Agent 更像一個可覆盤、可協作的工作系統,但依然不是普通用戶能輕鬆上車的工具。() 8 月 31 日,OpenClaw 2.0 正式發佈(版本號: v2026.8.1 ),933 位貢獻者、569 位首次貢獻者、16,962 個 PR 提交。這組數字讓它成為近期最受關注的開源 Agent 更新之一。((公眾號:))在過去 230 天裡,OpenClaw 曾發佈 106 個版本,但在 2.0 到來前已經有近 7 周沒有更新了。
因此,這一次 OpenClaw 不是給 Agent 多補幾個工具,而是把安裝、瀏覽器、雲會話、記憶管理、插件、安全、多人協作和恢復能力幾乎重新梳理了一遍。因此,一個急需回答的問題是:OpenClaw 2.0 到底是一次聲量很大的版本升級,還是把個人 AI Agent 從一個能幹活的工具,往可長期運行、可協作、可審計的系統推了一步?為回答這個問題,我們選擇 OpenClaw v2026.7.1-2 (1.x) 和官方標註為 2.0 的 v2026.8.1 的新版本進行對比。我們用同一道複雜長任務,對比兩個版本的上手門檻、任務推進和交付表現。OpenClaw v2026.8.1 (2.
0) 配置界面增加“詢問 OpenClaw”01OpenClaw 2.0 優化了什麼?8 月 31 日,官方將發佈的 v2026.8.1 版本稱為“自託管 AI 網關”,核心強調把 Discord、Google Chat、iMessage、Matrix、Microsoft Teams、Signal、Slack、Telegram、WhatsApp、Zalo、WebChat 等消息入口和 AI 編程助手、瀏覽器、終端、本地/遠端機器、插件、記憶系統連在一起。因此,2.0 想做的是:模型負責思考,工具負責執行,網關負責把消息入口、文件系統、遠端機器、長期記憶、權限審批和團隊協作組織進同一個工作流。
但從用戶體驗看,真正關鍵的不是功能清單有多長,而是三條主線:上手:配置重新組織,但工程門檻還在對比 v2026.7.1-2,2.0 把很多複雜度散落在命令行、配置文件、模型服務商、插件和渠道連接裡,2.0 把這些步驟往更結構化的首次引導裡收。實測中,新版啟動後會主動檢查本機已有的 AI 工具和模型配置,並把 OpenAI、OpenRouter、xAI、Google、Anthropic 等模型入口放進初始化流程。而這些,對第一次接觸 OpenClaw 的用戶來說很重要。2.
0 版本加載本地 AI 工具集成到平臺(左側面板展示了本機的 CLAUDE CODE 工具)長任務:從會話變成有狀態的任務2.0 強化了歷史會話搜索、對話分支、持續進度卡片、任務面板、主動記憶等能力,共同解決 Agent 能不能記住一件還沒做完工作的問題,而不是每次都像第一次見到用戶。協作和安全邊界變得更顯性通過雲會話、共享會話、團隊角色、私密憑證請求、共享憑證庫、權限模式、插件安全審計等功能一起來解決另一個問題:當 Agent 開始接入遠端機器、消息渠道、瀏覽器、插件、團隊成員和各種憑證時,誰能看見什麼,誰能操作什麼,出問題後又怎麼追溯?
同時,官方安全文檔也強調,一個網關就是一個信任邊界,更適合單人或互相信任的小團隊,而不是讓互不信任的人共享同一套網關。這說明儘管 OpenClaw 開始具備協作能力,但面對 ToB 場景暫時還不能用於企業級多租戶的協作應用。具體地,我們進一步把 v2026.7.1-2 和 v2026.8.1 (2.0) 放在一起來直觀對比這次升級的重點:通過表格可以發現,2.0 的核心變化是把 OpenClaw 從一個可運行的個人 Agent 往一個能長期託管任務的工作系統推了一步。02實戰測試:同一道長任務,2.0到底改變了什麼?儘管 2.
0 看起來有了極大的改進,但有用戶願意選擇它才是關鍵,因此我們選擇 v2026.7.1-2 和 v2026.8.1 (2.0) 兩個連續的版本進行對比測試。具體地,我們在同一臺服務器上分別創建獨立的全新 Ubuntu 容器(OP1 和 OP2)作為兩個連續 OpenClaw 版本的測試環境,並分別安裝和配置了 OpenClaw,在任務運行環節都使用智譜發佈的 GLM 5.3 模型作為基座。OP1 用於部署 OpenClaw v2026.7.1-2 的測試環境信息OP2 用於部署 OpenClaw v2026.8.1 的測試環境信息先說安裝,2.
0 的確比舊版更重視新手引導,但還沒有把 OpenClaw 變成傳統意義上的“下載、雙擊、下一步”產品。官方文檔給出的主路徑仍然是命令行安裝:macOS / Linux 通過一條腳本命令啟動安裝,Windows 通過 PowerShell 完成,這對開發者來說不算門檻,但對普通用戶來說,仍然需要理解終端、Node 環境、安裝腳本、端口和權限這些基礎概念。同時,OpenClaw 是自託管網關,天然要和本機環境、模型服務、消息渠道、瀏覽器、工作目錄打交道,所以安裝成功並不等於馬上能順滑使用,2.0 降低的是配置過程中的迷路感,而不是徹底消除工程門檻。
官方安裝教程頁截圖在本次測試中,我們設計了一個開放式但驗收標準明確的綜合任務,把“信息檢索 → 來源判斷 → 多源交叉驗證 → 信息組織 → 面向領導的彙報寫作 → 數據可視化 → Web 開發”串成一個完整任務。簡化版的測試題目如下:請調研 OpenClaw 2.0 的全部重要公開信息,包括官方公告、GitHub、開發者社區、媒體報道,以及行業大佬和關鍵人物的公開發言。重點梳理:OpenClaw 2.
0 是什麼、什麼時候發佈;- 相比上一版本有哪些核心變化;- 最重要的新功能和技術特點;- 官方、社區和行業人士分別如何評價;- 當前有哪些爭議、問題和風險;- 與主流 Agent 產品相比有什麼優勢和差異;- 它對 AI Agent 行業可能產生什麼影響。請優先使用一手來源,對重要信息進行交叉驗證,並保留原始鏈接;無法確認的信息不要編造。完成調研後,整理一份適合向領導彙報的總結材料,提煉核心結論和是否值得關注/跟進的建議。
最後,將調研結果製作成一個可直接運行的可視化網頁,以專業的 AI 科技情報 Dashboard 風格呈現,至少包含核心結論、版本變化、時間線、關鍵人物觀點、社區反饋、競品對比、風險分析和信息來源,併合理使用圖表或其他可視化方式展示信息。請直接完成調研、總結和網站製作,不要只提供執行方案。這道題的難度在於我們把一個真實打工人遇到的完整工作流壓進了同一輪任務裡:先要從官方公告、GitHub、媒體報道和社區討論中找信息,然後要區分一手事實、二手轉述和無法確認的說法,接著還要把散亂材料整理成領導能快速判斷的彙報,最後再做成可運行的可視化網頁。
這樣的設計對 OpenClaw 這類 Agent 是合理的,這個題目核心用來考察 Agent 的長期任務、工具調用、瀏覽器、文件系統、進度追蹤和可交付物組織能力,通過把信息檢索、事實校驗、文檔生成、網頁交付和任務覆盤放在一起,用來測試 OpenClaw 到底是一個會聊天的工具,還是一個能接住複雜任務的 Agent 工作臺。下面一起來看看兩個版本 OpenClaw 的任務執行表現:v2026.7.1-2:更像一個工程工作臺從界面上看,v2026.7.1-2 具備比較完整的工作臺形態:可以創建會話、選擇模型、切換權限模式、查看任務狀態,也能在側欄裡看到工作區文件。
對於熟悉命令行和項目目錄的用戶,v2026.7.1-2 可以支撐較複雜的任務。OpenClaw v2026.7.1-2 的主界面截圖同時,v2026.7.1-2 的問題也很直觀:界面能展示很多信息,卻更像把底層配置直接攤給用戶。主界面頂部提示版本更新,底部看到模型和思考強度,左側是會話入口;設置頁裡集中放著模型、通信渠道、安全、瀏覽器、工具權限、MCP、工作區、日誌等模塊。對工程用戶來說,這種透明度是優點;但對普通用戶來說,它也意味著每一步都要理解自己在調什麼。1.x 版 OpenClaw 能做事,但更是需要用戶自己掌舵的工程控制台。OpenClaw v2026.7.
1-2 的設置界面截圖從任務完成情況來看,整體很完整:研究報告、檢索日誌、還有數據分析、可運行網頁目錄和多張網頁截圖,v2026.7.1-2 報告的結果結果包括 50 個信息源、27 個時間線事件、32 條人物/社區觀點、13 個功能模塊、17 個對比維度、5 組競品矩陣,以及 9 張可視化截圖。從執行角度看,v2026.7.1-2 能把開放式的調研題拆成搜索、篩選、結構化、報告、網頁和截圖幾個步驟,覆蓋多個內容編輯和行業分析工作的基本鏈路。任務跑起來之後,這種“工程工作臺”氣質會更明顯,如下圖所示,v2026.7.
1-2 一邊顯示綜合調研任務正文,一邊在右側展示工作區,下面還能看到模型狀態和任務進度,能把任務、文件、會話和執行狀態放在同一個頁面裡,這是 1.x 版已具備的能力。v2026.7.1-2 任務執行截圖v2026.8.1:產物沒有一味貪多,證據邊界更清楚到了 v2026.8.1(2.0),變化首先體現在任務完成後的交代方式上,如下截圖裡的進度卡片不是簡單告訴用戶“完成了”,而是像 Codex、Claude Code、Zcode 等 Agent 一樣把任務拆成了多個步驟:前提校驗、官方信源調研、社區與媒體調研、競品和時間線梳理、報告生成、數據與網頁拆分、可視化網站驗證。2.
0 還直接寫出產物路徑和驗證方式,例如打開 html 文件或進入 web 目錄運行服務。因此,對長任務來說,用戶可以沿著清單去複查資料、網頁、截圖和原始記錄。當然,這並不意味著 OpenClaw 2.0 已經形成了不可替代的產品壁壘,更準確地說,OpenClaw 正在向其他 Agent 產品的交互方式靠攏:把任務拆開、把進度攤開、把產物列清楚。v2026.8.1 任務執行截圖然後,一起來看看模型交出的“答案”:從最終網頁看,兩個版本都完成了可視化交付,但風格差異很明顯。v2026.7.
1-2 版頁面的信息密度更高,首頁直接放出 GitHub Stars、貢獻者、PR、首次貢獻者、消息渠道、HN 討論等多個指標,還用圖表呈現 star 增長和討論熱度,整體像一份資料鋪得很開的情報看板。新版頁面則更強調結論先行:頂部保留關鍵數字,但很快進入執行摘要、熱度週期和八個核心問題,把“是否值得關注”、“應該怎麼跟進”、“哪些地方有風險”放到更顯眼的位置。前者更像研究員交出的全量資料包,後者更像給管理者看的判斷材料。v2026.7.1-2 可視化頁面首頁v2026.8.
1 可視化總覽最後,對比兩個版本的後臺執行統計數據,揭開底層運行邏輯,完整的統計信息如下圖所示:這組後臺數據,比界面截圖更能說明 2.0 的真實變化:首先,2.0 並沒有在總耗時上拉開差距,1.x 版任務耗時 103.3 分鐘,2.0 版為 106.1 分鐘,基本持平。但 2.0 版的執行方式明顯變了:1.x 版用了 74 次 LLM 請求,2.0 只用了 46 次,請求次數減少 38%;工具調用結果也從 100 次降到 65 次,減少 35%。這說明 2.0 版不是簡單少做了事,而是把更多上下文和工具結果合併到更少輪次裡處理。代價也很清楚,2.
0 版輸入 tokens 從 369,251 增加到 516,897,平均單次請求輸入從約 4,990 提高到約 11,237,幾乎是1.x 版的 2.25 倍;輸出 tokens 和推理 tokens 也都有增加。這說明 2.0 的內置指令更長,執行方式更像“大步少輪”:每次請求攜帶更多上下文、做更重的判斷,再減少來回切換和工具調用。這種變化對複雜任務有利,降低了碎片化決策和中途丟上下文的風險;但如果按實際計費折算,它不一定更省。最值得注意的是上下文壓縮,1.x 版在任務中觸發了 1 次 138,781 tokens 的壓縮,這意味著早期細節會被摘要替代,存在信息損失風險;2.
0 版全程沒有觸發壓縮,卻仍然完成了更長報告和網頁交付。這與 2.0 強調的狀態工程、SQLite 存儲和上下文管理方向相吻合。結合界面和產物看,2.0 的進步不在於把任務跑得更快,而在於讓長任務更少被打斷、更少依賴人工催促,也更容易被複盤。03OpenClaw 2.0 在進步,但依然不好上手這次對比之後,OpenClaw 2.0 的定位反而更清楚了,一個以消息入口為中心、自託管、模型中立的 Agent 網關,更適合希望把 AI Agent 接進消息工具、瀏覽器、終端、遠端機器、長期記憶和團隊協作流程的人。相比上一個版本 v2026.7.1-2,v2026.8.
1 的進步是真實存在的,把新手引導、任務面板、主機狀態、產物清單、信源分級和網頁交付都做得更清楚,讓一次長任務更像可以被託管和覆盤的工作流。從後臺數據看,新版減少了 LLM 請求次數和工具調用次數,沒有觸發上下文壓縮,說明它確實在用更集中的方式處理長任務,而不是隻換了一層界面。但 2.0 的門檻也同樣真實,安裝仍然需要命令行,Ubuntu 用戶仍然要處理 Node、npm、安裝腳本和權限配置;雲會話、共享會話、記憶、憑證管理這些能力也不是打開就自動變好,而是需要用戶理解它們的邊界。如果選擇 Openclaw 作為日常工作的助手,也意味著用戶要為系統複雜性付出學習成本。
那麼,OpenClaw 還剩下什麼?對比 ChatGPT、Claude Code、Kimi Code、Zcode 這類更成熟的交互產品比網頁界面更具有親和力,OpenClaw 並不佔優;如果只做單機編碼,也不是最省事的選擇。最後,真正剩下的就是自託管、模型中立、多入口連接、遠端執行、長期會話和團隊協作這些系統能力。因此,OpenClaw 2.0 不適合被簡單理解成“更好用的助手”,而是一個面向複雜工作流的 Agent 基礎設施,對媒體調研、投研分析、產品研究、技術管理這類需要長期檢索、整理、交付和覆盤的工作,OpenClaw 已經值得放進受控環境裡認真測試。OpenClaw 2.
0 還沒有把開源 Agent 的上手門檻真正打掉,但已經把 OpenClaw 從“能幹活的工具”,往“能長期託管複雜任務的系統”方向推了一步,雖然沒能讓所有普通用戶立刻上車,卻依然引導行業思考如何在小團隊內協作使用智能工具。▼推薦閱讀▼我們拆了 1.1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制2026-08-28唐傑說後訓練是關鍵,GLM 5.3 實測卻被自己的安全策略卡住了2026-08-22 原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 ai 大模型 評測 從 Codex Harness 開源,看 AI 公司的護城河是什麼?
...在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.
1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!最新文章 Muse爆火,dots入場:Personal Agent開始和互聯網平臺搶入口 實測 Qwen-3.8 與 GLM-5.3 的 Flash 版:誰能讓我提前下班半小時?從 Codex Harness 開源,看 AI 公司的護城河是什麼?
對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回 從海拉魯到現實世界:視頻模型如何理解「變化」 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 熱門搜索 Siri 上市 雲服務 增強現實 商湯 日本 deepseek 錘子手機 通用 高德 Nexus 7
Related
相關文章

實測 Qwen-3.8 與 GLM-5.3 的 Flash 版:誰能讓我提前下班半小時?
本文作者: 李娜 2026-09-30 16:28 導語:兩款 Flash 模型均能勝任辦公應用開發,但 GLM 偏工程完整性,Qwen 偏個人工作流設計,Flash 正從低價問答轉向承接高頻辦公工作流。2026 年 8 月 26 日,同一天,Qwen 發佈 Qwen3.

豆包AI個人助手獨立App實錘:定名“小豆”劍指全場景智能生態
據最新消息顯示,豆包此前在個人助理方向推進的探索項目(代號“Spell”)已正式定名為“小豆”,並且計劃推出獨立的App版本。這一名稱早在今年暑期就已經敲定。目前,該產品正處於緊鑼密鼓的內部測試階段,未來面向大眾的最終對外版本可能會根據實際測試情況進行調整,官方尚未公佈確切的上線時間。

從 Codex Harness 開源,看 AI 公司的護城河是什麼?
本文作者: 李娜 2026-09-30 16:24 導語:技術領先非護城河,開源意在沉澱轉換成本、規模與反饋。8 月 19 日,OpenAI 正式開源了 Codex Harness。這家公司名字裡的 Open,久違地兌現了一次。((公眾號:))長期深耕 Agent Harness 的開發者群體對該消息的普遍反饋是“振奮”。

智能眼鏡聲學性能測試規範 10 月 2 日起正式實施,圍繞“收音”“放音”兩大模塊建立標準化檢測流程
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 不一樣的體驗、火瓶座 的線索投遞!9 月 30 日消息,市場監管總局今日宣佈,JJF 2385—2026《智能眼鏡聲學性能測試規範》國家計量技術規範(以下簡稱《規範》)將自 10 月 2 日起正式實施,為智能眼鏡聲學性能檢測劃定統一技術標尺。

豆包宣佈支持出行服務:覆蓋訂機票、火車票以及打車導航
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖、files 的線索投遞!9 月 30 日消息,豆包宣佈支持多種出行服務,用戶現已可通過豆包一站式完成機票預訂、火車票購買、打車及路線導航等多種出行需求,覆蓋從長途交通到市內出行的全場景。

DeepSeek官方開源昇騰基礎組件,與昇騰共建高效易用的AI芯片軟件生態
DeepSeek於9月30日正式開源面向華為昇騰算力平臺的基礎設施組件,涵蓋TileLang編譯工具、高效能運算庫及分散式通信庫等,並提供DeepGEMM、FlashMLA、DeepEP等元件。此次開源被視為中國AI軟體生態的重要里程碑,透過與昇騰的深度合作,支援超低延遲推論與大規模訓練,實測通信效能接近硬體上限。華為也將聯合創新成果在CANN社群開源,期望打造開放、高效、易用的AI軟體生態。