辦公 Agent 爆火,模型大戰進入下一階段

重點摘要
中國三大互聯網巨頭阿里、騰訊、字節跳動在短短兩個月內同步整合其辦公Agent產品,顯示AI行業已從模型競爭進入入口與生態爭奪階段。阿里將旗下三款Agent產品合併為「千問辦公」,整合桌面、雲端及企業協作能力,並結合釘釘與阿里雲基礎設施,企圖搶佔企業級AI辦公的統一入口。
從今年6月到8月初,短短不到60天內,中國三大網路巨頭不約而同地展開了內部辦公Agent產品的整合行動。6月,阿里率先啟動內部Agent產品線與能力的大規模整併,並在8月3日正式宣布推出Qwen3.8模型,同時將旗下三款Agent產品——QoderWork、悟空、MuleRun——合併為統一的「千問辦公」。緊接著,7月20日,騰訊將QClaw的相關業務與團隊併入WorkBuddy體系。7月30日,字節跳動宣布飛書產品團隊整體併入豆包,飛書負責人謝欣改向豆包負責人趙祺彙報。三家企業雖然組織架構、產品積累與市場優勢各有不同,卻在相近時間點做出相似的整合決策,這顯然不是巧合。 更合理的解釋是,AI行業走過摸索期後,已進入入口爭奪的關鍵階段。過去,大廠需要透過多個團隊分別驗證桌面操作、雲端執行與企業協作等不同路線;如今,主要產品形態逐漸清晰,競爭重點從「能否做出Agent」轉向「誰能成為用戶與企業的統一入口」。千問辦公作為這波收束中最新的落地產品,正好成為觀察行業變化的最佳樣本。 阿里此次的能力重組,將先前分散在模型、桌面端、雲端與企業協作場景中的積累,整合進一款獨立產品。同時,它也集中體現了企業Agent競爭中的幾個關鍵問題:內部賽馬為何在此時結束?企業即時通訊(IM)與雲端服務為何成為Agent的底層資產?模型、產品與真實任務如何形成共同進化的閉環?讀懂千問辦公,就能掌握企業級Agent真正的賽點。 大廠為何幾乎同時開始整合Agent產品?以阿里為例,今年年初同時保留QoderWork、悟空與MuleRun是合理的,因為三款產品分別測試本地執行、企業協作與雲端運行三種路線。QoderWork在用戶電腦上處理本地文件;悟空試圖進入釘釘的企業帳號與權限體系;MuleRun則從一開始就運行在雲端,能長時間執行任務,且已進入海外市場,截至今年5月服務43個國家和地區的企業與用戶,其中單月付費超過200美元的用戶占比達34%。在市場尚未定型時,多線測試有助於快速找到方向。 然而,試錯期不會永遠持續。今年上半年,行業對通用Agent的理解出現明顯變化。Anthropic發現許多非技術員工會繞過普通聊天界面,直接使用Claude Code整理文件、處理表格與完成多步驟知識工作,於是推出Cowork,保留任務執行能力但改用更適合一般知識工作者的互動方式。同樣的變化也發生在OpenAI身上:部分用戶在ChatGPT處理編程問題,另一部分則在Codex完成報告、圖片與數據處理等非編程任務,聊天、編程與辦公之間的產品邊界被用戶主動打破。7月下旬,OpenAI將獨立運行近一年的Codex併入ChatGPT桌面客戶端,實現三端合一。 千問辦公的誕生,正是阿里三場實驗驗證過的能力重新組合。桌面端繼承本地文件與電腦操作能力,雲端承接長任務、資源調度與多模態生成,企業端則繼續進入組織身份、權限與業務系統。透過將分散的產品能力與反饋數據集中到一個入口、一套工程體系與一個迭代閉環中,阿里得以加速產品迭代。用戶在用腳投票,市場也沒有留下太多繼續分散試驗的時間。易觀分析發布的二季度報告顯示,2026年6月,17款主流桌面端AI辦公智能體的合計訪問量已超過6000萬次,其中騰訊系、字節系與阿里系產品相加約為5622萬次,留給其他玩家的市場不到500萬次。技術路線逐漸確定,頭部效應開始出現,分散反而成為資源分配的負擔。 工程層面也是如此。過去,模型每升級一次,三支團隊都要針對任務規劃、上下文管理、工具調用、失敗重試、權限控制重新適配,造成不必要的重複勞動。千問辦公正是在這個分秒必爭的背景下誕生。 目前市場上多數通用辦公Agent首先解決的是個人生產力問題,例如讀取用戶電腦文件、分析個人文檔、整理個人日程、調用有限的外部工具。但這些僅是個人上下文的疊加,並不等於企業上下文。企業內所有人的效率相加,也不等於企業效率。給每位員工配置一個更聰明的個人助手,可以提高局部產出,卻未必能改善整體信息流轉、任務協同,以及將個人結果轉化為組織行動的效率。 企業面對的是另一類問題。企業不是個人帳號的簡單集合,所有員工的文件、對話與任務相加,也不會自動變成企業的運行方式。同樣一份文件,個人Agent可能只視為需要總結的材料,但企業Agent還需考慮誰可以閱讀、誰需要確認、結論應同步給哪些部門,以及後續任務必須經誰批准。這是企業級Agent與個人辦公Agent最根本的區別。在相似的整合背景下,中美大廠的邏輯也出現明顯差異:OpenAI與Anthropic主要在合併聊天、編程與桌面執行入口,而中國大廠的整合範圍則涵蓋了釘釘、飛書等企業協作軟體,並讓雲端服務成為Agent底層能力的一部分。 體現在產品層面,豆包產品線融合飛書的同時,也與火山引擎深度結合;千問辦公合併了主攻釘釘場景的悟空,同時繼承阿里雲在企業級服務市場上關於行業認知、數據管理、資源調度的全方位資源。這意味著Agent開始吸收IM與雲,把它們變成底層基礎設施。傳統辦公軟體按功能劃分世界,但真實世界中,用戶要完成一個目標需要組合多種工具,Agent也是如此。過去十多年,整合了溝通、員工身份、組織關係、協作網絡、文件、會議、審批、權限與各種企業應用連接的釘釘式IM,因其功能最多且包含完整組織上下文,已成為Agent時代最底層的能力支撐。 在實際測試中,千問辦公能夠在自建的釘釘組織群中模擬選題討論,總結要點並提取待辦事項。它不僅從對話中識別出五條待辦,每條正確分配負責人,還對緊急事項標註「較高」優先級與「即將截止」,並直接寫入釘釘的待辦系統。對外部第三方Agent來說,透過連接器讀取群訊息、生成摘要或完成投研、網頁製作、表格處理並不困難,真正的難點在於寫回:創建待辦、調整日程、發送郵件、提交審批,或將任務分配給正確的人。讀取只需要接口,寫回需要更高的信任,企業必須確定Agent能看到什麼、能替誰操作、哪些步驟需要審批,以及發生錯誤後如何追溯與撤銷。過去十多年,釘釘為Agent積累的不僅是工具,更是信任與企業級上下文的護城河。 再將眼光收斂到國內一線玩家,阿里在這場競爭中還擁有一項少見的條件:同時擁有一線大模型、企業協作平台與雲端運算基礎設施。但模型與應用都在自己手中並不會自動轉化為優勢,只有模型與Agent能夠相互提供反饋時,這種組合才真正有價值。因此,在推出千問辦公的同日,阿里低調發布了在編程與專業辦公能力大幅提升的Qwen3.8模型。這背後邏輯在於,在生產環境中,Agent能為模型提供比聊天記錄更有價值的反饋,而模型又能一勞永逸地解決Agent中的底層問題。 許多Agent產品中看似發生在應用層的問題,根源其實在模型層。例如模型選錯工具,產品團隊可以增加調用規則解決;模型在長任務中忘記最初要求,團隊可以再套一層工作流。這些應用上的修補能降低錯誤率,卻無法改善模型本身的判斷與認知能力。OpenAI推出Codex時,沒有只是為通用模型接入代碼編輯器,而是訓練了面向軟體工程任務的codex-1,使用真實編程任務進行強化學習,能讀取與修改文件、運行測試,並根據結果繼續調整直到通過,一舉改善開發者在編程任務中的大量問題,成為OpenAI在編程領域逆襲的關鍵。 模型解決了Agent的底層能力問題,Agent也為模型帶來比聊天記錄更完整的反饋。對OpenAI與千問系列模型來說,Agent留下的完整行動軌跡,可以告訴模型它如何理解目標、制定了什麼計劃、調用了哪些工具、在哪一步偏離要求、用戶修改了什麼,以及最終產物是否真的被使用。尤其在代碼任務中,能否運行、測試是否通過、文件是否正確修改,通常可由機器驗證。這些真實企業任務中的失敗軌跡又能反饋給模型,成為模型迭代的動力。最終,Agent為模型提供真實任務反饋,模型為Agent提供更強的判斷能力,兩者構成持續運行的飛輪系統。 當然,千問辦公此次整合完成,並不意味著阿里關於Agent的探索從此可以高枕無憂。但它至少說明阿里已經找到了自己的主線。當越來越多Agent都能製作PPT、分析表格、控制瀏覽器時,各種面向消費者的Agent功能差異會快速縮小。未來真正的差距,將來自產品背後的系統能力:它掌握多少企業上下文,能夠獲得多大的執行權限,又能否把每一次Agent真實任務變成下一次模型升級的依據。在這個過程中,IM的上下文、基礎設施的基礎能力,以及模型與Agent的飛輪,三者缺一不可。千問辦公,已經拿到了半張門票。
Related
相關文章

消息稱小米第二代 AI 眼鏡延遲到 Q4 或明年發佈,相關負責人否認
外傳小米第二代AI眼鏡因外觀設計問題可能延遲至Q4或明年發布,但小米相關負責人已否認此消息,稱報導不實。首款產品已於去年6月上市,售價1999元起,小米在中國智能眼鏡市場市佔率達28%。
白宮 AI 評估框架完成卻秘而不宣:連企業都看不到全文,開源議題再成焦點
AI資訊AI新閒資訊正文白宮 AI 評估框架完成卻秘而不宣:連企業都看不到全文,開源議題再成焦點發布於AI新閒資訊時間 :Aug 5, 2026閱讀 :1分鐘據消息人士透露,美國白宮並不計劃向公眾公開其最新制定的先進 AI 模型評估框架。這一自願性框架對全球 AI 安全領域具有深遠影響,但具體細節將僅向參與制定過程的相關企業提供。
像素原生RAG:視覺文件索引實戰指南
在本教學中,我們從零建構完整的像素原生檢索增強生成管線,探討如何在不依賴傳統HTML解析、文字萃取或固定區塊切割策略的情況下進行文件檢索。我們將網頁與PDF文件渲染為圖像,分割成重疊區塊,使用SigLIP、CLIP或可選的Qwen3-VL後端生成多模態嵌入,並將結果向量儲存於FAISS索引中以實現高效相似度搜尋。我們也透過基於OCR的BM25評分與互逆排名融合強化檢索,將區塊層級證據彙整為文件層級結果,並透過FastAPI搜尋服務公開系統。過程中,我們使用Recall@k與平均互逆排名評估檢索品質,並訓練輕量級殘差網路。

中國版「生物DeepSeek」誕生,4個牛津學霸,讓AI接管生命科學
這篇消息聚焦「中國版「生物DeepSeek」誕生,4個牛津學霸,讓AI接管生命科學」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

老黃壘20年的CUDA護城河,AI剛剛用10小時鑿開了
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。
