當Agent成為職場和實驗室的重要搭子

2026年7月8日 08:36
當Agent成為職場和實驗室的重要搭子

重點摘要

OpenAI和Google DeepMind近期報告顯示,AI Agent正從單次互動轉變為能長時間自主執行複雜任務的工具。OpenAI內部的Codex已佔據公司每週輸出token總量的99.8%,非開發人員使用量也大幅增長。Google DeepMind的Co-Scientist多智能體系統則在科研領域協助科學家加速假設生成與驗證,已產生實質性成果。

站內 AI 整理稿

AI Agent 正在從實驗室走入職場與科研一線,成為人類工作中不可或缺的協作夥伴。近日,OpenAI 與 Google DeepMind 先後發布報告,揭露這項技術如何從根本上改變知識工作的底層邏輯,並拓展人類能觸及的工作邊界。OpenAI 以自身公司為樣本,記錄了旗下 AI Agent 工具 Codex 如何在不到一年內從邊緣工具躍升為全公司核心生產力平台;而 Google DeepMind 則在《自然》雜誌上發表了 Co-Scientist 多智能體系統,展示 AI Agent 如何在真實科研中加速假設生成與驗證,甚至催生具體科研成果。

OpenAI 在報告開頭便點明:「AI Agent 正在重新定義知識工作的基本單元——從單次交互,變為可以託付出去、長時間自主執行的任務。」報告指出,Agent 如今能獨立運行數小時,過程中調用工具、與外部環境互動、持續迭代,直到完成任務。這項能力躍升,讓 Agent 成為職場中最強大的 AI 工具,而 OpenAI 內部正是觀察這場變革的最佳樣本。Codex 對外發布後最初幾個月,即便在 OpenAI 內部,員工仍習慣使用 ChatGPT 作為預設 AI 工具。直到 2025 年 8 月,普通員工花在 Codex 上的 token 使用量還不到 10%。

但此後局面迅速逆轉,到了 2026 年,Codex 已成為 OpenAI 每個部門的主要 AI 工具——不只是工程師,法務、財務、招聘等非技術部門同樣大量採用。目前 Codex 佔據 OpenAI 內部每週輸出 token 總量的 99.8%,OpenAI 認為這趨勢反映了未來工作的普遍走向:隨著 Agent 工具能力增強、門檻降低,這將成為常態。從任務時長來看,變化尤為明顯。報告估算 Codex 請求所對應的「人工時長」,到 2026 年 5 月,80.6% 的用戶曾向 Codex 提交過需要人類工作超過 30 分鐘才能完成的任務,70.

2% 的用戶提交過對應人工時長超過 1 小時的任務,而對應超過 8 小時工作量的任務,增速最快。早期 Codex 多用來快速回答問題、生成程式碼片段;但現在,用戶開始委託它整塊的工作——調研、分析、搭建流程。OpenAI 表示,隨著 Codex 處理長上下文、獨立作業的能力不斷提升,用戶的使用習慣從短平快交互轉向更複雜、週期更長的任務委託。另一方面,工作的可能邊界也隨之拓展。程式設計師率先擁抱 Codex 並不意外,但報告顯示,自 2025 年 8 月以來,個人用戶中非開發者的使用量增長了 137 倍,企業用戶中非開發者增長了 189 倍。

在其他職能部門(非程式設計師的技術崗位)中,員工使用 Codex 產出的內容有超過四分之一屬於工程或程式設計類工作。過去需要請技術團隊支援才能完成的自動化、數據處理、工具搭建、調試等任務,現在非程式設計師員工自己就能委託給 Agent 來做。OpenAI 強調,當人們能順暢使用強大的 Agent 工具,他們會自然地將其用於時間更長、難度更高、跨越更多職能邊界的工作,這很可能就是未來工作的樣貌。

如果說 OpenAI 的報告描繪了職場中知識工作交付方式的轉變,那麼 Google DeepMind 在《自然》雜誌上發表的 Co-Scientist 研究,則展示了 AI Agent 如何在科研領域發揮實質性作用。Google DeepMind 表示,Co-Scientist 的核心目標是解決科研中「大海撈針」般的難題——在浩瀚資訊中找到正確的科研假設,因為每一項重大科學突破往往始於一個正確的假設。該系統基於 Gemini 構建,是一個多智能體系統,由多個專職 Agent 協作,模擬科學思維的完整循環:生成假設、批判審查、迭代進化。

Co-Scientist 的運作流程分為生成、辯論、進化三個階段。首先由 Agent 提出初始假設並進行多樣性聚類,接著由「虛擬同行評審者」對假設展開批判性評估,最後持續優化排名靠前的方向,輸出供研究者審閱的研究提案。整個系統由一個「督導 Agent」統籌協調,將高層研究目標拆解為可執行步驟,驅動多個 Agent 並行探索。最具特色的設計是驗證假設的方式——系統借鑑 AlphaGo 和 AlphaStar 的競賽機制,讓 Agent 們進行科學辯論。

所有候選假設投入一場「創意錦標賽」,透過兩兩對比和模擬辯論不斷篩選、淘汰、進化,同時深度比對科學文獻與專業數據庫,確保每個留下來的假設在邏輯上站得住腳、在事實上有據可查。計算資源的大頭正是投入在驗證環節。報告中記錄了多個真實案例,展示 Co-Scientist 已產生的具體影響。例如,有科學家團隊藉助 AI Agent 加速了肝纖維化治療方案的探索,發現了此前被忽視的藥物;另有團隊在細胞衰老逆轉研究中,將分析龐大篩選數據集的時間從數月壓縮至數天;還有衰老生物學領域的企業,利用該系統生成出新的假設,後來在實驗室中獲得驗證。

參與研究的科學家表示,AI Agent 出現在科研工作中最重要的好處是提高效率,由此大幅縮短實現科學突破所需的週期。Google DeepMind 在官方部落格強調,他們的 AI Agent「旨在成為研究夥伴,而非科學或臨床專業知識的替代品」。與此同時,OpenAI 在報告中強調 AI Agent 不只是讓人們的工作「提速」,而是擴大每個人能夠觸及的工作半徑。兩家公司都聚焦於人類如何與 AI Agent 協作,從而完成更複雜的任務。然而,協作的邊界不可避免地會被持續重新劃定。當 Agent 能夠承接原本需要專業技能的任務,工作流應該如何重新設計?

當職能邊界開始鬆動,什麼樣的能力會變得更有價值、什麼樣的會被重估?當科研假設的生成速度以數量級提升,哪些領域會率先迎來突破?這些問題的答案,將決定人類應該把時間和精力放在哪裡。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

4 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

9 小時前