登上Science,華人科學家推出通用生物醫學AI Agent,真實科研表現接近人類專家

重點摘要
華人科學家團隊在《科學》期刊發表通用生物醫學AI Agent「Biomni」,能自主拆解任務與調用工具,在真實科研任務中表現接近人類專家且用時更短。Biomni可解讀多模態數據、優化蛋白質穩定性、協調溼實驗室儀器,並生成可驗證的實驗方案。
由華人青年科學家黃柯鑫團隊主導、並與多位合作者共同開發的通用生物醫學 AI Agent——Biomni,於今日凌晨正式登上權威學術期刊《Science》。這項研究展示了一種不依賴固定工作流程模板的智慧型代理系統,能根據研究者提出的問題,自動拆解任務、調用對應工具,協助完成多樣化的生物醫學研究工作。根據論文描述,Biomni 在遺傳學、基因組學、藥理學等不同領域的任務上展現出強大的泛化能力,在部分真實科研情境下的表現已接近人類專家,且完成時間大幅縮短。
不同於過去僅專精於單一領域的生物醫學代理,Biomni 從架構上建立了一個統一的生物醫學動作空間,主要由兩個核心組件構成:Biomni-E1 與 Biomni-A1。Biomni-E1 是執行環境,負責整合科研常用的工具、資料庫與軟體,將其轉化為可供呼叫與組合的資源。團隊從 bioRxiv 定義的 25 個生物醫學主題中,各選取 100 篇近期論文,共分析 2500 篇文獻,經由動作發現代理逐篇提取復現或開展研究所需的任務、工具與實驗方案,再經人工驗證後整理成可執行的環境,允許後續代理透過 Python、R 和命令列進行呼叫。
Biomni-A1 則是實際在該環境中運作的代理,根據研究問題動態篩選資源、規劃流程並執行任務。具體流程包含資源選擇、程式碼執行與自適應規劃三個環節:代理會根據使用者目標,從眾多生物醫學工具與資料庫中選出最相關的資源;接著以程式碼作為統一介面,串聯工具呼叫、資料查詢與分析步驟;最後,代理會先基於生物醫學知識生成初始計劃,並在執行過程中依據中間結果不斷修正後續步驟,使流程更貼近當前的任務需求。在通用生物醫學研究基準測試中,Biomni 的表現明顯優於多個基線模型。
根據 Biomni-Eval1 的結果,Biomni 在平均準確率上取得最高成績;即便使用相同的 Biomni-E1 環境,ReAct 生物資訊學代理的表現仍不如由 Biomni-A1 驅動的系統,證明其能力不僅來自資源整合,更來自代理架構本身。研究團隊進一步使用 Humanity’s Last Exam 的生物醫學子集 HLE-Bio 進行泛化能力測試,結果顯示,當多款前沿大型語言模型接入 Biomni-A1 架構與 Biomni-E1 環境後,準確率約提升 6% 至 12%,說明 Biomni 的效能主要由架構與環境支撐,而非依賴單一底層模型。
在與人類專家的對比中,Biomni 的整體準確率接近專家水準,同時分析速度明顯更快。特別是在罕見病診斷與全基因組關聯分析(GWAS)任務中,原本需要專家花費一到兩小時完成的分析,Biomni 僅需幾分鐘即可產出結果。研究團隊也透過多個真實案例驗證其能力,證明 Biomni 不僅能完成計算分析,還能提出假說、輔助實驗方案設計、整合完整工作流程,並將部分實驗流程轉化為可運行的程式碼。在提出假說方面,Biomni 具備從複雜資料中自動生成可驗證生物學假說的能力。
例如,它能從穿戴式裝置收集的睡眠數據中,發現睡眠結構、效率與品質相關的規律;也能在人類胚胎骨骼發育的多組學數據中,復現已知的成骨調控關係,並提出候選轉錄調控因子,解析骨骼譜系的轉錄調控機制。在輔助實驗方案設計部分,研究團隊測試了分子克隆任務:Biomni 產出端到端的克隆方案與質粒圖譜,經盲法評審結果接近人類專家,優於人類受訓者。隨後,研究人員按照 Biomni 設計的 B2M sgRNA 克隆方案進行溼實驗,第二天即獲得菌落,兩個菌落的測序結果均顯示 sgRNA 插入正確,證實該方案具備實際可行性。
在整合完整工作流程方面,團隊以蛋白質熱穩定性優化任務為例:研究者只需提供蛋白質序列,並提出「提高熱穩定性」的目標,Biomni 便會自動選擇並組合 AlphaFold-2、ThermoMPNN 與文獻檢索等資源,預測蛋白質結構、評估序列熱穩定性,並結合結構資訊與既有文獻提出候選突變。至於實驗自動化任務,Biomni 展示的是將自然語言實驗需求轉化為機器人可執行程式碼的能力。研究者只需描述實驗內容,並說明所使用的液體處理平臺,Biomni 便能選擇 PyLabRobot 作為自動化介面,根據硬體配置生成可執行程式碼,讓機器人按照方案執行實驗操作,直接將研究者的實驗意圖連結到實際的自動化執行流程。
研究團隊也嘗試透過強化學習進一步提升 Biomni 在專門任務上的表現。雖然 Biomni 具備良好的泛化能力,但在若干專門任務上仍未能達到專家水準。團隊因此訓練了開源模型 Biomni-R0,讓模型在 Biomni-E1 環境中與工具、資料庫及任務流程互動,並使用專家標註的獎勵訊號最佳化任務完成效果。結果顯示,經過強化學習後,開源 Biomni-R0 的專門任務表現明顯提升:8B 版本的平均任務得分從 0.32 提高到 0.59,超越 Claude 4 Sonnet 的 0.56;32B 版本進一步提高到 0.67,涵蓋實驗設計、基因與變異分析、資料庫查詢和疾病診斷等多類任務。
儘管成果亮眼,研究團隊也坦承 Biomni 仍有不足之處。首先,現有評估任務僅涵蓋部分生物醫學研究領域,許多關鍵子領域尚未充分測試;動作發現階段主要依賴近期文獻,可能遺漏一些已淡出當前討論、但仍具長期價值的基礎概念與經典技術。未來需要納入更多生物醫學子領域、真實任務場景及更廣泛的文獻來源。其次,Biomni 在複雜多步驟任務中仍依賴較明確的結構化提示,例如在多組學分析時,提前寫明關鍵分析步驟有助於提升結果穩定性與可再現性,但系統尚無法自動補足複雜分析中的領域知識與分析慣例,規劃與推理能力仍有提升空間。
此外,Biomni 在不同任務上的表現不均衡:在資料庫查詢、序列分析與分子克隆等任務上已接近人類水準,但在需要細緻臨床判斷、實驗推理或深層生物學綜合的任務中仍有不足,團隊認為可透過強化學習進一步強化規劃與執行能力,並整合更多文字、圖像及結構化數據等多模態資訊。最後,研究團隊也提出,生命科學 AI Agent 可能帶來生物安全問題。由於這類系統能夠綜合文獻、生成實驗方案並執行自動化分析,可能使生物知識更容易被濫用。團隊強調,未來必須堅持開放透明、嚴格評估,並與生物安全及政策社群保持溝通,在擴大科研收益的同時降低潛在風險。
整體而言,這項研究為生物醫學研究開啟了一個充滿前景的方向:AI Agent 有望與人類科學家共同協作,輔助完成繁雜的研究與實驗,加速基礎研究向應用的轉化。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。