首個面向LLM的蛋白突變排序標準化評測基準,哈佛大學團隊提出PG-LLM,一次性測評13款主流模型+95種專業模型

重點摘要
隨著 ChatGPT、豆包等通用語言模型普及,這類工具在文化、藝術、科學等領域展現出驚人的能力,讓許多人不禁開始思考:這些看似「無所不能」的智慧助手,一旦面對知識壁壘高聳的專業領域,究竟還能發揮多少實力?以蛋白質工程為例,近來通用語言模型憑藉在生物知識與推理基準測試上的持續進步,已逐漸被納入蛋白質設計流程。然而,學術界對於這類模型評估蛋白突變效應的真實能力,始終缺乏系統性的認識。
隨著 ChatGPT、豆包等通用語言模型普及,這類工具在文化、藝術、科學等領域展現出驚人的能力,讓許多人不禁開始思考:這些看似「無所不能」的智慧助手,一旦面對知識壁壘高聳的專業領域,究竟還能發揮多少實力?以蛋白質工程為例,近來通用語言模型憑藉在生物知識與推理基準測試上的持續進步,已逐漸被納入蛋白質設計流程。然而,學術界對於這類模型評估蛋白突變效應的真實能力,始終缺乏系統性的認識。
儘管部分技術報告曾揭示特定通用語言模型的測評結果,例如 Anthropic 在其系統技術文件中所展示的 ProteinGym-Hard 評測,針對 Claude 系列模型進行了測試,但這類研究普遍存在模型群體過於單一的問題,缺少跨品牌的橫向對比與驗證。換句話說,科學家無法從少數案例中判斷通用語言模型在蛋白突變排序這項任務上的整體表現。為了解決這個缺口,哈佛大學與 Capable 研究團隊聯手提出了一套名為 PG-LLM 的標準化基準測試。該基準完全依託 ProteinGym 數據集建構,目的是在統一的評價維度下,同時衡量通用語言模型與專業蛋白質預測工具在蛋白突變效應排序上的表現。
這是學界首次將通用語言模型與專業領域工具放在同一平台上進行大規模比較。在這次測評中,研究團隊一口氣納入了 13 款通用語言模型,其中包括 Claude 系列等業界代表性模型,以及高達 95 種專業蛋白質預測工具。PG-LLM 基準透過一致的評估流程與指標,讓兩類模型能在公平的條件下互相競技,從而揭示通用模型在專業任務中真正的定位。測評結果令人矚目:透過 PG-LLM 基準的驗證,科學家首次明確確認通用語言模型確實能夠勝任蛋白突變篩選任務,且具有高度的實用價值。
更重要的是,這些通用模型的整體表現已經超越了至少半數成熟專業預測工具,意味著它們不僅能當作「聊天機器人」,更能在高度專業的生物工程領域提供可靠的預測協助。這項發現對於蛋白質工程領域具有深遠的意義。過去,研究人員若要預測蛋白突變對功能造成的影響,通常需要倚賴專門設計的模型,這類模型往往需要大量標註數據與領域知識才能開發。現在,通用語言模型不僅可以直接拿來使用,還能達到不亞於專業工具的成績,大幅降低了蛋白質設計的技術門檻。PG-LLM 基準的推出也填補了現有評測體系的空白。過去由於缺乏統一的評測平台,不同研究團隊所報告的模型效能往往難以直接比較,甚至可能因數據集與評估方式不同而出現矛盾結果。
PG-LLM 作為首個專門針對蛋白突變排序的標準化基準,未來可望成為業界通用的參考標準,幫助研究人員更客觀地篩選與比較各類模型。值得注意的是,雖然通用語言模型在本次測評中展現出不俗的實力,但研究團隊也指出,專業預測工具在特定任務族群中仍保有領先優勢。因此,在實際應用中,研究人員可以根據任務特性選擇最適合的工具,或是結合兩類模型的優勢來提升預測準確度。從更宏觀的角度來看,這項研究不僅回答了「通用語言模型在專業領域能否派上用場」的疑問,更為語言模型在其他科學分支的應用鋪平了道路。倘若通用模型能像這次測試一樣,在化學、材料、醫學等領域也能高效勝任,未來的科學研究模式可能迎來根本性的改變。
總結來說,哈佛大學與 Capable 團隊提出的 PG-LLM 基準測試,不僅提供了一個透明、可重複的評測框架,也證明了通用語言模型在蛋白突變排序上的能力已然成熟。這項成果對於加速蛋白質工程流程、降低研發成本,以及推動 AI 在生物科技中的應用,都具有實質的貢獻。隨著更多通用模型問世與持續優化,未來這一領域的進展值得密切關注。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。