首個面向LLM的蛋白突變排序標準化評測基準,哈佛大學團隊提出PG-LLM,一次性測評13款主流模型+95種專業模型

2026年8月5日 20:41
首個面向LLM的蛋白突變排序標準化評測基準,哈佛大學團隊提出PG-LLM,一次性測評13款主流模型+95種專業模型

重點摘要

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

站內 AI 整理稿

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作首個面向LLM的蛋白突變排序標準化評測基準,哈佛大學團隊提出PG-LLM,一次性測評13款主流模型+95種專業模型超神經HyperAI·2026年08月05日 20:30哈佛團隊測評通用大模型蛋白突變預測能力 哈佛大學和 Capable 的研究團隊提出了一項依託 ProteinGym 數據集構建的 PG-LLM 基準測試,並首次在統一評價維度中同時測評了 13 款通用語言模型和 95 種專業蛋白質預測工具。 還記得第一次與 ChatGPT、豆包聊天時所感受到的震撼嗎? 依託通用語言模型搭建的它們似乎無所不知,不僅能詩善對、通曉時事,還可以作畫、寫信、編代碼。 然而對於這樣一個在文化、藝術、科學等全領域似乎「無所不能」的智慧助手,越來越多的科學家心中出現了一個疑問:通用語言模型在知識壁壘高築的專業領域究竟能有何表現? 以蛋白質工程而言,當前通用語言模型憑藉在生物知識和推理基準測試中的性能提升,已經越來越頻繁的在蛋白質設計流程中亮相,然而科學家對於其評估蛋白突變效應的能力目前卻尚無明確的認識。 雖然一些技術報告已經展示了部分通用語言模型的測評效果,如 Anthropic 系統技術報告中提及的 ProteinGym-Hard 評測,評估了 Claude 系列模型。 但這些研究仍存諸多問題,比如模型群體單一,缺乏橫向對比驗證等等。 針對於此,來自哈佛大學和 Capable 的研究團隊提出了一項依託 ProteinGym 數據集構建的 PG-LLM 基準測試,並首次在統一評價維度中同時測評了 13 款通用語言模型和 95 種專業蛋白質預測工具。 通過 PG-LLM 基準測試驗證,科學家首次明確了通用語言模型確實能做蛋白突變篩選,具有高度的實用價值,且性能已優於至少半數的成熟專業預測工具。

Related

相關文章

量子位生成式AI

別再吹AI生圖了,不能圖層編輯的AI都是“畫餅”

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 別再吹AI生圖了,不能圖層編輯的AI都是“畫餅” 思邈 2026-08-05 22:09:18 來源:量子位 兔展智能發佈RabbitVis,讓AI真正走完設計全流程 允中 發自 凹非寺 量子位 | 公眾號 QbitAI 過去兩年,AI大模型幾乎重塑了整個內容生產行業。 聊天、寫代碼、生成圖片、製作視頻……越來越多過去依賴專業技能完成的工作,開始被AI接管。 視覺領域同樣如此。 從最初的“六指琴魔”,到如今能夠生成複雜海報、真實UI、高密度中文排版,視覺AI大模型的能力不斷刷新著行業認知。 AI會畫圖,已經不是新聞,真正值得討論的是,當大模型越來越強以後,它還能做什麼? RabbitVis正式上線,立即體驗AI設計生產工具:https://rabbitvis.rabbitpre.com/ 點擊文末“閱讀原文”,加入官方社區,與更多用戶一起探索AI設計生產的新方式。 過去幾年,視覺AI的發展正在從單純的內容生成,走向對圖像、空間和結構的更深層理解。 對於AI而言,生成只是開始,如何理解視覺內容,並將這種能力應用到真實場景中,成為下一階段探索的重點。 此前,兔展智能聯合北京大學、鵬城實驗室研發的UniWorld-View登頂WorldScore世界模型榜單,展現了團隊在視覺AI領域的技術積累。 基於多年視覺AI技術積累,兔展智能將AI大模型能力轉化為實際應用。 面向設計生產場景,兔展智能研發了UniWorld-Design,進一步強化了視覺生成與編輯能力的結合,並基於此打造了產模一體戰略的重要產品——RabbitVis。 AI正在從通用能力競爭,進入場

剛剛
IT之家生成式AI

中國聯通:智算規模達 45EFLOPS,今年算力相關投資將超 175 億元

首頁 > 智能時代>人工智能 中國聯通:智算規模達 45EFLOPS,今年算力相關投資將超 175 億元 2026/8/5 21:41:05 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 5 日消息,中國聯通今日宣佈,截至目前,中國聯通標準機架規模超過 110 萬架,建成 7 個百兆瓦級 AIDC 園區,智算規模達到 45EFLO。

剛剛

每週2億年輕人用ChatGPT,卻連高手的零頭都沒用出來

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

AI到底是什麼

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業。

剛剛

前線共創,雙向賦能:FDE 模式行業觀察與實踐報告

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
全天候科技生成式AI

字節推出SeedRealtime音視頻全雙工大模型,已在豆包App全量上線

字節跳動近日正式推出名為 SeedRealtime 的音視頻全雙工大模型,該模型已於旗下 AI 對話產品豆包 App 中完成全量上線。這項新技術讓用戶在與 AI 互動時,能夠同時進行語音與視訊訊號的即時收發,不再需要等待一方說完再回應,實現更接近人類自然對話的雙向交流體驗。

剛剛