基於超1萬腫瘤樣本訓練,哈佛醫學院等提出泛癌症基礎模型COMPASS,平均性能優於22種現有方法

重點摘要
哈佛醫學院等團隊提出泛癌症基礎模型COMPASS,基於33種癌症類型、超過1萬個腫瘤樣本訓練。該模型在16個臨床隊列中平均預測準確率優於22種現有方法,提升8.5%,且能跨癌種與跨治療方案進行預測,有助於免疫治療響應評估。
哈佛醫學院攜手羅氏製藥與浙江大學的研究團隊,近日發表了一項名為 COMPASS 的泛癌症基礎模型,該模型基於來自 33 種癌症類型的超過 1 萬個腫瘤樣本進行訓練,並在涵蓋 7 種癌症、6 種免疫檢查點抑制劑的 16 個臨床隊列中驗證其預測能力。結果顯示,COMPASS 的平均性能優於 22 種現有方法,在不同隊列中平均將預測準確率提升了 8.5%,精確率-召回率曲線下面積(AUPRC)也提升了 15.7%。這項研究已刊登於頂尖期刊《自然·醫學》。免疫檢查點抑制劑(ICIs)在過去十餘年間徹底改變了癌症治療格局,但並非所有患者都能從中獲益。
即使接受同一種藥物治療,不同患者的療效差異仍然顯著:部分患者可獲得長期緩解,另一部分則幾乎毫無反應。因此,提升對免疫治療響應的預測能力,並找出影響治療效果與耐藥的關鍵機制,已成為實現個體化治療與改善患者預後的核心課題。目前臨床上用於預測免疫治療療效的生物標誌物,如腫瘤突變負荷(TMB)與 PD-L1 免疫組織化學檢測(IHC),雖然已部分納入決策參考,但存在明顯侷限。隨著高通量測序技術成熟,RNA 測序(RNA-seq)提供了一種觀察腫瘤免疫狀態的新視角,然而要從數萬個基因表達數據中篩選出真正與治療響應相關的生物學規律,仍是一大挑戰。
在此背景下,研究團隊開發了 COMPASS 模型,期望透過人工智能從大規模轉錄組數據中學習複雜的免疫模式。為了建立具備泛化能力的模型,研究團隊並未侷限於單一癌種或單一臨床試驗,而是整合了多個公開數據庫的轉錄組數據與免疫治療隊列。在預訓練階段,團隊使用了癌症基因組圖譜(TCGA)中的泛癌種 RNA 測序數據,初始樣本數達 11,274 個、基因數 60,660 個,經過篩選去除正常組織、既往治療樣本與非福爾馬林固定石蠟包埋樣本後,最終選定 15,672 個蛋白編碼基因作為模型輸入。
隨後,為了訓練模型預測免疫治療響應,團隊進一步收集了 16 個臨床隊列中共 1,133 名患者的治療前整體 RNA 測序數據以及臨床治療結果。這些隊列涵蓋膀胱癌、腎透明細胞癌、黑色素瘤、肺腺癌、肺鱗癌、胃癌與膠質母細胞瘤等 7 種癌症類型,治療方案則包括抗 PD-1/PD-L1、抗 CTLA-4 以及聯合治療。隊列規模從 16 人到 298 人不等,患者依治療結果分為響應者(346 人,佔 30.5%)與非響應者(787 人,佔 69.5%),數據涵蓋了不同癌症適應症、治療方案、測序平臺與研究設計所帶來的高度異質性。
COMPASS 是一種能夠跨癌種應用的基礎模型,採用概念瓶頸 Transformer 架構,將患者的轉錄組數據透過一系列人類可理解的生物學概念進行映射。模型主要由三部分組成:首先是以 Transformer 為基礎的基因語言模型(GLM),將每個基因視為一個「token」,透過可學習的基因位置偏置來學習基因之間的上下文關係;其次是分層投影器,建立「基因→基因集→概念」的層級映射,涵蓋免疫細胞類型、信號通路等 44 個免疫相關概念;最後是分類器,基於這些概念特徵預測免疫治療響應機率。
模型支援多種微調方式,包括無需重新訓練的零樣本預測、僅調整分類層的輕量微調、部分參數微調以及全模型微調,並提出多階段微調策略,先學習通用免疫響應規律,再針對特定藥物或癌症類型優化。在性能評估中,研究團隊將 COMPASS 與 22 種廣泛用於免疫檢查點抑制劑響應預測的方法進行比較,包括單基因預測模型、免疫特徵評分方法,以及基於網絡與機器學習的預測模型。結果顯示,部分微調模式(COMPASS-PFT)與輕量微調模式(COMPASS-LFT)在所有隊列規模與評價指標中均取得最高整體性能。與排名第二的方法相比,平均準確率提升 8.5%,AUPRC 提升 15.
7%,Matthews 相關係數(MCC)也提升 12.3%。無論面對大型、中型還是小型臨床隊列,模型性能均保持穩定。進一步的泛化能力測試顯示,COMPASS 在隊列內部留一患者驗證以及跨研究隊列遷移預測中均有出色表現。在跨隊列遷移分析中,研究人員使用基於一個隊列訓練的模型預測另一個隊列的治療響應,共完成 240 次兩兩隊列遷移評估。COMPASS-LFT 成功完成 163 次遷移,COMPASS-PFT 完成 155 次,明顯優於此前最佳方法(如 PGM 的 130 次、Teff 的 118 次、NetBio 的 117 次)。
在跨治療方案預測方面,COMPASS-PFT 展現出識別訓練數據中未包含癌症類型之治療響應患者的能力。例如,當訓練數據排除肺腺癌後,模型仍在獨立測試隊列中達到 76.5% 的預測準確率。此外,當模型僅利用抗 PD-1/PD-L1 治療隊列訓練時,仍能預測抗 CTLA-4 治療患者的響應,準確率達 70.8%,顯示不同免疫檢查點治療之間可能存在共享的免疫作用機制。研究也測試了模型在不同技術因素下的泛化能力,結果顯示 COMPASS-PFT 保持穩定性能,而基於基因特徵簽名的方法容易受測序平臺與樣本來源差異影響。
研究團隊坦言,COMPASS 目前仍屬探索性工具,由於依賴 bulk RNA-seq 數據,空間分辨能力有限,部分低丰度免疫細胞信號可能被掩蓋,且需要更多前瞻性臨床試驗驗證才能真正進入臨床決策體系。然而,這項研究代表了一個重要方向:未來的醫療 AI 不僅要提升預測準確率,更應幫助醫生理解疾病機制,為個體化治療提供更透明、可靠的依據。COMPASS 透過可解釋的概念瓶頸架構,讓預測結果不僅是「黑箱」輸出,還能提供機制假設線索,有望在輔助治療適應症選擇與患者分層中發揮關鍵作用。
Related
相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人
美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

一口氣發佈三款教育插件,OpenAI教育產品再升級
OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

騰訊、字節、阿里,搶著給打工人配「AI助理」
騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

推行AI提效後,策劃們開始加班趕工期
當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

DeepSeek大漲價,Token價格戰終於要結束了?
DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

狂攬130億!英偉達投的AI基建獨角獸又融資了
澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。