MarkTechPost AI模型更新

Building a Scaffold-Split Random Forest QSAR Co-Scientist for EGFR Inhibitor Discovery Using ChEMBL, RDKit, SHAP, and BRICS

2026年7月7日 01:43

重點摘要

# Building a Scaffold-Split Random Forest QSAR Co-Scientist for EGFR Inhibitor Discovery Using ChEMBL, RDKit, SHAP, and BRICS **從靶點解析到分子生成,一套端到端的 AI 藥物發現工作流程** 第三代 EGFR 抑制劑奧希替尼(osimertinib)雖能有效控制非小細胞肺癌,但腫瘤一旦獲得 C797S 突變,原本依賴的半胱氨酸共價鍵就會消失,導致耐藥性迅速產生。

站內 AI 整理稿

# Building a Scaffold-Split Random Forest QSAR Co-Scientist for EGFR Inhibitor Discovery Using ChEMBL, RDKit, SHAP, and BRICS

**從靶點解析到分子生成,一套端到端的 AI 藥物發現工作流程**

第三代 EGFR 抑制劑奧希替尼(osimertinib)雖能有效控制非小細胞肺癌,但腫瘤一旦獲得 C797S 突變,原本依賴的半胱氨酸共價鍵就會消失,導致耐藥性迅速產生。開發第四代 C797S 活性抑制劑已成為當前精準腫瘤學的迫切需求。為此,研究團隊設計了一套自動化的「AI 共同科學家」工作流程,整合 ChEMBL、RDKit、隨機森林、SHAP 與 BRICS 等多個開放工具,從靶點確認到候選分子生成完全自動化,展現了人工智慧驅動先導發現的實際潛力。 ### 第一步:靶點情報與生物背景確認

工作流程首先透過 ChEMBL 資料庫與 UniProt 解析目標蛋白。研究團隊設定 EGFR 作為靶點,自動比對取得 ChEMBL ID(CHEMBL203)與 UniProt 存取號,並從 UniProt 中提取蛋白功能註釋,確認 EGFR 在細胞訊息傳遞中的關鍵角色。這一步不僅驗證了靶點的生物學合理性,也為後續資料篩選奠定了基礎。 ### 第二步:生物活性資料自動挖掘

團隊使用 ChEMBL API 批量拉取 EGFR 的 IC50 活性數據,僅保留具有明確 pChEMBL 值、標準單位為 nM、且關係符號為「=」的高品質記錄。經過限制與分頁擷取,最終獲得近千筆經人工審核的活性測量值。所有資料被整理成統一的 pIC50 格式,作為建模的標準響應變數。 ### 第三步:分子結構標準化與聚合

為了確保化學表徵的一致性,系統導入 RDKit 的 MolStandardize 模組,自動移除鹽類與溶劑分子、選取最大片段、中和電荷,並排除重複或含糊的立體異構體。對於同一分子具有多個活性記錄的情況,採用中位數聚合方式,將每種化合物縮減為單一 pIC50 值,消除實驗系統誤差帶來的噪聲。 ### 第四步:化學特徵工程與骨架多樣性分析

在分子表徵部分,團隊同時計算兩種互補的描述符:Morgan 圓形指紋(半徑 2、2048 位元)作為拓撲特徵;並透過 RDKit 提取一系列物理化學描述符(分子量、logP、氫鍵供體/受體數、TPSA、可旋轉鍵數等)作為性質表徵。此外,利用 Murcko 骨架對數據集進行骨架分類,確保後續模型訓練能夠評估對全新化學類型的泛化能力。 ### 第五步:骨架分割與隨機森林 QSAR 建模

為避免隨機分割造成的資料洩漏(leakage),研究採用 scaffold split 策略將數據集劃分為訓練集與測試集,確保兩組的骨架結構不重疊。隨機森林迴歸模型(1000 棵樹)在訓練集上擬合,並在測試集上以 R² 與 RMSE 評估預測力。結果顯示,模型對未見過的骨架仍能維持合理的外推能力,證實了骨架分割策略的有效性。 ### 第六步:SHAP 與可解釋 AI 驅動的特徵剖析

為了解讀模型決策,團隊引入 SHAP 值對 Morgan 指紋位元與物理化學描述符進行全局重要性排序。分析發現,特定芳環取代模式與含氮雜環的存在對 pIC50 有顯著正向貢獻,而過高的親脂性或過大的分子量則與活性下降相關。這些 SHAP 摘要圖與子結構視覺化為化學家提供了可直接理解的結構-活性關係線索。 ### 第七步:BRICS 片段重組與生成式設計

基於 QSAR 模型對「高效分子」的定義(pIC50 >= 7.0),團隊從這些藥物類似物中提取 BRICS 片段,並進行隨機重組。系統迭代生成大量虛擬類似物,每次重組後自動檢查新分子是否在訓練集中出現,以確保全新化學實體的產出。這一步驟利用現有藥效團知識,探索更大的化學空間。 ### 第八步:多重過濾與候選短列表

生成的虛擬分子依序通過一系列嚴格的 in silico 閘門:先用 QSAR 模型預測活性並保留高於閾值的分子;再以 QED 評估藥性、SA_Score 評估合成可及性、並透過與 ChEMBL/PubChem 的相似性排除已知分子;最後以 ADMET 描述符(如 hERG、CYP 抑制潛勢)進行早段開發性過濾。最終僅有少數分子入選為「可合成、具新穎性、活性突出」的先導候選。 ### 第九步:外部資料庫交叉驗證

系統自動將入選候選分子提交至 PubChem,查詢是否有已報導的活性或結構鄰近物。若偵測到高相似度但未在 EGFR 背景記錄的分子,則標記為潛在的骨架躍遷起點。此交叉驗證步驟有效降低了後續驗證失敗的風險。 ### 總結:可複製、可擴展的 AI 共同科學家

本工作流程串聯了靶點解析、生物活性挖掘、分子標準化、特徵工程、骨架分割建模、可解釋分析、生成設計與多重虛擬篩選,每個環節皆基於開放工具與可重複程式碼。其模組化設計可輕鬆遷移至其他靶點(如 BTK、JAK2),為早期藥物發現提供了一個即開即用的 AI 協作架構。在 C797S 耐藥問題日益嚴峻的今天,這樣的端到端方法正為開發新一代 EGFR 抑制劑鋪設高效、數據驅動的捷徑。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

45 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

46 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前