Meet NeuroVFM: A New Neuroimaging Foundation Model Trained With Vol-JEPA on Uncurated Clinical MRI and CT Volumes
重點摘要
Frontier models learn mostly from public internet data. However, clinical neuroimaging rarely appears there, because MRI and CT scans contain identifiable facial features.
密西根大學研究團隊近日在《自然醫學》(Nature Medicine)上發表了一款名為 NeuroVFM 的神經影像基礎模型,試圖解決當前通用 AI 模型在臨床腦部影像任務上表現不佳的困境。由於 MRI 與 CT 掃描影像中含有可辨識的臉部特徵,這些資料極少出現在公開的網路數據集中,導致以網路資料為主要學習來源的前沿模型,在處理實際醫院產生的神經影像時,準確度與泛化能力都明顯不足。NeuroVFM 的訓練規模相當龐大。
團隊使用了來自「UM-NeuroImages」資料集的 524 萬組臨床 MRI 與 CT 立體影像,這些影像涵蓋密西根大學醫學院(Michigan Medicine)超過二十年常規醫療過程中累積的 566,915 次檢查。研究人員將這種學習策略稱為「健康系統學習」(health system learning),核心概念是讓模型直接從未經人工整理、在正常臨床運作中產生的影像資料中學習,不需要依賴成對的放射科報告,也不需要針對特定疾病進行標註,從而跳脫傳統狹義分類器的瓶頸。
這項模型的核心基礎架構稱為 Vol-JEPA,是將先前提出的 I-JEPA 與 V-JEPA 方法擴展到立體醫學影像的成果。JEPA 風格的學習方式正逐步進入醫學影像領域,其特色是採用自監督、純視覺的演算法,不透過重建像素來學習,而是在一個學習到的潛在空間中預測表徵。因此,Vol-JEPA 不需要任何標籤、不需要報告文字,也不需要體素解碼器。具體運作流程如下:首先,每個 3D 立體影像會被切割成不重疊的區塊(patch),每個區塊大小為 4×16×16 體素。
接著,整個立體影像會被分成兩部分:一個較小的「可見上下文」(visible context)區域,以及一個較大的「遮罩目標」(masked target)區域。一個學生編碼器(student encoder)會處理上下文區塊,而一個預測器(predictor)則會結合上下文潛變量與目標位置編碼,來預測遮罩區域的潛變量。與此同時,一個教師編碼器(teacher encoder)會生成真實的目標潛變量。這個教師編碼器是學生編碼器的指數移動平均(EMA),並且在訓練過程中會停止梯度反向傳播。訓練的目標是讓預測出的潛變量與教師生成的潛變量之間的平滑 L1 損失(smooth L1 loss)最小化。
值得注意的是,遮罩策略是以前景為導向的。研究團隊預先計算出頭部遮罩(head mask),只針對頭部區域內的區塊進行取樣與預測。對於 MRI 影像,上下文比例設定為 25%;對於 CT 影像,則為 20%。此外,還會隨機丟棄 20% 的區塊,以避免模型過度依賴背景捷徑。這種設計迫使編碼器專注於學習共享的神經解剖結構,而不是影像中的瑣碎背景特徵。研究團隊表示,NeuroVFM 的推出展現了「健康系統學習」的潛力,證明在缺乏人工整理與標註的情況下,大規模的臨床常規影像仍能訓練出具有泛化能力的神經影像基礎模型。
這項成果不僅為腦部疾病診斷、手術規劃與神經科學研究提供了一個強有力的工具,也為未來將類似方法擴展到其他醫學影像領域開創了新的路徑。
Related
相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑
阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

Caviar 推出 24K 鍍金版 Meta 雷朋智能眼鏡 Odyssey,售價 6130 美元限量 24 副
Caviar 推出限量 24 副的 Odyssey 智能眼鏡,以 Meta Ray-Ban 為基礎,提供 24K 金與 925 銀裝飾版本,售價分別為 6130 美元與 6840 美元。該產品保留原版功能,並附帶鱷魚皮充電盒,展現奢華工藝。

Suno 平臺將為 AI 生成音樂添加隱水印,防止濫用現象發生
Suno 平台將為其AI生成的音樂加入隱藏式音頻水印與指紋識別技術,以便在其他平台上被上傳時可辨識來源。此舉是因應索尼、環球等音樂巨頭組成的聯盟,要求防止AI音樂濫用並禁止其進入全球排行榜。

AI寫的PR堆成山,Rust已忍無可忍
Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

內置 10TOPS INT8 算力:韓 Mobilint 推出 USB AI 加速器 MLD-R1
韓國NPU企業Mobilint推出USB外接AI加速器MLD-R1,內建REGULUS AI SoC,提供10TOPS INT8算力與4核Arm處理器。該裝置支援多種AI框架與作業系統,功耗僅3W,具備IP65防塵防水,適合邊緣運算場景。

AI 藝人“方桃子”帶貨美瞳廣告遭下架,聲稱“戴了一天都很舒服”
AI 虛擬藝人「方桃子」因推廣美瞳廣告,聲稱「戴了一天都很舒服」引發爭議,網友質疑其無真實眼睛無法體驗產品效果。該廣告目前已從抖音下架,可能涉及違反《中華人民共和國廣告法》中關於虛假或誤導性內容的規定。