中文醫療大模型迎來重大升級,MedBench 5. 0 版本正式發佈築牢安全防線
重點摘要
中文醫療大模型評測基準MedBench正式推出5.0版本,由上海人工智慧實驗室攜手廣州實驗室、鍾南山院士團隊及葛均波院士團隊共同建置。新版主打專科化評測體系,首創醫療原子技能評測範式,可全維度校正AI模型幻覺,強化醫療AI安全防線。MedBench也是上海市委網信辦與衛健委指定的前置醫療AI應用技術評測載體。
中文醫療大模型迎來重大升級,MedBench 5.0 版本正式發佈築牢安全防線
醫療人工智能正以超乎預期的速度朝向更專科化、更安全的方向邁進,而評測體系的演進,正是這股浪潮中至關重要的基石。據上海人工智能實驗室消息,中文醫療大模型評測基準 MedBench 近日正式迎來 5.0 版本的全面升級。此次升級不只是版本號的更迭,更代表著醫療 AI 從「能用」走向「好用」與「可信」的關鍵一步,為大模型在臨床場景中的落地應用提供更嚴謹的檢驗標準。本次 MedBench 5.0 的建置,匯聚了國內醫療 AI 領域頂尖的科研力量。上海人工智能實驗室科研團隊聯合廣州實驗室、廣州醫科大學附屬第一醫院鍾南山院士團隊,以及復旦大學附屬中山醫院葛均波院士團隊,共同參與了新版評測體系的構建。
來自呼吸醫學與心血管領域的權威專家深度參與,讓評測內容更加貼近真實臨床需求,也讓評測結果更具專業說服力。MedBench 自推出以來,一直是觀察中文醫療大模型發展的重要窗口。作為國內首個原生醫療垂直評測體系,它跳脫了一般通用評測基準的框架,專注於醫療場景中的語言理解、醫學推理、知識問答、安全倫理等核心能力,提供更貼近醫療實務的評估方式。而此次 5.0 版本的升級,則進一步將評測的觸角延伸到更精細的專科領域。新版本的一大亮點,在於重點打造了專科化評測體系。過去醫療大模型的評測多聚焦於全科能力,也就是在廣泛的醫學知識範圍內衡量模型表現。
然而,真實臨床場景中的疾病診斷與治療決策,往往高度依賴專科知識的深度與精準度。MedBench 5.0 針對不同專科領域設計差異化的評測任務,讓醫療大模型不再只是「什麼都懂一點」,而是能在特定專科中展現出足以信賴的專業水準。更值得關注的是,MedBench 5.0 首創了「醫療原子技能評測」這一全新範式。所謂原子技能,指的是可被拆解、可被量化的最小醫療能力單元,例如從病歷中正確擷取關鍵症狀、判讀檢驗數值的異常意義、區分不同疾病之間的鑑別診斷要點等。透過拆解醫療行為中最基本的技能模組,評測體系能夠更細緻地檢視模型的每一項能力,而不是僅以籠統的分數概括整體表現。
這項創新評測範式的背後,是對醫療 AI 安全性的高度重視。近年來,大模型在醫療領域的應用日益廣泛,但「幻覺」問題始終是阻礙其深入臨床的痛點。所謂幻覺,指的是模型在回答問題時生成看似合理、實則錯誤的內容。在一般場景中,這類錯誤或許只是令人困擾,但在醫療場域中,任何一個錯誤的診斷建議或藥物指引,都可能對病人安全造成難以挽回的傷害。MedBench 5.0 正是針對這一痛點,實現了對 AI 模型幻覺的全維度校正。透過原子技能級的細緻檢視,評測系統能夠精準定位模型在哪些具體醫療任務上容易產生錯誤輸出,進而引導研發團隊針對性地修正模型行為。
這種「對症下藥」的評測思維,讓醫療大模型的安全防線從被動防禦轉向主動建構,可望大幅降低 AI 在臨床應用中的潛在風險。除了技術層面的突破,MedBench 在政策與治理層面同樣扮演著舉足輕重的角色。據了解,MedBench 同時是上海市委網信辦和上海市衛健委指定的前置醫療 AI 應用技術評測載體。這意味著,相關醫療 AI 應用在正式上線前,需先通過 MedBench 的技術評測,作為確保其安全性的重要關卡。這項制度設計,讓評測基準不再只是學術研究的工具,而是實質參與醫療 AI 治理的關鍵環節。從產業發展的角度來看,MedBench 5.0 的發布也將對醫療大模型的競賽格局產生深遠影響。
當評測標準從全科走向專科、從整體分數走向原子技能拆解,模型的研發方向也必須隨之調整。過去那種靠「刷題」提升總分的策略將逐漸失去效用,真正的臨床實戰能力將成為衡量醫療大模型價值的核心指標。這也意味著,醫療 AI 的競賽,正從規模競賽轉向品質與安全的深水區。此次升級的另一項重要意義,在於頂尖臨床團隊的深度參與。鍾南山院士團隊長期深耕呼吸疾病領域,葛均波院士團隊則是心血管醫學的權威代表。由這些臨床一線專家共同定義評測內容,確保了 MedBench 5.0 的評測任務不是紙上談兵,而是真正反映臨床實務中的診斷思路與決策邏輯。這種「由臨床定義標準」的合作模式,為醫療 AI 評測樹立了新的標竿。
展望未來,隨著 MedBench 5.0 正式上線,中文醫療大模型將迎來一波新的淬鍊與考驗。對於模型研發團隊而言,這既是挑戰,也是契機——唯有通過更嚴格、更專科化、更貼近臨床的評測,才能在醫療 AI 的賽道上真正站穩腳跟。而對於整個醫療體系而言,一套可靠、可信、可持續演進的評測基準,正是醫療 AI 得以大規模落地應用的重要前提。MedBench 5.0 的發布,為中文醫療大模型的安全發展築起了更堅實的防線,也為醫療 AI 的未來指明了更清晰的方向。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。