通用模型竟然比醫療專用模型更懂醫療?一篇 ACL 論文的兩個反直覺發現 | GAIR Paper 123
Doubao 、DeepSeek 在三語數據集上的表現,普遍超過 GPT-4o 和 Gemini。作者丨幸麗娟 編輯丨岑 峰 醫療,是大模型落地最特殊的場景之一。特殊在哪裡?特殊在一個很微小的錯誤,就可能導致致命的後果;也特殊在你不能用直覺去判斷它"行"還是"不行"——你覺得醫療專用模型肯定比通用模型更懂醫療?直覺上是。但實驗數據不支持。你覺得英語訓練出來的模型處理英語醫療數據肯定最好?直覺上是。但實驗數據也不支持。這兩重"反直覺",正是紐約大學阿布扎比分校和阿布扎比克利夫蘭診所的研究團隊在ACL 2026 Findings上發表的論文揭示的核心真相。
論文鏈接:https://aclanthology.org/2026.findings-acl.573.pdf論文代碼:https://github.com/congboma/MedErrBench研究團隊構建了首個面向醫療錯誤檢測、錯誤定位和錯誤糾正的多語言評測基準MedErrBench,覆蓋英語、中文和阿拉伯語三種語言,考驗了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多達十類典型醫療錯誤上的表現。
論文一作馬聰博( Congbo Ma)是紐約大學阿布扎比分校博士後研究員,所在的 Clinical AI Lab 長年與阿布扎比克利夫蘭診所等當地醫療機構保持合作。這種醫工深度融合的研究模式,讓團隊既不缺技術能力,也擁有較為豐富的行業經驗。而這正是構建一套"臨床可信"的評測基準的前提。但這個評測基準數據集的構建,並不簡單。它涉及英文,中文和阿拉伯語三語醫學數據、十類錯誤的設計、與醫療系統的跨界協作、以及數輪標註標準的拉鋸。這樣一項環節較多、涉及多方協作的研究工作,究竟為什麼必須要做?又為什麼能做成?
AI 科技評論採訪了馬聰博,她詳細介紹了這項工作的必要性、構建過程、行業意義以及下一步的深入研究方向。01MedErrBench為什麼非做不可?這項研究並非憑空而起,它始於兩個方向的具體原因:第一個來自臨床一線。馬聰博 所在的 Clinical AI Lab 與阿布扎比多家醫院的臨床醫生保持長期合作,他們基本上每兩週都會跟醫生開會討論。在交流過程中,醫生們提出:無論是給出診斷,還是撰寫病例小結,如果能有一個系統自動標記出哪裡可能存在錯誤,對輔助診斷會非常有用。臨床實踐中的真實需求,給了他們這一研究靈感。第二個來自對大模型行為的觀察。
研究團隊發現,現有的大模型經常能生成非常流暢、甚至有醫學術語支撐的解釋或診斷,但這些看似專業的輸出背後,隱藏著錯誤。在醫學領域,哪怕一個詞出錯,後果都可能是致命的。團隊意識到,需要一個專門針對"錯誤檢測與糾正"的評測基準,給現有大模型在後面再加一道安全網。醫療糾錯的價值,在於儘可能早地發現診療過程中的潛在錯誤,並在錯誤進一步影響臨床決策之前提供提示。尤其在急診等信息密集、決策節奏快的場景中,及時識別遺漏、矛盾或不合理之處,有助於降低醫療錯誤帶來的風險,提升患者安全。馬聰博 表示,如果這類系統能嵌入醫療流程,在急診等容易漏診的場景下提示潛在錯誤,將具有實際的臨床價值。
02MedErrBench是怎麼建出來的?醫療作為容錯率極低的落地場景,首先得有一套靠譜的“考題”。MedErrBench的構建流程,本身就是一項嚴謹的工程。MedErrBench 的整體框架▎三語數據:全部來自原生來源很多多語言數據,把英語數據扔進Google Translate就號稱“多語言”。MedErrBench不是。英語和中文數據來自MedQA(美國和中國執業醫師考試題),研究團隊進一步篩選出包含完整臨床背景、多句描述的複雜病例,去掉了過於簡單的事實型問答,使數據更接近真實臨床推理任務。阿拉伯語數據來自MedArabiQ和MedAraBench。
研究團隊結合關鍵詞篩選與人工審核,構建了涵蓋病例場景題(Scenario-based)和醫學知識題(Knowledge-based)的數據,以保證數據的多樣性和挑戰性。也就是說,英語、中文、阿拉伯語全部來自各自語言的原生醫學數據源,而非翻譯產物。而研究團隊之所以選擇這三種語言,有明確用意:英語:國際醫學研究和臨床教育的主要語言中文:全球使用人數最多的語言之一,醫療AI的重要應用場景阿拉伯語:覆蓋中東和北非地區,代表低資源語言環境這種設計能真實反映模型在不同語言和文化背景下的表現,而不僅僅是測試跨語言翻譯能力。
▎十類典型醫療錯誤有了原始病例之後,研究團隊邀請臨床醫生總結歸納了10類臨床最常見的醫療錯誤:1.Diagnosis(診斷錯誤)2.Management(診療方案錯誤)3.Treatment(治療錯誤)4.Pharmacotherapy(藥物相關錯誤)5.Causal Organism / Pathogen(病原體錯誤)6.Lab/Serum Value Interpretation(實驗室檢查解讀錯誤)7.Physiology(生理知識錯誤)8.Histology(病理組織學錯誤)9.Anatomy(解剖學錯誤)10.
Epidemiology(流行病學錯誤)這套分類體系覆蓋了臨床工作中的高頻錯誤類型,也方便後續細粒度分析不同模型的弱點分佈。▎多維度標註:不止是“對不對”研究團隊設計了三種輔助標註,讓MedErrBench不僅能測“模型答沒答對”,還能分析“為什麼答錯”:Important Medical Words(關鍵醫學術語)臨床醫生標註每個案例中的關鍵醫學實體——疾病名稱、藥物、檢查項目、解剖結構等。這些術語直接影響臨床決策,也是模型在糾正時最需要保持準確的信息。Difficulty Level(任務難度)每個案例根據醫學知識複雜程度和推理難度,標註為簡單、中等或困難。
這可以用來分析不同模型在簡單病例和複雜病例上的表現差異。Reasoning Type(推理類型)標註完成該任務所需的推理能力——事實檢索、單步推理或多步推理。這為分析模型的能力邊界提供了直接依據。任務難度和推理類型統計▎臨床專家審核與質量控制為了保證數據質量,所有案例均經過臨床專家審核(Expert Review and Quality Control)。團隊採用了兩階段人工審核與質量控制流程。第一階段,由三名分別以英語、中文和阿拉伯語為母語的 NLP 研究人員,在學習了由臨床醫生定義的十類臨床錯誤分類體系後,進行初步標註和人工核驗。
具體工作包括識別幻覺內容或不自然的表述,刪除大語言模型引入的錯誤或冗餘信息,並對過長句子進行拆分。尤其是在中文數據集中,逗號等標點有時無法合理劃分不同分句,因此需要進行額外處理。第二階段,每種語言由兩名獨立的臨床醫生對所有樣本進行審核,以確保醫學上的有效性。他們會糾正數據轉換過程中產生的錯誤,核驗錯誤類型標籤,並檢查關鍵臨床術語、難度等級和推理類型。對於審核中的分歧,我們將其歸類為邏輯錯誤、分類錯誤或拼寫錯誤。拼寫錯誤直接修正;對於其他問題,只要任一位臨床醫生提出異議,就會進一步修改。這套質量控制流程說起來簡單,做起來還有有點費勁。
馬聰博 坦言,整個流程中最困難的一環不是技術,而是與醫生的合作。醫生沒有技術背景,從臨床角度標註數據,與研究團隊的需求之間存在 gap。為解決這個問題,團隊採用小批量迭代的方式:先讓醫生標註二三十個例子,團隊審核後反饋問題,醫生再修改、再返回,如此反覆多個回合,逐步統一了標註標準。再加上醫生本職工作繁忙,整個流程耗時較長。最終,這套質量控制流程確保了數據的一致性、準確性和臨床可信度。回顧整個構建流程,馬聰博認為這項工作的最大價值體現在兩個層面:一是數據覆蓋的廣度。
三語原生數據的收集和標註本身就是一項長鏈條工程,而此前業內缺乏一個真正可用的多語言醫療錯誤評測基準;二是錯誤分類的深度——從五種類型拓展到十類,分類來源於臨床醫生的真實經驗。從這個意義上來看,MedErrBench不僅能夠作為醫療錯誤檢測與糾正的評測基準,也為整個行業未來的醫療AI安全研究提供了高質量的數據基礎。
03實驗結果:兩個反直覺的發現研究團隊選取了三類模型進行測試:通用大語言模型(General-purpose LLMs)、語言專用大語言模型(Language-specialized LLMs)以及醫療專用大語言模型(Medical-domain LLMs),涵蓋GPT-4o、Gemini、Llama、Qwen、DeepSeek、ALLAM、MedGemma和HuatuoGPT等主流模型。
所有模型需完成三項逐級遞進的任務:錯誤檢測(Detection):判斷病例文本中是否存在錯誤;錯誤定位(Localization):指出錯誤具體在哪個位置;錯誤糾正(Correction):生成修正後的正確文本。三項任務的難度並不均等。檢測和定位是判別式任務,用準確率衡量即可。糾正則是生成式任務,評估更為複雜。研究團隊採用了 ROUGE-1、ROUGE-2、ROUGE-L、BLEU、BERTScore 和 BLEURT 六個自動評價指標。
其中,ROUGE 和 BLEU 主要衡量生成文本與參考答案在詞語和短語層面的匹配程度,BERTScore 和 BLEURT 則進一步從語義表示和學習到的人類評價信號等角度衡量兩者的一致性。通過這些指標,可以從不同維度評估模型生成的糾正文本與參考答案之間的接近程度。實驗跑完之後,團隊得到了兩個完全反直覺的發現。▎反直覺發現一:醫療專用模型,不如通用模型如果問一個AI從業者:MedGemma和HuatuoGPT這類在醫學數據上專門訓練過的模型,在醫療錯誤檢測任務上,表現應該優於同量級的通用模型嗎?大多數人會回答"是的"。但實驗數據給出了相反的結論。在英文數據集上Doubao-1.
5-Thinking-Pro三項任務均表現最優:檢測準確率0.779,定位準確率0.774。DeepSeek-R1和gpt-4o-mini緊隨其後。而醫療專用模型MedGemma和HuatuoGPT的表現,不僅沒有超越通用模型,甚至落後於部分通用模型。為什麼醫療專用模型反而表現不佳?馬聰博在採訪中分析了兩個原因。第一,醫療模型的訓練目標與當前任務並不完全匹配。“像 MedGemma 這樣的醫療模型,訓練重點更多放在醫學問答、臨床文本和醫學影像等任務上,並沒有專門針對醫療錯誤檢測和糾正進行訓練。醫學知識豐富,並不意味著模型天然擅長識別一段看似合理的臨床文本中具體哪裡出了錯。
第二,通用模型可能受益於更大的訓練規模和更廣泛的數據分佈。“前沿通用模型通常在更大規模、更多樣的數據上訓練,其中也可能包含相當數量的醫學內容。這樣的訓練不僅帶來醫學知識,也增強了模型在語言理解、推理和指令遵循等方面的通用能力。對於醫療錯誤檢測和糾正這樣既需要醫學知識、又需要細粒度推理的任務,這些通用能力可能同樣重要。此外,還有一個實驗結果出乎研究團隊意料:Doubao和DeepSeek系列模型在三語數據集上的整體表現普遍超過了GPT-4o和Gemini。研究團隊同樣探討了原因,一是訓練數據的構成。DeepSeek同時涵蓋中英文語料,在多語言醫療任務上具有天然優勢。二是推理能力的貢獻。
DeepSeek-R1等模型具備推理機制,而推理能力在錯誤檢測,尤其是定位和糾正這類複雜任務上,起到了關鍵作用。不過她也補充了一個重要的時間背景:論文實驗完成於2025年,測試的是GPT-4o和GPT-4o mini。如果使用2026年最新版的GPT模型,結果可能會有所不同。這兩個實驗結果共同提示,在醫療錯誤檢測與糾正任務中,領域知識並不是決定模型表現的唯一因素。相比單純積累醫學知識,模型能否理解上下文、識別潛在矛盾並進行推理和糾正,可能更加關鍵。▎反直覺發現二:英文原生模型在中文原生數據集上,竟然表現更好這個發現來自研究團隊做的一組對比實驗。
團隊將中文數據集翻譯成英文和阿拉伯語後重新測試,結果發現:在中文原生數據集上模型表現最好;翻譯成英文和阿拉伯語後,各項指標普遍下降,尤其在定位和糾正任務上降幅明顯。更出乎意料的是,像 GPT、Gemini 這種以英語訓練為主的模型,在中文原生數據集上的檢測表現,竟然比在英文原生數據集上還要好。對此,馬聰博進一步分析原因:原生數據的臨床信息密度和質量,比"翻譯過來的多語言覆蓋"更有價值。翻譯可能會丟失語境細節,還可能引入表達偏差,影響模型對錯誤的判斷。(這組對比實驗的結果放在論文附錄 J.1 中。)除了模型本身的差異,研究團隊還發現三個額外因素會顯著影響結果。一是提示策略(Prompt)設計。
研究團隊進一步分析了不同提示策略(Prompt)的影響,實驗發現,模型的性能不僅取決於模型本身,也與提示設計密切相關。相比僅提供錯誤類型,在 Prompt 中加入錯誤類型定義以及少樣本示例,通常能夠幫助模型更準確地理解和糾正醫療錯誤。二是不同難度示例。不同模型對 in-context 示例難度的偏好存在明顯差異:Doubao-1.5-thinking-pro 更適合中等難度示例,DeepSeek-V3 更受益於簡單示例,而 Gemini 2.0 Flash 則更適用於發現語高難度示例的錯誤。此外,Doubao-1.5-thinking-pro 在各難度下均表現出最高的預測置信度。
三是不同的臨床數據類型(知識型 VS場景型)。實驗結果顯示,大多數模型在場景型臨床數據上的表現優於知識型數據,說明它們更依賴上下文模式識別,而非穩健的阿拉伯語醫學知識。Llama3-8B 是唯一的例外,在知識型任務上表現略好;而 Qwen2.5-7B-Instruct 的兩類任務性能差距最大,表明其可能更依賴表層模式和指令遵循。04兩個坦誠的侷限論文最後列出了兩個侷限性:第一,缺少錯誤嚴重程度的標註。一個藥物劑量的小錯誤和一個致命誤診,風險天差地別,但當前數據集沒有區分。這意味著,模型修正了一個"不痛不癢的小錯"和修正了一個"可能致命的大錯",在MedErrBench上的得分可能完全一樣。
第二,阿拉伯語數據量偏小。不是不想做,是高質量、公開的阿拉伯語醫學數據本身就稀缺。團隊在論文中表示正在繼續擴充。此外在採訪中討論到“如何判斷 AI 是否達到人類水平”這一問題時,馬聰博的回答很務實:"我們目前並沒有讓 AI 去設定一個什麼樣的標準,或者說讓它能夠替代人類去做一些什麼。目前我們希望它能夠做一個輔助診斷的系統,能夠提醒醫生可能存在的一些潛在錯誤,發現一些遺漏的信息,降低一些有可能造成的醫療事故。"換句話說,AI 在這裡的角色不是替代醫生,而是做一個"檢測錯誤、告訴醫生"的輔助角色。至於糾正,模型給出的方案,本身不一定對,依然需要醫生複核。
因此,在醫療AI的現階段,與其糾結於“AI是否達到了人類水平”這一抽象命題,不如先讓AI做好輔助這件事。把錯誤找出來、告訴醫生、由醫生做最終判斷——這或許才是醫療AI在當前技術階段最務實、也最有價值的落地方向。05下一步的研究MedErrBench 只是這個團隊的第一步。正如馬聰博所說,他們做這個數據集的初衷,是希望能夠推動更多研究者關注醫療錯誤檢測與糾正這個方向。她坦言,一個新的研究方向要形成,數據集往往是第一道門檻,所以他們選擇先從收集多語料數據集入手,為後續的研究生態打下基礎。
在後續研究中,團隊也開始將重點延伸到實際醫療流程,探索如何在醫生診斷、撰寫病歷等環節及時提示潛在錯誤,為臨床決策提供輔助。與此同時,臨床應用對模型的準確性和可靠性提出了更高要求,而目前模型在錯誤定位和糾正上的表現仍有明顯提升空間。圍繞這些問題,團隊已經進一步開展了相關研究,目前論文正在投遞中,主要聚焦於兩個方向第一個方向:用 Agentic AI 提升檢測,定位和糾正效果。團隊正在用智能體架構來提升模型在錯誤檢測和糾正任務上的準確度和生成質量,目標是把當前還不夠高的指標進一步提高。第二個方向:為醫療糾錯任務設計新的評估指標。這是一個容易被忽視但極其重要的問題。
目前衡量糾正任務用的還是 ROUGE、BLEU Score、BLEURT 這類通用指標,但它們把所有詞都按同等重要來給分。馬聰博 舉了一個例子:如果模型根據病例推斷出患者可能患有什麼疾病,結果疾病名稱給錯了,那整個糾正就是失敗的。但用 ROUGE 來算,其他詞語對了、只有病名錯了,依然能拿到一個不低的分數。因此,團隊正在設計一套新指標:對關鍵醫學術語賦予更高權重,同時引入安全性評估維度,判斷修正後的文本是否真正規避了臨床風險。通用指標看“像不像”,醫療指標看“關鍵的地方對不對”、安全性夠不夠, 這是團隊對評估理念的凝練,也是他們下一步希望推動的範式轉變。
IJCAI 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 IJCAI 2026 參會群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。
現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

剛剛,Codex恢復5小時限額,用戶哀嚎
AI應用風向標(公眾號:ZhidxcomAI) 作者|畢偉豪 編輯|漠影 8月25日報道,剛剛,OpenAI Codex負責人Tibo宣佈,明天開始將會恢復ChatGPT Work和Codex平臺上Plus用戶的5小時用量限制。 據Tibo所說,這一做法早就在計劃之中,目的主要是減輕算力負荷,從而在周使用額度上提供更慷慨的計劃。 這一表述暗含了計算資源不足的意思,但有網友對於Tibo的說法並不買賬,原因是前段時間他親口說過“我們不缺算力”。

中國 AI 為什麼追得這麼快?美媒找到一批關鍵人物
首頁 > 智能時代>人工智能 中國 AI 為什麼追得這麼快?美媒找到一批關鍵人物 2026/8/25 12:46:15 來源:鳳凰科技 作者:於雷 責編:遠洋 評論: 8 月 25 日,據《華爾街日報》報道,中國 AI 模型近年來快速縮小與美國頭部模型的差距,其背後並非短期突然出現的技術突破,而是清華大學等高校長期形成的人才網絡,以及開源技術、人才迴流和更高算力效率等因素共同推動的結果。

Generalist AI融資超13億,8VC領投
機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月25日報道,近日,據外媒Axios報道,Generalist AI籌集了約2億美元(約13.45億元)的資金。 據消息人士透露,本次融資由8VC領投,數家現有投資者跟投。關於估值暫無具體信息,但確認高於6月份的20億美元水平。目前該公司並未回應,但在聯邦申報文件中披露了本輪融資。 根據Generalist AI向美國SEC提交的Form-D備案文件顯示,本輪計劃募資約2.08億美元(約13.99億元),實際完成融資約1.

人民教育音像數字出版社與小猿達成合作 “中小學課本學習智能體”首落小猿AI學習機
人民教育音像數字出版社與小猿學習機合作,推出首個「中小學課本學習智能體」,搭載於小猿AI學習機,結合權威教材與猿力大模型,提供AI伴學與AI導學雙模式。試點數據顯示,學生語文知識點掌握量提升33.6%,英語提升24%,家長陪讀時間每日減少20分鐘。雙方簽署合作協議,未來將持續推動智能體規模化應用。

WAIC CONNECT | AI出海,不聊虛的!CONNECT帶你拿下馬來西亞真正的AI採購需求
WAIC CONNECT MALAYSIA活動將於2026年9月7日至8日在吉隆坡舉辦,聚焦馬來西亞政府、電信、金融科技與教育等領域的實際AI採購需求,並與華為合作建立當地生態鏈接。活動規劃中國企業短講、一對一精準對接及監管機構與決策者面對面交流,僅限50至60家中國AI企業參與,旨在協助業者直接取得東南亞市場的真實商業訂單。

被智譜封號的會員,有多少是被冤枉的?
鋅消費研究中心2026.08.25 11:33 · 來自北京全文3351字00:00 / 09:02這麼突然被封號了?文 | 鋅消費研究中心 真金白銀辦了智譜會員,結果賬號突然就被封了。 你如果遇到這種事兒,會不會賬號剛一被封,就想原地發瘋? 先別急。智譜之所以會對用戶進行封號,往往源於用戶的登錄設備、IP等出現異常,被平臺判定為多人使用賬號。 而之所以出現這種情況,除了智譜定價越來越貴之外,還源於智譜新、老會員定價不同,讓會員們有了更多套利的空間。