長手冊任務暴露推理短板
:TAM基準測試揭示頂尖AI在複雜規則遵循上的系統性缺陷 近年來,大型語言模型的飛速發展讓AI在文本生成、知識問答等領域展現出驚人能力,然而,一項名為TAM(Technical Answering with Manuals)的全新基準測試卻為這股熱潮潑下了一盆冷水。這項旨在檢驗AI「長程推理」能力的測試,要求模型在閱讀數百頁的權威手冊後,嚴格遵循其中錯綜複雜的規則並給出精確答案。測試結果令人震驚:即便是目前最先進的GPT-5模型,在醫療編碼與聯邦量刑這兩類高專業性任務中,其準確率也低得可憐,徹底暴露了頂尖模型在複雜指令執行上的明顯短板,也為AI在醫療、司法等高合規性領域的實際應用敲響了警鐘。
TAM基準測試的設計初衷,正是為了填補當前AI評估體系中對「真實世界規則遵循能力」的檢驗空白。與傳統問答測試不同,TAM模擬的是人類專業人士的日常工作場景:一位醫療編碼員需要依據厚厚的ICD-10-CM手冊,將醫生的診斷描述精確轉化為標準代碼;一位聯邦量刑官員則需參考《聯邦量刑指南》,綜合犯罪情節、被告前科及各種加權因素,計算出建議的刑期範圍。這些任務的共同特點是,它們要求AI不僅要理解單一規則,更要在數百頁的文本中,將分散在不同章節、相互交織的條款與例外情況同時納入考量,並在長達數十步的推理鏈條中保持邏輯的一致性。然而,測試結果卻殘酷地揭示了當前AI的局限性。
在醫療編碼任務中,GPT-5的ICD-10-CM編碼準確率僅有1%,幾乎可以忽略不計。這意味著,面對一個看似簡單的診斷描述,模型在查閱手冊時,極易被細微的語義差異所迷惑,無法準確匹配到唯一且精確的代碼。例如,一個描述「因意外跌倒導致的股骨頸骨折」的診斷,其編碼需要區分骨折的具體部位、是否為病理性骨折、以及是否伴有併發症等多重維度,任何一個條件的遺漏或誤判,都會導致編碼錯誤。而在聯邦量刑任務中,GPT-5的準確率也僅有15.5%,模型在綜合考量犯罪情節的嚴重程度、被告的犯罪歷史以及指南中規定的各種加權或減輕因素時,表現出明顯的簡化傾向,往往會忽略手冊中至關重要的例外條款,導致量刑建議偏離實際。
TAM基準的設計者指出,這類失敗並非源於數據不足或記憶力不佳,而是暴露了當前AI在「長程推理」上的本質缺陷。現有的大型語言模型本質上是基於海量數據訓練的「模式匹配器」,他們擅長從文本中提取統計規律,並生成流暢的、符合語法的回應。然而,當任務要求他們在數百頁的文本中,建立一個跨越章節、需要同時處理多個變量與條件的決策路徑時,其推理鏈條便會迅速斷裂。這種「長程推理」能力,要求模型具備類似人類的「工作記憶」與「邏輯演繹」能力,能將分散的資訊在腦海中整合,並在每一步決策時都回溯到相關的規則,而這正是當前AI的薄弱環節。更值得警惕的是,低準確率的背後,是「知識記憶」與「規則應用」之間的巨大鴻溝。
GPT-5在訓練過程中,無疑已接觸過大量的法律與醫學文本,其參數中儲存了豐富的知識。然而,測試結果表明,這些知識並未轉化為實際的應用能力。模型能「背誦」手冊中的條文,卻無法在具體情境中正確地「調用」這些條文。這揭示了當前AI發展的一個關鍵瓶頸:單純擴大參數量或語料規模,並不能自動帶來更強的推理能力。未來的模型需要專門的推理訓練,例如透過「思維鏈」提示或針對性的強化學習,來強化其多步邏輯推演與規則遵循的能力。TAM基準的出現,為AI領域提供了一面更為嚴格的鏡子。它提醒我們,在醫療、司法等依賴精確合規的領域,AI的表現遠未達到可實際部署的標準。
一個錯誤的醫療編碼可能導致保險理賠被拒或醫療記錄失真,一個不準確的量刑建議則可能影響司法公正。因此,在這些高風險領域,AI目前只能作為輔助工具,而無法完全取代人類專業人員的判斷。同時,TAM也為AI的未來發展指明瞭方向:從追求「記憶」轉向追求「理解」,從追求「生成」轉向追求「推理」。只有當模型能真正掌握複雜規則的內在邏輯,並在長程任務中維持一致的決策路徑,AI才能從「聰明的聊天機器人」進化為「可靠的專業助手」。此外,TAM基準的設計也揭示了當前AI評估體系的局限性。傳統的基準測試,如問答或摘要,往往側重於單一任務的表現,而忽略了真實世界任務的複雜性與交織性。
TAM則透過模擬真實的專業場景,迫使模型在一個開放的、包含大量資訊的文本中進行探索與決策,這更貼近實際應用的需求。它的出現,為評估模型在真實世界規則遵循能力提供了一個更嚴格的標尺,也促使研究者和開發者重新思考AI的訓練目標與評估方法。展望未來,要克服「長手冊任務」的挑戰,需要多方面的努力。一方面,研究人員需要開發新的模型架構或訓練策略,以增強模型的「長程推理」能力,例如引入外部記憶機制或模組化推理結構。另一方面,也需要建立更豐富的、包含複雜規則與例外情況的訓練資料集,讓模型在訓練階段就接觸到真實世界的複雜性。
此外,人機協作也將是重要的發展方向,AI可以負責快速檢索與初步分析,而人類專家則負責最終的決策與審核,這既能發揮AI的效率優勢,又能確保決策的準確性與可靠性。TAM基準的測試結果,雖然揭示了當前AI的不足,但這並非壞事。它像一面鏡子,清晰地照出了AI能力的邊界,也為未來的發展指明了方向。在追求通用人工智慧的漫長道路上,這種對「短板」的清醒認識,正是推動技術進步的關鍵動力。只有正視這些挑戰,才能讓AI在醫療、法律等關鍵領域真正落地,成為值得信賴的助手。
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床
AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。