AI倒查論文100年!99.2%的頂刊都有問題…

2026年8月10日 22:02
AI倒查論文100年!99.2%的頂刊都有問題…
站內 AI 整理稿

好方向全被前人佔滿了??如果我說—— 那些已經發表的頂刊論文裡,大多都有問題呢?最近,有研究者用AI Agent「學術打假」後發現: 2026年國際機器學習大會(ICML)上報告的92篇論文中,有58篇已經無法復現。真假??莫非,猛發頂刊的機會真的來了?頂會論文正在集體被AI「打假」 通常一篇論文能夠進入頂級會議,就說明它已經經過了同行評審。然而受精力所限,同行評審審稿人幾乎沒有時間從頭下載數據、運行模型或復現實驗,以驗證論文中的每一個實驗結論。與此同時隨著AI領域的論文數量爆炸增長,模型越來越複雜,實驗規模越來越大,一篇論文背後的代碼、數據、參數設置可能涉及數百個細節。

論文的可驗證性也就變得越發重要,論文發表了,但其中的結論能被重新跑出來嗎?目前,AI Agent大大降低了這種驗證和復現的成本。7月22日,美國某研究審查公司用AI Agent對ICML 2026全部168篇口頭報告論文進行了系統性的結果復現審計。168篇論文中有92篇擁有至少5條可供驗證的結論性聲明。最終的結果是:AI Agent能夠成功復現超過四成結論的,只有34篇;而能復現八成以上結論的,僅有8篇。不過需要說明的是,“無法復現”和“研究造假”之間還存在著巨大區別。

復現失敗的原因包括不限於代碼缺少關鍵文件、依賴庫版本斷裂、運行結果與論文不符,還有4篇論文依賴的模型已下線,這意味著實驗結果已經永久性地無法被任何人復現。除此外,還有一些就錯的比較離譜了—— 比如,一篇論文將「僅訓練基礎模型0.77%的參數」作為核心賣點,但其實際開源的checkpoint訓練了6.31%的參數,相差約8倍。另一篇論文放了一張基於某評判模型的可靠性表格,但其開源代碼中根本不包含該評判模型,也沒有任何腳本能夠生成表格裡的結果。

無獨有偶,2026年抱抱臉與AlphaXiv聯合發起針對ICML 2026的「Agent Reproduction Challenge」挑戰賽,邀請研究者使用AI Coding Agent對ICML 2026接收的論文進行自動化復現,結果同樣很不樂觀。類似的趨勢在論文錯漏檢測中的體現更令人驚異。2025年底,一項研究開發了基於GPT-5的論文檢查系統,用於分析已經發表在頂級 AI 會議和期刊上的論文,尋找可以客觀驗證的問題。研究者非常明確地表示: 我們只看「客觀錯誤」,我們不管論文的創新性和研究價值。最終結果顯示,平均每篇論文被檢測出4.7個客觀錯誤,99.2%的論文至少被標記出了一個問題。

△圖片系AI生成 從錯誤類型來看,數學與公式錯誤佔比最高,達到54.0%(包括方程式寫錯、推導邏輯有漏洞、證明中的錯誤假設等)。大約30.8%的NeurIPS論文和23.8%的ICLR論文包含至少一個可能影響結果解讀的實質性錯誤。更值得注意的是時間趨勢:NeurIPS論文的篇均錯誤數從2021年的3.8個上升至2025年的5.9個,漲幅55.3%。…… 或許在今後,論文發表不再意味著研究宣告「勝利」,而只是再次進入了下一輪AI驗證的開始。學術萌新重大利好,不做實驗也能發頂刊 所以,朋友們,這對正在愁選題的人來說,可能還真是個相當意外的「利好」。

查文獻挑錯、寫勘誤,本來就是學術圈裡正經八百的產出形式,如今看來,完全的學術藍海啊。具體怎麼下手?給愁選題的學術萌新們支幾招: 第一,轉變研究思路,不卷前沿捲過去。從“找新選題”轉向“找舊論文裡的異常點”,重點關注那些被大量引用但爭議較少的經典論文。畢竟“99.2%的論文至少有一處錯誤”。第二,讓AI幫你製作知識地圖和研究譜系。這種知識地圖可以幫你理解——哪些是真正的奠基性工作?哪些研究觀點目前還存在爭議?哪些結論被大量引用但缺少驗證?不同論文之間的引用關係是什麼?從而由此找到過去難以發現的連接和異常。第三,Ask anything.

科學史上的很多重要突破並不來自於提出全新的問題,而來自重新審視一個長期被接受的假設。例如:一個經典實驗是否按照今天的標準被驗證過?一個被廣泛引用的結論,是否存在未被注意的限制條件?過去,這種追問成本非常高,研究者需要花費大量時間查閱原始文獻、比較實驗細節,而如今AI讓這種成本幾乎歸零了。AI或將開始重整科學史 最近,浙江實驗室理論化學家Pios在使用AI預測分子沸點時,發現結果與一份75年前的化學數據庫存在明顯衝突。對此,任何人的第一反應可能都是“那肯定是我錯了唄”。Pios也不例外,他連忙檢查自己的模型。但在手動回溯了原始文獻之後他發現:天吶,AI竟然是對的那一個。

Pios大為驚訝,隨後用AI繼續核查,竟然還發現了一份約一個世紀前且被學界公認權威的沸點測量值也是錯的。要知道,這些數據已經被經年累月地引用、吸納於後代的研究之中。這類問題此前長期未被發現可能與科學文獻的規模直接相關。△圖片系AI生成 現代科學論文的數量已經遠遠超出任何個體研究者的閱讀極限,例如,僅一家人工智能頂會ICLR的年度投稿量就從2018年的1013篇上升至2026年的19619篇。在這樣的規模下,一處最初出現在某篇論文中的錯誤一旦被後續文獻反覆引用,就會沿著引用鏈持續傳遞,形成事實上的學術共識。

由於年代久遠、引用鏈條複雜,加之複核工作耗時巨大而學術回報有限,絕大多數已進入文獻體系的錯誤從未被系統性地審視過。但如今一切都鬆動了,至少在技術能力上,人們首次具備了大規模重審過往科學文獻的可能。不過,以GPT-5驅動的Paper Correctness Checker為例,其檢測精確率為83.2%,且每次檢測中仍有約四成真實錯誤未被檢出。可以說,此類AI事實核查工具本身不足以擔任科學文獻的判官,AI核查工具的輸出結果最後還需要人工來審核。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

鈦媒體模型更新

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告

AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

剛剛

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷

Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。

剛剛

Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕

月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。

1 小時前4700
雷峰網模型更新

光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態

8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

6 小時前