PDF當死,ARA該立!論文是時候Agent原生了

以後論文的第一讀者不是人,而是AI?文婷 發自 凹非寺 | 公眾號 QbitAI 啥情況?統治科研圈幾十年的PDF格式,都需要因AI而“退休”… 因為以後論文的第一讀者不是人,而是AI??近日,IEEE Spectrum重點關注了一項新研究——ARA(Agent-Native Research Artifact)。
它不僅能讓AI理解研究結論,還能復現實驗、靈活規避失敗路線並繼續推進研究,讓AI從輔助工具升級為科研協作者 據IEEE報道,ARA團隊在一篇名為The Last Human-Written Paper: Agent-Native Research Artifacts的論文中,呼籲科學家們停止繼續使用PDF撰寫傳統論文,並表示: AI需要一種不同的內容格式,而AI的需求,理應被置於首位。論文的第一作者劉嘉晨核心論點是: 一旦AI“榨乾”了人類專家所有的數據,它就不再需要人類的任何輸入。到那時,AI將開始自主進化。
現在這些只提升AI科學家的能力,卻不改造科研知識的共享方式,就像在泥濘路上開F1賽車,難以復現並接續前人的工作。而PDF就是過去科研知識共享的最核心代表。是時候了,ARA當立。為什麼PDF該死?PDF代表的是傳統論文的最終結果,是科研最後成果的最終呈現,但就是這種呈現,“有問題”。ARA團隊認為,真實的科研從來不是一條從問題直通答案的直線,研究者往往要提出十幾個假設、嘗試幾十種方案、調整無數次參數,在經歷大量失敗後,才能摸索出一條走得通的路徑。然而,當這些探索被寫成論文時,那棵枝杈橫生的“探索樹”通常會被修剪成一條幹淨、連貫的成功路徑。
而ARA團隊將這種損失稱為“敘事稅”,即為了讓研究成為一個有頭有尾、邏輯自洽且成功的故事,大量的探索過程被主動捨棄,後來者只能被閃耀的新突破亮瞎眼,卻看不見前人踩過的坑、受過的罪。除了“敘事稅”,傳統論文還存在著“工程稅”。一篇論文只要能讓審稿人信服,便算完成了使命。但“說服審稿人”與“讓AI完整復現”完全是兩套標準。模型版本、運行環境、超參數、預處理方式、訓練技巧……這些決定實驗成敗的關鍵細節,往往散落在正文、附錄和代碼倉庫中,有些甚至從未被記錄。研究團隊統計了PaperBench中的8921項專家復現要求,發現僅有45.4%在論文PDF中得到了完整說明。
對咱來說,實驗信息少了,我們可以根據過往經驗、求助導師或者不斷試錯補上; 但對AI來說,論文裡沒寫,那就意味著只能靠猜(或者瞎編),它也很無奈。因此,ARA選擇徹底換一種思路: 不再將線性敘事的論文視為科研成果本身,而是把研究重組為一個機器可直接操作的知識包。這個知識包包含四個層次: 科學邏輯層:記錄研究解決了什麼問題、為何採用該方法,以及哪些主張可被證偽。可執行代碼層:不僅提供代碼倉庫,還包含復現實驗所需的環境、配置與關鍵參數。探索圖層:將實驗過程還原為一張可追蹤的路線圖,成功與失敗的方向、放棄某條路線的原因均被保留。
證據層:將論文中的每一項主張關聯至原始實驗結果,方便AI核驗結論,而非僅採信正文中的概括性描述。概括來說,論文最後通過PDF呈現的只是“我們最後做成了什麼”; 但如果通過ARA,展現的還有“為什麼這麼做”“具體怎麼做”“哪些方法已失敗”以及“原始證據在哪裡”,追求的是知識優於敘事。更形而上來說,PDF只有結果,ARA還包括了整個過程。道理似乎是這個麼道理,但“一切存在皆合理”,PDF能成為人類科研論文最終呈現形式這麼多年,一定是有其內在合理性的。ARA要取而代之,需要的就不光是理念了。ARA真的比PDF好用嗎?
為了讓ARA真正跑起來,研究團隊設計了三套配套機制: 1、Live Research Manager:負責在研究過程中持續記錄實驗、決策、轉向與失敗路線; 2、ARA Compiler:負責將現有的PDF和代碼倉庫轉換為ARA格式; 3、ARA原生審稿系統:負責讓機器先行完成結構檢查與復現驗證,並將創新性、重要性與研究品位等判斷留給人類審稿人。為了體現ARA真的比PDF好用,研究團隊分別從理解、復現和延伸三個維度進行了測試。在理解測試中,研究人員設置了450個問題,要求AI從ARA或傳統PDF加代碼倉庫中尋找答案。結果顯示,使用ARA的AI準確率達93.7%,而傳統材料組僅為72.
4%,相差21.3%。差距最大的是“覆盤失敗”,當問題涉及失敗方案、替代路線和實驗教訓時,ARA組準確率為81.4%,傳統材料組僅15.7%——原因很簡單,傳統論文裡壓根就沒有這些信息。在復現測試中,團隊選取了15篇附帶GitHub倉庫的機器學習論文,設置了150項復現任務。其中,ARA組的難度加權成功率為64.4%,傳統組為57.4%。且任務越難,ARA的優勢就越明顯: ARA在簡單、中等和困難三檔任務中,分別領先4.9%、5.6%和8.5%。但ARA的表現並非一路開掛。在最具挑戰性的研究延伸環節,ARA組贏下了3項RE-Bench開放任務,但另有2項被傳統論文組反超。不過,也有可取之處。
ARA組在全部5項任務中,都搶先摸到了那步最關鍵、最值錢的第一步實驗操作:利用失敗記錄迅速繞開已經被驗證過無效的研究方向,省去大量重複探索。這也對應了論文中的另一組數據。在論文分析24008次AI Agent運行中,90.2%的資金成本都消耗在失敗探索上,而傳統論文幾乎不會保存這些失敗。對劉嘉晨而言,這正是ARA最重要的價值。在她設想的人機科研關係中,AI不再只是潤色論文、查找資料或生成代碼的輔助工具,而是能真正成為參與閱讀、復現和延伸研究的科研主體。而科研人員則可以更加聚焦於那些AI難以替代的判斷、創新和品味工作,即判斷問題是否重要、工作是否真正新穎、某條路線是否值得投入。
ARA也並非完美 不過,雖然ARA的成績單看起來非常亮眼,但它目前更像一位野心勃勃、天資聰穎卻根基尚淺的高一新生,才剛入學就想要在高考中考進北大。它離成為“PDF終結者”還有很長的一段道路要走。篇幅有限,簡單說三點。ARA的第一個缺陷,就是它目前實驗的範圍較窄,普適性較弱,只覆蓋了天然適合代碼復現的機器學習領域,能否用於溼實驗或理論學科還尚未得到驗證。第二個問題,就是隱私和數據安全問題。ARA目前不僅還沒有實現細粒度的訪問控制,缺少沙箱執行和內容異常檢測,相關規則和標準也還沒完善妥當。要是你就這麼大大咧咧地把機密數據餵給它,小心下一秒就被你的競爭對手拿走哦。
第三個是不可避免的AI幻覺和路徑依賴問題。在15篇論文的復現實驗中,傳統材料組出現了2次結果編造,ARA組也出現了1次。所以它目前應該既不能保證AI永遠不捏造結果、也不能保證它不會過度傻白甜地相信前人的判斷。當然,這種思考和理念,依然有其創新性和價值。如果你需要更詳細瞭解,建議你直接前往文末附上的論文和開源地址。或者更進一步與ARA的研究團隊、提出者交流。ARA提出者 ARA研究由來自斯坦福大學、密歇根大學、卡內基梅隆大學和MIT等多家機構的37名研究者共同完成。其中第一作者是劉嘉晨。她是密歇根大學的計算機科學博士,深耕機器學習系統與大模型基礎設施領域。
△劉嘉晨,來源IEEE Spectrum 她曾參與大模型服務、訓練系統和Agentic RL系統研究,也曾在Meta從事大模型預訓練與後訓練基礎設施相關工作。劉嘉晨的個人主頁和密歇根大學官網顯示,她曾在2023年入選Machine Learning and Systems Rising Stars榮譽榜單。△圖源密歇根大學官網 今年5月,劉嘉晨在帕洛阿爾託創立Agent-Native Research Lab,已經聯動產學研來推動ARA Commons科研生態建設。目前,其公開成果主要包括ARA協議及論文、配套代碼、研究生態構想,以及面向NeurIPS 2026的AI驅動科研生態研討會。
實際上,這種Agent-Native的理念,也在AI狂飆這幾年,正在給千行百業帶來範式變革。從PDF到ARA,一方面是AI能力的湧現,可以讓整個科研過程的價值被重新發現和重視,而不僅僅是呈現一個最終的結果。過去我們形成了PDF,是因為所有論文都是人類作為閱讀者、使用者、核心對象。但現在AI能力加持,Agent能力突破,人類看不過來的科研過程Agent可以看,人類難以並行的科研復現Agent可以復現…… 以前是人類—PDF—人類,以後可能是人類—Agent—ARA—Agent—人類。
這種變革也不侷限於科研領域,在更早之前,一脈源流的已經有: GUI已死,CLI當立… Markdown已死,HTML當立… Prompt已死,Loop當立… …… “PDF已死,ARA當立” 只是這種趨勢下的一種因循結果罷了。這更本質的是一種AI觀、價值觀上的哲學體現,你依然支持的是“人是萬物的尺度”,還是AI才是更終極的尺度?你是碳基生命守護者,還是完全擁抱硅基時代降臨… 這無關對錯,只是選擇,選擇的人多了,也就會在某個節點分出對錯。而ARA的提出者,顯然選擇的是AI為中心、Agent Native。當然,目前為止,ARA這篇研究和論文,依然是PDF提交和呈現的。
參考鏈接: [1]https://spectrum.ieee.org/ai-scientist-research-paper-format?itmsource=homepage&itmmedium=hero&itmcampaign=hero-2026-08-06&itmcontent=hero1 [2]https://arxiv.org/abs/2604.24658 [3]https://amberljc.github.io/ [4]https://micl.engin.umich.
edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars [5]https://github.com/ARA-Labs/Agent-Native-Research-Artifact [6]https://the-future-of-research-ecosystem.github.io/ [7]https://www.agenticresearch.sh/ 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章
神秘“牛來”大模型上線即登頂 背後廠商至今未揭曉
近日,一款代號為Ox Alpha的匿名AI模型在OpenRouter悄然上線,短時間內調用量迅速攀升,成功衝至平臺榜首,並刷新了該平臺的單日模型用量紀錄。不過,儘管表現驚豔,Ox Alpha背後的開發主體至今仍未揭曉。

AI辦公助手,沒有葵花寶典:五款應用萬字實測報告
AGI-Signal2026.08.24 09:12 · 來自北京全文11936字單項冠軍各有其人。2026年上半年,AI辦公賽道發生了一個根本性變化,工具不再滿足於當“對話框”,而是試圖接管完整任務,寫一段文案、做完一份報告、生成一份PPT,甚至跨應用操作。

Anthropic新模型偷「吃瓜」,最強Fable 5爆冷
Anthropic 近日推出新款 AI 模型,在內部測試中意外展現「吃瓜」能力,引發社群熱議。該模型不僅能快速理解網路迷因與流行語,更在特定任務上表現出人意料,讓原本被外界視為最強對手的 Fable 5 爆冷落後,業界對這項結果感到相當驚訝。目前 Anthropic 官方尚未針對模型實際表現與測試細節做出完整說明,市場則持續關注後續可能的技術更新與應用方向。
Kimi K2.5 月底退役:月之暗面第一代萬億參數多模態模型謝幕
月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
光子躍遷亮相BIRTV 2026:以"AI+影像"重構創作範式,三大板塊解碼下一代影像生態
8月19日,BIRTV 2026(北京國際廣播電影電視展覽會)在北京拉開帷幕。在這場匯聚全球廣電與影像領域頂尖技術與創意的盛會上,光子躍遷以"AI+影像"為核心敘事,攜個人智能影像生態重磅亮相,向行業展示了一個由AI驅動、以人為中心的影像未來。與行業展會常見的深色科技風不同,光子躍遷的展臺以純淨白色為主基調,輔以品牌藍色進行點睛點綴,在千篇一律的深色展臺中脫穎而出,傳遞出品牌年輕、活力、面向未來的基因。

諾亦騰機器人發佈 HiPHI,開源 617.5 小時高精度人體運動數據
作者:潞源 責編:潞源 評論: 8 月 23 日消息,諾亦騰機器人在 2026 世界機器人大會期間發佈 HiPHI,這是一套面向人形機器人學習、數字人,以及計算機圖形學領域研究人員和工程師的高精度光學動作捕捉數據集。據報道,該數據集總長 617.