長程研究代理基準拉高難度
一個名為「Mr.」的全新長程研究代理基準近日在預印本平台上公開,論文歸屬於電腦科學與人工智慧領域,並於2026年9月10日正式提交。這項基準的推出,主要是為了替研究代理在長時間跨度任務中的表現建立更高門檻,進一步推動該領域的標準化測試與能力比較。對當前快速發展的人工智慧代理研究而言,這代表評估方式正從短週期、單點任務,逐步轉向更接近真實研究流程的長期挑戰。過去常見的代理基準,多半聚焦於短週期、單一步驟的問答或程式撰寫。這類測試雖然能反映模型在特定任務上的基本能力,卻不容易檢驗代理是否具備持續推理、多階段規劃與長期記憶整合等更複雜的本領。
當任務被拆解成單一問題或單一程式片段時,系統往往只需要在有限上下文內給出答案,較難看出它在長時間運作下是否仍能維持方向感、修正策略,或記住先前步驟所累積的資訊。「Mr.」基準正是針對這些缺口設計。它要求代理在更長的時間維度上完成複雜研究流程,而不是只回答一個問題或產出一段程式碼。依照論文描述,受測代理必須經歷文獻檢索、假設推演、實驗設計與結果分析等環節,這些步驟彼此牽連,前一個階段的判斷很可能影響後一個階段的走向。換言之,代理不能只追求單一步驟的正確,還得在整個研究流程中保持連貫與自我校正。這樣的设计試圖更真實地反映研究代理在實際科研環境中的運用潛力。
真實研究工作通常不是一次問答就能完成,而是需要在大量資料中來回搜尋、提出假設、設計驗證方式,再根據實驗結果回頭修正想法。論文作者透過「Mr.」基準,希望把評估場景推向更接近這種長期、多階段的研究歷程,同時也揭露現有系統在延續性任務上的侷限。由於「Mr.」基準刻意拉高難度,參與評估的代理不僅需要精準理解初始問題,還得在過程中動態調整策略、回溯錯誤資訊,並維持長達數小時甚至數天的連貫推理。這對系統的記憶管理、規劃能力與錯誤修正機制都是嚴格考驗。只要中途出現理解偏差、遺漏關鍵資訊,或在某個階段做出錯誤假設,後續流程就可能逐步偏離,最終影響整體研究結果。
這種長時間跨度的要求,使許多當前表現優異的模型在該基準下的成績明顯下滑。論文所呈現的結果顯示,即使部分模型在既有短週期任務中具備亮眼表現,一旦進入需要持續推理與多階段規劃的研究流程,仍會遭遇顯著困難。成績下滑本身反映的不只是單一任務失敗,而是目前人工智慧在長期自主研究能力上仍存在明顯瓶頸。從評估設計的角度來看,「Mr.」基準把焦點放在代理能否在數小時甚至數天的過程中維持目標、累積知識並修正錯誤。這樣的能力與短週期問答或程式生成有本質差異。
短週期任務通常有明確終點與有限上下文,代理只要在當下給出正確回應即可;長程研究任務則要求系統在不確定性中持續前進,並且在遇到矛盾或失敗時,能夠回頭檢查先前的推理鏈。論文作者透過這項工作,也試圖指出現有系統在延續性任務上的不足。當代理被要求處理文獻檢索、假設推演、實驗設計與結果分析等一系列相互依賴的步驟時,任何一個環節的薄弱都可能被放大。這讓「Mr.」不只是另一個排行榜式的測試,而更像是一種壓力測試,用來觀察研究代理在長期自主運作下的穩定度與適應力。該論文的公開,預期將引發學界與業界對下一代研究代理架構的重新思考。
過去一段時間,代理能力的比較多半集中在短任務的正確率或特定程式撰寫表現;如今「Mr.」把難度拉到長時間跨度與複雜研究流程,等於要求研究者重新檢視記憶機制、規劃策略、工具使用與自我修正之間的整合方式。若代理無法在長程任務中保持連貫,單點能力再強也難以轉化為真正的研究助力。對學界而言,「Mr.」基準提供了一個新的標準化測試方向,可用來比較不同系統在長程研究流程中的表現。對業界來說,這也意味著若要把代理應用於更接近真實科研、分析或開發流程的場景,就必須面對長期推理與多階段規劃的挑戰。基準的價值不僅在於排名,更在於揭露問題所在,讓後續研究能針對弱點提出改進。整體來看,「Mr.
」基準的出現,象徵研究代理評估正從短週期、單一步驟的問答或程式撰寫,邁向更長時間跨度、更多階段整合的複雜任務。它要求代理理解初始問題、動態調整策略、回溯錯誤資訊,並在數小時甚至數天的過程中維持連貫推理。當前許多表現優異的模型在此基準下成績明顯下滑,顯示長期自主研究能力仍是人工智慧領域亟待突破的瓶頸。隨著論文在預印本平台公開,關於下一代研究代理架構的討論預料將持續升溫。無論是學界還是業界,若想讓代理真正勝任長程研究工作,就不能只著眼於單一任務的正確率,而必須正視持續推理、多階段規劃與長期記憶整合等核心能力。「Mr.」基準拉高的不只是測試難度,也重新定義了外界衡量研究代理实力的標準。
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床
AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。