B模型成功率94.5%!Token級獎勵打開長鏈路智能體訓練新思路

2026年9月16日 09:00
B模型成功率94.5%!Token級獎勵打開長鏈路智能體訓練新思路
站內 AI 整理稿

在大型語言模型的訓練過程中,傳統的獎勵機制長期以來習慣以任務最終結果作為唯一評判標準,這種「成王敗寇」的評價方式雖然直觀,卻可能忽略執行過程中關鍵決策節點的真實貢獻。特別是在需要多步推理與長鏈執行的智能體應用場景裡,模型往往必須面對連鎖反應式的決策——例如程式生成、網頁操作或長期規劃——此時真正決定成敗的,並非整條路徑最終是否成功,而是成功之前是否能在關鍵時刻做出正確的選擇。近期一項研究提出了一種名為TVA(Token-level Value Advantage)的Token級獎勵方法,成功將模型在特定任務上的成功率推升至94.5%,為長鏈路智能體訓練開闢了全新方向。

TVA的核心設計在於不依賴因果歸因來判斷每個Token的貢獻,而是利用batch內部的統計關聯來分配獎勵。這種思路跳脫了傳統方法對「哪一步導致結果」的強烈假設,轉而從大量樣本的統計模式中,學習哪些Token的選擇與最終成敗高度相關。研究團隊指出,TVA的效果高度取決於底層advantage算子是否能夠保留Token層級的差異性;若算子將所有Token視為等價,則細粒度的獎勵分配將失去意義,模型也無法從中學到真正的關鍵節點。對比傳統的獎勵機制,後者通常只對完整的任務軌跡給予一次性獎懲,這使得模型難以區分在一連串行為中,究竟是哪一個Token的選擇決定了最終成敗。

舉例來說,在程式生成任務中,若最終程式碼編譯成功,傳統方法會獎勵整條生成路徑,但其中可能包含多個無效或累贅的Token,而真正的轉折點——例如正確的函式名稱或條件判斷——反而被淹沒在整體成功的光環中。TVA透過Token級別的獎勵分配,讓模型能精準辨識這些轉折點,並強化對應的決策模式。然而,TVA的訓練並非沒有代價。由於方法需要對生成軌跡進行重評分,模型必須在訓練階段額外執行一次前向計算,這直接帶來了運算成本的增加。研究團隊也坦承,這項成本在面對長鏈路任務時可能更為顯著,因為軌跡越長,需要重新計算的Token數量也越多。

不過,考量到長鏈智能體任務本身的複雜度與高失誤率,這筆額外運算或許是值得付出的成本——畢竟,傳統方法即使執行數百次推理,也可能因為無法定位關鍵錯誤而始終達不到理想效能。從實驗結果來看,TVA在特定任務上達到了94.5%的成功率,遠高於傳統獎勵機制的最佳表現。研究人員並未詳細揭露該任務的具體細節,但從論文中描述的應用場景推測,應該涉及需要多步驟推理與工具調用的智能體任務。這項成果證明了Token層級獎勵的可行性,也打破了過去學界對「因果歸因是細粒度獎勵唯一途徑」的刻板印象。值得注意的是,TVA的設計哲學與當前主流強化學習方法有本質上的不同。

主流方法通常依賴於基於因果的Advantage計算,試圖找出「因為某個動作,所以得到某個結果」的邏輯鏈;但TVA則轉向統計關聯,透過大量樣本中Token與結果的共變關係來分配獎勵。這種做法雖然在理論上更為靈活,但也對訓練資料的多樣性與batch大小提出了更高要求——若batch內部缺乏足夠的變異,統計關聯可能淪為雜訊。從應用角度來看,TVA最適合的場景莫過於那些「成敗在細節」的長鏈路任務。例如網頁操作中,一個滑鼠點擊的位置可能決定整個爬取流程是否成功;長期規劃中,一句指令中的關鍵詞可能影響後續所有決策的方向。

傳統獎勵機制在這些情況下往往束手無策,因為它們無法辨識這個Token的重要性,反而可能將成功歸因於整段軌跡中的其他無關環節。另一方面,TVA的引入也意味著訓練流程的改變。模型必須在每個訓練步驟中同時保存生成軌跡與對應的Token級獎勵訊號,這對記憶體與時間管理都構成挑戰。研究團隊建議,可以透過非同步計算或近似方法來降低開銷,但這些優化方式是否會影響TVA的精準度,仍有待後續驗證。整體而言,TVA的出現標誌著智能體訓練從宏觀結果導向,轉向微觀決策層級的精細調控。它提醒我們,在評估模型表現時,不應只看終點線的成績,更應關注每一步的落地品質。

當然,這項方法仍處於早期階段,尚未在廣泛的任務集上驗證其通用性;但94.5%的成功率已經為後續研究提供了強而有力的起點。對於正在探索長鏈路智能體應用的開發者而言,TVA無疑是一個值得密切關注的新方向。未來,隨著計算資源的持續提升與演算法優化,Token級獎勵機制有望進一步降低成本,並擴展至更複雜的多智能體協作場景。屆時,模型是否能學會在數百個Token中準確識別那幾個「關鍵之選」,將決定智能體從工具進化為真正自主決策者的速度。而TVA,正是這個進化過程中的一塊重要里程碑。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

5 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

9 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

11 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

12 小時前