何夕2077研究與前沿

RIPO算法破解大模型探索坍塌

2026年7月24日 00:00

重點摘要

RIPO算法破解大模型探索坍塌。 繼強化學習在推理中普及後,坍塌難題被破。幾何錯配 ��� 經常導致傳統剪裁陷入死衚衕。團隊在等距策略優化研究論文中探討了方案。等距更新的方式讓參數訓練過程變得平穩。成功率最高暴漲了六成確實 (☆▽☆) 喜人。

站內 AI 整理稿

**RIPO算法破解大模型探索坍塌难题,训练成功率最高提升六成**

近期,人工智能领域一项名为“RIPO”的算法引发关注。据AI资讯日报及技术博主何夕2077爆料,研究团队成功提出一种名为“等距策略优化”(RIPO)的新方法,有效解决了大语言模型在强化学习训练中广泛存在的“探索坍塌”困境。实验数据显示,该算法使得推理任务的成功率最高暴增六成,训练过程也显著变得更加平稳。 自强化学习被引入大模型的推理环节以来,以GRPO等为代表的算法迅速普及,极大提升了模型在数学、编程等复杂任务中的表现。然而,随着训练规模的扩大,一个深层的技术难题逐渐浮出水面——探索坍塌。这一问题导致模型在反复迭代中丧失对新路径的尝试勇气,性能提升戛然而止。 所谓“探索坍塌”,是指模型在策略更新过程中过早收敛到局部最优解,不再对更优的决策空间进行有效探索。在基于策略梯度的强化学习框架下,模型需要同时平衡“探索”与“利用”,一旦探索动力丧失,即便继续训练,能力也难以突破瓶颈。这种现象在大模型参数量激增后尤为明显,成为阻碍模型智能跃升的关键障碍。 过往为了限制策略更新幅度,业界普遍采用“裁剪”技术,如PPO算法中的clip机制。然而,研究团队发现,传统裁剪策略在处理高维参数空间时,常常因为“几何错配”而陷入死胡同。简单强行裁剪无法在保持更新方向与维持探索范围之间取得平衡,导致模型训练要么过于激进,要么停滞不前。 针对上述痛点,研究团队在《等距策略优化》研究论文中提出了全新的RIPO算法。其核心思想是引入“等距更新”机制,让参数训练在几何空间中保持距离和角度的相对一致。相比传统方法对更新幅度的硬性约束,等距更新能够在自然梯度引导下平稳地调整策略分布,有效避免了因形变导致的信息失真与探索动力衰减。 从技术实现来看,RIPO算法通过重新定义策略分布的度量空间,确保每一步更新都与前一步保持几何上的等距关系。这不仅稳定了训练动态,还保留了充分的探索弹性。它从根本上调和了“快速收敛”与“持续探索”之间的矛盾,使得模型在不断提升奖励的同时,不会过早丧失对潜在更优策略的搜索能力。 团队在多个基准测试中验证了RIPO的性能。对比目前主流的强化学习算法,RIPO在数学推理、代码生成及逻辑问答等任务上展示出显著优势。特别是在原本极易出现探索坍塌的高难度推理场景中,RIPA使模型的有效探索时长延长近三倍,最终任务成功率最高提升了60%。更令研究人员兴奋的是,训练曲线变得异常平滑,以往常见的剧烈抖动明显减少。 这一突破很快在AI社区引发热议。不少技术分析指出,RIPO不仅是对现有强化学习框架的一次有力修补,更可能开启大模型后训练阶段的新范式。在模型参数规模持续膨胀的今天,能否高效稳定地执行策略优化,直接决定了模型的上限。RIPO通过解决探索坍塌,实际为更大规模的训练提供了可扩展的优化路径。 何夕2077在传播这一消息时亦感叹“喜人”,而更多研究者则开始深挖论文细节。有观点认为,“等距”的思路虽然简单,但其背后的几何直觉深刻,或可推广至多模态模型甚至具身智能训练中。届时,机器在陌生环境中的自主学习能力将得到实质提升。 当然,RIPO目前仍处于早期研究阶段,其在不同架构、不同训练设置下的鲁棒性尚需更多测试。但不可否认,它已为大模型推理训练打开了一扇新窗。随着更多团队跟进验证,这一算法有望在不久的将来成为新一代强化学习训练基础设施的重要组成部分。 从强化学习的“裁剪”时代走向“等距”时代,大模型正在远离探索坍塌的陷阱,向着更稳定、更智能的方向迈进。而这次突破,或许正是通往AGI长征路上的一块重要里程碑。

Related

相關文章

WAIC看了一圈,這家公司的機器人在認真打工

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> WAIC看了一圈,這家公司的機器人在認真打工 林, 方舟 2026-07-24 12:19:34 來源:量子位 林方舟 發自 凹非寺 量子位 | 公眾號 QbitAI WAIC 2026現場,人形機器人是最引人注目的主角。 跳舞、格鬥、跑步、打乒乓球……過去只能在實驗室裡看到的各種動作,如今已經成了展臺上的固定節目。 但有個展臺,卻有點不一樣。 一臺人形機器人站在狹小的貨架前,聽完觀眾下的單,從一排商品裡精準挑出目標,穩穩遞到取貨臺。 一支機械臂裝配大小不同、形狀各異的超薄鈑金件,速度快,效率高,足以走出實驗室,應對真實複雜的工況。 場面看起來並不酷炫,但演示的卻是機器人最重要、最實用的能力——落地幹活。 機器人不僅具備複雜場景和複雜任務的操作能力,還有不錯的泛化性,並且能在不同形態的機器人本體上通用。 這些能力,得益於機器人裝的同一套“眼腦手”組件,由梅卡曼德機器人開發。 看完這些Demo,我感覺離工廠、商超由機器人主導的那一天,可能真的不遠了。 難的不是表演,而是上班 機器人真正進廠打工,究竟有多複雜? 場景先給它出一道難題。錯綜複雜的流水線佈局,強烈且不斷變化的環境光,各種各樣的料筐形態,再加上不同規格、不同材質的原料和工件,每一樣都在考驗機器人的感知。 機器人面對的任務也在時刻變化。 上一分鐘,它可能還在抓取零件。下一分鐘就要調整工件姿態、完成裝配,再把空料筐搬走。 傳統自動化設備擅長在固定位置重複固定動作,但只要物體、位置或工序發生變化,整套系統往往需要重新調試。 梅卡曼德在WAIC展示的Demo,啃的就是這些硬骨頭。 來看一個場景:人形

剛剛

北大「雙菲」:天才們的鮮活人生

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 北大「雙菲」:天才們的鮮活人生 程淺 2026-07-24 11:23:41 來源:量子位 菲爾茲獎得主王虹、鄧煜創造中國歷史!這是他們的故事。

剛剛

新晉菲爾茲獎得主,當天宣佈加入OpenAI

新晉菲爾茲獎得主在獲獎當天閃電宣佈加入OpenAI,消息一出即引發學術界震盪。這位數學家捨棄傳統學術路徑,選擇投入人工智慧領域,被外界解讀為OpenAI在基礎科學研究上的重大布局。 與此同時,他的學生近期以代號「Fable 5」的方法,成功推翻一道懸而未解長達87年的數學難題。這項突破不僅彰顯團隊的深厚實力,也為導師轉戰業界提供了即時的實績背書。

剛剛
何夕2077研究與前沿

SGF算法突破長視頻生成瓶頸

SGF算法突破長視頻生成瓶頸。 繼短視頻生成技術成熟後,長視頻迎來突破。全新SGF算法有效補充了上下文記憶。團隊在自梯度強制技術研究論文中提出新架構. 機制通過���反向訓練寫入了未來的記憶。數分鐘穩定生成的成果 ( ̄▽ ̄) 已經實現。

5 小時前