騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間

2026年9月24日 14:10
騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間
站內 AI 整理稿

AI資訊AI新聞資訊正文騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間發佈於AI新聞資訊發佈時間 :2026年9月24號 13:57閱讀 :1分鐘大模型強化學習正奔向更大的GPU集群和更厚的訓練數據,訓練效率已從一個配角升格為頭等大事。騰訊混元團隊最新研究把目光投向了一個被忽視已久的老問題:當模型自己生成訓練數據、且rollout生成與訓練本身以不同節奏縮放時,批大小這門手藝該怎麼重做。研究從經典的臨界批大小理論出發,把它重新推演到在線大語言模型強化學習這個新場景。

結論很務實:在GRPO和PPO這兩類主流算法裡,只要在擴大批大小的有界範圍內重新調一調學習率,就能保住"每條響應"該學到的東西不被稀釋。也就是說,批大小不是越大越好、也不是一成不變,而是存在一個能調教清楚的甜蜜區間。落到實打實的硬件賬單上,收益相當醒目。在固定硬件配置下,把批大小往上擴,PPO生成階段的吞吐量最高提升2.29倍;而測量到的最佳GRPO配置,用比此前少29%的時間就跑到了同一個驗證目標。對天天燒卡的訓練團隊來說,這意味著同樣一張集群、同樣一個目標,要麼更快地交卷,要麼在單位時間裡吞吐更多——強化學習裡最貴的那部分生成開銷,被悄悄擠出了水分。

這項研究的意義在於,它給在線RL的規模化提供了一把可操作的旋鈕:模型在強化學習裡既是學生也是出題人,生成與訓練兩條流水線的縮放失配正是效率黑洞的源頭,而臨界批大小加學習率重調的組合,恰好補上了這道縫隙。當行業還在比誰的模型更大,騰訊混元先把刀磨向了怎麼讓已有的卡跑得更划算。相關推薦Hy Image3.5preview 登陸 WorkRally,影視創作者免費試用兩週騰訊混元發佈 Hy Image3.5preview,騰訊視頻工業級 AI 平臺 WorkRally 首發接入,兩週內向創作者免費開放,用於劇集分鏡、影視物料、角色場景設定等。

該平臺覆蓋劇本解析、分鏡生成、內容生產到資產協作全鏈路,具備專家級 Agent 與 S+ 級影視動漫技能庫。2026年9月24號 10:20152.6k阿里試水QwenBook AI設備,團隊規模約150人阿里雲無影團隊正研發AI設備QwenBook,定位原生智能體電腦,形態接近“千問平板”,尚處早期試水,主打辦公場景,接入Qwen3.8-Max和Flash模型。產品定義與硬件自研,融合無影雲電腦系統及端雲能力,團隊約150人。2026年9月22號 16:01215.4k騰訊混元圖像3.5來了:畫字更準、修圖更強、一張2K圖只要一毛五9月22日,騰訊混元發佈圖像3.

5預覽版,畫質、排版、修圖等核心能力全面升級,使用成本大幅降低,主打“便宜又好用”。官方稱整體能力較上代提升約30%,文字生成更精準,避免缺筆少畫;排版更能理解畫面佈局需求;修圖能力同步增強。2026年9月22號 10:47237.9k上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手上海AI實驗室與上海交大LUMIA Lab提出新預訓練任務“下一個概念預測”(NCP),推出全球首個8.9B離散隱空間基座模型NCP-ArchPreview。該模型僅用51.3%的Token預算,就在5.

73T語料上追平OLMo-3-7B最終預訓練Loss,顯著提升訓練效率。2026年9月22號 10:39167.6k雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.1 Pro 領銜中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。2026年9月20號 16:07226.

8k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

IT之家生成式AI

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底

首頁 > 智能時代>人工智能 谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底 2026/9/24 15:17:50 來源:IT之家 作者:清源 責編:清源 評論: IT之家 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。IT之家注:“後訓練”是在基礎 AI 模型完成後進一步調整模型,提高其行為可靠性。卡武克奧盧希望 Gemini 4 能在“遠早於年底”的時間點推出。“我們的打算是儘快拿出後訓練階段的早期成果,因為我們看到了結果,也很振奮。”隨後,谷歌會繼續快速迭代模型。Gemini 4 將成為谷歌自去年年底推出 Gemini 3 系列後首款下一代旗艦模型。谷歌 2 月發佈了 Gemini 3.1 升級版,此後還推出多款規模更小、成本更低,但複雜推理能力也較弱的 Flash 模型。今年 5 月,谷歌 CEO 桑達爾 · 皮查伊曾在年度 I/O 大會上宣佈,重大更新 Gemini 3.5 Pro 將在 6 月發佈,但最終沒有亮相。卡武克奧盧稱,Gemini 3 和 3.1 推出後,谷歌沒有繼續發佈 Gemini 3.5 Pro,而是“稍微退了一步”,轉而把精力放在 Flash 模型上。“對我們來說,當時最重要的是儘可能加快學習速度。”卡武克奧盧沒有說明谷歌是否正式取消 Gemini 3.5 Pro,而是明確稱,當前重點是推出 Gemini 4。被問到是否擔心谷歌已經落後於同行時,卡武克奧盧回覆道,自己對團隊“百分之百有信心”。“我們的團隊強得不可思議,我對團隊有最大的信任。在我看來,我們始終會站在技術前沿,這是確定無疑的。”目前,Gemini 4 正

剛剛

ChatGPT 移動端上新語音智能體:動動嘴就能寫文檔、總結郵件

據瞭解,Pro 和 Plus 訂閱用戶可在手機上使用"工作"創建文檔、撰寫電子郵件或總結 Slack 消息,還能執行創建網站、製作 PPT、使用雲端瀏覽器等進階操作;Free 和 Go 訂閱用戶則可使用插件與已連接的應用。OpenAI 表示,ChatGPT 的語音對話將提供更豐富的文本輸出,Plus 訂閱用戶可在文本與語音之間輕鬆切換,或者先在手機上處理工作、再轉移到電腦上繼續。

剛剛
IT之家生成式AI

月之暗面最強 AI:消息稱 Kimi K3.1 下月登場

作者:故淵 責編:故淵 評論: 感謝網友 華南吳彥祖 的線索投遞!9 月 24 日消息,科技媒體 Wccftech 昨日(9 月 23 日)發佈博文,報道稱月之暗面(Moonshot)正醞釀推出 Kimi K3.1 模型,並將提供 Low、High、Max 共 3 檔推理強度,預估會在下月(2026 年 10 月)登場。

剛剛

AI團隊重組頻上熱搜:豆包回應“對話團隊砍掉一半”傳聞不實

此前有媒體報道豆包通用Session團隊出現人員縮減,網絡上隨之出現“豆包裁員”“對話團隊砍掉一半”等說法,並有網傳內部員工感慨“豆包正在被邊緣化”。豆包公關負責人劉星發文回應稱,相關報道實為豆包Session團隊的組織調整,部分自媒體將其解讀為裁員,信息不實。

剛剛

豆包向所有用戶免費送30天訂閱權益:標準套餐免費體驗至10月17日

官方展示的訂閱頁面顯示,本次贈送的標準套餐標註“活動贈送”,到期時間為10月17日,用戶可在訂閱與額度管理頁面領取並查看生效狀態。權益機制上,豆包採用訂閱加額度的運營模式:用戶可升級至付費訂閱以獲得高峰期優先權益,或購買創作額度包擴充用量;額度按當前時段與近7天雙週期統計,自開始使用後計時,頁面支持額度重置與訂閱記錄查詢。

剛剛