騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間

AI資訊AI新聞資訊正文騰訊混元把經典臨界批大小理論搬進大模型強化學習,PPO生成吞吐最高拉到2.29倍、GRPO省下29%訓練時間發佈於AI新聞資訊發佈時間 :2026年9月24號 13:57閱讀 :1分鐘大模型強化學習正奔向更大的GPU集群和更厚的訓練數據,訓練效率已從一個配角升格為頭等大事。騰訊混元團隊最新研究把目光投向了一個被忽視已久的老問題:當模型自己生成訓練數據、且rollout生成與訓練本身以不同節奏縮放時,批大小這門手藝該怎麼重做。研究從經典的臨界批大小理論出發,把它重新推演到在線大語言模型強化學習這個新場景。
結論很務實:在GRPO和PPO這兩類主流算法裡,只要在擴大批大小的有界範圍內重新調一調學習率,就能保住"每條響應"該學到的東西不被稀釋。也就是說,批大小不是越大越好、也不是一成不變,而是存在一個能調教清楚的甜蜜區間。落到實打實的硬件賬單上,收益相當醒目。在固定硬件配置下,把批大小往上擴,PPO生成階段的吞吐量最高提升2.29倍;而測量到的最佳GRPO配置,用比此前少29%的時間就跑到了同一個驗證目標。對天天燒卡的訓練團隊來說,這意味著同樣一張集群、同樣一個目標,要麼更快地交卷,要麼在單位時間裡吞吐更多——強化學習裡最貴的那部分生成開銷,被悄悄擠出了水分。
這項研究的意義在於,它給在線RL的規模化提供了一把可操作的旋鈕:模型在強化學習裡既是學生也是出題人,生成與訓練兩條流水線的縮放失配正是效率黑洞的源頭,而臨界批大小加學習率重調的組合,恰好補上了這道縫隙。當行業還在比誰的模型更大,騰訊混元先把刀磨向了怎麼讓已有的卡跑得更划算。相關推薦Hy Image3.5preview 登陸 WorkRally,影視創作者免費試用兩週騰訊混元發佈 Hy Image3.5preview,騰訊視頻工業級 AI 平臺 WorkRally 首發接入,兩週內向創作者免費開放,用於劇集分鏡、影視物料、角色場景設定等。
該平臺覆蓋劇本解析、分鏡生成、內容生產到資產協作全鏈路,具備專家級 Agent 與 S+ 級影視動漫技能庫。2026年9月24號 10:20152.6k阿里試水QwenBook AI設備,團隊規模約150人阿里雲無影團隊正研發AI設備QwenBook,定位原生智能體電腦,形態接近“千問平板”,尚處早期試水,主打辦公場景,接入Qwen3.8-Max和Flash模型。產品定義與硬件自研,融合無影雲電腦系統及端雲能力,團隊約150人。2026年9月22號 16:01215.4k騰訊混元圖像3.5來了:畫字更準、修圖更強、一張2K圖只要一毛五9月22日,騰訊混元發佈圖像3.
5預覽版,畫質、排版、修圖等核心能力全面升級,使用成本大幅降低,主打“便宜又好用”。官方稱整體能力較上代提升約30%,文字生成更精準,避免缺筆少畫;排版更能理解畫面佈局需求;修圖能力同步增強。2026年9月22號 10:47237.9k上海AI Lab與上交大拋出NCP預訓練新範式,8.9B隱空間模型用一半Token追平對手上海AI實驗室與上海交大LUMIA Lab提出新預訓練任務“下一個概念預測”(NCP),推出全球首個8.9B離散隱空間基座模型NCP-ArchPreview。該模型僅用51.3%的Token預算,就在5.
73T語料上追平OLMo-3-7B最終預訓練Loss,顯著提升訓練效率。2026年9月22號 10:39167.6k雙節前後 10 多款大模型蓄勢待發:GPT-6 全系、Opus 5.2、V4.1 Pro 領銜中秋國慶雙節前後,國內外至少十餘款大模型將密集發佈。國外方面,OpenAI月底開發者大會前,重磅產品延期至下週,將補齊GPT-6全系:Sol、Terra、Luna,與已發佈的Astra形成完整矩陣;Anthropic則被指跳過5.1版本。美國廠商雖無節前發佈習慣,但此次節點巧合,或掀新一輪AI競賽。2026年9月20號 16:07226.
8k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。

消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市
該業績躍升主要得益於近期產品定價的上調,以及其系列模型在開發者與企業端持續攀升的採用率。DeepSeek首席執行官梁文峰在近期舉辦的投資者會議上披露了這一核心財務數據。此舉被視為在資本市場關鍵節點提振投資人信心的重要舉措——目前DeepSeek正接近完成第二輪融資,並緊鑼密鼓地籌備在上海證券交易所上市。

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底
作者:清源 責編:清源 評論: 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。

ChatGPT 移動端上新語音智能體:動動嘴就能寫文檔、總結郵件
據瞭解,Pro 和 Plus 訂閱用戶可在手機上使用"工作"創建文檔、撰寫電子郵件或總結 Slack 消息,還能執行創建網站、製作 PPT、使用雲端瀏覽器等進階操作;Free 和 Go 訂閱用戶則可使用插件與已連接的應用。OpenAI 表示,ChatGPT 的語音對話將提供更豐富的文本輸出,Plus 訂閱用戶可在文本與語音之間輕鬆切換,或者先在手機上處理工作、再轉移到電腦上繼續。

月之暗面最強 AI:消息稱 Kimi K3.1 下月登場
作者:故淵 責編:故淵 評論: 感謝網友 華南吳彥祖 的線索投遞!9 月 24 日消息,科技媒體 Wccftech 昨日(9 月 23 日)發佈博文,報道稱月之暗面(Moonshot)正醞釀推出 Kimi K3.1 模型,並將提供 Low、High、Max 共 3 檔推理強度,預估會在下月(2026 年 10 月)登場。

Anthropic Claude Code 雲會話正式上線,Pro / Max 用戶可領 100~250 美元額度
作者:問舟 責編:問舟 評論: 感謝網友 咩咩洋 的線索投遞!9 月 24 日消息,Anthropic 今日宣佈 Claude Code 雲會話功能結束預覽、正式上線。該功能讓用戶在關閉電腦後,讓任務在雲端繼續運行,並可從瀏覽器、手機、桌面應用或終端查看和接管。