告別單機模型“虛胖”:百靈團隊聯合AReno打通本地智能體強化學習閉環

2026年8月14日 07:376200 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文告別單機模型“虛胖”:百靈團隊聯合AReno打通本地智能體強化學習閉環發布於AI新閒資訊時間 :Aug 14, 2026閱讀 :1分鐘模型能夠完成本地部署,並不意味著它在真實業務場景中能夠遊刃有餘。在具體的業務流程中,AI不僅需要具備基礎的對話能力,還必須精準理解複雜的規則、遵守安全邊界,並正確調用外部工具以輸出符合規範的結果。為了攻克這一痛點,螞蟻ASystem團隊聯合開源社區共同維護的本地化大模型後訓練工具包AReno,近日攜手百靈大模型推出了一條輕量級的後訓練實踐路徑,成功在單機環境中打通了Agentic RL(強化學習)閉環。

為了確保整個技術方案具備高度的可復現性,本次合作選取了規則清晰、反饋直接的井字棋作為最小驗證任務。實驗基於DGX Spark硬件環境,對擁有7.9B總參數但激活參數僅為1.3B的Ling-3.0-tiny模型展開了後訓練。在訓練初期,模型雖然能夠理解基本規則,但在交互過程中仍會出現非法動作;而通過將任務規則轉化為精確的Reward反饋機制,並藉助GSPO算法進行400個步驟的訓練後,模型的獎勵均值明顯提升,輸出長度也隨之收斂。複測結果充分證明,模型在工具調用與動作選擇上的穩定性與合理性得到了質的飛躍。

這一探索的核心價值在於驗證了一條透明、可復現的任務適配方法論:從精準發現錯誤、定義可驗證反饋,到完成本地訓練並回到同一環境進行復測。該模式不僅適用於棋類實驗,更可以流暢遷移至工具調用修復、結構化字段抽取、領域指令遵循以及業務流程智能體等多元化的真實生產場景中。目前,Ling-3.0-tiny已提供BF16、FP8和INT4等多種開源版本,開發者可通過Hugging Face或魔搭社區獲取並使用,同時也可以訪問AReno開源倉庫參與後續的代碼共建與技術討論。相關推薦百萬上下文解鎖複雜辦公!

金山辦公靈犀全量上線 DeepSeek-V4正式版雙模型金山辦公“靈犀專業版”於2026年8月14日接入DeepSeek-V4-Pro正式版,用戶無需配置,手動切換即可體驗。該模型支持100萬token超長上下文,單次最大輸出38.4萬token,基準測試較Preview全面提升,落地場景具差異化優勢。Aug 14, 202699.3k​賈樟柯新片《敦煌媽媽》備案立項:獨居母親愛上 AI,實現橫穿中國賈樟柯編劇新片《敦煌媽媽》備案立項,講述敦煌獨居母親藉助AI排解寂寞、瞭解外界,最終完成橫穿中國之旅。主演趙濤、廖凡,預計2027年上映。Aug 14, 202687.

0kOpenAI年化營收突破400億美元,7月環比暴增超20%OpenAI正加速推進今年在美上市,估值有望突破萬億美元。內部文件顯示,其年化營收已突破400億美元,較去年底翻倍增長;7月單月營收環比增長超20%,財務表現亮眼,引發資本市場高度聚焦。Aug 14, 2026140.4k三星用Claude Code加速芯片驗證:一個月項目縮短至兩天三星電子系統LSI部門將Anthropic的Claude Code引入半導體設計與驗證流程,部分芯片測試週期從一個月以上縮短至兩天,開發效率提升約15倍。該工具今年5月先向軟件開發者開放,現擴展至硬件領域。

在一項含64條複雜數據通路的定製SoC項目中,Claude Code僅用兩天便完成虛擬測試環境搭建與驗證。Aug 14, 202689.0kDeepSeek Harness v0.1開放全球測試:採用“一切皆插件”架構並開源DeepSeek Harness 開發者預覽版 v0.1 發佈並以 MIT 協議開源。其採用“一切皆插件”設計,基於 Cordis 插件系統構建 Agent Harness,模型、工具、技能、會話、沙箱、存儲、循環、調度、UI 等能力均以插件形式組合,可獨立替換與靈活重組。Cordis 元框架負責插件加載等基礎能力。Aug 14, 2026158.

3k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

鈦媒體生成式AI

王興興“錯配”梁文鋒?

王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛