量子位生成式AI

當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了數據層RSI

2026年8月9日 11:44
當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了數據層RSI

重點摘要

中國無盡前沿團隊發布BigBang-V1基座模型,這是首個透過遞歸自我改進(RSI)原生方式訓練的模型,參數規模35B,在某些科研任務上表現超越1T級別模型。該模型的訓練數據百分之百由AI自主合成,透過可驗證前沿任務讓系統持續生成高品質數據,實現了數據層的自我進化閉環,不需人類逐題參與。

站內 AI 整理稿

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了數據層RSI 聞樂 2026-08-09 11:40:25 來源:量子位 AI參與創造下一代AI 聞樂 發自 凹非寺 量子位 | 公眾號 QbitAI 硅谷今年最貴的詞,叫Recursive Self-Improving。它就是指讓AI參與迭代自身的模型、算法、數據和研發流程。這個概念有多火呢?

Jeff Dean離職創辦的Discovery Loop,方向就是探索AI自動化科學研究。不只姐夫,AlphaGo締造者David Silver等一眾大牛也在同一條賽道上。看得出來,這些頂級AI研究者正在形成一個共識: 讓AI參與創造下一代AI,讓AI持續自我改進並構建更強的AI。在這個共識之下,一個更棘手的問題出現了。模型越強,能給AI出題、解題、驗證的人越少,高質量訓練數據該從哪來?一支中國團隊給出了他們的答案。

由上海交大人工智能學院、深勢科技、上海算法創新研究院組成的無盡前沿團隊發佈BigBang-V1—— 這是首個基於recursive self-improving原生方式訓練出的基座模型。在訓練過程中,出題、解題、驗證都交給AI把控,通過可驗證前沿任務持續生成高質量自演進合成數據,全程無需人類逐題參與。35B跑贏1T大模型 模型已開源,技術報告也同步公開。BigBang-V1參數規模35B,推理時激活約3B參數,支持262K長上下文。它的後訓練數據100%由AI自主合成,以科學前沿任務為核心。在這樣的條件下,模型在長程搜索、代碼、科學研究、AI研究等評測中,拿下全部35B模型裡的10項第一。

不僅如此,在FrontierScience Research、PaperBench等多項高難度科研任務上,成績甚至超過了1T級的DeepSeek V4 Pro Preview。基準分數之外,具體任務裡的表現更能說明BigBang-V1解決複雜問題的水平。先看一個高難度生物信息學任務。轉座子定位要求在全基因組測序數據裡定位一個47bp的轉座子插入位點,模型不僅要識別相關序列,還得遵守RefSeq染色體命名和1-based座標約定。BigBang沒有去猜座標,而是利用轉座子與染色體之間的連接證據做約束映射: 一個junction對應一個座標,最終把斷點鎖定在4144431,每一步證據都可追溯。

在論文復現任務裡,BigBang的表現又像一個會自我糾錯的工程師。任務要求把LBCS論文復現為可運行的代碼倉庫,它在通讀完論文之後沒有急著交卷,而是在冒煙測試裡發現自己寫出的實現違反了論文的核心主張: 樣本量被固定死了,核心集根本沒法收縮。它推算了擾動規模,發現無法越過觸發閾值,於是連續否決了三個候選修複方案,最終把連續擾動改成二進制掩碼翻轉,問題才真正解決。第二輪它又發現一個梯度項從計算圖中脫離,主動恢復了梯度流,最終復現評分0.7657,全部485個評分點通過331個。這些案例體現的並不只是分數。

BigBang真正展現出的是把多步證據組織成可驗證結論的能力,以及在失敗中發現問題、修正方案的本事。對科研AI來說,這兩種能力恰恰最要緊。畢竟,科研不是背答案,而是從噪聲裡找證據,在出錯時改方案。不過,以科研任務為核心構建的數據,並沒有把BigBang-V1訓練成只會答科學題的垂直模型。BrowseComp基準達到76.5,SWE-Bench Pro拿到54.2,能力增益同時遷移到了長程搜索、軟件工程、代碼等場景。我們也拿它實測了一把長程搜索。讓它盤點8月第一週AI圈的大事。它一天一天連著檢索了二十多輪、翻了十幾個來源。

先用定位候選事件,再逐條打開信源交叉驗證,最後還專門找到一手頁面核對細節,連發布日期都逐個確認才給出結論。而且它現搜列出的來源全部真實可訪問。然後我們又讓它寫了一個太空射擊小遊戲。代碼寫得非常絲滑,打中後爆炸產生粒子特效,左上角還展示了分數、生命、等級遊戲UI。100%純AI合成的訓練數據,為什麼能有這樣的表現?要解開這個疑問,得先從訓練數據本身說起。訓練數據生產,也可以成為AI優化對象 Recursive Self-Improving火熱,業界也都在談論,但大多數探索還僅僅徘徊在概念層,真正跑通完整閉環的落地案例並不多。落到實際工作裡,現在常見的有兩類嘗試。

一部分方案只是給模型套上一層工具外殼,比如harness,讓模型自己調調工具、改改提示詞。但這樣相當於只是把模型的調用方式做了增強,底層的訓練管線幾乎原封不動,並沒有觸動模型自我迭代的根源。還有一類做法則是用大模型對生成的數據做打分篩選。但這套評判標準是人類預先寫死的規則,篩選邏輯本身不會跟著模型能力成長而自我演化。模型變強之後,舊的評判標尺很快就會失效,依然源源不斷產出低價值樣本。單純靠擴大數據集規模、對已有數據反覆清洗過濾,已經很難再撬動能力的進一步躍升。訓練數據仍由人類逐題生產,模型的進化速度被人類出題的速度卡住,這是Recursive Self-Improving落地的核心問題之一。

BigBang團隊換了一個角度思考這個問題。如果模型可以自我改進,那麼能不能讓訓練數據的生產系統本身,也成為被優化的對象?於是,問題從「如何收集更多科學數據」,變成了「如何讓數據生產系統,隨著模型能力一起持續進化」。要解決它,就要回到數據質量這一源頭,數據質量不是清洗洗出來的,是任務本身的屬性決定的。如果想要搭建一套能持續自我進化的數據系統,任務必須同時滿足兩個條件。首先是前沿性。任務要位於當前知識或模型能力的邊界,甚至沒有已知最優答案。新理論、新數據、新工具不斷出現,科學前沿就會持續產生新問題,不會像靜態題庫一樣被模型迅速耗盡。其次是可驗證性。

候選方案要能通過形式化方法、程序執行、數值計算、模擬器、實驗反饋或領域工具做客觀檢查。只有前沿而無法驗證,系統拿不到可靠訓練信號;只有驗證但缺乏難度,任務又會迅速落後於模型能力。二者缺一,數據都會快速貶值。BigBang團隊將科學領域作為模型的訓練載體,恰好同時滿足前沿性與可驗證性兩大條件。它天然組合了搜索、閱讀、提出假設、數學推導、代碼開發、工具調用、實驗分析和結果寫作,相當於一套面向通用智能的綜合課程。Jeff Dean說Discovery Loop這條路線適用於有可衡量目標的科學和工程領域,BigBang選科學當訓練場,底層邏輯同源。

用可驗證的前沿任務牽引數據生產,讓數據生產系統跟著模型一起進化,這就是BigBang給出的回答: AI advancing science, and science advancing AI.(AI推動科學,科學推動AI) AI開始決定,下一代AI學什麼 把理論答案落為工程實現,BigBang的關鍵是一套能持續修改和改進自身生產策略的自演化合成數據管線。它把RSI機制嵌入了訓練管線內部,讓AI直接參與任務構造、求解、驗證、篩選,以及下一輪數據生產策略的優化。△BigBang整體框架 系統的核心,是兩類Agent協同工作。

Generator Agent負責不斷提出並解決科學、技術及AI研究中的高難度任務。並非照著固定Prompt出題的生成器,它是作為代碼Agent,直接修改、運行和調試數據合成程序。並且,它還可以調整任務來自哪些科學領域、問題需要多長的推理鏈、該用搜索還是計算還是代碼還是模擬工具,甚至決定哪些樣本保留、哪些淘汰、哪些生成策略失敗了下輪不再重複。每一輪實驗結束,它還會記錄修改動機、實驗結果和失敗原因,讓後續探索繼承此前的經驗。Critic Agent則從對抗角度審查候選數據。第一層看格式、工具執行、數據完整性和約束滿足; 第二層進一步判斷任務是否正確、可驗證、足夠困難、多樣,並且真正具備訓練價值。

過不了審查的任務就被拒絕或回爐,通過的才進入合成數據集。Generator負責造,Critic負責挑,這套對抗與協作就像AlphaGo的自我對弈,只不過棋盤換成了開放的科學任務空間。以上是系統的自迭代內循環,但這種快速內循環還有一個隱患。Generator可能逐漸學會迎合Critic,造出一些表面複雜、評分很高、訓練後卻無法遷移到真實任務的數據。因此BigBang在快速循環之外,又加了一層由真實訓練結果驅動的外循環。△BigBang的兩層共同演化框架 系統會生成不同版本的數據生產管線,分別訓練模型,再放到留出的真實研究任務裡評測。

如果Critic認為某類數據價值很高,訓練後的模型卻沒有真正變強,說明評價標準存在偏差,系統就用真實結果反向校準Critic,並調整Generator下一輪的任務領域和難度; 反過來,如果某類看似狹窄的科學任務帶來了搜索、推理或工具上的廣泛提升,系統也會加大對該方向的探索。內外雙循環轉起來,數據和模型開始一起變強。但模型越強,原本困難的任務就可能“越來越不值錢”,所以模型過去無法處理的問題又變得可解。因此,數據管線必須是動態的,它得跟著模型一起變化。這就是BigBang的數據層RSI閉環: 上一輪模型和實驗產生的結果,影響下一輪訓練數據的生成與篩選方式。

100%純AI合成數據,靠這個閉環打破了「合成數據會坍縮」的魔咒,錯誤的答案不會被當成正確答案繼續喂回訓練,因為驗證鏈一直在兜底。當然,這也並不意味著人類退出研發。研發目標、資源預算、風險邊界、最終驗收標準,仍然由人類定義。AI不能自行修改評測標準,也不能因為自己的Critic打了高分就直接批准某個方案進入下一輪訓練。人類負責確定方向和定義什麼是有效進步,AI負責大規模探索、執行實驗、整理失敗經驗、生產下一輪訓練所需的數據。可以說,這是訓練數據生產關係的一次重新分工。無盡前沿 BigBang-V1背後的無盡前沿團隊,是學術與產業的結合。團隊創始成員之一是上海交大人工智能學院副教授陳思衡。

這位CMU博士曾任職於Uber ATG自動駕駛部門,回國後帶領團隊打造出通用科研智能體SciMaster。SciMaster曾登頂OpenAI FrontierScience榜單,實現了“搜、讀、算、做、寫”完整科研閉環。另一位核心成員是上海交大助理教授張林峰。這位年輕博導主攻模型壓縮與數據蒸餾,他提出的大模型數據蒸餾方法拿過CVPR滿分,一直在探索怎麼更科學地合成數據、怎麼讓模型用更少的數據變得更高效。產業一側,深勢科技創始人張林峰與中國科學院院士鄂維南為這支團隊補上了AI for Science的產業縱深。

無盡前沿要做的是依託可驗證前沿任務的自進化合成體系,實現開放式通用智能,搭建完整AI自我迭代訓練飛輪。當訓練數據的生產不再依賴人類逐題產出、當AI開始參與決定下一代AI應該學習什麼,AI進步的天花板,就被自己抬高了。或許,下一個賽點的關鍵不在算力堆疊,而在數據智能。模型主頁:https://huggingface.co/endless-frontier/BigBang-v1 代碼地址:https://github.com/endless-frontier/BigBang-v1 團隊主頁:https://endlessfrontier.

tech 版權所有,未經授權不得以任何形式轉載及使用,違者必究。聞樂 奧特曼也逃不過刷TikTok上癮,Sora背後最抓馬的一段來了2026-08-01 企業出海,被中國信通院和騰訊重新定義了一次2026-07-27 芯片賣了56萬片之後,阿里平頭哥把最值錢的東西開源了2026-07-23 清華系團隊發佈國產Token優化工廠:兼容10餘種國產芯片,日吞吐千億Token2026-07-18 掃碼分享至朋友圈

Related

相關文章

IT之家生成式AI

首個全國產 10 萬卡 AI 超集群投用:每秒峰值算力相當全人類持續計算 200 年

首頁 > 智能時代>人工智能 首個全國產 10 萬卡 AI 超集群投用:每秒峰值算力相當全人類持續計算 200 年 2026/8/9 12:23:34 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 9 日消息,據央視新聞今日報道,記者從國家發展改革委瞭解到,今年以來,我國算力底座進一步夯實,首個全國產 10 萬卡人工智能超集群日前正式投用。

剛剛
量子位生成式AI

Opus 5狂燒6.9億token做遊戲,GPT-5.6用5美元復刻了

Opus 5 使用6.9億個token和一條長達2000字的提示詞,花費423美元生成了一款美式卡通風格的水上快艇競速遊戲《INK TIDE》,品質精美。隨後有網友用GPT-5.6在Codex中以約5美元成本快速復刻出類似遊戲,但完成度與畫面細節明顯較差。此案例顯示當前AI生成遊戲的品質上限仍取決於提示詞設計與預算投入。

剛剛
量子位生成式AI

爆料:哈薩比斯原本要和Jeff Dean一起走!

據報導,哈薩比斯原本計畫與Jeff Dean等人同期離開谷歌,但谷歌管理層擔心股價受挫而極力挽留,最終他卸任Google DeepMind CEO,改任董事長及Alphabet首席科學家,被外界視為緩兵之計,可能一年內徹底離開。與此同時,谷歌已將DeepMind的管理權、關鍵人才與決策中心逐步移往加州,而哈薩比斯未來可能更深入投入Isomorphic Labs,延續AI加速藥物發現的科學願景。

剛剛
鈦媒體生成式AI

Jeff Dean離職谷歌首次亮相回答:AI的下一個十年是什麼

前Google首席科學家Jeff Dean離職後首次公開亮相,在AASF 2026峰會上闡述他對AI下一個十年的構想,並發布新公司Discovery Loop。他強調技術判斷應以「10倍提升」為標準,並認為雲端運算將基礎設施變成商品,讓頂尖人才得以在小型創業團隊中追求前沿突破。

剛剛
IT之家生成式AI

消息稱小米成立具身智能與應用部,前字節 Seed 具身負責人孔濤掛帥

小米機器人事業部進行大調整,新成立具身智能與應用部,由前字節跳動 Seed Robotics 具身智能負責人孔濤主導。該部門整合了多個機器人團隊,孔濤將負責小米所有具身智慧業務。此外,小米機器人在汽車工廠的實習表現優異,自攻螺母上件工站雙側作業成功率已提升至98%,接近人類水準。

剛剛
鈦媒體生成式AI

Edge AI Daily 早報(8月9日)

Edge AI Daily 早報(8月9日)Edge AI Daily2026.08.09 08:28 · 來自北京全文3329字00:00 / 09:25谷歌創始人迴歸寫代碼,AI戰略從研究優先轉向產品驅動;Backflip AI以100倍成本坍塌撬動製造業數字化;英偉達與CoreWeave押注亞美尼亞,AI基礎設施轉向能源地緣。

剛剛