生成模型也能端到端訓練了?核心竟是一個for循環

重點摘要
2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。
2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。它們在訓練時只學習預測「一小步」,推理時卻要像循環網絡那樣將這一步反覆展開數百甚至上千次。訓練和推理所使用的採樣方式並不一致,這個裂縫帶來了長久存在的問題:每一步的誤差會餵入下一步,輸入逐漸偏離訓練時所見過的分佈,誤差層層累積,學術上稱之為「暴露偏差」(exposure bias)。換句話說,「端到端更好」這條深度學習最核心的經驗,十幾年來始終未能真正應用於生成模型之上。 而最近,一篇來自伊利諾大學厄巴納-香檳分校(UIUC)與哈佛大學的論文,試圖補上這塊最後的拼圖。作者將這個新範式命名為「探索式建模」(Explorative Modeling),簡稱XM。其想法簡單到近乎樸素,卻指向一個大膽的結論:生成模型除了參數和數據之外,其實還有第三根可以放大的軸。 要理解這篇論文在解決什麼問題,得先理解生成到底難在哪裡。普通的監督學習,例如分類任務,每個輸入基本上只有一個正確答案,模型只需學習一個確定的映射即可。但生成任務不同,讓模型「生成一隻狗」,正確答案可能多到無窮無盡,這些合法的輸出就是數據分佈中的一個又一個「mode」(即分佈中一個個獨立的峰)。生成之所以困難,正是因為需要同時抓住這麼多mode。 麻煩在於,主流生成模型訓練時使用的是重構損失,例如平方誤差。當一個輸入被隨機配上了許多不同的合法目標時,重構損失所能給出的最優解,是這些目標的平均值。而對絕大多數數據而言,平均值根本不在數據流形上,而是落在幾個mode之間,誰也不像。論文中用一張圖直觀地展示了這個現象:讓模型在沒有任何技巧的情況下直接端到端地迴歸,三堆散點會被它預測成正中間的一個點,一張狗的照片會糊成一團,一句話會退化成把「the」重複到底。這就是「mode模糊」(mode blurring),最優解恰恰是最不像真實數據的那個答案。 現有模型是如何繞過這個問題的?答案是將「生成」這件事拆碎。自迴歸一次只預測一個元素,擴散一次只去除一點噪聲,每一小步的目標都被切到幾乎只剩單一mode,於是重構損失就不會再取平均。這套「拆分生成過程」正是擴散與自迴歸能做出高質量樣本的原因,但也正是它,讓模型無法端到端。作者由此提出一個關鍵追問:一個生成模型只有兩樣東西可以拆,一個是怎麼生成,一個是怎麼訓練。既然拆生成這條路會毀掉端到端,那為什麼不去拆訓練呢? ### 一個for循環:探索式建模的全部內核
Explorative Modeling拆的就是訓練循環本身。它的機制可以用一句話說清:在每一個訓練步,模型不再只生成一個樣本去硬湊目標,而是生成K個候選,然後只挑其中離真實數據最近的那一個來訓練、回傳梯度。論文將其實現成一個三到五行的for循環,簡單得令人有些懷疑。 為什麼這樣做就能解決mode模糊?換個生活場景來理解:猜飛鏢落點。如果只讓你猜一次,最優策略是猜所有飛鏢的平均位置,但這往往是靶盤上根本沒有幾支飛鏢扎中的地方。但如果允許你猜K次,且只按最接近的那一次算分,最優策略立刻改變:你會把這幾次猜測散開,讓每一次去覆蓋一簇不同的落點。模型也是如此。當它被允許探索K個候選,不同的輸入噪聲就會各自「認領」一個不同的mode,而不是全部擠到中間去取平均。探索多少次,模型就能穩穩抓住多少個mode。 作者將這個長期被忽視的能力命名為「生成表達力」(generative expressivity),並指出它由訓練目標本身決定,無論把參數和數據堆到多大,它都不會自己增長。這也解釋了業內早就觀察到的怪現象:為什麼今天最好的模型都如此依賴「引導」(guidance)技術。所謂無分類器引導,本質上是把預測「推離」那個模糊的平均值。但如果模型本身不模糊,又何必去推它?引導之所以有用,恰恰是mode模糊留下的病根。 論文還給出了Forward和Reverse兩種探索方向:前者固定一個真實目標、在自己的生成裡搜尋最近的一個,偏向「查全」(覆蓋所有mode);後者固定一個生成、在真實數據裡搜尋最近的一個,偏向「查準」,且幾乎不增加算力開銷,代價是可能塌縮到少數mode。兩者互補,可以組合使用。 ### 第三根軸:越放大,收益越大
這篇論文最有分量的結論,是把「探索」驗證成了一根真正的scaling軸。作者把探索加到擴散/流模型、Jumpy模型乃至掩碼擴散語言模型上,在圖像、視頻、語言三種模態上一致地看到性能單調提升。更關鍵的是收益隨規模的走向:越放大越猛。論文給出的數字是:隨著數據規模增長,探索帶來的增益從7%一路爬到36%;隨著模型增大,從13%爬到23%;當算力翻到三倍時,效率增益直接翻了一倍多。 具體到效率上,探索把FLOP效率提升了4.1倍、樣本效率提升了6.2倍、參數效率提升了47%。在圖像生成上,它把當前最強的RAE配方進一步推到了ImageNet上無引導1.43的FID,逼近業界最好水平。一個探索5個mode的Large模型,甚至能跑贏一個多了47%參數卻不做探索的XLarge模型。 這個走向的含義並不小。作者的解釋是:小規模時,模型主要被參數和數據卡著,生成表達力還不是瓶頸;可一旦參數和數據放大到「不再是限制」的地步,生成表達力就會越來越成為那個真正的瓶頸。而它正是探索能直接放大的東西。考慮到當下真正的基礎模型訓練,用的算力比這篇論文最大的實驗還高出約四個數量級,作者認為論文裡報出的這些數字,很可能只是更大規模下收益的下限。 ### 真正端到端的生成
如果把探索推到極限,會發生什麼?答案回到了開頭那個懸念:生成模型終於可以端到端了。作者把XM當作獨立的端到端模型,拿去做機器人控制任務。在行為克隆(Behavior Cloning)上,他們的Explorative Policy只用一次網絡前向就追平甚至超過了需要100次前向的Diffusion Policy;在目標導向的世界建模上,Explorative World Model用比Diffuser少16到256倍的推理算力,做到了更好的平均表現。 這個差距的來源很清晰:擴散模型是在推理時用幾百步生成來換取表達力,而端到端的XM把這筆帳挪到了訓練時的探索上,推理因此只需一次前向。「處理多mode」這同一件事,要麼在推理時慢慢拆,要麼在訓練時一次探索到位;這篇論文選擇了後者。 ### 作者與侷限
這篇論文的第一作者Alexi Gladstone並非生面孔。就在2025年7月,他主導的Energy-Based Transformers(EBT)曾在社交平台上引發過不小的討論。那項工作聲稱首次在多個維度上「跑贏」了標準前饋Transformer的擴展曲線,並試圖把「System 2思考」推廣到任意mode。Explorative Modeling與他一貫的思路一脈相承:都在追問「模型能不能通過某種搜索、探索的方式,去做單次前向做不到的事」。而這篇論文更是建立在他與合作者(Yilun Du和Heng Ji)的另一套理論Mode Forcing之上。論文裡坦言,正因為有那套理論在先,XM的大部分結果是先被理論預測、再被實驗驗證的,這在以「跑完實驗再解釋」為常態的深度學習圈裡並不多見。 作者也很坦誠地承認了侷限:best-of-K這個想法本身並不新,前人做過很多次;他們真正的貢獻,是想清楚了這個簡單循環到底在做什麼——它在不拆分生成過程的前提下,直接放大了生成表達力。此外,自迴歸語言模型目前仍是最難啃的骨頭,純端到端的Forward XM在極度多mode的分佈(比如圖像生成)上還太貴,這些都留給了後續工作。 十幾年來,我們習慣了用兩個旋鈕去調生成模型:把它做得更大,餵它更多數據。這篇論文提出的第三個旋鈕相當樸素:讓模型多猜幾次、只留最好的一次。但如果它揭示的趨勢成立,那麼隨著規模繼續膨脹,前兩個旋鈕遲早會擰到頭,而第三個才剛剛開始轉動。
Related
相關文章

阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里Qwen3.

賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發!
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發! Jay 2026-08-03 12:29:44 來源:量子位 終究還是喜提了「美國豆包」 Jay 發自 凹非寺 量子位 | 公眾號 QbitAI 啥,谷歌真比OpenAI還早一年搞出了ChatGPT? 不是谷歌事後找補了,這次是OpenAI自己人,Codex負責人Tibo剛佐證的消息: 那就是早一年版的ChatGPT。最初叫LMChat,後來又換了另一個代號。 谷歌太緊張了,不敢發佈它,而DeepMind則被禁止推出可能衝擊谷歌業務的產品。 但Tibo為啥對這段陳年舊事如此瞭如指掌? 答案是:他當時就在那支谷歌團隊裡。 我當時就是那個團隊的一員。 是的,如今為OpenAI打造「無限Token」的Tibo,正是當年穀歌那個項目的親歷者。 網友都震驚了,Tibo還有這麼一段經歷: 不er,我還以為你只是個Codex的重置按鈕(bushi)。 Jeff Dean:我不甘心啊!! 事情是這樣的,一名Midjourney工程師,最近在X上翻出了前谷歌大腦負責人Jeff Dean的一段舊採訪: 我有時會想Jeff Dean的那次採訪,他說他們在ChatGPT之前就有一個內部的Chatbot,但覺得用它還不如直接用谷歌搜索。 沒想到Tibo親自下場回覆,和Jeff Dean來了波隔空對話: Jeff說的那個項目確實存在,最初叫LMChat,幾乎就是一個早了一年的ChatGPT。 至於為啥沒發出來,Tibo無奈地表示,DeepMind沒這權限啊,LLM會衝擊谷歌搜索,老闆們緊張壞了,不給拍板。

數百萬本書,被Claude “閱後即焚”
Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。

王慧文家族辦公室押注的AI版圖:從大模型到AI Agent
王慧文家族辦公室Lollapalooza Capital已投資24個AI項目,從大模型公司月之暗面到AI Agent創業公司蝴蝶效應,覆蓋AI基礎設施、內容生成、教育和硬體等產業鏈關鍵環節。這顯示其投資布局從早期的大模型能力競爭,逐漸轉向AI應用落地與生態建設。

天下苦閉源模型久矣,MiniMax要做多模態領域的Deepseek
MiniMax發布多模態生成模型H3,支援2K解析度、15秒影片生成,性能與Seedance 2.5相當,但定價僅每秒0.8元人民幣,具備價格競爭力。H3將開源,打破影片生成市場由閉源模型主導的局面,可私有化部署,有望取代部分傳統後製工序。

微信、支付寶會給豆包手機“開門”嗎?AI手機背後的入口之爭
如果這些規則沒有明確,即使技術接口存在,超級App們也沒有動力把最有價值的部分交給一個可能架空自己的外部Agent。如果豆包遲遲無法拿到阿里和騰訊等企業的深度授權,字節並非完全沒有退路。相比其他公司,字節最大的優勢之一,是它本身已經擁有一套規模龐大的互聯網產品生態。在內容領域,字節擁有抖音和今日頭條;在辦公與創作領域,擁有飛書、剪映等工具;在消費場景中,抖音電商和抖音生活服務也已經形成了相當規模的商品和本地商戶供給。