Meta新研究:字節模型蒸餾後,天花板破了

2026年9月15日 14:39
Meta新研究:字節模型蒸餾後,天花板破了
站內 AI 整理稿

Meta FAIR 團隊攜手華盛頓大學,近期發表一項名為「字節級蒸餾」的最新研究成果,試圖打破過去語言模型蒸餾技術長期以來的效能天花板。這項研究直接挑戰傳統知識蒸餾的主流框架,從底層運算單元切入,提出一套完全跳脫詞元(Token)層級的訓練方法,讓小型學生模型能夠更精準地模仿大型教師模型的行為,並且在計算資源持續擴增的條件下,仍能穩定拉開與傳統方法的差距。知識蒸餾一直是深度學習領域中實現模型輕量化的關鍵技術。概念上,研究人員先訓練一個規模龐大、效能頂尖的教師模型,再讓一個參數較少的學生模型去學習教師模型的輸出行為,設法在縮小模型體積的同時,盡可能保留接近原廠的預測能力。

傳統作法多半聚焦在 Token 層級,也就是讓學生模型去匹配教師模型在每個 Token 上產生的機率分佈。然而,Token 化本身是一個有損的過程——文字被切分成子詞或詞元時,邊界資訊與字元層級的細微語意往往被犧牲,尤其對於拼寫敏感、字根變化或形態豐富的語言,這類損失會進一步限制學生模型的學習天花板。Meta 與華盛頓大學的研究團隊正是看準了這個瓶頸,提出了「字節級蒸餾」的嶄新架構。他們捨棄 Token 化步驟,直接讓學生模型學習教師模型在原始字節(byte)層次的機率分佈。所謂字節,就是電腦中最基本的資料單位,每個字元、標點或空格都被視為獨立的字節來處理。

這種做法等於繞過所有預先定義的詞彙邊界,讓學生模型直接面對文字最原始的編碼形式,從而保留更完整的底層語言特徵。研究人員認為,字節級蒸餾能夠捕捉到 Token 層級遺失的細微語意線索,例如拼寫錯誤、大小寫變化或非標準用語,這些細節在許多自然語言理解任務中往往扮演關鍵角色。實驗數據顯示,這項新方法在效能成長曲線上展現出明顯優勢。研究團隊透過不同規模的訓練計算量進行預測,模擬從低到高各種運算預算下的模型表現。結果發現,採用字節級蒸餾訓練的學生模型,在各種下游任務(包括自然語言理解與自然語言生成)的平均準確率上限,相較於傳統 Token 級蒸餾,最多可高出 4 個百分點。

更重要的是,這項優勢並非曇花一現——隨著計算資源持續增加,傳統 Token 級蒸餾的效能提升逐漸趨緩,彷彿撞上了看不見的天花板;但字節級蒸餾卻依然保持上升動能,效能天花板似乎被進一步向上突破,讓輕量化模型的潛力獲得重新評估。這項研究為輕量化模型訓練開闢了一條全新路徑。過去業界在部署語言模型時經常面臨兩難:想要高準確率就得使用大型模型,但大型模型需要大量記憶體與運算力,難以在手機、物聯網裝置或邊際伺服器上運行;若改用小型模型,往往犧牲大量效能。

字節級蒸餾提供了一個更具效率的折衷方案:在相同參數規模下,學生模型可以達到更接近教師模型的表現,同時避開 Token 化帶來的語彙邊界問題,對於需要處理多語言、拼寫變異或非規範文本的場景特別有用。研究團隊也指出,字節級蒸餾的訓練流程並未大幅增加計算負擔。學生模型直接從字節序列學習機率分佈,雖然字節序列比 Token 序列更長,但由於不需要維護詞彙表與分詞器,整體管道反而更加簡潔。此外,字節層次的表示也具有天然的跨語言一致性——不同語言的字元都可以用統一的字節編碼表示,模型不需要為每種語言分別學習切詞規則。

這意味著字節級蒸餾在跨語言遷移學習上可能具備先天優勢,對於開發通用多語言輕量模型特別有吸引力。目前該論文已經公開,學術界與產業界均可查閱完整方法與實驗細節。研究團隊表示,後續若能成功整合進主流框架,例如 Hugging Face Transformers 或 PyTorch 生態系,將可望讓小型模型在理解細粒度文字特徵時更具競爭力。對於需要在邊際裝置或有限算力環境中部署高效語言模型的場景而言,這項技術有機會成為新一代模型壓縮的標準做法,進一步降低部署門檻,同時維持服務品質。值得注意的是,字節級蒸餾並非完全取代 Token 級方法,而是在特定條件下提供更優的效能表現。

研究團隊也觀察到,當訓練資料極小時,字節級蒸餾可能因序列過長而收斂較慢,需要搭配適當的學習率排程與架構設計。但在多數中大型訓練場景中,字節級蒸餾的優勢相當穩定,尤其適合需要處理細微語意差異的任務,例如情感分析、語意相似度、問答系統或文本糾錯。從產業角度來看,Meta 此次的研究延續了他們在開源語言模型與輕量化技術上的長期投入。FAIR 團隊過去曾推出 LLaMA 系列模型,帶動一波開放模型熱潮,如今將注意力轉向蒸餾技術的底層革新,顯示他們對於讓高品質 AI 更普及的目標始終不變。華盛頓大學的參與則帶入學術界對訓練效率與模型泛化能力的深入理解,雙方合作可望加速這項技術從論文走向實務。

總體而言,字節級蒸餾為知識蒸餾領域注入全新思考方向:從「模仿 Token 分佈」轉向「模仿字節分佈」,讓學生模型有機會學到更原始、更完整的語言表徵。隨著邊際運算與端側 AI 需求持續增長,這項技術有望成為下一波輕量化語言模型發展的重要基石,讓小型模型不再只是大型模型的廉價替代品,而是能夠真正在某些任務上逼近或超越傳統大型模型的效能表現。未來能否進一步克服序列長度帶來的訓練挑戰,並與現有推理框架無縫整合,將是這條路徑能否廣泛落地的關鍵。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

11 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

13 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

14 小時前