Bart復古LLM開源
開源社群近日出現一款名為 Bart 的復古語言模型,參數量達到 2.82B,一推出便在技術圈內引發熱烈討論。這款模型之所以受到矚目,並非因為它具備當前主流大語言模型的頂尖效能,而是因為它選擇了一條截然不同的路線——將訓練資料完全鎖定在 1931 年之前的英文文本上,試圖透過機器學習的方式重現近百年前的語言風格與知識脈絡。根據 Reddit 上的介紹,Bart 的語料規模約為 20.1B tokens,整體訓練成本據團隊宣稱僅約 807 美元,以如此低廉的經費完成一個 2.
82B 參數模型的訓練,在現今動輒數百萬美元訓練費用的 AI 產業中格外顯眼,也再次印證了開源社群在資源有限的情況下,依然有能力推進語言模型研究的可能性。Bart 的誕生背景,與當前大型語言模型競相追求更大參數量、更多訓練資料、更強推理能力的趨勢形成強烈對比。近年來,各家科技巨頭與研究機構紛紛投入巨額資源,打造數百億乃至數千億參數的模型,並以涵蓋網路文章、書籍、學術論文、程式碼等多元來源的龐大語料進行訓練,目標是讓模型能夠應對各種複雜任務,從日常對話、內容生成到專業領域的問答與分析。
然而,Bart 的團隊卻反其道而行,刻意將訓練資料的時代範圍嚴格限制在 1931 年以前,這意味著模型所學習的詞彙用法、語法結構、文化典故與世界觀,都停留在一個世紀前的時空背景之中。這種復古取向的設計,使得 Bart 在處理現代用語與當代資訊時勢必有所侷限。例如,當使用者詢問關於電腦、網路、人工智慧、太空探索等 20 世紀後期才出現的概念時,模型可能無法給出準確或有意義的回應,因為這些詞彙與知識從未出現在它的訓練資料中。同樣地,現代英語中大量湧現的俚語、縮寫、流行文化用語,以及近年來因科技發展而誕生的新詞,對 Bart 而言都是陌生的領域。
然而,這種侷限性並非純粹的缺陷,反而在某種意義上成為 Bart 的獨特優勢。由於模型不受現代語言干擾,它在理解特定歷史文本、模擬早期文風、解析古典文獻等應用場景中,具備了當代模型難以比擬的專注性與純粹性。對於歷史研究者、語言學家以及從事文獻數位化工作的專業人士而言,Bart 提供了一個極具實驗價值的工具。在過去,若要分析大量 19 世紀末至 20 世紀初的英文書籍、報刊、信件或官方文件,研究人員往往需要耗費大量心力進行人工閱讀與比對,即便借助現代語言模型輔助,也常因模型訓練資料中混雜了大量現代文本,導致對歷史語境的理解出現偏差。
Bart 的出現改變了這個困境,它作為一個完全基於 1931 年前文本訓練的模型,能夠更貼近當時的語言習慣與思維模式,無論是辨識特定時代的用詞差異、理解已被淘汰的語法結構,或是模擬維多利亞時期小說的敘事風格,Bart 都展現出獨特的能力。除了在學術研究上的潛在應用,Bart 也為創作者與文化工作者開啟了新的可能性。在文學創作領域,作家可以利用 Bart 生成具有復古風情的文本片段,作為小說、劇本或詩歌創作的靈感來源;在影視製作中,編劇與美術團隊可藉助模型理解特定歷史背景下的對話模式與社會氛圍,使作品呈現更貼近時代的真實感。
此外,對於博物館、圖書館、檔案館等文化保存機構而言,Bart 可作為輔助工具,協助整理與解讀大量尚未數位化的歷史文獻,提升藏品研究的效率與深度。值得注意的是,Bart 的訓練成本僅約 807 美元,這個數字在大型語言模型領域幾乎可以說是微不足道。近年來,產業界普遍認為訓練一個具有競爭力的語言模型需要耗費巨額資金,僅計算雲端運算資源的支出,往往就高達數十萬甚至數百萬美元,若將資料收集、清洗、標註以及人力成本納入計算,總花費更是驚人。Bart 團隊以如此低廉的成本完成訓練,背後可能涉及多種最佳化策略,例如採用更有效率的模型架構、使用預訓練與微調相結合的方法、或是在運算資源的調配上進行精細控制。
無論具體做法為何,Bart 的案例都向開源社群傳遞了一個重要訊息:語言模型研究並非只有大型企業或資金充裕的研究機構才能參與,個人開發者與小型團隊同樣有機會以創意與巧思,在有限的資源下做出具價值的成果。Bart 的出現,也為 LLM 生態系增添了一個具實驗性質的選項。目前市場上的語言模型大多以通用性為導向,追求在各類任務上都表現優異,然而這種「通才」路線往往意味著模型在特定領域的深度有所不足。Bart 則代表了一種截然不同的設計哲學——以「專才」為目標,放棄廣泛的適用性,轉而深耕單一時代的語言特徵。這種取徑雖然在應用範圍上較為狹窄,但在其所專注的領域中,卻可能達到通用模型無法企及的精準度。
對於關注語言演變、歷史文獻處理或文化保存的研究者而言,Bart 提供了一個可供測試、修改與微調的基礎模型,讓有興趣的團隊能夠在此基礎上進一步開發更符合自身需求的專用工具。當然,Bart 作為一款實驗性質濃厚的模型,仍有許多值得探討與改進的空間。首先,訓練資料僅涵蓋 1931 年前的英文文本,這意味著模型的知識範圍存在明確的天花板,無法處理任何與現代社會相關的議題;其次,2.
82B 的參數量在當今動輒數十億甚至數百億參數的模型生態中屬於中小規模,這可能限制了模型的整體表現與複雜任務的處理能力;再者,訓練資料的來源與品質、資料中是否存在偏見或遺漏、模型在生成文本時是否會出現時代錯置等問題,都有待進一步檢驗。然而,正是這些侷限性與不確定性,使得 Bart 成為一個值得關注的實驗案例,它所代表的「復古 AI」路線,或許將激發更多研究者思考語言模型發展的多元可能性。從更宏觀的角度來看,Bart 的出現反映了開源社群近年來日益蓬勃的創新活力。
在大型科技公司主導 AI 發展的同時,開源社群憑藉著集體協作與知識共享的精神,不斷推出各種具備實驗性質的模型與工具,填補了商業產品未能覆蓋的空白。Bart 正是這種精神的具體體現——它不以追求商業價值為目標,而是基於對語言本質與歷史脈絡的探索熱情,打造出一款獨具特色的模型。對於那些對 AI 技術懷抱好奇與熱忱的人而言,Bart 的開源釋出意味著任何人都可以下載、使用、修改這個模型,進一步探索它的能力邊界,或將其整合進自己的研究與創作之中。總而言之,Bart 是一款顛覆主流思維的復古語言模型,它以極低的訓練成本、完全限定的歷史語料,以及明確的實驗定位,在 LLM 生態中開闢出一條前所未有的小徑。
雖然它無法與當前最先進的通用模型在效能上一較高下,但其獨特的時代取向與應用潛力,使其在特定領域中具備不可取代的價值。對於語言學家、歷史學者、文化工作者以及所有對語言演變感興趣的人而言,Bart 無疑是一個值得深入探索的新工具,也為開源 AI 社群的未來發展提供了另一個值得深思的方向。
Related
相關文章

被智譜封號的會員,有多少是被冤枉的?
鋅消費研究中心2026.08.25 11:33 · 來自北京全文3351字00:00 / 09:02這麼突然被封號了?文 | 鋅消費研究中心 真金白銀辦了智譜會員,結果賬號突然就被封了。 你如果遇到這種事兒,會不會賬號剛一被封,就想原地發瘋? 先別急。智譜之所以會對用戶進行封號,往往源於用戶的登錄設備、IP等出現異常,被平臺判定為多人使用賬號。 而之所以出現這種情況,除了智譜定價越來越貴之外,還源於智譜新、老會員定價不同,讓會員們有了更多套利的空間。

中消協發佈消費提示:使用人工智能服務需謹防誤導
作者:遠洋 責編:遠洋 評論: 8 月 25 日消息,中國消費者協會今天發佈人工智能服務消費提示,提醒廣大消費者理性認識通用生成式人工智能的信息輔助和參考屬性,對涉及價格費用、合同條款、售後服務、法律責任等重要消費信息,不宜僅依據人工智能生成內容作出決定,應通過經營者官方渠道、合同文本、監管部門及其他權威渠道進行核實確認。

VC開始靠AI預測未來了
DigClaw的預測框架Rhizome在FutureX評測中,以同一套系統跨三個不同基礎模型取得前三名成績,驗證其預測能力可獨立於模型權重。該系統將搜索、因果推理與概率推斷解耦,並透過軌跡記錄與校準累積數據資產,試圖解決大型語言模型不擅長因果預測的根本問題。這項技術由AI原生創投Newborn Ventures支持,目標是將投資背後的趨勢預測系統化,應用於投資決策與產業風險評估。

全球最大生活指南百科 WikiHow 指控 OpenAI 爬取超 1.1 萬篇教程文章訓練 AI
作者:故淵 責編:故淵 評論: 感謝網友 愚公騎馬 的線索投遞!8 月 25 日消息,路透社今天(8 月 25 日)發佈博文,報道稱 WikiHow 於 8 月 21 日向美國曼哈頓聯邦法院提交訴訟,指控 OpenAI 其未經許可抓取超過 11,000 篇教程文章,用於訓練 ChatGPT 及 GPT 大型語言模型,並侵犯至少 1,200 項已註冊版權。

Edge AI Daily 早報(8月25日)
Edge AI Daily2026.08.25 08:05 · 來自北京全文4868字00:00 / 13:43微軟Skala 1.1改寫計算化學底層規則;Coherent用SiC襯底提升AI散熱25%。AI倫理調查顯示ChatGPT等模型高頻鏈接反墮胎組織。

研究團隊調查發現超七成英語生物醫學論文已使用 AI 輔助寫作,呼籲業界建立完善監管機制
作者:漾仔 責編:漾仔 評論: 8 月 25 日消息,據外媒 phys 報道,近期 Lena Holzwarth 帶頭的研究團隊分析了來自 PubMed Central 平臺的 119 萬餘篇英文生物醫學論文,發現生成式 AI 正迅速融入學術論文寫作。