Bart復古LLM開源

2026年8月25日 00:00
站內 AI 整理稿

開源社群近日出現一款名為 Bart 的復古語言模型,參數量達到 2.82B,一推出便在技術圈內引發熱烈討論。這款模型之所以受到矚目,並非因為它具備當前主流大語言模型的頂尖效能,而是因為它選擇了一條截然不同的路線——將訓練資料完全鎖定在 1931 年之前的英文文本上,試圖透過機器學習的方式重現近百年前的語言風格與知識脈絡。根據 Reddit 上的介紹,Bart 的語料規模約為 20.1B tokens,整體訓練成本據團隊宣稱僅約 807 美元,以如此低廉的經費完成一個 2.

82B 參數模型的訓練,在現今動輒數百萬美元訓練費用的 AI 產業中格外顯眼,也再次印證了開源社群在資源有限的情況下,依然有能力推進語言模型研究的可能性。Bart 的誕生背景,與當前大型語言模型競相追求更大參數量、更多訓練資料、更強推理能力的趨勢形成強烈對比。近年來,各家科技巨頭與研究機構紛紛投入巨額資源,打造數百億乃至數千億參數的模型,並以涵蓋網路文章、書籍、學術論文、程式碼等多元來源的龐大語料進行訓練,目標是讓模型能夠應對各種複雜任務,從日常對話、內容生成到專業領域的問答與分析。

然而,Bart 的團隊卻反其道而行,刻意將訓練資料的時代範圍嚴格限制在 1931 年以前,這意味著模型所學習的詞彙用法、語法結構、文化典故與世界觀,都停留在一個世紀前的時空背景之中。這種復古取向的設計,使得 Bart 在處理現代用語與當代資訊時勢必有所侷限。例如,當使用者詢問關於電腦、網路、人工智慧、太空探索等 20 世紀後期才出現的概念時,模型可能無法給出準確或有意義的回應,因為這些詞彙與知識從未出現在它的訓練資料中。同樣地,現代英語中大量湧現的俚語、縮寫、流行文化用語,以及近年來因科技發展而誕生的新詞,對 Bart 而言都是陌生的領域。

然而,這種侷限性並非純粹的缺陷,反而在某種意義上成為 Bart 的獨特優勢。由於模型不受現代語言干擾,它在理解特定歷史文本、模擬早期文風、解析古典文獻等應用場景中,具備了當代模型難以比擬的專注性與純粹性。對於歷史研究者、語言學家以及從事文獻數位化工作的專業人士而言,Bart 提供了一個極具實驗價值的工具。在過去,若要分析大量 19 世紀末至 20 世紀初的英文書籍、報刊、信件或官方文件,研究人員往往需要耗費大量心力進行人工閱讀與比對,即便借助現代語言模型輔助,也常因模型訓練資料中混雜了大量現代文本,導致對歷史語境的理解出現偏差。

Bart 的出現改變了這個困境,它作為一個完全基於 1931 年前文本訓練的模型,能夠更貼近當時的語言習慣與思維模式,無論是辨識特定時代的用詞差異、理解已被淘汰的語法結構,或是模擬維多利亞時期小說的敘事風格,Bart 都展現出獨特的能力。除了在學術研究上的潛在應用,Bart 也為創作者與文化工作者開啟了新的可能性。在文學創作領域,作家可以利用 Bart 生成具有復古風情的文本片段,作為小說、劇本或詩歌創作的靈感來源;在影視製作中,編劇與美術團隊可藉助模型理解特定歷史背景下的對話模式與社會氛圍,使作品呈現更貼近時代的真實感。

此外,對於博物館、圖書館、檔案館等文化保存機構而言,Bart 可作為輔助工具,協助整理與解讀大量尚未數位化的歷史文獻,提升藏品研究的效率與深度。值得注意的是,Bart 的訓練成本僅約 807 美元,這個數字在大型語言模型領域幾乎可以說是微不足道。近年來,產業界普遍認為訓練一個具有競爭力的語言模型需要耗費巨額資金,僅計算雲端運算資源的支出,往往就高達數十萬甚至數百萬美元,若將資料收集、清洗、標註以及人力成本納入計算,總花費更是驚人。Bart 團隊以如此低廉的成本完成訓練,背後可能涉及多種最佳化策略,例如採用更有效率的模型架構、使用預訓練與微調相結合的方法、或是在運算資源的調配上進行精細控制。

無論具體做法為何,Bart 的案例都向開源社群傳遞了一個重要訊息:語言模型研究並非只有大型企業或資金充裕的研究機構才能參與,個人開發者與小型團隊同樣有機會以創意與巧思,在有限的資源下做出具價值的成果。Bart 的出現,也為 LLM 生態系增添了一個具實驗性質的選項。目前市場上的語言模型大多以通用性為導向,追求在各類任務上都表現優異,然而這種「通才」路線往往意味著模型在特定領域的深度有所不足。Bart 則代表了一種截然不同的設計哲學——以「專才」為目標,放棄廣泛的適用性,轉而深耕單一時代的語言特徵。這種取徑雖然在應用範圍上較為狹窄,但在其所專注的領域中,卻可能達到通用模型無法企及的精準度。

對於關注語言演變、歷史文獻處理或文化保存的研究者而言,Bart 提供了一個可供測試、修改與微調的基礎模型,讓有興趣的團隊能夠在此基礎上進一步開發更符合自身需求的專用工具。當然,Bart 作為一款實驗性質濃厚的模型,仍有許多值得探討與改進的空間。首先,訓練資料僅涵蓋 1931 年前的英文文本,這意味著模型的知識範圍存在明確的天花板,無法處理任何與現代社會相關的議題;其次,2.

82B 的參數量在當今動輒數十億甚至數百億參數的模型生態中屬於中小規模,這可能限制了模型的整體表現與複雜任務的處理能力;再者,訓練資料的來源與品質、資料中是否存在偏見或遺漏、模型在生成文本時是否會出現時代錯置等問題,都有待進一步檢驗。然而,正是這些侷限性與不確定性,使得 Bart 成為一個值得關注的實驗案例,它所代表的「復古 AI」路線,或許將激發更多研究者思考語言模型發展的多元可能性。從更宏觀的角度來看,Bart 的出現反映了開源社群近年來日益蓬勃的創新活力。

在大型科技公司主導 AI 發展的同時,開源社群憑藉著集體協作與知識共享的精神,不斷推出各種具備實驗性質的模型與工具,填補了商業產品未能覆蓋的空白。Bart 正是這種精神的具體體現——它不以追求商業價值為目標,而是基於對語言本質與歷史脈絡的探索熱情,打造出一款獨具特色的模型。對於那些對 AI 技術懷抱好奇與熱忱的人而言,Bart 的開源釋出意味著任何人都可以下載、使用、修改這個模型,進一步探索它的能力邊界,或將其整合進自己的研究與創作之中。總而言之,Bart 是一款顛覆主流思維的復古語言模型,它以極低的訓練成本、完全限定的歷史語料,以及明確的實驗定位,在 LLM 生態中開闢出一條前所未有的小徑。

雖然它無法與當前最先進的通用模型在效能上一較高下,但其獨特的時代取向與應用潛力,使其在特定領域中具備不可取代的價值。對於語言學家、歷史學者、文化工作者以及所有對語言演變感興趣的人而言,Bart 無疑是一個值得深入探索的新工具,也為開源 AI 社群的未來發展提供了另一個值得深思的方向。

Related

相關文章

智東西生成式AI

剛剛,Codex恢復5小時限額,用戶哀嚎

AI應用風向標(公眾號:ZhidxcomAI) 作者|畢偉豪 編輯|漠影 智東西8月25日報道,剛剛,OpenAI Codex負責人Tibo宣佈,明天開始將會恢復ChatGPT Work和Codex平臺上Plus用戶的5小時用量限制。 據Tibo所說,這一做法早就在計劃之中,目的主要是減輕算力負荷,從而在周使用額度上提供更慷慨的計劃。 這一表述暗含了計算資源不足的意思,但有網友對於Tibo的說法並不買賬,原因是前段時間他親口說過“我們不缺算力”。 消息一齣,Codex用戶一陣哀嚎,尤其是很多僅在週末使用Codex的用戶,對此感到非常不滿,有人提出能否在週末取消5小時限額,以滿足此類用戶的需求,避免周使用額度浪費的情況。 還有用戶提出,希望Codex能把5小時限額作為可選項,用戶可以自行選擇打開或者關閉。 此外,很多美國之外的開發者對此不滿的核心原因在於,Codex此舉似乎並未考慮到20美金的訂閱價格對於其他國家的用戶來說是一筆不菲的支出,而擁有5小時限額的Codex套餐,從性價比上很難和Qwen等模型的套餐競爭。 而Tibo這樣做,可能還有另一個原因,在此前Codex尚存在5小時限額的時候,日拋號就非常盛行,7月13日,Tibo宣佈暫時移除5小時限額後,有網友直呼“日拋號價值提升5倍”。 相對於高額的訂閱費用,低價的日拋號結合無限額的使用計劃,的確是“薅羊毛”的好辦法。 同時,由於Tibo經常重置額度帶來的“天才涅槃”,可能也要消失了,此前plus訂閱用戶常常在一天之內就把一週額度“蹬”完,然後等待重置,如今5小時限額恢復,即使重置也不能薅完整的羊毛了。 結語:爽用Codex的時代,暫時結束了 顯然,Tibo此舉無疑是在倒逼用戶升級為更高級的套餐,讓重置次數不再被“薅羊毛”。 但這一做法的確讓plus套餐的性價比極速下滑,此前通過無限額時期對Codex產生依賴的用戶,面對限

剛剛
IT之家生成式AI

中國 AI 為什麼追得這麼快?美媒找到一批關鍵人物

首頁 > 智能時代>人工智能 中國 AI 為什麼追得這麼快?美媒找到一批關鍵人物 2026/8/25 12:46:15 來源:鳳凰科技 作者:於雷 責編:遠洋 評論: 8 月 25 日,據《華爾街日報》報道,中國 AI 模型近年來快速縮小與美國頭部模型的差距,其背後並非短期突然出現的技術突破,而是清華大學等高校長期形成的人才網絡,以及開源技術、人才迴流和更高算力效率等因素共同推動的結果。報道認為,以智譜 AI 聯合創始人唐傑、月之暗面創始人楊植麟以及 DeepSeek 創始人梁文鋒等人為代表的一批研究者,構成了中國這一輪 AI 追趕的重要力量。《華爾街日報》稱,中美兩國多名行業人士認為,中國最好的 AI 模型目前與美國最先進模型的能力差距已經縮小至數月。今年 6 月,馬斯克曾預測中國要到 2027 年第一季度才能追上 Anthropic 的頂級模型,唐傑隨後回應稱,“不會需要那麼久”。報道將中國 AI 人才體系的形成追溯至 20 多年前。2005 年,圖靈獎得主姚期智在清華大學創辦“姚班”,培養計算機領域的頂尖人才。與此同時,唐傑長期在清華從事數據挖掘和機器學習研究,其實驗室後來成為中國 AI 人才的重要來源之一。楊植麟曾師從唐傑,在清華研究機器學習算法,隨後赴卡內基梅隆大學攻讀博士,回國後創辦月之暗面。這種高校與創業公司的人員流動逐漸形成了一張 AI 人才網絡。2018 年,中國進一步放寬科研人員創業及科研成果商業化限制,次年唐傑從清華實驗室孵化出後來發展為智譜 AI 的公司。早在 OpenAI 於 2020 年發佈 GPT-3 後,智譜就將開發同等級模型作為目標。不過,相比美國 AI 企業,中國公司長期面對資金和先進芯片不足的問題。傑富瑞測算,在相關時期內,中國科技公司的投入規模不到美國同行的五分之一。在這一背景下,提高算力利用效率成為中國 AI 企業追趕的重要路徑。D

剛剛
智東西生成式AI

Generalist AI融資超13億,8VC領投

機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月25日報道,近日,據外媒Axios報道,Generalist AI籌集了約2億美元(約13.45億元)的資金。 據消息人士透露,本次融資由8VC領投,數家現有投資者跟投。關於估值暫無具體信息,但確認高於6月份的20億美元水平。目前該公司並未回應,但在聯邦申報文件中披露了本輪融資。 根據Generalist AI向美國SEC提交的Form-D備案文件顯示,本輪計劃募資約2.08億美元(約13.99億元),實際完成融資約1.

剛剛
量子位生成式AI

人民教育音像數字出版社與小猿達成合作 “中小學課本學習智能體”首落小猿AI學習機

人民教育音像數字出版社與小猿學習機合作,推出首個「中小學課本學習智能體」,搭載於小猿AI學習機,結合權威教材與猿力大模型,提供AI伴學與AI導學雙模式。試點數據顯示,學生語文知識點掌握量提升33.6%,英語提升24%,家長陪讀時間每日減少20分鐘。雙方簽署合作協議,未來將持續推動智能體規模化應用。

剛剛
量子位生成式AI

WAIC CONNECT | AI出海,不聊虛的!CONNECT帶你拿下馬來西亞真正的AI採購需求

WAIC CONNECT MALAYSIA活動將於2026年9月7日至8日在吉隆坡舉辦,聚焦馬來西亞政府、電信、金融科技與教育等領域的實際AI採購需求,並與華為合作建立當地生態鏈接。活動規劃中國企業短講、一對一精準對接及監管機構與決策者面對面交流,僅限50至60家中國AI企業參與,旨在協助業者直接取得東南亞市場的真實商業訂單。

剛剛
鈦媒體生成式AI

被智譜封號的會員,有多少是被冤枉的?

鋅消費研究中心2026.08.25 11:33 · 來自北京全文3351字00:00 / 09:02這麼突然被封號了?文 | 鋅消費研究中心 真金白銀辦了智譜會員,結果賬號突然就被封了。 你如果遇到這種事兒,會不會賬號剛一被封,就想原地發瘋? 先別急。智譜之所以會對用戶進行封號,往往源於用戶的登錄設備、IP等出現異常,被平臺判定為多人使用賬號。 而之所以出現這種情況,除了智譜定價越來越貴之外,還源於智譜新、老會員定價不同,讓會員們有了更多套利的空間。

剛剛