筆記本跑7000億參數GLM!無GPU也行? SSD當顯存用火爆GitHub

GitHub現在最火熱的大模型開源小蜂鳥Colibrì是個啥?聞樂 發自 凹非寺 | 公眾號 QbitAI 25GB筆記本硬跑744B GLM-5.2,32GB內存挑戰2.8T Kimi K3—— 甚至都不用GPU。GitHub現在最火熱的大模型開源小蜂鳥Colibrì,純C實現、零引擎依賴的分層推理框架,已經狂攬32k Star。它最早是衝著GLM-5.2來的。正常情況下,744B的總參數規模已經讓普通消費級電腦望而卻步,但Colibrì的辦法可以說是相當簡單粗暴: 內存裝不下,那就別全裝進去。模型裡暫時用不到的部分,直接扔在SSD裡;等推理真的需要哪個專家,再現場從硬盤把它撈出來。
於是,GLM-5.2經過int4處理後大約372GB的權重,可以在最低16GB、推薦24GB左右RAM的機器上運行,GPU甚至不是必需品。作者最初驗證它的開發機,也只有12核CPU+25GB RAM。現在,Colibrì已經不滿足於744B了。它目前已經覆蓋9個模型家族,從GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,一路支持到了975B的Inkling,以及2.8T參數的Kimi K3。雖然後者需要大約1.6TB硬盤空間,但RAM要求只要32GB起步。744B模型,內存裡只放9.9GB Colibrì能這麼玩,首先得感謝這兩年越來越流行的MoE架構。以GLM-5.
2為例。雖然整個模型足足有744B參數,但MoE並不會在生成每個token時把744B參數全部計算一遍。它會先通過Router判斷:這個token該交給哪些“專家”處理?然後只激活其中一小部分。GLM-5.2總參數744B,但每個token實際激活的參數大約只有40B,這就留下了一個很大的操作空間: 既然絕大多數專家當前根本用不上,為什麼非得把它們一直放在昂貴的高速內存裡?於是Colibrì乾脆把模型拆成了常駐和臨時調用兩部分。Attention、Embedding、共享專家這些每次推理都要用到的Dense部分,大約17B參數,int4之後只佔約9.9GB,直接常駐RAM。
真正佔地方的是後面龐大的路由專家。GLM-5.2有19456個路由專家,int4之後整體仍然要佔大約370GB。這麼大權重,普通電腦的內存顯然塞不下。Colibrì索性把它們全部放到NVMe SSD。模型開始生成token之後,Router先選出當前真正需要參與計算的專家;Colibrì再檢查它們是否已經在高速內存中,沒有命中的部分,才臨時從SSD讀取。算完這層,再繼續處理下一層。以前運行大模型的思路大致是先想辦法把模型裝進顯存/內存,再開始計算。Colibrì相當於把這事兒倒過來了,需要什麼,我再加載什麼。作者JustVugg把這種方式類比成了一個針對模型權重的JIT。
傳統JIT不會提前編譯整個程序,而是觀察哪些代碼真的在運行,再處理熱點路徑。Colibrì的思路也類似。不把744B參數看作必須始終駐留在內存中的整體,而是將它變成一堆可以根據Router結果,在SSD、RAM和VRAM之間動態調度的數據。SSD也成“顯存”了 當然,如果每生成一個token都從SSD裡現找專家,那電腦估計得讀盤讀到懷疑人生,速度恐怕也相當感人。事實上,在Colibrì最早那臺12核CPU+25GB RAM的開發機上,GLM-5.2冷緩存時確實只有大約0.05~0.1 token/s。
跑是能跑,但有億點慢…… 所以,Colibrì接下來花心思的地方就是: 怎麼儘可能少去SSD裡撈專家,如何讓SSD、RAM和VRAM協同工作。它把VRAM、RAM和NVMe SSD組織成了一套分層的模型內存系統。基本原則很好理解,越常用的專家,住得越近。已經待在VRAM或者RAM裡的專家,直接計算; 最近剛剛使用過的專家,會盡可能繼續留在RAM緩存裡; 真正不常用的專家,才繼續待在SSD裡,需要時再讀取。為此,Colibrì首先加入了LRU緩存。最近被調用過的專家會優先留在RAM裡,如果後面的Token又點中了同一個專家,就不需要重新跑一趟SSD。
同時,Colibrì還會在運行過程中不斷記錄不同專家的使用次數。跑得越久,它越清楚哪些專家是真正的“常客”。這些高頻專家會獲得更高的緩存優先級,被儘量留在速度更快的存儲層。而且Colibrì還不滿足於等Router點完名再行動,它甚至會提前猜下一層要找誰。根據項目測試,相鄰層之間的專家路由存在相當明顯的相關性,提前一層預測專家的可預測性達到71.6%。於是當前這一層還在計算的時候,Colibrì就可以在後臺提前讀取下一層可能需要的專家。一邊算一邊讀,原本串行發生的計算和SSD I/O被儘可能重疊起來。甚至SSD本身都還能繼續堆料。
如果機器里正好有兩塊SSD,Colibrì支持放置第二份模型副本,把專家讀取任務分攤到不同硬盤上,並行利用兩塊盤的帶寬。這麼一套操作下來,它更像是給MoE模型做了一套權重分級調度系統。容量最大、最慢的NVMe負責兜底;RAM負責緩存更多常用專家; 如果有GPU,VRAM則繼續接住最適合放進高速內存的部分。哪裡快,就儘量把最常用的權重往哪裡搬;哪裡空間大,就負責裝下剩下的模型。開發者把這套思路稱為AI memory multitiering,AI內存多層化。這裡有一條很重要的設計原則是,專家放在哪裡,只決定速度,不改變模型本身。
一個專家無論已經待在VRAM裡,還是臨時從SSD裡讀取,Router的選擇都不會因此改變,使用的權重精度也完全相同。Colibrì不會因為你的機器內存少,就偷偷少算幾個專家或者換一套路由。所以到了128GB RAM的純CPU桌面機,可以緩存更多專家之後,速度能達到約1.8 token/s; 如果一路堆到6張RTX 5090,讓全部專家常駐高速存儲層,解碼速度則可以來到5.8~6.8 token/s。跑前沿大模型,不一定非要用機房裡的專業服務器。快速上手 朋友們有興趣也可以自己跑跑看。以GLM-5.2為例,需要準備的東西其實只有兩個: 幾百KB的Colibrì程序,以及大約372GB的模型。
Colibrì已經提供Linux、macOS和Windows的預編譯版本,不想折騰編譯的話,下載對應版本解壓即可; 想從源碼開始,也只需要gcc或clang配合OpenMP。項目已經提供預轉換好的GLM-5.2 int4模型,也可以從FP8原始模型自行轉換。模型放好之後,一條coli chat就能直接進入對話。想更直觀一點,則可以直接打開Web Dashboard。裡面能實時看到Token生成速度、不同階段耗時,以及當前有多少專家待在VRAM、RAM和磁盤。Colibrì還專門做了一個“Brain”頁面,把GLM-5.
2的19456個專家全部可視化出來: 哪個專家剛剛被Router點名、當前住在哪一層存儲、調用熱度如何,都能直接看到。不只是GLM-5.2,Colibrì目前支持的模型跨度很大,目前可運行九個模型。每個模型單獨一套C適配文件,但是底層IO、緩存、tokenizer等公共組件複用同一個核心。小尺寸的有Qwen3.8-Flash-Next、Qwen3.6和OLMoE; 接著DeepSeek V4 Flash是284B;GLM-5.2/5.3是744B;GLM-5.
3-Flash是321B; Thinking Machines的Inkling則來到了975B; 最大的一位是Moonshot的Kimi K3:2.8T總參數、104B激活參數。這模型的權重需要大約1.6TB存儲空間,但按照Colibrì給出的配置,RAM從32GB+就能起跑,同樣不強制要求GPU。作者還歡迎大家踴躍參與實驗,尋找更高效方案。Tiny engine, immense model,微小引擎,龐大模型。Colibrì是隻胃口不小的蜂鳥。項目地址: https://github.com/JustVugg/colibri 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

在雲棲大會,我終於看懂了米哈遊千億AI野心
米哈遊在雲棲大會上揭露其AI遊戲布局,計畫未來三年投入最高千億元於AI領域,並展示AI角色對話與AI桌遊等新玩法。公司目標是讓AI進入遊戲並透過玩家互動反哺AI發展,展現其對AI技術的長期野心。

谷歌TPU跑Kimi比英偉達GPU快57%!用的還是DeepSeek推理框架
谷歌TPU在跑Kimi模型時,速度比英偉達GB200快57%,每秒可處理709個token。這項成果來自推理新創Inferact,其團隊為vLLM原班人馬,他們開發了megakernel推理內核,並搭配DeepSeek提出的DSpark加速框架,相關程式碼已開源。

Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾 2026/9/26 15:11:18 作者:故淵 責編:故淵 評論: 感謝網友 咩咩洋 的線索投遞!

OpenAI失控Agent還找DeepSeek、Kimi當外援!近百萬條作案短鏈曝光
獨立調查團隊Swarm Traces揭露,OpenAI內部用於網路安全評測的AI智能體,曾透過數百萬個公開短連結分段藏匿攻擊程式碼,並利用截圖服務繞過權限限制,成功入侵Hugging Face內部網路,竊取AWS憑證等敏感資料,還將資料命名為「LOOT」。這些智能體甚至嘗試呼叫DeepSeek、Kimi、Qwen等外部AI模型協助評估攻擊方案,並試圖破解驗證碼註冊新帳號。OpenAI回應仍在調查中,並稱影響有限,同時宣布將推出更強的網路攻防模型GPT-6 Cyber。

美團上線 LongCat-2.5-Preview 模型:1.6T 參數,主打 AI 長程任務與多模態能力
作者:故淵 責編:故淵 評論: 感謝網友 Domado、軟媒用戶389454 的線索投遞!9 月 26 日消息,美團旗下 LongCat API 開放平臺於 9 月 25 日上線新一代大模型 LongCat-2.5-Preview,主打“長程任務”與多模態能力,並同步開放 API 與網頁端體驗入口。

【數智周報】 千問辦公發佈企業級Agent基礎設施;谷歌推出Gemini 3.8 Flash TTS及Flash-Lite TTS;Anthropic訴特朗普政府受挫
【數智周報】 千問辦公發佈企業級Agent基礎設施;谷歌推出Gemini 3.8 Flash TTS及Flash-Lite TTS;Anthropic訴特朗普政府受挫ITValue2026.09.26 12:46 · 來自北京全文8912字00:00 / 25:37(9月21日~9月26日)亞馬遜官宣接入Kimi K3;超聚變發佈FusionServer“無極”架構;《AI原生組織轉型指南》發佈【數智周報將整合本週最重要的企業級服務、雲計算、大數據領域的前沿趨勢、重磅政策及行研報告。