Swiftlet 把 80B 量級 Qwen 巨獸塞進 Mac:峰值內存僅 4.3GB,iPhone 17 還能原生機跑 35B
重點摘要
AI資訊AI新閒資訊正文Swiftlet 把 80B 量級 Qwen 巨獸塞進 Mac:峰值內存僅 4.3GB,iPhone 17 還能原生機跑 35B發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :2分鐘一個叫 Swiftlet 的 Swift + Metal 運行時正在重新定義"大模型能跑在哪"。它專門伺候 Qwen3-Next 和 Qwen3.5/3.
一個名為 Swiftlet 的開源專案,近期在 Mac 與 iPhone 上展示了令人眼睛一亮的成果。這個以 Swift 與 Metal 打造的推論運行時,目標是讓規模龐大的 Qwen MoE 混合專家模型不再倚賴高階伺服器,而是直接在消費級 Apple 裝置上流暢運作。開發團隊宣稱,它已成功將具備 800 億參數等級的 Qwen3-Next-80B-A3B 模型,壓縮至僅 4.3GB 的峰值記憶體就能運行,刷新許多人對端側 AI 的想像。
Swiftlet 的核心策略相當直接:面對 MoE 架構中數量驚人的路由專家,它選擇不讓所有權重都常駐在記憶體裡,而是只保留模型的小型稠密核心,其餘佔據大量儲存空間的專家權重,則存放在 SSD 中,等到真正需要運算時,才以串流方式動態取用。這種做法讓記憶體需求與模型總參數量脫鉤,轉而取決於每次推論實際會動用的參數規模。從實際數據來看,效果相當顯著。在 M5 Mac 上,Qwen3.6-35B-A3B 的 4-bit 版本磁碟佔用約 18GB,但運行時峰值記憶體僅落在 2.6GB,解碼速度約每秒 7 到 11 個 token。
更令人驚訝的是 Qwen3-Next-80B-A3B 的 4-bit 版本,磁碟空間雖然需要 42GB,但峰值記憶體卻被壓在 4.3GB 左右,速度仍有每秒 4.5 到 5 個 token。這對於一款 80B 量級的模型來說,記憶體控制能力確實突出。這項突破也讓手機原生運行大模型成為可能。開發者表示,35B 版本的模型如今已經能在 iPhone 17 上運行,記憶體用量約 2.5GB,速度約每秒 1 個 token。據開發者所知,這是該量級模型首次在手機上完全原生運行,全程不依賴任何伺服器。專案目前已達到端到端可用的狀態,兩個模型都能產生經過驗證的正確輸出。
不過,開發者也坦承這種取捨背後的代價。由於每個 token 實際只會激活約 3B 參數,這些模型在對話與寫作這類需要流暢語言能力的任務上,表現得像一個大型模型;但在事實記憶層面,受限於實際參與運算的參數規模,它仍然更像一個小型模型。這意味著開發者必須對模型的能力邊界有清楚的認知。深入拆解 Swiftlet 的運作機制,可以看出它在調度細節上下了不少功夫。模型每一層會將每個 token 路由到特定數量的專家,80B 版本是從 512 個專家中選出 10 個,35B 版本則是從 256 個專家中選出 8 個。
Swiftlet 將注意力機制、DeltaNet 投影、路由器、共享專家以及嵌入向量等稠密權重固定放在記憶體中,4-bit 條件下分別約佔 1.3GB(35B 版本)與 2.5GB(80B 版本)。而數量龐大的路由專家,則被重新打包成固定步長的資料塊,放入 .qpack 容器中。取用一個專家時,只需對 SSD 做一次 pread 操作,不需要 mmap,也不會干擾頁面快取的運作。針對熱門專家的快取機制,Swiftlet 使用了一個容量有限的池子,並搭配 LFU 加上近期性策略來進行淘汰。
實測命中率約落在 43% 到 70% 之間,而快取大小對速度幾乎沒有明顯影響,原因在於 Apple SSD 的讀取速度足以消化未命中帶來的額外開銷。整個前向傳播過程跑在 Metal 上,使用的是執行期間動態編譯的 shader,因此建置時並不需要完整的 Metal 工具鏈,同一套程式碼也能直接部署到 iOS 環境。值得一提的是,Swiftlet 有 75% 的層採用 Gated DeltaNet 線性注意力機制,這種設計帶著固定大小的循環狀態,意味著無論對話上下文如何拉長,都不會出現持續膨脹的 KV 快取。
這項特性讓長文本對話背後隱藏的記憶體負擔被悄悄消除,也讓模型在長時間互動下維持穩定的資源消耗。Swiftlet 本身並不只是命令列工具,它同時具備四種不同的應用身份。作為函式庫使用時,SwiftletCore 可以嵌入任何 macOS 或 iOS 應用程式,提供具備串流增量輸出與對話快取功能的聊天能力;作為命令列工具,swiftlet chat 與 swiftlet generate 分別負責本機對話與基準測試,而 swiftlet-repack 則能直接從 MLX 檢查點建構容器,同時支援從 Hugging Face 中斷續傳下載。
在伺服器模式上,swiftlet-server 會在迴環位址提供 OpenAI 相容的 chat-completions 介面,任何支援 OpenAI 標準的聊天介面都能直接接上本機模型。此外,iOS 端的 Priv AI 應用程式已將 SwiftletCore 嵌入作為串流模型引擎,一般使用者只需點擊下載,就能開始與模型對話。在正確性驗證方面,Swiftlet 也建立了嚴謹的對照流程。每一層的前向傳播都與 mlx-lm 參考實作逐層比對,涵蓋 f32 與 int4 量化形式;增量解碼同樣會與整序列的結果進行比對,Metal 核心也針對精確的 CPU 參考反覆驗證。
容器本身還能與來源檢查點進行位元組級校驗,確保無論專家是從快取還是磁碟讀取,最終給出的回答都完全一致。談到靈感來源,開發者明確指出 TurboFieldfare 在 Mac 上驗證了為 Gemma 做專家串流的可行性,Swiftlet 借用其中若干公開設計經驗,例如以 pread 將專家串流讀入有界槽位池、採用 LFU 加上近期性淘汰策略、以及固定步長打包讓一次讀取即一次 fetch 的架構。
但其餘部分基本上從零開始撰寫,約一萬行 Swift 與 Metal 程式碼,逐一克服了 Qwen 混合體系中 Gated DeltaNet 線性注意力、門控 GQA,以及帶共享專家的高稀疏 MoE 等獨特挑戰。Swiftlet 甚至實作了 MLX 風格的 int4/int8 分組量化計算,使用位元組定址核心與 64 位元偏移來撐起數 GB 大小的分片。想要在手機上體驗 Swiftlet,硬體門檻並不苛刻,只要具備 Apple Silicon、macOS 14 以上或 iOS 17 以上的裝置即可,再加上足夠的 SSD 空間,35B 版本需要 18GB,80B 版本則需要 42GB。
目前 iPhone 端可透過 App Store 上的 Priv AI 應用,開啟 Experimental Models 功能下載模型,該功能會隨新版本發佈,目前仍在審核通道中。想立刻嘗試的開發者也可以直接從原始碼自行建構。整個專案以 Apache 2.0 授權釋出,模型權重則需單獨下載,並遵循各自的授權條款。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。