Swiftlet 把 80B 量級 Qwen 巨獸塞進 Mac:峰值內存僅 4.3GB,iPhone 17 還能原生機跑 35B

2026年8月4日 08:00

重點摘要

AI資訊AI新閒資訊正文Swiftlet 把 80B 量級 Qwen 巨獸塞進 Mac:峰值內存僅 4.3GB,iPhone 17 還能原生機跑 35B發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :2分鐘一個叫 Swiftlet 的 Swift + Metal 運行時正在重新定義"大模型能跑在哪"。它專門伺候 Qwen3-Next 和 Qwen3.5/3.

站內 AI 整理稿

一個名為 Swiftlet 的開源專案,近期在 Mac 與 iPhone 上展示了令人眼睛一亮的成果。這個以 Swift 與 Metal 打造的推論運行時,目標是讓規模龐大的 Qwen MoE 混合專家模型不再倚賴高階伺服器,而是直接在消費級 Apple 裝置上流暢運作。開發團隊宣稱,它已成功將具備 800 億參數等級的 Qwen3-Next-80B-A3B 模型,壓縮至僅 4.3GB 的峰值記憶體就能運行,刷新許多人對端側 AI 的想像。 Swiftlet 的核心策略相當直接:面對 MoE 架構中數量驚人的路由專家,它選擇不讓所有權重都常駐在記憶體裡,而是只保留模型的小型稠密核心,其餘佔據大量儲存空間的專家權重,則存放在 SSD 中,等到真正需要運算時,才以串流方式動態取用。這種做法讓記憶體需求與模型總參數量脫鉤,轉而取決於每次推論實際會動用的參數規模。 從實際數據來看,效果相當顯著。在 M5 Mac 上,Qwen3.6-35B-A3B 的 4-bit 版本磁碟佔用約 18GB,但運行時峰值記憶體僅落在 2.6GB,解碼速度約每秒 7 到 11 個 token。更令人驚訝的是 Qwen3-Next-80B-A3B 的 4-bit 版本,磁碟空間雖然需要 42GB,但峰值記憶體卻被壓在 4.3GB 左右,速度仍有每秒 4.5 到 5 個 token。這對於一款 80B 量級的模型來說,記憶體控制能力確實突出。 這項突破也讓手機原生運行大模型成為可能。開發者表示,35B 版本的模型如今已經能在 iPhone 17 上運行,記憶體用量約 2.5GB,速度約每秒 1 個 token。據開發者所知,這是該量級模型首次在手機上完全原生運行,全程不依賴任何伺服器。專案目前已達到端到端可用的狀態,兩個模型都能產生經過驗證的正確輸出。 不過,開發者也坦承這種取捨背後的代價。由於每個 token 實際只會激活約 3B 參數,這些模型在對話與寫作這類需要流暢語言能力的任務上,表現得像一個大型模型;但在事實記憶層面,受限於實際參與運算的參數規模,它仍然更像一個小型模型。這意味著開發者必須對模型的能力邊界有清楚的認知。 深入拆解 Swiftlet 的運作機制,可以看出它在調度細節上下了不少功夫。模型每一層會將每個 token 路由到特定數量的專家,80B 版本是從 512 個專家中選出 10 個,35B 版本則是從 256 個專家中選出 8 個。Swiftlet 將注意力機制、DeltaNet 投影、路由器、共享專家以及嵌入向量等稠密權重固定放在記憶體中,4-bit 條件下分別約佔 1.3GB(35B 版本)與 2.5GB(80B 版本)。而數量龐大的路由專家,則被重新打包成固定步長的資料塊,放入 .qpack 容器中。取用一個專家時,只需對 SSD 做一次 pread 操作,不需要 mmap,也不會干擾頁面快取的運作。 針對熱門專家的快取機制,Swiftlet 使用了一個容量有限的池子,並搭配 LFU 加上近期性策略來進行淘汰。實測命中率約落在 43% 到 70% 之間,而快取大小對速度幾乎沒有明顯影響,原因在於 Apple SSD 的讀取速度足以消化未命中帶來的額外開銷。整個前向傳播過程跑在 Metal 上,使用的是執行期間動態編譯的 shader,因此建置時並不需要完整的 Metal 工具鏈,同一套程式碼也能直接部署到 iOS 環境。 值得一提的是,Swiftlet 有 75% 的層採用 Gated DeltaNet 線性注意力機制,這種設計帶著固定大小的循環狀態,意味著無論對話上下文如何拉長,都不會出現持續膨脹的 KV 快取。這項特性讓長文本對話背後隱藏的記憶體負擔被悄悄消除,也讓模型在長時間互動下維持穩定的資源消耗。 Swiftlet 本身並不只是命令列工具,它同時具備四種不同的應用身份。作為函式庫使用時,SwiftletCore 可以嵌入任何 macOS 或 iOS 應用程式,提供具備串流增量輸出與對話快取功能的聊天能力;作為命令列工具,swiftlet chat 與 swiftlet generate 分別負責本機對話與基準測試,而 swiftlet-repack 則能直接從 MLX 檢查點建構容器,同時支援從 Hugging Face 中斷續傳下載。 在伺服器模式上,swiftlet-server 會在迴環位址提供 OpenAI 相容的 chat-completions 介面,任何支援 OpenAI 標準的聊天介面都能直接接上本機模型。此外,iOS 端的 Priv AI 應用程式已將 SwiftletCore 嵌入作為串流模型引擎,一般使用者只需點擊下載,就能開始與模型對話。 在正確性驗證方面,Swiftlet 也建立了嚴謹的對照流程。每一層的前向傳播都與 mlx-lm 參考實作逐層比對,涵蓋 f32 與 int4 量化形式;增量解碼同樣會與整序列的結果進行比對,Metal 核心也針對精確的 CPU 參考反覆驗證。容器本身還能與來源檢查點進行位元組級校驗,確保無論專家是從快取還是磁碟讀取,最終給出的回答都完全一致。 談到靈感來源,開發者明確指出 TurboFieldfare 在 Mac 上驗證了為 Gemma 做專家串流的可行性,Swiftlet 借用其中若干公開設計經驗,例如以 pread 將專家串流讀入有界槽位池、採用 LFU 加上近期性淘汰策略、以及固定步長打包讓一次讀取即一次 fetch 的架構。但其餘部分基本上從零開始撰寫,約一萬行 Swift 與 Metal 程式碼,逐一克服了 Qwen 混合體系中 Gated DeltaNet 線性注意力、門控 GQA,以及帶共享專家的高稀疏 MoE 等獨特挑戰。Swiftlet 甚至實作了 MLX 風格的 int4/int8 分組量化計算,使用位元組定址核心與 64 位元偏移來撐起數 GB 大小的分片。 想要在手機上體驗 Swiftlet,硬體門檻並不苛刻,只要具備 Apple Silicon、macOS 14 以上或 iOS 17 以上的裝置即可,再加上足夠的 SSD 空間,35B 版本需要 18GB,80B 版本則需要 42GB。目前 iPhone 端可透過 App Store 上的 Priv AI 應用,開啟 Experimental Models 功能下載模型,該功能會隨新版本發佈,目前仍在審核通道中。想立刻嘗試的開發者也可以直接從原始碼自行建構。整個專案以 Apache 2.0 授權釋出,模型權重則需單獨下載,並遵循各自的授權條款。

Related

相關文章

物理AI不是下一個風口,而是下一輪工業革命

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

開源版Claude Science來了,零依賴、MIT協議,內置30+項科研Skills

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體生成式AI

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?文娛先聲2026.08.04 17:56 · 來自北京全文4045字從製作流程到商業化路徑,《奇譚》的探索證明,AI影視的發展並非簡單替代傳統影視,而是在人工創意與AI能力結合下,重新定義影視生產方式。文 | 文娛先聲,作者 | 王燁 AI影視,迎來了首部獲得官方發行許可的長片作品。近期,《奇譚:紙刃渡荒墟》(以下簡稱《奇譚》)在愛奇藝正式上線。

剛剛

斷電0.01秒燒掉幾十萬:AI最隱秘的暴利賽道,中企瘋搶

AI 的運算能力正在成為這個時代最稀缺的資源,但支撐這一切運轉的,除了那些昂貴的圖形處理器(GPU),還有一套外界幾乎看不見的電力系統。每天有無數人對著人工智慧對話框輸入指令、要求生成圖片或影片,每一次請求的背後,都是成千上萬顆GPU在瞬間進入滿載狀態。這些晶片的用電模式和傳統數據中心截然不同,過去機房的電力負載相對平穩,現在AI的GPU則像一輛在怠速與全油門之間來回切換的跑車,用電量在毫秒級別內暴起暴落。

剛剛
智東西生成式AI

120萬星!開發者排隊“投簡歷”,DeepSeek一條內測帖,變成了Agent開源大摸底

DeepSeek的Agent Harness團隊負責人崔添翼於8月1日發文招募內測人員,吸引769位開發者提交712個開源倉庫,合計超過120萬Stars,涵蓋長任務執行、記憶管理與安全評測等Agent基礎設施方向。社區推測DeepSeek可能基於Harness打造對標Claude Code的AI Coding Agent,但官方尚未證實。這場招募意外揭露了Agent工程化的關鍵能力版圖,包括穩定執行、上下文管理與安全控制等挑戰。

剛剛

OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題

OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。

剛剛