27B大模型塞進iPhone!蘋果看中AI壓縮黑科技:體積縮到十四分之一,速度還快 8 倍
重點摘要
AI資訊AI新閒資訊正文27B大模型塞進iPhone!蘋果看中AI壓縮黑科技:體積縮到十四分之一,速度還快 8 倍發布於AI新閒資訊時間 :Jul 10, 2026閱讀 :1分鐘據科技媒體The Information報道,蘋果公司正接洽AI初創公司PrismML,評估在iPhone上直接運行更大規模AI模型的可行性。
蘋果近期傳出正與AI新創公司PrismML接洽,評估能否將更大規模的大型語言模型直接放進iPhone運行。這項合作若成真,意味著蘋果在裝置端(on-device)AI能力的布局可能出現關鍵突破,讓手機不再需要仰賴雲端算力,就能流暢執行過去只有伺服器才能負荷的複雜模型。PrismML是一家從加州理工學院(Caltech)衍生出來的AI初創企業,核心技術來自於原生1-bit模型壓縮架構。該技術能將模型體積壓縮至全精度版本的約十四分之一,記憶體佔用大幅降低超過90%。
傳統量化方法多半透過減少位元數來縮小模型,但權重仍保留多個位元;PrismML則極端到只使用「-1」與「1」兩個值來表示權重,並配合分組縮放因子完成運算,從底層徹底改變模型的儲存與推理方式。這項技術最引人注目的地方,在於它沒有傳統量化方案中常見的「高精度逃生通道」——也就是某些關鍵層仍保留較高精度以補償性能損失的折衷做法。PrismML在完全採用1-bit權重的前提下,宣稱仍能維持接近FP16(16位元浮點數)模型的精度水準。不僅如此,推理速度最高可提升8倍,能耗則降低75%至80%。這意味著手機端要運行大型AI模型所需的算力與電量門檻被大幅拉低,且不需犧牲模型品質。
最有力的驗證案例已經出爐:PrismML將阿里巴巴開源的27B參數大型語言模型Qwen 3.6進行壓縮後,成功在iPhone 17 Pro上完整跑通。27B參數規模在傳統架構下幾乎不可能在手機端順暢運作,但經過PrismML的1-bit壓縮後,不僅順利執行,還保持接近原版的推理品質。這項成果直接展示了壓縮技術的實戰能力。蘋果看中的正是這種量化能力。對蘋果而言,裝置端AI的強弱直接影響Apple Intelligence生態的競爭力。
當前iPhone上搭載的AI模型規模與功能仍受限於記憶體與功耗,若能導入PrismML的技術,iPhone有望在不增加硬體成本的前提下,運行更大規模的模型,進而實現更複雜的多輪對話、圖像理解乃至智慧體任務編排。當手機端也能跑上旗艦級大模型,端側AI與雲端AI之間的能力天平可能迎來重新校準。過去受限於頻寬、延遲與隱私問題的應用場景,例如即時語音助理、離線翻譯、本地影像生成等,都有機會獲得顯著升級。PrismML的技術若能順利整合,不僅能強化iPhone的AI體驗,也可能對整個智慧型手機產業的AI路線產生示範效應。
不過,從接洽到實際導入產品仍需一段時間,蘋果是否會正式採用PrismML的解決方案,或自行發展類似技術,目前尚未明朗。業界普遍認為,端側AI的競爭已進入白熱化階段,任何能讓手機跑更大模型的突破,都可能成為下一波換機潮的關鍵推動力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。