大模型正在“變小”?

重點摘要
# 大模型正在“变小”:从云端下凡到终端的智能革命 在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。
# 大模型正在“变小”:从云端下凡到终端的智能革命
在刚刚过去的WAIC 2026上,一个明显的风向转变正在发生:厂商不再像去年那样热衷于比拼模型参数规模和榜单跑分,反而集体谈论“模型能干什么”“能不能赚钱”。细心观察不难发现,几乎所有的参展商都在推广轻量化部署,纷纷拿出自家的“mini版”大模型。曾几何时,我们习惯了让手机语音助手在电梯里失灵、让汽车导航在隧道里沉默、让相册里的AI修图因断网变成灰色图标——真正的智能似乎永远依赖那朵“云”。但今天,一场让大模型“瘦身”的全球竞赛正在改写这一切:研发人员正将曾经需要一整栋机房和巨大电力才能驱动的超级大脑,拼命塞进手机、汽车、甚至一台机械臂中。这不是幻想,而是源自现实需求催生的产业共识。
需求端的三记“耳光”,直接扇醒了路径依赖。第一记来自手机隐私:当用户拍下孩子第一次走路的视频、截图股票账户或与伴侣火热聊天,这些数据绝不该上传到任何云端。手机作为最贴身的数字器官,倒逼大模型必须本地运行,否则隐私保护就是一句空话。第二记来自汽车安全:当一辆以时速120公里飞驰的电车,需要理解“有点困了,来点提神的但别对着脸吹”这样复杂的口语指令,任何将其上传云端再等待回传的延迟都可能带来致命的0.5秒——那意味着15米的距离。自动驾驶和智能座舱的端到端决策,必须长在车身上。
第三记则来自工厂效率:长三角、珠三角的“黑灯工厂”里,高速摄像头每秒上百帧扫描电子元件,如果每笔数据都要上传到中央服务器分析,一旦网络抖动或过载,整条产线就得停摆。如今,内置轻量视觉大模型工控机直接在产线上做毫秒级判决,既不需要联网,也不会抱怨。这三记耳光从隐私、安全和效率三个维度打出一个清晰的结论:智能不能只漂浮在云端,它必须像血氧一样融入每一个终端。全球科技巨头迅速响应,但路径各有千秋。OpenAI的策略是纵向分级、按质论价:云端用最强GPT-4探索智能上限,但应对每天数十亿“帮炸鸡店起名”“写会议纪要”这类高频简单任务,则派出更轻更快的GPT-4o mini。
后者的响应速度极快,成本断崖式下降了超过60%,就像一个随叫随到的博士生师兄,把诺贝尔奖级的导师留给关键答辩和战略方向。Google则走“全尺寸覆盖、软硬一体”路线,从发布之初就将Gemini分为Ultra、Pro、Nano三个版本。最不起眼的Gemini Nano被专门设计用于在Android设备本地运行,通过极致的蒸馏算法和量化技术,将诈骗短信检测、智能回复、离线语音转录等能力压缩成一个小型高效离线引擎。即使飞行模式,Pixel 8 Pro依然能精准过滤垃圾短信并生成智能摘要——所有计算都在本机完成,数据没有一比特离开设备。视线回到国内,创新的形式更为多元。
DeepSeek背靠量化交易的创始背景,对效率有近乎偏执的追求。它不仅发布对标GPT-4的云端大模型,更推出了1.3B、6.7B这样“犯规”的微型模型矩阵,专攻代码生成与数学推理。一个6.7B的代码小模型,在特定算法题上的速度与表现能媲美大几十倍的模型,且完全免费开源。这意味着一个回龙观出租屋里的三人极客团队,可以用几千块的服务器跑着一位24小时不知疲倦、水平堪比三年经验工程师的AI同事。DeepSeek将“AI平权”的口号直接变成了小团队手里的生产力工具。
而Kimi的创始人杨植麟则重新定义了什么是“轻”:当其他模型还在炫耀能处理几十页PDF时,Kimi已经能一口气吞下3小时录音、100页财报和50篇论文,然后精准回答内容的内在矛盾。它用极致的算法深度替代系统层面的复杂度累加,一个模型就完成了往常需要“大模型+向量数据库+检索增强生成工具+多智能体”才能搞定的长文本任务——轻的是整个应用架构的复杂度和开发成本。面壁智能则把“小”本身当作信仰,其推出的“小钢炮”系列端侧模型在只有几亿参数的情况下就在基础NLP任务上展现惊人能力,让人看到未来洗衣机、电饭煲里也能住着一个懂衣料分类和大米新鲜度的“哆啦A梦”。
面对“变小了会变傻吗”的核心疑虑,业界的回答既坦诚又严密。过去几年,“大力出奇迹”似乎是唯一铁律,参数越多就越聪明。但工程师们指出,当模型要被部署到手机相册“一键修图”功能时,它99.99%的知识都是占内存的废物。它只需要成为全宇宙最懂相册管理的专家,不需要会写离骚或求解量子力学。在这种目标下,知识蒸馏像一位“一对一精英私教”,大模型老师在教学生时不仅给出答案,还传递思考过程中的“软标签”——比如看一张狗的照片,老师内心判断是金毛犬85%、拉布拉多10%、还有5%是混血犬,这种带温度和不确定性的“暗知识”让小学生学会举一反三。
同时,工程师给这些模型实行了最严格的“饮食管理”,用最强大的模型去合成最纯净的因果链数据,在合同审查、医学影像分析等高精尖任务里,一个只吃“特供营养餐”的1B参数小模型可以在精准度上轻松超过被全网噪音污染过的千亿大模型。再辅以量化感知训练——从训练第一天就告诉模型以后要在信号严重损失的设备上工作,让它主动学会用更少的比特位表达最核心的信息,进化出内在的“降噪算法”。这些技术合力证明:变小不等于降智,而是以放弃全知全能为代价,换取在特定场景内的极致表现。这场让模型变小的史诗级大戏高潮远未到来。
它真正的野心,不是创造一项可写入教科书的技术指标,而是让技术完全消失——消失在手机里、汽车后视镜里、工厂流水线的每一次快门里。如盐溶于水,潜入生活的角角落落。真正伟大的技术,就是你感受不到它的存在,却再也离不开它带来的那种不动声色的妥帖。而每日伴随我们的手机与汽车,正是距离这场风暴最近的前线,正在你我掌中,无声惊雷。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。