Liquid AI Releases LFM2.5-2.6B: An On-Device Agentic Model With 128K Context, Tool Calling, And Open Weights

2026年8月7日 03:42
站內 AI 整理稿

Liquid AI 正式發布全新裝置端代理模型 LFM2.5-2.6B,這款模型專為在手機、筆電、個人電腦與機器人上直接執行所設計,具備規劃、工具呼叫與多步驟任務處理能力。模型總參數量為 26.9 億,支援 131,072 token 的上下文窗口與 128,000 token 的詞彙表,預訓練階段使用了約 34 兆 token 的資料。Liquid AI 同步釋出兩個檢查點版本,分別是供微調使用的 LFM2.5-2.6B-Base,以及針對代理任務最佳化的 LFM2.5-2.6B post-trained 版本。

由於推論過程完全在本地端進行,資料不會離開裝置,每次執行所產生的邊際成本也趨近於零。Liquid AI 表示,在工具使用與指令遵循的評測成績上,這款模型能與規模將近四倍的模型競爭,例如在 ToolSandbox 與 Multi-IF 等基準測試中表現突出。模型目前已在 Hugging Face 上以 lfm1.0 授權公開,提供原生、GGUF、MLX 與 ONNX 等多種格式,並在 llama.cpp、vLLM、SGLang 與 LM Studio 等框架中獲得首日支援。在執行效能方面,LFM2.5-2.

6B 在 Apple M5 Max 晶片上可達到每秒 220 token 的解碼速度,記憶體占用低於 2.5 GB;在手機上則約為每秒 30 token。對於中型團隊而言,可以透過單張 NVIDIA H100 SXM5 GPU 自行部署,每日約可處理 13 億 token。企業與 OEM 廠商則可透過 GGUF 與 ONNX 格式,將相同權重部署至大量終端裝置。微調部分支援透過 LoRA 搭配 TRL 與 Unsloth 進行。Liquid AI 鎖定的應用領域包括汽車、消費性電子、工業機器人、醫療保健、金融服務、電子商務與國防等產業。

尤其對受監管或需要隔離網路的環境最為有利,因為所有提示詞都不會送往第三方 API。官方建議的應用情境涵蓋代理任務、工具呼叫、資料擷取、檢索增強生成(RAG)與長上下文處理,實際案例包括裝置端助理、離線文件分類、表單與發票內容擷取、機器人指令解析,以及可持續在背景運作且不產生逐 token 費用的代理程式。不過 Liquid AI 明確表示,這款模型不適合用於代理式程式碼生成或知識密集型任務。在模型架構上,LFM2.5-2.6B 擁有 26.9 億總參數與 30 層結構,由 22 個雙閘極短卷積區塊與 8 個分組查詢注意力區塊組成。

詞彙表大小為 128,000,上下文長度達 131,072 token。預訓練使用了約 34 兆 token 的資料。Liquid AI 特別說明,團隊是在既有 tokenizer 基礎上直接擴充詞彙表至 128K,而非重新訓練,並透過專門的中段訓練階段將上下文延伸至 128K。模型支援 16 種語言,且僅處理文字輸入。後訓練階段則分為四個步驟。首先進行兩輪連續的監督式微調,其 SFT 混合資料量約為 LFM2.5-8B-A1B 所用資料的七倍。接著進入教師專業化階段,每個領域配置一位專家,並以可驗證獎勵的強化學習進行訓練。

第三步是多領域的 on-policy 蒸餾,學生模型在自己的策略下進行推論,每個提示詞會路由至對應領域的教師模型。最後則是在真實代理框架中,以 GRPO 進行代理強化學習,涵蓋 Hermes Agent 與 OpenClaw 等環境。在基準測試表現上,Liquid AI 將 LFM2.5-2.6B 與 gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)以及 Qwen3.5-9B(9.7B)進行比較。結果顯示,LFM2.5-2.6B 在 ToolSandbox 拿下 77.83 分,勝過 gemma-4-E4B-it 的 65.

00 分,但略低於 Qwen3.5-9B 的 76.44 分;在 Multi-IF 上以 80.07 分領先所有對手;IFStruct 則為 85.49 分;IFBench 為 59.17 分;BFCLv4 為 56.88 分,僅落後 Qwen3.5-9B 的 60.13 分。在程式碼生成方面,大型模型仍保有優勢,LFM2.5-2.6B 在 LiveCodeBenchv6 的分數為 59.41 分,而 Qwen3.5-9B 達到 69.86 分。整體而言,LFM2.5-2.6B 的定位相當明確,鎖定的是需要在終端裝置上執行代理任務、重視隱私與成本控制的場景。

由於所有運算都在本地完成,對於不適合將資料送往雲端的企業與政府單位而言,這款模型提供了實際可行的部署選項。獨立開發者與新創團隊也能直接使用手上既有的硬體進行測試與產品原型開發。

Related

相關文章

IT之家模型更新

鴻蒙 PC 生態首款 AI 編程智能體工作臺,阿里 Qoder 支持鴻蒙電腦

作者:沁滄(實習) 責編:沁滄 評論: 9 月 21 日消息,阿里 Qoder 今日宣佈,Qoder 登陸鴻蒙 PC 應用市場,是鴻蒙 PC 生態首款 AI 編程智能體工作臺。據介紹,Qoder 團隊與鴻蒙團隊緊密配合,重點解決了幾個關鍵問題:讓 Qoder 的完整任務閉環 —— 從理解意圖、拆解步驟、調用工具到交付結果 —— 在鴻蒙系統上流暢運行,確保核心體驗不打折。

4 小時前

百度文庫網盤宣佈AI辦公出海,庫庫AI全球月活超4000萬

通用智能體“庫庫AI”全球AI辦公月活已超4000萬,百度文庫網盤去年推出的海外一站式AI辦公平臺Oreate AI同步煥新為庫庫AI海外版“Kooko”,海外用戶一年內突破1000萬。作為百度文庫網盤三年前佈局的通用AI辦公產品,庫庫AI前身GenFlow於2025年4月上線1.

7 小時前
智東西模型更新

5499元起,vivo X500系列三機齊發:動態影像成核心戰略,首發2nm旗艦芯

作者 | 雲鵬 編輯 | 李水青 9月21日上海現場報道,剛剛vivo正式發佈X500系列手機,包括X500、X500 Pro、X500 Pro Max三款機型,起售價分別為5499元、6499元、6999元。 發佈會上,vivo副總裁、產品副總裁黃韜宣佈該系列是vivo影像進入下一個10年的開篇之作,並首次完整落地藍圖動態影像技術棧。 系統層面,OriginOS 7升級了不少AI個性化功能,比如用戶上傳一張寵物照片,AI即可生成高精度的3D建模萌寵互動主題。

8 小時前
智東西模型更新

公眾號插圖、秋招物料、潮玩設計,實測商湯SenseNova U1 Pro:生圖模型走向真實任務交付

作者 | 畢偉豪 編輯|漠影 時常會有人感慨,各種生圖模型讓人眼花繚亂,但一到真正交稿時,還是免不了反覆“抽卡”。好不容易挑到一張滿意的圖,改個字、換個元素,又得重新開始。 抽到一張好看的圖,和完成一項工作,畢竟不是一回事。 在真實工作中,做一張圖往往只是任務的一部分:公眾號文章需要封面和多張配圖,企業招聘需要海報、易拉寶、摺頁等一整套物料,設計過程中還可能隨時需要改文字、換人物服裝、調整局部元素。 這也意味著,辦公場景中的生圖需求,對模型提出的要求已經不只是畫面效果。

10 小時前

用 AI 造謠再收費刪帖:自媒體博主敲詐科技企業 230 萬元被抓

今年以來,上海警方共偵破涉企謠言案件百餘起,依法清理涉企不實信息 8.7 萬餘條;累計偵破涉企黑客類案件 68 起,抓獲犯罪嫌疑人 210 餘名。上海警方重點介紹了一起故意製造企業負面輿情、實施敲詐勒索的案件:犯罪嫌疑人針對一家剛剛宣佈獲得融資的科技企業,連續發佈十餘篇不實文章持續抹黑造謠,敲詐 230 萬元。

11 小時前