MarkTechPost AI模型更新

Liquid AI Releases LFM2.5-2.6B: An On-Device Agentic Model With 128K Context, Tool Calling, And Open Weights

2026年8月7日 03:42

重點摘要

Liquid AI released LFM2.5-2.6B, an agentic model that runs entirely on-device. It plans, calls tools, and works through multi-step tasks on phones, laptops, PCs, and robots. The model has 2.

站內 AI 整理稿

Liquid AI 正式發布全新裝置端代理模型 LFM2.5-2.6B,這款模型專為在手機、筆電、個人電腦與機器人上直接執行所設計,具備規劃、工具呼叫與多步驟任務處理能力。模型總參數量為 26.9 億,支援 131,072 token 的上下文窗口與 128,000 token 的詞彙表,預訓練階段使用了約 34 兆 token 的資料。Liquid AI 同步釋出兩個檢查點版本,分別是供微調使用的 LFM2.5-2.6B-Base,以及針對代理任務最佳化的 LFM2.5-2.6B post-trained 版本。

由於推論過程完全在本地端進行,資料不會離開裝置,每次執行所產生的邊際成本也趨近於零。Liquid AI 表示,在工具使用與指令遵循的評測成績上,這款模型能與規模將近四倍的模型競爭,例如在 ToolSandbox 與 Multi-IF 等基準測試中表現突出。模型目前已在 Hugging Face 上以 lfm1.0 授權公開,提供原生、GGUF、MLX 與 ONNX 等多種格式,並在 llama.cpp、vLLM、SGLang 與 LM Studio 等框架中獲得首日支援。在執行效能方面,LFM2.5-2.

6B 在 Apple M5 Max 晶片上可達到每秒 220 token 的解碼速度,記憶體占用低於 2.5 GB;在手機上則約為每秒 30 token。對於中型團隊而言,可以透過單張 NVIDIA H100 SXM5 GPU 自行部署,每日約可處理 13 億 token。企業與 OEM 廠商則可透過 GGUF 與 ONNX 格式,將相同權重部署至大量終端裝置。微調部分支援透過 LoRA 搭配 TRL 與 Unsloth 進行。Liquid AI 鎖定的應用領域包括汽車、消費性電子、工業機器人、醫療保健、金融服務、電子商務與國防等產業。

尤其對受監管或需要隔離網路的環境最為有利,因為所有提示詞都不會送往第三方 API。官方建議的應用情境涵蓋代理任務、工具呼叫、資料擷取、檢索增強生成(RAG)與長上下文處理,實際案例包括裝置端助理、離線文件分類、表單與發票內容擷取、機器人指令解析,以及可持續在背景運作且不產生逐 token 費用的代理程式。不過 Liquid AI 明確表示,這款模型不適合用於代理式程式碼生成或知識密集型任務。在模型架構上,LFM2.5-2.6B 擁有 26.9 億總參數與 30 層結構,由 22 個雙閘極短卷積區塊與 8 個分組查詢注意力區塊組成。

詞彙表大小為 128,000,上下文長度達 131,072 token。預訓練使用了約 34 兆 token 的資料。Liquid AI 特別說明,團隊是在既有 tokenizer 基礎上直接擴充詞彙表至 128K,而非重新訓練,並透過專門的中段訓練階段將上下文延伸至 128K。模型支援 16 種語言,且僅處理文字輸入。後訓練階段則分為四個步驟。首先進行兩輪連續的監督式微調,其 SFT 混合資料量約為 LFM2.5-8B-A1B 所用資料的七倍。接著進入教師專業化階段,每個領域配置一位專家,並以可驗證獎勵的強化學習進行訓練。

第三步是多領域的 on-policy 蒸餾,學生模型在自己的策略下進行推論,每個提示詞會路由至對應領域的教師模型。最後則是在真實代理框架中,以 GRPO 進行代理強化學習,涵蓋 Hermes Agent 與 OpenClaw 等環境。在基準測試表現上,Liquid AI 將 LFM2.5-2.6B 與 gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)以及 Qwen3.5-9B(9.7B)進行比較。結果顯示,LFM2.5-2.6B 在 ToolSandbox 拿下 77.83 分,勝過 gemma-4-E4B-it 的 65.

00 分,但略低於 Qwen3.5-9B 的 76.44 分;在 Multi-IF 上以 80.07 分領先所有對手;IFStruct 則為 85.49 分;IFBench 為 59.17 分;BFCLv4 為 56.88 分,僅落後 Qwen3.5-9B 的 60.13 分。在程式碼生成方面,大型模型仍保有優勢,LFM2.5-2.6B 在 LiveCodeBenchv6 的分數為 59.41 分,而 Qwen3.5-9B 達到 69.86 分。整體而言,LFM2.5-2.6B 的定位相當明確,鎖定的是需要在終端裝置上執行代理任務、重視隱私與成本控制的場景。

由於所有運算都在本地完成,對於不適合將資料送往雲端的企業與政府單位而言,這款模型提供了實際可行的部署選項。獨立開發者與新創團隊也能直接使用手上既有的硬體進行測試與產品原型開發。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

2 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

2 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

3 小時前