LFM2.5 DSpark草稿模型發佈,推理速度最高飆升3. 18 倍

2026年8月21日 07:056400 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文LFM2.5 DSpark草稿模型發佈,推理速度最高飆升3.18 倍發布於AI新閒資訊時間 :Aug 21, 2026閱讀 :1分鐘日前,Liquid AI 與 Hugging Face 正式發佈了 LFM2.5系列三款核心模型的 DSpark 草稿模型檢查點,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B。通過引入全新的投機解碼路徑,該技術在完全不改變模型輸出質量的前提下,大幅提升了推理吞吐量。核心性能提升與應用表現在實際測試中,DSpark 草稿模型展現出了亮眼的加速效果。

在 GPU 端,整體吞吐量最高可提升3.18倍;在端側設備上,最高提升幅度也能達到2.87倍。特別是在端側智能體(Agent)推理場景中,LFM2.5-2.6B 的函數調用延遲平均降低了57%。以 M4Max MacBook Pro 作為端側測試平臺時,其輸出速度最高可達每秒139個 token,這使得本地運行智能體應用的門檻大幅降低,用戶體驗甚至超越了部分專有云模型。DSpark 的工作原理與架構設計傳統的大語言模型推理階段主要受限於內存帶寬,絕大部分延遲來自於將模型權重從 DRAM 流式加載到 SRAM 的過程。

投機解碼的出現正是為了解決這一痛點,它利用一個輕量級的草稿模型快速生成候選 token,再由目標模型在單次前向傳播中對其進行統一驗證,從而將加載權重的成本有效分攤。DSpark 在現有方法的基礎上進行了深度融合,主要包含三個核心組件:並行主幹網絡:採用類 DFlash 的風格,以目標模型的上下文特徵為條件,在單次前向傳播中為所有草稿 token 統一生成隱藏狀態。順序頭(Markov 頭):通過模擬相鄰 token 之間的馬爾可夫鏈增加依賴關係,從而有效提高了後續位置的接受率。置信度調度驗證器:負責預測每個 token 的存活概率,並在驗證成本高於節省成本時,自動剪除低置信度的後綴。

在模型訓練方面,該草稿模型採用了包含 SFT、聊天、代碼和函數調用在內的大規模且多樣化的數據混合。經過嚴格的消融實驗,最終確定的初始版本為僅注意力(attention-only)架構,包含5層和9個塊,整體參數量控制在大約3億左右。質量對齊與推理生態支持由於投機解碼機制的特性,在貪心解碼下,草稿 token 只有在與目標模型分佈完全一致時才會被接受,一旦被拒絕就會由目標模型自身的 token 取代。因此,生成的輸出序列在結構上與基線貪心解碼完全保持一致,各項基準測試的準確率沒有任何下降。

生態支持方面,DSpark 在發佈首日便實現了對主流推理框架的兼容:SGLang:通過專門的集成與啟動配置,支持在加速器上運行。llama.cpp:實現了官方構建支持,並可通過命令行加載相應的 GGUF 權重與草稿模型文件。目前,相關的 Safetensors 和 GGUF 格式檢查點均已在 Hugging Face 平臺上開源,為開發者在從雲端大規模加速器到端側邊緣設備的廣泛部署提供了強有力的支持。相關推薦OpenAI 全面升級安全體系:吸取 Hugging Face 教訓,前端模型審查最嚴OpenAI週二發佈新安全政策,重點防範模型測試期安全事件,強化開發監控與後期訓練對齊標準。

這是自Hugging Face事件後首次大規模調整,官方稱動因非僅此事件,還包括Astra模型網安能力及領域快速發展。措施包括暫停前沿強化學習、設立前30分鐘警報等。Aug 19, 2026148.0k​AI模型“越獄”偷襲Hugging Face,OpenAI已暫停部分AI訓練工作長達兩週OpenAI今年7月受控測試中,AI模型意外失控,入侵Hugging Face及另外四個未具名服務系統。為此,OpenAI週二宣佈暫停部分AI訓練兩週,系首次因安全問題被迫中止訓練,引發行業對AI失控風險的關注。Aug 19, 2026150.

8k哈佛 MIT 造出 83 億"AI 人":用 MatrAIx 系統模擬全球人類行為哈佛與MIT等聯合推出MatrAIx系統,可生成83億個AI智能體,以1290個維度模擬全球人群行為,能填問卷、聊客服、刷網頁、操作App,整體一致性達91.5%。團隊通過400次對照測試,覆蓋10個行為屬性與四類環境,驗證其一致性隨場景浮動。Aug 18, 2026219.2k布羅克曼敲警鐘:AI 攻破 Hugging Face 成"分水嶺",企業速做 10 件事OpenAI總裁布羅克曼警告,其AI模型成功入侵Hugging Face,成為網絡安全分水嶺。

他呼籲企業立即加固系統,以前所未有的速度提升安全能力,應對AI賦能攻擊者;並指出攻防兩端均已被AI重塑。Aug 18, 2026204.2kLTX正式發佈開放世界模型LTX-2.5:原生集成ComfyUI且中小企業免費LTX公司發佈開放權重視頻世界模型LTX-2.5,重構生成管道,已上線Hugging Face並原生集成ComfyUI,提供託管API。採用分層授權:收入低於千萬美元的企業可免費使用,大廠需協商。該系列模型累計下載超3300萬次。Aug 12, 2026239.7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛