Liquid AI 推出 LFM2.5-Encoder-230M 與 LFM2.5-Encoder-350M:在 CPU 上 8K 上下文仍維持高速的雙向編碼器
重點摘要
Liquid AI has released two open-weight bidirectional encoders, LFM2.5-Encoder-230M and LFM2.5-Encoder-350M. Both are masked language models built on the LFM2 hybrid backbone. Both carry an 8,192-token context.
# Liquid AI 推出 LFM2.5-Encoder-230M 與 LFM2.5-Encoder-350M:在 CPU 上 8K 上下文仍維持高速的雙向編碼器
Liquid AI 近日正式發布了兩款開放權重的雙向編碼器模型——LFM2.5-Encoder-230M 與 LFM2.5-Encoder-350M。這兩款模型均為基於 LFM2 混合骨幹(hybrid backbone)的遮蔽語言模型,支持高達 8192 tokens 的上下文長度,並能在無 GPU 的環境下保持高速推理。該系列模型瞄準分類器、意圖路由、安全過濾器及 PII 檢測器等生產級任務,試圖在效率與效能之間取得新的平衡。雙向編碼器長期以來是自然語言處理管線中的核心元件。
從 BERT 開始,這類模型透過雙向上下文編碼徹底改變了文本表示的方式,廣泛應用於文本分類、語意匹配、實體辨識、內容審核等場景。然而,隨著實際應用中輸入長度的不斷增長,傳統編碼器在推理速度和資源消耗上的瓶頸日益凸顯。ModernBERT 曾透過架構最佳化大幅提升了準確性、速度與上下文長度,成為該領域的重要進展。Liquid AI 此次提出的 LFM2.5-Encoder 則試圖在 ModernBERT 的基礎上進一步突破,為長上下文編碼提供更具成本效益的解決方案。兩款新模型分別具有 2.3 億與 3.5 億個參數,採用了 LFM2 混合架構。
LFM2 是 Liquid AI 自主研發的新型骨幹網路,融合了 Transformer 的雙向編碼能力與高效混合運算機制。與傳統 Transformer 編碼器相比,LFM2 在處理長序列時能有效降低漸進式的計算開銷,這使得它在 8K 上下文長度下依然可以流暢運行於 CPU 之上,而不必依賴昂貴的 GPU 加速。Liquid AI 強調,LFM2.5-Encoder 的設計初衷是服務於需要持續運行的後端系統。分類器、意圖路由器、安全過濾器與 PII 檢測器等元件往往被部署在線上推理環境中,這些場景通常缺乏 GPU 資源,卻需要處理越來越長的使用者輸入或文檔內容。
傳統編碼器在面對 8K 甚至更長上下文時往往會出現延遲暴漲或記憶體超載,而 LFM2.5-Encoder 憑藉其架構特點,在 CPU 上依然能維持符合生產要求的處理速度,這對於成本敏感或邊緣部署場景具有重要意義。從技術路線來看,BERT 開創了雙向編碼器這個類別,ModernBERT 將其推向了更高的精度與更長的支持上下文。Liquid AI 的觀點明確:LFM2 系列架構正是這條進化路線的延續。差別在於,LFM2 的計算成本隨輸入長度增長的曲線更加平緩,這使得它能夠在低資源條件下承載更長的上下文,而不必在速度或準確性上做出過大犧牲。這種「成本增長更慢」的特性,是 LFM2.
5-Encoder 在長文本分類與安全過濾等場景中得以脫穎而出的關鍵。在具體應用方面,LFM2.5-Encoder-230M 與 350M 可被直接整合到現有的 NLP 管線中,作為特徵提取器或微調起點。由於採用遮蔽語言建模進行預訓練,兩款模型保留了豐富的雙向語義表示能力,適合句子與段落層級的下游任務。例如,在內容審核系統中,模型需要從整段對話或長文章中識別不當言論;在意圖路由場景中,系統必須理解完整的用戶上下文才能正確分配處理邏輯。這些任務對長上下文的依賴度極高,而 LFM2.5-Encoder 的長序列處理能力正好對應了這一需求。開放權重是此次發布的另一大亮點。
任何開發者或研究人員都可以直接下載模型權重,並在本地進行部署、微調或二次開發。開源策略不僅降低了試用門檻,也為學術界與工業界提供了進一步探索高效編碼器架構的基礎。特別是在資源有限的開發環境或需要快速原型驗證的專案中,LFM2.5-Encoder 可以作為 BERT 系列模型的即時替代方案,幫助團隊在不引入大量運算成本的前提下獲得 8K 上下文支援。從更宏觀的視角看,LFM2.
5-Encoder 的出現反映了 NLP 基礎設施的兩個重要趨勢:一是長上下文在實際部署中已成為剛需,無論是處理完整對話歷史、長篇幅文檔,還是聚合多輪輸入;二是模型效率的戰場正在從單純的 FLOPs 最佳化轉向實際硬體上的端到端延遲,尤其是 CPU 推理的表現直接影響著大量應用的運維成本與可擴展性。Liquid AI 選擇在此時推出該系列模型,正是為了填補這一生產力空缺。Liquid AI 以其在液體神經網路(Liquid Neural Networks)領域的開創性工作聞名,LFM2 混合架構則進一步延伸了其在動態系統與高效序列建模方面的積累。LFM2.
5-Encoder 的發布表明,該公司正在將基礎研究成果轉化為可直接落地的高性能模型,並以開源形式回饋社群。雖然目前公布的僅有編碼器版本,但業界普遍預期未來可能出現基於相同混合骨幹的生成式解碼器或編碼器-解碼器模型。對於開發者而言,LFM2.5-Encoder-230M 與 LFM2.5-Encoder-350M 已可在 Hugging Face 等模型庫中獲取,並支援常見的深度學習推理框架。建議在下列場景中優先評估:需要長期穩定運行的 CPU 推理服務、對輸入長度有明確 8K 要求的線上分類任務,以及希望在低預算下引入長上下文能力的邊緣應用。
透過簡單的對比測試,即可感受其在延遲與記憶體佔用上與 BERT 系列或 ModernBERT 的差異。總結來看,LFM2.5-Encoder 系列是雙向編碼器領域一次值得關注的實用主義創新。它沒有追求極致的參數規模或精度數值,而是選擇在「長上下文、低資源、高速度」這個容易被忽略卻至關重要的維度上深耕。Liquid AI 的論證簡單而有力——當輸入變長時,誰的成本增長更慢,誰就更能適應真實世界的部署節奏。在 AI 模型日趨工業化的當下,這或許正是維持高效與可用之間平衡的正確方向。
Related
相關文章

OpenAI首款AI硬件,為什麼是個沒有屏幕的「甜甜圈」
OpenAI與Jony Ive團隊合作的首款AI硬體,外型類似無螢幕的冰球大小圓環,被形容為金屬甜甜圈。這款設備定位為以AI為第一交互入口的計算設備,而非傳統智能音箱,售價可能落在300至400美元之間。
OpenAI 首款硬件真容浮現:冰球大小無屏設計,售價 300 至 400 美元
OpenAI首款硬件產品細節曝光,為一款無螢幕的智能音箱,外型類似冰球,售價約300至400美元,由OpenAI與前蘋果設計師Jony Ive的LoveFrom公司合作開發。該設備內建電池與攝影鏡頭,可支援手持使用並將視覺資訊傳給ChatGPT,實現多模態感知。此產品推出時正值蘋果對OpenAI提起商業機密訴訟,OpenAI內部評估其設計細節有望反駁侵權指控。

消息稱英偉達急尋中國 AI 基站供應商,與“下一個中際旭創”合作開發 6G 基站
NVIDIA正積極在中國尋找AI基站供應商,並有意與被視為「下一個中際旭創」的業者合作開發6G基站,顯示其從資料中心延伸至通訊基礎設施的布局。此舉凸顯NVIDIA對6G市場的重視,AI基站被視為整合邊緣運算與智慧調度的關鍵節點,但合作細節與技術方案尚未正式公布。
金剛GC3芯片重新定義視頻AI算力規則,國產RISC-V高端算力商業化提速
近日,第三屆中國計算機學會芯片大會(CCF Chip 2026)在太湖之濱無錫成功舉辦。會場中,兩院院士與頂尖工程師們的討論話題直指底層架構的“根技術”創新。一個核心追問被反覆推至臺前:當摩爾定律逼近物理極限,製程紅利日益稀薄,堆核心、拼頻率的老路越走越窄,是否該徹底換一條路走?換言之,與其在通用架構上不斷打補丁,能否從數據流動的本質出發,為特定場景原生設計一顆芯片?
把512 GiB閃存搬到xPU旁邊,HBF能打破推理內存牆?
HBM已經證明,通過堆疊和共封裝把存儲介質遷移至GPU附近,可以緩解AI計算中的數據搬運瓶頸。現在,SK海力士聯合閃迪,將類似的思路正式應用到NAND上,通過HBF將大容量閃存放到包括GPU在內的各類xPU旁,以緩解AI推理內存牆問題。近日,雙方通過OCP發佈《High Bandwidth Flash(HBF)High-Level Base Die Specification, Version 0.7.0》。

AI的錢,被誰賺走了?
AI 浪潮推動雲端服務供應商大舉擴建資料中心,背後龐大的資本支出正沿著供應鏈層層傳導,最終流向光模塊、晶片與伺服器業者。這條資金鏈路的起點是亞馬遜 AWS、微軟 Azure、Google Cloud 等雲端廠商,他們為了滿足訓練與推論大語言模型所需的算力,持續加碼採購 GPU 伺服器與高速網路設備,帶動上游零組件需求爆發。