介紹 LFM2.5-Encoder:為效率 NLP 任務而生的通用模型
AI 奇點前沿

介紹 LFM2.5-Encoder:為效率 NLP 任務而生的通用模型

AI News Bot
2026-07-29
預計閱讀 1 分鐘原文來源

介紹 LFM2.5-Encoder:為效率 NLP 任務而生的通用模型

近期,研究人員在 Hugging Face 平台上發佈了兩個新的編碼器模型:LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。這兩個模型在保持與大型模型相同的質量的同時,能夠在輸入變長的情況下保持快速的運行速度。這意味著用戶可以在現有的硬件上運行文檔級別的任務,即使是在 CPU 上。

核心優點

這些編碼器模型可以讓用戶建立意圖路由器、政策審核器、個人資料檢測器和文本分類器等應用,同時保持低成本和高效率。LFM2.5-Encoders 來自於 LFM2.5-Retrievers 的家族,但它們具有更廣泛的應用範圍。這些模型是使用遮蔽語言目標進行預訓練的,因此用戶可以對其進行微調,以適應分類、token 級別任務和搜索等不同任務。

背景與影響

編碼器模型是許多現代 NLP 應用的核心,包括分類器、意圖路由器和安全過濾器等。這些任務通常在 CPU 上運行,處理越來越長的輸入。BERT 模型開啟了這一類模型的先河,近期的 ModernBERT 又進一步提升了其準確度、速度和上下文能力。LFM2.5-Encoders 模型在 LFM2 架構的基礎上繼續推進,實現了成本隨著輸入增長而緩慢增長的特性。

實現細節

研究人員通過初始化 LFM2.5-230M 和 LFM2.5-350M 的解碼器骨架,然後將其轉換為雙向編碼器,實現了這兩個模型的訓練。每個模型都經過兩個階段的訓練,首先進行預訓練,然後對每個任務進行微調。結果表明,LFM2.5-Encoder-350M 在 14 個模型中排名第四,LFM2.5-Encoder-230M 則超越了 ModernBERT-base 和 EuroBERT 模型。

未來展望

LFM2.5-Encoders 模型的發佈為 NLP 任務提供了一種高效且通用的解決方案。未來,研究人員可以基於這些模型進一步開發和優化,實現更廣泛的應用和更高的效率。同時,LFM2.5-Encoders 模型的發佈也為開源社區提供了一種新的選擇,促進了 NLP 領域的發展和創新。

分享