今天,我们在 Hugging Face 上发布了两款新的编码器模型:LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。它们在保持与更大模型相当质量的同时,随着输入变长仍然保持高速。这意味着你可以在现有硬件上运行文档级任务,甚至只用 CPU 也可以。
你将获得:
- **体量小但能力强:**在 GLUE、SuperGLUE 和多语言任务上匹敌甚至超越更大的编码器。
- 8,192 token 上下文长度,且随着输入变长,延迟增长很慢。
- **CPU 上速度快:**在长上下文下,速度大约比 ModernBERT-base 快 3.7 倍。
借助这些模型,你可以构建意图路由器、策略检查器、PII 检测器和文本分类器,而且运行成本低、可全天候使用。下面可以查看在线演示。
为什么我们要构建通用编码器
上个月,我们发布了 LFM2.5-Retrievers,用于多语言搜索。LFM2.5-Encoders 来自同一系列,但用途更广。它们采用 masked language objective 进行预训练,因此你可以将其微调用于分类、token 级任务以及搜索。搜索只是编码器能力的一部分,这也是我们构建通用模型而不是复用检索器的原因。
编码器支撑着许多现代生产级 NLP 应用:分类器、意图路由器、安全过滤器。这些任务通常全天运行,一般部署在 CPU 上,并且输入长度还在不断增长。BERT 奠定了这类模型的基础,而近期的 ModernBERT 又进一步提升了准确率、速度和上下文长度。LFM2.5-Encoders 基于 LFM2 架构迈出了下一步:随着输入增长,成本只会缓慢上升。
编码器是如何构建的
我们从各自的 LFM2 解码器骨干网络初始化编码器:LFM2.5-230M 和 LFM2.5-350M。随后,我们通过一些改动将每个因果解码器转为双向编码器:
- **双向注意力掩码:**每个 token 现在可以看到左右两侧的 token,而不只是前面的 token。
- **非因果短卷积:**我们采用对称填充,使每个 token 的卷积都能融合左右邻居的信息。
- **Masked language modeling:**训练时,我们会对 30% 的 token 进行掩码。
我们分两个阶段训练这两个模型:
- **通用语言能力:**在大型网页语料上,以 1,024 token 的上下文长度进行短上下文 masked language 目标训练。
- **长上下文适配:**将上下文扩展到 8,192 token,并在完整数据混合上训练,以增强事实、法律和多语言能力。
评测结果
我们对每个任务都进行完整微调,并报告最终得分。整张表包含 14 个模型、17 个来自 GLUE、SuperGLUE 和多语言分类的数据集任务。
我们报告的是 5 个保留随机种子下的平均值,因此结果在不同运行之间较为稳定。完整框架和原始结果已 开源。

LFM2.5-Encoder-350M 在 14 个模型中排名第四。排在它前面的三个模型都更大,其中包括一个 35 亿参数模型,规模接近它的 10 倍。LFM2.5-Encoder-230M 的表现超过了 ModernBERT-base 以及所有 EuroBERT 模型,同时体量比它们中的大多数都更小。两款模型在这里的得分也都明显高于我们自己的 LFM2.5-Retrievers。
CPU 和 GPU 上的推理速度
我们的编码器继承了 LFM2 骨干网络的高速推理能力。由于我们的编码器和 ModernBERT 都支持 8,192 token 上下文长度,因此我们在完整范围内测量速度。

我们的编码器在 CPU 上优势最明显。在这里,LFM2.5-Encoder-230M 在所有序列长度下都是最快的(即使在短输入上,也比更小的 ModernBERT-base 更快)。随着输入长度增加,ModernBERT 的吞吐量会急剧下降,而我们的 LFM2.5-Encoders 则会先升至中段再趋于平缓。在 8,192 token 时,ModernBERT-base 每次前向传播需要一分半以上,而 LFM2.5-Encoder-230M 大约只需要 28 秒。这大约快 3.7 倍。对开发者来说,这意味着你可以在笔记本 CPU 上,于 30 秒内扫描或分类一整份合同、完整对话记录或很长的客服工单线程。
在 GPU 上,也呈现类似趋势,但优势幅度更小:在 Apple GPU 上,ModernBERT-base 在约 1K token 以下领先。我们的编码器从约 2K token 开始反超。这说明对于长输入,LFM2.5-Encoders 是更快的选择;如果你在 CPU 上运行,优势则会更加明显。
LFM2.5-Encoder 演示
下面这些演示都基于微调后的 LFM2.5-Encoders 构建。每个演示都运行在仅 CPU 的 Hugging Face Space 中:

