SummFlow 2026-06-19 Hugging Face

LFM2.5-Embedding-350M (LiquidAI)

11语种双编码器,面向端侧语义检索

入选理由
多语言检索新SOTA,支持11种语言,可用sentence-transformers或GGUF快速部署,适合RAG和语义搜索。
对位
对位 Qwen3-Embedding-0.6B
适合
端侧本地语义搜索 (文件/邮件) / 跨语言 FAQ/知识库检索
不适合
长文档 (>512 tokens) 检索
规模
350M · 32k · Q4 ~0.2GB / FP16 ~0.9GB
授权
lfm1.0 · 需自查
框架
sentence-transformers / llama.cpp
维度
1024 维 · 125k 序列
血统
微调自 LFM2.5-350M-Base
可信度
下载3734,多语言NanoBEIR NDCG@10 0.577,MKQA Recall@20 0.691,同级最佳,已出GGUF

仅 safetensors · 无 pickle 加载风险

社区实测

社区对 LFM2.5-Embedding-350M 以 350M 小参数量实现超低延迟多语言检索表示兴奋

  • 端到端检索延迟低至 1.5ms(企业栈),CPU 上通过 llama.cpp 也可做到 <10ms
  • 覆盖 11 种语言的多语言与跨语言检索
  • 350M 小体积可运行在笔记本、边缘设备上

截至 2026-06-19

快速上手

llama-server -hf LiquidAI/LFM2.5-Embedding-350M-GGUF (需安装llama.cpp)