指南 / 向量嵌入模型

向量嵌入模型

共 7 个 · 数据更新于 2026-07-21

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

模型参数量显存门槛上下文许可证商用语言国内可达部署
Nemotron-3-Embed-1B-NVFP4 (NVIDIA)
量化自 Nemotron-3-Embed-1B-BF16
1.14BQ4 ~0.5GB / FP16 ~1.8GB32kOpenMDW-1.1需自查需代理vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4
Nemotron-3-Embed-8B (NVIDIA) 8BQ4 ~5.3GB / FP16 ~19GB32768OpenMDW-1.1需自查需代理vllm serve nvidia/Nemotron-3-Embed-8B-BF16
Nemotron-3-Embed-1B (NVIDIA)
微调自 Ministral-3-3B-Instruct-2512
1.14BQ4 ~0.8GB / FP16 ~2.7GB32768OpenMDW-1.1需自查需代理vllm serve nvidia/Nemotron-3-Embed-1B-BF16
LFM2.5-ColBERT-350M (LiquidAI)
微调自 LFM2.5-350M-Base
350MQ4 ~0.2GB / FP16 ~0.8GB32kLFM Open License v1.0需自查需代理llama-server -hf LiquidAI/LFM2.5-ColBERT-350M-GGUF --embeddings -ngl 99 (需先下载 GGUF 文件) 等 2 种
LFM2.5-Embedding-350M (LiquidAI)
微调自 LFM2.5-350M-Base
350MQ4 ~0.2GB / FP16 ~0.9GB32klfm1.0需自查需代理llama-server -hf LiquidAI/LFM2.5-Embedding-350M-GGUF (需安装llama.cpp) 等 2 种
Lean Finder (delta-lab-ai) 8.2BQ4 ~5.4GB / FP16 ~20GBApache-2.0可商用需代理sentence-transformers SentenceTransformer('delta-lab-ai/lean-finder') 等 2 种
jina-embeddings-v5-omni-small (Jina) 1.74BQ4 ~1.1GB / FP16 ~3.9GB32768cc-by-nc-4.0不可商用需代理vllm serve jinaai/jina-embeddings-v5-omni-small --trust-remote-code --hf-overrides '{"task":"retrieval"}' 等 3 种

常见坑

  • 使用 transformers 加载需设置 trust_remote_code=True,存在安全风险 —— jinaai/jina-embeddings-v5-omni-small
  • small 版本参数量 1.57B,对边缘设备或资源受限环境部署仍有压力 —— jinaai/jina-embeddings-v5-omni-small

收藏本页,或 订阅 RSS 追踪每日更新。