指南 / 向量嵌入模型
向量嵌入模型
共 7 个 · 数据更新于 2026-07-21
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| Nemotron-3-Embed-1B-NVFP4 (NVIDIA) 量化自 Nemotron-3-Embed-1B-BF16 | 1.14B | Q4 ~0.5GB / FP16 ~1.8GB | 32k | OpenMDW-1.1 | 需自查 | — | 需代理 | vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4 |
| Nemotron-3-Embed-8B (NVIDIA) | 8B | Q4 ~5.3GB / FP16 ~19GB | 32768 | OpenMDW-1.1 | 需自查 | — | 需代理 | vllm serve nvidia/Nemotron-3-Embed-8B-BF16 |
| Nemotron-3-Embed-1B (NVIDIA) 微调自 Ministral-3-3B-Instruct-2512 | 1.14B | Q4 ~0.8GB / FP16 ~2.7GB | 32768 | OpenMDW-1.1 | 需自查 | — | 需代理 | vllm serve nvidia/Nemotron-3-Embed-1B-BF16 |
| LFM2.5-ColBERT-350M (LiquidAI) 微调自 LFM2.5-350M-Base | 350M | Q4 ~0.2GB / FP16 ~0.8GB | 32k | LFM Open License v1.0 | 需自查 | — | 需代理 | llama-server -hf LiquidAI/LFM2.5-ColBERT-350M-GGUF --embeddings -ngl 99 (需先下载 GGUF 文件) 等 2 种 |
| LFM2.5-Embedding-350M (LiquidAI) 微调自 LFM2.5-350M-Base | 350M | Q4 ~0.2GB / FP16 ~0.9GB | 32k | lfm1.0 | 需自查 | — | 需代理 | llama-server -hf LiquidAI/LFM2.5-Embedding-350M-GGUF (需安装llama.cpp) 等 2 种 |
| Lean Finder (delta-lab-ai) | 8.2B | Q4 ~5.4GB / FP16 ~20GB | — | Apache-2.0 | 可商用 | — | 需代理 | sentence-transformers SentenceTransformer('delta-lab-ai/lean-finder') 等 2 种 |
| jina-embeddings-v5-omni-small (Jina) | 1.74B | Q4 ~1.1GB / FP16 ~3.9GB | 32768 | cc-by-nc-4.0 | 不可商用 | — | 需代理 | vllm serve jinaai/jina-embeddings-v5-omni-small --trust-remote-code --hf-overrides '{"task":"retrieval"}' 等 3 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 使用 transformers 加载需设置 trust_remote_code=True,存在安全风险 —— jinaai/jina-embeddings-v5-omni-small
- small 版本参数量 1.57B,对边缘设备或资源受限环境部署仍有压力 —— jinaai/jina-embeddings-v5-omni-small