指南 / 向量嵌入模型
向量嵌入模型
共 11 个 · 数据更新于 2026-09-04
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
all-MiniLM-L6-v2 (sentence-transformers)
量化自 MiniLM-L6-H384-uncased
英文句子/短段落向量化,用于语义搜索与聚类
- 参数量
- 22.7M
- 商用
- 可商用
当前运行配置
sentence-transformers/all-MiniLM-L6-v2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 256 word pieces
- 国内可达
- 需代理
当前运行配置
tencent/WeMM-Embedding-9B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve tencent/WeMM-Embedding-9B --runner pooling- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
BAAI/bge-m3- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 上下文
- 8192
- 国内可达
- 需代理
当前运行配置
inference-optimization/Kimi-K3-0.40B- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
Nemotron-3-Embed-1B-NVFP4 (NVIDIA)
量化自 Nemotron-3-Embed-1B-BF16
多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计
- 参数量
- 1.14B
- 商用
- 需自查
当前运行配置
nvidia/Nemotron-3-Embed-1B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- OpenMDW-1.1
- 上下文
- 32k
- 国内可达
- 需代理
当前运行配置
nvidia/Nemotron-3-Embed-8B-BF16- 显存
- ~17GB BF16(估算)
查看详情查看运行方式
vllm serve nvidia/Nemotron-3-Embed-8B-BF16- 许可证
- OpenMDW-1.1
- 上下文
- 32768
- 国内可达
- 需代理
当前运行配置
nvidia/Nemotron-3-Embed-1B-BF16- 显存
- ~2.4GB BF16(估算)
查看详情查看运行方式
vllm serve nvidia/Nemotron-3-Embed-1B-BF16- 许可证
- OpenMDW-1.1
- 上下文
- 32768
- 国内可达
- 需代理
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 2.8T 参数规模超出个人硬件承载能力,本地推理不可行 —— inference-optimization/Kimi-K3-0.40B
- 实测输出速度约 62 tok/s,低于同价位中位数 72.7 tok/s —— inference-optimization/Kimi-K3-0.40B
- 在 UK AISI/CAISI 网络攻防评估中显著落后于前沿模型 —— inference-optimization/Kimi-K3-0.40B
- 训练依赖出口级 Nvidia 芯片及未公开的替代 GPU,算力受限 —— inference-optimization/Kimi-K3-0.40B
- 实际可行访问方式仅限于 API,本地推理不现实 —— inference-optimization/Kimi-K3-0.40B
- 社区讨论度和实际采用率低,远不如 Gemma 和 Qwen 常见 —— nvidia/Nemotron-3-Embed-1B-NVFP4
- 最大输入长度 32K token,长文档场景受限 —— nvidia/Nemotron-3-Embed-1B-NVFP4
- 使用 OpenMDW-1.1 协议,非标准开源许可证 —— nvidia/Nemotron-3-Embed-1B-NVFP4
展开其余 5 条
- 混合架构(Transformer + Mamba-2)在非 NVIDIA 芯片(如 Cerebras/Groq)上编译部署较为困难 —— nvidia/Nemotron-3-Embed-8B-BF16
- 与 8B 版本相比,在 RTEB(72.38 vs 78.46)和 MMTEB(71.04 vs 75.45)等检索基准上仍有可感知的精度差距 —— nvidia/Nemotron-3-Embed-1B-BF16
- 评测序列长度限定为 4096 tokens,更长上下文场景下的表现未覆盖 —— nvidia/Nemotron-3-Embed-1B-BF16
- 使用时需注意非对称的query:和document:前缀,集成时不可忽略 —— LiquidAI/LFM2.5-Embedding-350M
- Ollama端更新llama.cpp依赖偏慢,Ollama用户可能无法及时获得最新支持 —— LiquidAI/LFM2.5-Embedding-350M