模型 / Nemotron-3-Embed-1B-NVFP4 (NVIDIA)

Nemotron-3-Embed-1B-NVFP4 (NVIDIA)

多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计

作者 nvidia

仓库标识nvidia/Nemotron-3-Embed-1B-NVFP4

显存未知许可 需自查任务 向量嵌入最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
VLLM
下载
6,682

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Nemotron-3嵌入模型的NVFP4量化版,通过vLLM一行命令部署,适合多语言RAG,需NVIDIA GPU(Ampere+)和vLLM环境。
对位
对位 BGE-M3、multilingual-e5 等同级开源嵌入模型
适合
多语言 RAG 检索 / 语义搜索与问答
不适合
生成式任务(仅输出嵌入向量)

独立证据与社区反馈

4 个独立来源最近验证 2026-08-05

基准测试成绩亮眼但社区实际采用率低,Nemotron 嵌入模型在 RTEB 和第三方评测中表现优异,但社区讨论度远不及 Gemma 和 Qwen。

  • RTEB 检索得分 72.4%(1B-BF16),较前代错误率降低 27%
  • NVFP4 量化版保持 99% 以上 BF16 精度,推理吞吐提升至 2 倍
  • Mem0 与 Zep 等第三方评测中检索性能优于更大参数模型,LongMemEval Retrieval@10 达 80.38%
  • 提供 NeMo 微调方案,在专业语料上微调后 NDCG@10 从 56.7% 提升至 63.3%
  • 社区讨论度和实际采用率低,远不如 Gemma 和 Qwen 常见
  • 最大输入长度 32K token,长文档场景受限
  • 使用 OpenMDW-1.1 协议,非标准开源许可证

可信度下载 6.6k,RTEB NDCG@10 得分 72.00,比 BF16 仅降 0.38

完整规格

规模
1.14B · 32k · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
OpenMDW-1.1 · 需自查
框架
vllm
维度
2048 维 · 256k 序列
血统
量化自 Nemotron-3-Embed-1B-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 13.7k → 14.3k · likes +3

观测时间线

模型家族

查看全部家族 →