模型 / Nemotron-3-Embed-8B (NVIDIA)

Nemotron-3-Embed-8B (NVIDIA)

多语言文本嵌入模型,面向RAG检索与语义搜索。

作者 nvidia

仓库标识nvidia/Nemotron-3-Embed-8B-BF16

~17GB BF16许可 需自查任务 向量嵌入最近核对 2026-08-05
格式
BF16
文件
~15GB
运行内存
~17GB–22GB
运行时
VLLM
下载
14,038

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Nemotron-3-Embed-8B-BF16

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
8B多语言embedding模型,支持32768长度,可用vLLM一键启在线服务,适合中文RAG场景,但需较大显存。
对位
对位 e5-mistral-7b 等开源嵌入模型
适合
多语言RAG检索增强生成 / 代码语义搜索与匹配
不适合
不适用于文本生成或对话

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Nemotron-3-Embed-8B 发布即登顶 RTEB 检索基准排行榜,检索精度超过 OpenAI、Cohere、Voyage 等同类嵌入模型

  • 前沿级检索精度,适合对检索质量要求高的 RAG 与智能体系统
  • 多语言与跨语言检索,覆盖 34 种语言
  • 提供 8B/1B 精度-效率梯度,1B 版本通过剪枝、蒸馏保留 8B 版本 95% 以上精度
  • 混合架构(Transformer + Mamba-2)在非 NVIDIA 芯片(如 Cerebras/Groq)上编译部署较为困难

可信度RTEB 78.46 NDCG@10,34语种,HuggingFace 14k下载,vLLM/Sentence Transformers原生支持。

完整规格

规模
8B · 32768 · 下载 ~15GB · 显存最低 ~17GB · 推荐 ~22GB · BF16(估算)
授权
OpenMDW-1.1 · 需自查
框架
transformers / sentence-transformers / vllm
维度
4096 维 · 256k 序列
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 94.2k → 111.8k · likes +7

观测时间线