模型 / Nemotron-3-Embed-1B (NVIDIA)

Nemotron-3-Embed-1B (NVIDIA)

多语言文本嵌入模型,用于语义搜索与 RAG

作者 nvidia

仓库标识nvidia/Nemotron-3-Embed-1B-BF16

~2.4GB BF16许可 需自查任务 向量嵌入最近核对 2026-08-05
格式
BF16
文件
~2.1GB
运行内存
~2.4GB–3.1GB
运行时
VLLM
下载
46,305

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Nemotron-3-Embed-1B-BF16

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
NVIDIA最新1B嵌入模型,支持34种语言和32K上下文,通过vLLM可快速部署为OpenAI兼容API,适合多语言RAG检索。
对位
对位 BGE-M3 / multilingual-e5-large
适合
多语言语义搜索 / RAG 系统的检索组件
不适合
不适用于文本生成

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

1B 版本以约 5% 的精度损失换取大幅降低的索引延迟和推理成本,被定位为 8B 的高效替代方案,适合高吞吐生产环境。

  • 在检索精度仅下降 5% 以内的情况下,显著降低索引延迟和服务成本
  • 开源且可商用,可直接用于企业 RAG、代码检索、Agent 记忆等场景
  • NVFP4 量化下吞吐量翻倍,精度仅损失 1%
  • 与 8B 版本相比,在 RTEB(72.38 vs 78.46)和 MMTEB(71.04 vs 75.45)等检索基准上仍有可感知的精度差距
  • 评测序列长度限定为 4096 tokens,更长上下文场景下的表现未覆盖

可信度46k 下载 · 60 点赞 · RTEB NDCG@10 72.38

完整规格

规模
1.14B · 32768 · 下载 ~2.1GB · 显存最低 ~2.4GB · 推荐 ~3.1GB · BF16(估算)
授权
OpenMDW-1.1 · 需自查
框架
transformers / sentence-transformers / vllm
维度
2048 维 · 256k 序列
血统
微调自 Ministral-3-3B-Instruct-2512
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 602.8k → 667k · likes +10

观测时间线

模型家族

查看全部家族 →