SummFlow 2026-07-19 Hugging Face

Nemotron-3-Embed-8B (NVIDIA)

多语言文本嵌入模型,面向RAG检索与语义搜索。

入选理由
8B多语言embedding模型,支持32768长度,可用vLLM一键启在线服务,适合中文RAG场景,但需较大显存。
对位
对位 e5-mistral-7b 等开源嵌入模型
适合
多语言RAG检索增强生成 / 代码语义搜索与匹配
不适合
不适用于文本生成或对话
规模
8B · 32768 · Q4 ~5.3GB / FP16 ~19GB
授权
OpenMDW-1.1 · 需自查
框架
transformers / sentence-transformers / vllm
维度
4096 维 · 256k 序列
可信度
RTEB 78.46 NDCG@10,34语种,HuggingFace 14k下载,vLLM/Sentence Transformers原生支持。

快速上手

vllm serve nvidia/Nemotron-3-Embed-8B-BF16