SummFlow 2026-05-18 Hugging Face

jina-embeddings-v5-omni-small (Jina)

多模态嵌入模型,支持文本/图像/视频/音频

入选理由
transformers可用,有详尽示例;下载量2.8万,有arXiv论文;新增多模态embedding能力,与text共享空间。
对位
对位 OpenAI CLIP / Cohere Embed multimodal
适合
多模态检索与RAG / 跨模态零样本分类与聚类
不适合
仅需文本嵌入的轻量场景
规模
1.74B · 32768 · Q4 ~1.1GB / FP16 ~3.9GB
授权
cc-by-nc-4.0 · 不可商用
框架
transformers / sentence-transformers / vllm
可信度
下载量 28917,vLLM 0.20.1 已验证,Matryoshka 32-1024 维

仅 safetensors · 无 pickle 加载风险

社区实测

在同等体量下是少有的同时覆盖文本、图像、视频、音频四模态的开源嵌入模型,且文本向量与 v5-text 完全对齐,迁移成本低。

  • 文本向量与 jina-embeddings-v5-text 完全一致,已有文本索引无需重建即可扩展为多模态检索
  • 单一模型覆盖文本、图像、视频、音频四种模态的嵌入,无需为不同模态维护多个模型
  • 支持近 100 种语言的多语言嵌入
  • 使用 transformers 加载需设置 trust_remote_code=True,存在安全风险
  • small 版本参数量 1.57B,对边缘设备或资源受限环境部署仍有压力

截至 2026-06-21

快速上手

vllm serve jinaai/jina-embeddings-v5-omni-small --trust-remote-code --hf-overrides '{"task":"retrieval"}'