模型 / 归档 / 2026-07-21

本期 (2)

1.14B

多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计

  • 已量化

适合多语言 RAG 检索 / 语义搜索与问答

短板生成式任务(仅输出嵌入向量)

Q4 ~0.5GB / FP16 ~1.8GB · OpenMDW-1.1 · 32k · vllm需自查

证据6682 下载 / 55 赞

20B (MoE)

2-bit 量化 MLX 模型,专为 Apple Silicon 推理

  • Apple Silicon
  • 已量化

适合Apple Silicon 设备本地推理 / 极低内存占用(约 6 GB)

短板高精度文本生成

Q4 ~14GB / FP16 ~50GB · Apache 2.0 · 未知 · mlx需自查

证据283 下载

← 前一日 2026-07-20 · 后一日 不可用 (已是最新)