模型 / Cosmos3-Super-Text2Image (nvidia)

Cosmos3-Super-Text2Image (nvidia)

文本生成高保真图像,面向物理AI与创作

作者
nvidia
对位
开源替代Flux、SD3等文生图模型
适合
物理世界场景生成 / 文本到高保真图像创作
不适合
安全关键任务与精确物理模拟
入选理由
完备的推理接口(vLLM-Omni、Diffusers)可快速上手。
规模
64B · 4k tokens (文本输入) · 最低 ~39GB · 4-bit(估算)
授权
OpenMDW1.1 · 需自查
框架
vLLM-Omni / Diffusers / PyTorch
国内访问
需代理
可信度
NVIDIA发布,64B参数,支持vLLM-Omni/Diffusers,经GB200/H100推理验证

社区实测

社区普遍认可其为当前最强开源图文/视频生成模型,但指出其定位是物理AI世界模型而非消费级图像生成工具。

  • 在 Artificial Analysis 排行榜上取得开源图文生成模型排名第一
  • 在 Artificial Analysis 排行榜上取得开源图生视频模型排名第一
  • 提供 SOTA 级别的开源图像与视频生成能力
  • 模型定位为机器人与自动驾驶AI训练的世界模型,非消费级图像生成产品,与 Seedance 等消费级产品不构成直接竞争

截至 2026-07-19

本形态 ~39GB 4-bit · 国内 需代理 · 139 下载

快速上手

vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni)

本形态源 ↗

下载动量

30天下载 28k → 27k · likes +22

观测时间线