指南 / 图像生成模型

图像生成模型

共 21 个 · 数据更新于 2026-07-13

本地图像生成入门(2026-07)

18 个本地可跑的开源文生图模型,显存数据大多缺失,先看 intro 再看表。

阅读完整指南 →

模型参数量显存门槛上下文许可证商用语言国内可达部署
M87 (mgwr)
LoRA · 基于 Krea-2-Turbo
apache-2.0需自查需代理python -c "from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('krea/Krea-2-Turbo'); pipe.load_lora_weights('mgwr/M87'); pipe('a cat --preview').images[0].save('out.png')"
Krea2 Turbo Style Reference LoRA (Krea)
LoRA · 基于 Krea-2-Turbo
不适用krea-2-community-license需自查需代理pipe = DiffusionPipeline.from_pretrained("krea/Krea-2-Turbo", custom_pipeline="ostris/Krea2OstrisEdit", torch_dtype=torch.bfloat16); pipe.enable_model_cpu_offload(); pipe.load_lora_weights("ostris/krea2_turbo_style_reference")
Krea-2 Depth ControlNet (Patil)
LoRA · 基于 Krea-2-Raw
862MB LoRAkrea-2-community-license需自查需代理git clone https://github.com/Tanmaypatil123/Krea-2-controlnet && cd Krea-2-controlnet && pip install -q -r requirements.txt && hf download Patil/Krea-2-depth-controlnet depth-control-lora.safetensors --local-dir . && python inference.py input.jpg -p "prompt" --lora depth-control-lora.safetensors
Sun-Direction LoRA (eric-venti-seeds)
LoRA · 基于 FLUX.2-klein-9B
9B不适用Apache-2.0需自查需代理
Krea-2-Turbo (Krea)
量化自 Krea-2-Turbo
原生 · GGUF
12BKrea-2-Community-License需自查需代理sglang generate --model-path krea/Krea-2-Turbo --prompt "a red fox sitting in fresh snow, golden hour, photorealistic" --num-inference-steps 8 --height 1024 --width 1024 --save-output 等 2 种
Krea2-FP8 (KREA) krea-2-license需自查需代理huggingface-cli download AlperKTS/Krea2_FP8 --local-dir ./krea2_fp8
Krea-2-Raw (Krea) 12Bkrea-2-community-license需自查需代理pip install git+https://github.com/sgl-project/sglang.git && sglang generate --model-path krea/Krea-2-Raw --prompt "a fox in the snow" --num-inference-steps 52 --height 1024 --width 1024 --guidance-scale 3.5 --save-output 等 2 种
ideogram_4_turbotime_lora (ostris)
LoRA · 基于 ideogram-4-fp8
未公开(LoRA)不适用ideogram-4-non-commercial需自查需代理from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('ideogram-ai/ideogram-4-fp8', dtype=torch.bfloat16, device_map='cuda'); pipe.load_lora_weights('ostris/ideogram_4_turbotime_lora') 等 2 种
Ideogram-4-NF4 (Ideogram) other需自查需代理python -c 'from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained("ideogram-ai/ideogram-4-nf4", torch_dtype=torch.bfloat16); pipe.to("cuda")' 等 2 种
ideogram-4-fp8 (ideogram-ai) other需自查需代理diffusers: from_pretrained('ideogram-ai/ideogram-4-fp8')
Cosmos3-Super-Text2Image (nvidia) 64BQ4 ~43GB / FP16 ~155GB4k tokens (文本输入)OpenMDW1.1需自查需代理vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni) 等 3 种
Bonsai Image Ternary 4B (Prism ML)
微调自 bonsai-image-ternary-4B-unpacked
4B不适用Apache-2.0可商用需代理Python API: from backend_gpu.server import build_pipeline; pipe = build_pipeline('prism-ml/bonsai-image-ternary-4B-gemlite-2bit') 等 2 种
Bonsai-Image-4B (Prism ML)
量化自 bonsai-image-ternary-4B-unpacked
4B不适用apache-2.0可商用需代理macOS: git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo && cd Bonsai-Image-Demo && ./setup.sh && ./scripts/download_model.sh && ./scripts/generate.sh
Bonsai-Image-Binary-4B (Prism ML)
量化自 bonsai-image-binary-4B-unpacked
4Bapache-2.0可商用需代理MLX Python: BONSAI_VARIANT=binary ./scripts/generate.sh --prompt "..."
FLUX.1-dev (BFL) 12B不适用非商业许可需自查需代理diffusers: FluxPipeline.from_pretrained('black-forest-labs/FLUX.1-dev')
PiD (NVIDIA)
微调自 PixelDiT-1300M-1024px
NVIDIA Internal SRDML (仅限研究)需自查需代理hf download nvidia/PiD --local-dir . --include 'checkpoints/*' 等 2 种
Lens (Microsoft) 3.8BMIT可商用需代理git clone https://github.com/microsoft/Lens && python inference.py 等 2 种
Lens-Turbo (Microsoft) 3.8BMIT可商用需代理CLI: git clone https://github.com/microsoft/Lens && python inference.py --repo_id microsoft/Lens-Turbo 等 2 种
AsymFLUX.2-klein-9B (Stanford)
微调自 FLUX.2-klein-base-9B
9Bflux-non-commercial-license需代理Python: pip install lakonlab 后用 PixelFlux2KleinPipeline 加载适配器
Juggernaut-Z-Image (RunDiffusion)
量化自 Z-Image
cc-by-nc-4.0不可商用需代理diffusers: from_pretrained('RunDiffusion/Juggernaut-Z-Image')
Z-Anime (SeeSee21)
量化自 Z-Image
4Bapache-2.0可商用需代理from diffusers import StableDiffusionPipeline; pipe = StableDiffusionPipeline.from_pretrained('SeeSee21/Z-Anime') 等 2 种

常见坑

  • 每条帖子垂直间距过大,在类似 Reddit 的站点上浏览效率低 —— mgwr/M87
  • Krea 2 Turbo 原生缺乏参考模式,保持角色或风格一致性必须依赖 LoRA 训练 —— ostris/krea2_turbo_style_reference
  • 原生模型有安全限制,需通过 prompt rebalancing 或 LoRA 才能解除 —— ostris/krea2_turbo_style_reference
  • 社区曾对其是否已发布/可用存在疑问 —— Patil/Krea-2-depth-controlnet
  • 仅针对室外场景训练,室内或非外景图像效果无法保证 —— eric-venti-seeds/Sun-Direction-Lora-Flux2Klein9B
  • 真实感/照片级渲染不如 Z-Image Turbo —— krea/Krea-2-Turbo
  • 复杂提示词下可靠性偏低 —— krea/Krea-2-Turbo
  • 团队承认模型未针对真实感调优,后续版本拟改善 —— krea/Krea-2-Turbo
展开其余 35 条
  • 超过 50 人团队需购买企业许可,非完全免费商用 —— krea/Krea-2-Raw
  • 所有用户必须实施技术安全措施以防止生成非法内容 —— krea/Krea-2-Raw
  • 并非传统意义上的开源,而是自定义许可证下的开放权重 —— krea/Krea-2-Raw
  • 降低步数存在画质取舍,证据中未完整描述具体损失 —— ostris/ideogram_4_turbotime_lora
  • NF4 量化版画质明显下降,尤其文字渲染变差 —— ideogram-ai/ideogram-4-nf4
  • 生成速度较慢 —— ideogram-ai/ideogram-4-nf4
  • 低 CFG 值(如 1)跑图效果不稳定 —— ideogram-ai/ideogram-4-nf4
  • JSON 格式提示词上手门槛高,自然语言效果不如结构化输入 —— ideogram-ai/ideogram-4-nf4
  • 下载模型需同意共享联系方式 —— ideogram-ai/ideogram-4-nf4
  • FP8 量化版本质量下降明显,尤其是文字渲染 —— ideogram-ai/ideogram-4-fp8
  • 自然语言提示效果不如 JSON 结构化提示 —— ideogram-ai/ideogram-4-fp8
  • 模型定位为机器人与自动驾驶AI训练的世界模型,非消费级图像生成产品,与 Seedance 等消费级产品不构成直接竞争 —— nvidia/Cosmos3-Super-Text2Image
  • 生成图像的准确度/质量明显不如全精度模型 —— prism-ml/bonsai-image-ternary-4B-gemlite-2bit
  • 文字生成结果差 —— prism-ml/bonsai-image-ternary-4B-mlx-2bit
  • 整体准确度不佳 —— prism-ml/bonsai-image-ternary-4B-mlx-2bit
  • 生成准确性不佳,输出质量不够理想 —— prism-ml/bonsai-image-binary-4B-mlx-1bit
  • FLUX.1-dev 使用非商业许可,不能用于商业用途或商业服务 —— black-forest-labs/FLUX.1-dev
  • 部分社区模型将 dev 与 Schnell 合并后以 Apache 等商业友好许可分发,存在法律风险 —— black-forest-labs/FLUX.1-dev
  • 生成速度比同系列的 Schnell 慢约 4 倍 —— black-forest-labs/FLUX.1-dev
  • 约需 20 步推理才能产出高质量图像,对低配硬件仍有算力压力 —— black-forest-labs/FLUX.1-dev
  • 社区 LoRA 与衍生模型(如 Krea-dev)的兼容性不保证,迁移需实测验证 —— black-forest-labs/FLUX.1-dev
  • 目前社区仅有 Python 脚本形式的简易封装,尚无 ComfyUI 工作流节点 —— nvidia/PiD
  • 人体解剖结构渲染不够稳定,手部/姿态容易出错 —— microsoft/Lens
  • 冷门/小众题材生成质量下降明显 —— microsoft/Lens
  • 需使用ComfyUI nightly版本,稳定版(≤0.22.0)不兼容 —— microsoft/Lens
  • 文本编码器体积达 20B,加载和推理开销较大 —— microsoft/Lens-Turbo
  • 不支持图像编辑/inpainting 等能力,功能较单一 —— microsoft/Lens-Turbo
  • 16GB 显存能否流畅运行存在疑问 —— microsoft/Lens-Turbo
  • 人物生成误差大,经常无法正确绘制人物 —— Lakonik/AsymFLUX.2-klein-9B
  • 提示跟随能力弱,生成错误多 —— Lakonik/AsymFLUX.2-klein-9B
  • 编辑时无法保持人物面部一致性,且会轻微改变整体光照和色彩 —— Lakonik/AsymFLUX.2-klein-9B
  • 采用 CC BY-NC 4.0 许可,不可商用 —— RunDiffusion/Juggernaut-Z-Image
  • 基于 Z-Image Base 微调,对上游基座模型有依赖 —— RunDiffusion/Juggernaut-Z-Image
  • 与 Anima 对比中被多位社区用户认为动漫风格差距明显 —— SeeSee21/Z-Anime
  • 使用 Stable Diffusion 风格提示词时可能出现效果不佳的问题 —— SeeSee21/Z-Anime

收藏本页,或 订阅 RSS 追踪每日更新。