模型 / Lens (Microsoft)

Lens (Microsoft)

3.8B文本生成图像基础模型,高效训练与高分辨率生成

作者
microsoft
对位
以3.8B参数量竞争更大T2I模型(如FLUX)
适合
高分辨率(1440×1440)图像生成 / 密集描述与多语言提示跟随
不适合
生产环境与商业产品部署
入选理由
有完整推理代码和论文。
规模
3.8B · 最低 ~2.3GB · 4-bit(估算)
授权
MIT · 可商用
框架
diffusers / transformers / pytorch
国内访问
需代理
可信度
GitHub仓库开源,论文arXiv 2605.21573,MIT许可证

社区实测

一款3.8B参数的开源文本生图模型,MIT许可证,在消费级硬件上能以极低显存(GGUF约2GB起)快速运行,生成质量被认为不输2-3倍参数量的模型,社区实测认为它在同类小型模型中表现出色,但在人体解剖和冷门题材上仍有明显短板。

  • 低显存部署:GGUF量化版约2GB,FP8仅5.56GB,消费级显卡可流畅运行
  • 生成速度快:Turbo变体4-8步即可出图,适合本地实时使用
  • 开源MIT许可,无需付费订阅即可商用
  • 生成质量在小型模型中突出,被认为可与6B以上大模型竞争
  • 训练效率高:训练计算量仅为Z-Image的约19.3%,LoRA训练更快
  • 支持最高1440×1440分辨率输出
  • ComfyUI完整工作流支持,社区已有详细配置教程
  • 人体解剖结构渲染不够稳定,手部/姿态容易出错
  • 冷门/小众题材生成质量下降明显
  • 需使用ComfyUI nightly版本,稳定版(≤0.22.0)不兼容

截至 2026-07-05

本形态 ~2.3GB 4-bit · 国内 需代理 · 296 下载

快速上手

git clone https://github.com/microsoft/Lens && python inference.py

本形态源 ↗

下载动量

观测时间线