模型 / Unlimited-OCR (Baidu)

Unlimited-OCR (Baidu)

3B 视觉语言 OCR 模型,文档解析与 Markdown 转换

作者
sahilchachra
对位
对位 DeepSeek-OCR 3B / GOT-OCR2.0
适合
文档 OCR 转 Markdown(带布局/框) / 多语言长文档解析
不适合
通用视觉对话或复杂推理
入选理由
百度Unlimited-OCR的GGUF量化版,多语言文档OCR可本地运行,支持Markdown和边界框输出。需编译特定llama.cpp分支。
规模
3B · 最低 ~1.8GB · 4-bit(估算)
授权
MIT · 需自查
框架
llama.cpp
血统
量化自 Unlimited-OCR
国内访问
需代理
可信度
HuggingFace 28k 下载,50 赞,基于 Baidu/Unlimited-OCR 量化

社区实测

社区对 Unlimited-OCR 持观望期待态度,认为对本地 AI 场景有潜力,但实际落地反馈尚少

  • 开源的 3B MoE 模型,仅 500M 活跃参数,适合本地部署
  • 基于 DeepSeek OCR 构建,替换了 decoder 注意力层
  • 支持一次性长文本解析(one-shot long-horizon parsing)
  • 有做图像 OCR 的开发者表示这正是其常见工作流
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议
  • 对长对话场景的适用性尚不明确
  • HN 讨论量有限,缺乏大规模实际使用反馈

截至 2026-07-12

本形态 ~1.8GB 4-bit · 国内 需代理 · 28,228 下载

本形态源 ↗

下载动量

30天下载 66.4k → 69.8k

观测时间线