此页是 2026-06-30 的观测快照,查看该模型当前信息 → /m/sahilchachra__unlimited-ocr-gguf/

归档 / 2026-06-30 / Unlimited-OCR (Baidu)

Unlimited-OCR (Baidu)

3B 视觉语言 OCR 模型,文档解析与 Markdown 转换

入选理由
百度Unlimited-OCR的GGUF量化版,多语言文档OCR可本地运行,支持Markdown和边界框输出。需编译特定llama.cpp分支。
对位
对位 DeepSeek-OCR 3B / GOT-OCR2.0
适合
文档 OCR 转 Markdown(带布局/框) / 多语言长文档解析
不适合
通用视觉对话或复杂推理
规模
3B · 未知
授权
MIT · 需自查
框架
llama.cpp
血统
量化自 Unlimited-OCR
可信度
HuggingFace 28k 下载,50 赞,基于 Baidu/Unlimited-OCR 量化

社区实测

社区对 Unlimited-OCR 持观望期待态度,认为对本地 AI 场景有潜力,但实际落地反馈尚少

  • 开源的 3B MoE 模型,仅 500M 活跃参数,适合本地部署
  • 基于 DeepSeek OCR 构建,替换了 decoder 注意力层
  • 支持一次性长文本解析(one-shot long-horizon parsing)
  • 有做图像 OCR 的开发者表示这正是其常见工作流
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议
  • 对长对话场景的适用性尚不明确
  • HN 讨论量有限,缺乏大规模实际使用反馈

截至 2026-07-12

评分详情

Q1
今天能接上用吗   4 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
8

HuggingFace 原始数据 (抓取于 2026-06-30)

作者
sahilchachra
任务类型
image-text-to-text
推理库
gguf
下载
28,228
点赞
50
许可证
MIT
标签
gguf, llama.cpp, deepseek-ocr, ocr, vision-language, multimodal, image-text-to-text, quantized, imatrix, document-parsing, multilingual, base_model:baidu/Unlimited-OCR, base_model:quantized:baidu/Unlimited-OCR, license:mit, endpoints_compatible, region:us, conversational

探索

源链接