模型 / Ornith-1.0-9B (DeepReinforce)

Ornith-1.0-9B (DeepReinforce)

Ornith-9B MTP GGUF:llama.cpp推测解码加速

作者
deepreinforce-ai
对位
Qwen3.5-9B 基座, 对位 Llama-3-8B
适合
无需额外草稿模型的推测解码 / 低VRAM场景的批量生成吞吐优化
不适合
要求bitwise一致输出的评测
入选理由
今天能用llama.cpp直接运行,自带多token预测加速,适合需要本地快速推理9B模型的开发者;注意需要llama.cpp b9616+和至少5GB显存。
规模
9B · 256k · 最低 ~5.4GB · 4-bit(估算)
授权
MIT · 需自查
框架
llama.cpp
工具调用
OpenAI-style (Qwen3 XML)
血统
量化自 Ornith-1.0-9B
国内访问
需代理
可信度
RTX A6000 单卡 1.4-1.7x 解码加速,接受率 0.766 与 vLLM 一致,1.4 万次下载

仅 safetensors · 无 pickle 加载风险

社区实测

9B模型便于本地部署且基准成绩亮眼,但实际编码任务中表现不佳,无工具环境下幻觉严重

  • 可在本地或边缘设备上部署
  • 在SWE-Bench Verified上得分69.4,超过部分更大模型
  • 实际编码任务中表现不佳,仅发现几乎所有模型都能发现的bug
  • 无工具环境的对话中幻觉严重
  • 会幻觉工具调用及其输出

截至 2026-07-08

本形态 ~5.4GB 4-bit · 国内 需代理 · 218 下载

仅 safetensors · 无 pickle 加载风险

快速上手

llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF -c 262144

本形态源 ↗

下载动量

30天下载 528.8k → 962.4k

观测时间线