模型 / Inkling-Small-GGUF (Unsloth)

Inkling-Small-GGUF (Unsloth)

多模态文本/图像/音频输入,GGUF 量化,适合本地运行。

作者 unsloth

仓库标识unsloth/Inkling-Small-GGUF

~7.2GB 4-bit许可 可商用任务 视觉理解最近核对 2026-08-05
格式
4-bit
文件
~6.3GB
运行内存
~7.2GB–9.4GB
运行时
OLLAMA
下载
17,355

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/unsloth/Inkling-Small-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Inkling-Small 的 GGUF 量化版,可用 Ollama/llama.cpp 本地运行;原生图文音频多模态,12B 激活适合多模态 Agent,适合本地部署。
对位
对位 Qwen3.5-A17B (激活17B)
适合
多模态对话与工具调用 / 代码生成与 agent 任务
不适合
实时流式音频生成

独立证据与社区反馈

2 个独立来源最近验证 2026-08-05

1M 上下文 + 12B 激活参数的设计具有吸引力,但 276B 总参数的内存门槛是实际部署的主要制约

  • 1M 上下文且仅 12B 激活参数,可结合 GGUF 和 CPU offload 在本地运行
  • 276B 总参数使权重内存成为家庭实验室的实际瓶颈
  • 需使用 add-inkling 分支的 llama.cpp 才能加载 Unsloth 量化版,mainline 无法直接加载
  • 有社区用户对 Unsloth 的量化模型(如 GLM-4.6、Step-Flash)表示失望

可信度Hugging Face 下载量 17k+,由 Unsloth 量化发布。

完整规格

规模
12B (激活, 276B 总) · 下载 ~6.3GB · 显存最低 ~7.2GB · 推荐 ~9.4GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
vllm / sglang / ollama / llama.cpp
血统
量化自 Inkling-Small
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 885.5k → 1226.9k · likes +9

观测时间线