模型 / Qwen3.5-9B-Defiant-Fable (DavidAU)

Qwen3.5-9B-Defiant-Fable (DavidAU)

无审查9B多模态模型,提升推理与指令跟随

作者 DavidAU

仓库标识DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

~5.4GB 4-bit许可 需自查任务 视觉理解最近核对 2026-08-05
格式
4-bit
文件
~4.7GB
运行内存
~5.4GB–7GB
运行时
LLAMA-SERVER
下载
41,268

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
直接可用的 GGUF 版 Qwen3.5 微调模型,去审查适合角色创作,单卡可跑。
对位
对位 Qwen3.5-9B-Instruct / Llama-3-8B
适合
推理与复杂指令任务 / 创意写作与角色扮演
不适合
需要内容过滤的安全场景

独立证据与社区反馈

10 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Qwen3.5-9B在9B级模型中性能突出,能在12-16GB VRAM消费级硬件上流畅运行,agentic coding场景表现惊喜,但代码生成有幻觉问题、推理链偶尔失控,是日常小任务和实验的实用选择而非生产级替代品。

  • 9B参数即可在12-16GB VRAM硬件上运行,部署门槛低
  • 在ARC-C等7项基准测试上超越同尺寸9B乃至27B模型
  • 4-bit和8-bit量化下均保持640+ ARC-C分数
  • agentic coding/工具调用场景表现出色,支持长时间无人值守agent运行
  • 速度够快,响应'snappy',适合日常小任务
  • 0/465拒绝率,uncensored无审查
  • 9B推理成本远低于27B($0.14 vs $0.51/百万token)
  • 使用MTP量化可在RTX 5090上超过90 tokens/s
  • 代码生成幻觉严重,会编造不存在的API
  • 推理链偶尔失控,思维token出现不可控状态
  • 在agentic coding方面仍落后于Claude
  • MTP量化需温度<1且关闭重复惩罚,否则性能下降
  • 长时间运行可能感觉慢且不稳定
  • DavidAU过往模型口碑参差,部分用户对其持保留态度
  • 基准测试分数与实际表现存在差距,不可全信榜单

可信度下载量41k,点赞58,模型卡列详细基准

完整规格

规模
9B · 256k · 下载 ~4.7GB · 显存最低 ~5.4GB · 推荐 ~7GB · 4-bit(估算)
授权
Apache 2.0 · 需自查
框架
llama.cpp / ollama
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 778.2k → 872.9k · likes +259

观测时间线