SummFlow 2026-06-26 Hugging Face

Qwen3.6-27B-AEON-Uncensored (AEON-7)

无审查的27B视觉语言模型,用于多模态对话与图像理解

入选理由
GGUF 格式可直接用 Ollama/llama.cpp 加载,5 分钟内可本地运行;但仅为量化重打包,无新能力,且缺乏第三方评测或社区复现案例。
对位
对位 Qwen2.5-32B
适合
多模态无审查对话 / 图像描述与视觉问答
不适合
需要安全过滤的生产环境
规模
27B · 未知
授权
apache-2.0 · 需自查
框架
llama.cpp / ollama / vllm
血统
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
可信度
下载量7462,提供imatrix加权量化,量化文件覆盖IQ1~Q6

社区实测

AEON-Ultimate 是 Qwen3.6-27B 社区公认的顶级无审查变体,公开基准测试显示其超越原始基础模型,编程输出质量获实战验证,覆盖从 M1 Mac 到 Blackwell 的广泛硬件,DGX Spark 上通过 DFlash 可获得数倍于原生 vLLM 的解码速度。

  • 0/100 拒绝率,完全无审查(KL 散度仅 0.000492,几乎无损)
  • 公开基准测试超越原始 Qwen3.6-27B 基础模型
  • RTX PRO 6000 Blackwell 上 NVFP4 + DFlash 可达约 140 tok/s
  • 多模态(视觉)能力在消融后完整保留
  • MTP 投机解码保留,P0 接受率约 90%,平均接受长度 3.3/3
  • 支持 262k 上下文长度
  • DGX Spark 上 DFlash 投机解码可达原生 vLLM 的 5.3 倍解码速度
  • DGX Spark 上可稳定扩展至 64 并发请求不崩溃
  • DGX Spark 容器为 ARM64 + sm_121a 专用构建,不可移植到其他硬件
  • BF16 全精度权重需 52 GB 显存,消费级单卡难以承载
  • 作为 CLI 编程 agent(opencode)需较多调校,开箱体验不如 Claude Code
  • M1 Mac(8 核/16GB)2bit 量化下生成速度仅约 5.9 tok/s
  • DGX Spark 单流推理约 30–36 tok/s,远低于高端 Blackwell 的表现

截至 2026-06-28

快速上手

ollama run hf.co/mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF:Q4_K_M