模型 / Qwen3.6-27B-Uncensored (AEON-7/mradermacher)

Qwen3.6-27B-Uncensored (AEON-7/mradermacher)

27B 无审查多模态混合模型,本地创作者使用

作者 mradermacher

仓库标识mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF

~57GB BF16许可 可商用任务 智能体最近核对 2026-08-05
格式
BF16
文件
~49GB
运行内存
~57GB–74GB
运行时
LLAMA-SERVER
下载
31,281

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可用Ollama直接运行,下载量超3万,适合本地部署未经审查的多模态对话模型,要求显存约10-28GB。
对位
对位 Gemma 2 27B
适合
无审查对话与角色扮演 / 多模态图像与文档理解
不适合
需要内容过滤的生产环境

独立证据与社区反馈

8 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

Qwen3.6-27B 被广泛视为当前 27B 级别最强的稠密模型,社区口碑与基准分数均显著优于同期的 Gemma 4 31B,在本地编码场景中已成为首选。其 DFlash/NVFP4 变体在 DGX Spark/Blackwell 上带来约 4–5 倍解码速度提升,同时保持多模态与工具调用能力,整体能力定位接近 2025 年中期的前沿模型水平。

  • 提供非 MoE 的稠密 27B 选项,在需要稠密推理且显存充裕的场景下优于 35B-A3B 的 MoE 变体
  • 实现完全无审查(unceinsored),有害提示拒绝率从基座模型的 99% 降至 0%
  • DFlash 投机解码带来相对于原始 vLLM 基线约 4–5 倍解码加速,且保持短上下文下质量不变
  • 在双 4090 消费级 GPU 上可达约 40 tok/s 的 IQ3_M GGUF 推理速度,部署门槛较低
  • NVFP4 硬件量化仅 26 GB,适配 DGX Spark/Blackwell,速度约为 BF16 的 2 倍且 KL 散度仅 0.000492
  • 单次提示即可完成 Node 包创建等实际编码任务,一次性成功
  • 保留多模态输入、推理解析与 OpenAI 兼容工具调用,可作为完整 Agent 后端
  • Artificial Analysis 综合评分 37,定位约等于 2025 年中期的 GPT-5/Claude Sonnet 4.5 层级
  • 双 4090 在 32K 上下文长度下提示处理速度约 4,200 tok/s,处理长上下文效率高
  • 在 c=64 并发下可稳定运行不崩溃,适合高并发部署
  • 部分用户反馈 AEON abliteration 变体失败率偏高,不如 prismascout 的量化质量
  • GGUF 格式无法在 vLLM 中使用,对生态兼容性构成限制
  • 在 DGX Spark 上运行 MTP 或在专用 VRAM 上运行 DFlash 均为实测损失,不应混用
  • n=12 投机令牌在 DGX Spark 上与 CUDA device-side assert 崩溃相关,建议 n=10
  • 质量与速度的权衡高度依赖具体工作负载,同一模型在不同任务上表现差异显著
  • 4090 上 TG512 生码速度仅约 45.81 tok/s,生成速度在部分场景下仍显不足
  • 35B-A3B 的 NVFP4 量化在 Agent 工作流中已知损坏,选型时需避开

可信度基于 Qwen3.6-27B 去审查版,量化下载 3.1 万,提供多种位宽

完整规格

规模
27B · 下载 ~49GB · 显存最低 ~57GB · 推荐 ~74GB · BF16(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
工具调用
OpenAI-compatible
血统
量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.1k → 1.1k

观测时间线

模型家族

查看全部家族 →