9B 推理模型 GGUF,供本地编码与代理使用
适合OpenAI 兼容本地推理服务 / 终端编码代理后端
短板移动端低内存部署
Q4 ~5.9GB / FP16 ~22GB · MIT · 262k · llama.cpp需自查
证据54.9k 下载 / 107 赞
9B 推理模型 GGUF,供本地编码与代理使用
适合OpenAI 兼容本地推理服务 / 终端编码代理后端
短板移动端低内存部署
Q4 ~5.9GB / FP16 ~22GB · MIT · 262k · llama.cpp需自查
证据54.9k 下载 / 107 赞
8B-A1B 投机解码草稿侧车,配 llama.cpp 加速
适合llama.cpp 本地加速推理 / 目标模型 DSpark 投机解码
短板单独作为主模型部署
Q4 ~5.3GB / FP16 ~19GB · other (lfm1.0) · 未知 · llama.cpp需自查
证据16 赞
无审查 Qwen3.8-27B,供红队与对齐研究
适合红队与 AI 安全评估 / 本地无审查内容生成
短板需安全过滤的生产环境
Q4 ~18GB / FP16 ~67GB · Apache-2.0 · 未知 · transformers需自查
证据4415 下载 / 246 赞
35B MoE 激活3B GGUF,本地编码与工具调用
适合Agentic 编码与工具调用 / 长上下文仓库级代码任务
短板低显存环境或非代码任务
Q4 ~23GB / FP16 ~84GB · MIT · 262k · ollama需自查
证据53.7k 下载 / 158 赞
9B 稠密推理模型,单卡部署与终端编程
适合单卡 vLLM/SGLang 部署 / 终端编码与工具调用
短板简单问答 / 低延迟场景
Q4 ~6.2GB / FP16 ~23GB · MIT · 262k(YaRN 可扩展至约 1M) · transformers需自查
证据1324 下载 / 124 赞
Mac 用 Qwen3.6-27B MLX 量化,低冗余输出
适合Apple Silicon 本地长上下文推理 / Token 预算受限的 agent 任务
短板32GB 及以下内存的长上下文运行
Q4 ~18GB / FP16 ~65GB · Apache-2.0 · 256k · mlx需自查
证据1275 下载 / 7 赞
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索