从 Qwen3.8-27B 切割的 MoE,24GB 本地对话/代码
适合本地 24GB 量化的对话与代码生成 / 复现 router healing 与 MoE 压缩研究
短板SQL/HTML/表格结构化输出
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 8k · llama.cpp需自查
证据13.8k 下载 / 89 赞
从 Qwen3.8-27B 切割的 MoE,24GB 本地对话/代码
适合本地 24GB 量化的对话与代码生成 / 复现 router healing 与 MoE 压缩研究
短板SQL/HTML/表格结构化输出
Q4 ~18GB / FP16 ~65GB · apache-2.0 · 8k · llama.cpp需自查
证据13.8k 下载 / 89 赞
中英文实时TTS,支持语音克隆/设计/定向
适合实时语音交互与流式合成 / 中英文语音克隆与声音设计
短板商业用途需额外授权
Q4 ~2.3GB / FP16 ~8.3GB · 研究/非商业许可;代码 Apache-2.0 · 未知 · pytorch需自查
证据51 下载 / 95 赞
MiniMax-H3 8步加速 LoRA,面向视频生成
适合MiniMax-H3 文生视频少步加速 / Ref2VA 参考视频生成加速
短板无 MiniMax-H3 基座时独立推理
未公开 · apache-2.0 · 不适用 · diffusers需自查
证据75 赞
IBM Granite 4.2 30B GGUF 量化版,本地推理
适合本地 30B 级对话与文本生成 / GGUF 量化格式离线部署
短板高并发生产服务
Q4 ~20GB / FP16 ~72GB · Apache-2.0 · 未知 · llama.cpp需自查
证据167 下载 / 2 赞
IBM 3B GGUF 量化,本地推理
适合本地 llama.cpp 推理 / 低显存设备部署
短板高精度复杂推理
Q4 ~2GB / FP16 ~7.2GB · Apache-2.0 · 未知 · llama.cpp需自查
证据143 下载
Granite 8B GGUF 量化版,本地推理
适合本地 GGUF 量化推理 / 通用文本生成与对话
短板多模态输入与超大上下文任务
Q4 ~5.3GB / FP16 ~19GB · Apache-2.0 · 未知 · llama.cpp需自查
证据151 下载
Granite 4.2 8B MLX 量化版,Mac 本地跑
适合Mac 本地文本生成 / 多语言工具调用
短板非 Apple Silicon 环境
Q4 ~1.6GB / FP16 ~5.9GB · apache-2.0 · 未知 · mlx_lm需自查
证据102 下载
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索