模型 / 归档 / 2026-07-02

本期 (5)

30B (3B 激活)

双塔扩散LLM,块并行解码,2.42x生成吞吐量

适合大规模批量文本生成 / 作为基座模型微调

短板低延迟对话或指令跟随

30B (3B 激活) · NVIDIA Nemotron Open Model License · 128k · transformers需自查

证据7628 下载 / 79 赞 / 2 个社区来源

26B-A4B

无审查Gemma4-26B MoE,适用于代理编码与创意写作

适合代理编码与工具调用 / 多模态角色扮演/故事创作

短板需要严格内容过滤的生产环境

26B-A4B · gemma · 256k · llama.cpp需自查

证据35.2k 下载 / 54 赞 / 11 个社区来源

9B

未审查 1M 上下文 Qwen3.5 微调,支持工具调用

适合长上下文角色扮演创作 / 工具调用与代理任务

短板需内容审查的生产场景

9B · apache-2.0 · 1M · llama.cpp需自查

证据37.9k 下载 / 55 赞 / 3 个社区来源

未公开

移除安全过滤的GLM-5.2 GGUF,供研究实验用

适合无审查的文本生成和调试 / 安全对抗性研究与测试

短板生产部署或面向未成年用户

未公开 · MIT · 未知 · llama.cpp需自查

证据901 下载 / 115 赞

27B

Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理

  • 已量化

适合AI Agent 与工具调用 / 聊天机器人与 RAG 系统

短板不适用于安全敏感应用

27B · Apache-2.0 · 262k · vllm需自查

证据2671 下载 / 168 赞 / 11 个社区来源

← 前一日 2026-07-01 · 后一日 2026-07-03 →