3B活跃参数的通用Agent,自动研究/编程/推理
适合自动化机器学习与代码迭代 / 复杂推理与工具调用Agent
短板低延迟简单闲聊
35B (3B激活) · Apache-2.0 · 131k · transformers需自查
证据1243 下载 / 54 赞
3B活跃参数的通用Agent,自动研究/编程/推理
适合自动化机器学习与代码迭代 / 复杂推理与工具调用Agent
短板低延迟简单闲聊
35B (3B激活) · Apache-2.0 · 131k · transformers需自查
证据1243 下载 / 54 赞
本地离线编码与工具使用Agent,仅需4.5GB显存即可运行
适合终端命令执行与调试 / 代码编写与多步工具调用
短板通用客服或百科问答
12B · Apache-2.0 · 16k(示例命令) · llama.cpp需自查
证据93 赞 / 4 个社区来源
超小型英文TTS,总4.63M参数,适合本地/嵌入式实验
适合本地嵌入式TTS实验与演示 / 离线助手原型及效率研究
短板生产叙述与高保真音频生成
4.63M · Apache-2.0 · 未知 · pytorch需自查
证据121 赞 / 3 个社区来源
混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成
适合8GB显存本地代码生成 / 混合量化高效率推理
短板需全精度BF16或16GB+显存场景
12B · Apache-2.0 · 未知 · llama.cpp需自查
证据1420 下载 / 1 赞 / 9 个社区来源
原生多模态 1M 上下文 MoE 模型,融合图文与视频理解,擅长编程及智能体协作
适合多模态长文档理解与跨图像、视频推理 / 复杂编程、工具调用与多步智能体任务
短板本地部署(显存需求极高,普通硬件无法运行),以及低延迟的简单分类或闲聊场景
Q4 ~282GB / FP16 ~1025GB · other · 未公开需自查
证据13 个社区来源
284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。
适合超长上下文理解与分析(百万 Token 级),如全库代码审查、长文档深度问答 / 复杂编程、数学竞赛题解与多步推理任务
短板本地个人设备部署(模型庞大,需专业多卡集群)及低延迟实时对话等高吞吐轻量场景
Q4 ~104GB / FP16 ~379GB · mit · 未公开可商用
证据11 个社区来源
1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。
适合高难度推理、编程与数学竞赛级任务 / 百万 token 超长文档分析与大规模代码库理解
短板本地部署(需专业级多卡服务器);简单闲聊或对延迟极敏感的应用。
Q4 ~569GB / FP16 ~2068GB · mit · 未公开可商用
证据11 个社区来源
万亿参数 MoE 编码智能体,长周期复杂任务更省 token、工具调用更强
适合复杂长周期软件工程任务(多语言、全栈、基础设施等) / 需要工具调用/代码智能体的生产环境(如 MCP 工具链、自动化 Coworking)
短板不适合本地部署(1T 参数,仅限云端推理),也不适合纯粹的休闲闲聊等非工具性任务
Q4 ~699GB / FP16 ~2541GB · other · 未公开需自查
证据10 个社区来源
面向真实生产力场景的智能体模型,统一推理、工具调用与执行闭环
适合复杂智能体工作流:编程、长程任务执行、工具调用与环境反馈闭环 / 深度研究、多步搜索与高难度推理评测
短板本地单卡部署(模型巨大,需多节点高端 GPU 集群)与低延迟轻量对话
Q4 ~262GB / FP16 ~952GB · apache-2.0 · 未公开可商用
证据12 个社区来源
云端旗舰,225B 参数稀疏 MoE,专为智能体编程和长周期任务设计
适合复杂多步智能体编程与软件工程流水线 / 需要长上下文推理的代码生成、调试与修复
短板本地单机或个人设备部署(需超大规模 GPU 集群),不适合闲聊、简单问答等轻量任务
Q4 ~149GB / FP16 ~542GB · apache-2.0 · 未公开可商用
证据9 个社区来源
智谱最新旗舰,原生百万上下文,长程任务大幅跃升,MIT 纯开源。
适合大规模长程编程与软件工程(如 SWE-bench Pro) / 复杂智能体与工具调用任务(如 MCP-Atlas)
短板本地消费级硬件部署(模型极大,需高配服务器或 NPU 集群)。
Q4 ~497GB / FP16 ~1808GB · mit · 未公开可商用
证据10 个社区来源
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索