面向电话语音代理的 30B-A3B 微调模型
适合英语电话语音代理 / 多轮工具调用客服
短板非英语或需长思考的通用推理
Q4 ~21GB / FP16 ~76GB · BSD-2-Clause(含 NVIDIA Nemotron Open Model License) · 262k · vllm需自查
证据2668 下载 / 127 赞
面向电话语音代理的 30B-A3B 微调模型
适合英语电话语音代理 / 多轮工具调用客服
短板非英语或需长思考的通用推理
Q4 ~21GB / FP16 ~76GB · BSD-2-Clause(含 NVIDIA Nemotron Open Model License) · 262k · vllm需自查
证据2668 下载 / 127 赞
面向 RAG 路由的查询重写小模型
适合RAG 路由前查询重写 / 多语言请求拆分与澄清
短板直接回答或执行用户指令
Q4 ~0.2GB / FP16 ~0.6GB · Gemma · 2048 · llama.cpp需自查
证据589 下载
为 GLM-5.3-Flash 推理加速的 DFlash2 草稿模型
适合GLM-5.3-Flash 投机解码加速 / 提高 GLM-5.3-Flash 生成吞吐
短板独立文本生成
Q4 ~0.8GB / FP16 ~2.8GB · CC BY-NC-ND 4.0 · 未知 · sglang需自查
证据3253 下载 / 81 赞
Qwen3.8 Flash 的 GGUF 量化,面向本地推理
适合GGUF 量化本地推理 / 低显存/边缘设备部署
短板需要原始权重微调或高精度推理
Q4 ~2.5GB / FP16 ~9.1GB · other · 未知 · llama.cpp需自查
证据1047 下载
Qwen3.8 GGUF,本地图像文本推理
适合本地图像文本对话 / 低资源设备的 GGUF 推理
短板高风险合规或商用授权场景
Q4 ~2.5GB / FP16 ~9.1GB · unknown · 未知 · llama.cpp需自查
证据20.3k 下载 / 85 赞
文本生成同步音视频,4步推理
适合文本生成同步音视频 / 4步推理的少步生成
短板FL2VA/Ref2VA 未蒸馏
Q4 ~23GB / FP16 ~84GB · MiniMax H3 Community License · 未知 · fastvideo需自查
证据93 赞
IBM 30B MLX 6bit 量化,Mac 用
适合Apple 芯片 Mac 本地推理 / 工具调用 / 推理文本生成
短板非 Apple Silicon 环境
Q4 ~20GB / FP16 ~72GB · apache-2.0 · 未知 · mlx需自查
证据166 下载
3B开源文本生成模型,面向Apple Silicon本地推理与工具调用
适合Apple Silicon 本地文本生成 / 思维链推理与工具调用
短板非 Apple Silicon 平台
Q4 ~2GB / FP16 ~7.2GB · Apache-2.0 · 未知 · mlx需自查
证据150 下载
IBM Granite 3B MLX 量化,苹果芯片推理
适合苹果芯片本地 3B 推理 / 多语言推理与工具调用原型
短板需要高精度、长上下文的生产任务
Q4 ~0.7GB / FP16 ~2.5GB · apache-2.0 · 未知 · mlx_lm需自查
证据196 下载
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索