SummFlow 2026-06-20 Hugging Face

DeepSeek-V4-Flash

284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。

对位
对标同等量级的前沿开源大模型(如 Qwen 系、Llama 系),以更低的激活参数量实现有竞争力的推理、代码与智能体能力。
适合
超长上下文理解与分析(百万 Token 级),如全库代码审查、长文档深度问答 / 复杂编程、数学竞赛题解与多步推理任务
不适合
本地个人设备部署(模型庞大,需专业多卡集群)及低延迟实时对话等高吞吐轻量场景
规模
158.1B · 未公开 · Q4 ~104GB / FP16 ~379GB
授权
mit · 可商用
可信度
DeepSeek 最新旗舰系列的开源轻量版,MIT 协议开放权重,完整技术报告可查,在百万 Token 长上下文、编码及高难度推理中表现扎实。

仅 safetensors · 无 pickle 加载风险

社区实测

DeepSeek V4 Flash 以极低价格提供了接近前沿模型的编程能力与极快响应速度,被社区视为日常开发的高性价比首选,但复杂推理和长上下文任务仍需 Pro 或多次返工补位。

  • API 调用成本极低,重度使用一天不到 1 美元,有用户 4 小时密集子代理循环仅花 5 美分
  • 输出 token 价格约为 Claude Opus 4.7 的 1/89、Kimi K2.6 的 1/14,跑三四次仍比一次 Kimi K2.6 便宜
  • 生成速度极快,社区实测 100–150 TPS,迭代反馈体感流畅
  • 在多工具调用和复杂原生工具定义场景下不会混淆,是少数能做到这一点的开放权重模型
  • 284B MoE(13B 激活参数)、MIT 许可证,开放权重可商用,可在 M3 Ultra 512GB 上本地运行
  • 在 20 项真实任务测试中以 $0.04/M 输入 token 的成本赢了 7 项,日常任务足够胜任
  • 支持 1M token 上下文窗口
  • 开启 max thinking 后编程表现可超越 Kimi K2.6
  • 思考/规划阶段耗时较长,可能等待数分钟才开始执行
  • 有时会忽略用户给出的具体指令
  • 一次生成往往不够,需要多轮 review/refactor 才能达到满意结果
  • 存在 expired-lease 完成 bug:原 worker 已释放租约但仍可能继续完成步骤
  • 长上下文检索任务(800K token 仓库中定位函数调用图)表现明显弱于 Pro-Max(1/3 vs 3/3)
  • 复杂推理、长链条调试和分析型任务不如 V4 Pro 稳定
  • 在扩展思考(extended thinking)和真实场景中,Qwen 3.6 Plus、Minimax M2.7、GLM 5.1 等国产模型表现更优
  • 部分场景下 token 生成速度偏慢

截至 2026-06-22