此页是 2026-06-20 的观测快照,查看该模型当前信息 → /m/deepseek-ai__deepseek-v4-pro/

归档 / 2026-06-20 / DeepSeek-V4-Pro

DeepSeek-V4-Pro

1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。

对位
对标GPT-5.4、Gemini 3.1-Pro等高端闭源模型,提供高性价比的开源替代方案。
适合
高难度推理、编程与数学竞赛级任务 / 百万 token 超长文档分析与大规模代码库理解
不适合
本地部署(需专业级多卡服务器);简单闲聊或对延迟极敏感的应用。
规模
861.6B · 未公开 · Q4 ~569GB / FP16 ~2068GB
授权
mit · 可商用
可信度
DeepSeek迄今最强开源模型,多项知识与推理基准匹敌顶级闭源模型,长文本效率提升显著。

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为 DeepSeek V4 Pro 以极低成本提供了接近前沿模型的性能,性价比突出;人格感受类似 Claude Opus 4.6,日常编码够用,但在大型复杂代码库和模糊提示下表现下降,Arena 用户偏好基准上口碑不如能力基准亮眼。

  • 极高性价比:重度使用 4 小时(含密集子代理循环)仅花费 5 美分
  • SWE-bench Verified 得分 80.6%,与 Claude Opus 4.6 仅差 0.2 分
  • 输出 token 价格 $3.48/百万,远低于 Claude 的 $25/百万
  • 开源权重,可在自有基础设施部署或通过第三方 API 使用
  • 给定明确指令时能较好地按指示执行
  • 适合复杂代理工作流、深度代码库分析和多步推理任务
  • 适合多模型路由方案,将低成本任务分流给 V4 Pro,高难度任务留给闭源前沿模型
  • 在聚焦单一端点的逐层深度分析中表现可用
  • 对系统指令极为字面化且敏感,容易因提示措辞产生意外行为
  • 细节丰富程度不如 Claude Opus
  • 代码库规模和复杂度增大后,对模糊提示的容错性显著下降,要求精确描述
  • 在 Arena 众包用户偏好基准上表现不佳,用户主观偏好低于能力基准得分
  • 在编码工具链中存在低效的随机搜索和 grep 行为,部分归因于 harness
  • 基准测试中输出 token 消耗远高于同类开源模型中位数(190M vs 47M),运行成本达 $1,071
  • 编码能力存在分歧,部分用户认为 Kimi K2.6 编码更强

截至 2026-06-22

原始抓取数据已归档清理。

探索

源链接