如果你正在评估 2026 年夏季的 Agent API 选型,并需要判断 DeepSeek V4-Flash-0731 是否值得接入生产流水线,这篇文章按时间线、核心参数、横向对比与争议点四个维度展开——7 月 31 日 DeepSeek 将 V4-Flash 升级为官方版:参数规模不变、仅重训后训练,跑分反超更大的 V4-Pro 预览版,价格约为 Claude Opus 4.8 的几十分之一;旗舰 V4-Pro 官方版与自研 Harness 框架仍未上线。

时间线:从4月预览到7月「官方版」

  • 2026年4月24日:DeepSeek-V4 预览版首次发布并开源,包含 V4-Pro(1.6T 总参数 / 49B 激活)和 V4-Flash(284B 总参数 / 13B 激活),均支持 100 万 token 上下文,采用 MIT 协议。
  • 2026年7月24日:旧接口模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。
  • 2026年7月27日:月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,是当时体量最大的开源权重发布之一。
  • 2026年7月31日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布。此次公测仅限 API,App 和网页端暂未同步更新。
  • 截至2026年8月5日:V4-Pro 官方版仍是「尽快发布」,没有官方确认日期。部分媒体援引未署名消息源称内部测试已在 7 月 28 日那周启动,GA 窗口可能在 8 月 10 日至 20 日之间——这一时间点目前未经 DeepSeek 官方证实,仅供参考

这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。

核心数据一览:定价、参数与协议

模型状态总参数 / 激活上下文输入价格(缓存未命中/命中,每百万 token)输出价格协议
DeepSeek-V4-Flash-0731官方正式版(2026-07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3(月之暗面)权重开源(2026-07-27)2.8T / 约104B(社区估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2(智谱/Z.ai)开源(2026年6月)~744B / ~40B1M未在本文核实范围内未在本文核实范围内MIT
Qwen3.8-Max(阿里)API可用(2026-08-02)2.4T / 95B1M$2.00 / ~$0.17-0.25$6.00官方承诺开源,权重待放出

以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),但截至发稿未公布具体生效日期。价格与参数可能随时间变化,请以官方页面为准。

深度拆解:性能是怎么「变出来」的

架构没有变,变的是后训练。V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练数据质量和方法的重要性正在逼近甚至超过单纯堆参数。

混合注意力机制:CSA+HCA、mHC、Muon 优化器。根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列在架构上做了三处关键改动:

  1. 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),对外统一称为「DSA 稀疏注意力」,核心目的是在长上下文场景下降低计算和显存开销;
  2. 流形约束超连接(mHC):对传统残差连接结构做了改进;
  3. Muon 优化器:替换传统优化器,用于提升训练收敛速度和稳定性。

三项改动叠加的效果是:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%(DeepSeek 官方公布指标,尚未看到独立第三方复现验证)。

自研 Agent 框架 Harness 首次亮相。7 月 31 日 changelog 里第一次正式出现「DeepSeek Harness」——用于让模型读写文件、调用工具、执行命令、完成端到端工程任务,对标 Claude Code。官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,DeepSeek 在 changelog 里也主动提示:「跑分对 harness 的选择非常敏感,不能简单等同于模型本身能力的提升」。

横向对比:中国开源大模型的「六边形混战」

模型实验室发布/权重时间总参数Artificial Analysis Intelligence Index单任务平均成本
DeepSeek-V4-Flash-0731DeepSeek2026-07-31(官方版)284B50$0.03
Kimi K3月之暗面2026-07-16预览 / 07-27权重2.8T57$0.86
GLM-5.2智谱/Z.ai2026年6月~744B比 V4-Flash 高约 1 分未在本次调研范围内核实
Qwen3.8-Max阿里2026-08-02 GA2.4T未在本次调研范围内核实未在本次调研范围内核实
GPT-5.6 SolOpenAI闭源未公开比 V4-Flash 高 9 分以上$1.86
Claude Fable 5Anthropic闭源未公开比 V4-Flash 高 9 分以上$3.15

Intelligence Index 与单任务成本数据引自 Artificial Analysis(第三方独立评测);DeepSeek 官方跑分为厂商自报,两组数据评测方法和权重不完全一致,不能直接相加比较。V4-Flash 的单任务成本约为 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105——DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」。更多竞品定价背景可参考本站 GPT-5.6 降价与 API 定价对比,以及 Qwen3.8-Max 发布解读

可引用技术信息与数据来源

  • 后训练驱动性能跃升:284B/13B 架构不变,V4-Flash-0731 在 Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版的 67.9 分(DeepSeek 官方 changelog,Harness minimal mode 测得)。
  • 长上下文效率:百万 token 场景下 V4-Pro 单 token FLOPs 为 V3.2 的 27%,KV Cache 为 10%(DeepSeek 技术报告)。
  • 独立评测成本对比:Artificial Analysis 单任务平均成本 V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15(第三方独立评测,经财经媒体转引)。
  • OpenRouter 调用量:V4-Flash 预览版曾连续七周稳坐调用量第一(社区观察,反映大规模 Agent 场景对性价比的偏好)。

以下为可核验官方与第三方来源,发布前请以最新公告为准:

DeepSeek 官方 API 文档与更新日志

Hugging Face DeepSeek 模型卡(DeepSeek-V4-Pro、DeepSeek-V4-Flash)

Artificial Analysis 第三方模型评测数据

争议点:跑分好看,不代表没有水分

  1. 跑分方法依赖 Harness,官方自己都在提醒别只看数字。Agent 类跑分全部基于 DeepSeek 自研且尚未公开发布的 Harness 极简模式测得(max 档位、top_p=0.95、temperature=1.0),在独立社区复现之前应视为「厂商自报+特定框架」结果。
  2. 海外开发者反馈了具体的可用性问题。据 21 世纪经济报道援引的海外开发者社区反馈,V4-Flash 正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
  3. V4-Pro 官方版和 Harness 的具体上线时间目前未经证实。「8 月 10–20 日 GA」等窗口为未署名消息源或社区传言,DeepSeek 官方 changelog 原话只是「将尽快发布」。
  4. 企业融资与 IPO 传闻同样需要谨慎对待。多家媒体报道 DeepSeek 近期完成约 74 亿美元融资、估值约 487 亿美元等信息,目前主要来自财经媒体「据报道」「消息人士称」,尚无官方或监管备案文件直接确认。

影响与背景:从「梁白开」到「梁圣」,价格战进入下一轮

在 V4 正式版发布之前,因 Pro 版本迟迟没有兑现「7 月中旬全量上线」的预期,中文 AI 社区一度把 DeepSeek 创始人梁文锋戏称为「梁白开」。V4-Flash-0731 上线后,因实际表现超出预期,不少网友又把「梁圣」的称号还了回去。

更值得关注的是中文开发者社区流传的「斩杀线」说法:DeepSeek 凭借「够用的性能 + 极端低价」给同行设下门槛——友商模型若性能没有明显超过 DeepSeek,又拿不出更低价格,就会在市场上失去存在感。这也解释了近期 GPT-5.6 Luna 低价版一次性降价 80% 等密集调价动作。7 月 31 日 V4-Flash 正式版上线当天,英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已习惯「DeepSeek 式效率突破」叙事,不再简单把「用更少算力做到同等效果」等同于「利空算力股」。

FAQ

DeepSeek V4 和之前的 V3.2 相比,最大的区别是什么?

最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。

日常使用应该选 V4 Flash 还是 V4 Pro?

如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。

现在能用上 V4 Pro 官方版吗?

截至本文发稿(2026 年 8 月 5 日),还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期。

DeepSeek 公布的跑分能直接相信吗?

建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具独立复现后再下结论。

这次更新对普通开发者有什么实际影响?

如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chat/deepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。

DeepSeek V4-Flash-0731 把「够用智能 + 极致低价」的 Agent API 路线推到了新高度,但 Harness 尚未公开、V4-Pro 官方版仍无确切日期——在第三方复现完成之前,若你需要在真实 Apple Silicon 硬件上验证本地 Agent 工作流、对比不同 harness 下的实际表现,一台整机独享、可随时重置环境的物理主机往往比共享 GPU 集群更可控。VMSPIN 按天起租的云端 Mac mini 提供 MDM 自动交付与 SSH + VNC 双通道接入,适合短期 benchmark 与多工具链对比;若你还在评估 API 成本与本地部署方案,可结合 Mac mini M4 租赁全解析定价页 一起测算。