2026 年夏のフロンティアモデル乱立期に、エージェント向け API を本番パイプラインへ組み込むべきかを判断したい開発者向けに、本稿は DeepSeek V4-Flash-0731 のタイムライン・主要スペック・競合横並び比較・注意点の 4 軸で整理します。7 月 31 日に公式ビルドへ昇格した同モデルは、4 月プレビューと同一の 284B/13B アーキテクチャのまま、ポストトレーニングのみ刷新し、同ファミリーの大型 V4-Pro プレビューをエージェントベンチで上回り、Claude Opus 4.8 比でおおよそ 1/36〜1/179 の価格帯に収まります。フラッグシップ V4-Pro と社内 Harness フレームワークは、現時点では未公開です。

7 月 31 日に実際に出荷されたものと、まだ出ていないもの

  • 2026 年 4 月 24 日:DeepSeek-V4 プレビュー公開。MIT ライセンスのオープン重み MoE が 2 系統——V4-Pro(総 1.6T / 活性 49B)と V4-Flash(総 284B / 活性 13B)。いずれもコンテキスト 100 万トークン。
  • 2026 年 7 月 24 日:レガシーエイリアス deepseek-chatdeepseek-reasoner を廃止。全トラフィックを V4 ファミリーへルーティング。
  • 2026 年 7 月 27 日:Moonshot AI が Kimi K3(総 2.8T)のフルオープン重みを公開。DeepSeek 自身のアップデート直前に競争圧力が高まりました。
  • 2026 年 7 月 31 日:deepseek-v4-flash が公式パブリック API ベータ(ビルドタグ「0731」)へ昇格。アーキテクチャもパラメータ数も不変——性能向上はポストトレーニングの再実行のみ。同日 Hugging Face で MIT ライセンスのオープン重みを公開。チェンジログで社内エージェントフレームワーク「DeepSeek Harness」が初めて名称登場。本更新はAPI のみで、コンシューマーアプリと Web チャットは変更なし。
  • 2026 年 8 月 5 日時点:公式 V4-Pro リリースは未確認。一部中国メディアは匿名ソースに基づき、7 月 28 日週から社内テストが始まり GA 窓は 8 月 10〜20 日の可能性と報じていますが、DeepSeek による確認はなく、噂として扱うべきです。

「DeepSeek V4 公式版」という見出しだけを読むと、新モデルが登場したように見えますが、実際にはそうではありません。DeepSeek は性能向上がすべてポストトレーニングの再実行によるもので、スケールアップではないと明言しています。284B/13B のモデルが、同一ファミリーの 1.6T/49B を複数のエージェントタスクで上回る状況です。

主要数値の一覧

モデルステータス総 / 活性コンテキスト入力(ミス / ヒット、100万トークンあたり)出力(100万あたり)ライセンス
DeepSeek-V4-Flash-0731公式(2026年7月31日)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Proプレビューのみ1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3(Moonshot AI)オープン重み(2026年7月27日)2.8T / 約104B(コミュニティ推定)約1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2(Zhipu / Z.ai)オープン(2026年6月)約744B / 約40B1M本稿では未検証本稿では未検証MIT
Qwen3.8-Max(Alibaba)API GA(2026年8月2日)2.4T / 95B1M$2.00 / 約$0.17〜0.25$6.00重み未公開

上記の価格はすべてベンダー公表レートです。DeepSeek は将来、北京時間 9〜12 時・14〜18 時のピーク時間帯に 2 倍のサーチャージを適用する予定と発表していますが、発効日は未確定です。価格とスペックは変更される可能性があるため、コミット前に公式ページで再確認してください。

同一アーキテクチャからどう性能を引き出したか

アーキテクチャは不変——変わったのは学習データです。V4-Flash-0731 は 4 月プレビューとサイズ・構造が同一です。DeepSeek によれば、エージェントベンチマークでの性能ジャンプはすべてポストトレーニングの再実行によるもので、スケールアップではありません。「大きいほど良い」という業界のデフォルト仮説に逆行する結果です。

ハイブリッド注意機構、ハイパーコネクション、新オプティマイザ。DeepSeek の技術レポート「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」では、3 つのアーキテクチャ変更を説明しています。

  1. ハイブリッド注意機構——Compressed Sparse Attention(CSA)と Heavily Compressed Attention(HCA)を組み合わせ、「DSA」(DeepSeek Sparse Attention)としてマーケティング。長コンテキストでの計算・メモリ削減を狙います。
  2. Manifold-Constrained Hyper-Connections(mHC)——標準的な残差接続の強化版。
  3. Muon オプティマイザ——収束速度と学習安定性の向上。

DeepSeek は 100 万トークンのコンテキスト長において、V4-Pro が V3.2 比でトークンあたり推論 FLOPs の 27%、KV キャッシュの 10% で済むと主張しています。これはベンダー報告値であり、第三者による独立再現はまだありません。

Harness:DeepSeek 初の社内エージェントフレームワーク。7 月 31 日に DeepSeek Harness が初めて公式言及され、Claude Code の社内代替として位置づけられました。DeepSeek が公開したエージェントベンチマーク(Terminal Bench 2.0、Toolathlon など)はすべて、まだ公開されていない Harness の「minimal モード」で、最大推論 effort、top_p 0.95、temperature 1.0 の条件で計測されています。DeepSeek 自身のチェンジログにも、エージェントスコアは「ハーネス選択に極めて敏感」との注意書きがあります。

DeepSeek V4-Flash vs Kimi K3 vs GLM-5.2 vs Qwen3.8-Max

モデルラボリリース / 重み総パラメータArtificial Analysis Intelligence Indexタスクあたり平均コスト
DeepSeek-V4-Flash-0731DeepSeek2026年7月31日(公式)284B50$0.03
Kimi K3Moonshot AI7月16日プレビュー / 7月27日重み2.8T57$0.86
GLM-5.2Zhipu / Z.ai2026年6月約744BV4-Flash より約1点高本稿では未検証
Qwen3.8-MaxAlibaba2026年8月2日 GA2.4T本稿では未検証本稿では未検証
GPT-5.6 SolOpenAIクローズドソース非公開V4-Flash より9点以上高$1.86
Claude Fable 5Anthropicクローズドソース非公開V4-Flash より9点以上高$3.15

Intelligence Index とタスクあたりコストは独立ベンチマーク企業 Artificial Analysis のデータです。DeepSeek 自社のエージェントベンチマークは別手法で、別途記載しています。V4-Flash のタスクあたりコストは Kimi K3 の約 1/29、GPT-5.6 Sol の約 1/62、Claude Fable 5 の約 1/105 です。DeepSeek はリーダーボード首位を狙うのではなく、「十分な知能を誰もマネできない価格で」というポジションを取っています。価格の文脈については、GPT-5.6 値下げと API 価格比較およびQwen3.8-Max リリース解説もあわせてご覧ください。

引用可能なハードデータと出典

  • ポストトレーニングがジャンプを駆動:V4-Flash-0731 は Terminal Bench 2.0 で 82.7 点、V4-Pro プレビューの 67.9 点——同一 284B/13B アーキテクチャ(DeepSeek チェンジログ、Harness minimal モード)。
  • 長コンテキスト効率:100 万トークンで V4-Pro は V3.2 比トークンあたり FLOPs の 27%、KV キャッシュの 10%(DeepSeek 技術レポート)。
  • 独立コスト比較:Artificial Analysis タスクあたり平均コスト——V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15。
  • OpenRouter 利用状況:V4-Flash プレビューは 7 週連続で最も利用されたモデルランキング首位を報告——大規模エージェントワークロードがピーク知能より単価経済を優先するシグナルです。

検証可能な公式・第三者ソースです。公開前に最新数値を再確認してください。

DeepSeek 公式 API ドキュメントとチェンジログ

Hugging Face DeepSeek モデルカード(DeepSeek-V4-Pro、DeepSeek-V4-Flash)

Artificial Analysis 独立モデルベンチマーク

注意点:ベンチマークを盲信すべきでない理由

  1. 見出しのエージェントスコアはハーネス依存かつ自社報告です。Terminal Bench 2.0 の 82.7 点は、未公開の Harness minimal モードで計測。第三者が Claude Code、Cursor など別ハーネスで再現するまで、「ベンダー+特定フレームワーク」の結果として扱うべきです。
  2. 実運用での不満も存在します。中国の財経メディア 21 世紀経済報道は、海外開発者コミュニティのフィードバックを引用し、公式 V4-Flash ビルドで入力キャッシュヒット率の低さや、安全分類器のタイムアウトが散見されると報じています。
  3. V4-Pro と Harness の公開日は未確定です。8 月 10〜20 日の GA 窓は匿名ソースの噂——DeepSeek チェンジログは公式 V4-Pro リリースは「できるだけ早く」とのみ記載しています。
  4. 資金調達・IPO 報道は独立確認されていません。約 74 億ドルの資金調達ラウンド、約 487 億ドルの評価額などは財経メディアの匿名ソースに遡り、規制当局の提出書類や DeepSeek の声明ではありません。

中国の開発者が「斩杀線(ざんさせん)」と呼ぶ理由

V4-Flash-0731 出荷前、中国の AI フォーラムでは DeepSeek 創業者の梁文鋒氏を「梁百開(りょうひゃっかい)」——「約束だけで実装なし」という皮肉のニックネーム——で揶揄していました。V4-Pro の 7 月中旬目標がずれたことへの反発です。公式 Flash ビルドが期待を上回ると、同じコミュニティは「梁聖(りょうせい)」——「賢者の梁」——へと態度を翻しました。

より実質的な議論では、中国の開発者コミュニティに「斩杀線(ざんさせん)」——文字通り「斬殺ライン」——という用語が広がっています。DeepSeek の「十分な性能+破格の価格」の組み合わせが、事実上の基準線を引くという考え方です。能力で DeepSeek を明確に上回れず、価格でも下回れない競合は、存在感を失うリスクがある、という枠組みです。同時期に OpenAI が低価格帯 GPT-5.6 Luna で 80% 値下げを報じた動きとも整合します。7 月 31 日に V4-Flash が公式化された日、Nvidia・Broadcom・AMD の株価に大きな動きはありませんでした。2025 年初頭の DeepSeek-R1 効率主張で世界の AI チップ株が売られたのとは対照的です。

FAQ

DeepSeek V4 はオープンソースですか?

はい。V4-Pro と V4-Flash の両方、7 月 31 日公式 V4-Flash-0731 ビルドを含め、Hugging Face で MIT ライセンスのオープン重みとして公開されています。商用利用・ファインチューニング・再配布に追加許可は不要です。

DeepSeek V4-Flash は Claude よりどれくらい安いですか?

21 世紀経済報道の数値によれば、公式 V4-Flash 価格はキャッシュミス入力で Claude Opus 4.8 比おおよそ 36 倍安く、キャッシュヒット入力で約 179 倍、出力で約 89 倍安い(100 万トークンあたり)。これはベンダー定価であり、独立監査ではありません。

DeepSeek V4-Pro の公式版はいつリリースされますか?

確定日はありません。DeepSeek チェンジログは公式 V4-Pro リリースは「できるだけ早く」とのみ記載。8 月 10〜20 日の GA 窓は中国メディアの匿名ソースによる報道で、DeepSeek による確認はありません。

DeepSeek のベンチマーク数値は信頼できますか?

部分的にです。SWE-bench Verified など広く採用された第三者ベンチマークの方が重みは高いです。ただしエージェント固有スコア(Terminal Bench 2.0、Toolathlon など)は未公開の Harness フレームワークで計測されており、同社自身もハーネス選択に極めて敏感であると警告しています。

DeepSeek Harness とは何ですか?

DeepSeek 初の自社エージェント実行フレームワークで、Claude Code の社内代替として位置づけられています。ファイル編集、ツール呼び出し、多段階エンジニアリング作業向け。2026 年 7 月 31 日チェンジログで初めて名称が登場し、現時点では公開されていません。

DeepSeek V4-Flash-0731 は「破格の価格で十分な知能」というエージェント API 戦略を新たな段階へ押し上げました。ただし Harness は未公開、V4-Pro の GA 日も未確定です。独立再現が揃うまでの間、ローカルエージェントワークフローを実機 Apple Silicon で検証し、ハーネス挙動を横並び比較する必要があるなら、必要に応じてリセットできる専用物理ホストは、共有 GPU プールより予測可能性が高い場合があります。VMSPIN の日単位クラウド Mac mini は MDM 自動プロビジョニングと SSH + VNC デュアルアクセスに対応し、短期ベンチマークやマルチツールチェーン比較に適しています。Mac mini M4 レンタル解説料金ページもあわせてご確認ください。