2026 年夏のフロンティアモデル乱立期に、エージェント向け API を本番パイプラインへ組み込むべきかを判断したい開発者向けに、本稿は DeepSeek V4-Flash-0731 のタイムライン・主要スペック・競合横並び比較・注意点の 4 軸で整理します。7 月 31 日に公式ビルドへ昇格した同モデルは、4 月プレビューと同一の 284B/13B アーキテクチャのまま、ポストトレーニングのみ刷新し、同ファミリーの大型 V4-Pro プレビューをエージェントベンチで上回り、Claude Opus 4.8 比でおおよそ 1/36〜1/179 の価格帯に収まります。フラッグシップ V4-Pro と社内 Harness フレームワークは、現時点では未公開です。
7 月 31 日に実際に出荷されたものと、まだ出ていないもの
- 2026 年 4 月 24 日:DeepSeek-V4 プレビュー公開。MIT ライセンスのオープン重み MoE が 2 系統——V4-Pro(総 1.6T / 活性 49B)と V4-Flash(総 284B / 活性 13B)。いずれもコンテキスト 100 万トークン。
- 2026 年 7 月 24 日:レガシーエイリアス
deepseek-chatとdeepseek-reasonerを廃止。全トラフィックを V4 ファミリーへルーティング。 - 2026 年 7 月 27 日:Moonshot AI が Kimi K3(総 2.8T)のフルオープン重みを公開。DeepSeek 自身のアップデート直前に競争圧力が高まりました。
- 2026 年 7 月 31 日:
deepseek-v4-flashが公式パブリック API ベータ(ビルドタグ「0731」)へ昇格。アーキテクチャもパラメータ数も不変——性能向上はポストトレーニングの再実行のみ。同日 Hugging Face で MIT ライセンスのオープン重みを公開。チェンジログで社内エージェントフレームワーク「DeepSeek Harness」が初めて名称登場。本更新はAPI のみで、コンシューマーアプリと Web チャットは変更なし。 - 2026 年 8 月 5 日時点:公式 V4-Pro リリースは未確認。一部中国メディアは匿名ソースに基づき、7 月 28 日週から社内テストが始まり GA 窓は 8 月 10〜20 日の可能性と報じていますが、DeepSeek による確認はなく、噂として扱うべきです。
「DeepSeek V4 公式版」という見出しだけを読むと、新モデルが登場したように見えますが、実際にはそうではありません。DeepSeek は性能向上がすべてポストトレーニングの再実行によるもので、スケールアップではないと明言しています。284B/13B のモデルが、同一ファミリーの 1.6T/49B を複数のエージェントタスクで上回る状況です。
主要数値の一覧
| モデル | ステータス | 総 / 活性 | コンテキスト | 入力(ミス / ヒット、100万トークンあたり) | 出力(100万あたり) | ライセンス |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 公式(2026年7月31日) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | プレビューのみ | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3(Moonshot AI) | オープン重み(2026年7月27日) | 2.8T / 約104B(コミュニティ推定) | 約1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2(Zhipu / Z.ai) | オープン(2026年6月) | 約744B / 約40B | 1M | 本稿では未検証 | 本稿では未検証 | MIT |
| Qwen3.8-Max(Alibaba) | API GA(2026年8月2日) | 2.4T / 95B | 1M | $2.00 / 約$0.17〜0.25 | $6.00 | 重み未公開 |
上記の価格はすべてベンダー公表レートです。DeepSeek は将来、北京時間 9〜12 時・14〜18 時のピーク時間帯に 2 倍のサーチャージを適用する予定と発表していますが、発効日は未確定です。価格とスペックは変更される可能性があるため、コミット前に公式ページで再確認してください。
同一アーキテクチャからどう性能を引き出したか
アーキテクチャは不変——変わったのは学習データです。V4-Flash-0731 は 4 月プレビューとサイズ・構造が同一です。DeepSeek によれば、エージェントベンチマークでの性能ジャンプはすべてポストトレーニングの再実行によるもので、スケールアップではありません。「大きいほど良い」という業界のデフォルト仮説に逆行する結果です。
ハイブリッド注意機構、ハイパーコネクション、新オプティマイザ。DeepSeek の技術レポート「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」では、3 つのアーキテクチャ変更を説明しています。
- ハイブリッド注意機構——Compressed Sparse Attention(CSA)と Heavily Compressed Attention(HCA)を組み合わせ、「DSA」(DeepSeek Sparse Attention)としてマーケティング。長コンテキストでの計算・メモリ削減を狙います。
- Manifold-Constrained Hyper-Connections(mHC)——標準的な残差接続の強化版。
- Muon オプティマイザ——収束速度と学習安定性の向上。
DeepSeek は 100 万トークンのコンテキスト長において、V4-Pro が V3.2 比でトークンあたり推論 FLOPs の 27%、KV キャッシュの 10% で済むと主張しています。これはベンダー報告値であり、第三者による独立再現はまだありません。
Harness:DeepSeek 初の社内エージェントフレームワーク。7 月 31 日に DeepSeek Harness が初めて公式言及され、Claude Code の社内代替として位置づけられました。DeepSeek が公開したエージェントベンチマーク(Terminal Bench 2.0、Toolathlon など)はすべて、まだ公開されていない Harness の「minimal モード」で、最大推論 effort、top_p 0.95、temperature 1.0 の条件で計測されています。DeepSeek 自身のチェンジログにも、エージェントスコアは「ハーネス選択に極めて敏感」との注意書きがあります。
DeepSeek V4-Flash vs Kimi K3 vs GLM-5.2 vs Qwen3.8-Max
| モデル | ラボ | リリース / 重み | 総パラメータ | Artificial Analysis Intelligence Index | タスクあたり平均コスト |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026年7月31日(公式) | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot AI | 7月16日プレビュー / 7月27日重み | 2.8T | 57 | $0.86 |
| GLM-5.2 | Zhipu / Z.ai | 2026年6月 | 約744B | V4-Flash より約1点高 | 本稿では未検証 |
| Qwen3.8-Max | Alibaba | 2026年8月2日 GA | 2.4T | 本稿では未検証 | 本稿では未検証 |
| GPT-5.6 Sol | OpenAI | クローズドソース | 非公開 | V4-Flash より9点以上高 | $1.86 |
| Claude Fable 5 | Anthropic | クローズドソース | 非公開 | V4-Flash より9点以上高 | $3.15 |
Intelligence Index とタスクあたりコストは独立ベンチマーク企業 Artificial Analysis のデータです。DeepSeek 自社のエージェントベンチマークは別手法で、別途記載しています。V4-Flash のタスクあたりコストは Kimi K3 の約 1/29、GPT-5.6 Sol の約 1/62、Claude Fable 5 の約 1/105 です。DeepSeek はリーダーボード首位を狙うのではなく、「十分な知能を誰もマネできない価格で」というポジションを取っています。価格の文脈については、GPT-5.6 値下げと API 価格比較およびQwen3.8-Max リリース解説もあわせてご覧ください。
引用可能なハードデータと出典
- ポストトレーニングがジャンプを駆動:V4-Flash-0731 は Terminal Bench 2.0 で 82.7 点、V4-Pro プレビューの 67.9 点——同一 284B/13B アーキテクチャ(DeepSeek チェンジログ、Harness minimal モード)。
- 長コンテキスト効率:100 万トークンで V4-Pro は V3.2 比トークンあたり FLOPs の 27%、KV キャッシュの 10%(DeepSeek 技術レポート)。
- 独立コスト比較:Artificial Analysis タスクあたり平均コスト——V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15。
- OpenRouter 利用状況:V4-Flash プレビューは 7 週連続で最も利用されたモデルランキング首位を報告——大規模エージェントワークロードがピーク知能より単価経済を優先するシグナルです。
検証可能な公式・第三者ソースです。公開前に最新数値を再確認してください。
Hugging Face DeepSeek モデルカード(DeepSeek-V4-Pro、DeepSeek-V4-Flash)
Artificial Analysis 独立モデルベンチマーク
注意点:ベンチマークを盲信すべきでない理由
- 見出しのエージェントスコアはハーネス依存かつ自社報告です。Terminal Bench 2.0 の 82.7 点は、未公開の Harness minimal モードで計測。第三者が Claude Code、Cursor など別ハーネスで再現するまで、「ベンダー+特定フレームワーク」の結果として扱うべきです。
- 実運用での不満も存在します。中国の財経メディア 21 世紀経済報道は、海外開発者コミュニティのフィードバックを引用し、公式 V4-Flash ビルドで入力キャッシュヒット率の低さや、安全分類器のタイムアウトが散見されると報じています。
- V4-Pro と Harness の公開日は未確定です。8 月 10〜20 日の GA 窓は匿名ソースの噂——DeepSeek チェンジログは公式 V4-Pro リリースは「できるだけ早く」とのみ記載しています。
- 資金調達・IPO 報道は独立確認されていません。約 74 億ドルの資金調達ラウンド、約 487 億ドルの評価額などは財経メディアの匿名ソースに遡り、規制当局の提出書類や DeepSeek の声明ではありません。
中国の開発者が「斩杀線(ざんさせん)」と呼ぶ理由
V4-Flash-0731 出荷前、中国の AI フォーラムでは DeepSeek 創業者の梁文鋒氏を「梁百開(りょうひゃっかい)」——「約束だけで実装なし」という皮肉のニックネーム——で揶揄していました。V4-Pro の 7 月中旬目標がずれたことへの反発です。公式 Flash ビルドが期待を上回ると、同じコミュニティは「梁聖(りょうせい)」——「賢者の梁」——へと態度を翻しました。
より実質的な議論では、中国の開発者コミュニティに「斩杀線(ざんさせん)」——文字通り「斬殺ライン」——という用語が広がっています。DeepSeek の「十分な性能+破格の価格」の組み合わせが、事実上の基準線を引くという考え方です。能力で DeepSeek を明確に上回れず、価格でも下回れない競合は、存在感を失うリスクがある、という枠組みです。同時期に OpenAI が低価格帯 GPT-5.6 Luna で 80% 値下げを報じた動きとも整合します。7 月 31 日に V4-Flash が公式化された日、Nvidia・Broadcom・AMD の株価に大きな動きはありませんでした。2025 年初頭の DeepSeek-R1 効率主張で世界の AI チップ株が売られたのとは対照的です。
FAQ
DeepSeek V4 はオープンソースですか?
はい。V4-Pro と V4-Flash の両方、7 月 31 日公式 V4-Flash-0731 ビルドを含め、Hugging Face で MIT ライセンスのオープン重みとして公開されています。商用利用・ファインチューニング・再配布に追加許可は不要です。
DeepSeek V4-Flash は Claude よりどれくらい安いですか?
21 世紀経済報道の数値によれば、公式 V4-Flash 価格はキャッシュミス入力で Claude Opus 4.8 比おおよそ 36 倍安く、キャッシュヒット入力で約 179 倍、出力で約 89 倍安い(100 万トークンあたり)。これはベンダー定価であり、独立監査ではありません。
DeepSeek V4-Pro の公式版はいつリリースされますか?
確定日はありません。DeepSeek チェンジログは公式 V4-Pro リリースは「できるだけ早く」とのみ記載。8 月 10〜20 日の GA 窓は中国メディアの匿名ソースによる報道で、DeepSeek による確認はありません。
DeepSeek のベンチマーク数値は信頼できますか?
部分的にです。SWE-bench Verified など広く採用された第三者ベンチマークの方が重みは高いです。ただしエージェント固有スコア(Terminal Bench 2.0、Toolathlon など)は未公開の Harness フレームワークで計測されており、同社自身もハーネス選択に極めて敏感であると警告しています。
DeepSeek Harness とは何ですか?
DeepSeek 初の自社エージェント実行フレームワークで、Claude Code の社内代替として位置づけられています。ファイル編集、ツール呼び出し、多段階エンジニアリング作業向け。2026 年 7 月 31 日チェンジログで初めて名称が登場し、現時点では公開されていません。
DeepSeek V4-Flash-0731 は「破格の価格で十分な知能」というエージェント API 戦略を新たな段階へ押し上げました。ただし Harness は未公開、V4-Pro の GA 日も未確定です。独立再現が揃うまでの間、ローカルエージェントワークフローを実機 Apple Silicon で検証し、ハーネス挙動を横並び比較する必要があるなら、必要に応じてリセットできる専用物理ホストは、共有 GPU プールより予測可能性が高い場合があります。VMSPIN の日単位クラウド Mac mini は MDM 自動プロビジョニングと SSH + VNC デュアルアクセスに対応し、短期ベンチマークやマルチツールチェーン比較に適しています。Mac mini M4 レンタル解説と料金ページもあわせてご確認ください。