Si vous dimensionnez des pipelines agents à l'été 2026 et devez trancher sur l'intégration de DeepSeek V4-Flash-0731 en production, cet article vous guide à travers la chronologie, les spécifications clés, les comparaisons tarifaires et les réserves documentées. Le 31 juillet, DeepSeek a promu V4-Flash en build officiel « 0731 » — même architecture 284B/13B qu'en avril, seul le post-entraînement a changé — surpassant le preview V4-Pro plus volumineux sur les benchmarks agents pour environ 1/36e à 1/179e du prix de Claude Opus 4.8. Le flagship V4-Pro et le framework Harness interne restent non publiés.
Ce qui a réellement été livré le 31 juillet — et ce qui ne l'a pas été
La vague « modèles frontière » de l'été 2026 oblige les équipes produit à distinguer marketing et livrables techniques. Voici la chronologie vérifiée :
- 24 avril 2026 : lancement du preview DeepSeek-V4 avec deux modèles MoE open weights sous licence MIT — V4-Pro (1,6T total / 49B actifs) et V4-Flash (284B total / 13B actifs), fenêtre de contexte d'1M tokens chacun.
- 24 juillet 2026 : retrait des alias historiques
deepseek-chatetdeepseek-reasoner; tout le trafic bascule vers la famille V4. - 27 juillet 2026 : Moonshot AI publie les poids ouverts complets de Kimi K3 (2,8T paramètres totaux), intensifiant la pression concurrentielle.
- 31 juillet 2026 :
deepseek-v4-flashpasse en bêta API publique officielle (tag « 0731 »). Architecture et nombre de paramètres inchangés — les gains proviennent exclusivement d'un nouveau passage de post-entraînement. Poids ouverts sur Hugging Face sous MIT le même jour. Le changelog mentionne pour la première fois « DeepSeek Harness ». Point crucial : cette mise à jour est API uniquement — l'application grand public et le chat web restent inchangés. - Au 5 août 2026 : la sortie officielle de V4-Pro n'est pas confirmée. Certains médias chinois, citant des sources anonymes, évoquent des tests internes dès la semaine du 28 juillet et une fenêtre GA possible entre le 10 et le 20 août — fenêtre non confirmée par DeepSeek, à traiter comme rumeur.
Lire « DeepSeek V4 version officielle » laisse souvent croire à un nouveau modèle. Ce n'est pas le cas. DeepSeek affirme explicitement que les gains proviennent entièrement d'un nouveau post-entraînement, pas d'un scaling — un modèle 284B/13B bat désormais un 1,6T/49B de la même famille sur plusieurs tâches agentiques.
Tableau de référence : spécifications et tarification API
| Modèle | Statut | Total / Actifs | Contexte | Input (miss / hit, par 1M) | Output (par 1M) | Licence |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Officiel (31 juil. 2026) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview uniquement | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 (Moonshot AI) | Poids ouverts (27 juil. 2026) | 2,8T / ~104B (est. communauté) | ~1,05M | $3,00 / $0,30 | $15,00 | MIT modifiée |
| GLM-5.2 (Zhipu / Z.ai) | Ouvert (juin 2026) | ~744B / ~40B | 1M | Non vérifié ici | Non vérifié ici | MIT |
| Qwen3.8-Max (Alibaba) | API GA (2 août 2026) | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Poids en attente |
Tous les tarifs ci-dessus proviennent des grilles publiées par les éditeurs. DeepSeek a annoncé un futur supplément de pointe ×2 (9h–12h et 14h–18h, heure de Pékin) sans date d'entrée en vigueur confirmée. Prix et spécifications susceptibles d'évoluer — vérifiez sur les pages officielles avant engagement.
Comment DeepSeek a extrait plus d'un modèle inchangé
L'architecture n'a pas bougé — les données d'entraînement, si. V4-Flash-0731 est identique en taille et structure au preview d'avril. DeepSeek attribue l'intégralité du bond sur les benchmarks agents à un nouveau post-entraînement, contredisant l'hypothèse sectorielle « plus gros = meilleur ».
Attention hybride, hyper-connexions et optimiseur Muon. Le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence » décrit trois évolutions architecturales :
- Attention hybride combinant Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA), commercialisée sous « DSA » (DeepSeek Sparse Attention), visant à réduire calcul et mémoire sur longs contextes ;
- Manifold-Constrained Hyper-Connections (mHC), amélioration des connexions résiduelles classiques ;
- L'optimiseur Muon pour une convergence plus rapide et une stabilité d'entraînement accrue.
À 1M tokens de contexte, V4-Pro ne nécessiterait que 27 % des FLOPs d'inférence par token et 10 % de l'empreinte KV cache de V3.2 — chiffres éditeur sans reproduction tierce indépendante à ce jour.
Harness : le premier framework agent maison de DeepSeek. Mentionné officiellement le 31 juillet, positionné comme alternative interne à Claude Code. Chaque benchmark agent publié (Terminal Bench 2.0, Toolathlon, etc.) a été mesuré avec le mode minimal de Harness — pas encore publié — en effort de raisonnement maximal, top_p 0,95, température 1,0. Le changelog de DeepSeek précise que les scores agents sont « extrêmement sensibles au choix du harness ».
Positionnement concurrentiel : V4-Flash face à Kimi K3, GLM-5.2 et Qwen3.8-Max
| Modèle | Labo | Release / poids | Params totaux | Artificial Analysis Intelligence Index | Coût moyen par tâche |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31 juil. 2026 (officiel) | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16 juil. preview / 27 juil. poids | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu / Z.ai | Juin 2026 | ~744B | ~1 point au-dessus de V4-Flash | Non vérifié ici |
| Qwen3.8-Max | Alibaba | 2 août 2026 GA | 2,4T | Non vérifié ici | Non vérifié ici |
| GPT-5.6 Sol | OpenAI | Source fermée | Non divulgué | 9+ points au-dessus de V4-Flash | $1,86 |
| Claude Fable 5 | Anthropic | Source fermée | Non divulgué | 9+ points au-dessus de V4-Flash | $3,15 |
L'Intelligence Index et le coût par tâche proviennent d'Artificial Analysis. Les benchmarks agents de DeepSeek suivent une méthodologie distincte. Le coût par tâche de V4-Flash représente environ 1/29e de Kimi K3, 1/62e de GPT-5.6 Sol et 1/105e de Claude Fable 5. DeepSeek ne vise pas le sommet du classement mais « assez intelligent au prix le plus bas du marché ». Pour le contexte tarifaire, consultez notre analyse des baisses GPT-5.6 et notre décryptage de Qwen3.8-Max.
Données vérifiables et sources citables
- Le post-entraînement a fait la différence : V4-Flash-0731 a atteint 82,7 sur Terminal Bench 2.0 contre 67,9 pour le preview V4-Pro — même architecture 284B/13B (changelog DeepSeek, Harness mode minimal).
- Efficacité long contexte : à 1M tokens, V4-Pro nécessite 27 % des FLOPs par token et 10 % du KV cache de V3.2 (rapport technique DeepSeek).
- Comparaison de coût indépendante : Artificial Analysis — V4-Flash $0,03 vs Kimi K3 $0,86 vs Claude Fable 5 $3,15 par tâche.
- Usage OpenRouter : le preview V4-Flash aurait dominé le classement des modèles les plus utilisés pendant sept semaines consécutives — signal que les workloads agents privilégient l'économie unitaire à l'intelligence maximale.
Sources officielles et tierces — confirmez les chiffres les plus récents avant publication :
Documentation API officielle et changelog DeepSeek
Fiches modèles DeepSeek sur Hugging Face (DeepSeek-V4-Pro, DeepSeek-V4-Flash)
Benchmarks indépendants Artificial Analysis
Les réserves : pourquoi ne pas prendre les benchmarks au pied de la lettre
- Les scores agents dépendent du harness et sont auto-déclarés. Le 82,7 sur Terminal Bench 2.0 a été mesuré avec le Harness non publié de DeepSeek en mode minimal. Jusqu'à reproduction par des tiers avec d'autres frameworks (Claude Code, Cursor, etc.), traitez-les comme des résultats « éditeur + framework spécifique ».
- Des retours terrain négatifs existent. Le journal économique chinois 21st Century Business Herald, citant la communauté développeur internationale, signale de faibles taux de cache-hit en entrée et des timeouts occasionnels du classificateur de sécurité sur le build officiel V4-Flash.
- Les dates de sortie de V4-Pro et Harness ne sont pas confirmées. La fenêtre GA 10–20 août issue de sources anonymes est une rumeur — le changelog indique seulement que V4-Pro officiel suivra « dès que possible ».
- Les rapports de financement et d'IPO ne sont pas confirmés indépendamment. Les médias évoquent un tour d'environ $7,4 milliards valorisant DeepSeek à ~$48,7 milliards — sources anonymes, pas de dépôts réglementaires ni déclaration DeepSeek.
La « kill line » : le virage de l'opinion chez les développeurs chinois
Avant V4-Flash-0731, les forums chinois moquaient le fondateur de DeepSeek Liang Wenfeng sous le surnom « Liang Baikai » — jeu de mots signifiant à peu près « Liang Promesse Vide », en référence au report du V4-Pro mi-juillet. Une fois le build Flash officiel au-delà des attentes, les mêmes communautés sont revenues à « Liang Sheng » (« Liang le Sage »).
Plus structurellement, le terme « 斩杀线 » (zhǎn shā xiàn), littéralement « ligne d'élimination », circule dans les cercles développeurs chinois : la combinaison performance suffisante et prix plancher de DeepSeek trace une barre — les concurrents qui ne la dépassent ni en capacité ni en tarif risquent l'obsolescence. Cela éclaire des mouvements comme la baisse de prix rapportée de 80 % sur le tier GPT-5.6 Luna d'OpenAI à la même période. Le 31 juillet, jour de la promotion officielle de V4-Flash, Nvidia, Broadcom et AMD n'ont guère bougé en bourse — contraste frappant avec la vente massive de titres AI début 2025 après les claims d'efficacité de DeepSeek-R1.
FAQ
DeepSeek V4 est-il open source ?
Oui. V4-Pro et V4-Flash, y compris le build officiel V4-Flash-0731 du 31 juillet 2026, sont publiés en poids ouverts sous licence MIT sur Hugging Face, utilisables, affinables et redistribuables commercialement sans permission supplémentaire.
À quel point V4-Flash est-il moins cher que Claude ?
Selon le 21st Century Business Herald, V4-Flash officiel coûte environ 36× moins cher que Claude Opus 4.8 en input cache miss, ~179× en cache hit et ~89× en output, par million de tokens. Tarifs catalogue éditeur, pas audit indépendant.
Quand sortira la version officielle de V4-Pro ?
Aucune date confirmée. Le changelog indique seulement « dès que possible ». Les rapports sur une fenêtre 10–20 août proviennent de médias chinois citant des sources anonymes, non confirmés par DeepSeek.
Peut-on faire confiance aux benchmarks DeepSeek ?
Partiellement. Les benchmarks tiers largement adoptés comme SWE-bench Verified ont plus de poids. Les scores agents spécifiques (Terminal Bench 2.0, Toolathlon) ont été mesurés avec le Harness non publié ; DeepSeek avertit lui-même de la forte sensibilité au choix du harness.
Qu'est-ce que DeepSeek Harness ?
Le premier framework d'exécution agent développé en interne par DeepSeek, positionné comme alternative maison à Claude Code pour l'édition de fichiers, les appels d'outils et le travail d'ingénierie multi-étapes. Nommé pour la première fois dans le changelog du 31 juillet 2026, pas encore disponible publiquement.
DeepSeek V4-Flash-0731 porte le playbook « intelligence suffisante à prix plancher » à un nouveau niveau — mais Harness n'est pas public et V4-Pro n'a pas de date GA confirmée. En attendant les reproductions indépendantes, valider des workflows agents locaux sur du vrai matériel Apple Silicon — comparer côte à côte le comportement des harness — demande souvent un hôte physique dédié que vous pouvez réinitialiser à la demande, plus prévisible qu'un pool GPU partagé pour les créateurs et développeurs qui enchaînent builds, tests et comparaisons multi-outils. La location à la journée de Mac mini cloud VMSPIN propose provisioning MDM automatique et accès SSH + VNC, adaptée aux runs de benchmark courts. Complétez avec notre guide location Mac mini M4 et la page tarifs si vous arbitrez coûts API et déploiement local.