Public : équipes qui choisissent DeepSeek, Qwen ou GLM en API, ou qui prévoient d'héberger des poids ouverts. Problème : en cinq jours, DeepSeek annonce jusqu'à 1 100 % de hausse en heures de pointe, Alibaba publie un flagship 2,4 billions de paramètres jamais ouvert, et Zhipu livre GLM-5.3 avec un saut d'environ 6× sur les bancs de code, sans réentraîner la base. Conclusion : les labos chinois ne se battent plus seulement sur le prix, mais sur le pouvoir de tarifer. La suite déroule la chronologie, la grille, un calcul en six étapes, trois logiques, un comparatif, les points contestés et une FAQ.

En cinq jours, trois labos chinois font des gestes contradictoires en apparence. DeepSeek relève certains paliers API jusqu'à 1 100 %. Alibaba, la même semaine, ouvre un flagship 2,4 T. Zhipu livre GLM-5.3 sur la même base 743 B, uniquement par post-entraînement. Le signal commun : passer de la guerre des prix à la guerre du pouvoir tarifaire.

Chronologie : ce qui s'est passé, et quand

DateÉvénement
16 juil. 2026Moonshot AI ouvre Kimi K3 (2,8 T), déjà sous regard sécuritaire américain
2–3 août 2026Alibaba préannonce puis lance Qwen3.8-Max en API hébergée
10 août 2026Meta publie Muse Glimmer (30 B, Apache 2.0) et teaser les poids de Muse Spark 1.2
12 août 2026Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6
13 août 2026DeepSeek-V4-Pro passe en GA et annonce la hausse au 17 août ; Google livre Gemini 3.7 Flash en baisse
14 août 2026Zhipu livre GLM-5.3 sur la base 743 B de GLM-5.2
17 août 2026, 00:00 PékinLes nouveaux tarifs DeepSeek s'appliquent

En reculant : le 30 juillet, OpenAI baisse GPT-5.6 Luna de 80 %, puis les 6–7 août en fait le modèle par défaut des comptes gratuits, avec chat texte illimité. Pendant que les labos chinois montent les prix et ouvrent des flagships, les labos américains baissent et gratifient le grand public. Ce n'est pas un hasard : deux faces de la même bataille. Voir aussi la fiche de lancement Qwen3.8-Max, les anciens tarifs V4 Flash et la baisse GPT-5.6 Luna / Terra / Sol.

Les chiffres : ce qui change vraiment

DeepSeek passe à la tarification horaire le 17 août à 00:00 Pékin (16:00 UTC le 16 août). Heures de pointe : 9 h–12 h et 14 h–18 h Pékin (01:00–04:00 et 06:00–10:00 UTC). Le tableau convertit l'annonce officielle à environ 7,15 pour 1. Vérifiez la page tarifaire DeepSeek avant tout budget.

Poste (par million de tokens)AncienHeures creusesPointeHausse pointe
V4-Flash entrée cache hit$0,003$0,007$0,014~400 %
V4-Flash entrée cache miss$0,14$0,21$0,42200 %
V4-Flash sortie$0,28$0,63$1,26350 %
V4-Pro entrée cache hit$0,0035$0,021$0,042~1 100 %
V4-Pro entrée cache miss$0,42$0,63$1,26200 %
V4-Pro sortie$0,84$1,89$3,78350 %

Le « 1 100 % » ne concerne que l'entrée cache hit en pointe, le palier le plus proche de zéro. La sortie, qui pèse sur la facture, monte de 350 %. Un scénario tiers (environ 84 M de tokens/mois, surtout en heures creuses, moitié de hits) donne plutôt 1,8×.

Qwen3.8-2.4T-A95B : spécifications

RubriqueDétail
Paramètres2,4 T au total, 95 B actifs (MoE, 512 experts, 10 routés + 1 partagé)
Contexte262 144 tokens natifs, extensible à ~1,01 M ; Max hébergé à 1 M par défaut
CadenceAperçu 2 août → API 3 août → poids 12 août
API internationale$2/M entrée, $6/M sortie
LicencePas Apache 2.0 — Qwen3.8-Max License maison
EnjeuPremier Max d'Alibaba en open weight ; 3.5 / 3.6 / 3.7 Max restaient API

GLM-5.3 contre GLM-5.2 : même base, post-entraînement seul

BancGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Chiffres Zhipu, sans rerun tiers publié. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). C'est un premier rang open-weight, pas une victoire frontier.

Six étapes pour reconstruire votre facture

  1. Projeter les heures de pointe. Pékin 9 h–12 h et 14 h–18 h = UTC 01:00–04:00 et 06:00–10:00. La journée US est surtout en heures creuses ; la matinée d'Europe de l'Ouest recouvre la seconde fenêtre.
  2. Séparer entrée et sortie. +350 % en sortie porte la facture. L'entrée hit reste petite même après ×12.
  3. Estimer le taux de cache. Prompts système stables et préfixes RAG le montent. Contextes longs neufs et agents one-shot ressemblent à des misses.
  4. Revaloriser le mois dernier. 84 M de tokens, surtout creux, moitié hits ≈ 1,8×.
  5. Comparer les substituts. Qwen3.8-Max international ($2 / $6), GPT-5.6 Luna ($0,20 / $1,20), Claude Opus 5 (~$5 / ~$25).
  6. Décaler, changer ou auto-héberger. Les lots partent en heures creuses. Un checkpoint 2,4 T local demande un hôte dédié, pas un notebook partagé — utile aussi pour les flux Xcode / Agent sur Mac Apple Silicon.

Tarifs et licences bougent. Sources primaires :

DeepSeek API Docs : Models & Pricing

Hugging Face : Qwen3.8-2.4T-A95B et LICENSE

Z.ai : note technique GLM-5.3

South China Morning Post : clauses commerciales Qwen3.8-Max

Trois stratégies, trois logiques

DeepSeek : du forfait plat à l'heure. C'est un problème de capacité. Lire « le modèle le moins cher de Chine cède à la marge » est le plus court chemin, et le plus faux. Tant que les GPU suivaient, le tarif toujours bas servait d'acquisition. Quand l'usage a explosé et pas la capacité, il a fallu rendre la rareté visible. « Encourager un ordonnancement plus souple » signifie : le compute de pointe manque, décalez vous-mêmes.

Détail peu repris : en pointe, l'API officielle dépasse déjà certains revendeurs (GMI Cloud, Novita, etc.). « L'officiel est toujours le moins cher » ne tient plus.

Alibaba : les poids achètent l'écosystème ; la licence maison protège le plafond de revenus. Le checkpoint 2,4 T se télécharge, mais pas sous Apache 2.0. Un métier « Model-as-a-Service » ou « AI Work Assistant » au-delà de 50 M$ sur 12 mois doit négocier une licence séparée. Un produit à plus de 100 M de MAU ou 20 M$ de revenu mensuel doit afficher le nom du modèle.

La logique : gagner les développeurs, surtout à l'international, et garder un levier sur les rares acteurs capables d'en faire un métier d'inférence. Muse Glimmer (Apache 2.0 sans clause) n'est pas le même « ouvert ».

La rumeur d'une interdiction de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée est fausse. Le fichier LICENSE n'a aucune clause territoriale.

GLM-5.3 : pas de nouvelle base, un plus gros pari de post-entraînement. Même 743 B, pas de réentraînement, Terminal-Bench 3.0 de 4,6 % à 28,3 %. Quand le pretraining s'essouffle, le RL de post-entraînement devient un levier autonome, moins cher qu'un nouveau fondationnel — et plus accessible aux labos intermédiaires qui livrent des agents de code.

Comparatif : DeepSeek reste-t-il le flagship le moins cher ?

ModèleEntrée / 1 MSortie / 1 MPoids ouverts
DeepSeek V4-Pro (pointe)$1,26$3,78Non
DeepSeek V4-Pro (creux)$0,63$1,89Non
Qwen3.8-Max (API internationale)$2,00$6,00Oui (licence maison)
OpenAI GPT-5.6 Luna$0,20$1,20Non
Claude Opus 5 (ratio Alibaba)~$5,00~$25,00Non

Réponse courte : non. Le creux V4-Pro reste sous Claude Opus 5, mais ce n'est plus le moins cher du tableau. Qwen3.8-Max international et Luna sous-cotent DeepSeek creux sur au moins un axe. « Modèle chinois = modèle le moins cher » valait en 2025 et début 2026 ; ce n'est plus une hypothèse sûre.

Points contestés ou non vérifiés

  • « 1 100 % » est exact, trompeur sans contexte. Uniquement l'entrée cache hit en pointe. Sortie +350 %.
  • Inférence sur puces Zhenwu M890 : pas de confirmation dans la doc technique Alibaba ni de banc tiers. Non vérifié.
  • Faille « grave » Cursor via GLM-5.3 : VentureBeat et Zhipu. Détails absents : source vendeur, non auditée.
  • Contrôles d'export de représailles : presse, pas d'annonce officielle.

Pourquoi ça compte : deux guerres de prix en parallèle

Depuis environ un mois, les labos chinois enchaînent à un rythme que la presse financière locale appelle « trois mises à jour par semaine » — plus Kimi K3 (16 juillet, 2,8 T) et MiniMax H3. Le cadrage chinois parle de repricing mondial ; la presse anglophone traite souvent des sorties isolées.

Les labos américains font l'inverse côté grand public : OpenAI baisse de 80 % le 30 juillet puis rend le modèle gratuit et illimité une semaine plus tard. Google livre le 13 août un modèle code à la moitié du prix de son prédécesseur de trois semaines. Deux stratégies réelles, deux étages d'entonnoir.

Couche géopolitique : Kimi K3 a déjà attiré le regard américain. Certains analystes lisent la fenêtre 2,4 T d'Alibaba comme une prise d'esprit international avant un durcissement possible. Interprétation, pas fait établi — mais un contexte que les seules news produit manquent.

FAQ

DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude ?

En heures creuses, oui face à Claude Opus 5. Plus le moins cher globalement : Luna ($0,20 / $1,20) et Qwen3.8-Max international ($2 / $6) sous-cotent au moins un axe.

Puis-je utiliser les poids Qwen3.8-Max gratuitement en commercial ?

Projets personnels et usage interne : oui. Un métier MaaS ou assistant IA au-delà de 50 M$ sur 12 mois exige une licence séparée. Au-delà de 100 M de MAU ou 20 M$ de revenu mensuel, le nom du modèle doit être affiché.

Qwen3.8-Max est-il interdit aux utilisateurs US, UE ou UK ?

Non. La licence n'a aucune restriction géographique. Les seuils tiennent au chiffre d'affaires, pas au lieu.

Quelle est la vraie différence entre GLM-5.3 et GLM-5.2 ?

Aucune au niveau de la base (743 B). Le saut d'environ 6× sur Terminal-Bench 3.0 vient du RL de post-entraînement, sans réentraînement de fondation.

Meta ouvrira-t-il vraiment son flagship, pas seulement Muse Glimmer ?

Pas encore. Glimmer est un 30 B distillé. Zuckerberg annonce Muse Spark 1.2 « bientôt ». Intention, pas fait.

Tarifs horaires, licence maison et checkpoint 2,4 T la même semaine changent le métier : décaler les lots, lire le LICENSE, reproduire des bancs d'agents dans un environnement que l'on peut effacer. Les notebooks partagés et les API à garde-fous suffisent rarement. Quand il faut un Mac Apple Silicon dédié, réinitialisable, livré par MDM, avec SSH et VNC, le Mac mini cloud VMSPIN à la journée convient aux evals open-weight et aux sandboxes d'agents — y compris les flux développeurs Xcode. Voir aussi le guide de location Mac mini M4 et la page des tarifs.