Wer: Teams, die DeepSeek, Qwen oder GLM als API wählen oder Open Weights selbst hosten. Problem: In fünf Tagen hebt DeepSeek Peak-Tarife um bis zu 1.100 % an, Alibaba legt ein 2,4-Billionen-Parameter-Flagschiff offen, das nie veröffentlicht war, und Zhipu liefert GLM-5.3 mit rund sechsfachem Coding-Sprung auf demselben Basismodell. Fazit: Chinesische Labore konkurrieren nicht mehr nur über den Preis, sondern über Preismacht. Der Text folgt Zeitlinie, Tarifblatt, einer sechsschrittigen Rechnung, drei Strategien, einem Vergleich, ungeprüften Behauptungen und FAQ.
In fünf Tagen wirken drei Züge widersprüchlich. DeepSeek erhöht bestimmte API-Stufen um bis zu 1.100 %. Alibaba veröffentlicht in derselben Woche ein 2,4-Billionen-Flagschiff. Zhipu liefert GLM-5.3 ohne Neutraining der 743-Milliarden-Basis. Gemeinsam verschiebt sich der Wettbewerb von reiner Billigkeit auf Preismacht.
Zeitlinie: Was wann passiert ist
| Datum | Ereignis |
|---|---|
| 16. Jul 2026 | Moonshot AI veröffentlicht Kimi K3 (2,8 Bio. Parameter); US-Sicherheitsprüfung folgt |
| 2.–3. Aug 2026 | Alibaba kündigt Qwen3.8-Max an und startet die gehostete API |
| 10. Aug 2026 | Meta liefert Muse Glimmer (30B, Apache 2.0) und kündigt Gewichte für Muse Spark 1.2 an |
| 12. Aug 2026 | Alibaba legt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6 |
| 13. Aug 2026 | DeepSeek-V4-Pro wird GA und kündigt die Erhöhung zum 17. Aug an; Google senkt Gemini 3.7 Flash |
| 14. Aug 2026 | Zhipu liefert GLM-5.3 auf der 743B-Basis von GLM-5.2 |
| 17. Aug 2026, 00:00 Peking | Neue DeepSeek-Tarife gelten |
Weiter gezoomt: Am 30. Juli senkt OpenAI GPT-5.6 Luna um 80 %, am 6.–7. August wird Luna kostenloses Standardmodell mit unbegrenztem Textchat. Während chinesische Labore Preise anheben und Flagschiff-Gewichte öffnen, verbilligen US-Labore die Verbraucherschicht. Das ist dieselbe Preisauseinandersetzung. Spezifikationen zum Launch: Qwen3.8-Max-Release, alte V4-Flash-Flattarife: DeepSeek V4 Flash, OpenAI-Schnitt: GPT-5.6 Luna / Terra / Sol.
Die Zahlen: Was sich wirklich ändert
DeepSeek wechselt am 17. Aug 00:00 Peking (16:00 UTC am 16. Aug) auf Tageszeit-Tarife. Peak: 9–12 und 14–18 Uhr Peking (01:00–04:00 und 06:00–10:00 UTC). Die Tabelle rechnet die Amtsmitteilung mit etwa 7,15 in USD um. Verbindlich bleibt DeepSeeks Preisseite. Wer Tokens in der EU verarbeitet, prüft zusätzlich die eigene DSGVO-Dokumentation zu Auftragsverarbeitung und Speicherort – die Tarifänderung ändert die Rechtslage nicht, aber sie ändert, welche Logs Sie intern halten müssen.
| Position (je 1 Mio. Tokens) | Alt | Off-Peak neu | Peak neu | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit Eingabe | $0,003 | $0,007 | $0,014 | ~400 % |
| V4-Flash Cache-Miss Eingabe | $0,14 | $0,21 | $0,42 | 200 % |
| V4-Flash Ausgabe | $0,28 | $0,63 | $1,26 | 350 % |
| V4-Pro Cache-Hit Eingabe | $0,0035 | $0,021 | $0,042 | ~1.100 % |
| V4-Pro Cache-Miss Eingabe | $0,42 | $0,63 | $1,26 | 200 % |
| V4-Pro Ausgabe | $0,84 | $1,89 | $3,78 | 350 % |
Die Schlagzeile „1.100 %“ gilt nur für Peak-Cache-Hit-Eingabe. Ausgabe – der Posten, der die Rechnung trägt – steigt um 350 %. Eine Drittanalyse (rund 84 Mio. Tokens/Monat, überwiegend Off-Peak, etwa 50 % Hits) landet näher bei 1,8× als bei 11×.
Qwen3.8-2.4T-A95B: Kernspezifikation
| Merkmal | Wert |
|---|---|
| Parameter | 2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt) |
| Kontext | 262.144 Tokens nativ, erweiterbar auf ~1,01 Mio.; gehostetes Max standardmäßig 1 Mio. |
| Takt | Vorschau 2. Aug → API 3. Aug → Gewichte 12. Aug |
| Internationale API | $2/M Eingabe, $6/M Ausgabe |
| Lizenz | Nicht Apache 2.0 — eigene Qwen3.8-Max License |
| Bedeutung | Erstes Max-Flagschiff von Alibaba als Open Weight; 3.5/3.6/3.7 Max blieben API-only |
GLM-5.3 gegen GLM-5.2: dieselbe Basis, nur Post-Training
| Benchmark | GLM-5.2 | GLM-5.3 | Delta |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Zahlen stammen von Zhipu. Eine unabhängige Wiederholung fehlt. Auf Terminal-Bench 3.0 liegt GLM-5.3 hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Es ist Spitze unter Open Weights, kein Frontier-Sieg.
Sechs Schritte von der Schlagzeile zur Rechnung
- Peak in Ihre Zeitzone legen. Peking 9–12 und 14–18 Uhr ist UTC 01:00–04:00 und 06:00–10:00. US-Geschäftszeiten sind meist Off-Peak; mitteleuropäischer Vormittag trifft das zweite Fenster.
- Eingabe und Ausgabe trennen. +350 % Ausgabe trägt die Rechnung. Cache-Hit-Eingabe bleibt trotz 12× klein.
- Hit-Rate schätzen. Stabile Systemprompts und RAG-Präfixe heben sie. Frische Langkontexte und One-Shot-Agenten wirken wie Misses.
- Letzten Monat neu bepreisen. 84 Mio. Tokens, überwiegend Off-Peak, Hälfte Hits ≈ 1,8×.
- Substitute rechnen. Qwen3.8-Max international ($2 / $6), GPT-5.6 Luna ($0,20 / $1,20), Claude Opus 5 (~$5 / ~$25).
- Verschieben, wechseln oder selbst hosten. Batches gehen Off-Peak. Wer den 2,4T-Checkpoint lokal fährt, braucht einen dedizierten Host, kein geteiltes Notebook – und eine nachvollziehbare Datenverarbeitung im Sinne der DSGVO.
Tarife und Lizenztexte ändern sich. Primärquellen vor Budget und Veröffentlichung:
DeepSeek API Docs: Models & Pricing
Hugging Face: Qwen3.8-2.4T-A95B und LICENSE
South China Morning Post: kommerzielle Klauseln zu Qwen3.8-Max
Drei Strategien, drei Logiken
DeepSeek: vom Flattarif zur Tageszeit. Das ist Kapazität, kein Strategiewechsel. Der kürzeste Fehlschluss lautet „Chinas Billigmodell knickt bei der Marge ein“. Die Struktur sagt das Gegenteil: Rechenknappheit wird erstmals im Preisblatt sichtbar. Solange GPUs mitwuchsen, funktionierte immer-günstig als Akquise. Als die Nutzung exponentiell stieg und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Lastverschiebung anregen“ heißt: Peak-Compute ist knapp, verschieben Sie selbst.
Ein Detail, das internationale Berichte oft auslassen: Im Peak liegt die offizielle API über mehreren Resellern (GMI Cloud, Novita und andere listen V4 Pro unter dem neuen Peak). „Offiziell ist immer am günstigsten“ gilt nicht mehr.
Alibaba: Gewichte kaufen Ökosystem, die eigene Lizenz schützt die Ertragsdecke. Der 2,4T-Checkpoint ist frei ladbar, aber nicht unter Apache 2.0. Jedes „Model-as-a-Service“- oder „AI-Work-Assistant“-Geschäft über 50 Mio. USD in 12 Monaten braucht eine gesonderte Lizenz. Produkte mit über 100 Mio. MAU oder 20 Mio. USD Monatsumsatz müssen den Modellnamen sichtbar zeigen.
Die Logik: Entwickler-Mindshare gewinnen, vor allem international, und Verhandlungsmacht über die wenigen behalten, die darauf ein Inferencing-Geschäft bauen können. Meta Muse Glimmer (uneingeschränktes Apache 2.0) ist ein anderes „offen“.
Das Gerücht, Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea seien verboten, ist falsch. Der LICENSE-Text enthält keine Territorialklausel.
GLM-5.3: keine neue Basis, nur größeres Post-Training. Dieselbe 743B-Basis, kein Neutraining, Terminal-Bench 3.0 von 4,6 % auf 28,3 %. Wenn Pretraining-Skalierung abflacht, wird RL-Post-Training ein eigener Hebel – mit niedrigerer Kostenschwelle als ein neues Foundation-Modell.
Vergleich: Ist DeepSeek noch das günstigste Frontier-Modell?
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Open Weights |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | $1,26 | $3,78 | Nein |
| DeepSeek V4-Pro (Off-Peak) | $0,63 | $1,89 | Nein |
| Qwen3.8-Max (international) | $2,00 | $6,00 | Ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 | Nein |
| Claude Opus 5 (impliziert) | ~$5,00 | ~$25,00 | Nein |
Kurz: nein. Off-Peak V4-Pro bleibt unter Claude Opus 5, ist aber nicht mehr das billigste Angebot. Qwen3.8-Max international und Luna unterbieten DeepSeek Off-Peak auf mindestens einer Achse. „Chinesisches Modell = billigstes Modell“ galt 2025 und Anfang 2026; es ist keine sichere Annahme mehr.
Strittig oder ungeprüft
- „1.100 %“ ist korrekt, ohne Kontext irreführend. Nur Peak-Cache-Hit-Eingabe. Ausgabe +350 %.
- Zhenwu-M890-Inferenz ist in Alibabas Technikdokumenten und Drittbenchmarks nicht unabhängig bestätigt. Ungeprüft.
- „Schwere Cursor-Lücke“ durch GLM-5.3 stammt von VentureBeat und Zhipu. Details fehlen: herstellerseitig, nicht auditiert.
- Vergeltungs-Exportkontrollen des Handelsministeriums sind Medienvermutung, keine Amtsbekanntmachung.
Warum es zählt: zwei Preiskriege parallel
Seit etwa einem Monat liefern Chinas Top-Labore in einem Takt, den Finanzmedien „drei Updates pro Woche“ nennen – plus Kimi K3 (16. Jul, 2,8 Bio.) und MiniMax H3. Chinesische Berichte rahmen das als globale Neubepreisung; englischsprachige Tech-Presse behandelt oft isolierte Produktnews.
US-Labore laufen am Consumer-Ende entgegen: OpenAI senkt am 30. Jul um 80 % und macht das Modell eine Woche später frei und unbegrenzt. Google liefert am 13. Aug ein Coding-Modell zum halben Preis des drei Wochen alten Vorgängers. Beide Strategien sind real; sie optimieren verschiedene Trichterstufen.
Die geopolitische Schicht: Kimi K3 zog bereits US-Prüfung auf sich. Manche Analysten lesen Alibabas 2,4T-Fenster als Sicherung internationaler Parität vor möglicher Regulierung. Das ist Interpretation, kein Beleg – aber Kontext, den reine Produktnews auslassen.
FAQ
Ist DeepSeek nach der Erhöhung noch günstiger als GPT-5.6 oder Claude?
Off-Peak ja gegenüber Claude Opus 5. Nicht mehr das günstigste Gesamtangebot: Luna ($0,20 / $1,20) und Qwen3.8-Max international ($2 / $6) unterbieten mindestens eine Achse.
Darf ich Qwen3.8-Max-Gewichte kostenlos kommerziell nutzen?
Persönliche und interne Nutzung bleiben unberührt. Nur MaaS- oder AI-Work-Assistant-Geschäfte über 50 Mio. USD in 12 Monaten brauchen eine Extra-Lizenz. Über 100 Mio. MAU oder 20 Mio. USD Monatsumsatz gilt die Namenspflicht.
Ist Qwen3.8-Max für US-, EU- oder UK-Nutzer gesperrt?
Nein. Die LICENSE enthält keine Geoklausel. Grenzen hängen am Umsatz, nicht am Standort.
Was unterscheidet GLM-5.3 von GLM-5.2?
Dieselbe 743-Milliarden-Basis. Der rund sechsfache Terminal-Bench-3.0-Sprung kommt nur aus skaliertem RL-Post-Training.
Wird Meta das echte Flagschiff öffnen, nicht nur Muse Glimmer?
Noch nicht. Glimmer ist 30B destilliert. Zuckerberg kündigt Muse Spark 1.2 „bald“ an. Das ist Absicht, kein Fakt.
Tageszeit-Tarife, eine eigene Lizenz und ein 2,4T-Checkpoint in derselben Woche ändern die Arbeit: Last verschieben, LICENSE lesen, Agent-Benches in einer wischbaren Umgebung reproduzieren. Geteilte Notebooks und API-Leitplanken reichen oft nicht. Wer einen dedizierten, rücksetzbaren Apple-Silicon-Host mit Root, MDM sowie SSH und VNC braucht, findet in VMSPIN-Cloud-Mac-mini zum Tagessatz einen sauberen Weg für Open-Weight-Evals. Ergänzend: Mac-mini-M4-Mietleitfaden und Preisseite.