Wer im Sommer 2026 Agent-APIs für Produktionspipelines evaluiert und prüfen muss, ob DeepSeek V4-Flash-0731 wirtschaftlich tragfähig ist, findet hier eine datenbasierte Entscheidungsgrundlage: Zeitachse, Kernparameter, Preisvergleich und dokumentierte Einschränkungen. Am 31. Juli stufte DeepSeek V4-Flash mit Build-Tag „0731“ zur offiziellen API-Beta hoch — gleiche 284B/13B-Architektur wie im April-Preview, nur Post-Training neu — und schlägt das größere V4-Pro-Preview auf Agent-Benchmarks bei etwa 1/36 bis 1/179 des Claude-Opus-4.8-Preises. V4-Pro und das Harness-Framework sind weiterhin nicht veröffentlicht.
Was am 31. Juli wirklich ausgeliefert wurde — und was nicht
Die folgende Zeitachse trennt bestätigte Releases von Gerüchten. Für EU-Teams, die Prompts und Tool-Outputs über Cloud-APIs verarbeiten, ist der API-only-Charakter des Updates relevant: Die Verarbeitung personenbezogener Daten über Drittanbieter-APIs erfordert eine DSGVO-konforme Auftragsverarbeitung — unabhängig vom Tokenpreis.
- 24. April 2026: DeepSeek-V4-Preview mit zwei Open-Weight-MIT-MoE-Modellen — V4-Pro (1,6T gesamt / 49B aktiv) und V4-Flash (284B gesamt / 13B aktiv), jeweils 1M-Token-Kontext.
- 24. Juli 2026: Legacy-Aliase
deepseek-chatunddeepseek-reasonerwerden abgeschaltet; gesamter Traffic läuft auf die V4-Familie. - 27. Juli 2026: Moonshot AI veröffentlicht vollständige Open Weights für Kimi K3 (2,8T gesamt).
- 31. Juli 2026:
deepseek-v4-flashwird zur offiziellen öffentlichen API-Beta (Build „0731“) hochgestuft. Architektur und Parameterzahl unverändert — Gewinne ausschließlich durch erneutes Post-Training. Open Weights unter MIT auf Hugging Face. Changelog nennt erstmals „DeepSeek Harness“. Nur API — Consumer-App und Web-Chat bleiben unangetastet. - Stand 5. August 2026: Offizielles V4-Pro-Release unbestätigt. Chinesische Medien berichten über interne Tests ab der Woche vom 28. Juli mit möglichem GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt, als Gerücht behandeln.
„DeepSeek V4 offizielle Version“ suggeriert oft ein neues Modell. Dem war nicht so: DeepSeek betont ausdrücklich, dass die Gewinne ausschließlich aus erneutem Post-Training stammen — ein 284B/13B-Modell schlägt nun das 1,6T/49B-Modell derselben Familie auf mehreren agentischen Aufgaben.
Spezifikationen und API-Preise im Direktvergleich
| Modell | Status | Gesamt / Aktiv | Kontext | Input (Miss / Hit, pro 1M) | Output (pro 1M) | Lizenz |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31. Jul. 2026) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Nur Preview | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 (Moonshot AI) | Open Weights (27. Jul. 2026) | 2,8T / ~104B (Community-Schätzung) | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 (Zhipu / Z.ai) | Open (Juni 2026) | ~744B / ~40B | 1M | Hier nicht verifiziert | Hier nicht verifiziert | MIT |
| Qwen3.8-Max (Alibaba) | API GA (2. Aug. 2026) | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Weights ausstehend |
Alle Preisangaben stammen von Anbieter-Tariflisten. DeepSeek kündigte einen künftigen 2×-Peak-Hour-Zuschlag (9–12 Uhr und 14–18 Uhr Peking-Zeit) ohne festes Datum an. Preise und Specs können sich ändern — vor Produktionsentscheidungen auf offiziellen Seiten verifizieren. Wer EU-Daten über die API verarbeitet, sollte zusätzlich prüfen, ob ein Auftragsverarbeitungsvertrag (AVV) vorliegt und ob die Datenverarbeitung den Anforderungen der DSGVO entspricht.
Post-Training statt Skalierung: technische Hebel im Detail
Architektur unverändert — Trainingsdaten neu. V4-Flash-0731 ist in Größe und Struktur identisch mit dem April-Preview. Der gesamte Sprung auf Agent-Benchmarks kommt laut DeepSeek aus erneutem Post-Training, nicht aus Parameter-Skalierung.
Hybrid Attention, Hyper-Connections, Muon-Optimizer. Im Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ beschreibt DeepSeek drei Architekturänderungen:
- Hybrid Attention mit Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), vermarktet als „DSA“ (DeepSeek Sparse Attention), zur Reduktion von Compute und Speicher bei langen Kontexten;
- Manifold-Constrained Hyper-Connections (mHC) als Erweiterung klassischer Residual Connections;
- Muon-Optimizer für schnellere Konvergenz und Trainingsstabilität.
Bei 1M-Token-Kontext benötigt V4-Pro laut DeepSeek nur 27 % der per-Token-Inference-FLOPs und 10 % des KV-Cache-Footprints gegenüber V3.2 — anbieterseitige Effizienzangaben ohne unabhängige Dritt-Reproduktion.
Harness: DeepSeeks erstes In-House-Agent-Framework. Am 31. Juli erstmals offiziell genannt, positioniert als Alternative zu Claude Code. Alle veröffentlichten Agent-Benchmarks (Terminal Bench 2.0, Toolathlon u. a.) wurden mit Harness „minimal mode“ gemessen — noch nicht öffentlich — bei max reasoning effort, top_p 0,95, temperature 1,0. DeepSeek warnt selbst, dass Agent-Scores „extrem sensitiv auf Harness-Wahl“ reagieren.
Intelligence Index und Kosten pro Aufgabe: V4-Flash gegen Wettbewerber
| Modell | Lab | Release / Weights | Gesamt-Parameter | Artificial Analysis Intelligence Index | Ø Kosten pro Aufgabe |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31. Jul. 2026 (offiziell) | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16. Jul. Preview / 27. Jul. Weights | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu / Z.ai | Juni 2026 | ~744B | ~1 Punkt über V4-Flash | Hier nicht verifiziert |
| Qwen3.8-Max | Alibaba | 2. Aug. 2026 GA | 2,4T | Hier nicht verifiziert | Hier nicht verifiziert |
| GPT-5.6 Sol | OpenAI | Closed Source | Nicht offengelegt | 9+ Punkte über V4-Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed Source | Nicht offengelegt | 9+ Punkte über V4-Flash | $3,15 |
Intelligence Index und Kosten-pro-Aufgabe stammen von Artificial Analysis. DeepSeeks eigene Agent-Benchmarks nutzen eine andere Methodik. V4-Flash kostet pro Aufgabe etwa 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek zielt nicht auf Spitzenplatzierungen, sondern auf „ausreichende Intelligenz zum niedrigsten Preis“. Weitere Preiskontexte: GPT-5.6-Preissenkungen und API-Vergleich sowie Qwen3.8-Max-Release-Analyse.
Verifizierbare Kennzahlen und Quellen
- Post-Training als Treiber: V4-Flash-0731 erreichte 82,7 auf Terminal Bench 2.0 gegenüber 67,9 beim V4-Pro-Preview — gleiche 284B/13B-Architektur (DeepSeek-Changelog, Harness minimal mode).
- Long-Context-Effizienz: Bei 1M Tokens benötigt V4-Pro 27 % der per-Token-FLOPs und 10 % des KV-Cache von V3.2 (DeepSeek Technical Report).
- Unabhängiger Kostenvergleich: Artificial Analysis — V4-Flash $0,03 vs. Kimi K3 $0,86 vs. Claude Fable 5 $3,15 pro Aufgabe.
- OpenRouter-Nutzung: Das V4-Flash-Preview führte sieben Wochen in Folge die Most-Used-Rangliste an — Signal, dass Agent-Workloads Unit Economics über Peak-Intelligenz priorisieren.
Offizielle und unabhängige Quellen — aktuelle Zahlen vor Veröffentlichung bestätigen:
DeepSeek offizielle API-Dokumentation und Changelog
Hugging Face DeepSeek Model Cards (DeepSeek-V4-Pro, DeepSeek-V4-Flash)
Artificial Analysis unabhängige Modell-Benchmarks
Benchmarks kritisch lesen: dokumentierte Grenzen
- Agent-Scores sind harness-abhängig und anbieterseitig gemessen. Terminal Bench 2.0 mit 82,7 wurde mit DeepSeeks noch nicht veröffentlichtem Harness in minimal mode erzielt. Bis Dritte mit anderen Frameworks (Claude Code, Cursor u. a.) reproduzieren, als „Vendor plus spezifisches Framework“ behandeln.
- Praxisbeschwerden existieren. Das chinesische Wirtschaftsblatt 21st Century Business Herald berichtet über niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts auf dem offiziellen V4-Flash-Build.
- V4-Pro- und Harness-Release-Daten unbestätigt. Das GA-Fenster 10.–20. August aus anonymen Quellen ist ein Gerücht — der Changelog sagt nur, V4-Pro folge „so bald wie möglich“.
- Finanzierungs- und IPO-Berichte nicht unabhängig bestätigt. Medien berichten über eine ~$7,4-Mrd.-Runde bei ~$48,7 Mrd. Bewertung — anonyme Quellen, keine regulatorischen Filings oder DeepSeek-Erklärungen.
Die „Kill Line“: warum chinesische Entwickler umdenken
Vor V4-Flash-0731 verspotteten chinesische Foren DeepSeek-Gründer Liang Wenfeng als „Liang Baikai“ (sinngemäß „Liang Leeres Versprechen“) wegen des verpassten V4-Pro-Ziels Mitte Juli. Nach dem offiziellen Flash-Build kehrte die Stimmung zu „Liang Sheng“ („Liang der Weise“).
Substanzieller ist der Begriff „斩杀线“ (zhǎn shā xiàn), wörtlich „Kill Line“: DeepSeeks Kombination aus ausreichender Leistung und Mindestpreis setzt eine effektive Schwelle — Wettbewerber, die weder klar überlegen noch günstiger sind, verlieren Relevanz. Das erklärt Bewegungen wie OpenAIs gemeldete 80-%-Preissenkung auf der GPT-5.6-Luna-Stufe. Am 31. Juli, als V4-Flash offiziell wurde, reagierten Nvidia, Broadcom und AMD kaum an der Börse — im Gegensatz zum AI-Chip-Selloff Anfang 2025 nach DeepSeek-R1-Effizienzclaims.
FAQ
Ist DeepSeek V4 Open Source?
Ja. V4-Pro und V4-Flash, einschließlich Build V4-Flash-0731 vom 31. Juli 2026, liegen als Open Weights unter MIT auf Hugging Face und dürfen kommerziell genutzt, feinabgestimmt und weiterverbreitet werden.
Wie viel günstiger ist V4-Flash als Claude?
Laut 21st Century Business Herald liegt V4-Flash etwa 36× günstiger als Claude Opus 4.8 bei Cache-Miss-Input, ~179× bei Cache-Hit-Input und ~89× bei Output — pro Million Tokens. Das sind Anbieter-Listenpreise, keine unabhängige Prüfung.
Wann erscheint die offizielle V4-Pro-Version?
Kein bestätigtes Datum. Der Changelog nennt nur „so bald wie möglich“. Berichte über 10.–20. August stammen aus anonymen chinesischen Medienquellen und sind von DeepSeek nicht bestätigt.
Kann man DeepSeeks Benchmark-Zahlen vertrauen?
Teilweise. Weit verbreitete Dritt-Benchmarks wie SWE-bench Verified haben mehr Gewicht. Agent-spezifische Scores (Terminal Bench 2.0, Toolathlon) wurden mit dem noch nicht veröffentlichten Harness gemessen; DeepSeek warnt selbst vor starker Harness-Abhängigkeit.
Was ist DeepSeek Harness?
DeepSeeks erstes eigenes Agent-Ausführungsframework, positioniert als In-House-Alternative zu Claude Code für Dateibearbeitung, Tool-Calls und mehrstufige Engineering-Aufgaben. Erstmals im Changelog vom 31. Juli 2026 genannt, noch nicht öffentlich verfügbar.
DeepSeek V4-Flash-0731 treibt das „ausreichende Intelligenz zum Mindestpreis“-Playbook voran — Harness ist jedoch noch nicht öffentlich und V4-Pro hat kein bestätigtes GA-Datum. Bis unabhängige Reproduktionen vorliegen, ist zum Validieren lokaler Agent-Workflows auf echter Apple-Silicon-Hardware ein dedizierter physischer Host, den Sie jederzeit zurücksetzen können, oft planbarer als ein geteilter GPU-Pool — besonders wenn DSGVO-konforme Testdaten nicht in fremde Cloud-Umgebungen wandern sollen. VMSPINs Cloud-Mac-mini-Tagesmiete liefert MDM-Auto-Provisioning sowie SSH- und VNC-Zugang für kurze Benchmark-Läufe und Multi-Toolchain-Vergleiche. Ergänzend: Mac-mini-M4-Miet-Leitfaden und Preisseite, wenn Sie API-Kosten gegen lokales Deployment abwägen.