Wer die chinesische Frontier-Modell-Welle im Sommer 2026 verfolgt und entscheiden muss, ob Qwen3.8-Max in Produktions-APIs gehört, auf Open Weights gewartet oder hinter Kimi K3 und DeepSeek V4 eingeordnet wird, findet hier Timeline, Kerndaten, Gegenüberstellung und Transparenzlücken. Kurzantwort zur Offenheit: noch nicht — Alibaba taggte das Modell am GA-Tag (3. August) als „Open-Source“, doch kein Hugging-Face-Repository existiert, und alle Benchmarks stammen aus dem eigenen Test-Harness.
Timeline: Was ausgeliefert wurde — und was nicht
- 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8T MoE).
- 19. Juli: Qwen3.8-Max-Preview zu 10 % des späteren Standardpreises, ohne aktive Parameterzahl.
- 27. Juli: Kimi K3 liefert Open Weights auf Hugging Face.
- 31. Juli: DeepSeek V4-Flash übertrifft V4-Pro auf neun Agentic-/Coding-Benchmarks ohne Parameterzuwachs.
- 3. August: Qwen3.8-Max GA, Agent-Produkt „Qwen Office“. Alibaba-Aktien +7 % (HK).
- „Nächste Woche“ (~10. August): Open Weights für Qwen3.8-Max und Qwen3.8-27B angekündigt — kein Repo, keine Lizenz.
Auf der Arena Text Arena (Snapshot 1. August) Rang #5 mit 1.496 Punkten (Preliminary) — einziges Nicht-Anthropic-Modell in den Top 8. Alle Scores sind vendor-run.
Die veröffentlichten Zahlen
| Spezifikation | Qwen3.8-Max |
|---|---|
| Gesamt / aktive Parameter | 2,4T / 95B |
| Architektur | Sparse MoE + Hybrid-Attention |
| Kontext | 1M Token |
| API-Preis | $2 / $6 pro 1M Input/Output |
| Arena Text | #5, 1.496 Pkt. (Preliminary) |
| Open Weights | versprochen, nicht live |
Was 2,4 Billionen Parameter praktisch bedeuten
Nur 95B Parameter werden pro Token aktiviert — Inferenzkosten folgen der aktiven Zahl, nicht der Gesamtkapazität. Daher $2/$6 statt Claude Opus 5 ($5/$25) oder Fable 5 ($10/$50). reasoning_effort bietet low/medium/xhigh über enable_thinking oder Anthropic-kompatibles reasoning.effort.
- API-Kompatibilität (OpenAI/Anthropic) prüfen.
reasoning_effortnach Aufgabe wählen, Token-Kosten steuern.- Für On-Premise Qwen3.8-27B Open Weights abwarten.
- A/B-Tests im eigenen Workload fahren.
- Hugging-Face-Repo und Lizenz beobachten.
- Gegen Kimi K3 und DeepSeek V4 benchmarken.
Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude
| Modell | Preis (In/Out) | Open Weights | Unabhängiger Benchmark |
|---|---|---|---|
| Qwen3.8-Max | $2 / $6 | angekündigt | keiner |
| Kimi K3 | $3 / $15 | 27. Juli live | Artificial Analysis ≈ 57,11 |
| DeepSeek V4-Flash | nicht voll publiziert | live | 9 Benches > V4-Pro |
| Claude Fable 5 | $10 / $50 | geschlossen | Arena Text #1 |
Im einzigen unabhängigen Blindtest (269-Dateien-Architekturaufgabe): Kimi K3 83, Qwen3.8-Max-Preview 80 — Gleichstand. API-Kontext: GPT-5.6-Preissenkung.
Verifizierbare Fakten und Quellen
- MoE-Effizienz: 2,4T gesamt / 95B aktiv (Alibaba Launch-Material).
- Arena: Snapshot 1. August, Rang #5, Preliminary (Arena.ai).
- Blindtest: 83 vs. 80 (Drittanbieter, nicht Alibaba).
Arena.ai öffentliche Leaderboards
Alibaba Cloud offizielle Ankündigungen
Das Open-Source-Label-Problem
- „Open-Source“-Tag am GA-Tag, Gewichte fehlen.
- Alle Benchmarks vendor-run inkl. eigener Suites.
- Preview ohne aktive Parameterzahl und Model Card.
Bei API-Nutzung mit personenbezogenen Daten in EU-Workloads gelten weiterhin DSGVO-Anforderungen an Verarbeitung, Auftragsverarbeitung und Datenresidenz — unabhängig vom Modellhersteller.
FAQ
Ist Qwen3.8-Max jetzt Open Source?
Nein. API live, Gewichte auf Hugging Face/ModelScope noch nicht. „Nächste Woche“ ohne festes Datum.
Vergleich mit Kimi K3?
83 vs. 80 im Blindtest — Gleichstand. Kimi K3 hat öffentliche Gewichte; Qwen3.8-Max günstigere API und Multimodalität.
Bis Gewichte und unabhängige Reproduktionen vorliegen, lohnt sich für Qwen3.8-27B- oder Agent-Validierung auf echter Apple Silicon oft ein dedizierter physischer Host mit Reset-on-Demand. VMSPIN Cloud Mac mini ab Tagesmiete mit MDM-Provisioning und SSH+VNC. Siehe auch Mac-mini-M4-Mietguide und Preisseite.