Wer die chinesische Frontier-Modell-Welle im Sommer 2026 verfolgt und entscheiden muss, ob Qwen3.8-Max in Produktions-APIs gehört, auf Open Weights gewartet oder hinter Kimi K3 und DeepSeek V4 eingeordnet wird, findet hier Timeline, Kerndaten, Gegenüberstellung und Transparenzlücken. Kurzantwort zur Offenheit: noch nicht — Alibaba taggte das Modell am GA-Tag (3. August) als „Open-Source“, doch kein Hugging-Face-Repository existiert, und alle Benchmarks stammen aus dem eigenen Test-Harness.

Timeline: Was ausgeliefert wurde — und was nicht

  • 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8T MoE).
  • 19. Juli: Qwen3.8-Max-Preview zu 10 % des späteren Standardpreises, ohne aktive Parameterzahl.
  • 27. Juli: Kimi K3 liefert Open Weights auf Hugging Face.
  • 31. Juli: DeepSeek V4-Flash übertrifft V4-Pro auf neun Agentic-/Coding-Benchmarks ohne Parameterzuwachs.
  • 3. August: Qwen3.8-Max GA, Agent-Produkt „Qwen Office“. Alibaba-Aktien +7 % (HK).
  • „Nächste Woche“ (~10. August): Open Weights für Qwen3.8-Max und Qwen3.8-27B angekündigt — kein Repo, keine Lizenz.

Auf der Arena Text Arena (Snapshot 1. August) Rang #5 mit 1.496 Punkten (Preliminary) — einziges Nicht-Anthropic-Modell in den Top 8. Alle Scores sind vendor-run.

Die veröffentlichten Zahlen

SpezifikationQwen3.8-Max
Gesamt / aktive Parameter2,4T / 95B
ArchitekturSparse MoE + Hybrid-Attention
Kontext1M Token
API-Preis$2 / $6 pro 1M Input/Output
Arena Text#5, 1.496 Pkt. (Preliminary)
Open Weightsversprochen, nicht live

Was 2,4 Billionen Parameter praktisch bedeuten

Nur 95B Parameter werden pro Token aktiviert — Inferenzkosten folgen der aktiven Zahl, nicht der Gesamtkapazität. Daher $2/$6 statt Claude Opus 5 ($5/$25) oder Fable 5 ($10/$50). reasoning_effort bietet low/medium/xhigh über enable_thinking oder Anthropic-kompatibles reasoning.effort.

  1. API-Kompatibilität (OpenAI/Anthropic) prüfen.
  2. reasoning_effort nach Aufgabe wählen, Token-Kosten steuern.
  3. Für On-Premise Qwen3.8-27B Open Weights abwarten.
  4. A/B-Tests im eigenen Workload fahren.
  5. Hugging-Face-Repo und Lizenz beobachten.
  6. Gegen Kimi K3 und DeepSeek V4 benchmarken.

Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude

ModellPreis (In/Out)Open WeightsUnabhängiger Benchmark
Qwen3.8-Max$2 / $6angekündigtkeiner
Kimi K3$3 / $1527. Juli liveArtificial Analysis ≈ 57,11
DeepSeek V4-Flashnicht voll publiziertlive9 Benches > V4-Pro
Claude Fable 5$10 / $50geschlossenArena Text #1

Im einzigen unabhängigen Blindtest (269-Dateien-Architekturaufgabe): Kimi K3 83, Qwen3.8-Max-Preview 80 — Gleichstand. API-Kontext: GPT-5.6-Preissenkung.

Verifizierbare Fakten und Quellen

  • MoE-Effizienz: 2,4T gesamt / 95B aktiv (Alibaba Launch-Material).
  • Arena: Snapshot 1. August, Rang #5, Preliminary (Arena.ai).
  • Blindtest: 83 vs. 80 (Drittanbieter, nicht Alibaba).

Arena.ai öffentliche Leaderboards

Alibaba Cloud offizielle Ankündigungen

Das Open-Source-Label-Problem

  1. „Open-Source“-Tag am GA-Tag, Gewichte fehlen.
  2. Alle Benchmarks vendor-run inkl. eigener Suites.
  3. Preview ohne aktive Parameterzahl und Model Card.

Bei API-Nutzung mit personenbezogenen Daten in EU-Workloads gelten weiterhin DSGVO-Anforderungen an Verarbeitung, Auftragsverarbeitung und Datenresidenz — unabhängig vom Modellhersteller.

FAQ

Ist Qwen3.8-Max jetzt Open Source?

Nein. API live, Gewichte auf Hugging Face/ModelScope noch nicht. „Nächste Woche“ ohne festes Datum.

Vergleich mit Kimi K3?

83 vs. 80 im Blindtest — Gleichstand. Kimi K3 hat öffentliche Gewichte; Qwen3.8-Max günstigere API und Multimodalität.

Bis Gewichte und unabhängige Reproduktionen vorliegen, lohnt sich für Qwen3.8-27B- oder Agent-Validierung auf echter Apple Silicon oft ein dedizierter physischer Host mit Reset-on-Demand. VMSPIN Cloud Mac mini ab Tagesmiete mit MDM-Provisioning und SSH+VNC. Siehe auch Mac-mini-M4-Mietguide und Preisseite.