Если вы отслеживаете летнюю волну китайских frontier-моделей 2026 года и решаете, стоит ли Qwen3.8-Max идти в продакшен-API, ждать открытых весов или уступить место Kimi K3 и DeepSeek V4, этот разбор даёт таймлайн, спецификации, прямое сравнение и пробелы в прозрачности. Короткий ответ про открытость: пока нет — Alibaba пометила модель «Open-Source» в день GA (3 августа), но репозитория на Hugging Face нет, а все бенчмарки — из собственного test harness.
Таймлайн: что вышло — и что ещё нет
- 16 июля: Moonshot AI выпускает Kimi K3 (MoE 2,8T).
- 19 июля: превью Qwen3.8-Max за 10 % будущей цены, без числа активных параметров.
- 27 июля: Kimi K3 публикует веса на Hugging Face.
- 31 июля: DeepSeek V4-Flash обходит V4-Pro на девяти agentic/coding-бенчмарках без роста параметров.
- 3 августа: GA Qwen3.8-Max, агент «Qwen Office». Акции Alibaba +7 % (HK).
- «На следующей неделе» (~10 августа): обещаны веса Qwen3.8-Max и Qwen3.8-27B — репо и лицензии нет.
На Arena Text Arena (снимок 1 августа) — #5, 1496 очков (Preliminary): единственная не-Anthropic модель в топ-8. Все оценки — vendor-run.
Цифры из релиза Alibaba
| Параметр | Qwen3.8-Max |
|---|---|
| Всего / активных параметров | 2,4T / 95B |
| Архитектура | Sparse MoE + гибридное внимание |
| Контекст | 1M токенов |
| Цена API | $2 / $6 за 1M input/output |
| Arena Text | #5, 1496 (Preliminary) |
| Открытые веса | обещаны, не опубликованы |
Что на практике означают 2,4 трлн параметров
На токен активируется только 95B — стоимость инференса следует за активным числом, отсюда $2/$6 против Claude Opus 5 ($5/$25) и Fable 5 ($10/$50). reasoning_effort: low/medium/xhigh через enable_thinking или Anthropic-совместимый reasoning.effort.
- Проверить совместимость API (OpenAI/Anthropic).
- Выбрать
reasoning_effortпод задачу и контролировать расход токенов. - Для on-premise ждать открытых весов Qwen3.8-27B.
- Прогнать A/B на своём workload.
- Отслеживать репозиторий и лицензию на Hugging Face.
- Бенчмарк против уже открытых Kimi K3 и DeepSeek V4.
Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Модель | Цена (in/out) | Открытые веса | Независимый бенч |
|---|---|---|---|
| Qwen3.8-Max | $2 / $6 | обещаны | нет |
| Kimi K3 | $3 / $15 | 27 июля | Artificial Analysis ≈ 57,11 |
| DeepSeek V4-Flash | не полностью опубликована | да | 9 бенчей > V4-Pro |
| Claude Fable 5 | $10 / $50 | закрыта | Arena Text #1 |
Единственный независимый слепой тест (269 файлов, архитектура): Kimi K3 — 83, Qwen3.8-Max-Preview — 80. Паритет. Контекст цен API: снижение цен GPT-5.6.
Проверяемые факты и источники
- Эффективность MoE: 2,4T всего / 95B активных (материалы Alibaba).
- Arena: снимок 1 августа, #5, Preliminary (Arena.ai).
- Слепой тест: 83 vs 80 (третья сторона, не Alibaba).
Arena.ai — публичные лидерборды
Alibaba Cloud — официальные анонсы
Проблема метки open source
- Тег «Open-Source» в день GA, весов нет.
- Все бенчмарки — внутренний прогон вендора.
- Превью без активных параметров и model card.
FAQ
Qwen3.8-Max уже open source?
Нет. API доступен, весов на Hugging Face/ModelScope нет. «Следующая неделя» без фиксированной даты.
Сравнение с Kimi K3?
83 против 80 в слепом тесте — паритет. У Kimi K3 веса публичны; у Qwen3.8-Max дешевле API и шире мультимодальность.
Пока веса и независимые воспроизведения не вышли, для валидации Qwen3.8-27B и agent-workflow на реальном Apple Silicon часто выгоднее выделенный физический хост с reset по требованию, чем shared GPU. Облачный Mac mini VMSPIN с посуточной арендой, MDM и SSH+VNC. См. также гид по аренде Mac mini M4 и цены.