Кому: командам, которые выбирают DeepSeek, Qwen или GLM по API либо готовят self-host открытых весов. Проблема: за пять дней DeepSeek объявляет пиковый рост до 1100%, Alibaba впервые выкладывает флагман на 2,4 трлн параметров, Zhipu выпускает GLM-5.3 с примерно шестикратным скачком на кодовых бенчмарках без переобучения базы. Вывод: китайские лаборатории больше не конкурируют только ценой — они конкурируют правом задавать цену. Ниже — таймлайн, тарифный лист, шестишаговый пересчёт счёта, три стратегии, сравнение, спорные утверждения и FAQ.

За пять дней три китайские лаборатории сделали ходы, которые выглядят противоречиво. DeepSeek поднял отдельные ступени API до 1100%. Alibaba в ту же неделю открыла флагман 2,4 трлн. Zhipu выпустила GLM-5.3 на той же базе 743 млрд, только за счёт post-training. Общий сигнал: переход от войны цен к войне ценовой власти.

Таймлайн: что произошло и когда

ДатаСобытие
16 июля 2026Moonshot AI открывает Kimi K3 (2,8 трлн); уже под вниманием США
2–3 августа 2026Alibaba анонсирует и запускает Qwen3.8-Max как hosted API
10 августа 2026Meta выпускает Muse Glimmer (30B, Apache 2.0) и обещает веса Muse Spark 1.2
12 августа 2026Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6
13 августа 2026DeepSeek-V4-Pro выходит в GA и объявляет рост с 17 августа; Google снижает Gemini 3.7 Flash
14 августа 2026Zhipu выпускает GLM-5.3 на базе GLM-5.2 (743 млрд)
17 августа 2026, 00:00 ПекинНовые тарифы DeepSeek вступают в силу

Шире: 30 июля OpenAI снижает GPT-5.6 Luna на 80%, 6–7 августа делает Luna дефолтом бесплатных аккаунтов с безлимитным текстовым чатом. Пока китайские лаборатории поднимают цены и открывают флагманы, американские удешевляют потребительский слой. Это две стороны одной ценовой войны. См. разбор запуска Qwen3.8-Max, старые тарифы V4 Flash и снижение GPT-5.6 Luna / Terra / Sol.

Цифры: что реально изменилось

DeepSeek переходит на почасовые тарифы 17 августа в 00:00 по Пекину (16:00 UTC 16 августа). Пик: 9–12 и 14–18 по Пекину (01:00–04:00 и 06:00–10:00 UTC). Таблица — долларовая реконструкция официального объявления при курсе около 7,15. Счёт сверяйте с страницей тарифов DeepSeek.

Позиция (за 1 млн tokens)БылоOff-peakPeakРост peak
V4-Flash вход cache hit$0.003$0.007$0.014~400%
V4-Flash вход cache miss$0.14$0.21$0.42200%
V4-Flash выход$0.28$0.63$1.26350%
V4-Pro вход cache hit$0.0035$0.021$0.042~1100%
V4-Pro вход cache miss$0.42$0.63$1.26200%
V4-Pro выход$0.84$1.89$3.78350%

Заголовок «1100%» относится только к peak cache-hit входу — ступени, которая начиналась почти с нуля. Выход, который обычно держит счёт, вырос на 350%. Сторонний сценарий (около 84 млн tokens/мес, в основном off-peak, половина hit) даёт ближе 1,8×, а не 11×.

Qwen3.8-2.4T-A95B: ключевые спецификации

ПараметрЗначение
Параметры2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 routed + 1 shared)
Контекст262 144 tokens нативно, до ~1,01 млн; hosted Max по умолчанию 1 млн
РитмПревью 2 авг → API 3 авг → веса 12 авг
Международный API$2/M вход, $6/M выход
ЛицензияНе Apache 2.0 — своя Qwen3.8-Max License
СмыслПервый Max-флагман Alibaba в open weight; 3.5/3.6/3.7 Max оставались API-only

GLM-5.3 против GLM-5.2: та же база, только post-training

БенчмаркGLM-5.2GLM-5.3Дельта
Terminal-Bench 3.04.6%28.3%+23.7
DeepSWE v1.146.2%66.9%+20.7
Agents' Last Exam (CLI)23.8%28.5%+4.7
CyberGym77.2%84.5%+7.3
AutomationBench26.2%48.2%+22.0

Цифры Zhipu, независимого прогона нет. На Terminal-Bench 3.0 GLM-5.3 отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это верх open-weight, не победа frontier.

Шесть шагов от заголовка к счёту

  1. Перенести пик в свой часовой пояс. Пекин 9–12 и 14–18 = UTC 01:00–04:00 и 06:00–10:00. Рабочий день США почти весь off-peak; утро Западной Европы пересекается со вторым окном.
  2. Разделить вход и выход. +350% на выходе обычно держит инвойс. Cache-hit вход остаётся мелким даже после ×12.
  3. Оценить hit-rate. Стабильные system prompt и RAG-префиксы поднимают его. Свежие длинные контексты и one-shot агенты выглядят как сплошные miss.
  4. Пересчитать прошлый месяц. 84 млн tokens, в основном off-peak, половина hit ≈ 1,8×.
  5. Прогнать заменители. Qwen3.8-Max international ($2 / $6), GPT-5.6 Luna ($0.20 / $1.20), Claude Opus 5 (~$5 / ~$25).
  6. Сдвинуть, сменить или self-host. Батчи уходят в off-peak. Локальный 2,4T checkpoint требует выделенного хоста, не shared notebook: нужна root-машина, которую можно сбросить после прогона агента.

Тарифы и лицензии меняются. Первичные источники:

DeepSeek API Docs: Models & Pricing

Hugging Face: Qwen3.8-2.4T-A95B и LICENSE

Z.ai: технический пост GLM-5.3

South China Morning Post: коммерческие условия Qwen3.8-Max

Три стратегии, три механизма

DeepSeek: с плоского тарифа на time-of-day. Это дефицит compute, не смена стратегии. Самое короткое неверное чтение — «самая дешёвая китайская модель сдалась марже». Структура говорит обратное: дефицит GPU впервые вынесен в прайс. Пока ёмкость росла вместе со спросом, всегда-дешёвый тариф работал как acquisition. Когда вызовы росли экспоненциально, а карты — нет, редкость пика пришлось сделать явной. «Гибкое планирование нагрузки» = «пикового compute не хватает, сдвиньте сами».

Деталь, которую международные обзоры почти не берут: в пике официальный API уже дороже части реселлеров (GMI Cloud, Novita и др.). Гипотеза «официал всегда дешевле» сломана впервые.

Alibaba: веса покупают экосистему, своя лицензия держит потолок выручки. Чекпоинт 2,4 трлн качается бесплатно, но не под Apache 2.0. Бизнес Model-as-a-Service или AI Work Assistant свыше $50 млн за 12 месяцев обязан взять отдельную лицензию. Продукт с 100 млн MAU или $20 млн месячной выручки обязан показывать имя модели.

Логика: отдать веса ради mindshare, особенно международного, и оставить рычаг над теми немногими, кто способен построить inference-бизнес. Muse Glimmer (чистый Apache 2.0) — другое «открыто».

Слух о запрете скачивания из США, ЕС, Великобритании и Кореи ложен. В LICENSE нет территориальной оговорки. Читать файл, не тред анонса.

GLM-5.3: новой базы нет. Масштаб post-training — вся история. Та же база 743 млрд, без pretrain заново, Terminal-Bench 3.0 с 4.6% до 28.3%. Когда предельная отдача pretraining падает, RL в post-training становится отдельным рычагом с более низким порогом, чем новое foundation-обучение. Средние лаборатории могут догонять агентные бенчи без бюджета OpenAI.

Сравнение: DeepSeek всё ещё самый дешёвый флагман?

МодельВход / 1 млнВыход / 1 млнOpen weights
DeepSeek V4-Pro (peak)$1.26$3.78Нет
DeepSeek V4-Pro (off-peak)$0.63$1.89Нет
Qwen3.8-Max (international)$2.00$6.00Да (своя лицензия)
OpenAI GPT-5.6 Luna$0.20$1.20Нет
Claude Opus 5 (оценка по кратности Alibaba)~$5.00~$25.00Нет

Короткий ответ: нет. Off-peak V4-Pro всё ещё ниже Claude Opus 5, но уже не самый дешёвый вариант. Qwen3.8-Max international и Luna бьют DeepSeek off-peak хотя бы по одной оси. «Китайская модель = самая дешёвая» держалось в 2025 и начале 2026; сейчас это небезопасное допущение.

Спорное и неподтверждённое

  • «1100%» технически верно и без контекста вводит в заблуждение. Только peak cache-hit вход. Выход +350%.
  • Инференс на Zhenwu M890 не подтверждён техдоками Alibaba и сторонними бенчами. Не проверено.
  • «Серьёзная уязвимость Cursor» от GLM-5.3 — VentureBeat и Zhipu. Деталей нет: вендорский источник, без аудита.
  • Ответные экспортные ограничения Минкоммерции — медиа-гипотеза, не официальное объявление.

Почему это важно: две ценовые войны параллельно

Примерно месяц китайские топ-лаборатории выпускают релизы в темпе, который местная финпресса зовёт «три обновления в неделю» — плюс Kimi K3 (16 июля, 2,8 трлн) и MiniMax H3. Китайская рамка: open-weight заставляет мир пересчитать цену AI. Англоязычная техпресса чаще пишет изолированные продукт-новости.

Американские лаборатории бегут в другую сторону на потребительском слое: OpenAI режет 80% 30 июля и через неделю делает модель бесплатной и безлимитной. Google 13 августа выпускает кодовую модель вдвое дешевле трёхнедельного предшественника. Обе стратегии реальны; они оптимизируют разные этажи воронки.

Геополитический слой: Kimi K3 уже вызвал интерес США. Часть аналитиков читает окно 2,4 трлн Alibaba как фиксацию международной паритетной истории до возможного ужесточения. Это интерпретация, не факт — но контекст, который не виден, если читать только английские продукт-релизы.

FAQ

DeepSeek после роста всё ещё дешевле GPT-5.6 и Claude?

Off-peak — да относительно Claude Opus 5. Не самый дешёвый в целом: Luna ($0.20 / $1.20) и Qwen3.8-Max international ($2 / $6) бьют хотя бы одну ось.

Можно ли бесплатно использовать веса Qwen3.8-Max в коммерческом продукте?

Личные проекты и внутреннее использование почти не затронуты. Отдельная лицензия нужна только MaaS / AI Work Assistant с выручкой свыше $50 млн за 12 месяцев. Свыше 100 млн MAU или $20 млн месячной выручки — обязателен показ имени модели.

Qwen3.8-Max запрещён для пользователей США, ЕС или Великобритании?

Нет. В лицензии нет географического ограничения. Пороги завязаны на выручку, не на локацию.

Чем GLM-5.3 отличается от GLM-5.2 на уровне модели?

База та же, 743 млрд. Скачок ~6× на Terminal-Bench 3.0 — только масштабирование RL в post-training, без повторного pretrain.

Meta реально откроет флагман, а не только Muse Glimmer?

Пока нет. Glimmer — дистиллят 30B. Zuckerberg обещает Muse Spark 1.2 «скоро». Это намерение, не факт.

Почасовые тарифы, своя лицензия и чекпоинт 2,4 трлн в одну неделю меняют работу: сдвигать батчи, читать LICENSE, воспроизводить агентные бенчи в среде, которую можно стереть. Shared notebook и API с гардрейлами обычно не тянут. Когда нужен выделенный сбрасываемый хост Apple Silicon с root, MDM, SSH и VNC, облачный Mac mini VMSPIN с дневной оплатой подходит для open-weight eval и агентных песочниц. См. также разбор аренды Mac mini M4 и страницу тарифов.