대상은 DeepSeek, Qwen, GLM API를 고르거나 오픈 웨이트를 직접 호스팅하려는 개발자와 기술 의사결정자입니다. 문제는 8월 12일부터 17일까지 닷새 동안 DeepSeek가 피크 구간에서 최대 1100% 이상 인상을 발표하고, 알리바바가 한 번도 공개하지 않았던 2.4조 파라미터 플래그십 가중치를 풀었으며, 지푸는 같은 베이스로 후학습만 키워 코딩 벤치가 약 6배 올랐다는 점입니다. 결론은 세 회사의 수는 달라도, 경쟁 축이 ‘최저가’에서 ‘가격 결정권’으로 이동했다는 것입니다. 아래는 타임라인, 요금표, 6단계 청구 재구성, 세 전략, 비교표, 미확인 주장, FAQ입니다.
닷새 동안 중국 주요 랩이 겉보기에는 모순된 세 수를 두었습니다. DeepSeek는 일부 구간 API를 최대 1100% 올렸고, 알리바바는 같은 주에 2.4조 파라미터 플래그십을 처음 공개했으며, 지푸는 GLM-5.3을 전작과 동일한 베이스로 후학습만으로 출시했습니다. 공통 신호는 가격 경쟁에서 가격 결정권 경쟁으로의 전환입니다.
타임라인: 이 2주에 일어난 일
| 날짜 | 사건 |
|---|---|
| 2026년 7월 16일 | 문샷 AI가 Kimi K3(2.8조 파라미터)를 공개. 이미 미국 안보 검토 대상이었습니다 |
| 8월 2–3일 | 알리바바가 Qwen3.8-Max를 예고하고 호스티드 API로 출시 |
| 8월 10일 | Meta가 Muse Glimmer(300억, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2 가중치 공개를 예고 |
| 8월 12일 | 알리바바가 Qwen3.8-2.4T-A95B를 Hugging Face / ModelScope에 공개. 같은 날 xAI가 Grok 4.6 출시 |
| 8월 13일 | DeepSeek-V4-Pro 정식 출시와 8월 17일 인상 공지. Google은 인하한 Gemini 3.7 Flash 출시 |
| 8월 14일 | 지푸가 GLM-5.3 출시. 베이스는 GLM-5.2와 같은 7430억 |
| 8월 17일 0시(베이징) | DeepSeek 신규 요금 발효 |
더 넓히면 7월 30일 OpenAI는 가장 싼 GPT-5.6 Luna를 80% 내렸고, 8월 6–7일에는 무료 사용자 기본 모델로 두고 텍스트 대화를 무제한으로 열었습니다. 중국 랩이 인상과 플래그십 공개를 더하는 같은 시간에 미국 랩은 무료와 인하를 더합니다. 우연이 아니라 같은 가격 전쟁의 양면입니다. 당시 Qwen3.8-Max 수치는 Qwen3.8-Max 출시 브리프, V4-Flash 구요금은 DeepSeek V4 Flash 해설, OpenAI 인하는 GPT-5.6 Luna / Terra / Sol에서 확인할 수 있습니다.
숫자: 실제로 바뀐 것
DeepSeek는 베이징 시간 8월 17일 0시(UTC 8월 16일 16:00)부터 시간대 과금으로 바꿨습니다. 피크는 베이징 9–12시, 14–18시(UTC 01:00–04:00, 06:00–10:00)입니다. 아래는 공식 공고를 약 7.15로 달러 환산한 재구성입니다. 청구는 DeepSeek 공식 요금 페이지를 기준으로 하십시오.
| 과금 항목(100만 tokens) | 인상 전 | 오프피크(신) | 피크(신) | 피크 상승 |
|---|---|---|---|---|
| V4-Flash 캐시 히트 입력 | $0.003 | $0.007 | $0.014 | 약 400% |
| V4-Flash 캐시 미스 입력 | $0.14 | $0.21 | $0.42 | 200% |
| V4-Flash 출력 | $0.28 | $0.63 | $1.26 | 350% |
| V4-Pro 캐시 히트 입력 | $0.0035 | $0.021 | $0.042 | 약 1,100% |
| V4-Pro 캐시 미스 입력 | $0.42 | $0.63 | $1.26 | 200% |
| V4-Pro 출력 | $0.84 | $1.89 | $3.78 | 350% |
헤드라인 ‘1100%’는 피크 시간 캐시 히트 입력에만 해당합니다. 실제 청구를 좌우하는 출력은 350%입니다. 제3자 시나리오(월 약 8400만 tokens, 대부분 오프피크, 히트 약 절반)에서는 청구 증가가 약 1.8배에 가깝습니다.
Qwen3.8-2.4T-A95B 핵심 사양
| 항목 | 내용 |
|---|---|
| 파라미터 | 총 2.4조, 활성 950억(MoE, 전문가 512, 라우팅 10+공유 1) |
| 컨텍스트 | 공개 체크포인트 26.2만 tokens, 약 101만까지 확장. 호스티드 Max 기본 100만 |
| 출시 리듬 | 8월 2일 예고 → 8월 3일 API → 8월 12일 가중치 공개 |
| 국제 API | 입력 $2/M, 출력 $6/M |
| 라이선스 | Apache 2.0이 아닌 맞춤 Qwen3.8-Max License |
| 의미 | 알리바바가 Max급 플래그십을 처음 공개. Qwen3.5/3.6/3.7 Max는 API만 |
GLM-5.3 vs GLM-5.2: 같은 베이스, 후학습만
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam(CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
수치는 지푸 자체 측정이며 독립 재실행은 아직 없습니다. Terminal-Bench 3.0에서는 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 오픈 웨이트 1군이지 전면 1위가 아닙니다.
헤드라인 인상을 청구서로 되돌리는 6단계
‘1100%’는 요금표의 한 칸입니다. 벤더를 바꾸기 전에 아래 6단계로 재계산하십시오.
- 피크를 자기 시간대로 옮깁니다. 베이징 9–12시, 14–18시는 UTC 01:00–04:00, 06:00–10:00입니다. 북미 업무 시간은 대부분 오프피크이고, 서유럽 오전은 두 번째 창과 겹칩니다.
- 입력과 출력을 나눕니다. 출력 350%가 보통 청구의 본체입니다. 히트 입력은 12배여도 절대액이 작습니다.
- 캐시 히트율을 추정합니다. 고정 시스템 프롬프트와 RAG 접두사는 올리고, 매번 바뀌는 장문과 원샷 에이전트는 거의 미스입니다.
- 지난달 tokens를 새 요금으로 다시 곱합니다. 월 8400만 tokens, 대부분 오프피크, 히트 절반이면 약 1.8배입니다.
- 대체 요금을 같은 트래픽에 적용합니다. Qwen3.8-Max 국제($2/$6), GPT-5.6 Luna($0.20/$1.20), Claude Opus 5(약 $5/$25)입니다.
- 이동, 전환, 자체 호스팅을 고릅니다. 배치는 오프피크로 옮길 수 있습니다. 2.4T를 로컬에서 돌리려면 공유 노트북이 아니라 전용 호스트가 필요합니다.
요금과 라이선스는 바뀝니다. 재게시나 예산 확정 전에 1차 출처를 확인하십시오.
DeepSeek API Docs: Models & Pricing
Hugging Face: Qwen3.8-2.4T-A95B와 LICENSE
South China Morning Post: Qwen3.8-Max 상업 조항
세 전략을 분해합니다
DeepSeek: 단일 저가에서 시간대 요금으로. 전략 전환이 아니라 용량 문제입니다. ‘중국 최저가가 마진에 굴복했다’는 가장 쉬운 오독입니다. 구조는 반대입니다. 호출이 지수로 늘고 GPU가 따라가지 못하자, 피크의 희소성을 요금표에 드러내야 했습니다. 공지의 ‘더 유연한 워크로드 스케줄링을 권장한다’는 ‘피크 연산이 부족하니 부하를 직접 옮기라’는 뜻입니다.
국제 보도가 거의 놓친 점은, 피크 시간에는 공식 API가 GMI Cloud, Novita 등 일부 재판매보다 비싸졌다는 것입니다. ‘공식이 항상 가장 싸다’는 가정이 처음 깨졌습니다.
알리바바: 가중치로 생태계를 사고, 맞춤 라이선스로 수익 천장을 지킵니다. 2.4조 체크포인트를 무료로 풀면서, 소형 Qwen의 Apache 2.0이 아닌 맞춤 라이선스를 붙였습니다. 연속 12개월 5000만 달러 초과의 Model-as-a-Service 또는 AI Work Assistant 사업은 별도 상업 허가가 필요하고, 월간 1억 MAU 또는 월 매출 2000만 달러 초과 제품은 모델명을 눈에 띄게 표시해야 합니다.
논리는 명확합니다. 해외 기업 구매자의 주저를 낮추려고 가중치를 주고, 추론 사업을 세울 수 있는 소수 대고객에게는 협상권을 남깁니다. Meta Muse Glimmer(제한 없는 Apache 2.0)와 ‘오픈’의 의미가 다릅니다.
미국·EU·영국·한국 다운로드를 금지한다는 소문은 거짓입니다. 공개 LICENSE에 지역 조항이 없습니다. 발표 스레드가 아니라 LICENSE 파일을 읽는 편이 빠릅니다.
GLM-5.3: 새 베이스가 없습니다. 후학습 규모가 본론입니다. 베이스는 GLM-5.2와 같은 7430억, 재학습 없음, Terminal-Bench 3.0은 4.6%에서 28.3%로 약 6배입니다. 사전학습 한계 수익이 둔화하는 동안 후학습 RL 규모가 독립 성능 레버가 되었습니다. 천억급 베이스를 다시 만드는 것보다 문턱이 낮고, 중규모 랩도 에이전트 지표를 좁힐 수 있습니다.
비교: 인상 후에도 DeepSeek가 가장 싼 플래그십인가
| 모델 | 입력(100만 tokens) | 출력(100만 tokens) | 오픈 웨이트 |
|---|---|---|---|
| DeepSeek V4-Pro(피크) | $1.26 | $3.78 | 없음 |
| DeepSeek V4-Pro(오프피크) | $0.63 | $1.89 | 없음 |
| Qwen3.8-Max(국제 API) | $2.00 | $6.00 | 있음(맞춤 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 없음 |
| Claude Opus 5(알리바바 배수 추정) | 약 $5.00 | 약 $25.00 | 없음 |
짧은 답은 아닙니다. 오프피크 V4-Pro는 여전히 Claude Opus 5보다 싸지만 최저가는 아닙니다. Qwen3.8-Max 국제 요금과 Luna가 적어도 한 축에서 오프피크 DeepSeek를 밑돕니다. ‘중국 모델=최저가’는 2025년과 2026년 초에는 대체로 맞았고, 지금은 안전한 가정이 아닙니다.
쟁점과 미확인 세부
- ‘1100%’는 기술적으로 맞지만 맥락 없이는 오해를 낳습니다. 피크 캐시 히트 입력만입니다. 출력은 350%입니다. 매체마다 다른 구간을 전체처럼 인용합니다.
- Qwen3.8-Max가 자체 Zhenwu M890에서 돈다는 보도는 알리바바 기술 문서나 제3자 벤치로 독립 확인되지 않았습니다. 미검증으로 다루십시오.
- GLM-5.3이 Cursor 심각 취약점을 발견했다는 주장은 VentureBeat와 지푸 측 공개입니다. 기술 세부는 비공개이며 벤더 출처·미감사입니다.
- 중국 상무부가 AI/반도체 보복 수출 통제를 준비한다는 보도는 공식 발표가 아니라 배경 추정입니다.
왜 중요한가: 동시에 달리는 두 가격 전쟁
지난 한 달 중국 주요 랩은 국내 금융 미디어가 ‘주 3회 업데이트’라고 부르는 밀도로 출시했습니다. DeepSeek, 알리바바, 지푸에 더해 7월 16일 Kimi K3(2.8조)와 MiniMax H3가 앞섰습니다. 중국어권 프레이밍은 ‘오픈 웨이트가 글로벌 AI 가격을 다시 매긴다’로, 영어권 제품 뉴스보다 공격적입니다.
미국 랩은 소비 층에서 반대로 달립니다. OpenAI는 7월 30일 최저 구간을 80% 내리고 일주일 뒤 무료·무제한으로 만들었습니다. Google은 8월 13일 3주 전 전작의 반값으로 코딩 모델을 냈습니다. 중국 랩은 플래그십을 풀고 정점을 단계 인상하고, 미국 랩은 소비 끝을 싸게 만듭니다. 둘 다 실제 전략이며 최적화하는 깔때기 위치가 다릅니다.
지정학 층도 조심히 적습니다. 7월 Kimi K3 공개는 이미 미국 안보 검토를 불렀고, 알리바바가 이 창에 2.4조를 푼 것을 ‘규제 강화 전에 기술 대등 서사를 고정하는 수’로 읽는 분석이 있습니다. 확정 사실이 아니라, 영어권 제품 뉴스만으로는 보이기 어려운 맥락입니다.
FAQ
인상 후에도 DeepSeek가 GPT-5.6이나 Claude보다 쌉니까?
오프피크는 아직 Claude Opus 5보다 쌉니다. 다만 전체 최저가는 아니고, Luna($0.20/$1.20)와 Qwen3.8-Max 국제($2/$6)가 적어도 한 축에서 밑돕니다. 플래그십급으로는 여전히 상대적 저가입니다.
Qwen3.8-Max 오픈 웨이트를 상용 제품에서 무료로 쓸 수 있습니까?
개인 프로젝트와 내부 사용은 대체로 영향이 없습니다. 연속 12개월 5000만 달러 초과의 Model-as-a-Service 또는 AI Work Assistant 사업만 별도 상업 허가가 필요합니다. 월간 1억 MAU 또는 월 매출 2000만 달러 초과는 모델명 표시도 필요합니다.
미국·EU·영국 사용자는 Qwen3.8-Max를 받을 수 없습니까?
아닙니다. 그 소문은 거짓입니다. 공개 라이선스에 지역 제한이 없습니다. 제한은 매출 규모에 묶이고 소재지에 묶이지 않습니다.
GLM-5.3과 GLM-5.2의 실제 차이는 무엇입니까?
베이스는 같은 7430억입니다. Terminal-Bench 3.0의 약 6배는 후학습에서 강화학습 환경을 키운 결과이며 베이스 재학습은 없습니다.
Meta는 플래그십도 정말 공개합니까?
아직 아닙니다. Muse Glimmer는 300억 증류 모델입니다. Zuckerberg는 폐쇄형 Muse Spark 1.2를 ‘곧’ 공개한다고 했지만, 작성 시점에는 의도이지 사실이 아닙니다.
시간대 요금, 맞춤 라이선스, 2.4조 체크포인트가 같은 주에 모이면 작업이 바뀝니다. 배치를 옮기고 LICENSE 원문을 읽고, 언제든 초기화할 수 있는 격리 환경에서 에이전트 벤치를 재현해야 합니다. 공유 노트북과 가드레일 API는 보통 부족합니다. 단독 점유 Apple Silicon 물리 호스트가 필요하면 VMSPIN 일 단위 클라우드 Mac mini가 MDM 자동 교부와 SSH·VNC 이중 경로로 오픈 웨이트 평가와 에이전트 샌드박스에 맞습니다. Mac mini M4 렌탈 가이드와 요금 페이지도 함께 보십시오.