2026년 여름 프론티어 모델 출시 물결 속에서 에이전트 API를 평가하며 DeepSeek V4-Flash-0731을 프로덕션 파이프라인에 넣을지 판단해야 하는 개발자를 위해, 본문은 타임라인·핵심 스펙·경쟁사 횡단 비교·주의점 네 축으로 정리합니다. 7월 31일 DeepSeek은 4월 프리뷰와 동일한 284B 아키텍처를 유지한 채 사후 학습만 갱신해 V4-Flash를 공식 빌드로 승격했으며, 에이전트 벤치마크에서는 동일 계열의 더 큰 V4-Pro 프리뷰를 앞지르면서 Claude Opus 4.8 대비 약 1/36~1/179 수준의 가격을 제시합니다. 플래그십 V4-Pro와 자체 Harness 프레임워크는 아직 공개되지 않았습니다.

7월 31일에 실제로 공개된 것과 아직 없는 것

  • 2026년 4월 24일: DeepSeek-V4 프리뷰 출시. MIT 라이선스 MoE 두 모델——V4-Pro(총 1.6T / 활성 49B)와 V4-Flash(총 284B / 활성 13B)——모두 100만 토큰 컨텍스트를 지원합니다.
  • 2026년 7월 24일: 레거시 별칭 deepseek-chat·deepseek-reasoner 폐지, 모든 트래픽이 V4 계열로 라우팅됩니다.
  • 2026년 7월 27일: Moonshot AI, Kimi K3(총 2.8T) 오픈 가중치 전체 공개. DeepSeek 자체 업데이트 며칠 전 경쟁 압박이 커졌습니다.
  • 2026년 7월 31일: deepseek-v4-flash가 공식 공개 API 베타(빌드 태그 「0731」)로 승격됩니다. 아키텍처·파라미터 수는 동일하고 성능 향상은 전부 새 사후 학습 패스에서 나왔습니다. 당일 Hugging Face에 MIT 라이선스로 가중치가 공개되었고, 변경 로그에 자체 에이전트 프레임워크 「DeepSeek Harness」가 처음 명시되었습니다. 이 업데이트는 API 전용이며 소비자 앱·웹 채팅은 변경되지 않았습니다.
  • 2026년 8월 5일 기준: 공식 V4-Pro 출시는 미확정입니다. 일부 중국 매체는 익명 소식통을 인용해 7월 28일 주 내부 테스트 시작·8월 10~20일 GA 가능성을 보도했으나, DeepSeek이 확인한 일정은 아니며 루머로 취급해야 합니다.

「DeepSeek V4 공식 버전」이라는 표현만 보면 새 모델이 나온 것처럼 읽히기 쉽습니다. 실제로는 그렇지 않습니다. DeepSeek은 성능 향상이 스케일 업이 아니라 사후 학습 재실행에서만 나왔다고 명시했으며, 284B/13B 모델이 동일 계열 1.6T/49B 모델을 여러 에이전트 태스크에서 앞서는 상황입니다.

한눈에 보는 수치

모델상태총 / 활성컨텍스트입력(미스/히트, 백만 토큰당)출력(백만 토큰당)라이선스
DeepSeek-V4-Flash-0731공식(2026.07.31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro프리뷰만1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3(Moonshot AI)오픈 가중치(2026.07.27)2.8T / ~104B(커뮤니티 추정)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2(Zhipu / Z.ai)오픈(2026년 6월)~744B / ~40B1M본문 미검증본문 미검증MIT
Qwen3.8-Max(Alibaba)API GA(2026.08.02)2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00가중치 대기

위 요금은 모두 벤더 공시 요율입니다. DeepSeek은 향후 베이징 시간 오전 9~12시·오후 2~6시 피크 시간대 2배 할증을 예고했으나 시행일은 미확정입니다. 가격·스펙은 변동될 수 있으므로 확정 전 공식 페이지에서 재확인하세요.

동일 모델에서 성능을 끌어낸 방법

아키텍처는 그대로, 학습 데이터가 바뀌었습니다. V4-Flash-0731은 4월 프리뷰와 크기·구조가 동일합니다. DeepSeek에 따르면 에이전트 벤치마크에서의 성능 점프는 전부 사후 학습 재실행에서 나왔으며, 업계 기본 가정인 「더 크면 더 좋다」와는 반대 방향입니다.

하이브리드 어텐션, 하이퍼 커넥션, 새 옵티마이저. 기술 보고서 「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」는 세 가지 아키텍처 변경을 설명합니다.

  1. 하이브리드 어텐션——Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA)을 결합한 「DSA」(DeepSeek Sparse Attention)로 장문맥에서 연산·메모리를 절감합니다.
  2. Manifold-Constrained Hyper-Connections(mHC)——표준 잔차 연결을 개선한 구조입니다.
  3. Muon 옵티마이저——수렴 속도와 학습 안정성을 높입니다.

DeepSeek은 100만 토큰 컨텍스트에서 V4-Pro가 V3.2 대비 토큰당 추론 FLOPs 27%, KV 캐시 10%만 필요하다고 주장합니다. 이는 벤더 자체 수치이며 제3자 독립 재현은 아직 없습니다.

Harness: DeepSeek 최초의 자체 에이전트 프레임워크. 7월 31일 변경 로그에 DeepSeek Harness가 처음 공식 언급되었으며, Claude Code 대안으로 포지셔닝됩니다. DeepSeek이 공개한 에이전트 벤치마크(Terminal Bench 2.0, Toolathlon 등)는 아직 공개되지 않은 Harness 「minimal mode」에서 최대 추론 effort, top_p 0.95, temperature 1.0 조건으로 측정되었습니다. 변경 로그에는 에이전트 점수가 「하네스 선택에 극도로 민감하다」는 주의도 함께 적혀 있습니다.

DeepSeek V4-Flash vs Kimi K3 vs GLM-5.2 vs Qwen3.8-Max

모델출시 / 가중치총 파라미터Artificial Analysis Intelligence Index태스크당 평균 비용
DeepSeek-V4-Flash-0731DeepSeek2026.07.31(공식)284B50$0.03
Kimi K3Moonshot AI7/16 프리뷰 / 7/27 가중치2.8T57$0.86
GLM-5.2Zhipu / Z.ai2026년 6월~744BV4-Flash 대비 약 1점 상회본문 미검증
Qwen3.8-MaxAlibaba2026.08.02 GA2.4T본문 미검증본문 미검증
GPT-5.6 SolOpenAI폐쇄형미공개V4-Flash 대비 9점 이상 상회$1.86
Claude Fable 5Anthropic폐쇄형미공개V4-Flash 대비 9점 이상 상회$3.15

Intelligence Index와 태스크당 비용은 독립 벤치마킹 기관 Artificial Analysis 출처입니다. DeepSeek 자체 에이전트 벤치마크는 별도 방법론을 사용합니다. V4-Flash 태스크당 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105 수준입니다. DeepSeek은 리더보드 최상위가 아니라 「충분한 지능을 아무도 따라올 수 없는 가격에」를 노립니다. 가격 맥락은 GPT-5.6 인하와 API 요금 비교Qwen3.8-Max 출시 정리도 참고하세요.

인용 가능한 핵심 데이터와 출처

  • 사후 학습이 점프를 이끌었습니다: V4-Flash-0731은 Terminal Bench 2.0에서 82.7점, V4-Pro 프리뷰 67.9점——동일 284B/13B 아키텍처(DeepSeek 변경 로그, Harness minimal mode).
  • 장문맥 효율: 100만 토큰에서 V4-Pro는 V3.2 대비 토큰당 FLOPs 27%, KV 캐시 10%(DeepSeek 기술 보고서).
  • 독립 비용 비교: Artificial Analysis 태스크당 평균 비용——V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15.
  • OpenRouter 사용량: V4-Flash 프리뷰가 7주 연속 최다 사용 모델 1위를 기록했다는 보도가 있으며, 대규모 에이전트 워크로드가 최고 지능보다 단위 경제성을 우선한다는 신호로 해석됩니다.

검증 가능한 공식·제3자 출처는 다음과 같습니다. 최신 수치는 게시 전 재확인하세요.

DeepSeek 공식 API 문서 및 변경 로그

Hugging Face DeepSeek 모델 카드(DeepSeek-V4-Pro, DeepSeek-V4-Flash)

Artificial Analysis 독립 모델 벤치마크

주의점: 벤치마크를 맹신하면 안 되는 이유

  1. 헤드라인 에이전트 점수는 하네스 의존·자체 보고입니다. Terminal Bench 2.0의 82.7점은 미공개 Harness minimal mode로 측정되었습니다. Claude Code·Cursor 등 다른 에이전트 하네스로 제3자가 재현하기 전까지는 「벤더 + 특정 프레임워크」 결과로 봐야 합니다.
  2. 실사용 불만이 존재합니다. 중국 경제 매체 21세기 경제보(21st Century Business Herald)는 해외 개발자 커뮤니티 피드백을 인용해 공식 V4-Flash 빌드에서 입력 캐시 히트율이 낮고 안전 분류기 타임아웃이 간헐적으로 발생한다고 보도했습니다.
  3. V4-Pro·Harness 출시일은 미확정입니다. 8월 10~20일 GA 창구는 익명 소식통 기반 루머이며, DeepSeek 변경 로그는 공식 V4-Pro가 「가능한 한 빨리」 출시된다고만 명시합니다.
  4. 투자·IPO 보도는 독립 확인되지 않았습니다. 약 74억 달러 규모 펀딩·약 487억 달러 기업가치 보도는 금융 매체 익명 소식통에 기반하며 규제 공시나 DeepSeek 공식 발표가 아닙니다.

중국 개발자가 「斩杀线」이라 부르는 이유

V4-Flash-0731 출시 전 중국 AI 포럼에서는 DeepSeek 창업자 양원봉을 「梁百开」(양백개——「약속만 하고 안 지킨다」는 말장난)으로 놀렸습니다. V4-Pro 7월 중순 목표가 밀리면서 생긴 별명입니다. 공식 Flash 빌드가 기대를 넘기자 같은 커뮤니티는 다시 「梁圣」(양성——「현자」)으로 호칭을 바꿨습니다.

보다 실질적으로는 중국 개발자 사이에 「斩杀线」(zhǎn shā xiàn, 문자 그대로 「처단선」)이라는 용어가 돕니다. DeepSeek의 「충분한 성능 + 바닥 가격」 조합이 사실상 기준선을 세우며, 성능에서 뚜렷이 앞서지 못하고 가격도 못 깎는 경쟁사는 관련성을 잃을 수 있다는 프레이밍입니다. 같은 시기 OpenAI가 저가 GPT-5.6 Luna 티어를 약 80% 인하했다는 보도와도 맞물립니다. 7월 31일 V4-Flash 공식화 당일 Nvidia·Broadcom·AMD 주가에는 뚜렷한 변동이 없었는데, 이는 2025년 초 DeepSeek-R1 효율 주장이 글로벌 AI 칩 매도를 촉발했던 때와 대조됩니다.

자주 묻는 질문

DeepSeek V4는 오픈소스인가요?

예. V4-Pro와 V4-Flash 모두 7월 31일 공식 V4-Flash-0731 빌드를 포함해 Hugging Face에 MIT 라이선스 오픈 가중치로 공개되었으며, 상업적 사용·파인튜닝·재배포가 추가 허가 없이 가능합니다.

DeepSeek V4-Flash는 Claude보다 얼마나 저렴한가요?

21세기 경제보 보도 기준 공식 V4-Flash 요율은 Claude Opus 4.8 대비 캐시 미스 입력 약 36배, 캐시 히트 입력 약 179배, 출력 약 89배 저렴합니다(백만 토큰당, 벤더 정가 기준, 독립 감사 아님).

DeepSeek V4-Pro 공식 버전은 언제 나오나요?

확정일은 없습니다. DeepSeek 변경 로그는 공식 V4-Pro가 「가능한 한 빨리」 출시된다고만 명시합니다. 8월 10~20일 GA 창구는 중국 매체 익명 소식통 보도이며 DeepSeek이 확인하지 않았습니다.

DeepSeek 벤치마크 수치를 믿어도 될까요?

부분적으로만 가능합니다. SWE-bench Verified처럼 널리 쓰이는 제3자 벤치마크는 가중치가 큽니다. Terminal Bench 2.0·Toolathlon 등 에이전트 전용 점수는 미공개 Harness로 측정되었고, 회사 스스로 하네스 선택에 민감하다고 경고합니다.

DeepSeek Harness란 무엇인가요?

DeepSeek 최초의 자체 에이전트 실행 프레임워크로, Claude Code 대안으로 파일 편집·도구 호출·다단계 엔지니어링 작업을 처리합니다. 2026년 7월 31일 변경 로그에 처음 명시되었으며 아직 공개되지 않았습니다.

DeepSeek V4-Flash-0731은 「충분한 지능을 바닥 가격에」라는 에이전트 API 전략을 한 단계 끌어올렸지만, Harness는 아직 공개되지 않았고 V4-Pro GA 일정도 미확정입니다. 독립 재현이 나오기 전 실제 Apple Silicon 하드웨어에서 로컬 에이전트 워크플로를 검증하고 하네스 동작을 나란히 비교해야 한다면, 공유 GPU 풀보다 필요할 때마다 리셋 가능한 전용 물리 호스트가 더 예측 가능합니다. VMSPIN 일 단위 클라우드 Mac mini는 MDM 자동 프로비저닝과 SSH·VNC 이중 접속을 제공하며, 짧은 벤치마크 실행과 멀티 툴체인 비교에 적합합니다. API 비용과 로컬 배포를 함께 따져본다면 Mac mini M4 렌탈 가이드요금 페이지도 확인하세요.