DeepSeek, 프리뷰 4개월 만에 V4 Pro 정식판, 벤치마크 최대 5배 뛰었다

DeepSeek이 2026년 8월 13일 V4 Pro 정식판(0813)을 조용히 공개했다. 자체 공개한 벤치마크에서 터미널벤치·사이버짐·DeepSWE 점수가 프리뷰 대비 크게 올랐다.

H
Huuush발행 2026.08.13 · 4분 read에디터: Jay Kim

3줄 요약

  • DeepSeek이 2026년 8월 13일 새벽(KST), API 문서의 모델 버전을 DeepSeek-V4-Pro-0813 으로 조용히 교체했다. 별도 발표문이나 블로그 글은 없었다.
  • 넉 달 가까이 이어진 프리뷰 기간이 끝나고 정식판(GA)으로 전환된 것이다. 4월 24일 V4 계열 오픈웨이트 공개 이후 첫 정식 출시다.( GMI Cloud )
  • 소식은 공식 채널보다 이용자 게시물로 먼저 퍼졌다. 계정 @ChrisGPT 는 DeepSeek이 공개한 비교표를 함께 올리며 이렇게 전했다. "터미널벤치 2.1이 72.1%에서 87.9%로, 사이버짐이 52.7%에서 83.3%로, DeepSWE가 12.8%에서 62.7%로 뛰었다."(2026-08-13 01:12 KST)
DeepSeek V4 Pro 정식판과 프리뷰·경쟁 모델의 에이전트 벤치마크를 비교한 DeepSeek 공식 표

DeepSeek이 2026년 8월 13일 새벽(KST), API 문서의 모델 버전을 DeepSeek-V4-Pro-0813으로 조용히 교체했다. 별도 발표문이나 블로그 글은 없었다.

넉 달 가까이 이어진 프리뷰 기간이 끝나고 정식판(GA)으로 전환된 것이다. 4월 24일 V4 계열 오픈웨이트 공개 이후 첫 정식 출시다.(GMI Cloud)

소식은 공식 채널보다 이용자 게시물로 먼저 퍼졌다. 계정 @ChrisGPT는 DeepSeek이 공개한 비교표를 함께 올리며 이렇게 전했다.
"터미널벤치 2.1이 72.1%에서 87.9%로, 사이버짐이 52.7%에서 83.3%로, DeepSWE가 12.8%에서 62.7%로 뛰었다."(2026-08-13 01:12 KST)

프리뷰 대비 최대 5배, 그런데 기준점이 낮았다

DeepSeek이 공개한 표에서 상승폭이 가장 큰 지표는 DeepSWE다. 프리뷰(12.8%)에서 정식판(62.7%)으로 4.9배 뛰었다.

벤치마크V4-Pro-0813V4-Pro-PreviewKimi-K3Opus-4.8Fable 5
Terminal Bench 2.187.972.188.385.088.0
Cybergym83.352.780.078.383.1
DeepSWE62.712.867.558.070.0
AutomationBench(Public)31.812.830.827.229.1

출처: DeepSeek 공식 발표 이미지(X 게시물 @ChrisGPT 경유, 2026-08-13 01:12 KST 확인)

가격은 입력 100만 토큰당 0.435달러, 출력 100만 토큰당 0.87달러다. 컨텍스트 창은 100만 토큰이다.(@ChrisGPT 게시물 기준)

Kimi-K3·Fable 5와 견주면 "1위는 아니다"

같은 표에서 Kimi-K3(터미널벤치 88.3, DeepSWE 67.5)와 Fable 5(터미널벤치 88.0, DeepSWE 70.0)는 여전히 DeepSeek V4 Pro보다 높은 점수를 기록했다.

Opus-4.8과 비교하면 대부분의 지표에서 DeepSeek V4 Pro가 앞선다. 정리하면 "최상위는 아니지만 프리뷰 대비 대폭 개선되며 상위권에 근접했다"는 평가가 정확하다.

V4-Pro 성능은 자체 발표뿐

이 수치는 전부 DeepSeek이 자체 공개한 자료다. 외부 독립 기관이 재현한 결과는 아직 확인되지 않았다. 에이전트 벤치마크는 하네스 구성, 프롬프트, 도구 환경에 따라 점수가 크게 흔들릴 수 있어 주의가 필요하다.

DeepSeek 공식 블로그나 changelog 페이지에도 이번 출시를 알리는 별도 글은 아직 없다. API 가격표와 이용자 보고가 현재로선 가장 구체적인 1차 정보다.

자주 묻는 질문

이 글에서 다룬 벤더