작은 실험 모델이 오퍼스 4.8을 이긴 세 지점

DeepSeek이 8월 21일 공개한 실험 멀티모달 모델 V4-Flash-Vision-Exp가 DeepSWE·Agents' Last Exam·ZeroBench 세 벤치마크에서 Opus 4.8을 근소하게 앞섰다. 가격 인상 없이 바로 쓸 수 있다.

H
Huuush발행 2026.08.22 · 4분 read에디터: Jay Kim

3줄 요약

  • DeepSeek이 8월 21일 실험 멀티모달 모델 V4-Flash-Vision-Exp를 공식 공개했다.
  • 공식 벤치마크 표 기준 DeepSWE·Agents' Last Exam·ZeroBench Pass@5 세 항목에서 Opus 4.8보다 근소하게 앞섰다.
  • 이미지 입력을 추가해도 기존 V4-Flash와 동일한 가격 정책이 그대로 적용된다.
DeepSeek V4-Flash-Vision-Exp와 V4-Flash-0731, Opus-4.8 세 모델의 벤치마크 점수를 비교한 표

오퍼스 4.8을 이긴 세 지점

DeepSeek가 8월 21일 공식 X 계정을 통해 실험적 멀티모달 모델 DeepSeek-V4-Flash-Vision-Exp를 DeepSeek API 플랫폼에 공개했다고 발표했다. 공식 API 문서에 함께 게재된 벤치마크 표를 보면, 이 모델은 코딩·에이전트 평가인 DeepSWE에서 59.3점을 받아 Anthropic Opus-4.8(58.0점)을 근소하게 앞섰다. 멀티모달 평가인 Agents' Last Exam(27.3 대 25.7)과 ZeroBench Pass@5(35.0 대 34.0)에서도 마찬가지로 Opus-4.8보다 높은 점수를 기록했다.

다만 전 항목에서 앞선 것은 아니다. 같은 표에서 NL2Repo는 57.7점으로 Opus-4.8(69.7점)에 12점 뒤졌고, DSBench-Hard도 63.6점으로 Opus-4.8(71.7점)에 8.1점 뒤처졌다. 세 항목의 근소한 우위를 앞세워 "Opus급"이라 부르기는 이르고, 특정 멀티모달 에이전트 과제에 한해 대형 모델과 맞먹는 수준에 도달했다고 보는 편이 정확하다.

텍스트 성능은 그대로 유지했다

DeepSeek는 V4-Flash-Vision-Exp가 에이전트·추론·세계 지식을 포함한 텍스트 능력에서 기존 V4-Flash-0731과 동등하다고 밝혔다. 이번 업데이트는 텍스트 성능을 깎지 않으면서 이미지·화면을 읽는 능력만 얹은 구조라는 뜻이다. 실제로 표의 텍스트 기반 항목(Terminal Bench 2.1, Cybergym, Toolathlon-Verified 등)에서 두 모델의 점수 차는 대부분 1~5점 안쪽이다.

기존에 텍스트 전용 워크플로우로 V4-Flash를 쓰던 곳이라면 굳이 지금 바꿀 이유는 없다. Vision 버전이 의미가 있는 지점은 스크린샷, 표, 차트처럼 이미지 형태의 입력을 함께 다뤄야 하는 에이전트 작업이다.

가격 인상 없이 바로 붙는다

새 모델은 deepseek-v4-flash-vision-exp라는 이름으로 Chat Completions·Messages·Responses API에서 바로 호출할 수 있고, 이미지는 base64·외부 URL·Files API 세 가지 방식으로 넣을 수 있다. DeepSeek는 이미지 입력을 추가해도 기존 V4-Flash와 같은 토큰 단가를 그대로 적용하며 별도 가격 인상은 없다고 밝혔다. 같은 날 배포된 DeepSeek Harness 0.1.1이 새 모델을 기본 지원하므로, 별도 설정 없이 바로 시험해볼 수 있다.

자주 묻는 질문

질문
V4-Flash-Vision-Exp는 기존 V4-Flash보다 비싼가요?아니요. DeepSeek는 이미지 입력을 포함해도 기존 V4-Flash와 동일한 가격 정책을 그대로 적용한다고 밝혔습니다. 별도 인상은 없습니다.
정말 Opus 4.8보다 나은가요?일부 벤치마크에서만 그렇습니다. DeepSWE, Agents' Last Exam, ZeroBench(Pass@5) 세 항목에서 Opus 4.8보다 근소하게 높은 점수를 기록했지만, NL2Repo·DSBench-Hard 등 다른 항목에서는 여전히 Opus 4.8이 8~12점 앞섭니다.
지금 바로 쓸 수 있나요?네. 모델명 'deepseek-v4-flash-vision-exp'로 Chat Completions·Messages·Responses API에서 바로 호출할 수 있고, 이미지는 base64·외부 URL·Files API로 넣을 수 있습니다. 같은 날 배포된 DeepSeek Harness 0.1.1이 이 모델을 기본 지원합니다.
텍스트만 쓰는 기존 작업에도 영향이 있나요?DeepSeek는 V4-Flash-Vision-Exp가 에이전트·추론·세계 지식을 포함한 텍스트 능력에서 기존 V4-Flash와 동등하다고 밝혔습니다. 텍스트 전용 워크플로우를 굳이 바꿀 필요는 없습니다.

자주 묻는 질문