오퍼스 4.8을 이긴 세 지점
DeepSeek가 8월 21일 공식 X 계정을 통해 실험적 멀티모달 모델 DeepSeek-V4-Flash-Vision-Exp를 DeepSeek API 플랫폼에 공개했다고 발표했다. 공식 API 문서에 함께 게재된 벤치마크 표를 보면, 이 모델은 코딩·에이전트 평가인 DeepSWE에서 59.3점을 받아 Anthropic Opus-4.8(58.0점)을 근소하게 앞섰다. 멀티모달 평가인 Agents' Last Exam(27.3 대 25.7)과 ZeroBench Pass@5(35.0 대 34.0)에서도 마찬가지로 Opus-4.8보다 높은 점수를 기록했다.
다만 전 항목에서 앞선 것은 아니다. 같은 표에서 NL2Repo는 57.7점으로 Opus-4.8(69.7점)에 12점 뒤졌고, DSBench-Hard도 63.6점으로 Opus-4.8(71.7점)에 8.1점 뒤처졌다. 세 항목의 근소한 우위를 앞세워 "Opus급"이라 부르기는 이르고, 특정 멀티모달 에이전트 과제에 한해 대형 모델과 맞먹는 수준에 도달했다고 보는 편이 정확하다.
텍스트 성능은 그대로 유지했다
DeepSeek는 V4-Flash-Vision-Exp가 에이전트·추론·세계 지식을 포함한 텍스트 능력에서 기존 V4-Flash-0731과 동등하다고 밝혔다. 이번 업데이트는 텍스트 성능을 깎지 않으면서 이미지·화면을 읽는 능력만 얹은 구조라는 뜻이다. 실제로 표의 텍스트 기반 항목(Terminal Bench 2.1, Cybergym, Toolathlon-Verified 등)에서 두 모델의 점수 차는 대부분 1~5점 안쪽이다.
기존에 텍스트 전용 워크플로우로 V4-Flash를 쓰던 곳이라면 굳이 지금 바꿀 이유는 없다. Vision 버전이 의미가 있는 지점은 스크린샷, 표, 차트처럼 이미지 형태의 입력을 함께 다뤄야 하는 에이전트 작업이다.
가격 인상 없이 바로 붙는다
새 모델은 deepseek-v4-flash-vision-exp라는 이름으로 Chat Completions·Messages·Responses API에서 바로 호출할 수 있고, 이미지는 base64·외부 URL·Files API 세 가지 방식으로 넣을 수 있다. DeepSeek는 이미지 입력을 추가해도 기존 V4-Flash와 같은 토큰 단가를 그대로 적용하며 별도 가격 인상은 없다고 밝혔다. 같은 날 배포된 DeepSeek Harness 0.1.1이 새 모델을 기본 지원하므로, 별도 설정 없이 바로 시험해볼 수 있다.
자주 묻는 질문
| 질문 | 답 |
|---|---|
| V4-Flash-Vision-Exp는 기존 V4-Flash보다 비싼가요? | 아니요. DeepSeek는 이미지 입력을 포함해도 기존 V4-Flash와 동일한 가격 정책을 그대로 적용한다고 밝혔습니다. 별도 인상은 없습니다. |
| 정말 Opus 4.8보다 나은가요? | 일부 벤치마크에서만 그렇습니다. DeepSWE, Agents' Last Exam, ZeroBench(Pass@5) 세 항목에서 Opus 4.8보다 근소하게 높은 점수를 기록했지만, NL2Repo·DSBench-Hard 등 다른 항목에서는 여전히 Opus 4.8이 8~12점 앞섭니다. |
| 지금 바로 쓸 수 있나요? | 네. 모델명 'deepseek-v4-flash-vision-exp'로 Chat Completions·Messages·Responses API에서 바로 호출할 수 있고, 이미지는 base64·외부 URL·Files API로 넣을 수 있습니다. 같은 날 배포된 DeepSeek Harness 0.1.1이 이 모델을 기본 지원합니다. |
| 텍스트만 쓰는 기존 작업에도 영향이 있나요? | DeepSeek는 V4-Flash-Vision-Exp가 에이전트·추론·세계 지식을 포함한 텍스트 능력에서 기존 V4-Flash와 동등하다고 밝혔습니다. 텍스트 전용 워크플로우를 굳이 바꿀 필요는 없습니다. |



