DeepSeek-V4의 첫 번째 다중 모드 모델 가중치가 열리고 Opus-4.8을 따라잡기 위해 "눈을 떴습니다"

📅 2026-09-01

요약:

추론, 코드, 에이전트 기능을 지속적으로 강화한 끝에 DeepSeek는 마침내 V4에 시각적 입력을 추가했습니다. 8월 31일 아침, DeepSeek은 Hugging에 있었습니다. Face는 DeepSeek-V4-Flash-Vision-Exp 모델 가중치를 공개했으며 개발자는 모델 가중치를 직접 다운로드하여 직접 배포할 수 있습니다. 모델 파일 외에도 공식 웨어하우스에는 시각적 인코더 및 Aligner와 같은 구성 요소의 참조 추론 구현이 포함되어 있으며 DFlash를 다룹니다. 주의 사항, MoE, Hyper-Connections 및 DSpark 및 기타 부분.


불과 10일 전, DeepSeek은 약 3,050억 개의 매개변수 규모를 갖춘 V4-Flash-Vision-Exp 모델을 공식 발표했습니다. 이름의 "Exp"에서 이것이 V4 시리즈의 첫 번째 실험적 다중 모드 모델이라는 것을 쉽게 알 수 있습니다. V4-Flash 아키텍처를 기반으로 구축되었습니다. 시각적 모듈을 추가하고 지속적인 교육을 통해 모델은 이미지를 처리하는 능력을 얻습니다.

일반 텍스트 작업 측면에서는 V4-Flash-Vision-Exp와 V4-Flash가 대체로 비슷한 수준이라고 관계자는 전했다. 주요 차이점은 새 모델이 텍스트 설명에만 의존하는 대신 사진 내용을 인식하고, 스크린샷의 텍스트를 읽고, 차트를 분석하고, 에이전트 워크플로의 일부로 그림을 사용할 수도 있다는 것입니다.

DeepSeek에서 시연한 사례에는 요구 사항에 따라 PPT 만들기, 웹 페이지 읽기 및 수정, 동적 효과가 있는 프런트 엔드 페이지 생성 등이 포함됩니다.


이러한 작업의 공통점은 전통적인 의미의 이미지 인식이 아니라 모델이 시각적 콘텐츠를 먼저 이해한 다음 코드, 추론 및 도구 호출을 결합하여 후속 작업을 완료해야 한다는 것입니다. DeepSeek에서 게시한 벤치마크 테스트에 따르면 V4는 시각적 기능을 추가한 후 이미 일부 다중 모드 에이전트 작업에서 비교를 위해 선택한 Anthropic 다중 모드 대형 모델 Claude Opus 4.8에 가깝습니다.

구체적으로 ApexBench 테스트에서 V4-Flash-Vision-Exp의 Pass@1 점수는 36.5점으로 Opus-4.8의 39.4점보다 낮았습니다. Chartography는 각각 64.3과 65.0으로 격차가 작습니다. 에이전트의 마지막 시험에서 DeepSeek는 Opus-4.8의 25.7보다 높은 27.3을 획득했습니다. ZeroBench의 Pass@5 점수는 35.0으로 Opus-4.8의 34.0보다 높습니다.


4개의 다중 모드 테스트 데이터 중 2개가 Opus-4.8을 초과했습니다.

새로 추가된 시각적 모듈이 V4-Flash의 원래 텍스트 에이전트 기능을 크게 희생하지 않는다는 점은 주목할 가치가 있습니다.

예를 들어 Terminal Bench 2.1에서 Vision 버전은 83.9점을 받았지만 V4-Flash-0731은 이전에 82.7점을 받았습니다. DeepSWE는 54.4에서 59.3으로 상승하여 공식적으로 나열된 Opus-4.8 점수인 58.0을 초과했습니다. 그러나 NL2Repo는 57.7에 불과해 Opus-4.8의 69.7에 비해 현저히 낮으며, CyberGym은 이전 76.7에서 75.3으로 떨어졌습니다. 따라서 DeepSeek은 일반 텍스트 기능을 V4-Flash와 "동등"하다고 요약합니다.

반면 시각적 능력 자체에는 한계가 있습니다. 고화질의 디테일을 무한히 읽어낼 수 있는 시각적 시스템이 아닙니다.

DeepSeek API 문서에 따르면 이 모델은 JPEG, PNG, GIF 및 WebP 이미지를 지원하며 단일 또는 여러 이미지를 수신할 수 있습니다. 단, 모델을 입력하기 전에 이미지의 크기가 크기에 따라 조정됩니다. 더 큰 이미지는 결국 약 800×800에 해당하는 총 픽셀 볼륨으로 압축되며 각 이미지는 최대 384개의 토큰을 차지합니다.

이 접근 방식을 선택한 이유는 시각적 입력으로 인해 발생하는 계산 비용을 제어하기 위해서입니다. 그러나 특히 작은 텍스트, 로컬 텍스처 또는 기본 해상도에 의존하는 작업에서는 이미지 크기 조정이 제한될 수도 있습니다.

그러나 무슨 일이 있어도 DeepSeek는 마침내 V4의 눈을 보상해주었습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음