중국 AI 연구소 DeepSeek는 텍스트와 함께 이미지를 수용할 수 있는 V4-Flash 모델의 실험 버전인 deepseek-v4-flash-vision-exp를 조용히 출시하여 주력 모델 제품군에서 가장 눈에 띄는 격차 중 하나를 좁혔습니다. 회사의 공식 API 페이지에 문서화된 이 릴리스는 V4-Flash-0731 및 V4-Pro-0813이 새로 고쳐진 지 불과 몇 주 만에 출시되었으며 개발자에게 오랫동안 요청되었던 스크린샷, 차트 및 사진을 업계에서 가장 저렴한 프론티어 티어 모델 중 하나에 직접 공급할 수 있는 방법을 제공합니다. 최신 AI 개발을 추적하는 팀의 경우 DeepSeek가 서구 경쟁업체와 기능 면에서는 일치하면서도 공격적으로 가격을 낮추려는 또 다른 신호입니다.
새 모델의 기능
DeepSeek의 API 문서에 따르면 `deepseek-v4-flash-vision-exp`를 사용하면 사용자는 "모델에 그림 설명, 스크린샷의 텍스트 읽기, 차트 분석 등을 요청"할 수 있습니다. 이 모델은 파일 이름이나 선언된 MIME 유형이 아닌 실제 파일 콘텐츠에서 감지된 형식을 사용하여 JPEG, PNG, GIF 및 WebP 파일을 허용합니다. 이는 일치하지 않는 확장명 버그를 방지하는 작지만 사려 깊은 세부 사항입니다.
개발자는 base64로 인코딩된 인라인 데이터 URL(48MiB 요청 본문 제한 적용), 공개적으로 액세스 가능한 외부 URL(최대 8,192자, 이미지당 32MiB, 60초 다운로드 창) 또는 Files API를 통해 세 가지 방법으로 이미지를 전달할 수 있습니다. 모든 것은 표준 OpenAI 호환 Chat Completions 형식을 사용하며 DeepSeek의 Anthropic 호환 엔드포인트를 통해서도 모델에 연결할 수 있습니다. 즉, 기존 Claude SDK 코드는 최소한의 변경으로 백엔드를 전환할 수 있습니다.
가격: 원자재 가격의 개척자 비전
실험적인 모델은 V4-Flash의 공격적인 가격 시트를 계승합니다. 입력 토큰의 비용은 비수기 백만당 0.22달러, 최대 캐시 미스의 경우 0.44달러이며, 사용량이 적은 시간 동안 캐시 적중 시 백만 달러당 0.007달러까지 떨어집니다. 출력 토큰의 가격은 비수기 백만당 0.66달러, 최고 1.32달러입니다. 이미지는 크기에 따라 토큰으로 변환되고 텍스트 토큰과 함께 청구됩니다.
이러한 가격 책정은 미국의 주요 제공업체가 제공하는 유사한 멀티모달 제품을 대폭 낮추어 DeepSeek이 일년 내내 벌인 가격 전쟁을 계속하고 있기 때문에 중요합니다. 이 모델은 또한 제품군의 주요 사양인 100만 개의 토큰 컨텍스트 창, 최대 384K 토큰의 최대 출력, 사고 모드 및 비사고 모드 지원, JSON 출력, 도구 호출 및 2,500개의 동시성 제한 등 연구용 장난감이 아닌 대용량 생산 워크로드를 위한 진정한 주력 제품으로 자리매김하는 사양을 전달합니다.
개발자들이 이에 절실했던 이유
이 출시는 Hacker News에 게재되었으며, 그곳에서 빠르게 450개 이상의 포인트를 수집했으며 열정에는 특정한 기원 이야기가 있습니다. DeepSeek의 텍스트 전용 V4-Flash-0731은 볼 수 있다고 믿는 것으로 명성을 얻었습니다. 여러 개발자들은 모델이 비전 기능이 있다고 가정한 다음, 텍스트 기반 이미지 분석 도구를 개발하고, 볼 수 있는 방법이 없다는 사실을 깨닫기 전에 연결된 장치에서 스크린샷을 가져오는 등의 정교한 해결 방법을 즉석에서 마련한다고 보고했습니다.
한 논평자는 "DeepSeek v4 Flash 0731에 비전 기능이 있다고 자주 가정했다가 실제로 볼 수 없다는 사실이 밝혀지면 텍스트 기반 이미지 분석 도구를 발명한다는 이야기를 들었습니다."라고 한 댓글 작성자는 다른 여러 사람의 보고서를 반영했습니다. 코딩 또는 자동화 파이프라인에서 모델을 에이전트로 사용하는 모든 사람의 경우 새로운 비전 변형은 혼란으로 인한 실패의 전체 범주를 제거해야 합니다.
800x800 캐치
릴리스에는 제한이 없으며 Hacker News에 대한 가장 날카로운 비판은 이미지 해상도라는 한 가지 숫자를 대상으로 했습니다. 문서에는 추론하기 전에 모든 이미지의 크기가 자동으로 조정되어 총 픽셀 수가 가로 세로 비율을 유지하면서 대략 800x800 이미지와 일치하도록 명시되어 있습니다.
"유용하지만 OCR 및 기타 여러 응용 프로그램의 경우 약간 더 높아야 합니다(예: 전체 A4/Letter 크기의 페이지에 넣기)."라고 한 개발자는 주장했고, 다른 개발자는 800x800 크기가 "많은 사용 사례를 죽인다"고 퉁명스럽게 대답했습니다. 조밀한 문서, 전체 페이지 스캔 또는 세분화된 UI 디버깅의 경우 해상도 상한으로 인해 개발자는 더 높은 해상도와 더 비싼 대안을 선택할 수 있습니다. 스레드에서 제안된 인기 있는 해결 방법 중 하나는 큰 페이지를 타일로 분할하고 별도로 공급하는 것입니다.
또 다른 열린 질문은 개방성입니다. DeepSeek은 오픈 웨이트 출시로 명성을 쌓았지만 회사는 비전 변형이 뒤따를지 여부를 밝히지 않았습니다. 논평자들은 이 회사의 최근 "Thinking with Visual Primitives" 연구에서 파생된 것일 수 있다고 추측했습니다. 이에 대한 가중치는 약속되었지만 아직 확인된 바는 없습니다. 특히 이 모델은 실험적("-exp" 접미사)으로 표시되어 DeepSeek이 반복할 것으로 예상한다는 의미입니다.
조용하지만 전략적인 출시
비전 드롭은 V4-Flash-0731, 에이전트 지향 DeepSeek Harness 프레임워크, V4-Pro-0813 새로 고침 및 이제 다중 모드 입력과 같은 꾸준한 업데이트를 제공하는 데 8월을 보낸 항저우 기반 연구소의 바쁜 일정을 계속합니다. 단일 블록버스터 출시가 아닌 DeepSeek는 모델을 개발자 도구 체인 내에 유지하는 신속하고 점진적인 릴리스의 흐름을 실행하고 있습니다. 이는 서구 연구소가 코딩 에이전트를 통해 추구하는 것과 동일한 토지 확보 전략입니다.
AI 업계 전반에 걸쳐 이 메시지는 익숙하지만 기존 기업에게는 여전히 불편한 메시지입니다. 한때 프리미엄 가격 책정(백만 토큰 컨텍스트에 대한 이미지 이해)을 정당화했던 기능이 이제 백만 토큰당 몇 센트에 도달하고 있습니다. 실험적 라벨은 DeepSeek에 모델을 개선할 여지를 제공하지만 개발자는 이미 이를 스크린샷 기반 워크플로에 연결하기 시작했습니다. 문제는 더 이상 DeepSeek이 경쟁사의 다중 모드 기능 세트와 일치할 수 있는지 여부가 아니라 나머지 시장이 얼마나 빨리 가격에 적응하는지입니다.
AI보다 앞서 나가세요
최신 AI 모델 출시, 벤치마크 배틀, 업계 분석을 보려면 AI 버즈와이어를 즐겨찾기에 추가하세요.
AI 뉴스 자세히 보기 →