Китайская лаборатория искусственного интеллекта DeepSeek незаметно выпустила deepseek-v4-flash-vision-exp, экспериментальную версию своей модели V4-Flash, которая может принимать изображения наряду с текстом, закрывая один из самых явных пробелов в своем флагманском семействе моделей. Релиз, документированный на официальных страницах API компании, выйдет всего через несколько недель после обновления V4-Flash-0731 и V4-Pro-0813 и предоставит разработчикам давно востребованный способ загрузки снимков экрана, диаграмм и фотографий непосредственно в одну из самых дешевых моделей передового уровня в отрасли. Для команд, отслеживающих [последние разработки в области искусственного интеллекта] (https://aibuzzwire.news), это еще один сигнал о том, что DeepSeek намерен конкурировать с западными конкурентами по характеристикам, одновременно агрессивно снижая их цену.

Что делает новая модель

Согласно документации API DeepSeek, deepseek-v4-flash-vision-exp позволяет пользователям «просить модель описывать изображения, читать текст со скриншотов, анализировать диаграммы и многое другое». Модель принимает файлы JPEG, PNG, GIF и WebP, причем формат определяется по фактическому содержимому файла, а не по имени файла или объявленному типу MIME — небольшая, но продуманная деталь, которая предотвращает ошибки несовпадения расширений.

Разработчики могут передавать изображения тремя способами: URL-адреса встроенных данных в кодировке Base64 (с учетом ограничения тела запроса в 48 МБ), общедоступные внешние URL-адреса (до 8192 символов, 32 МБ на изображение, с 60-секундным окном загрузки) или через Files API. Все использует стандартный формат завершения чата, совместимый с OpenAI, и модель также доступна через совместимую с Anthropic конечную точку DeepSeek — это означает, что существующий код Claude SDK может переключать серверные части с минимальными изменениями.

Ценообразование: передовое видение при ценах на сырьевые товары

Экспериментальная модель унаследовала агрессивный ценник V4-Flash. Входные токены стоят 0,22 доллара за миллион в непиковые часы и 0,44 доллара в пиковые часы за промахи в кэше, а в непиковые часы они снижаются до всего лишь 0,007 доллара за миллион при попаданиях в кеш. Выходные токены оцениваются в 0,66 доллара за миллион вне пика и 1,32 доллара в пик. Изображения преобразуются в токены в зависимости от их размеров и оплачиваются вместе с текстовыми токенами.

Это ценообразование имеет значение, поскольку оно резко подрывает сопоставимые мультимодальные предложения от крупных поставщиков США, продолжая ценовую войну, которую DeepSeek вела весь год. Модель также сохраняет основные характеристики семейства: контекстное окно на 1 миллион токенов, максимальная производительность до 384 000 токенов, поддержка режимов мышления и без мышления, вывод JSON, вызовы инструментов и ограничение параллелизма в 2500 — характеристики, которые позиционируют его как настоящую рабочую лошадку для крупномасштабных производственных рабочих нагрузок, а не как исследовательскую игрушку.

Почему разработчики так отчаянно нуждались в этом

Запуск попал на Hacker News, где быстро набрал более 450 баллов — и этот энтузиазм имеет конкретную историю. Текстовый V4-Flash-0731 от DeepSeek заработал репутацию человека, который верит, что может видеть. Многие разработчики сообщили, что модель предполагала, что у нее есть возможности видения, а затем импровизировала сложные обходные пути, когда обнаруживала, что это не так, включая изобретение текстовых инструментов анализа изображений и получение снимков экрана с подключенных устройств, прежде чем понять, что у нее нет возможности их просмотреть.

«Я слышал, что DeepSeek v4 Flash 0731 часто предполагал, что у него есть возможности зрения, а затем прибегал к созданию инструментов анализа текстовых изображений, когда обнаруживал, что на самом деле не видит», — написал один комментатор, повторяя сообщения нескольких других. Для тех, кто использует модель в качестве агента в конвейерах кодирования или автоматизации, новый вариант видения должен устранить целую категорию ошибок, вызванных путаницей.

Подвох 800x800

Релиз не лишен ограничений, и самая резкая критика на Hacker News была направлена на одно число: разрешение изображения. В документации указано, что перед выводом размер каждого изображения автоматически изменяется так, чтобы общее количество пикселей примерно соответствовало изображению 800x800, сохраняя соотношение сторон.

«Это полезно, но для оптического распознавания символов и многих других приложений оно должно быть немного выше (например, для размещения полной страницы формата A4/Letter)», — заявил один разработчик, а другой прямо ответил, что ограничение 800x800 «убивает множество вариантов использования». Для плотных документов, полностраничного сканирования или детальной отладки пользовательского интерфейса потолок разрешения может подтолкнуть разработчиков к альтернативам с более высоким разрешением — и более дорогим —. В ветке предложено одно популярное обходное решение: разделить большие страницы на плитки и подавать их отдельно.

Другой открытый вопрос – открытость. DeepSeek заработал свою репутацию на выпуске открытых весов, но компания не сообщила, будет ли последуть этот концептуальный вариант. Комментаторы предположили, что это может быть связано с недавним исследованием компании «Мышление с помощью визуальных примитивов», для которого, как сообщается, были обещаны веса, но ничего не было подтверждено. Примечательно, что модель указана как экспериментальная — суффикс «-exp» — сигнализирует о том, что DeepSeek планирует провести итерацию.

Тихий, но стратегический релиз

Падение видения продолжает оставаться напряженным периодом для лаборатории в Ханчжоу, которая провела август, выпуская постоянные обновления: V4-Flash-0731, агентно-ориентированную структуру DeepSeek Harness, обновление V4-Pro-0813, а теперь и мультимодальный ввод. Вместо запуска одного блокбастера DeepSeek выполняет серию быстрых, дополнительных выпусков, которые сохраняют свои модели в цепочках инструментов разработчика — та же стратегия захвата земель, которую западные лаборатории реализуют с помощью агентов кодирования.

Для индустрии искусственного интеллекта в целом это сообщение знакомо, но все еще неудобно для действующих игроков: возможности, которые когда-то оправдывали премиальную цену — понимание изображения в контексте миллиона токенов — теперь достигают нескольких центов за миллион токенов. Экспериментальная метка дает DeepSeek возможность усовершенствовать модель, но разработчики уже начали встраивать ее в рабочие процессы, основанные на скриншотах. Вопрос уже не в том, сможет ли DeepSeek соответствовать мультимодальному набору функций своих конкурентов, а в том, насколько быстро остальная часть рынка приспособится к его ценам.

Будьте впереди ИИ

Чтобы быть в курсе последних выпусков моделей ИИ, сражений в тестах и отраслевого анализа, добавьте в закладки AI Buzz Wire.

Подробнее новости AI →