Китайська лабораторія штучного інтелекту DeepSeek тихо випустила deepseek-v4-flash-vision-exp, експериментальну версію своєї моделі V4-Flash, яка може приймати зображення разом із текстом, закриваючи одну з найбільш яскравих прогалин у сімействі флагманських моделей. Випуск, задокументований на офіційних сторінках API компанії, з’являється всього за кілька тижнів після оновлення V4-Flash-0731 і V4-Pro-0813 і дає розробникам давно просив спосіб завантажувати знімки екрана, діаграми та фотографії безпосередньо в одну з найдешевших передових моделей у галузі. Для команд, які відстежують [останні розробки штучного інтелекту] (https://aibuzzwire.news), це ще один сигнал про те, що DeepSeek має намір зрівнятися із західними суперниками за функціями, водночас різко знижуючи їм ціни.

Що робить нова модель

Відповідно до документації API DeepSeek, `deepseek-v4-flash-vision-exp` дозволяє користувачам "просити модель описати зображення, читати текст зі знімків екрана, аналізувати діаграми тощо". Модель приймає файли JPEG, PNG, GIF і WebP, причому формат визначається за фактичним вмістом файлу, а не за назвою файлу чи заявленим типом MIME — невелика, але продумана деталь, яка запобігає помилкам невідповідності розширень.

Розробники можуть передавати зображення трьома способами: вбудовані URL-адреси даних у кодуванні base64 (з обмеженням на тіло запиту в 48 МіБ), загальнодоступні зовнішні URL-адреси (до 8192 символів, 32 МіБ на зображення, з 60-секундним вікном завантаження) або через Files API. Усе використовує стандартний формат завершення чату, сумісний із OpenAI, і модель також доступна через сумісну з Anthropic кінцеву точку DeepSeek — це означає, що існуючий код Claude SDK може перемикати бекенди з мінімальними змінами.

Ціноутворення: краєвид за товарними ставками

Експериментальна модель успадкувала агресивну цінову політику V4-Flash. Вхідні маркери коштують 0,22 дол. США за мільйон у непіковий період і 0,44 дол. США на піку за промахи кешу, знижуючись лише до 0,007 дол. США за мільйон звернень до кешу в години поза піком. Вихідні токени коштують 0,66 дол. США за мільйон поза піком і 1,32 дол. США в пік. Зображення перетворюються на токени на основі їх розмірів і виставляються разом із текстовими токенами.

Це ціноутворення має значення, оскільки воно різко знижує порівняльні мультимодальні пропозиції від основних постачальників у США, продовжуючи цінову війну, яку DeepSeek вів цілий рік. Модель також містить основні специфікації сімейства: контекстне вікно з 1 мільйоном токенів, до 384 тис. токенів максимального виведення, підтримка режимів мислення та немислення, вихід JSON, виклики інструментів і обмеження одночасного виконання в 2500 — специфікації, які позиціонують її як справжню робочу конячку для великих виробничих навантажень, а не як дослідницьку іграшку.

Чому розробники цього відчайдушно прагнули

Запуск припав на Hacker News, де він швидко набрав понад 450 балів — і цей ентузіазм має конкретну історію походження. Текстовий V4-Flash-0731 від DeepSeek заслужив репутацію вірячи, що він може бачити. Кілька розробників повідомили, що модель припускатиме, що вона має можливості бачення, а потім імпровізуватимуть складні обхідні шляхи, коли виявитимуть, що це не так, включаючи винайдення інструментів аналізу текстових зображень і отримання скріншотів із підключених пристроїв до того, як зрозуміють, що немає можливості їх переглянути.

«Я чув, що DeepSeek v4 Flash 0731 часто припускав, що він має здатність бачення, а потім вдавався до винаходу інструментів аналізу текстових зображень, коли виявляв, що насправді не бачить», — написав один коментатор, повторюючи звіти кількох інших. Для тих, хто використовує цю модель як агент у конвеєрах кодування або автоматизації, новий варіант бачення повинен усунути цілу категорію збоїв, спричинених плутаниною.

Улов 800x800

Випуск не позбавлений обмежень, і найгостріша критика на Hacker News була націлена на одну цифру: роздільну здатність зображення. У документації зазначено, що перед визначенням розмір кожного зображення автоматично змінюється таким чином, щоб його загальна кількість пікселів приблизно відповідала розміру зображення 800x800, зберігаючи співвідношення сторін.

«Це корисно, але для оптичного розпізнавання тексту та багатьох інших додатків воно має бути трохи вищим (наприклад, для розміщення повної сторінки розміром A4/Letter)», — стверджував один розробник, а інший прямо відповів, що обмеження 800x800 «вбиває багато випадків використання». Для щільних документів, повносторінкового сканування або детального налагодження інтерфейсу користувача максимальна роздільна здатність може підштовхнути розробників до більш високої роздільної здатності — і дорожчих — альтернатив. Одне популярне рішення, запропоноване в ланцюжку: розділити великі сторінки на фрагменти та подати їх окремо.

Інше відкрите питання – відкритість. DeepSeek створив свою репутацію на випуску відкритих ваг, але компанія не повідомила, чи з’явиться варіант vision. Коментатори припустили, що це може бути результатом нещодавнього дослідження компанії «Мислення за допомогою візуальних примітивів», для якого нібито були обіцяні ваги, але нічого не підтверджено. Примітно, що модель вказана як експериментальна — суфікс «-exp» — сигналізує про те, що DeepSeek очікує ітерації.

Тихий, але стратегічний випуск

Зниження бачення продовжує напружений період для лабораторії в Ханчжоу, яка витратила серпень на доставку постійних оновлень: V4-Flash-0731, агентно-орієнтовану структуру DeepSeek Harness, оновлення V4-Pro-0813, а тепер мультимодальне введення. Замість того, щоб запускати один блокбастер, DeepSeek виконує каденцію швидких, поступових випусків, які зберігають його моделі в ланцюжках інструментів розробника — тієї самої стратегії захоплення землі, яку дотримуються західні лабораторії з агентами кодування.

Для індустрії штучного інтелекту в цілому повідомлення знайоме, але все ще незручне для провідних компаній: можливості, які колись виправдовували преміум-ціноутворення — розуміння зображення в контексті мільйона токенів — тепер досягають кількох центів за мільйон токенів. Експериментальний ярлик дає DeepSeek простір для вдосконалення моделі, але розробники вже почали включати його в робочі процеси, керовані знімками екрана. Питання вже не в тому, чи може DeepSeek відповідати мультимодальному набору функцій своїх конкурентів, а в тому, наскільки швидко решта ринку пристосовується до його цін.

Будьте попереду ШІ

Щоб переглянути найновіші випуски моделей штучного інтелекту, порівняльні битви та аналіз галузі, додайте закладку AI Buzz Wire.

Читати більше новин AI →