DeepSeek випустила V4-Flash-Vision-Exp — експериментальну мультимодальну модель, яка, за словами компанії, демонструє результати на внутрішніх бенчмарках агентів майже на рівні з Anthropic Opus 4.8, при цьому вартість токенів для кожного зображення обмежена 384. Цей запуск надає розробникам швидку альтернативу для візуальних завдань ШІ, яка обіцяє швидкість лінійки V4-Flash від DeepSeek разом із можливістю міркувати на основі зображень.

Чому це оголошення є важливим

Мультимодальні агенти — системи, які можуть бачити, читати та діяти — зараз перебувають у центрі розробки автономних інструментів. Команди використовують їх для створення ботів підтримки клієнтів, які читають скриншоти, або дослідницьких асистентів, що аналізують діаграми. Anthropic Opus 4.8 встановила високу планку, але її ціноутворення та затримка (latency) змушували багатьох залишатися осторонь. Заява DeepSeek про майже рівну продуктивність за частку вартості токенів може змінити розрахунок співвідношення витрат і вигоди для кожного, хто розглядає можливість впровадження візуальних функцій у свій робочий процес.

Як DeepSeek створила цю модель

Нова модель розширює існуючу архітектуру DeepSeek V4-Flash, яка вже налаштована для швидких текстових міркувань та низького споживання токенів. Інтегрувавши фронтенд для обробки зображень у це ядро, DeepSeek зберегла знання про світ та сильні сторони базової моделі в плані міркувань, додавши до цього візуальне розуміння.

Ключові технічні рішення включають:

  • Автоматичне визначення формату — модель зчитує бінарний вміст зображення, щоб вирішити, чи є воно JPEG, PNG, GIF чи WebP, уникаючи помилок через неправильно названі файли.
  • Адаптивне змінення розміру — вхідні зображення нормалізуються приблизно до 800 × 800 пікселів. Розробники можуть запитати режим з низькою деталізацією, який примусово встановлює розмір 512 × 512, що ще більше зменшує використання токенів.
  • Ліміт токенів — незалежно від початкової роздільної здатності, модель ніколи не нараховує більше 384 токенів за зображення, що робить планування бюджету передбачуваним.

DeepSeek також випустила версію 0.1.1 свого фреймворку Harness, який об'єднує нову модель і пропонує готові адаптери для OpenAI Chat Completions та Responses APIs, а також для Anthropic Messages endpoint. Команди можуть інтегрувати модель у наявні кодові бази лише за допомогою кількох змін у конфігурації.

Що отримують розробники

  • Широка підтримка зображень — приймаються формати JPEG, PNG, GIF та WebP; модель може приймати дані через рядки Base64, публічні URL (до 32 MiB) або безкоштовний DeepSeek Files API. Files API зберігає одне завантаження обсягом до 64 MiB і дозволяє посилатися на нього за ID протягом кількох етапів діалогу, що зменшує кількість повторних завантажень у довгих розмовах.
  • Великий обсяг контексту — один запит може містити до 600 зображень. Максимальна довжина сторони зображення становить 8 192 пікселі, але зменшується до 4 096 пікселів, якщо запит містить 15 або більше зображень, що допомагає контролювати час обробки.
  • Завдання, готові для агентів — модель налаштована для «агентських» робочих навантажень: опису складних сцен, вилучення тексту зі скриншотів та аналізу складних діаграм. Оскільки вона зберігає швидкість міркувань V4-Flash, вона може вплітати візуальні підказки у ширші ланцюжки міркувань, не стаючи «вузьким місцем».

Ці можливості вирішують типові проблеми розробників: обробку багатьох зображень в одній сесії, уникнення різкого зростання витрат токенів та інтеграцію візуальних функцій без переписування викликів API.

Потенційні обмеження

Заява DeepSeek про продуктивність ґрунтується на внутрішніх бенчмарках мультимодальних агентів. Ці тести можуть не враховувати варіативність реального світу — зашумлені фото, умови низької освітленості або незвичні формати файлів. Маркування «експериментальна» також натякає на те, що модель може все ще доопрацьовувати питання стабільності та масштабування.

Дизайни, орієнтовані на швидкість, як-от V4-Flash, зазвичай жертвують глибиною представлення, якої досягають більші та повільніші моделі. Ліміт токенів тримає витрати низькими, але обмежує візуальну деталізацію, що може зашкодити завданням, які потребують детального аналізу (наприклад, читання дуже дрібного шрифту або виявлення ледь помітних відмінностей у текстурі).

Нарешті, залишається питання прив'язки до екосистеми. Хоча DeepSeek повторює структуру API OpenAI та Anthropic, розробникам все одно потрібно керувати окремим провайдером, його автентифікацією та можливими змінами цін у майбутньому. Команди, які сильно залежать від одного вендора, можуть зважити зусилля на інтеграцію порівняно з прогнозованою економією.

За чим стежити

  • Незалежні оцінки – сторонні бенчмарки стануть першим справжнім випробуванням твердження про «рівень, близький до Opus 4.8». Звертайте увагу на результати на публічних наборах даних, таких як VQAv2 або CLEVR, які перевіряють як здатність до міркування, так і візуальну точність.
  • Оновлення ціноутворення – DeepSeek наголошує на ефективності використання токенів, але фактична вартість за зображення обсягом 384 токени вирішить, чи зможе модель справді запропонувати ціни нижче, ніж у конкурентів.
  • Впровадження нових функцій – майбутні релізи Harness можуть додати пакетну обробку, потокову передачу результатів або тіснішу інтеграцію з популярними інструментами оркестрації агентів, що розширить корисність моделі.
  • Прийняття спільнотою – швидкість, з якою розробники публікуватимуть плагіни, обгортки або кейси, покаже, чи перетвориться сумісність API моделі на практичне використання.

Підсумок

V4-Flash-Vision-Exp від DeepSeek виводить на ринок швидкого та економного до токенів мультимодального агента, продуктивність якого, за заявами, близька до Opus 4.8 від Anthropic. Якщо внутрішні бенчмарки підтвердяться, вона може стати основним вибором для розробників, яким потрібне комп'ютерне бачення без високої вартості моделей передового рівня, водночас зважаючи на звичні компроміси експериментального ШІ, орієнтованого на швидкість.