DeepSeek مدل آزمایشی V4-Flash-Vision-Exp را عرضه کرد؛ یک مدل چندوجهی (multimodal) که به گفته این شرکت، در بنچمارک‌های داخلی عامل‌ها (agent benchmarks) تقریباً با Opus 4.8 شرکت Anthropic برابری می‌کند، در حالی که هزینه توکن هر تصویر را در ۳۸۴ محدود نگه می‌دارد. این عرضه، جایگزینی سریع و flash برای وظایف هوش مصنوعی بصری فراهم می‌کند که سرعت سری V4-Flash شرکت DeepSeek را با توانایی استدلال روی تصاویر ترکیب می‌کند.

چرا این خبر اهمیت دارد

عامل‌های چندوجهی — سیستم‌هایی که می‌توانند ببینند، بخوانند و عمل کنند — اکنون در مرکز توسعه ابزارهای خودمختار قرار دارند. تیم‌ها از آن‌ها برای ربات‌های پشتیبانی مشتری که اسکرین‌شات‌ها را می‌خوانند و دستیاران پژوهشی که نمودارها را تجزیه می‌کنند، استفاده می‌کنند. Opus 4.8 شرکت Anthropic استاندارد بالایی تعیین کرده است، اما قیمت‌گذاری و تأخیر (latency) آن باعث شده بسیاری از توسعه‌دهندگان از آن صرف‌نظر کنند. ادعای DeepSeek مبنی بر عملکرد تقریباً برابر با کسری از هزینه توکن، می‌تواند محاسبات هزینه-فایده را برای هر کسی که در حال بررسی قابلیت‌های بینایی در گردش کار خود است، تغییر دهد.

DeepSeek چگونه این مدل را ساخت

مدل جدید معماری موجود V4-Flash شرکت DeepSeek را گسترش می‌دهد که پیش از این برای استدلال متنی سریع و مصرف پایین توکن بهینه شده بود. با اتصال یک بخش جلویی (front-end) پردازش تصویر به این هسته، DeepSeek ضمن افزودن درک بصری، قدرت استدلال و دانش جهانی مدل پایه را حفظ کرده است.

انتخاب‌های فنی کلیدی عبارتند از:

  • تشخیص خودکار فرمت – مدل محتوای باینری تصویر را می‌خواند تا تصمیم بگیرد که آیا JPEG، PNG، GIF یا WebP است؛ این کار از بروز خطا به دلیل نام‌گذاری اشتباه فایل‌ها جلوگیری می‌کند.
  • تغییر اندازه تطبیقی (Adaptive resizing) – تصاویر ورودی به حدود ۸۰۰ × ۸۰۰ پیکسل نرمال‌سازی می‌شوند. توسعه‌دهندگان می‌توانند حالت با جزئیات کمتر را درخواست کنند که اندازه را به ۵۱۲ × ۵۱۲ محدود می‌کند و مصرف توکن را بیشتر کاهش می‌دهد.
  • سقف توکن – صرف‌نظر از رزولوشن اصلی، مدل هرگز بیش از ۳۸۴ توکن برای هر تصویر دریافت نمی‌کند که بودجه‌بندی را قابل پیش‌بینی می‌کند.

DeepSeek همچنین نسخه 0.1.1 فریم‌ورک Harness خود را منتشر کرد که مدل جدید را در خود جای داده و آداپتورهای آماده‌ای برای OpenAI Chat Completions و Responses APIs و همچنین Anthropic's Messages endpoint ارائه می‌دهد. تیم‌ها می‌توانند مدل را تنها با چند تغییر در پیکربندی، در کدهای موجود خود قرار دهند.

آنچه توسعه‌دهندگان به دست می‌آورند

  • پشتیبانی گسترده از تصاویر – فرمت‌های JPEG، PNG، GIF و WebP پذیرفته می‌شوند و مدل می‌تواند داده‌ها را از طریق رشته‌های Base64، URLهای عمومی (تا ۳۲ مگابایت) یا Files API رایگان DeepSeek دریافت کند. Files API یک آپلود تا ۶۴ مگابایت را ذخیره می‌کند و به شما اجازه می‌دهد در چندین مرحله گفتگو با استفاده از ID به آن ارجاع دهید که باعث کاهش آپلودهای تکراری در مکالمات طولانی می‌شود.
  • بافتار (context) با حجم بالا – یک درخواست واحد ممکن است تا ۶۰۰ تصویر را حمل کند. حداکثر طول ضلع هر تصویر ۸,۱۹۲ پیکسل است که در درخواست‌های حاوی ۱۵ تصویر یا بیشتر، به ۴,۰۹۶ پیکسل کاهش می‌یابد تا زمان پردازش کنترل شود.
  • وظایف آماده برای عامل‌ها (Agent-ready) – مدل برای بارهای کاری "agentic" تنظیم شده است: توصیف صحنه‌های پیچیده، استخراج متن از اسکرین‌شات‌ها و تحلیل نمودارهای دشوار. از آنجایی که این مدل سرعت استدلال V4-Flash را حفظ کرده است، می‌تواند سرنخ‌های بصری را بدون ایجاد گلوگاه، در زنجیره‌های فکری گسترده‌تر ترکیب کند.

این ویژگی‌ها نقاط درد رایج توسعه‌دهندگان را هدف قرار می‌دهند: مدیریت تصاویر زیاد در یک جلسه، جلوگیری از انفجار مصرف توکن و ادغام قابلیت بینایی بدون نیاز به بازنویسی فراخوانی‌های API.

محدودیت‌های احتمالی

ادعای عملکرد DeepSeek بر پایه بنچمارک‌های داخلی عامل‌های چندوجهی است. این تست‌ها ممکن است متغیرهای دنیای واقعی مانند عکس‌های نویزدار، شرایط نور کم یا فرمت‌های فایل غیرمعمول را نادیده بگیرند. برچسب "experimental" (آزمایشی) نیز نشان می‌دهد که مدل ممکن است هنوز در حال رفع مشکلات پایداری و مقیاس‌پذیری باشد.

طراحی‌های اولویت‌محور بر سرعت مانند V4-Flash معمولاً عمق بازنمایی (representation) را که مدل‌های بزرگ‌تر و کندتر به آن دست می‌یابند، فدا می‌کنند. سقف توکن هزینه‌ها را پایین نگه می‌دارد اما جزئیات بصری را محدود می‌کند، که می‌تواند به وظایفی که نیاز به تحلیل دقیق دارند (مانند خواندن فونت‌های بسیار ریز یا تشخیص تفاوت‌های ظریف بافت) آسیب برساند.

در نهایت، وابستگی به اکوسیستم (ecosystem lock-in) همچنان یک ملاحظه است. اگرچه DeepSeek ساختار APIهای OpenAI و Anthropic را تقلید می‌کند، اما توسعه‌دهندگان همچنان باید یک ارائه‌دهنده مجزا، احراز هویت آن و تغییرات احتمالی قیمت در آینده را مدیریت کنند. تیم‌هایی که به شدت روی یک فروشنده سرمایه‌گذاری کرده‌اند، ممکن است تلاش برای ادغام را در مقابل صرفه‌جویی‌های پیش‌بینی‌شده بسنجند.

آنچه باید زیر نظر داشت

  • ارزیابی‌های مستقل – بنچمارک‌های شخص ثالث اولین آزمون واقعی برای ادعای «نزدیک به Opus 4.8» خواهند بود. به دنبال نتایجی در مجموعه‌داده‌های عمومی مانند VQAv2 یا CLEVR باشید که هم بر استدلال و هم بر دقت بصری تأکید دارند.
  • به‌روزرسانی‌های قیمت‌گذاری – DeepSeek بر کارایی توکن تأکید دارد، اما هزینه واقعی برای هر تصویر ۳۸۴ توکنی تعیین خواهد کرد که آیا این مدل واقعاً قیمت‌های رقبا را زیر می‌زند یا خیر.
  • عرضه ویژگی‌های جدید – نسخه‌های آتی Harness می‌تواند پردازش دسته‌ای، خروجی‌های استریمینگ یا ادغام نزدیک‌تر با ابزارهای محبوب ارکستراسیون عامل را اضافه کند و کاربرد مدل را گسترش دهد.
  • پذیرش توسط جامعه – سرعتی که توسعه‌دهندگان پلاگین‌ها، رپِرها (wrappers) یا مطالعات موردی را منتشر می‌کنند، نشان خواهد داد که آیا سازگاری API مدل به استفاده عملی تبدیل می‌شود یا خیر.

نکته کلیدی

مدل V4-Flash-Vision-Exp از DeepSeek، یک عامل چندوجهی سریع و کم‌مصرف (از نظر توکن) را روانه بازار می‌کند که ادعا می‌کند عملکردی نزدیک به Opus 4.8 شرکت Anthropic دارد. اگر بنچمارک‌های داخلی تایید شوند، این مدل می‌تواند به گزینه اصلی برای توسعه‌دهندگانی تبدیل شود که به قابلیت بینایی نیاز دارند اما نمی‌خواهند هزینه‌های سنگین مدل‌های پیشرو (frontier-scale) را بپردازند، در حالی که همچنان با موازنه‌های معمول در هوش مصنوعی آزمایشی و سرعت‌محور دست‌وپنجه نرم می‌کند.