گزارش سهم توکن ماه ژوئن Vercel نشان می‌دهد که مدل‌های وزن‌باز (open-weight) ۲۹٪ از توکن‌های درگاه را مدیریت می‌کنند، که نسبت به ۱۱٪ در ماه آوریل افزایش یافته است؛ در این میان، تنها DeepSeek ۲۲.۶٪ از این حجم را به خود اختصاص داده است. این جهش نشان‌دهنده یک تغییر سریع است: توسعه‌دهندگان از تمرکز بر یک مدل واحد «بهترین» فاصله گرفته و با مدل‌های هوش مصنوعی به عنوان یک زیرساخت مسیریابی‌پذیر برخورد می‌کنند.

چرا توسعه‌دهندگان با مدل‌ها مانند زیرساخت برخورد می‌کنند

مدل‌های ارزان‌قیمت و وزن‌باز — که بسیاری از آن‌ها متعلق به ارائه‌دهندگان چینی هستند — تنها بخشی از هزینه مدل‌های ممتاز مانند Anthropic را دارند. برای وظایف روتین مانند استخراج کد، پاک‌سازی متن یا جستجوی ساده داده‌ها، مدلی که به جای دلار، فقط چند سنت هزینه دارد می‌تواند جذاب‌تر باشد، حتی اگر چند درصد دقت کمتری داشته باشد.

نتیجه، یک الگوی طراحی جدید است. یک اپلیکیشن ابتدا درخواستی را برای بخش «کسل‌کننده» کار به یک مدل کم‌هزینه می‌فرستد. اگر خروجی از یک بررسی کیفیت ساده عبور کند، فرآیند ادامه می‌یابد؛ در غیر این صورت، یک مدل گران‌تر برای بررسی مجدد یا تصمیم نهایی فراخوانی می‌شود. در اینجا، منطق مسیریابی به قطعه حیاتی تبدیل می‌شود، نه انتخاب یک مدل واحد.

اعداد چه می‌گویند

داده‌های Vercel که از درگاه آن (که در مقابل چندین ارائه‌دهنده هوش مصنوعی قرار دارد) استخراج شده، نشان می‌دهد که مدل‌های وزن‌باز از حاشیه به جریان اصلی حرکت کرده‌اند. در ماه آوریل، آن‌ها تنها کمی بیش از یک‌دهم تمام توکن‌ها را شامل می‌شدند؛ اما تا ماه ژوئن، به نزدیک یک‌سوم رسیدند. DeepSeek، یک مدل چینی، به تنهایی بیش از یک‌پنجم حجم توکن‌ها را تامین کرد.

مدل‌های سطح بالا همچنان بر هزینه‌کردها تسلط دارند. برای مثال، Anthropic همچنان بخش عمده‌ای از مخارج مالی را به خود اختصاص می‌دهد زیرا قیمت هر توکن آن بالاتر است. محاسبات ساده است: مدل‌های ارزان‌قیمت در کارهای پرحجم با حاشیه سود کم پیروز می‌شوند، در حالی که مدل‌های گران‌قیمت وظایف با حاشیه سود بالا و تاثیرگذاری زیاد را حفظ می‌کنند.

پیامدها برای عامل‌های هوش مصنوعی (AI agents)

یک عامل هوش مصنوعی معمولاً مجموعه‌ای از مراحل را انجام می‌دهد: برنامه‌ریزی، بازیابی داده‌ها، فراخوانی ابزار و اصلاح نتیجه. وقتی هر مرحله را بتوان به مقرون‌به‌صرفه‌ترین مدل اختصاص داد، هزینه عملیاتی کلی به شدت کاهش می‌یابد.

  • بازیابی و استخراج داده‌ها اغلب تنها به درک پایه زبان نیاز دارند، وظیفه‌ای که مدل‌های ارزان در آن عالی هستند.
  • قضاوت نهایی — بخشی که تصمیم می‌گیرد آیا پاسخ قابل قبول است یا خیر — همچنان در قلمرو مدل‌های ممتاز با قابلیت اطمینان بالاتر باقی می‌ماند.

این رویکرد لایه‌بندی شده به توسعه‌دهندگان اجازه می‌دهد تا حجم کاری بزرگتری را بدون از بین رفتن بودجه خود خودکارسازی کنند. همچنین باعث تغییر از «انتخاب بهترین مدل» به «اندازه‌گیری موفقیت در هر مرحله و مسیریابی بر همان اساس» می‌شود.

ریسک‌ها و محدودیت‌ها

اقتصاد این مدل جذاب است، اما این گذار بدون اصطکاک نیست.

  • انطباق (Compliance): برخی حوزه‌های قضایی قوانین سختگیرانه‌ای برای مدیریت داده‌ها اعمال می‌کنند که ممکن است استفاده از مدل‌های میزبانی‌شده در خارج از کشور را محدود کند.
  • پیچیدگی میزبانی: اجرای مدل‌های ممتاز و بزرگ در داخل سازمان دشوار است، بنابراین سازمان‌ها باید به APIهای خارجی متکی باشند که می‌تواند باعث افزایش تأخیر (latency) و نگرانی‌های مربوط به وابستگی به فروشنده (vendor-lock) شود.

به دلیل این عوامل، بعید است که مدل‌های ارزان‌قیمت کاملاً جایگزین مدل‌های ممتاز شوند. در عوض، آن‌ها به گزینه پیش‌فرض برای کارهای روتین تبدیل می‌شوند، در حالی که مدل‌های ممتاز در «لایه تصمیم‌گیری» باقی می‌مانند، جایی که هزینه بالاتر آن‌ها توجیه‌پذیر است.

آنچه باید در آینده زیر نظر داشت

  • ابزارهای مسیریابی: با مرکزی‌تر شدن لایه مسیریابی، می‌توان انتظار موجی از SDKها و پلتفرم‌ها را داشت که انتخاب مدل را بر اساس تأخیر، هزینه و آستانه‌های اطمینان خودکار می‌کنند.

توسعه‌دهندگانی که شروع به اندازه‌گیری موفقیت در سطح وظیفه، ردیابی تلاش‌های مجدد (retries) و جداسازی واضح «حجم کار» از «قضاوت» می‌کنند، بهترین موقعیت را برای بهره‌برداری از ذهنیت زیرساختی نوظهور خواهند داشت.

نکته اصلی: پشته (stack) هوش مصنوعی از یک انتخاب مدل واحد به یک مسئله مسیریابی تبدیل می‌شود، جایی که مدل‌های وزن‌باز ارزان‌قیمت بخش عمده کار را انجام می‌دهند و مدل‌های ممتاز برای تصمیمات با تاثیر بالا رزرو می‌شوند. تسلط بر این مسیریابی، مزیت رقابتی بعدی برای سازندگان هوش مصنوعی خواهد بود.