گزارش سهم توکن ماه ژوئن Vercel نشان میدهد که مدلهای وزنباز (open-weight) ۲۹٪ از توکنهای درگاه را مدیریت میکنند، که نسبت به ۱۱٪ در ماه آوریل افزایش یافته است؛ در این میان، تنها DeepSeek ۲۲.۶٪ از این حجم را به خود اختصاص داده است. این جهش نشاندهنده یک تغییر سریع است: توسعهدهندگان از تمرکز بر یک مدل واحد «بهترین» فاصله گرفته و با مدلهای هوش مصنوعی به عنوان یک زیرساخت مسیریابیپذیر برخورد میکنند.
چرا توسعهدهندگان با مدلها مانند زیرساخت برخورد میکنند
مدلهای ارزانقیمت و وزنباز — که بسیاری از آنها متعلق به ارائهدهندگان چینی هستند — تنها بخشی از هزینه مدلهای ممتاز مانند Anthropic را دارند. برای وظایف روتین مانند استخراج کد، پاکسازی متن یا جستجوی ساده دادهها، مدلی که به جای دلار، فقط چند سنت هزینه دارد میتواند جذابتر باشد، حتی اگر چند درصد دقت کمتری داشته باشد.
نتیجه، یک الگوی طراحی جدید است. یک اپلیکیشن ابتدا درخواستی را برای بخش «کسلکننده» کار به یک مدل کمهزینه میفرستد. اگر خروجی از یک بررسی کیفیت ساده عبور کند، فرآیند ادامه مییابد؛ در غیر این صورت، یک مدل گرانتر برای بررسی مجدد یا تصمیم نهایی فراخوانی میشود. در اینجا، منطق مسیریابی به قطعه حیاتی تبدیل میشود، نه انتخاب یک مدل واحد.
اعداد چه میگویند
دادههای Vercel که از درگاه آن (که در مقابل چندین ارائهدهنده هوش مصنوعی قرار دارد) استخراج شده، نشان میدهد که مدلهای وزنباز از حاشیه به جریان اصلی حرکت کردهاند. در ماه آوریل، آنها تنها کمی بیش از یکدهم تمام توکنها را شامل میشدند؛ اما تا ماه ژوئن، به نزدیک یکسوم رسیدند. DeepSeek، یک مدل چینی، به تنهایی بیش از یکپنجم حجم توکنها را تامین کرد.
مدلهای سطح بالا همچنان بر هزینهکردها تسلط دارند. برای مثال، Anthropic همچنان بخش عمدهای از مخارج مالی را به خود اختصاص میدهد زیرا قیمت هر توکن آن بالاتر است. محاسبات ساده است: مدلهای ارزانقیمت در کارهای پرحجم با حاشیه سود کم پیروز میشوند، در حالی که مدلهای گرانقیمت وظایف با حاشیه سود بالا و تاثیرگذاری زیاد را حفظ میکنند.
پیامدها برای عاملهای هوش مصنوعی (AI agents)
یک عامل هوش مصنوعی معمولاً مجموعهای از مراحل را انجام میدهد: برنامهریزی، بازیابی دادهها، فراخوانی ابزار و اصلاح نتیجه. وقتی هر مرحله را بتوان به مقرونبهصرفهترین مدل اختصاص داد، هزینه عملیاتی کلی به شدت کاهش مییابد.
- بازیابی و استخراج دادهها اغلب تنها به درک پایه زبان نیاز دارند، وظیفهای که مدلهای ارزان در آن عالی هستند.
- قضاوت نهایی — بخشی که تصمیم میگیرد آیا پاسخ قابل قبول است یا خیر — همچنان در قلمرو مدلهای ممتاز با قابلیت اطمینان بالاتر باقی میماند.
این رویکرد لایهبندی شده به توسعهدهندگان اجازه میدهد تا حجم کاری بزرگتری را بدون از بین رفتن بودجه خود خودکارسازی کنند. همچنین باعث تغییر از «انتخاب بهترین مدل» به «اندازهگیری موفقیت در هر مرحله و مسیریابی بر همان اساس» میشود.
ریسکها و محدودیتها
اقتصاد این مدل جذاب است، اما این گذار بدون اصطکاک نیست.
- انطباق (Compliance): برخی حوزههای قضایی قوانین سختگیرانهای برای مدیریت دادهها اعمال میکنند که ممکن است استفاده از مدلهای میزبانیشده در خارج از کشور را محدود کند.
- پیچیدگی میزبانی: اجرای مدلهای ممتاز و بزرگ در داخل سازمان دشوار است، بنابراین سازمانها باید به APIهای خارجی متکی باشند که میتواند باعث افزایش تأخیر (latency) و نگرانیهای مربوط به وابستگی به فروشنده (vendor-lock) شود.
به دلیل این عوامل، بعید است که مدلهای ارزانقیمت کاملاً جایگزین مدلهای ممتاز شوند. در عوض، آنها به گزینه پیشفرض برای کارهای روتین تبدیل میشوند، در حالی که مدلهای ممتاز در «لایه تصمیمگیری» باقی میمانند، جایی که هزینه بالاتر آنها توجیهپذیر است.
آنچه باید در آینده زیر نظر داشت
- ابزارهای مسیریابی: با مرکزیتر شدن لایه مسیریابی، میتوان انتظار موجی از SDKها و پلتفرمها را داشت که انتخاب مدل را بر اساس تأخیر، هزینه و آستانههای اطمینان خودکار میکنند.
توسعهدهندگانی که شروع به اندازهگیری موفقیت در سطح وظیفه، ردیابی تلاشهای مجدد (retries) و جداسازی واضح «حجم کار» از «قضاوت» میکنند، بهترین موقعیت را برای بهرهبرداری از ذهنیت زیرساختی نوظهور خواهند داشت.
نکته اصلی: پشته (stack) هوش مصنوعی از یک انتخاب مدل واحد به یک مسئله مسیریابی تبدیل میشود، جایی که مدلهای وزنباز ارزانقیمت بخش عمده کار را انجام میدهند و مدلهای ممتاز برای تصمیمات با تاثیر بالا رزرو میشوند. تسلط بر این مسیریابی، مزیت رقابتی بعدی برای سازندگان هوش مصنوعی خواهد بود.
