مدل‌های Qwen2.5-Max از علی‌بابا و V3-Flash از DeepSeek این هفته وارد بازار شدند، که هر کدام مسیر متفاوتی را برای ارزان‌تر کردن استنتاج (inference) هوش مصنوعی در پیش گرفته‌اند. علی‌بابا با طراحی Mixture-of-Experts (MoE) خود با ۲.۴ تریلیون پارامتر، در هر پرس‌وجو تنها حدود ۹۵ میلیارد پارامتر را فعال می‌کند؛ DeepSeek نیز معماری خود را برای کاهش قیمت هر توکن اصلاح کرده است. رقابت تسلیحاتی هوش مصنوعی اکنون نه فقط با اندازه مدل، بلکه با دلار به ازای هر توکن سنجیده می‌شود.

از «پارامترهای بیشتر» به «هزینه کمتر»

سال‌ها بود که معیار اصلی در توسعه مدل‌های زبانی بزرگ (LLM)، تعداد پارامترها بود. OpenAI، Google و دیگران با شکستن مرز تریلیون پارامتر خود می‌بالیدند، با این فرض که بزرگ‌تر بودن به معنای هوشمندتر بودن است. اما علی‌بابا و DeepSeek نشان می‌دهند که محاسبات تغییر کرده است.

مدل Qwen2.5-Max از علی‌بابا همچنان بر مقیاس تکیه دارد، اما یک ترفند کاهش هزینه نیز به آن اضافه شده است. در یک مدل متراکم (dense)، هر پارامتر در هر بار استنتاج اجرا می‌شود که یک شبکه ۲.۴ تریلیون پارامتری را به هیولایی پرمصرف تبدیل می‌کند. معماری MoE شبکه را به بسیاری از «متخصصان» (experts) تقسیم کرده و هر درخواست را به زیرمجموعه‌ای از آن‌ها هدایت می‌کند. مسیریاب (router) در Qwen2.5-Max برای هر دستور (prompt)، تقریباً ۹۵ میلیارد پارامتر را انتخاب می‌کند که قدرت استدلال یک سیستم تریلیون پارامتری را ارائه می‌دهد، در حالی که تأخیر (latency) و مصرف انرژی را تحت کنترل نگه می‌دارد.

DeepSeek به طور کامل از جاه‌طلبی تریلیون پارامتری چشم‌پوشی کرده است. مدل V3-Flash آن برای اجرا به صورت ارزان، سریع و در مقیاس بالا ساخته شده است. این شرکت مدل خود را با محوریت «قیمت‌گذاری بسیار پایین استنتاج» بازاریابی می‌کند و توسعه‌دهندگانی را هدف قرار می‌دهد که روزانه میلیون‌ها توکن را بدون فشار مالی سنگین پردازش می‌کنند. قیمت دقیق اعلام نشده است، اما پیام روشن است: اگر یک استارتاپ توان پرداخت نرخ‌های توکن در غرب را نداشته باشد، V3-Flash یک جایگزین قابل اتکا خواهد بود.

چرا هزینه استنتاج در حال تبدیل شدن به یک مزیت رقابتی است

وقتی مدل‌ها از آزمایشگاه خارج شده و وارد مرحله تولید می‌شوند، هزینه استنتاج اهمیت می‌یابد. شرکت‌هایی که LLMها را در چت‌بات‌ها، خطوط تحلیل اسناد یا موتورهای پیشنهاددهنده ادغام می‌کنند، به سرعت متوجه می‌شوند که قیمت‌گذاری در سطح توکن، بر هزینه‌های عملیاتی غالب است. مدلی که هزینه هر توکن آن نصف باشد، می‌تواند بودجه برای سایر اقدامات را دو برابر کند—مانند داده‌های بیشتر، ترافیک بالاتر یا ویژگی‌های اضافی.

این دو شرکت چینی بخش‌های مختلفی از بازار را هدف قرار داده‌اند. معماری MoE علی‌بابا وعده عملکرد بالا برای وظایف پیچیده و استدلال‌محور را می‌دهد، در حالی که بودجه محاسباتی هر درخواست را در سطح متوسط نگه می‌دارد. در مقابل، مدل سبک‌تر DeepSeek برای حجم کاری بالا و حساس به تأخیر جذاب است، جایی که قدرت پردازشی خام نسبت به هزینه قابل پیش‌بینی اهمیت کمتری دارد.

هر دو استراتژی می‌توانند سهم ارائه‌دهندگان غربی را که مدل‌های بزرگ را با قیمت‌های بالا عرضه می‌کنند، کاهش دهند. اگر توسعه‌دهندگان بتوانند با قیمت توکن ارزان‌تر به نتایج مشابهی دست یابند، انگیزه برای ماندن در استفاده از APIهای گران‌قیمت ضعیف می‌شود.

پیامدها برای اکوسیستم جهانی هوش مصنوعی

  • استارتاپ‌ها و شرکت‌های کوچک و متوسط (SMEs): کاهش هزینه‌های استنتاج، مانع ورود به دنیای محصولات مبتنی بر هوش مصنوعی را کاهش می‌دهد. تیم‌هایی که زمانی برای هزینه‌های API به سرمایه اضافی نیاز داشتند، اکنون می‌توانند با بودجه‌های محدودتر نمونه‌سازی کرده و محصول خود را عرضه کنند.
  • سازمان‌ها: شرکت‌های بزرگی که سرویس‌های هوش مصنوعی داخلی را اجرا می‌کنند، می‌توانند هزینه‌های عملیاتی خود را کاهش داده و بودجه‌ای را برای تهیه داده، تنظیم دقیق مدل (fine-tuning) یا محاسبات اضافی آزاد کنند.
  • ارائه‌دهندگان غربی: مدل‌های درآمدی آن‌ها بر پایه هزینه‌های توکن‌محور است. تغییر به سمت جایگزین‌های متمرکز بر هزینه، آن‌ها را مجبور می‌کند قیمت‌ها را کاهش دهند یا در قابلیت‌هایی که مدل‌های ارزان‌تر هنوز قادر به انجام آن‌ها نیستند، متمایز شوند.
  • نهادهای نظارتی و سیاست‌گذاران: هوش مصنوعی مقرون‌به‌صرفه‌تر می‌تواند پذیرش آن را در بخش‌های مختلف تسریع کند و پرسش‌هایی را در مورد نظارت، حریم خصوصی داده‌ها و سرعت اتوماسیون ایجاد نماید.

سبک‌سنگین کردن‌ها و استدلال‌های مخالف

مدل‌های MoE مانند Qwen2.5-Max بدون هزینه نیستند. منطق مسیریابی (routing) به پیچیدگی مهندسی می‌افزاید و فعال‌سازی پراکنده (sparse activation) می‌تواند باعث عملکرد نابرابر در انواع مختلف پرس‌وجوها شود. اگر مسیریاب دچار خطا شود، ممکن است یک درخواست به متخصصان غیربهینه هدایت شود که کیفیت خروجی را کاهش می‌دهد. علاوه بر این، سخت‌افزارها هنوز به سمت محاسبات متراکم (dense) تمایل دارند؛ شتاب‌دهنده‌های تخصصی برای استنتاج MoE هنوز گسترده نشده‌اند، که این امر می‌تواند بهره‌وری در دنیای واقعی را محدود کند.

فلسفه «اول هزینه» در DeepSeek نیز خطراتی به همراه دارد. قیمت‌گذاری تهاجمی اغلب به معنای محدودیت‌های شدیدتر در اندازه مدل و داده‌های آموزشی است که پتانسیل محدود کردن عملکرد را دارد. برای کاربردهایی که نیازمند استدلال‌های ظریف هستند، مدل ارزان‌تر ممکن است پاسخگو نباشد و کاربران را دوباره به سمت جایگزین‌های بزرگ‌تر و گران‌تر سوق دهد.

در نهایت، «هوش به ازای هر دلار» تنها یکی از محورهای رقابت است. تأخیر، قابلیت اطمینان، پشتیبانی اکوسیستم و انطباق با مقررات منطقه‌ای همچنان تعیین‌کننده هستند. شرکت‌هایی که بسته‌ای متوازن در تمام این ابعاد ارائه می‌دهند، احتمالاً بازار را در اختیار خواهند گرفت، نه فقط کسانی که در جنگ قیمت‌ها پیروز می‌شوند.

آنچه باید در ادامه زیر نظر داشت

  • انتشار بنچمارک‌ها: ارزیابی‌های مستقل از کارایی مسیریابی MoE در Qwen2.5-Max و هزینه توکن در V3-Flash مشخص خواهد کرد که آیا این هیاهو به صرفه‌جویی‌های قابل اندازه‌گیری تبدیل می‌شود یا خیر.
  • پیشرفت‌های سخت‌افزاری: به‌کارگیری شتاب‌دهنده‌های بهینه‌سازی‌شده برای فعال‌سازی پراکنده (sparse activation) می‌تواند مزایای MoE را تقویت کند، در حالی که GPUهای همه‌منظوره ممکن است مدل‌های متراکم (dense) را رقابتی نگه دارند.
  • واکنش‌های قیمت‌گذاری: ارائه‌دهندگان غربی ممکن است سطوح قیمتی خود را تنظیم کنند یا ویژگی‌های کاهش هزینه مانند تخفیف‌های استنتاج دسته‌ای (batch inference) یا لایسنس‌های محلی (on-premise) را اضافه کنند.
  • اقدامات نظارتی: با گسترش هوش مصنوعی ارزان‌تر، دولت‌ها ممکن است استانداردهایی برای شفافیت و ایمنی معرفی کنند که می‌تواند بر نحوه استقرار این مدل‌ها در مقیاس بزرگ تأثیر بگذارد.

نکته کلیدی

مدل MoE-محور Qwen2.5-Max از Alibaba و مدل کم‌هزینه V3-Flash از DeepSeek نشان می‌دهند که رقابت در حوزه هوش مصنوعی اکنون به همان اندازه که بر پایه تعداد پارامترهاست، بر پایه جداول بودجه نیز پیش می‌رود. شرکت‌هایی که ضمن حفظ هزینه پایینِ هر توکن، توانایی‌های زبانی پیچیده‌ای را ارائه می‌دهند، هوش مصنوعی را به طیف گسترده‌تری از کاربران باز خواهند کرد و پویایی‌های رقابتی را که مدت‌ها به نفع بزرگ‌ترین و گران‌ترین مدل‌ها بوده است، بازتعریف خواهند کرد.