مدلهای Qwen2.5-Max از علیبابا و V3-Flash از DeepSeek این هفته وارد بازار شدند، که هر کدام مسیر متفاوتی را برای ارزانتر کردن استنتاج (inference) هوش مصنوعی در پیش گرفتهاند. علیبابا با طراحی Mixture-of-Experts (MoE) خود با ۲.۴ تریلیون پارامتر، در هر پرسوجو تنها حدود ۹۵ میلیارد پارامتر را فعال میکند؛ DeepSeek نیز معماری خود را برای کاهش قیمت هر توکن اصلاح کرده است. رقابت تسلیحاتی هوش مصنوعی اکنون نه فقط با اندازه مدل، بلکه با دلار به ازای هر توکن سنجیده میشود.
از «پارامترهای بیشتر» به «هزینه کمتر»
سالها بود که معیار اصلی در توسعه مدلهای زبانی بزرگ (LLM)، تعداد پارامترها بود. OpenAI، Google و دیگران با شکستن مرز تریلیون پارامتر خود میبالیدند، با این فرض که بزرگتر بودن به معنای هوشمندتر بودن است. اما علیبابا و DeepSeek نشان میدهند که محاسبات تغییر کرده است.
مدل Qwen2.5-Max از علیبابا همچنان بر مقیاس تکیه دارد، اما یک ترفند کاهش هزینه نیز به آن اضافه شده است. در یک مدل متراکم (dense)، هر پارامتر در هر بار استنتاج اجرا میشود که یک شبکه ۲.۴ تریلیون پارامتری را به هیولایی پرمصرف تبدیل میکند. معماری MoE شبکه را به بسیاری از «متخصصان» (experts) تقسیم کرده و هر درخواست را به زیرمجموعهای از آنها هدایت میکند. مسیریاب (router) در Qwen2.5-Max برای هر دستور (prompt)، تقریباً ۹۵ میلیارد پارامتر را انتخاب میکند که قدرت استدلال یک سیستم تریلیون پارامتری را ارائه میدهد، در حالی که تأخیر (latency) و مصرف انرژی را تحت کنترل نگه میدارد.
DeepSeek به طور کامل از جاهطلبی تریلیون پارامتری چشمپوشی کرده است. مدل V3-Flash آن برای اجرا به صورت ارزان، سریع و در مقیاس بالا ساخته شده است. این شرکت مدل خود را با محوریت «قیمتگذاری بسیار پایین استنتاج» بازاریابی میکند و توسعهدهندگانی را هدف قرار میدهد که روزانه میلیونها توکن را بدون فشار مالی سنگین پردازش میکنند. قیمت دقیق اعلام نشده است، اما پیام روشن است: اگر یک استارتاپ توان پرداخت نرخهای توکن در غرب را نداشته باشد، V3-Flash یک جایگزین قابل اتکا خواهد بود.
چرا هزینه استنتاج در حال تبدیل شدن به یک مزیت رقابتی است
وقتی مدلها از آزمایشگاه خارج شده و وارد مرحله تولید میشوند، هزینه استنتاج اهمیت مییابد. شرکتهایی که LLMها را در چتباتها، خطوط تحلیل اسناد یا موتورهای پیشنهاددهنده ادغام میکنند، به سرعت متوجه میشوند که قیمتگذاری در سطح توکن، بر هزینههای عملیاتی غالب است. مدلی که هزینه هر توکن آن نصف باشد، میتواند بودجه برای سایر اقدامات را دو برابر کند—مانند دادههای بیشتر، ترافیک بالاتر یا ویژگیهای اضافی.
این دو شرکت چینی بخشهای مختلفی از بازار را هدف قرار دادهاند. معماری MoE علیبابا وعده عملکرد بالا برای وظایف پیچیده و استدلالمحور را میدهد، در حالی که بودجه محاسباتی هر درخواست را در سطح متوسط نگه میدارد. در مقابل، مدل سبکتر DeepSeek برای حجم کاری بالا و حساس به تأخیر جذاب است، جایی که قدرت پردازشی خام نسبت به هزینه قابل پیشبینی اهمیت کمتری دارد.
هر دو استراتژی میتوانند سهم ارائهدهندگان غربی را که مدلهای بزرگ را با قیمتهای بالا عرضه میکنند، کاهش دهند. اگر توسعهدهندگان بتوانند با قیمت توکن ارزانتر به نتایج مشابهی دست یابند، انگیزه برای ماندن در استفاده از APIهای گرانقیمت ضعیف میشود.
پیامدها برای اکوسیستم جهانی هوش مصنوعی
- استارتاپها و شرکتهای کوچک و متوسط (SMEs): کاهش هزینههای استنتاج، مانع ورود به دنیای محصولات مبتنی بر هوش مصنوعی را کاهش میدهد. تیمهایی که زمانی برای هزینههای API به سرمایه اضافی نیاز داشتند، اکنون میتوانند با بودجههای محدودتر نمونهسازی کرده و محصول خود را عرضه کنند.
- سازمانها: شرکتهای بزرگی که سرویسهای هوش مصنوعی داخلی را اجرا میکنند، میتوانند هزینههای عملیاتی خود را کاهش داده و بودجهای را برای تهیه داده، تنظیم دقیق مدل (fine-tuning) یا محاسبات اضافی آزاد کنند.
- ارائهدهندگان غربی: مدلهای درآمدی آنها بر پایه هزینههای توکنمحور است. تغییر به سمت جایگزینهای متمرکز بر هزینه، آنها را مجبور میکند قیمتها را کاهش دهند یا در قابلیتهایی که مدلهای ارزانتر هنوز قادر به انجام آنها نیستند، متمایز شوند.
- نهادهای نظارتی و سیاستگذاران: هوش مصنوعی مقرونبهصرفهتر میتواند پذیرش آن را در بخشهای مختلف تسریع کند و پرسشهایی را در مورد نظارت، حریم خصوصی دادهها و سرعت اتوماسیون ایجاد نماید.
سبکسنگین کردنها و استدلالهای مخالف
مدلهای MoE مانند Qwen2.5-Max بدون هزینه نیستند. منطق مسیریابی (routing) به پیچیدگی مهندسی میافزاید و فعالسازی پراکنده (sparse activation) میتواند باعث عملکرد نابرابر در انواع مختلف پرسوجوها شود. اگر مسیریاب دچار خطا شود، ممکن است یک درخواست به متخصصان غیربهینه هدایت شود که کیفیت خروجی را کاهش میدهد. علاوه بر این، سختافزارها هنوز به سمت محاسبات متراکم (dense) تمایل دارند؛ شتابدهندههای تخصصی برای استنتاج MoE هنوز گسترده نشدهاند، که این امر میتواند بهرهوری در دنیای واقعی را محدود کند.
فلسفه «اول هزینه» در DeepSeek نیز خطراتی به همراه دارد. قیمتگذاری تهاجمی اغلب به معنای محدودیتهای شدیدتر در اندازه مدل و دادههای آموزشی است که پتانسیل محدود کردن عملکرد را دارد. برای کاربردهایی که نیازمند استدلالهای ظریف هستند، مدل ارزانتر ممکن است پاسخگو نباشد و کاربران را دوباره به سمت جایگزینهای بزرگتر و گرانتر سوق دهد.
در نهایت، «هوش به ازای هر دلار» تنها یکی از محورهای رقابت است. تأخیر، قابلیت اطمینان، پشتیبانی اکوسیستم و انطباق با مقررات منطقهای همچنان تعیینکننده هستند. شرکتهایی که بستهای متوازن در تمام این ابعاد ارائه میدهند، احتمالاً بازار را در اختیار خواهند گرفت، نه فقط کسانی که در جنگ قیمتها پیروز میشوند.
آنچه باید در ادامه زیر نظر داشت
- انتشار بنچمارکها: ارزیابیهای مستقل از کارایی مسیریابی MoE در Qwen2.5-Max و هزینه توکن در V3-Flash مشخص خواهد کرد که آیا این هیاهو به صرفهجوییهای قابل اندازهگیری تبدیل میشود یا خیر.
- پیشرفتهای سختافزاری: بهکارگیری شتابدهندههای بهینهسازیشده برای فعالسازی پراکنده (sparse activation) میتواند مزایای MoE را تقویت کند، در حالی که GPUهای همهمنظوره ممکن است مدلهای متراکم (dense) را رقابتی نگه دارند.
- واکنشهای قیمتگذاری: ارائهدهندگان غربی ممکن است سطوح قیمتی خود را تنظیم کنند یا ویژگیهای کاهش هزینه مانند تخفیفهای استنتاج دستهای (batch inference) یا لایسنسهای محلی (on-premise) را اضافه کنند.
- اقدامات نظارتی: با گسترش هوش مصنوعی ارزانتر، دولتها ممکن است استانداردهایی برای شفافیت و ایمنی معرفی کنند که میتواند بر نحوه استقرار این مدلها در مقیاس بزرگ تأثیر بگذارد.
نکته کلیدی
مدل MoE-محور Qwen2.5-Max از Alibaba و مدل کمهزینه V3-Flash از DeepSeek نشان میدهند که رقابت در حوزه هوش مصنوعی اکنون به همان اندازه که بر پایه تعداد پارامترهاست، بر پایه جداول بودجه نیز پیش میرود. شرکتهایی که ضمن حفظ هزینه پایینِ هر توکن، تواناییهای زبانی پیچیدهای را ارائه میدهند، هوش مصنوعی را به طیف گستردهتری از کاربران باز خواهند کرد و پویاییهای رقابتی را که مدتها به نفع بزرگترین و گرانترین مدلها بوده است، بازتعریف خواهند کرد.
