API مدل Kimi K3 روی کاغذ ارزان به نظر می‌رسد، اما هزینه‌های پنهان و جزئیات فنی مفقود می‌تواند آن را بسیار گران‌تر از اعداد اعلام‌شده نشان دهد.

آنچه در تبلیغات نادیده گرفته می‌شود

مطالب مربوط به عرضه Moonshot AI به مدلی با ۲.۸ تریلیون پارامتر ادعا می‌کند که «ارزان» و «باز» است. بیانیه مطبوعاتی همچنین وعده می‌دهد که وزن‌های مدل (weights) به‌زودی قابل دانلود خواهند بود. هیچ‌کدام از این ادعاها واقعیت ندارند.

  • وزن‌ها در دسترس نیستند – Moonshot مهلت ۲۷ جولای ۲۰۲۶ را برای انتشار یک چک‌پوینت عمومی تعیین کرده است. تا آن زمان، کاربران باید از API میزبانی‌شده استفاده کنند، بنابراین وعده «متن‌باز» بودن، هیچ چیز قابل استفاده‌ای ارائه نمی‌دهد.
  • تمام ۲.۸ تریلیون پارامتر فعال نیستند – این عدد ظرفیت کل معماری را توصیف می‌کند. طراحی Mixture-of-Experts در مدل K3، هر توکن را از طریق ۱۶ زیرشبکه از مجموع ۸۹۶ شبکه متخصص عبور می‌دهد. Moonshot اعلام نکرده است که در هر درخواست چند پارامتر اجرا می‌شود، که این امر تخمین حافظه و محاسبات را غیرممکن می‌کند.

قیمت‌گذاری‌ای که خوب به نظر می‌رسد – تا زمانی که کلمات را بشمارید

نرخ‌های منتشر شده:

  • ورودی با برخورد با حافظه پنهان (Cache-hit): ۰.۳۰ دلار به‌ازای هر ۱ میلیون توکن
  • ورودی بدون حافظه پنهان (Uncached): ۳.۰۰ دلار به‌ازای هر ۱ میلیون توکن
  • خروجی: ۱۵.۰۰ دلار به‌ازای هر ۱ میلیون توکن

این نرخ‌ها ناچیز به نظر می‌رسند، اما حجم توکن‌ها را نادیده می‌گیرند.

یک آزمایش اخیر، خروجی K3 را ۱۳۰ میلیون توکن اندازه‌گیری کرد که بیش از دو برابر ۶۳ میلیون توکنی است که سایر مدل‌های پیشرو در وظایف مشابه تولید می‌کنند. پرگویی (verbosity) مدل مستقیماً صورت‌حساب خروجی را افزایش می‌دهد؛ دو برابر کلمات یعنی دو برابر هزینه. برای تولید کد، مقالات یا عوامل چت (chat agents)، نرخ ۱۵ دلار به‌ازای هر میلیون توکن می‌تواند بخش اعظم هزینه‌ها را به خود اختصاص دهد.

این موضوع برای کاربران مختلف چه معنایی دارد

توسعه‌دهندگان و پژوهشگران

اگر K3 را برای کمک در کدنویسی یا تحقیقات داده‌محور آزمایش می‌کنید، محدودیت‌های سخت‌گیرانه‌ای برای خروجی توکن تعیین کنید. یک تست A/B که K3 را با یک مدل پایه با محدودیت‌های خروجی یکسان مقایسه می‌کند، نشان خواهد داد که آیا مصرف بالای توکن ناشی از خود مدل است یا از طراحی پرامپت (prompt design).

تیم‌های حساس به بودجه

تخفیف برخورد با حافظه پنهان (cache-hit) تنها زمانی اعمال می‌شود که ورودی یکسان تکرار شود. پیشوندهای پرامپت پایداری طراحی کنید که رشته‌های ورودی یکسانی تولید کنند تا درخواست‌های بیشتری را به سطح ۰.۳۰ دلاری هدایت کنید؛ این روش فقط برای حجم کارهای بسیار تکراری (مانند پرس‌وجوهای قالب‌بندی‌شده) کارایی دارد. اکثر ورودی‌های متنوع به نرخ ۳.۰۰ دلاری (بدون حافظه پنهان) بازمی‌گردند.

شرکت‌هایی که میزبانی شخصی (self-hosting) را مد نظر دارند

منتظر انتشار چک‌پوینت ماندن کار هوشمندانه‌ای است. میزبانی مدل هزینه‌های مربوط به هر توکن را حذف می‌کند، اما هزینه‌های پنهان مجوز (licensing) و زیرساخت را اضافه می‌کند. تا زمانی که وزن‌ها عمومی نشوند، API میزبانی‌شده تنها گزینه واقع‌بینانه باقی می‌ماند.

محیط‌های عملیاتی (Production)

صرفاً به این دلیل که قیمت اعلام‌شده کمتر از رقبا به نظر می‌رسد، سیستم خود را تغییر ندهید. یک طرح آزمایشی اجرا کنید که به جای هزینه به‌ازای هر توکن، هزینه به‌ازای هر وظیفه تکمیل‌شده را (با احتساب هزینه‌های پنهان ناشی از پاسخ‌های طولانی‌تر) اندازه‌گیری کند. تنها در این صورت می‌توانید تصمیم بگیرید که آیا K3 باعث صرفه‌جویی در هزینه‌ها می‌شود یا خیر.

آنچه باید در آینده زیر نظر داشت

  • انتشار چک‌پوینت در ۲۷ جولای ۲۰۲۶ – قرار است وزن‌ها در آن تاریخ منتشر شوند.
  • افشای پارامترهای فعال – دانستن اینکه چه تعداد از ۲.۸ تریلیون پارامتر در هر توکن اجرا می‌شود، به کاربران اجازه می‌دهد تا سخت‌افزار را به دقت تعیین کنند.

خلاصه کلام

قیمت ۱۵ دلاری خروجی به‌ازای هر میلیون توکن که برای K3 تبلیغ می‌شود، تنها نیمی از واقعیت را بیان می‌کند. تمایل این مدل به تولید توکن‌هایی که دو برابر همتایان خود است، می‌تواند هرگونه صرفه‌جویی اعلام‌شده را از بین ببرد، به‌ویژه در وظایف مربوط به پاسخ‌های طولانی. تا زمانی که وزن‌ها منتشر نشوند و تعداد پارامترهای فعال مشخص نگردد، با K3 به عنوان یک سرویس پرمیوم و احتمالاً پرگو برخورد کنید، نه یک جایگزین ارزان. تست‌های بودجه توکن را اجرا کنید، محدودیت‌های خروجی را اعمال کنید و تنها پس از اندازه‌گیری هزینه واقعی هر کارِ انجام‌شده، سیستم خود را تغییر دهید.