API مدل Kimi K3 روی کاغذ ارزان به نظر میرسد، اما هزینههای پنهان و جزئیات فنی مفقود میتواند آن را بسیار گرانتر از اعداد اعلامشده نشان دهد.
آنچه در تبلیغات نادیده گرفته میشود
مطالب مربوط به عرضه Moonshot AI به مدلی با ۲.۸ تریلیون پارامتر ادعا میکند که «ارزان» و «باز» است. بیانیه مطبوعاتی همچنین وعده میدهد که وزنهای مدل (weights) بهزودی قابل دانلود خواهند بود. هیچکدام از این ادعاها واقعیت ندارند.
- وزنها در دسترس نیستند – Moonshot مهلت ۲۷ جولای ۲۰۲۶ را برای انتشار یک چکپوینت عمومی تعیین کرده است. تا آن زمان، کاربران باید از API میزبانیشده استفاده کنند، بنابراین وعده «متنباز» بودن، هیچ چیز قابل استفادهای ارائه نمیدهد.
- تمام ۲.۸ تریلیون پارامتر فعال نیستند – این عدد ظرفیت کل معماری را توصیف میکند. طراحی Mixture-of-Experts در مدل K3، هر توکن را از طریق ۱۶ زیرشبکه از مجموع ۸۹۶ شبکه متخصص عبور میدهد. Moonshot اعلام نکرده است که در هر درخواست چند پارامتر اجرا میشود، که این امر تخمین حافظه و محاسبات را غیرممکن میکند.
قیمتگذاریای که خوب به نظر میرسد – تا زمانی که کلمات را بشمارید
نرخهای منتشر شده:
- ورودی با برخورد با حافظه پنهان (Cache-hit): ۰.۳۰ دلار بهازای هر ۱ میلیون توکن
- ورودی بدون حافظه پنهان (Uncached): ۳.۰۰ دلار بهازای هر ۱ میلیون توکن
- خروجی: ۱۵.۰۰ دلار بهازای هر ۱ میلیون توکن
این نرخها ناچیز به نظر میرسند، اما حجم توکنها را نادیده میگیرند.
یک آزمایش اخیر، خروجی K3 را ۱۳۰ میلیون توکن اندازهگیری کرد که بیش از دو برابر ۶۳ میلیون توکنی است که سایر مدلهای پیشرو در وظایف مشابه تولید میکنند. پرگویی (verbosity) مدل مستقیماً صورتحساب خروجی را افزایش میدهد؛ دو برابر کلمات یعنی دو برابر هزینه. برای تولید کد، مقالات یا عوامل چت (chat agents)، نرخ ۱۵ دلار بهازای هر میلیون توکن میتواند بخش اعظم هزینهها را به خود اختصاص دهد.
این موضوع برای کاربران مختلف چه معنایی دارد
توسعهدهندگان و پژوهشگران
اگر K3 را برای کمک در کدنویسی یا تحقیقات دادهمحور آزمایش میکنید، محدودیتهای سختگیرانهای برای خروجی توکن تعیین کنید. یک تست A/B که K3 را با یک مدل پایه با محدودیتهای خروجی یکسان مقایسه میکند، نشان خواهد داد که آیا مصرف بالای توکن ناشی از خود مدل است یا از طراحی پرامپت (prompt design).
تیمهای حساس به بودجه
تخفیف برخورد با حافظه پنهان (cache-hit) تنها زمانی اعمال میشود که ورودی یکسان تکرار شود. پیشوندهای پرامپت پایداری طراحی کنید که رشتههای ورودی یکسانی تولید کنند تا درخواستهای بیشتری را به سطح ۰.۳۰ دلاری هدایت کنید؛ این روش فقط برای حجم کارهای بسیار تکراری (مانند پرسوجوهای قالببندیشده) کارایی دارد. اکثر ورودیهای متنوع به نرخ ۳.۰۰ دلاری (بدون حافظه پنهان) بازمیگردند.
شرکتهایی که میزبانی شخصی (self-hosting) را مد نظر دارند
منتظر انتشار چکپوینت ماندن کار هوشمندانهای است. میزبانی مدل هزینههای مربوط به هر توکن را حذف میکند، اما هزینههای پنهان مجوز (licensing) و زیرساخت را اضافه میکند. تا زمانی که وزنها عمومی نشوند، API میزبانیشده تنها گزینه واقعبینانه باقی میماند.
محیطهای عملیاتی (Production)
صرفاً به این دلیل که قیمت اعلامشده کمتر از رقبا به نظر میرسد، سیستم خود را تغییر ندهید. یک طرح آزمایشی اجرا کنید که به جای هزینه بهازای هر توکن، هزینه بهازای هر وظیفه تکمیلشده را (با احتساب هزینههای پنهان ناشی از پاسخهای طولانیتر) اندازهگیری کند. تنها در این صورت میتوانید تصمیم بگیرید که آیا K3 باعث صرفهجویی در هزینهها میشود یا خیر.
آنچه باید در آینده زیر نظر داشت
- انتشار چکپوینت در ۲۷ جولای ۲۰۲۶ – قرار است وزنها در آن تاریخ منتشر شوند.
- افشای پارامترهای فعال – دانستن اینکه چه تعداد از ۲.۸ تریلیون پارامتر در هر توکن اجرا میشود، به کاربران اجازه میدهد تا سختافزار را به دقت تعیین کنند.
خلاصه کلام
قیمت ۱۵ دلاری خروجی بهازای هر میلیون توکن که برای K3 تبلیغ میشود، تنها نیمی از واقعیت را بیان میکند. تمایل این مدل به تولید توکنهایی که دو برابر همتایان خود است، میتواند هرگونه صرفهجویی اعلامشده را از بین ببرد، بهویژه در وظایف مربوط به پاسخهای طولانی. تا زمانی که وزنها منتشر نشوند و تعداد پارامترهای فعال مشخص نگردد، با K3 به عنوان یک سرویس پرمیوم و احتمالاً پرگو برخورد کنید، نه یک جایگزین ارزان. تستهای بودجه توکن را اجرا کنید، محدودیتهای خروجی را اعمال کنید و تنها پس از اندازهگیری هزینه واقعی هر کارِ انجامشده، سیستم خود را تغییر دهید.
