xAI در تاریخ ۶ می ۲۰۲۶، Grok-Imagine Quality API را عرضه کرد که برای هر تصویر تولید شده ۰.۰۵ دلار هزینه دریافت میکند و سقف درخواستها را نیز به ۳۰۰ درخواست در دقیقه محدود کرده است. توسعهدهندگانی که ابزارهای تصویرسازی میسازند، اگر میخواهند تصاویری واقعگرایانه بدون هزینههای غافلگیرکننده داشته باشند، باید این اعداد را در قیمتگذاری، برنامهریزی تأخیر (latency) و معماری کد لحاظ کنند.
چرا این حالت جدید اهمیت دارد
شناسه «Quality» (grok-imagine-image-quality) وعده واقعگرایی دقیقتر و رندر متن صحیحتر نسبت به مدل استاندارد قبلی را میدهد. برای اپلیکیشنهایی که گرافیکهای تولید شده را میفروشند یا مجوز آنها را صادر میکنند — مانند موکاپهای تجارت الکترونیک، جلوههای بصری بازاریابی یا طراحیهای مبتنی بر هوش مصنوعی — این بهبودهای کیفی میتواند یک مزیت رقابتی باشد، اما با ساختار هزینه و ویژگیهای فنی متفاوتی همراه است که صرفاً از طریق مستندات API مشخص نیستند.
نگاهی اجمالی به قیمتگذاری و محدودیتها
- قیمت خروجی: ۰.۰۵ دلار برای هر تصویر
- قیمت ورودی: ۰.۰۱ دلار برای هر تصویر (هنگامی که یک منبع را برای ویرایش آپلود میکنید اعمال میشود)
- حداکثر رزولوشن: ۲۰۴۸ × ۲۰۴۸ پیکسل
- تعداد تصویر در هر درخواست: تا ۱۰ تصویر
- محدودیت نرخ درخواست: ۳۰۰ درخواست در دقیقه (RPM)
هزینه خروجی کمتر از مدل استاندارد است، اما هزینه ورودی بالاتر است. در عمل، هنگام ویرایش یک تصویر موجود، باید این دو را با هم جمع کنید، بنابراین هزینه کل هر ویرایش میتواند از عنوان «خروجی ارزانتر» فراتر رود.
سه نکته فنی که نمیتوان از آنها چشمپوشی کرد
۱. URLهای موقت به سرعت ناپدید میشوند
وقتی API یک تصویر تولید شده را برمیگرداند، این کار را از طریق یک URL با عمر کوتاه انجام میدهد. لینکهای تولید شده سریع از کار میافتند، بنابراین برای ساخت یک محصول واقعی، باید این تصاویر را در فضای ذخیرهسازی خودتان ذخیره کنید.
۲. تأخیر متغیر (Variable latency)
زمان تولید بسته به پیچیدگی دستور (prompt) و بار سرور، بین چهار تا بیست ثانیه برای هر تصویر متغیر است. این بازه، تضمینِ بدترین حالت نیست؛ بلکه بازه عملیاتی عادی است. برای جلوگیری از انتظارهای کلافهکننده، از یک نشانگر پیشرفت (progress indicator) استفاده کنید یا درخواستها را به صورت دستهای (batch) ارسال کرده و نتایج را به صورت ناهمگام (asynchronously) تحویل دهید.
۳. تفاوت در SDK و فرمت payload با OpenAI
اندپوینت ویرایش xAI انتظار یک JSON payload را دارد که عملیات ویرایش را توصیف میکند، در حالی که سرویسهای سبک OpenAI از multipart/form-data برای ارسال تصویر اصلی و ماسک (mask) استفاده میکنند. جایگزین کردن یکی از کتابخانهها با دیگری بدون بازنویسی ساختار درخواست، باعث بروز خطا خواهد شد. کد کلاینت خود را تطبیق دهید یا از یک wrapper سبک استفاده کنید که بین فرمتها ترجمه انجام دهد.
سنجش مزایا و معایب
هزینه خروجی کمتر در هر تصویر، توسعهدهندگان حساس به هزینه را وسوسه میکند، اما هزینه ورودی بالاتر و نیاز به فضای ذخیرهسازی اضافی و مدیریت تأخیر میتواند این مزیت را از بین ببرد. اگر به طور مکرر داراییهای (assets) موجود را ویرایش میکنید، برای هر تصویر منبع ۰.۰۱ دلار بهعلاوه ۰.۰۵ دلار خروجی، و همچنین تلاش مهندسی برای مدیریت URLهای موقت و ویرایشهای مبتنی بر JSON پرداخت خواهید کرد.
آنچه باید در ادامه زیر نظر داشت
- مانیتورینگ استفاده: همیشه زیر سقف ۳۰۰ RPM باقی بمانید.
نتیجهگیری: Grok-Imagine Quality تصاویر با دقت (fidelity) بالاتر ارائه میدهد، اما اقتصاد و الزامات مهندسی آن به قدری متفاوت است که توسعهدهندگان باید هر اندپوینت را دوباره محاسبه کنند، برای ذخیرهسازی URLهای گذرا برنامهریزی کنند و فراخوانیهای ویرایش را بازنویسی کنند. نادیده گرفتن این جزئیات، یک ویژگی نویدبخش را به یک هزینه غیرمنتظره تبدیل خواهد کرد.
