DeepSeek مدل V4 Pro را در حالت دسترسی عمومی (GA) عرضه کرد. اندازهگیریهای اولیه نشان میدهد که این مدل در مقایسه با نسخه پیشنمایش (preview build)، استفاده از توکنهای استدلال (reasoning tokens) را ۱۸ تا ۶۲ درصد کاهش میدهد. این موضوع برای هر کسی که بر اساس تعداد توکن هزینه پرداخت میکند بسیار مهم است: اکنون همان دستورات (prompts) با هزینهای بهمراتب کمتر، خروجیهای مشابهی تولید میکنند.
چه چیزی باعث این مقایسه شد
انتشار نسخه GA بدون پست وبلاگ یا لیست تغییرات (changelog) انجام شد، بنابراین توسعهدهندگان مجبور بودند خودشان تفاوتها را کشف کنند. یک تست جامعه کاربری، وظایف یکسانی را روی هر دو نسخه اجرا کرد و متوجه بزرگترین تغییر شد: کاهش شدید توکنهایی که مدل پیش از پاسخ دادن صرف «فکر کردن» (thinking) میکند. در جستجوهای ساده، مدل GA از ۶۲ درصد توکن استدلال کمتری استفاده کرد؛ در پرسوجوهای پیچیدهتر، این کاهش ۱۸ درصد بود.
کارایی توکن و تأثیر آن
در یک گردش کار استخراج (extraction workflow) معمولی، نسخه پیشنمایش برای استخراج چند فیلد از یک دستور، ۱۵۹ توکن استدلال مصرف میکرد. با سوئیچ به نسخه GA و غیرفعال کردن قابلیت «تفکر» (thinking)، این عدد به ۴۰ توکن کاهش یافت. برای کاربرانی که از طرحهای مبتنی بر میزان مصرف (metered plans) استفاده میکنند، این صرفهجویی مستقیماً به کاهش هزینهها، بهویژه در مقیاس بالا، منجر میشود.
استخراج JSON: مشکل پنهان
هر دو نسخه زمانی که حالت «تفکر» روشن است دچار مشکل میشوند: آنها بررسی طرحواره (schema) JSON را پاس میکنند اما مقادیر عددی اشتباه وارد میکنند. تنها نسخه GA زمانی که «تفکر» خاموش است، JSON صحیحی برمیگرداند. تیمهایی که به خروجی ساختاریافته نیاز دارند، باید پرچم تفکر (thinking flag) را برای وظایف استخراج غیرفعال کنند، در غیر این صورت دادههایی دریافت خواهند کرد که از نظر ساختاری معتبر اما از نظر عددی نادرست هستند.
تغییر رویکرد در مدیریت امتناع از پاسخ
مدل پیشنمایش میتوانست به سوالاتی که پاسخناپذیر تشخیص میداد، با پاسخ «نمیدانم» امتناع کند. مدل GA دیگر این کار را انجام نمیدهد. در عوض، یا بدون پاسخ دادن بودجه توکن خود را تمام میکند و یا پاسخی ساختگی (fabricate) ارائه میدهد. این تغییر کارایی توکن را بهبود میبخشد اما حفاظ ایمنی را که مانع از توهم (hallucination) مدل در موضوعات ناشناخته میشد، از بین میبرد.
افزایش قابلیت اطمینان
یک حلقه خطرناک در نسخه پیشنمایش — که توسط بودجه محدود «تفکر» تحریک میشد — میتوانست باعث شود مدل همان متن را تکرار کند تا زمانی که پنجره ۸,۱۹۲ توکنی پر شود. نسخه GA این باگ را برطرف کرده و به تکرار بیرویه که قبلاً خطر اتمام پنجره درخواست و افزایش هزینهها را داشت، پایان داده است.
نکاتی که کاربران باید رعایت کنند
- از نسخه GA برای کاهش تعداد توکنها استفاده کنید. کاهشهای اندازهگیری شده در تمام سطوح پیچیدگی وظایف پابرجا است.
- برای هرگونه استخراج JSON یا دادههای ساختاریافته، «تفکر» را خاموش کنید. این کار باعث تولید مقادیر صحیح و به حداقل رساندن مصرف توکن میشود.
- به امتناعهای داخلی مدل اعتماد نکنید. اگر دستوری حاوی دادههای غیرقابل تایید باشد، مدل GA ممکن است همچنان پاسخی تولید کند، بنابراین اعتبارسنجی در مراحل بعدی (downstream validation) همچنان ضروری است.
- هزینههای ساعات اوج مصرف را زیر نظر داشته باشید. قوانین جدید قیمتگذاری باعث میشود مصرف توکن در دورههای ترافیک بالا، تأثیر شدیدتری بر هزینه کلی نسبت به قبل داشته باشد.
خلاصه کلام
مدل GA نسخه V4 Pro از DeepSeek یک پیروزی آشکار در کارایی ارائه میدهد — تا ۶۲ درصد توکن استدلال کمتر — و یک باگ حیاتی تکرار را اصلاح میکند. با این حال، از دست رفتن پاسخهای صریح امتناع و نیاز به غیرفعال کردن تفکر برای خروجی دقیق JSON، ملاحظات جدیدی را اضافه میکند. تیمهایی که خط لوله (pipeline) خود را با این تغییرات تطبیق دهند، میتوانند بدون قربانی کردن عملکرد، هزینهها را کاهش دهند.
Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
