DeepSeek مدل V4 Pro را در حالت دسترسی عمومی (GA) عرضه کرد. اندازه‌گیری‌های اولیه نشان می‌دهد که این مدل در مقایسه با نسخه پیش‌نمایش (preview build)، استفاده از توکن‌های استدلال (reasoning tokens) را ۱۸ تا ۶۲ درصد کاهش می‌دهد. این موضوع برای هر کسی که بر اساس تعداد توکن هزینه پرداخت می‌کند بسیار مهم است: اکنون همان دستورات (prompts) با هزینه‌ای به‌مراتب کمتر، خروجی‌های مشابهی تولید می‌کنند.

چه چیزی باعث این مقایسه شد

انتشار نسخه GA بدون پست وبلاگ یا لیست تغییرات (changelog) انجام شد، بنابراین توسعه‌دهندگان مجبور بودند خودشان تفاوت‌ها را کشف کنند. یک تست جامعه کاربری، وظایف یکسانی را روی هر دو نسخه اجرا کرد و متوجه بزرگ‌ترین تغییر شد: کاهش شدید توکن‌هایی که مدل پیش از پاسخ دادن صرف «فکر کردن» (thinking) می‌کند. در جستجوهای ساده، مدل GA از ۶۲ درصد توکن استدلال کمتری استفاده کرد؛ در پرس‌وجوهای پیچیده‌تر، این کاهش ۱۸ درصد بود.

کارایی توکن و تأثیر آن

در یک گردش کار استخراج (extraction workflow) معمولی، نسخه پیش‌نمایش برای استخراج چند فیلد از یک دستور، ۱۵۹ توکن استدلال مصرف می‌کرد. با سوئیچ به نسخه GA و غیرفعال کردن قابلیت «تفکر» (thinking)، این عدد به ۴۰ توکن کاهش یافت. برای کاربرانی که از طرح‌های مبتنی بر میزان مصرف (metered plans) استفاده می‌کنند، این صرفه‌جویی مستقیماً به کاهش هزینه‌ها، به‌ویژه در مقیاس بالا، منجر می‌شود.

استخراج JSON: مشکل پنهان

هر دو نسخه زمانی که حالت «تفکر» روشن است دچار مشکل می‌شوند: آن‌ها بررسی طرحواره (schema) JSON را پاس می‌کنند اما مقادیر عددی اشتباه وارد می‌کنند. تنها نسخه GA زمانی که «تفکر» خاموش است، JSON صحیحی برمی‌گرداند. تیم‌هایی که به خروجی ساختاریافته نیاز دارند، باید پرچم تفکر (thinking flag) را برای وظایف استخراج غیرفعال کنند، در غیر این صورت داده‌هایی دریافت خواهند کرد که از نظر ساختاری معتبر اما از نظر عددی نادرست هستند.

تغییر رویکرد در مدیریت امتناع از پاسخ

مدل پیش‌نمایش می‌توانست به سوالاتی که پاسخ‌ناپذیر تشخیص می‌داد، با پاسخ «نمی‌دانم» امتناع کند. مدل GA دیگر این کار را انجام نمی‌دهد. در عوض، یا بدون پاسخ دادن بودجه توکن خود را تمام می‌کند و یا پاسخی ساختگی (fabricate) ارائه می‌دهد. این تغییر کارایی توکن را بهبود می‌بخشد اما حفاظ ایمنی را که مانع از توهم (hallucination) مدل در موضوعات ناشناخته می‌شد، از بین می‌برد.

افزایش قابلیت اطمینان

یک حلقه خطرناک در نسخه پیش‌نمایش — که توسط بودجه محدود «تفکر» تحریک می‌شد — می‌توانست باعث شود مدل همان متن را تکرار کند تا زمانی که پنجره ۸,۱۹۲ توکنی پر شود. نسخه GA این باگ را برطرف کرده و به تکرار بی‌رویه که قبلاً خطر اتمام پنجره درخواست و افزایش هزینه‌ها را داشت، پایان داده است.

نکاتی که کاربران باید رعایت کنند

  • از نسخه GA برای کاهش تعداد توکن‌ها استفاده کنید. کاهش‌های اندازه‌گیری شده در تمام سطوح پیچیدگی وظایف پابرجا است.
  • برای هرگونه استخراج JSON یا داده‌های ساختاریافته، «تفکر» را خاموش کنید. این کار باعث تولید مقادیر صحیح و به حداقل رساندن مصرف توکن می‌شود.
  • به امتناع‌های داخلی مدل اعتماد نکنید. اگر دستوری حاوی داده‌های غیرقابل تایید باشد، مدل GA ممکن است همچنان پاسخی تولید کند، بنابراین اعتبارسنجی در مراحل بعدی (downstream validation) همچنان ضروری است.
  • هزینه‌های ساعات اوج مصرف را زیر نظر داشته باشید. قوانین جدید قیمت‌گذاری باعث می‌شود مصرف توکن در دوره‌های ترافیک بالا، تأثیر شدیدتری بر هزینه کلی نسبت به قبل داشته باشد.

خلاصه کلام

مدل GA نسخه V4 Pro از DeepSeek یک پیروزی آشکار در کارایی ارائه می‌دهد — تا ۶۲ درصد توکن استدلال کمتر — و یک باگ حیاتی تکرار را اصلاح می‌کند. با این حال، از دست رفتن پاسخ‌های صریح امتناع و نیاز به غیرفعال کردن تفکر برای خروجی دقیق JSON، ملاحظات جدیدی را اضافه می‌کند. تیم‌هایی که خط لوله (pipeline) خود را با این تغییرات تطبیق دهند، می‌توانند بدون قربانی کردن عملکرد، هزینه‌ها را کاهش دهند.

Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l