Claude Opus 5 اب ایک ہی کام (workload) کے لیے Opus 4.8 کے مقابلے میں تین گنا زیادہ لاگت رکھتا ہے، حالانکہ دونوں ماڈلز فی ٹوکن قیمت ایک جیسی بتاتے ہیں۔ اس کی وجہ ڈیفالٹ "adaptive thinking" فیچر ہے، جو خاموشی سے ہڈن ریزننگ (hidden reasoning) کے طور پر آؤٹ پٹ ٹوکنز استعمال کرتا ہے۔ اس فیچر کو بند کرنے سے درستگی (accuracy) کو نقصان پہنچائے بغیر قیمتوں میں برابری بحال ہو جاتی ہے۔

قیمتوں میں فرق کیوں نظر آتا ہے

دونوں ورژنز فی ملین ان پٹ ٹوکنز کے لیے $5 اور فی ملین آؤٹ پٹ ٹوکنز کے لیے $25 چارج کرتے ہیں۔ ہمارے بینچ مارکس میں، ایک جیسے پرامپٹس (prompts) چلانے پر Opus 5 کا بل Opus 4.8 کے مقابلے میں 3.1 گنا زیادہ تھا۔ یہ اضافی چارج زیادہ لسٹ پرائس کی وجہ سے نہیں ہے؛ بلکہ یہ اس طریقے میں شامل ہے جس سے Opus 5 اپنے اندرونی سوچنے کے عمل (internal thought process) کا حساب رکھتا ہے۔

adaptive thinking کیا کرتا ہے

جب adaptive thinking فعال (enabled) ہوتی ہے، تو ماڈل حتمی جواب دینے سے پہلے اضافی اندرونی استدلال (internal reasoning) کرتا ہے۔ اس استدلال کو آؤٹ پٹ ٹوکنز کے طور پر گنا جاتا ہے، چاہے وہ صارف تک کبھی پہنچے ہی نہ۔ سادہ سوالات پر، بل کیے گئے آؤٹ پٹ ٹوکنز کا 42% سے 95% تک حصہ یہی ہڈن ریزننگ ہوتی ہے۔ اس لیے ریاضی کا ایک سادہ مسئلہ، جس کا جواب صرف ایک ہندسے کا ہونا چاہیے، درجنوں غیر دیکھے ہوئے ٹوکنز پیدا کر سکتا ہے، جس سے لاگت میں ڈرامائی اضافہ ہو جاتا ہے۔

یہ فیچر کوئی بگ (bug) نہیں ہے—Claude کے ڈیزائنرز کا مقصد پیچیدہ کاموں پر جواب کے معیار کو بہتر بنانا ہے۔ عملی طور پر، ہڈن ریزننگ اکثر مشکل پرامپٹس پر درستگی میں معمولی اضافہ کرتی ہے، خاص طور پر جب ماڈل کو متعدد مراحل کو جوڑنا ہو یا بیرونی ٹولز (external tools) کے ساتھ کام کرنا ہو۔

لاگت کو کیسے کنٹرول کریں

ماڈل ایک واحد پیرامیٹر (parameter) قبول کرتا ہے جو adaptive thinking کو غیر فعال کر دیتا ہے:

{
  "thinking": {"type": "disabled"}
}

Opus 5 پر یہ سیٹنگ لاگو کرنے سے اس کے فی ٹاسک اخراجات بالکل اتنے ہی ہو جاتے ہیں جتنے Opus 4.8 چارج کرتا ہے، جبکہ ہمارے ٹیسٹ کیے گئے سادہ کاموں پر نتائج کی درستگی برقرار رہتی ہے۔

کب غیر فعال کریں

  • متن سے ڈیٹا نکالنا (Extraction of data from text)
  • فارمیٹنگ کے آپریشنز (مثلاً JSON کنورژن)
  • سنگل سٹیپ کالز جہاں جواب براہ راست تلاش (lookup) یا ایک معمولی حساب کتاب ہو

ان صورتوں میں سوچنے کے عمل (thinking) کو غیر فعال کرنے سے ہڈن ٹوکن ٹیکس ختم ہو جاتا ہے اور بل قابلِ پیش گوئی رہتے ہیں۔

کب اسے آن رکھیں

  • وہ کام جن کے لیے گہرے منطقی تسلسل یا باریک بینی سے استدلال کی ضرورت ہو
  • ایجنٹ ورک فلو (agent workflows) جو بار بار بیرونی ٹولز کو کال کرتے ہیں

ٹولز پر مبنی زیادہ تر صورتوں میں، قیمتوں کا فرق کم ہو کر تقریباً 33% رہ جاتا ہے کیونکہ ماڈل ٹول کالز کے دوران اندرونی استدلال پر کم خرچ کرتا ہے۔

دیگر اہم فرق

  • Context window: Opus 5 ایک ملین ٹوکنز تک کو محفوظ رکھ سکتا ہے، جس کی ہم نے ٹوکن 969,950 پر رکھے گئے ایک ٹارگٹ اسٹرنگ (target string) کو نکال کر تصدیق کی۔
  • Cache floor: کم از کم کیش سائز (cache size) کم ہو کر 512 ٹوکنز رہ گیا ہے، جو Opus 4.8 کے مقابلے میں آدھا ہے، جس سے اس بات پر اثر پڑتا ہے کہ ماڈل ری-ٹوکنائزنگ (re-tokenising) کے بغیر کتنی پچھلی گفتگو کو دوبارہ استعمال کر سکتا ہے۔

آگے کیا نظر رکھنا چاہیے

ڈویلپرز کو "reasoning tokens" یا اس طرح کے دیگر آئٹمز کے لیے استعمال کی رپورٹس پر نظر رکھنی چاہیے جو ظاہر کرتے ہیں کہ adaptive thinking فعال ہے۔ جیسے جیسے زیادہ ایپلی کیشنز ایجنٹ طرز کے آپریشنز کے لیے Claude کو اپنائیں گی، لاگت اور معیار کے درمیان توازن (trade-off) ایک اہم آپٹیمائزیشن فیصلہ بن جائے گا۔ مستقبل کی اپ ڈیٹس صارفین کو صرف آن یا آف سوئچ کے بجائے استدلال کی گہرائی (depth of reasoning) کو ایڈجسٹ کرنے کی اجازت دے سکتی ہیں، جس سے لاگت کا اتار چڑھاؤ بہتر ہو سکتا ہے۔

خلاصہ (Takeaway): Opus 5 کا ڈیفالٹ adaptive thinking آسان کاموں پر ٹوکن کے استعمال کو بڑھا دیتا ہے۔ Opus 4.8 کی لاگت کے برابر لانے کے لیے اوپر دی گئی سادہ سیٹنگ کے ذریعے اسے غیر فعال کریں، اور اسے صرف اسی وقت فعال کریں جب اضافی استدلال (reasoning) اضافی خرچ کا جواز پیش کرے۔