Anthropic نے Claude Opus 5 متعارف کروا دیا: آدھی قیمت پر بہترین کارکردگی

Anthropic نے باضابطہ طور پر Claude Opus 5 لانچ کر دیا ہے، جو ایک نیا فلیگ شپ ماڈل ہے جسے اعلیٰ درجے کی LLM مارکیٹ میں انقلاب لانے کے لیے ڈیزائن کیا گیا ہے۔ یہ ماڈل پریمیم Claude Fable 5 کے برابر کارکردگی کو کافی کم قیمت پر فراہم کرتا ہے۔ اس اسٹریٹجک اقدام کا مقصد GPT-5.6 Sol جیسے حریفوں کے قیمتوں کے دباؤ کو کم کرنا ہے، جبکہ ڈویلپرز کو کوڈنگ اور پیچیدہ علمی کاموں کے لیے ایک زیادہ موثر ٹول فراہم کرنا ہے۔

قیمت اور کارکردگی کی سرحدوں میں تبدیلی

Claude Opus 5 کی سب سے نمایاں خصوصیت اس کا جارحانہ قیمت کا ڈھانچہ ہے۔ جہاں اعلیٰ ترین Claude Fable 5 کی قیمت 10 ڈالر فی ملین ان پٹ ٹوکنز اور 50 ڈالر فی ملین آؤٹ پٹ ٹوکنز ہے، وہیں Opus 5 ان نرخوں کو آدھا کر دیتا ہے، جس کی قیمت 5 ڈالر فی ملین ان پٹ اور 25 ڈالر فی ملین آؤٹ پٹ ٹوکنز ہے۔

لیٹنسی (latency) کی ضروریات کو پورا کرنے کے لیے، Anthropic نے "Fast Mode" بھی متعارف کرایا ہے، جو پروسیسنگ کی رفتار کو 2.5 گنا بڑھا دیتا ہے، اگرچہ اس کے بدلے ٹوکن کی قیمت دوگنی ہو جاتی ہے۔ یہ درجہ بندی شدہ قیمت، 1 ملین ٹوکن کے وسیع 'کانٹیکسٹ ونڈو' (context window) کے ساتھ مل کر، Opus 5 کو Claude Max کے لیے نیا ڈیفالٹ ماڈل اور Claude Pro صارفین کے لیے سب سے قابل آپشن بناتی ہے۔

کوڈنگ اور استدلال (Reasoning) میں بینچ مارک برتری

Opus 5 محض ایک سستا متبادل نہیں ہے؛ بلکہ یہ مخصوص شعبوں میں کارکردگی کا پاور ہاؤس ہے۔ Frontier-Bench v0.1 کے ذریعے ایجنٹک ٹرمینل کوڈنگ میں، Opus 5 نے 43.3% اسکور حاصل کیا، جو Fable 5 (33.7%) اور GPT-5.6 Sol (34.4%) دونوں سے نمایاں طور پر بہتر ہے۔ اس نے علمی کاموں میں بھی غلبہ دکھایا، اور GDPval-AA v2 بینچ مارک میں 1,861 کے Elo اسکور کے ساتھ قیادت کی۔

شاید سب سے حیران کن اعداد و شمار ARC-AGI-3 بینچ مارک سے ملتے ہیں، جو نئے مسائل کو حل کرنے کی صلاحیت کی پیمائش کرتا ہے۔ Opus 5 نے 30.2% اسکور کیا، جو GPT-5.6 Sol کے 7.8% کے مقابلے میں تقریباً چار گنا زیادہ ہے۔ یہ ماڈل کی ان کاموں کو سنبھالنے کی صلاحیت میں ایک بڑی چھلانگ کی نشاندہی کرتا ہے جو اس کے ٹریننگ ڈیٹا کے پیٹرنز سے باہر ہیں۔

ذہین کوشش کی پیمائش (Effort Scaling) اور کارکردگی

Anthropic نے ایک جدید "effort" سسٹم متعارف کرایا ہے، جو صارفین کو پانچ سیٹنگز کے درمیان انتخاب کرنے کی اجازت دیتا ہے: low، medium، high، xhigh، اور max۔ یہ ٹوکن کے استعمال اور استدلال کی گہرائی کے درمیان ایک باریک توازن برقرار رکھنے کی سہولت دیتا ہے۔

اگرچہ Anthropic لاگت کو کم کرنے کے لیے عام کاموں کے لیے "low" اور "medium" سیٹنگز کی سفارش کرتا ہے، لیکن وہ پیچیدہ ایجنٹک کوڈنگ کے لیے "xhigh" استعمال کرنے کا مشورہ دیتے ہیں۔ دلچسپ بات یہ ہے کہ کمپنی نے "max" سیٹنگ پر کم ہوتے ہوئے فوائد کا مشاہدہ کیا؛ Frontier-Bench v0.1 اور Artificial Analysis Coding Agent Index دونوں پر، Opus 5 نے زیادہ قیمت کے باوجود زیادہ سے زیادہ کوشش (maximum effort) پر کارکردگی میں معمولی کمی دیکھی، جس سے یہ ظاہر ہوتا ہے کہ "xhigh" سیٹنگ فی الحال کارکردگی کے لیے بہترین (sweet spot) ہو سکتی ہے۔

بہتر حفاظت اور خود مختاری

صارفین کے فیڈ بیک کے براہ راست جواب میں، Anthropic نے Opus 5 کے لیے سیفٹی کلاسیفائرز (safety classifiers) کو بہتر بنایا ہے۔ ماڈل کے سائبر فلٹرز Fable 5 کے مقابلے میں تقریباً 85% کم بار متحرک ہوتے ہیں، جو جائز تحقیق کی ضرورت سے زیادہ بلاکنگ کے حوالے سے پچھلے اعتراضات کو دور کرتے ہیں۔ اگرچہ یہ اب بھی ایکسپلائٹ (exploit) کی تخلیق اور بائنری پر مبنی اسکیننگ کو روکتا ہے، لیکن یہ سورس کوڈ کی کمزوریوں (vulnerability) کی تحقیق کے لیے کہیں زیادہ نرم ہے۔

مزید برآں، Opus 5 بہتر خود اصلاح (self-correction) کی صلاحیتیں دکھاتا ہے۔ حقیقی دنیا کے ٹیسٹنگ میں، ماڈل نے جیومیٹری کی تشریح کے لیے اپنا کمپیوٹر ویژن پائپ لائن لکھ کر FreeCAD میں کامیابی سے ایک 3D ماڈل بنایا—ایک ایسا کام جس نے تمام دیگر حریف ماڈلز کو حیران کر دیا۔

اہم نکات

  • لاگت میں نمایاں کمی: Opus 5، Claude Fable 5 کی ٹوکن لاگت کے 50 فیصد پر فلیگ شپ لیول کی کارکردگی فراہم کرتا ہے۔
  • استدلال میں بڑی پیش رفت: ماڈل نے نئے مسائل کو حل کرنے کے لیے ARC-AGI-3 بینچ مارک میں حریفوں پر 4 گنا بڑی برتری دکھائی۔
  • بہتر ڈویلپر ورک فلو: بہتر سیفٹی کلاسیفائرز اور مخصوص "effort" سیٹنگز کے ساتھ، Opus 5 ایجنٹک کوڈنگ اور تحقیق کے لیے ایک زیادہ ہموار تجربہ فراہم کرتا ہے۔