اے آئی ایجنٹس (AI agents) جو APIs کو کال کر سکتے ہیں، سسٹم کمانڈز چلا سکتے ہیں یا فائلوں میں تبدیلی کر سکتے ہیں، اب صارفین کی طرف سے کام کرتے ہیں۔ جب وہ ایجنٹس کسی درخواست کو بہت زیادہ لفظی طور پر لیتے ہیں—جیسے کہ "سونے کا ایک پہاڑ" فراہم کرنا جو گھر کو گرا دے—تو اس کا نتیجہ تباہ کن، غیر اخلاقی، یا محض بے کار ہو سکتا ہے۔ محققین ایک نئے مجوزہ میٹرک کے ذریعے اس خلا کو پُر کر رہے ہیں جسے Genie coefficient کہا جاتا ہے، جو یہ ماپتا ہے کہ ایک ایجنٹ کا آؤٹ پٹ صارف کے اصل مقصد سے کتنا ہٹ جاتا ہے۔

اب وضاحت کی کمی کیوں اہم ہے

صرف چیٹ کرنے والے بوٹس سے ایسے ایجنٹس کی طرف منتقلی جو دنیا میں عملی طور پر کام کرتے ہیں، ایک لینگویج ماڈل کے مسئلے کو حفاظتی مسئلے (safety issue) میں بدل دیتی ہے۔ ایک ماڈل اب بھی فلوئنٹ ٹیکسٹ تیار کر سکتا ہے، لیکن ایک بار جب وہ API کالز یا شیل کمانڈز جاری کرنا شروع کر دیتا ہے، تو لفظی مطلب نکالنا حقیقی دنیا میں نقصان کا باعث بن سکتا ہے۔ چونکہ ماڈل میں pragmatics (سیاق و سباق سمجھنے کی صلاحیت) کی کمی ہوتی ہے—یعنی سیاق و سباق، معقول توقعات اور غیر بیان کردہ حدود کا اندازہ لگانے کی صلاحیت—اس لیے وہ الفاظ کی تو تعمیل کر سکتا ہے لیکن ان کے پیچھے چھپے مقصد کو نظر انداز کر سکتا ہے۔ "جنّی" (genie) کی مثال اس کی عکاسی کرتی ہے: ایک ایسی خواہش جو لفظی طور پر تو پوری ہو جائے لیکن خواہش کرنے والے کے گہرے مقصد کو نظر انداز کر دے۔

Genie coefficient کیا ماپتا ہے

یہ کوفیفیشینٹ کوئی ایک واحد بینچ مارک نمبر نہیں ہے؛ بلکہ یہ مطلوبہ نتیجے اور ایجنٹ کے اصل طرز عمل کے درمیان فرق کا جائزہ لینے کا ایک فریم ورک ہے۔ یہ چار ستونوں پر مبنی ہے:

  • مخصوص ڈومین کے بینچ مارکس (Domain-specific benchmarks) جو ان کاموں کی عکاسی کرتے ہیں جن کا سامنا ایک ایجنٹ کو کسی مخصوص شعبے میں کرنا پڑے گا۔
  • مصنوعی حقیقی دنیا کے ماحول (Simulated real-world environments) جہاں شارٹ کٹس، ایج کیسز (edge cases)، اور غیر ارادی ضمنی اثرات سامنے آتے ہیں۔
  • AI کے اقدامات کے لیے ایک "معقول انسان" کا معیار (reasonable-person standard)، جو اس قانونی تصور سے لیا گیا ہے کہ ایک سمجھدار شخص اسی صورتحال میں کیا کرے گا۔
  • ماڈل اور سافٹ ویئر ہارس (software harness) کا مشترکہ جائزہ، یہ تسلیم کرتے ہوئے کہ ارد گرد کے کوڈ میں موجود بگ (bugs) ماڈل کی غلطیوں جتنے ہی خطرناک ہو سکتے ہیں۔

ایسے عناصر کا اطلاق کرنے سے ڈویلپرز ایک ایسا Genie coefficient مقرر کر سکتے ہیں جو سیمنٹک درستگی (semantic correctness) اور پرگیمیٹک حفاظت (pragmatic safety) دونوں کو شامل کرتا ہے۔

ڈویلپرز اور صارفین کے لیے خطرات اور اہمیت

ایک زیادہ کوفیفیشینٹ اس بات کا اشارہ ہے کہ ایجنٹ حکم کے لفظی مطالبے پر تو عمل کرے گا لیکن اس کی روح کی خلاف ورزی کرے گا، جس سے صارفین کو مالی نقصان، ڈیٹا کی چوری، یا ریگولیٹری جرمانے کا سامنا کرنا پڑ سکتا ہے۔ ایک کم کوفیفیشینٹ ظاہر کرتا ہے کہ سسٹم ضمنی حدود کا احترام کرتا ہے، جس سے فنانس، ہیلتھ کیئر، یا اہم انفراسٹرکچر جیسے زیادہ خطرے والے شعبوں میں اس کا استعمال زیادہ ممکن ہو جاتا ہے۔

یہ میٹرک پروڈکٹ ٹیموں کو ایک تشخیصی ٹول بھی فراہم کرتا ہے: وہ ہدایت کی سطح کی ناکامیوں (instruction-level failures - یعنی ماڈل نے پرامپٹ کو غلط سمجھا) کو تکنیکی بدسلوکی (technical misbehavior - یعنی ارد گرد کے کوڈ نے API کال کو غلط راستے پر بھیج دیا) سے الگ کر سکتے ہیں۔ ڈی بگنگ (debugging)، تعمیل رپورٹنگ (compliance reporting)، اور لاگت کے تعین کے لیے یہ فرق بہت اہم ہے۔

مخالف آراء اور کھلے سوالات

ناقدین کا کہنا ہے کہ ارادے (intent) کی مقدار کا تعین کرنا ایک موضوعی (subjective) عمل ہے اور اس سے ترقی کے چکر (development cycles) سست ہو سکتے ہیں۔ ہر ڈومین کے لیے "معقول انسان" کا بنیادی معیار بنانے کے لیے وسیع قانونی اور اخلاقی مہارت کی ضرورت ہو سکتی ہے، جس سے ماڈل کے جائزے کا بوجھ بڑھ جائے گا۔ اس بات کا بھی خطرہ ہے کہ ٹیمیں اس کو سسٹم کی گہری ری ڈیزائننگ کے رہنما کے بجائے محض ایک چیک باکس کے طور پر استعمال کریں۔

آگے کیا دیکھنے کی ضرورت ہے

اگلے اقدامات میں Genie coefficient کو موجودہ AI ٹیسٹنگ پائپ لائنز میں شامل کرنا اور ان بینچ مارک سویٹس کو معیاری بنانا شامل ہے جو اسے ڈیٹا فراہم کرتے ہیں۔ اگر صنعتی گروپس اسے حفاظتی معیار کے طور پر اپنا لیتے ہیں، تو ایجنٹس کے صارفین تک پہنچنے سے پہلے سرٹیفیکیشن پروگراموں کے لیے ایک مخصوص حد (threshold) کے کوفیفیشینٹ کی ضرورت ہو سکتی ہے۔ محققین غالباً "معقول انسان" کی تعریف کو مزید بہتر بنائیں گے اور قابل اعتماد پیمائش کے لیے ضروری مصنوعی ماحول تیار کرنے کے خودکار طریقے تلاش کریں گے۔

خلاصہ: جیسے جیسے AI ایجنٹس ٹیکسٹ سے ایکشن (action) کی طرف بڑھ رہے ہیں، یہ پیمائش کرنا ضروری ہو جاتا ہے کہ وہ صارفین کے اصل مقصد کو کتنی اچھی طرح سمجھتے ہیں—نہ کہ صرف یہ کہ وہ کیا کہتے ہیں۔ Genie coefficient اس پیمائش کو عملی جامہ پہنانے کا ایک ٹھوس اور اب تک تیار ہوتا ہوا طریقہ فراہم کرتا ہے۔