AI ایجنٹس اس وقت حیرت انگیز طور پر بہتر کارکردگی دکھاتے ہیں جب آپ انہیں اپنے ٹولز کو دوبارہ چلانے کی واضح اجازت دیتے ہیں، مصنف نے یہ دریافت کیا ہے – الفاظ کی ایک سادہ سی تبدیلی نے اصلاح کی کامیابی کی شرح کو 0.16 سے بڑھا کر 1.00 کر دیا۔ اس نتیجے کو "action-licensing" کا نام دیا گیا ہے، جو ظاہر کرتا ہے کہ ایجنٹ کو اپنے کام کی جانچ کرنے کی ترغیب دینا محض مقصد کو دوبارہ بیان کرنے سے کہیں زیادہ مؤثر ہو سکتا ہے۔

یہ اصلاح کیوں اہم ہے

وہ AI اسسٹنٹ جو بیرونی ٹولز (databases, calculators, APIs) استعمال کر سکتے ہیں، کاروباری ورک فلو (workflows) کے لیے تیزی سے استعمال ہو رہے ہیں۔ جب وہ ایجنٹس غلطی کرتے ہیں، تو اکثر وہ غلطی خاموشی سے پھیل جاتی ہے، جس کے نتیجے میں واضح ناکامی کے اشاروں کے بغیر غلط جوابات ملتے ہیں۔ پورے پرامپٹ کو دوبارہ لکھنے کے بغیر مداخلت کا ایک قابل اعتماد طریقہ ڈویلپرز کا وقت بچا سکتا ہے اور پروڈکشن سسٹم میں مہنگے نقصانات سے بچا سکتا ہے۔

ناکامیاں کس طرح ظاہر ہوتی ہیں

مصنف نے دو عام اور کم نظر آنے والے ناکامی کے پیٹرن دیکھے:

  • Skipped Lookup – ایجنٹ جانتا ہے کہ اسے معلومات حاصل کرنی چاہیے (مثلاً کسی ID سے مینیجر کا نام) لیکن وہ لوک اپ ٹول (lookup tool) کو استعمال کرنے کے بجائے محض ایک فرضی جواب دے دیتا ہے۔ سطح پر جواب معقول لگتا ہے، لیکن اس کی حقیقت پر مبنی بنیاد موجود نہیں ہوتی۔

  • Validated Nonsense – ایجنٹ کسی ٹول کو غلط یا ناقص ڈیٹا فراہم کرتا ہے۔ ٹول بغیر کسی غلطی (error) کے نتیجہ واپس کرتا ہے، اور ایجنٹ اس نتیجے کو تصدیق کے طور پر لیتا ہے، جس سے وہ عملی طور پر اپنی ہی غلطی کی تائید کر دیتا ہے۔

دونوں پیٹرن صارف کو ایک پراعتماد لیکن غلط جواب دیتے ہیں، اور یہ ڈویلپرز کے لیے عام طور پر نظر آنے والے لوپ یا جواب نہ ملنے کے اشاروں کو متحرک نہیں کرتے۔

تجربہ

یہ پیمائش کرنے کے لیے کہ مختلف پرامپٹس اصلاح پر کیسے اثر انداز ہوتے ہیں، مصنف نے سخت 'ground-truth' جوابات کے ساتھ ایک کنٹرول شدہ ٹیسٹ ترتیب دیا (جس میں LLM پر مبنی گریڈنگ نہیں تھی)۔ دو ترغیبات (nudges) کا موازنہ کیا گیا:

  1. Goal-only nudge – "جواب مینیجر کا نام ہونا چاہیے۔" ریکوری ریٹ: 0.16۔

  2. Action-licensing nudge – "جواب مینیجر کا نام ہونا چاہیے۔ تصدیق کے لیے ٹولز کا استعمال کریں۔" ریکوری ریٹ: 1.00 (تمام ناکام کوششوں کو درست کر لیا گیا)۔

واحد فرق ٹول کو دوبارہ چلانے کی واضح اجازت تھا۔ دوسرے پرامپٹ نے ایجنٹ کو یہ بتا دیا کہ وہ واپس جا سکتا ہے، گمشدہ ڈیٹا حاصل کر سکتا ہے، اور اپنے پہلے اندازے کو درست کر سکتا ہے۔ اس اجازت نے ایک زیادہ تر غیر مؤثر ترغیب کو آزمائے گئے کیسز کے لیے ایک یقینی حل میں بدل دیا۔

اعداد و شمار کیا ظاہر کرتے ہیں

0.16 سے 1.00 تک کا اضافہ یہ ظاہر کرتا ہے کہ اصلاح میں رکاوٹ ایجنٹ کی مقصد کی سمجھ نہیں تھی بلکہ اس کی عمل کرنے کی محسوس شدہ آزادی تھی۔ جب پرامپٹ ماڈل کو کہتا ہے کہ "آپ دوبارہ کوشش کر سکتے ہیں،" تو وہ صورتحال کو ایک بند راستے کے بجائے ایک نئے ذیلی کام (sub-task) کے طور پر لیتا ہے، جس سے ٹول کال چین (tool-call chain) دوبارہ شروع ہو جاتی ہے۔

صرف پرامپٹ کے ذریعے اصلاح کی حدود

تجربے نے ان حالات کو بھی اجاگر کیا جہاں صرف پرامپٹ ایجنٹ کو بچانے کے لیے کافی نہیں ہے:

  • اگر کوئی ڈاؤن اسٹریم ٹول (downstream tool) خاموشی سے غلط ان پٹ قبول کرتا ہے اور ایک ویلیو واپس کرتا ہے، تو ایجنٹ کے پاس اس بات کا کوئی اشارہ نہیں ہوتا کہ اس کا ڈیٹا غلط تھا۔ الفاظ کی جتنی بھی تبدیلی کر لی جائے، وہ اس نقص کو نہیں پہچان سکے گا؛ ٹول کو خود ان پٹ کی تصدیق (validation) لازمی کرنی چاہیے یا کوئی غلطی (error) ظاہر کرنی چاہیے۔

  • ایجنٹس جو ٹولز کو کال کرنے میں ہی مشکل محسوس کرتے ہیں، انہیں "use tools" کی ہدایت سے کبھی فائدہ نہیں ہوگا، کیونکہ بنیادی صلاحیت ہی موجود نہیں ہے۔ ایسے ماڈلز پر اصلاح کا ٹیسٹ کرنا پرامپٹ کی کارکردگی اور ماڈل کی بنیادی ٹول کال کرنے کی صلاحیت کے درمیان فرق کو ختم کر دیتا ہے۔

ڈویلپرز کے لیے عملی نکات

  • اجازت دیں (Grant permission) – جب آپ مداخلت کریں، تو ایجنٹ کو واضح طور پر بتائیں کہ وہ ٹول کال کو دہرا سکتا ہے یا دوبارہ حساب لگا سکتا ہے۔ محض مطلوبہ نتیجے کو دوبارہ بیان کرنے سے اکثر ایجنٹ اپنے اصل غلط راستے پر ہی پھنسا رہتا ہے۔

  • ٹولز کی حفاظت کریں (Guard the tools) – ایجنٹ جو ٹولز استعمال کرتا ہے، ان میں ان پٹ چیک اور واضح ایرر میسجز شامل کریں۔ یہ "validated nonsense" کو گزرنے سے روکتا ہے۔

  • جلد شناخت کریں (Detect early) – غلطی جتنی جلدی پکڑی جائے گی، دوبارہ چلانے والے پرامپٹ کا کامیاب ہونا اتنا ہی آسان ہوگا۔ متوقع اور اصل ٹول کے استعمال کے درمیان فرق پر نظر رکھنا صحیح وقت پر اصلاحی پرامپٹ کو متحرک کر سکتا ہے۔

  • ماڈل کی صلاحیتوں کی تصدیق کریں (Validate model capabilities) – پرامپٹ پر مبنی اصلاح پر بھروسہ کرنے سے پہلے، اس بات کی تصدیق کر لیں کہ ماڈل بنیادی طور پر ٹولز کو قابل اعتماد طریقے سے کال کر سکتا ہے۔ ورنہ آپ ایک کمزور بنیاد پر پرامپٹ کی تاثیر ناپ رہے ہوں گے۔

بنیادی بات: AI ایجنٹ کو اپنا کام دوبارہ کرنے کی واضح اجازت دینے سے ایک ادھورا حل ایک مکمل بحالی میں بدل سکتا ہے۔ پرامپٹ ڈیزائنرز کو "use tools to verify" کو ایک حفاظتی والو (safety valve) کے طور پر دیکھنا چاہیے، نہ کہ محض ایک اختیاری سجاوٹ کے طور پر۔