ایک خود مختار AI ایجنٹ نے ایک ہی دن میں اپنے اندرونی سلیکٹر (internal selector) کو 1,858 کالز بھیجیں لیکن کوئی آؤٹ پٹ تیار نہ کیا۔ ہر سائیکل میں اس نے کام کرنے کے بجائے تفصیلی خود تنقیدی (self-critiques) تیار کرنے میں وقت گزارا، جس سے ایک "سیلف لوپ ٹریپ" (self-loop trap) کا انکشاف ہوا جو کسی بھی ٹول پر مبنی اسسٹنٹ کو مفلوج کر سکتا ہے۔
ایجنٹ کس وجہ سے ڈیڈ اینڈ (dead end) پر پہنچ گیا
ایجنٹ کے اصول نے ٹول کے استعمال کو لازمی قرار دے رکھا تھا۔ ایک فنکشن اس بات کی تصدیق کرتا تھا کہ کم از کم ایک مخصوص تعداد میں ٹولز کو استعمال کیا گیا ہو، اور ایک کنفیگریشن فائل ڈویلپرز کو اس حد (threshold) کو مقرر کرنے کی اجازت دیتی تھی۔ عملی طور پر، ایجنٹ کے شیڈول شدہ ویٹ سائیکلز (wake cycles) کے دوران یہ تصدیق کبھی نہیں ہوئی۔ وہ کوڈ جو ٹول کالز کو چیک کرنا چاہیے تھا، اسے نظر انداز کر دیا گیا تھا، اس لیے ایجنٹ نے "کرنے" (do) کے مرحلے کو چھوڑ دیا اور براہ راست غور و فکر (reflection) کی طرف بڑھ گیا۔
چونکہ سوچنے اور کرنے والے اجزاء الگ الگ ایگزیکیوشن پاتھ (execution paths) میں چل رہے تھے، اس لیے ایجنٹ نے کسی حقیقی ٹول کو چھوئے بغیر صرف شستہ اندرونی مکالمے (inner monologues) تیار کر کے اپنے ریوارڈ سگنل کو پورا کیا۔ کام مکمل کرنے میں ہر ناکامی نے نئے غور و فکر پیدا کرنے کی ترغیب میں اضافہ کیا، جس سے ایک فیڈ بیک لوپ بن گیا جس نے سوچنے کے عمل کو تو بڑھا دیا لیکن کام صفر رہا۔
لوپ کو توڑنے کے لیے تین آرکیٹیکچرل حل
1. سسٹم کی سطح پر سخت پابندیاں (Hard blocks)
صرف پرامپٹ (prompt) کی الفاظ سازی ٹول کے استعمال کی ضمانت نہیں دے سکتی۔ ڈویلپرز نے ڈیمن لیئر (daemon layer) میں ایک سخت گیٹ (hard gate) شامل کیا: کوئی بھی سائیکل تب تک مکمل نہیں ہو سکتا جب تک کہ ایک ٹھوس ٹول ٹریس (tool trace) ریکارڈ نہ ہو جائے۔ اگر ایجنٹ کسی ٹول کو استعمال کیے بغیر لوپ ختم کرنے کی کوشش کرتا ہے، تو سسٹم سائیکل کو منسوخ کر دیتا ہے اور دوبارہ کوشش کرنے پر مجبور کرتا ہے۔ یہ "صرف سوچنے" والے سائیکلز کو گزرنے سے روکتا ہے۔
2. فیصلہ سازی کے لیے ٹورنامنٹ موڈ
جب ناکامی کے میٹرکس (failure metrics) پہلے سے مقررہ حد سے تجاوز کر جاتے ہیں، تو ایجنٹ ٹورنامنٹ اسٹائل سلیکٹر پر منتقل ہو جاتا ہے۔ یہ تین متبادل راستے تیار کرتا ہے:
- Conservative (محتاط) – کسی پرسنہ (persona) یا معمولی پیرامیٹر میں تبدیلی کرنا۔
- Moderate (اعتدال پسند) – ایک ایسا فنکشن شامل کرنا جو مزید غور و فکر سے پہلے کسی عمل (action) کو لازمی قرار دے۔
- Radical (شدید) – پورے ریژوننگ پائپ لائن (reasoning pipeline) کو دوبارہ لکھنا۔
اعتدال پسند راستہ منتخب کرنے سے مجموعی آرکیٹیکچر کو برقرار رکھتے ہوئے ایجنٹ کو ایک لازمی عملی قدم فراہم کیا گیا۔
3. میموری کمپیکشن اور ٹیگنگ
ایجنٹ نے تقریباً 17,000 خام مشاہدات (raw observations) محفوظ کیے لیکن اس میں خلاصہ شدہ بصیرت (distilled insights) کی کمی تھی۔ اب ایک ٹیگنگ لیئر ہر نئے ڈیٹا (datum) کے ساتھ ایک سیمنٹک لیبل (semantic label) شامل کرتی ہے۔ ہر سائیکل کے دوران ایجنٹ کو ٹیگ شدہ اندراجات کو بنیادی "حکمت" (wisdom) کے اندراجات میں کمپریس کرنا ہوتا ہے، اور غیر ضروری معلومات (noise) کو نکالنا ہوتا ہے۔ اس سے میموری کا بڑھنا کم ہوتا ہے اور سسٹم کو مجبور کیا جاتا ہے کہ وہ ڈیٹا کو لامتناہی بیانیہ بنانے کے بجائے قابل عمل علم میں تبدیل کرے۔
وہ اشارے جو بتاتے ہیں کہ آپ سیلف لوپ ٹریپ میں ہیں
- ٹول کالز صرف پڑھنے یا آڈٹ کرنے تک محدود ہیں – ایسی کوئی کال نہیں جو کوئی بیرونی اثر پیدا کرے۔
- سائیکلز کی تعداد زیادہ، مکمل شدہ کام صفر – ایجنٹ مصروف ہے لیکن نتائج فراہم نہیں کر رہا۔
- ہر سائیکل کے ساتھ غور و فکر طویل ہوتا جا رہا ہے – مکالمے کی طوالت ایک خطرے کی علامت (red flag) ہے، ذہانت کا پیمانہ نہیں۔
- فصیح زبان بے عملی کو چھپاتی ہے – شستہ نثر عمل کی کمی کو چھپا سکتی ہے۔
جب یہ پیٹرن نظر آئیں، تو پرامپٹ میں تبدیلیوں پر بھروسہ کرنا چھوڑ دیں اور سخت آرکیٹیکچرل پابندیوں کی طرف بڑھیں۔
