زیادہ تر بینکنگ AI پروجیکٹس ایک ایسی وجہ سے ناکام ہو جاتے ہیں جس کا ماڈل کے معیار سے کوئی تعلق نہیں ہوتا۔ قیادت کی ٹیمیں پیرامیٹر کی تعداد اور بینچ مارک اسکورز کا موازنہ کرنے میں مہینوں ضائع کر دیتی ہیں، جبکہ ایک خاموش خطرہ ان کی بنائی ہوئی ہر چیز کو ختم کر رہا ہوتا ہے۔ وہ ماڈل کے سائز کو کامیابی کی شرط سمجھتے ہیں۔ یہ نہیں ہے۔ فنانس میں غالب رہنے والے ریگولیٹڈ اور کثیر مراحل والے ورک فلو میں، درستگی (accuracy) بڑھتی نہیں بلکہ کم ہوتی جاتی ہے۔ اگر آپ صرف ایک مرحلے کے اسکور پر توجہ مرکوز کریں گے، تو پورے سسٹم کی ناکامی آپ کو حیران کر دے گی۔

اصل مسئلہ ماڈل کا سائز نہیں ہے

یہ وہ حساب کتاب ہے جو رسک آفیسرز کی نیندیں اڑا دیتا ہے۔ ایک ایسے پائپ لائن کا تصور کریں جس میں چھ مختلف مراحل ہوں—ڈیٹا کا اخراج (data extraction)، تصدیق (validation)، رسک اسکورنگ، تعمیل کی جانچ (compliance check)، دستاویز کی تیاری (document generation)، اور حتمی منظوری۔ ہر مرحلہ تنہائی میں بہترین کام کرتا ہے اور 97 فیصد درستگی حاصل کرتا ہے۔ فطری طور پر جشن منانے کا دل کرتا ہے۔ لیکن امکانات (probability) وجدان کے مطابق نہیں چلتے۔ ان مراحل کو ایک ساتھ جوڑیں تو اینڈ ٹو اینڈ بھروسہ مندی (reliability) گر کر تقریباً 83 فیصد رہ جاتی ہے۔

مقامی کمال اور عالمی ناکامی کے درمیان وہ فرق 'AI Coordination Gap' کہلاتا ہے۔ یہ وہ رگڑ (friction) ہے جو ایجنٹس، سافٹ ویئر ٹولز اور انسانی جائزہ لینے والوں کے درمیان کام کی منتقلی (handoffs) کے دوران ضائع ہوتی ہے۔ ریگولیٹرز پہلے ہی اس مخصوص کمزوری کی تلاش میں ہیں۔ وہ آپ کی انجینئرنگ ٹیم کے پوسٹ مارٹم مکمل کرنے سے پہلے ہی اسے پکڑ لیں گے۔

2026 تک، گفتگو کا رخ بدل چکا ہے۔ سوال اب یہ نہیں رہا کہ کون سا ماڈل ریسرچ لیڈر بورڈ پر ٹاپ کرتا ہے۔ اب بات بجٹ کے نظم و ضبط، ڈیٹا کی خودمختاری (data sovereignty) اور اپ ڈیٹ کے کنٹرول کی ہے۔ آپ ایک کسٹم Small Language Model (SLM) کا انتخاب کر رہے ہیں جسے آپ اپنے انفراسٹرکچر کے اندر محدود رکھ سکتے ہیں، یا ایک تیار شدہ (off-the-shelf) Large Language Model (LLM) کا جسے آپ ٹوکن کے حساب سے کرائے پر لیتے ہیں۔

SLM بمقابلہ LLM: 2026 میں اصل میں کیا بدلے گا

تیار شدہ فرنٹیر ماڈلز—GPT-4o، Claude، اور ان کے ہم پلہ ماڈلز—کھلے ذہن کے استدلال (open-ended reasoning) اور کم حجم کے تجزیاتی کاموں کے لیے بے مثال ہیں۔ وہ باریکیوں کو سمجھتے ہیں۔ وہ پیچیدگیوں کو سنبھالتے ہیں۔ لیکن اس سہولت کی ایک قیمت ہے۔ آپ 'weights' کے مالک نہیں ہیں۔ آپ ریلیز شیڈول کو کنٹرول نہیں کرتے۔ وینڈر کی جانب سے ہفتہ وار تعطیل کے دوران ہونے والی ایک خاموش اپ ڈیٹ آپ کی ایپلی کیشن کے قرض سے آمدنی کے تناسب (debt-to-income thresholds) کی تشریح کرنے یا مشکوک لین دین کو نشان زد کرنے کے طریقے کو بدل سکتی ہے، اور ہو سکتا ہے کہ آپ کے پاس اس بات کا کوئی ریکارڈ نہ ہو کہ اصل میں کیا بدلا ہے۔ ایک ایسی صنعت میں جہاں ہر فیصلے کے لیے آڈٹ ٹریل کی ضرورت ہوتی ہے، وہاں یہ غیر شفافیت مہنگی پڑتی ہے۔

Llama یا Mistral جیسے اوپن ویٹس (open weights) پر مبنی کسٹم SLMs اس صورتحال کو بدل دیتے ہیں۔ وہ بھاری اور زیادہ حجم والے کاموں کے لیے خاص طور پر بنائے گئے ہیں: جیسے مارگیج (mortgage) پی ڈی ایف سے فیلڈز نکالنا، KYC دستاویزات کی درجہ بندی کرنا، یا ٹرانزیکشن میموز کا تجزیہ کرنا۔ چونکہ آپ انہیں خود ہوسٹ کرتے ہیں، اس لیے آپ ایک ورژن کو فریز کر سکتے ہیں، تفریقی ٹیسٹنگ (differential testing) کر سکتے ہیں، اور ایک آڈیٹر کو ثابت کر سکتے ہیں کہ مارچ میں کام کرنے والا ماڈل جون میں کام کرنے والے ماڈل کے بالکل برابر ہے۔ وہ انتہائی سستے بھی ہیں، ان کا فی ٹوکن خرچہ کلاؤڈ پر مبنی ماڈلز کے مقابلے میں تقریباً دس سے تیس گنا کم ہوتا ہے۔ اس کا نقصان محدود صلاحیت ہے۔ ایک SLM مارکیٹ کے رجحانات پر فلسفیانہ گفتگو نہیں کرے گا۔ تاہم، یہ آپ کے فائر وال سے باہر ملکیتی ڈیٹا بھیجے بغیر فی گھنٹہ دس ہزار انوائسز پر مہر لگا سکتا ہے۔

ہیٹرو جینیئس روٹنگ (Heterogeneous Routing): 80/20 تقسیم

وہ بینک جو آگے بڑھ رہے ہیں، انہوں نے اسے 'یا تو یہ یا وہ' کے طور پر دیکھنا چھوڑ دیا ہے۔ ان کا آرکیٹیکچر ہیٹرو جینیئس (heterogeneous) ہے۔ ایک سستا، فائن ٹیونڈ SLM قابلِ پیش گوئی اور منظم کاموں—جیسے دستاویز کا اخراج، اینٹیٹی ٹیگنگ، یا معمول کے اہلیت اسکرینز—کے پہلے مرحلے کو سنبھالتا ہے، جو کل حجم کا تقریباً اسی فیصد حصہ ہوتا ہے۔ باقی بیس فیصد، وہ پیچیدہ کیسز (edge cases) جنہیں استخراجی استدلال یا پیچیدہ پالیسی کی تشریح کی ضرورت ہوتی ہے، انہیں ایک فرنٹیر LLM کو بھیج دیا جاتا ہے۔

یہ محض نظریاتی نہیں ہے۔ ایک مارگیج سروس فراہم کنندہ SLM کو پے اسٹب سے آمدنی کے اعداد و شمار نکالنے دے سکتا ہے، اور پھر صرف مبہم درخواستوں کو ایک بڑے ماڈل کو بھیج سکتا ہے جو بدلتی ہوئی وفاقی ہدایات کے مطابق مختلف ملازمتوں کی اقسام کا موازنہ کرتا ہے۔ آپ صلاحیتوں میں کمی کیے بغیر کلاؤڈ کے اخراجات کم کر دیتے ہیں۔

گیپ کو ختم کرنے کے لیے پانچ تہوں والا فریم ورک

کوآرڈینیشن گیپ کو ختم کرنے کے لیے صرف اسمارٹ روٹنگ ہی کافی نہیں ہے۔ اس کے لیے ایک واضح اسٹیک (stack) کی ضرورت ہے۔ یہاں ایک پانچ تہوں والا فریم ورک ہے جسے ٹیمیں ابھی نافذ کر سکتی ہیں۔

  1. ماڈل کا انتخاب۔ انفرنس (inference) کو ایک ٹریاج نرس (triage nurse) کی طرح سمجھیں۔ کاموں کو حجم اور حساسیت کی بنیاد پر روٹ کریں۔ زیادہ تعدد (high-frequency) اور کم خطرے والے آپریشنز آپ کے SLM کو بھیجیں۔ فیصلے، ابہام، یا کسٹمر کی شکایات کے حل سے متعلق کیسز LLM کو بھیجیں۔ روٹنگ کے اصول کوڈ میں لکھیں، پرامپٹ (prompt) میں نہیں۔

  2. Grounding. ہر وہ جواب جو کسی صارف سے متعلق ہو، اسے ایک اصل دستاویز کی طرف اشارہ کرنا چاہیے۔ اپنے اصل پالیسی مینوئلز، ریٹ شیٹس، اور ریگولیٹری نوٹس میں آؤٹ پٹس کو مستحکم کرنے کے لیے retrieval-augmented generation کا استعمال کریں۔ موجودہ شرح سود یا فیس شیڈول کے لیے کبھی بھی ماڈل کی پیرا میٹرک میموری (parametric memory) پر بھروسہ نہ کریں۔ میموری بدلتی رہتی ہے، جبکہ ورژن نمبر کے ساتھ موجود PDF نہیں بدلتی۔

  3. Orchestration. ایسے ورک فلو بنائیں جہاں راستہ واضح ہو۔ LangGraph جیسے ٹولز آپ کو واضح اور آڈٹ کے قابل اسٹیٹ مشینز (state machines) کی تعریف کرنے کی اجازت دیتے ہیں۔ ایک فیصلے کو متعین مراحل سے گزرنا چاہیے: نکالنا (extract)، تصدیق کرنا (verify)، فیصلہ کرنا (decision)، اور لاگ (log) کرنا۔ ایجنٹس کو ایک کھلے مکالماتی لوپ میں "چیٹ" کے ذریعے نتیجے تک پہنچنے کی اجازت نہ دیں۔ اگر آپ فلو چارٹ نہیں بنا سکتے، تو آپ اسے ریگولیٹر کو نہیں سمجھا سکتے۔

  4. Tool Access. ایجنٹس کو کور بینکنگ سسٹم کو کال کرنے کی ضرورت ہوتی ہے، لیکن ہر انٹیگریشن ناکامی کا ایک ممکنہ مقام ہو سکتا ہے۔ ایجنٹس کس طرح آپ کے لیجرز، CRM ریکارڈز، اور کمپلائنس ڈیٹا بیسز کو آتھنٹیکیٹ (authenticate) اور کوئری (query) کرتے ہیں، اسے معیاری بنانے کے لیے Model Context Protocol کا استعمال کریں۔ یکساں انٹرفیسز خاموش خرابیوں (silent breakage) کے امکانات کو کم کرتے ہیں۔

  5. Verification. انسانی فیصلہ سازی کے لیے ایک مخصوص راستہ محفوظ رکھیں۔ زیادہ خطرے والے فیصلے—جیسے بڑے وائر ٹرانسفرز، کریڈٹ لمٹ اوور رائڈز، SAR فائلنگز—کسی انسانی ریویو کرنے والے یا کسی الگ ماڈل پر چلنے والے دوسرے تصدیقی ایجنٹ کو بھیجیں۔ کنارے پر موجود اضافی انتظام (redundancy) مرکز کی حفاظت کرتا ہے۔

صحیح چیز کی پیمائش کریں

ٹیموں کو ہر مرحلے کی درستگی (per-step accuracy) پر انعام دینا بند کریں۔ ایک ایسی پائپ لائن جہاں ہر ماڈیول ٹیسٹ سیٹ پر 99 فیصد کا دعویٰ کرتا ہے، وہ بھی تب ناکام ہو سکتی ہے جب مراحل آپس میں ملتے ہیں اور ہر پانچ میں سے ایک حقیقی صارف کو متاثر کرتی ہے۔ اینڈ ٹو اینڈ (end-to-end) قابل بھروسہ ہونے کی پیمائش شروع کریں۔ مصنوعی ناکامی کے کیسز (synthetic failure cases) شامل کریں۔ ہینڈ آف (handoffs) کا اسی طرح تجربہ کریں جیسے حملہ آور جوڑوں (seams) کا تجربہ کرتے ہیں۔

وہ بینک جو 2026 میں AI کے ذریعے اصل میں کامیابی حاصل کر رہے ہیں، وہ وہ نہیں ہیں جو سب سے بڑے ماڈلز کرایے پر لے رہے ہیں۔ وہ وہ ہیں جو سب سے واضح نظام تیار کر رہے ہیں۔ وہ جانتے ہیں کہ ایک چھوٹا ماڈل جسے آپ آڈٹ کر سکتے ہیں، اس بڑے ماڈل سے بہتر ہے جس کی آپ وضاحت نہیں کر سکتے، اور یہ کہ