बँकिंगमधील बहुतेक AI प्रकल्प एका कारणाने अपयशी ठरतात ज्याचा मॉडेलच्या गुणवत्तेशी काहीही संबंध नाही. नेतृत्व पथके (Leadership teams) पॅरामीटर संख्या आणि बेंचमार्क स्कोअरची तुलना करण्यात महिने वाया घालवतात, तर एक शांत धोका त्यांच्या बांधलेल्या सर्व गोष्टींना पोखरत असतो. ते मॉडेलचा आकार हा विजयाचा निकष मानतात. पण तसे नाही. फायनान्स क्षेत्रात वर्चस्व असलेल्या नियमन केलेल्या (regulated), बहु-स्तरीय कार्यप्रवाहामध्ये (multi-step workflows), अचूकता वाढत नाही, तर ती कमी होत जाते. जर तुम्ही केवळ एका टप्प्यातील स्कोअरवर लक्ष केंद्रित केले, तर संपूर्ण प्रणालीच्या अपयशाने तुम्ही चकित व्हाल.
खरे आव्हान मॉडेलच्या आकाराचे नाही
येथे असे गणित आहे ज्यामुळे रिस्क ऑफिसर्सना (risk officers) झोप येत नाही. सहा वेगवेगळ्या टप्प्यांचा एक पाइपलाइनचा विचार करा—डेटा एक्सट्रॅक्शन, व्हॅलिडेशन, रिस्क स्कोअरिंग, कंप्लायन्स चेक, डॉक्युमेंट जनरेशन आणि अंतिम मंजुरी. प्रत्येक टप्पा स्वतंत्रपणे उत्तम काम करतो आणि ९७ टक्के अचूकता गाठतो. अशा वेळी आनंद साजरा करण्याची प्रवृत्ती होते. परंतु संभाव्यता (probability) अंतर्ज्ञानाप्रमाणे चालत नाही. जेव्हा तुम्ही हे सर्व टप्पे एकत्र जोडता, तेव्हा एंड-टू-एंड विश्वासार्हता साधारण ८३ टक्क्यांपर्यंत खाली येते.
स्थानिक परिपूर्णता आणि जागतिक अपयश यातील ही दरी म्हणजे 'AI समन्वय त्रुटी' (AI Coordination Gap) आहे. एजंट्स, सॉफ्टवेअर टूल्स आणि मानवी पुनर्विलोकनकर्ते (human reviewers) यांच्यातील हस्तांतरणादरम्यान (handoffs) होणारा हा घर्षण आहे. नियामक (Regulators) आधीच या नेमक्या त्रुटीचा शोध घेत आहेत. तुमच्या इंजिनिअरिंग टीमने 'पोस्ट-मॉर्टम' पूर्ण करण्यापूर्वीच त्यांना हे लक्षात येईल.
२०२६ पर्यंत, चर्चेचे स्वरूप बदलले आहे. प्रश्न आता असा उरलेला नाही की कोणते मॉडेल रिसर्च लीडरबोर्डवर अव्वल आहे. प्रश्न आता बजेट शिस्त, डेटा सार्वभौमत्व (data sovereignty) आणि अपडेट नियंत्रणाबद्दल आहे. तुम्ही तुमच्या स्वतःच्या इन्फ्रास्ट्रक्चरमध्ये सुरक्षित ठेवता येण्याजोग्या कस्टम 'स्मॉल लँग्वेज मॉडेल' (Small Language Model) किंवा टोकननुसार भाड्याने घेण्यायोग्य 'लार्ज लँग्वेज मॉडेल' (Large Language Model) यापैकी एकाची निवड करत आहात.
SLM विरुद्ध LLM: २०२६ मध्ये नेमके काय बदलेल
बाजारात उपलब्ध असलेले फ्रंटियर मॉडेल्स—GPT-4o, Claude आणि त्यांचे सहकारी—मुक्त तर्क (open-ended reasoning) आणि कमी प्रमाणात असलेल्या विश्लेषणात्मक कामांसाठी अजोड आहेत. ते शब्दांमधील अर्थ समजून घेतात. ते बारकावे हाताळतात. परंतु या सोयीची एक किंमत चुकवावी लागते. त्यांचे 'वेट्स' (weights) तुमच्या मालकीचे नसतात. त्यांच्या रिलीज शेड्युलवर तुमचे नियंत्रण नसते. व्हेंडरकडून (vendor) वीकेंडला केलेले एखादे शांत अपडेट तुमच्या ॲप्लिकेशनद्वारे कर्ज-उत्पन्न गुणोत्तर (debt-to-income thresholds) किंवा संशयास्पद व्यवहार ओळखण्याच्या पद्धतीत बदल करू शकते, आणि नेमके काय बदलले याचा तुमच्याकडे कोणताही रेकॉर्ड नसू शकतो. ज्या उद्योगात प्रत्येक निर्णयासाठी ऑडिट ट्रेलची आवश्यकता असते, तिथे ही अस्पष्टता महाग पडते.
Llama किंवा Mistral सारख्या ओपन वेट्सवर आधारित तयार केलेले कस्टम SLMs समीकरण बदलतात. ते अत्यंत कष्टाची आणि मोठ्या प्रमाणावरील कामांसाठी खास बनवलेले असतात: जसे की मॉर्टगेज PDF मधून फील्ड्स काढणे, KYC कागदपत्रांचे वर्गीकरण करणे किंवा ट्रान्झॅक्शन मेमोचे विश्लेषण करणे. तुम्ही ते स्वतः होस्ट करत असल्यामुळे, तुम्ही एखादे व्हर्जन फ्रीझ करू शकता, डिफरेंशियल टेस्टिंग करू शकता आणि ऑडिटरला हे सिद्ध करू शकता की मार्चमध्ये काम करणारे मॉडेल आणि जूनमध्ये काम करणारे मॉडेल अगदी सारखेच आहे. ते अत्यंत स्वस्त देखील आहेत, क्लाउड-आधारित मॉडेल्सच्या तुलनेत प्रति टोकन त्यांचा खर्च साधारणपणे दहा ते तीस पटीने कमी असतो. याचा एकमेव तोटा म्हणजे त्यांची मर्यादित क्षमता. SLM बाजारपेठेतील कल (market trends) यावर तत्वज्ञान मांडणार नाही. मात्र, ते तुमच्या फायरवॉलच्या बाहेर कोणताही मालकीचा डेटा न पाठवता तासाला दहा हजार इनव्हॉइसेसवर शिक्का मारू शकते.
हेटरोजीनियस राउटिंग: ८०/२० विभागणी
जे बँक्स आघाडीवर आहेत त्यांनी याकडे 'एकतर हे किंवा ते' असा पर्याय म्हणून पाहणे थांबवले आहे. त्यांचे आर्किटेक्चर हेटरोजीनियस (heterogeneous) आहे. एक स्वस्त, फाईन-ट्यून केलेले SLM अंदाजित आणि स्ट्रक्चर्ड कामांसाठी—जसे की डॉक्युमेंट एक्सट्रॅक्शन, एंटिटी टॅगिंग किंवा नियमित पात्रता तपासणी—पहिली फेरी हाताळते आणि एकूण कामाच्या साधारण ८० टक्के भागावर प्रक्रिया करते. उर्वरित २० टक्के कामे, ज्यांना तुलनात्मक तर्क (analogical reasoning) किंवा जटिल धोरणात्मक अर्थ लावण्याची गरज असते, ती फ्रंटियर LLM कडे सोपवली जातात.
हे केवळ सैद्धांतिक नाही. एखादा मॉर्टगेज सर्व्हिसर SLM द्वारे पे-स्टब्समधून उत्पन्नाचे आकडे काढू शकतो आणि त्यानंतर केवळ संदिग्ध (ambiguous) अर्ज मोठ्या मॉडेलकडे पाठवू शकतो, जे बदलत्या फेडरल मार्गदर्शक तत्त्वांनुसार विविध रोजगार प्रकारांची पडताळणी करते. यामुळे तुमची क्षमता कमी न करता तुम्ही क्लाउडवरील खर्च कमी करू शकता.
त्रुटी दूर करण्यासाठी पाच-स्तरीय फ्रेमवर्क
समन्वय त्रुटी (Coordination Gap) दूर करण्यासाठी केवळ स्मार्ट राउटिंग पुरेसे नाही. त्यासाठी एका स्पष्ट स्टॅकची गरज आहे. येथे एक पाच-स्तरीय फ्रेमवर्क आहे जे टीम्स आता लागू करू शकतात.
मॉडेल निवड. इन्फरन्सला (inference) एका ट्रायज नर्सप्रमाणे (triage nurse) समजा. कामाचे स्वरूप आणि संवेदनशीलता यानुसार ते राउट करा. उच्च-वारंवारता आणि कमी-धोका असलेल्या ऑपरेशन्ससाठी SLM वापरा. निर्णयक्षमता, संदिग्धता किंवा ग्राहक तक्रार निवारण यांसारख्या प्रकरणांसाठी LLM वापरा. राउटिंगचे नियम प्रॉम्प्टमध्ये (prompt) न लिहिता कोडमध्ये लिहा.
ग्राउंडिंग (Grounding). ग्राहकाशी संबंधित प्रत्येक उत्तराने मूळ दस्तऐवजाचा (source document) संदर्भ देणे आवश्यक आहे. तुमच्या प्रत्यक्ष पॉलिसी मॅन्युअल्स, रेट शीट्स आणि नियामक सूचनांमध्ये (regulatory notices) आउटपुट स्थिर करण्यासाठी 'retrieval-augmented generation' चा वापर करा. सध्याचे व्याजदर किंवा शुल्क वेळापत्रकासाठी मॉडेलच्या पॅरामीट्रिक मेमरीवर (parametric memory) कधीही विश्वास ठेवू नका. मेमरी बदलू शकते (drifts). परंतु व्हर्जन नंबर असलेला PDF तसा होत नाही.
ऑर्केस्ट्रेशन (Orchestration). असे वर्कफ्लो तयार करा जिथे मार्ग स्पष्टपणे दिसतो. LangGraph सारखी साधने तुम्हाला स्पष्ट आणि ऑडिट करण्यायोग्य 'state machines' परिभाषित करण्याची परवानगी देतात. कोणताही निर्णय परिभाषित केलेल्या टप्प्यांतून पार पडला पाहिजे: extract, verify, decision, log. एजंट्सना ओपन कन्वर्सेशनल लूपमध्ये 'चॅट' करून निष्कर्षापर्यंत पोहोचू देऊ नका. जर तुम्ही फ्लोचार्ट काढू शकत नसाल, तर तुम्ही ते नियामक (regulator) यंत्रणेला समजावून सांगू शकणार नाही.
टूल ॲक्सेस (Tool Access). एजंट्सना कोअर बँकिंग सिस्टम्सना कॉल करण्याची आवश्यकता असते, परंतु प्रत्येक इंटिग्रेशन हा संभाव्य त्रुटीचा बिंदू (failure point) असू शकतो. एजंट्स कशा प्रकारे ऑथेंटिकेट करतात आणि तुमचे लेजर्स, CRM रेकॉर्ड्स आणि कंप्लायन्स डेटाबेस क्वेरी करतात, हे प्रमाणित करण्यासाठी 'Model Context Protocol' चा वापर करा. एकसमान इंटरफेसमुळे 'सायलेंट ब्रेकगेज'ची (silent breakage) शक्यता कमी होते.
पडताळणी (Verification). मानवी निर्णयासाठी एक स्वतंत्र मार्ग (hard lane) राखून ठेवा. उच्च-जोखीम असलेले निर्णय—मोठे वायर ट्रान्सफर, क्रेडिट लिमिट ओव्हरराइड्स, SAR फायलिंग्स—एखाद्या मानवी रिव्ह्यूअरकडे किंवा वेगळ्या मॉडेलवर चालणाऱ्या दुसऱ्या व्हेरिफिकेशन एजंटकडे वळवा. कडांवरील अतिरिक्तता (Redundancy at the edge) केंद्राचे रक्षण करते.
योग्य गोष्टी मोजा
प्रत्येक टप्प्याच्या अचूकतेसाठी (per-step accuracy) टीम्सना बक्षीस देणे थांबवा. असा पाइपलाइन जिथे प्रत्येक मॉड्यूल टेस्ट सेटवर ९९ टक्के अचूकतेचा दावा करते, तो टप्पे एकमेकांशी संवाद साधताना पाचपैकी एका वास्तविक ग्राहकासाठी अपयशी ठरू शकतो. एंड-टू-एंड विश्वासार्हता (end-to-end reliability) मोजण्यास सुरुवात करा. सिंथेटिक फेल्युअर केसेस (synthetic failure cases) समाविष्ट करा. हँडऑफ्सची (handoffs) चाचणी अशा प्रकारे करा जशी हल्लेखोर (attackers) त्रुटी शोधण्यासाठी करतात.
२०२६ मध्ये AI च्या मदतीने खऱ्या अर्थाने यशस्वी होणारे बँका ते नाहीत जे सर्वात मोठे मॉडेल्स भाड्याने घेत आहेत. ते आहेत जे सर्वात स्पष्ट सिस्टम्स एकत्र गुंफत आहेत. त्यांना माहित आहे की तुम्ही ऑडिट करू शकता असे लहान मॉडेल, तुम्ही स्पष्ट करू शकत नाही अशा मोठ्या मॉडेलपेक्षा सरस आहे, आणि की
