अधिकांश बैंकिंग AI प्रोजेक्ट्स एक ऐसे कारण से विफल हो जाते हैं जिसका मॉडल की गुणवत्ता से कोई लेना-देना नहीं है। लीडरशिप टीमें महीनों तक पैरामीटर काउंट और बेंचमार्क स्कोर की तुलना करने में बिता देती हैं, जबकि एक शांत खतरा उनके द्वारा बनाए गए सब कुछ को नष्ट कर रहा होता है। वे मॉडल के आकार को जीत की शर्त मानते हैं। यह नहीं है। फाइनेंस में हावी होने वाले विनियमित, बहु-चरणीय वर्कफ़्लो में, सटीकता गुणात्मक रूप से नहीं बढ़ती। यह घटती है। यदि आप केवल सिंगल-स्टेप स्कोर पर ध्यान केंद्रित करेंगे, तो आप सिस्टम-व्यापी विफलता से अचानक चकित रह जाएंगे।
असली समस्या मॉडल का आकार नहीं है
यहाँ वह गणित है जो रिस्क ऑफिसर्स की नींद उड़ा देता है। छह अलग-अलग चरणों वाली एक पाइपलाइन की कल्पना करें—डेटा एक्सट्रैक्शन, वैलिडेशन, रिस्क स्कोरिंग, कंप्लायंस चेक, डॉक्यूमेंट जनरेशन और अंतिम अनुमोदन। प्रत्येक चरण अकेले में शानदार काम करता है, 97 प्रतिशत सटीकता प्राप्त करता है। सहज प्रवृत्ति उत्सव मनाने की होती है। लेकिन संभावना अंतर्ज्ञान का पालन नहीं करती है। उन चरणों को एक साथ जोड़ें और एंड-टू-एंड विश्वसनीयता गिरकर लगभग 83 प्रतिशत रह जाती है।
स्थानीय पूर्णता और वैश्विक विफलता के बीच का वह अंतर 'AI कोऑर्डिनेशन गैप' है। यह वह रुकावट है जो एजेंटों, सॉफ्टवेयर टूल्स और मानव समीक्षकों के बीच हैंडऑफ के दौरान होती है। नियामक पहले से ही इसी सटीक भेद्यता की तलाश कर रहे हैं। आपकी इंजीनियरिंग टीम अपना पोस्ट-मॉर्टम पूरा करने से पहले ही वे इसे पकड़ लेंगे।
2026 तक, चर्चा बदल चुकी है। सवाल अब यह नहीं है कि कौन सा मॉडल रिसर्च लीडरबोर्ड में शीर्ष पर है। यह बजट अनुशासन, डेटा संप्रभुता और अपडेट कंट्रोल के बारे में है। आप एक कस्टम Small Language Model चुन रहे हैं जिसे आप अपने स्वयं के इंफ्रास्ट्रक्चर के भीतर सीमित रख सकते हैं, या एक ऑफ-द-शेल्फ Large Language Model जिसे आप टोकन के आधार पर किराए पर लेते हैं।
SLM बनाम LLM: 2026 में वास्तव में क्या बदलता है
ऑफ-द-शेल्फ फ्रंटियर मॉडल्स—GPT-4o, Claude और उनके समकक्ष—ओपन-एंडेड रीजनिंग और कम मात्रा वाले विश्लेषणात्मक कार्यों के लिए बेजोड़ बने हुए हैं। वे पंक्तियों के बीच के अर्थ समझते हैं। वे बारीकियों को संभालते हैं। लेकिन इस सुविधा की एक कीमत चुकानी पड़ती है। आप उनके 'वेट्स' के मालिक नहीं हैं। आप उनके रिलीज़ शेड्यूल को नियंत्रित नहीं करते हैं। वेंडर की ओर से सप्ताहांत का एक मौन अपडेट आपके एप्लिकेशन द्वारा डेट-टू-इनकम थ्रेशोल्ड की व्याख्या करने या संदिग्ध लेनदेन को फ्लैग करने के तरीके को बदल सकता है, और आपके पास इस बात का सटीक रिकॉर्ड नहीं हो सकता है कि वास्तव में क्या बदला है। एक ऐसे उद्योग में जहाँ हर निर्णय के लिए ऑडिट ट्रेल की आवश्यकता होती है, वह अपारदर्शिता महंगी पड़ती है।
Llama या Mistral जैसे ओपन वेट्स पर बने कस्टम SLMs समीकरण को बदल देते हैं। वे कठिन, हाई-वॉल्यूम कार्यों के लिए विशेष रूप से बनाए गए हैं: मॉर्गेज PDFs से फ़ील्ड निकालना, KYC दस्तावेज़ों को वर्गीकृत करना, या ट्रांजैक्शन मेमो को पार्स करना। क्योंकि आप उन्हें होस्ट करते हैं, आप एक वर्शन को फ्रीज़ कर सकते हैं, डिफरेंशियल टेस्टिंग चला सकते हैं, और एक ऑडिटर को यह साबित कर सकते हैं कि मार्च में व्यवहार करने वाला मॉडल जून में व्यवहार करने वाले मॉडल के समान ही है। वे बेहद सस्ते भी हैं, जो उनके क्लाउड-आधारित समकक्षों की तुलना में प्रति टोकन लगभग दस से तीस गुना कम लागत पर चलते हैं। इसका ट्रेड-ऑफ सीमित क्षमता है। एक SLM मार्केट ट्रेंड्स पर दार्शनिक चर्चा नहीं करेगा। हालाँकि, यह आपके फ़ायरवॉल के बाहर प्रोपराइटरी डेटा भेजे बिना प्रति घंटे दस हजार इनवॉइस पर मुहर लगा सकता है।
हेटेरोजेनियस रूटिंग: 80/20 का विभाजन
जो बैंक आगे निकल रहे हैं, उन्होंने इसे 'या तो यह या वह' के दांव के रूप में देखना बंद कर दिया है। उनका आर्किटेक्चर हेटेरोजेनियस है। एक सस्ता, फाइन-ट्यून्ड SLM अनुमानित, स्ट्रक्चर्ड काम—डॉक्यूमेंट एक्सट्रैक्शन, एंटिटी टैगिंग, या रूटीन एलिजिबिलिटी स्क्रीन—पर पहला दौर संभालता है, जो कुल वॉल्यूम का लगभग अस्सी प्रतिशत हिस्सा होता है। शेष बीस प्रतिशत, वे एज केसेस जिन्हें एनालॉजिकल रीजनिंग या जटिल नीति व्याख्या की आवश्यकता होती है, उन्हें एक फ्रंटियर LLM को भेज दिया जाता है।
यह सैद्धांतिक नहीं है। एक मॉर्गेज सर्विसर एक SLM को पे स्टब्स से आय के आंकड़े निकालने दे सकता है, और फिर केवल अस्पष्ट आवेदनों को एक बड़े मॉडल को भेज सकता है जो बदलते फेडरल गाइडलाइन्स के विरुद्ध कई रोजगार प्रकारों का क्रॉस-रेफरेंस करता है। आप क्षमता कम किए बिना क्लाउड खर्च कम कर देते हैं।
गैप को पाटने के लिए एक पांच-स्तरीय ढांचा
कोऑर्डिनेशन गैप को पाटने के लिए स्मार्ट रूटिंग से कहीं अधिक की आवश्यकता है। इसके लिए एक स्पष्ट स्टैक की आवश्यकता है। यहाँ एक पांच-स्तरीय ढांचा है जिसे टीमें अभी तैनात कर सकती हैं।
मॉडल चयन। इन्फरेंस को एक ट्राइएज नर्स की तरह मानें। वॉल्यूम और संवेदनशीलता के आधार पर कार्यों को रूट करें। हाई-फ्रीक्वेंसी, लो-रिस्क ऑपरेशन आपके SLM के पास जाते हैं। निर्णय, अस्पष्टता, या ग्राहक शिकायत समाधान से जुड़े मामले LLM के पास जाते हैं। रूटिंग नियमों को कोड में लिखें, प्रॉम्प्ट में नहीं।
ग्राउंडिंग (Grounding). ग्राहक से संबंधित हर उत्तर को एक स्रोत दस्तावेज़ (source document) की ओर संकेत करना चाहिए। अपने वास्तविक पॉलिसी मैनुअल, रेट शीट और नियामक सूचनाओं (regulatory notices) में आउटपुट को स्थिर करने के लिए retrieval-augmented generation का उपयोग करें। वर्तमान ब्याज दरों या शुल्क अनुसूचियों (fee schedules) के लिए मॉडल की पैरामीट्रिक मेमोरी पर कभी भरोसा न करें। मेमोरी बदलती रहती है (drifts)। वर्जन नंबर वाला PDF नहीं बदलता।
ऑर्केस्ट्रेशन (Orchestration). ऐसे वर्कफ़्लो बनाएं जहाँ रास्ता स्पष्ट रूप से दिखाई दे। LangGraph जैसे टूल आपको स्पष्ट, ऑडिट करने योग्य (auditable) स्टेट मशीनों को परिभाषित करने की अनुमति देते हैं। एक निर्णय को परिभाषित चरणों से गुजरना चाहिए: एक्सट्रैक्ट (extract), वेरीफाई (verify), डिसीजन (decision), लॉग (log)। एजेंटों को एक खुले संवादात्मक लूप (conversational loop) में 'चैट' करते हुए निष्कर्ष तक न पहुँचने दें। यदि आप फ्लोचार्ट नहीं बना सकते, तो आप इसे नियामक (regulator) को नहीं समझा सकते।
टूल एक्सेस (Tool Access). एजेंटों को कोर बैंकिंग सिस्टम को कॉल करने की आवश्यकता होती है, लेकिन प्रत्येक एकीकरण (integration) विफलता का एक संभावित बिंदु है। एजेंट आपके लेजर (ledgers), CRM रिकॉर्ड और अनुपालन डेटाबेस (compliance databases) को कैसे प्रमाणित और क्वेरी करते हैं, इसे मानकीकृत करने के लिए Model Context Protocol का उपयोग करें। एकसमान इंटरफेस साइलेंट ब्रेकएज (silent breakage) की संभावना को कम करते हैं।
सत्यापन (Verification). मानवीय निर्णय के लिए एक निश्चित मार्ग (hard lane) सुरक्षित रखें। उच्च जोखिम वाले निर्णयों—जैसे बड़े वायर ट्रांसफर, क्रेडिट लिमिट ओवरराइड, SAR फाइलिंग—को किसी मानव समीक्षक या एक अलग मॉडल पर चलने वाले दूसरे सत्यापन एजेंट को भेजें। किनारे (edge) पर रेडंडेंसी (redundancy) केंद्र की रक्षा करती है।
सही चीज़ मापें
टीमों को प्रति-चरण सटीकता (per-step accuracy) के लिए पुरस्कृत करना बंद करें। एक ऐसा पाइपलाइन जहाँ प्रत्येक मॉड्यूल टेस्ट सेट पर 99 प्रतिशत का दावा करता है, वह तब भी पांच में से एक वास्तविक ग्राहक को विफल कर सकता है जब चरण आपस में क्रिया करते हैं। एंड-टू-एंड विश्वसनीयता (end-to-end reliability) मापना शुरू करें। सिंथेटिक विफलता मामलों (synthetic failure cases) को शामिल करें। हैंडऑफ (handoffs) का परीक्षण उसी तरह करें जैसे हमलावर जोड़ों (seams) का परीक्षण करते हैं।
2026 में AI के साथ वास्तव में जीत रहे बैंक वे नहीं हैं जो सबसे बड़े मॉडल किराए पर ले रहे हैं। वे वे हैं जो सबसे स्पष्ट प्रणालियों को एक साथ जोड़ रहे हैं। वे जानते हैं कि एक छोटा मॉडल जिसका आप ऑडिट कर सकते हैं, वह एक बड़े मॉडल से बेहतर है जिसे आप समझा नहीं सकते, और कि
