Çoğu bankacılık yapay zeka projesi, model kalitesiyle hiç ilgisi olmayan bir nedenden dolayı başarısız oluyor. Liderlik ekipleri, sessiz bir tehdit inşa ettikleri her şeyi aşındırırken aylarını parametre sayılarını ve benchmark skorlarını karşılaştırmakla harcıyor. Model boyutunu bir zafer koşulu olarak görüyorlar. Ancak öyle değil. Finans dünyasına hakim olan düzenlemeye tabi, çok adımlı iş akışlarında doğruluk katlanarak artmaz; aksine azalır. Tek adımlı skora odaklanırsanız, sistem genelindeki başarısızlık karşısında hazırlıksız yakalanırsınız.
Asıl Sorun Model Boyutu Değil
İşte risk yöneticilerinin uykusunu kaçıran o matematik. Altı farklı aşamadan oluşan bir iş akışı hayal edin: veri çıkarma, doğrulama, risk puanlama, uyumluluk kontrolü, doküman oluşturma ve son onay. Her aşama tek başına mükemmel çalışıyor ve %97 doğruluk oranına ulaşıyor. İçgüdüsel olarak bunu kutlamak istersiniz. Ancak olasılık sezgilere uymaz. Bu adımları birbirine bağladığınızda, uçtan uca güvenilirlik yaklaşık %83'e düşer.
Yerel mükemmellik ile küresel başarısızlık arasındaki bu boşluk, Yapay Zeka Koordinasyon Boşluğu'dur (AI Coordination Gap). Bu, ajanlar, yazılım araçları ve insan incelemeciler arasındaki geçişlerde kaybettiğiniz sürtünmedir. Düzenleyici kurumlar şimdiden tam olarak bu güvenlik açığının peşinde. Mühendislik ekibiniz durum analizi (post-mortem) çalışmasını bitirmeden bunu fark edeceklerdir.
2026 yılına gelindiğinde tartışma eksen değiştirmiş olacak. Soru artık hangi modelin araştırma liderlik tablolarında zirvede olduğu değil; bütçe disiplini, veri egemenliği ve güncelleme kontrolü üzerine olacak. Kendi altyapınızın içine hapsedebileceğiniz özel bir Küçük Dil Modeli (SLM) ile token başına kiraladığınız hazır bir Büyük Dil Modeli (LLM) arasında bir seçim yapacaksınız.
SLM vs LLM: 2026'da Aslında Ne Değişiyor?
GPT-4o, Claude ve benzerleri gibi hazır öncü modeller; açık uçlu muhakeme ve düşük hacimli analitik görevler için rakipsiz kalmaya devam ediyor. Satır aralarını okuyabiliyorlar, nüansları kavrayabiliyorlar. Ancak bu kolaylığın bir bedeli var. Model ağırlıklarına sahip değilsiniz. Yayın takvimini kontrol edemiyorsunuz. Tedarikçiden gelen sessiz bir hafta sonu güncellemesi, uygulamanızın borç/gelir eşiklerini yorumlama veya şüpheli işlemleri işaretleme biçimini değiştirebilir ve tam olarak neyin değiştiğine dair bir kaydınız olmayabilir. Her kararın bir denetim izi gerektirdiği bir sektörde, bu kapalılık oldukça maliyetlidir.
Llama veya Mistral gibi açık ağırlıklı modeller üzerine inşa edilen özel SLM'ler denklemi tersine çeviriyor. Bunlar; ipotek PDF'lerinden alan çıkarma, KYC dokümanlarını sınıflandırma veya işlem notlarını ayrıştırma gibi zorlu ve yüksek hacimli işler için özel olarak üretilmiştir. Bunları kendiniz barındırdığınız için bir versiyonu dondurabilir, farklılık testleri (differential testing) yapabilir ve bir denetçiye Mart ayındaki modelin Haziran ayındaki modelle tamamen aynı davrandığını kanıtlayabilirsiniz. Ayrıca, bulut tabanlı kuzenlerinden token başına yaklaşık on ila otuz kat daha düşük maliyetle çalışarak son derece ekonomiktirler. Buradaki ödün, daha dar bir yetenek kapasitesidir. Bir SLM, piyasa trendleri üzerine felsefe yapmayacaktır. Ancak, mülkiyet altındaki verilerinizi güvenlik duvarınızın dışına çıkarmadan saatte on bin faturayı damgalayabilecektir.
Heterojen Yönlendirme: %80/20 Ayrımı
Öne geçen bankalar, bunu bir "ya o ya bu" tercihi olarak görmeyi bıraktılar. Mimari yapıları heterojendir. Ucuz ve ince ayar yapılmış (fine-tuned) bir SLM; doküman çıkarma, varlık etiketleme veya rutin uygunluk kontrolleri gibi öngörülebilir ve yapılandırılmış işlerin ilk aşamasını üstlenerek toplam hacmin yaklaşık yüzde seksenini eritir. Geriye kalan yüzde yirmi ise; analojik muhakeme veya karmaşık politika yorumlama gerektiren uç durumlar (edge cases) olarak bir öncü LLM'e aktarılır.
Bu teorik bir durum değil. Bir ipotek hizmet sağlayıcısı, maaş bordrolarından gelir rakamlarını çekmesi için bir SLM kullanabilir, ardından yalnızca belirsiz başvuruları, birden fazla istihdam türünü değişen federal kılavuzlarla çapraz referanslayan daha büyük bir modele iletebilir. Yetenekten ödün vermeden bulut harcamalarınızı kısarsınız.
Boşluğu Kapatmak İçin Beş Katmanlı Bir Çerçeve
Koordinasyon Boşluğunu kapatmak, akıllı yönlendirmeden daha fazlasını gerektirir. Açık bir teknoloji yığınına (stack) ihtiyaç duyar. İşte ekiplerin şu an uygulayabileceği beş katmanlı bir çerçeve:
Model Seçimi. Çıkarımı (inference) bir triyaj hemşiresi gibi ele alın. Görevleri hacimlerine ve hassasiyetlerine göre yönlendirin. Yüksek frekanslı, düşük riskli operasyonlar SLM'nize gider. Yargı, belirsizlik veya müşteri şikayeti çözümü içeren vakalar LLM'e gider. Yönlendirme kurallarını bir istem (prompt) içinde değil, kod içinde yazın.
Grounding. Every answer that touches a customer must point back to a source document. Use retrieval-augmented generation to anchor outputs in your actual policy manuals, rate sheets, and regulatory notices. Never trust a model’s parametric memory for current interest rates or fee schedules. Memory drifts. A PDF with a version number does not.
Orchestration. Build workflows where the path is visible. Tools like LangGraph let you define explicit, auditable state machines. A decision should move through defined stages: extract, verify, decision, log. Do not let agents "chat" their way to a conclusion in an open conversational loop. If you cannot draw the flowchart, you cannot explain it to a regulator.
Tool Access. Agents need to call core banking systems, but every integration is a potential failure point. Use the Model Context Protocol to standardize how agents authenticate and query your ledgers, CRM records, and compliance databases. Uniform interfaces reduce the surface area for silent breakage.
Verification. Reserve a hard lane for human judgment. Route high-risk decisions—large wire transfers, credit limit overrides, SAR filings—to a human reviewer or to a second verification agent running on an isolated model. Redundancy at the edge protects the center.
Measure the Right Thing
Stop rewarding teams for per-step accuracy. A pipeline where each module claims 99 percent on a test set can still fail one in five real customers when the steps interact. Start measuring end-to-end reliability. Inject synthetic failure cases. Test handoffs the way attackers test seams.
The banks actually winning with AI in 2026 are not the ones renting the biggest models. They are the ones stitching together the clearest systems. They know that a small model you can audit beats a large model you cannot explain, and that
