AWS और Anthropic ने Amazon Web Services पर एक self-hosted Claude Apps Gateway पेश किया है, जबकि Google Cloud ने एक VS Code Workbench extension जोड़ा है जो एडिटर को सीधे इसके Jupyter notebooks से जोड़ता है। Stripe के एक अलग बेंचमार्क से पता चलता है कि इन प्रगतियों के बावजूद, AI agents अभी भी अपने द्वारा जनरेट किए गए कोड को वैलिडेट करने के मामले में लड़खड़ा जाते हैं।

नए कंट्रोल्स क्यों महत्वपूर्ण हैं

वे एंटरप्राइजेज जिन्होंने Claude जैसे large language models (LLMs) को अपने आंतरिक टूल्स में एम्बेड करना शुरू कर दिया है, उन्हें अब एक जानी-पहचानी समस्या का सामना करना पड़ रहा है: उपयोग को स्केल करते समय एक्सेस, लागत और डेटा को सुरक्षित रखना। Claude Apps Gateway कंट्रोल प्लेन को ग्राहक के AWS अकाउंट के भीतर रखता है, जिससे IT टीमों को आइडेंटिटी, ऑडिट लॉग और खर्च को मैनेज करने के लिए एक सिंगल पॉइंट मिलता है। डेवलपर्स अब डेटा को किसी बाहरी सेवा के सामने उजागर किए बिना Claude-powered Code या Desktop सेशन्स शुरू कर सकते हैं।

Google का VS Code Workbench एक अलग बाधा (friction point) को हल करता है। डेटा साइंटिस्ट और इंजीनियर्स अक्सर एक लोकल IDE और क्लाउड नोटबुक के बीच कोड को इधर-उधर कॉपी करते हुए स्विच करते रहते हैं। नया extension एक डेवलपर को Google Cloud पर नोटबुक का kernel खोलने, फाइलों को लोकल स्तर पर एडिट करने और बदलावों को रियल टाइम में सिंक होते हुए देखने की सुविधा देता है। रिमोट एक्जीक्यूशन और डिबगिंग परिचित VS Code UI से ही हो जाती है, जिससे "tool-hopping" का चरण समाप्त हो जाता है जो प्रयोगों की गति को धीमा कर देता है।

वह बेंचमार्क जो चर्चा को वास्तविकता के करीब रखता है

Stripe के हालिया AI Agent Benchmark ने यह परीक्षण किया कि वर्तमान agents सॉफ्टवेयर इंटीग्रेशन को कितनी अच्छी तरह संभालते हैं। Agents इंटीग्रेशन कोड तो अच्छी तरह लिखते हैं लेकिन वैलिडेशन के दौरान लड़खड़ा जाते हैं, और अक्सर edge cases और एरर चेक्स को मिस कर देते हैं। परिणाम स्पष्ट थे: agents ने जनरेशन फेज में शानदार प्रदर्शन किया लेकिन वैलिडेशन के दौरान वे विफल रहे।

किसे फायदा होगा, किसे नुकसान

  • Enterprises को Claude deployments पर बेहतर गवर्नेंस मिलती है, जिससे जोखिम कम होता है।
  • Developers Google Cloud पर बिना टूल्स के बीच स्विच किए काम कर सकते हैं, और एक ही एडिटर से क्लाउड मशीनों पर भारी कंप्यूटेशन चला सकते हैं।

दूसरी ओर, जो संगठन अपनी आंतरिक नीतियों को अपडेट किए बिना इन टूल्स को अपनाते हैं, उन्हें अभी भी वैलिडेशन में कमियां देखने को मिल सकती हैं, जैसा कि Stripe का बेंचमार्क दर्शाता है। ये टूल्स एक्सेस को सरल बनाते हैं लेकिन मानवीय निगरानी (human oversight) की आवश्यकता को समाप्त नहीं करते हैं।

आगे क्या देखने की जरूरत है

AI के साथ प्रयोग कर रही टीमों के लिए तत्काल सबक सरल है: सुरक्षा को मजबूत करने और वर्कफ़्लो को सुव्यवस्थित करने के लिए नए कंट्रोल्स का उपयोग करें, लेकिन वेरिफिकेशन के लिए 'human in the loop' (मानवीय हस्तक्षेप) बनाए रखें। जब तक agents भरोसेमंद तरीके से अपनी गलतियों को खुद नहीं पकड़ सकते, तब तक एक रिव्यूअर के रूप में डेवलपर की भूमिका अपरिहार्य बनी रहेगी।