AWS आणि Anthropic ने Amazon Web Services वर सेल्फ-होस्टेड Claude Apps Gateway लाँच केले आहे, तर Google Cloud ने VS Code Workbench एक्स्टेंशन जोडले आहे जे एडिटरला थेट त्याच्या Jupyter notebooks शी जोडते. Stripe च्या एका वेगळ्या बेंचमार्कवरून असे दिसून येते की, या प्रगतीनंतरही, AI एजंट्सनी स्वतः तयार केलेला कोड प्रमाणित (validate) करताना अजूनही अडचणी येतात.

नवीन नियंत्रणे का महत्त्वाची आहेत

ज्या उद्योगांनी (Enterprises) Claude सारखे लार्ज लँग्वेज मॉडेल्स (LLMs) त्यांच्या अंतर्गत साधनांमध्ये समाविष्ट करण्यास सुरुवात केली आहे, त्यांना आता एका परिचित समस्येचा सामना करावा लागत आहे: वापर वाढवताना प्रवेश (access), खर्च आणि डेटा सुरक्षित ठेवणे. Claude Apps Gateway कंट्रोल प्लेन ग्राहकाच्या AWS अकाउंटमध्ये ठेवते, ज्यामुळे IT टीमला ओळख (identity), ऑडिट लॉग्स आणि खर्च व्यवस्थापित करण्यासाठी एकच केंद्र मिळते. डेव्हलपर्स आता डेटा बाह्य सेवेला उघडे न ठेवता Claude-powered Code किंवा Desktop सेशन्स सुरू करू शकतात.

Google चे VS Code Workbench एका वेगळ्या अडथळ्यावर उपाय शोधते. डेटा सायंटिस्ट आणि इंजिनिअर्सना अनेकदा स्थानिक IDE आणि क्लाउड नोटबुक यांच्यामध्ये कोड कॉपी-पेस्ट करण्यासाठी सतत स्विच करावे लागते. हे नवीन एक्स्टेंशन डेव्हलपरला Google Cloud वर नोटबुकचे कर्नल उघडण्यास, स्थानिक पातळीवर फाइल्स संपादित करण्यास आणि बदल रिअल-टाइममध्ये सिंक होताना पाहण्यास मदत करते. रिमोट एक्झिक्यूशन आणि डीबगिंग हे परिचित VS Code UI मधूनच होते, ज्यामुळे "टूल-हॉपिंग" (एका टूलमधून दुसऱ्या टूलमध्ये जाणे) चा अडथळा दूर होतो आणि प्रयोगांचा वेग वाढतो.

संवाद वास्तववादी ठेवणारा बेंचमार्क

Stripe च्या अलीकडील AI Agent Benchmark ने सध्याचे एजंट्स सॉफ्टवेअर इंटिग्रेशन किती चांगल्या प्रकारे हाताळतात याची चाचणी घेतली. एजंट्स इंटिग्रेशन कोड चांगल्या प्रकारे लिहितात परंतु व्हॅलिडेशनच्या वेळी अडखळतात, अनेकदा edge cases आणि एरर चेक सुटतात. निकाल स्पष्ट होते: एजंट्सने जनरेशन फेजमध्ये उत्तम कामगिरी केली, परंतु व्हॅलिडेशन दरम्यान ते अपयशी ठरले.

कोणाचा फायदा, कोणाचे नुकसान

  • Enterprises ला Claude च्या उपयोजनांवर (deployments) अधिक कडक नियंत्रण मिळते, ज्यामुळे जोखमीचा धोका कमी होतो.
  • Developers Google Cloud वर साधनांमध्ये स्विच न करता काम करू शकतात आणि एकाच एडिटरमधून क्लाउड मशीन्सवर जड गणना (heavy computations) करू शकतात.

दुसरीकडे, ज्या संस्था अंतर्गत धोरणे अपडेट न करता ही साधने स्वीकारतात, त्यांना व्हॅलिडेशनमध्ये त्रुटींचा सामना करावा लागू शकतो, जसे की Stripe च्या बेंचमार्कवरून दिसून येते. ही साधने प्रवेश सुलभ करतात परंतु मानवी देखरेखीची (human oversight) गरज संपवत नाहीत.

पुढे काय पाहावे

AI सोबत प्रयोग करणाऱ्या टीम्ससाठी तात्काळ धडा साधा आहे: सुरक्षा मजबूत करण्यासाठी आणि वर्कफ्लो सुव्यवस्थित करण्यासाठी नवीन नियंत्रणांचा वापर करा, परंतु पडताळणीसाठी मानवी हस्तक्षेप (human in the loop) कायम ठेवा. जोपर्यंत एजंट्स स्वतःच्या चुका विश्वसनीयपणे शोधू शकत नाहीत, तोपर्यंत रिव्ह्यूअर (reviewer) म्हणून डेव्हलपरची भूमिका अपरिहार्य राहील.