AWS மற்றும் Anthropic ஆகியவை Amazon Web Services-இல் ஒரு self-hosted Claude Apps Gateway-ஐ அறிமுகப்படுத்தியுள்ளன, அதே நேரத்தில் Google Cloud தனது Jupyter notebooks-உடன் எடிட்டரை நேரடியாக இணைக்கும் ஒரு VS Code Workbench extension-ஐ சேர்த்துள்ளது. Stripe-இன் தனிப்பட்ட ஒரு benchmark ஆய்வின்படி, இந்த முன்னேற்றங்கள் இருந்தபோதிலும், AI agents தாங்கள் உருவாக்கும் குறியீடுகளை (code) சரிபார்க்கும் (validating) போது இன்னும் தடுமாறுகின்றன.

புதிய கட்டுப்பாடுகள் ஏன் முக்கியம்

Claude போன்ற பெரிய மொழி மாதிரிகளை (LLMs) தங்கள் உள் கருவிகளில் (internal tools) இணைக்கத் தொடங்கிய நிறுவனங்கள் இப்போது ஒரு தெரிந்த சிக்கலை எதிர்கொள்கின்றன: பயன்பாட்டை அதிகரிக்கும் போது அணுகல் (access), செலவுகள் மற்றும் தரவை (data) பாதுகாப்பாக வைத்திருப்பது. Claude Apps Gateway, control plane-ஐ வாடிக்கையாளரின் AWS கணக்கிற்குள்ளேயே வைப்பதன் மூலம், IT குழுக்களுக்கு அடையாளம் (identity), audit logs மற்றும் செலவுகளை நிர்வகிக்க ஒரு ஒற்றை புள்ளியை வழங்குகிறது. டெவலப்பர்கள் இப்போது தரவை வெளிப்புறச் சேவைக்கு வெளிப்படுத்தாமல், Claude மூலம் இயங்கும் Code அல்லது Desktop sessions-களைத் தொடங்க முடியும்.

Google-இன் VS Code Workbench ஒரு மாறுபட்ட சிக்கலைத் தீர்க்கிறது. தரவு விஞ்ஞானிகளும் (Data scientists) பொறியாளர்களும் பெரும்பாலும் ஒரு local IDE மற்றும் cloud notebooks ஆகியவற்றிற்கு இடையே மாறி மாறிச் செயல்படும்போது, குறியீடுகளை (code) முன்னும் பின்னும் நகலெடுக்க வேண்டியுள்ளது. புதிய extension மூலம், ஒரு டெவலப்பர் Google Cloud-இல் notebook kernel-ஐத் திறந்து, கோப்புகளை (files) உள்ளூரிலேயே (locally) திருத்தலாம் மற்றும் மாற்றங்கள் நிகழ்நேரத்தில் (real time) ஒத்திசைவதைக் காணலாம். வழக்கமான VS Code UI மூலமே remote execution மற்றும் debugging செய்ய முடியும் என்பதால், சோதனைகளைத் தாமதப்படுத்தும் "tool-hopping" என்ற படிநிலை நீக்கப்படுகிறது.

உரையாடலை உண்மையானதாக வைத்திருக்கும் benchmark

Stripe-இன் சமீபத்திய AI Agent Benchmark, தற்போதைய agents மென்பொருள் ஒருங்கிணைப்புகளை (software integrations) எவ்வளவு சிறப்பாகக் கையாளுகின்றன என்பதைச் சோதித்தது. Agents ஒருங்கிணைப்பு குறியீடுகளை (integration code) சிறப்பாக எழுதுகின்றன, ஆனால் சரிபார்ப்பதில் (validation) தடுமாறுகின்றன; பெரும்பாலும் edge cases மற்றும் பிழைச் சரிபார்ப்புகளை (error checks) விட்டுவிடுகின்றன. முடிவுகள் தெளிவாக இருந்தன: agents உருவாக்கும் நிலையில் (generation phase) வலுவாகச் செயல்பட்டன, ஆனால் சரிபார்ப்பின் போது (validation) தடுமாறின.

யார் வெற்றி பெறுகிறார்கள், யார் பாதிக்கப்படுகிறார்கள்

  • நிறுவனங்கள் (Enterprises) Claude பயன்பாடுகள் மீது கடுமையான நிர்வாகத்தைக் (governance) பெறுகின்றன, இது பாதிப்பு அபாயத்தைக் (exposure risk) குறைக்கிறது.
  • Google Cloud-இல் உள்ள டெவலப்பர்கள் கருவிகளுக்கு இடையே மாறாமல் பணியாற்ற முடியும், ஒரே எடிட்டரிலிருந்து cloud இயந்திரங்களில் கடினமான கணக்கீடுகளை (heavy computations) இயக்க முடியும்.

மறுபுறம், Stripe-இன் benchmark காட்டுவது போல, உள் கொள்கைகளை (internal policies) புதுப்பிக்காமல் இந்தத் கருவிகளைப் பயன்படுத்தும் நிறுவனங்கள், சரிபார்ப்பில் (validation) இன்னும் இடைவெளிகளைச் சந்திக்கக்கூடும். இந்தக் கருவிகள் அணுகலை எளிதாக்குகின்றன, ஆனால் மனித மேற்பார்வையின் (human oversight) தேவையை நீக்கவில்லை.

அடுத்து கவனிக்க வேண்டியவை

AI-இல் சோதனை செய்யும் குழுக்களுக்கான உடனடி பாடம் எளிமையானது: பாதுகாப்பை வலுப்படுத்தவும் மற்றும் பணிப்பாய்வுகளை (workflows) சீரமைக்கவும் புதிய கட்டுப்பாடுகளைப் பயன்படுத்துங்கள், ஆனால் சரிபார்ப்பிற்கு ஒரு மனிதனை (human in the loop) எப்போதும் ஈடுபடுத்துங்கள். Agents தங்களின் தவறுகளைத் தாங்களாகவே நம்பகமான முறையில் கண்டறியும் வரை, ஒரு ஆய்வாளராக (reviewer) டெவலப்பரின் பங்கு இன்றியமையாததாகவே இருக்கும்.