AWS-ഉം Anthropic-ഉം Amazon Web Services-ൽ ഒരു self-hosted Claude Apps Gateway അവതരിപ്പിച്ചു, അതേസമയം Google Cloud അതിന്റെ Jupyter notebooks-മായി എഡിറ്ററിനെ നേരിട്ട് ബന്ധിപ്പിക്കുന്ന ഒരു VS Code Workbench extension കൂടി ചേർത്തു. Stripe-ൽ നിന്നുള്ള മറ്റൊരു ബെഞ്ച്മാർക്ക് സൂചിപ്പിക്കുന്നത്, ഈ പുരോഗതികൾക്കിടയിലും, തങ്ങൾ നിർമ്മിക്കുന്ന കോഡ് പരിശോധിക്കുന്നതിൽ (validating) AI ഏജന്റുകൾ ഇപ്പോഴും പാളുന്നു എന്നാണ്.
പുതിയ നിയന്ത്രണങ്ങൾ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
Claude പോലുള്ള Large Language Models (LLMs) ആഭ്യന്തര ടൂളുകളിൽ ഉൾപ്പെടുത്താൻ തുടങ്ങിയ സംരംഭങ്ങൾ (Enterprises) ഇപ്പോൾ ഒരു പരിചിതമായ പ്രശ്നം നേരിടുന്നു: ഉപയോഗം വർദ്ധിപ്പിക്കുമ്പോൾ തന്നെ ആക്സസ്, ചിലവ്, ഡാറ്റ എന്നിവ സുരക്ഷിതമായി നിലനിർത്തുക എന്നത്. Claude Apps Gateway കസ്റ്റമറുടെ AWS അക്കൗണ്ടിനുള്ളിൽ തന്നെ കൺട്രോൾ പ്ലേൻ (control plane) നൽകുന്നു, ഇത് ഐടി ടീമുകൾക്ക് ഐഡന്റിറ്റി, ഓഡിറ്റ് ലോഗുകൾ, ചിലവ് എന്നിവ നിയന്ത്രിക്കാൻ ഒരു ഏകീകൃത സംവിധാനം നൽകുന്നു. ഡാറ്റ ഒരു ബാഹ്യ സേവനത്തിലേക്ക് (external service) വെളിപ്പെടുത്താതെ തന്നെ ഡെവലപ്പർമാർക്ക് ഇപ്പോൾ Claude അധിഷ്ഠിത Code അല്ലെങ്കിൽ Desktop സെഷനുകൾ ആരംഭിക്കാവുന്നതാണ്.
Google-ന്റെ VS Code Workbench മറ്റൊരു തടസ്സത്തെയാണ് പരിഹരിക്കുന്നത്. ഡാറ്റാ സയന്റിസ്റ്റുകളും എഞ്ചിനീയർമാരും പലപ്പോഴും ഒരു ലോക്കൽ IDE-യും ക്ലൗഡ് നോട്ട്ബുക്കുകളും തമ്മിൽ മാറിമാറി ഉപയോഗിക്കുകയും കോഡുകൾ പരസ്പരം കോപ്പി ചെയ്യുകയും ചെയ്യുന്നു. പുതിയ എക്സ്റ്റൻഷൻ വഴി ഒരു ഡെവലപ്പർക്ക് Google Cloud-ൽ ഒരു നോട്ട്ബുക്കിന്റെ കേർണൽ (kernel) തുറക്കാനും, ഫയലുകൾ ലോക്കലായി എഡിറ്റ് ചെയ്യാനും, മാറ്റങ്ങൾ തത്സമയം (real time) സിങ്ക് ആകുന്നത് കാണാനും സാധിക്കും. പരിചിതമായ VS Code UI-ൽ നിന്ന് തന്നെ റിമോട്ട് എക്സിക്യൂഷനും (remote execution) ഡിബഗ്ഗിംഗും (debugging) സാധ്യമാകുന്നതോടെ, പരീക്ഷണങ്ങളെ സാവധാനത്തിലാക്കുന്ന "tool-hopping" ഘട്ടം ഒഴിവാകുന്നു.
വസ്തുതകൾ തുറന്നു കാട്ടുന്ന ബെഞ്ച്മാർക്ക്
സോഫ്റ്റ്വെയർ ഇന്റഗ്രേഷനുകൾ നിലവിലെ ഏജന്റുകൾ എത്രത്തോളം നന്നായി കൈകാര്യം ചെയ്യുന്നു എന്ന് Stripe-ന്റെ പുതിയ AI Agent Benchmark പരിശോധിച്ചു. ഏജന്റുകൾ ഇന്റഗ്രേഷൻ കോഡ് നന്നായി എഴുതുന്നുണ്ടെങ്കിലും, വാലിഡേഷൻ (validation) സമയത്ത് പാളുന്നു; പലപ്പോഴും എഡ്ജ് കേസുകളും (edge cases) എറർ ചെക്കുകളും അവ വിട്ടുപോകുന്നു. ഫലങ്ങൾ വ്യക്തമാണ്: ജനറേഷൻ ഘട്ടത്തിൽ ഏജന്റുകൾ മികച്ച പ്രകടനം കാഴ്ചവെച്ചുവെങ്കിലും വാലിഡേഷൻ സമയത്ത് അവർ പരാജയപ്പെട്ടു.
ആര് ജയിക്കുന്നു, ആര് തോൽക്കുന്നു
- സംരംഭങ്ങൾക്ക് (Enterprises) Claude വിന്യാസത്തിന്മേൽ (deployments) കൂടുതൽ കർശനമായ നിയന്ത്രണം ലഭിക്കുന്നു, ഇത് റിസ്ക് കുറയ്ക്കുന്നു.
- Google Cloud ഉപയോഗിക്കുന്ന ഡെവലപ്പർമാർക്ക് ടൂളുകൾ മാറിമാറി ഉപയോഗിക്കാതെ തന്നെ ജോലി ചെയ്യാൻ സാധിക്കുന്നു, ഒരു സിംഗിൾ എഡിറ്ററിൽ നിന്ന് തന്നെ ക്ലൗഡ് മെഷീനുകളിൽ കനത്ത കമ്പ്യൂട്ടേഷനുകൾ (heavy computations) നടത്താം.
മറുവശത്ത്, ആഭ്യന്തര നയങ്ങൾ (internal policies) പരിഷ്കരിക്കാതെ ഈ ടൂളുകൾ സ്വീകരിക്കുന്ന സ്ഥാപനങ്ങൾക്ക് വാലിഡേഷനിൽ ഇപ്പോഴും പോരായ്മകൾ നേരിടേണ്ടി വന്നേക്കാം, Stripe-ന്റെ ബെഞ്ച്മാർക്ക് ഇത് തെളിയിക്കുന്നു. ഈ ടൂളുകൾ ആക്സസ് എളുപ്പമാക്കുന്നുണ്ടെങ്കിലും മനുഷ്യന്റെ മേൽനോട്ടം (human oversight) ഒഴിവാക്കുന്നില്ല.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
AI പരീക്ഷണങ്ങളിൽ ഏർപ്പെട്ടിരിക്കുന്ന ടീമുകൾക്കുള്ള ഉടനടിയുള്ള പാഠം ലളിതമാണ്: സുരക്ഷ ശക്തമാക്കാനും വർക്ക്ഫ്ലോകൾ ലഘൂകരിക്കാനും പുതിയ നിയന്ത്രണങ്ങൾ ഉപയോഗിക്കുക, എന്നാൽ പരിശോധനയ്ക്കായി (verification) ഒരു മനുഷ്യനെ കൂടെ നിർത്തുക. ഏജന്റുകൾക്ക് സ്വന്തം തെറ്റുകൾ വിശ്വസനീയമായി കണ്ടെത്താൻ കഴിയുന്നതുവരെ, ഒരു റിവ്യൂവർ എന്ന നിലയിലുള്ള ഡെവലപ്പറുടെ പങ്ക് ഒഴിച്ചുകൂടാനാവാത്തതായി തുടരും.
