AWS en Anthropic hebben een self-hosted Claude Apps Gateway uitgerold op Amazon Web Services, terwijl Google Cloud een VS Code Workbench-extensie heeft toegevoegd die de editor direct koppelt aan zijn Jupyter notebooks. Een aparte benchmark van Stripe laat zien dat AI-agenten, ondanks deze vooruitgang, nog steeds struikelen wanneer het gaat om het valideren van de code die ze genereren.

Waarom de nieuwe controles belangrijk zijn

Bedrijven die zijn begonnen met het integreren van large language models (LLM's) zoals Claude in interne tools, worden nu geconfronteerd met een bekend probleem: het veilig houden van toegang, kosten en gegevens terwijl het gebruik wordt opgeschaald. De Claude Apps Gateway plaatst de control plane binnen het AWS-account van de klant, waardoor IT-teams één centraal punt hebben om identiteit, audit logs en uitgaven te beheren. Ontwikkelaars kunnen nu Claude-gestuurde Code- of Desktop-sessies opstarten zonder gegevens bloot te stellen aan een externe dienst.

De VS Code Workbench van Google pakt een ander wrijvingspunt aan. Data scientists en engineers schakelen vaak tussen een lokale IDE en cloud notebooks, waarbij ze code heen en weer kopiëren. De nieuwe extensie stelt een ontwikkelaar in staat om de kernel van een notebook op Google Cloud te openen, bestanden lokaal te bewerken en wijzigingen in realtime te zien synchroniseren. Remote uitvoering en debugging vinden plaats vanuit de vertrouwde VS Code UI, waardoor de stap van het "springen tussen tools" die experimenteren vertraagt, wordt geëlimineerd.

De benchmark die de discussie realistisch houdt

De recente AI Agent Benchmark van Stripe testte hoe goed huidige agenten omgaan met software-integraties. Agenten schrijven integratiecode goed, maar struikelen bij de validatie, waarbij ze vaak randgevallen en foutcontroles missen. De resultaten waren duidelijk: agenten presteerden sterk in de generatiefase, maar schoten tekort tijdens de validatie.

Wie wint, wie verliest

  • Bedrijven krijgen een strakkere governance over Claude-implementaties, wat het blootstellingsrisico vermindert.
  • Ontwikkelaars op Google Cloud kunnen werken zonder tussen tools te hoeven schakelen, door zware berekeningen op cloudmachines uit te voeren vanuit één enkele editor.

Aan de andere kant kunnen organisaties die deze tools adopteren zonder hun interne beleid bij te werken, nog steeds te maken krijgen met hiaten in de validatie, zoals de benchmark van Stripe aantoont. De tools vereenvoudigen de toegang, maar elimineren de noodzaak voor menselijk toezicht niet.

Waar we de komende tijd op moeten letten

De directe les voor teams die experimenteren met AI is simpel: gebruik de nieuwe controles om de beveiliging te versterken en workflows te stroomlijnen, maar houd een mens in de loop voor verificatie. Totdat agenten betrouwbaar hun eigen fouten kunnen detecteren, blijft de rol van de ontwikkelaar als reviewer onmisbaar.