AWS dan Anthropic meluncurkan Claude Apps Gateway yang dapat di-host sendiri di Amazon Web Services, sementara Google Cloud menambahkan ekstensi VS Code Workbench yang menghubungkan editor secara langsung ke Jupyter notebooks miliknya. Sebuah tolok ukur (benchmark) terpisah dari Stripe menunjukkan bahwa, terlepas dari kemajuan ini, agen AI masih sering kesulitan saat melakukan validasi kode yang mereka hasilkan.

Mengapa kontrol baru ini penting

Perusahaan yang telah mulai menyematkan large language models (LLM) seperti Claude ke dalam alat internal kini menghadapi masalah yang umum: menjaga keamanan akses, biaya, dan data sambil meningkatkan skala penggunaan. Claude Apps Gateway menempatkan control plane di dalam akun AWS pelanggan, memberikan tim IT satu titik tunggal untuk mengelola identitas, log audit, dan pengeluaran. Pengembang kini dapat menjalankan sesi Code atau Desktop berbasis Claude tanpa mengekspos data ke layanan eksternal.

VS Code Workbench milik Google mengatasi titik hambatan yang berbeda. Ilmuwan data dan insinyur sering kali berpindah-pindah antara IDE lokal dan notebook cloud, menyalin kode bolak-balik. Ekstensi baru ini memungkinkan pengembang membuka kernel notebook di Google Cloud, mengedit file secara lokal, dan melihat perubahan tersinkronisasi secara real-time. Eksekusi jarak jauh dan debugging dilakukan dari UI VS Code yang sudah dikenal, menghapus langkah "berpindah-pindah alat" yang memperlambat eksperimentasi.

Tolok ukur yang menjaga diskusi tetap objektif

AI Agent Benchmark terbaru dari Stripe menguji seberapa baik agen saat ini menangani integrasi perangkat lunak. Agen menulis kode integrasi dengan baik tetapi kesulitan pada validasi, sering kali melewatkan edge cases dan pemeriksaan kesalahan. Hasilnya jelas: agen berkinerja kuat pada fase pembuatan (generation), tetapi gagal selama validasi.

Siapa yang menang, siapa yang kalah

  • Perusahaan mendapatkan tata kelola yang lebih ketat atas penerapan Claude, sehingga mengurangi risiko paparan data.
  • Pengembang di Google Cloud dapat bekerja tanpa harus berpindah-pindah alat, menjalankan komputasi berat pada mesin cloud dari satu editor tunggal.

Di sisi lain, organisasi yang mengadopsi alat-alat ini tanpa memperbarui kebijakan internal mungkin masih menghadapi celah dalam validasi, sebagaimana ditunjukkan oleh benchmark Stripe. Alat-alat tersebut menyederhanakan akses tetapi tidak menghilangkan kebutuhan akan pengawasan manusia.

Apa yang perlu diperhatikan selanjutnya

Pelajaran langsung bagi tim yang bereksperimen dengan AI sangatlah sederhana: gunakan kontrol baru untuk memperketat keamanan dan merampingkan alur kerja, tetapi tetap libatkan manusia (human in the loop) untuk verifikasi. Sampai agen dapat menangkap kesalahannya sendiri secara andal, peran pengembang sebagai peninjau tetap tidak tergantikan.