AWS و Anthropic یک Claude Apps Gateway با قابلیت میزبانی شخصی (self-hosted) را در Amazon Web Services عرضه کردند، در حالی که Google Cloud یک افزونه VS Code Workbench اضافه کرد که ویرایشگر را مستقیماً به Jupyter notebooks خود متصل می‌کند. یک بنچمارک مجزا از Stripe نشان می‌دهد که با وجود این پیشرفت‌ها، عامل‌های هوش مصنوعی (AI agents) همچنان در زمینه اعتبارسنجی کدی که تولید می‌کنند، دچار مشکل می‌شوند.

چرا کنترل‌های جدید اهمیت دارند

شرکت‌هایی که شروع به ادغام مدل‌های زبانی بزرگ (LLMs) مانند Claude در ابزارهای داخلی خود کرده‌اند، اکنون با مشکلی آشنا روبرو هستند: حفظ امنیت دسترسی، هزینه‌ها و داده‌ها در حین افزایش مقیاس استفاده. Claude Apps Gateway لایه کنترل (control plane) را در حساب AWS مشتری قرار می‌دهد و به تیم‌های IT یک نقطه واحد برای مدیریت هویت، گزارش‌های حسابرسی (audit logs) و هزینه‌ها ارائه می‌دهد. اکنون توسعه‌دهندگان می‌توانند جلسات Code یا Desktop مبتنی بر Claude را بدون قرار دادن داده‌ها در معرض یک سرویس خارجی راه‌اندازی کنند.

VS Code Workbench گوگل به نقطه اصطکاک متفاوتی می‌پردازد. دانشمندان داده و مهندسان اغلب بین یک IDE محلی و نوت‌بوک‌های ابری جابه‌جا می‌شوند و کدها را مدام کپی می‌کنند. این افزونه جدید به توسعه‌دهنده اجازه می‌دهد هسته (kernel) یک نوت‌بوک را در Google Cloud باز کند، فایل‌ها را به صورت محلی ویرایش کند و همگام‌سازی تغییرات را به صورت آنی مشاهده کند. اجرای از راه دور و عیب‌یابی (debugging) از طریق رابط کاربری آشنای VS Code انجام می‌شود و مرحله «جابه‌جایی بین ابزارها» (tool-hopping) را که سرعت آزمایش‌ها را کاهش می‌دهد، از بین می‌برد.

بنچمارکی که بحث را واقع‌بینانه نگه می‌دارد

بنچمارک اخیر AI Agent از Stripe، میزان توانایی عامل‌های فعلی در مدیریت یکپارچه‌سازی‌های نرم‌افزاری را آزمایش کرد. عامل‌ها کدهای یکپارچه‌سازی را به خوبی می‌نویسند، اما در مرحله اعتبارسنجی دچار مشکل می‌شوند و اغلب موارد خاص (edge cases) و بررسی‌های خطا را نادیده می‌گیرند. نتایج روشن بود: عامل‌ها در مرحله تولید عملکرد قدرتمندی داشتند، اما در طول مرحله اعتبارسنجی دچار لغزش شدند.

چه کسی برنده و چه کسی بازنده است

  • شرکت‌ها کنترل دقیق‌تری بر استقرار Claude به دست می‌آورند که ریسک قرارگیری در معرض خطر را کاهش می‌دهد.
  • توسعه‌دهندگان در Google Cloud می‌توانند بدون جابه‌جایی بین ابزارها کار کنند و محاسبات سنگین را از طریق یک ویرایشگر واحد روی ماشین‌های ابری اجرا کنند.

از سوی دیگر، سازمان‌هایی که این ابزارها را بدون به‌روزرسانی سیاست‌های داخلی خود به کار می‌گیرند، همان‌طور که بنچمارک Stripe نشان می‌دهد، ممکن است همچنان با شکاف‌هایی در اعتبارسنجی روبرو شوند. این ابزارها دسترسی را ساده می‌کنند اما نیاز به نظارت انسانی را از بین نمی‌برند.

آنچه باید در آینده زیر نظر داشت

درس فوری برای تیم‌هایی که در حال آزمایش با هوش مصنوعی هستند ساده است: از کنترل‌های جدید برای تقویت امنیت و ساده‌سازی جریان‌های کاری استفاده کنید، اما برای تأیید نهایی، یک انسان را در چرخه (human in the loop) نگه دارید. تا زمانی که عامل‌ها نتوانند با اطمینان اشتباهات خود را شناسایی کنند، نقش توسعه‌دهنده به عنوان بازبین (reviewer) همچنان ضروری و غیرقابل جایگزین است.