در نشست بوگوتا، AWS از Bedrock AgentCore، Fault Injection Service، Zonal Shift و مجموعه‌ای از دستورالعمل‌های امنیتی پساکوانتومی رونمایی کرد.

چرا عامل‌های هوش مصنوعی اکنون به یک بلوک سازنده اصلی تبدیل شده‌اند

Amazon Quick Desktop که در این رویداد نمایش داده شد، به‌صورت محلی اجرا می‌شود، محیط حرفه‌ای کاربر را پیمایش (crawl) می‌کند و یک گراف دانش از اسناد، مخاطبین و جریان‌های کاری مرتبط می‌سازد. این رابط کاربری (front-end)، نشان‌دهنده تلاش AWS برای تبدیل عامل‌ها به نقطه ادغام پیش‌فرض برای بارهای کاری ابری است.

Bedrock AgentCore پلتفرمی است که AWS برای مهار اکوسیستم رو به رشد عامل‌ها معرفی کرده است. این پلتفرم سه عملکرد را تحت مفهوم «Harness» تجمیع می‌کند:

  • Orchestration – تعریف نحوه تعامل چندین عامل با یکدیگر و با سرویس‌های پایین‌دستی.
  • Observability – جمع‌آوری معیارها (metrics)، لاگ‌ها و ردپاها (traces) تا اپراتورها بتوانند ببینند کدام عامل هر درخواست را مدیریت می‌کند.
  • Control limits – تعیین سهمیه‌ها و حفاظ‌های امنیتی که از اجرای کنترل‌نشده یا نشت داده جلوگیری می‌کنند.

توسعه‌دهندگان از این سرویس استفاده می‌کنند تا بدون نیاز به ساخت زیرساخت‌های اولیه (plumbing) از صفر، عامل‌های تخصصی ایجاد کنند. AWS با ارائه یک API استاندارد برای این سه عملکرد، می‌خواهد توسعه عامل‌ها به جای یک آزمایش محدود، به یک الگوی تکرارپذیر تبدیل شود.

تاب‌آوری، فراتر از «فقط روشن نگه داشتن چراغ‌ها»

وعده‌های پایداری بالا (High-availability) از درصدهای ساده‌ی زمان بالا بودن (uptime) به بودجه‌های خطای قابل اندازه‌گیری که توسط قابلیت مشاهده (observability) در لحظه پشتیبانی می‌شوند، تغییر یافته است. در این نشست، Yuno — یک ارائه‌دهنده منطقه‌ای SaaS — نشان داد که چگونه با ترکیب استقرار‌های کاناری (canary deployments) و مهندسی هرج‌ومرج (chaos engineering)، یک SLA معادل ۹۹.۹۵٪ را حفظ می‌کند.

دو ابزار جدید توجه‌ها را به خود جلب کردند:

  • Fault Injection Service – به تیم‌ها اجازه می‌دهد تا تأخیر (latency)، خطا یا خرابی گره‌ها (node failures) را در یک محیط زنده تزریق کنند تا منطق نظارتی و اصلاحی را پیش از وقوع یک قطعی واقعی، بررسی کنند.
  • Zonal Shift – یک ابزار پایه برای مسیریابی ترافیک که درخواست‌های ورودی را از یک Availability Zone در حال خرابی به مناطق سالم منتقل می‌کند، بدون اینکه نیازی به تغییر در کد اپلیکیشن باشد.

AWS یک چک‌لیست کاهش اثر (mitigation) را به صورت جزء به جزء بررسی کرد:

  • Amazon Aurora – فعال‌سازی قابلیت انتقال خطا (failover) منطقه‌ای با استفاده از Aurora Global Database.
  • Amazon MSK – استفاده از MSK Replicator برای همگام‌سازی topic offsets در میان خوشه‌ها (clusters).
  • Load balancers and EKS – اعمال Zonal Shift روی Application Load Balancers و خوشه‌های Amazon Elastic Kubernetes Service.

برای مهاجرت‌هایی که نمی‌توانند زمان از کار افتادگی (downtime) را تحمل کنند، در این نشست یک گردش کار Blue/Green پیشنهاد شد: ایجاد یک خوشه موازی، هدایت ۱٪ از ترافیک از طریق نسخه‌های مدیریت‌شده توسط ArgoCD، و انتقال کامل بار کاری تنها پس از تأیید نهایی. این رویکرد بر همان داده‌های observability تکیه دارد که محاسبات بودجه خطا را تغذیه می‌کند.

آماده‌سازی برای حملات در سطح کوانتومی

AWS به شرکت‌کنندگان یادآوری کرد که کامپیوترهای کوانتومی، اگرچه هنوز در مرحله آزمایشی هستند، اما در نهایت الگوریتم‌های کلید عمومی پرکاربرد مانند RSA و ECC را خواهند شکست. Amazon Braket اکنون دسترسی به پردازنده‌های کوانتومی واقعی و شبیه‌سازهای با دقت بالا را فراهم می‌کند و به تیم‌های امنیتی یک محیط آزمایشی (sandbox) برای تست اصول اولیه رمزنگاری (cryptographic primitives) می‌دهد.

بخش امنیت از سازمان‌ها خواست تا از همین حالا نقشه راه مهاجرت به رمزنگاری پساکوانتومی (PQC) را آغاز کنند:

  1. Inventory (موجودی‌برداری) از تمام دارایی‌های رمزنگاری — گواهی‌های TLS، کلیدهای VPN، ماژول‌های رمزنگاری داده‌های ذخیره‌شده (data-at-rest).
  2. اعمال کنترل‌های ترکیبی (hybrid controls) — اجرای یک الگوریتم کلاسیک به صورت موازی با یک الگوریتم کاندیدای PQC تا زمانی که الگوریتم دوم ایمنی خود را ثابت کند.
  3. برنامه‌ریزی برای شتاب‌دهی سخت‌افزاری — زیر نظر گرفتن تراشه‌های نوظهور PQC که می‌توانند از طریق AWS Nitro یا نمونه‌های سفارشی FPGA ادغام شوند.

این راهنما از تعیین اجباری هیچ الگوریتم خاصی خودداری کرده است.

مرزهای امنیتی بیانی (Declarative) در عمل

امنیت سنتی ابری بر هویت (چه کسی می‌تواند وارد شود) و شبکه (کدام زیرشبکه‌ها می‌توانند با هم ارتباط برقرار کنند) تمرکز داشته است. AWS از استقرار Control Tower در Bancolombia به عنوان الگویی برای یک مدل «مرزی» چهار لایه استفاده کرد:

  • Identity perimeter – سیاست‌های کنترل سرویس (SCPs) که محدود می‌کنند نقش‌های IAM چه اقداماتی را می‌توانند در سراسر سازمان انجام دهند.
  • Resource perimeter – سیاست‌های کنترل منابع (RCPs) که سرویس‌های خاص را برچسب‌گذاری و محافظت می‌کنند، مانند محدود کردن ایجاد S3 bucket به مناطق تأیید شده.
  • Network perimeter – نقاط پایانی VPC و VPC Lattice جدیدتر، ترافیک را در شبکه اصلی (backbone) AWS نگه می‌دارند و از اینترنت عمومی اجتناب می‌کنند.
  • Declarative policy enforcement – اجرای سیاست‌های بیانی؛ برای مثال، CloudFormation Hooks و توابع Lambda به‌طور خودکار انحراف (drift) را اصلاح می‌کنند، مثلاً با اعمال مجدد تنظیمات رمزنگاری زمانی که یک bucket بدون رمزنگاری سمت سرور ایجاد می‌شود.

ایده این است که هر تصمیم امنیتی کدگذاری شود تا انحرافات بدون نیاز به چرخه دستی تیکت‌ها، شناسایی و اصلاح شوند.

هوش مصنوعی در مقیاس واقعی: ADRES Colombia

یک نمونه عینی از پارادایم عامل (agent paradigm) در ADRES، یک شرکت پردازش مطالبات سلامت در کلمبیا، مشاهده می‌شود. پشته (stack) آن‌ها Amazon Nova (یک سرویس استنتاج مدیریت‌شده) را با SageMaker ترکیب می‌کند که از طریق یک معماری چندعاملی (multi-agent architecture) سازماندهی شده است:

  • عامل‌های متخصص فاکتورها را تجزیه (parse) کرده، کدهای بالینی را استخراج می‌کنند و صلاحیت را به‌صورت موازی بررسی می‌کنند.
  • لایه‌های هوش مصنوعی قابل توضیح (XAI) متادیتای منشأ (provenance metadata) را پیوست می‌کنند تا حسابرسان بتوانند یک تصمیم را تا سند اصلی ردیابی کنند.
  • مراحل انسان در چرخه (HITL) جریان کار خودکار را متوقف می‌کنند تا یک حسابرس پزشکی پیش از صدور پرداخت، تأیید نهایی را انجام دهد.

نکته مقابل: پیچیدگی و هزینه

تمام این اصول اولیه (primitives) جدید نویدبخش اتوماسیون هستند، اما سطح نیاز به تخصص عملیاتی را نیز بالا می‌برند. پیاده‌سازی Fault Injection Service و Zonal Shift مستلزم یک خط لوله CI/CD بالغ و تله‌متری (telemetry) قابل اعتماد است؛ در غیر این صورت، شبکه‌های ایمنی خود به منابع ایجاد نویز تبدیل می‌شوند. نگهداری پشته‌های ترکیبی PQC بار اضافی رمزنگاری (cryptographic overhead) را اضافه می‌کند که می‌تواند بر بارهای کاری حساس به تأخیر (latency-sensitive workloads) تأثیر بگذارد. شرکت‌های کوچک‌تر ممکن است سرمایه‌گذاری اولیه را تا زمان بلوغ ابزارها و تثبیت قیمت‌ها، بازدارنده و بسیار سنگین بیابند.