شاخص هوش مصنوعی ۲۰۲۶ استنفورد نشان می‌دهد که حوادث ایمنی در سال گذشته به ۳۶۲ مورد افزایش یافته است، که این امر نشان‌دهنده شکاف رو به گسترش میان بهبود سریع مدل‌ها و عقب ماندن تدابیر حفاظتی برای حفظ قابلیت اعتماد آن‌هاست. هر شکستِ کنترل‌نشده، اعتماد به سیستم‌هایی را که پیش از این در حوزه‌های مالی، سلامت و خدمات عمومی نهادینه شده‌اند، تضعیف می‌کند.

داده‌های پشت این شکاف

این شاخص که توسط موسسه هوش مصنوعی انسان‌محور (Institute for Human-Centered Artificial Intelligence) تهیه شده است، عملکرد برجسته را در مقابل قابلیت اطمینان در دنیای واقعی قرار می‌دهد. مدل‌های سطح بالا همچنان در آزمون‌های معیار (benchmark) عالی عمل می‌کنند، با این حال نرخ «توهم» (hallucination) آن‌ها — یعنی مواردی که در آن اظهارات نادرست یا ساختگی تولید می‌کنند — در کل این حوزه بین ۲۲٪ تا ۹۴٪ متغیر است. وقتی کاربران فرض‌های به‌طور عمدی نادرست را به مدل‌ها می‌دهند، دقت GPT-4o از ۹۸.۲٪ به ۶۴.۴٪ سقوط می‌کند؛ در حالی که DeepSeek R1 تحت همین آزمایش از کمی بیش از ۹۰٪ به ۱۴.۴٪ کاهش می‌یابد. حفاظ‌های ایمنی که باید جلوی دستورات مخرب را بگیرند، معمولاً زمانی که مهاجمان آن‌ها را مورد آزمایش قرار می‌دهند، از کار می‌افتند.

چرا شرکت‌ها در تکاپو هستند

پذیرش سیاست‌ها از اجرای آن‌ها پیشی می‌گیرد. سهم شرکت‌های فاقد هرگونه حاکمیت هوش مصنوعی بین نظرسنجی قبلی و امسال از ۲۴٪ به ۱۱٪ کاهش یافته است و بسیاری از آن‌ها اکنون به استانداردهایی مانند ISO/IEC 42001 یا چارچوب مدیریت ریسک هوش مصنوعی NIST استناد می‌کنند. تدوین یک سیاست با پایبندی به آن یکی نیست. شکاف‌های دانش داخلی بر ۵۹٪ پاسخ‌دهندگان تأثیر گذاشته، محدودیت‌های بودجه‌ای مانع ۴۸٪ شده و عدم قطعیت مقرراتی ۴۱٪ را نگران کرده است. این گزارش آن را یک «مشکل فنی» می‌نامد: تشدید کنترل‌های حریم خصوصی می‌تواند به‌طور ناخواسته معیارهای عدالت را تضعیف کند و بالعکس، که باعث می‌شود مهندسان بدون ابزار یا بودجه کافی، مجبور به مدیریت اهداف متضاد باشند.

توهم بررسی‌های ایمنی فعلی

امتیازات شفافیت — که مجموع نحوه افشای آشکار محدودیت‌های مدل و روش‌های آزمایش توسط توسعه‌دهندگان است — از ۵۸ به ۴۰ کاهش یافته که نشان می‌دهد گزارش‌دهی داوطلبانه در حال از دست دادن اعتبار خود است. شرکت‌ها به حسابرسی‌های داخلی تکیه می‌کنند که اغلب شکست‌های مربوط به موارد خاص (edge-case) را که در شاخص ثبت شده‌اند، نادیده می‌گیرند. نتیجه این است که یک احساس امنیت کاذب ایجاد می‌شود؛ سازمان‌ها تصور می‌کنند محافظت می‌شوند، در حالی که آسیب‌پذیری‌های پنهان همچنان پابرجا هستند.

نقطه مقابل: استانداردها در حال گسترش هستند

موافقان استدلال می‌کنند که ارجاع به چارچوب‌های ISO و NIST یک گام رو به جلو است. استانداردهای رسمی به حسابرسان و نهادهای ناظر یک زبان مشترک و انتظارات پایه ارائه می‌دهند و مقایسه‌های بین‌شرکتی را آسان‌تر می‌کنند. پذیرندگان اولیه گزارش می‌دهند که در صورت وجود سیاست، هماهنگی داخلی روان‌تر و مسیرهای ارجاع شفاف‌تری دارند. افزایش پذیرش سیاست‌ها نشان می‌دهد که صنعت خطر را تشخیص داده و مایل به سرمایه‌گذاری در حاکمیت است.

آنچه هنوز مفقود است

حتی با وجود سیاست‌ها روی کاغذ، اجرا دچار لغزش می‌شود. این شاخص سه مانع عملی را برجسته می‌کند:

  • شکاف‌های دانش: تیم‌ها فاقد تخصص عمیق در زمینه ریسک هوش مصنوعی هستند که منجر به بررسی‌های انطباق سطحی می‌شود.
  • کمبود بودجه: ابزارهای ایمنی، حسابرسی‌های شخص ثالث و نظارت مستمر نیازمند بودجه‌هایی است که بسیاری از شرکت‌ها نمی‌توانند توجیه کنند.
  • ابهام مقرراتی: قوانین مبهم یا در حال تغییر، طراحی نقشه‌های راه بلندمدت برای انطباق را دشوار می‌کند.

رسیدگی به این مسائل احتمالاً به اعتبارسنجی خارجی نیاز خواهد داشت. این گزارش توصیه می‌کند که فراتر از خودارزیابی حرکت کرده و به سمت ارزیابی‌های مستقلی بروید که استفاده در دنیای واقعی و حملات خصمانه را شبیه‌سازی می‌کنند. همچنین خواستار راهکارهای مهندسی است که بررسی‌های ایمنی را مستقیماً در خط لوله مدل‌ها (model pipelines) بگنجانند، به جای اینکه با آن‌ها مانند ملاحظات ثانویه برخورد کنند.

آنچه در آینده باید زیر نظر داشت