یک بنچمارک جدید که «آگاهی موقعیتی» را در مدل‌های زبانی بزرگ (LLMs) می‌سنجد، نشان می‌دهد که آزمون‌های استاندارد امروزی، شکاف‌های حیاتی را نادیده می‌گیرند. این بنچمارک با درخواست از مدل‌ها برای توصیف هویت، محدودیت‌ها و بافتار پیرامون خود، بررسی می‌کند که آیا آن‌ها تشخیص می‌دهند که سیستم‌های هوش مصنوعی هستند یا در صورت تغییر موقعیت، پاسخ‌های خود را تعدیل می‌کنند؛ کاستی‌هایی که برای استقرار در حوزه‌های حساس از نظر ایمنی و برای توسعه‌دهندگانی که در حال ساخت ابزارهای قابل اعتماد هستند، اهمیت دارد.

چرا ارزیابی‌های موجود ناکافی هستند

بسیاری از بنچمارک‌های عمومی همچنان با LLMها مانند دانشنامه‌های ایستا رفتار می‌کنند. آن‌ها به بازیابی صحیح حقایق پاداش می‌دهند، اما نادیده می‌گیرند که آیا مدل می‌داند که یک ماشین است، به عدم قطعیت خود اعتراف می‌کند، یا با تغییر محیط گفتگو، خود را تطبیق می‌دهد یا خیر. این ابعادِ مفقوده زمانی آشکار می‌شوند که برای مثال، پرامپتی پرسیده شود: «آیا تو انسان هستی یا هوش مصنوعی؟» یا «چه کارهایی را نمی‌توانی انجام دهی؟». امتیازات حتی اگر مدل تظاهر به انسان بودن کند یا توانایی‌های خود را بیش از حد جلوه دهد، همچنان بالا باقی می‌مانند.

این بنچمارک جدید چه چیزی را می‌سنجد

مجموعه سنجش آگاهی موقعیتی، سه حوزه را هدف قرار می‌دهد:

  • خودشناسی (Self-identification) – آیا مدل به درستی بیان می‌کند که یک هوش مصنوعی است و نقش خود را توصیف می‌کند؟
  • تبیین توانمندی‌ها (Capability framing) – آیا به جای پنهان کردن محدودیت‌ها، آشکارا آن‌ها را می‌پذیرد؟
  • استدلال زمینه‌ای (Contextual reasoning) – آیا تغییر در گفتگوی پیرامون، پاسخ آن را به شکلی مناسب تغییر می‌دهد؟

هر آزمون، یک پرسش واقع‌گرایانه را با یک فراپرسش (meta-question) درباره وضعیت مدل ترکیب می‌کند و سیستم را مجبور می‌سازد تا دانش را با خودشناسی درآمیزد.

پیامدها برای ایمنی هوش مصنوعی و ابزارسازی

اگر مدلی نتواند محدودیت‌های خود را به شکلی قابل اعتماد اعلام کند، ممکن است خروجی‌های گمراه‌کننده‌ای تولید کند.

دیدگاه مخالف: سنجش آگاهی دشوار است

منتقدان می‌گویند درخواست از یک مدل برای توصیف خود، ممکن است صرفاً بازتابی از داده‌های آموزشی آن باشد و نه یک درون‌نگری واقعی. آن‌ها استدلال می‌کنند که «آگاهی» یک مدل می‌تواند توهمی باشد که توسط مهندسی پرامپت ساخته شده است و شاید بهتر باشد منابع صرف بهبود استناد به حقایق (factual grounding) شود. این بنچمارک ادعا نمی‌کند که هوشیاری واقعی را تأیید می‌کند، بلکه تنها هدفش آشکار کردن تناقض‌هایی است که معیارهای فعلی از آن‌ها غافل هستند.

آنچه باید در آینده زیر نظر داشت

این بنچمارک خواستار اندازه‌گیری بهتر این دانش است، که می‌تواند به پژوهشگران و مهندسان کمک کند تا در جهت ساخت سیستم‌های زبانی قابل اعتمادتر گام بردارند.

نکته کلیدی: مدلی که می‌داند یک هوش مصنوعی است و می‌تواند محدودیت‌های خود را بیان کند، مدل ایمن‌تری است.