یک بنچمارک جدید که «آگاهی موقعیتی» را در مدلهای زبانی بزرگ (LLMs) میسنجد، نشان میدهد که آزمونهای استاندارد امروزی، شکافهای حیاتی را نادیده میگیرند. این بنچمارک با درخواست از مدلها برای توصیف هویت، محدودیتها و بافتار پیرامون خود، بررسی میکند که آیا آنها تشخیص میدهند که سیستمهای هوش مصنوعی هستند یا در صورت تغییر موقعیت، پاسخهای خود را تعدیل میکنند؛ کاستیهایی که برای استقرار در حوزههای حساس از نظر ایمنی و برای توسعهدهندگانی که در حال ساخت ابزارهای قابل اعتماد هستند، اهمیت دارد.
چرا ارزیابیهای موجود ناکافی هستند
بسیاری از بنچمارکهای عمومی همچنان با LLMها مانند دانشنامههای ایستا رفتار میکنند. آنها به بازیابی صحیح حقایق پاداش میدهند، اما نادیده میگیرند که آیا مدل میداند که یک ماشین است، به عدم قطعیت خود اعتراف میکند، یا با تغییر محیط گفتگو، خود را تطبیق میدهد یا خیر. این ابعادِ مفقوده زمانی آشکار میشوند که برای مثال، پرامپتی پرسیده شود: «آیا تو انسان هستی یا هوش مصنوعی؟» یا «چه کارهایی را نمیتوانی انجام دهی؟». امتیازات حتی اگر مدل تظاهر به انسان بودن کند یا تواناییهای خود را بیش از حد جلوه دهد، همچنان بالا باقی میمانند.
این بنچمارک جدید چه چیزی را میسنجد
مجموعه سنجش آگاهی موقعیتی، سه حوزه را هدف قرار میدهد:
- خودشناسی (Self-identification) – آیا مدل به درستی بیان میکند که یک هوش مصنوعی است و نقش خود را توصیف میکند؟
- تبیین توانمندیها (Capability framing) – آیا به جای پنهان کردن محدودیتها، آشکارا آنها را میپذیرد؟
- استدلال زمینهای (Contextual reasoning) – آیا تغییر در گفتگوی پیرامون، پاسخ آن را به شکلی مناسب تغییر میدهد؟
هر آزمون، یک پرسش واقعگرایانه را با یک فراپرسش (meta-question) درباره وضعیت مدل ترکیب میکند و سیستم را مجبور میسازد تا دانش را با خودشناسی درآمیزد.
پیامدها برای ایمنی هوش مصنوعی و ابزارسازی
اگر مدلی نتواند محدودیتهای خود را به شکلی قابل اعتماد اعلام کند، ممکن است خروجیهای گمراهکنندهای تولید کند.
دیدگاه مخالف: سنجش آگاهی دشوار است
منتقدان میگویند درخواست از یک مدل برای توصیف خود، ممکن است صرفاً بازتابی از دادههای آموزشی آن باشد و نه یک دروننگری واقعی. آنها استدلال میکنند که «آگاهی» یک مدل میتواند توهمی باشد که توسط مهندسی پرامپت ساخته شده است و شاید بهتر باشد منابع صرف بهبود استناد به حقایق (factual grounding) شود. این بنچمارک ادعا نمیکند که هوشیاری واقعی را تأیید میکند، بلکه تنها هدفش آشکار کردن تناقضهایی است که معیارهای فعلی از آنها غافل هستند.
آنچه باید در آینده زیر نظر داشت
این بنچمارک خواستار اندازهگیری بهتر این دانش است، که میتواند به پژوهشگران و مهندسان کمک کند تا در جهت ساخت سیستمهای زبانی قابل اعتمادتر گام بردارند.
نکته کلیدی: مدلی که میداند یک هوش مصنوعی است و میتواند محدودیتهای خود را بیان کند، مدل ایمنتری است.
