عامل‌های هوش مصنوعی که می‌توانند APIها را فراخوانی کنند، دستورات سیستم را اجرا کنند یا فایل‌ها را دستکاری کنند، اکنون از طرف کاربران عمل می‌کنند. وقتی این عامل‌ها یک درخواست را بیش از حد تحت‌اللفظی اجرا می‌کنند – مثلاً با تحویل دادن یک «کوه طلا» که باعث فروپاشی یک خانه می‌شود – نتیجه می‌تواند مخرب، غیراخلاقی یا صرفاً بی‌استفاده باشد. پژوهشگران در حال پر کردن این شکاف با معیار جدیدی به نام ضریب جنی (Genie coefficient) هستند که میزان انحراف خروجی یک عامل از قصد واقعی کاربر را اندازه‌گیری می‌کند.

چرا عدم تعیین دقیق (underspecification) اکنون اهمیت دارد

گذار از بات‌های صرفاً چت‌محور به عامل‌هایی که در دنیای واقعی عمل می‌کنند، یک مسئله مربوط به مدل زبانی را به یک مسئله ایمنی تبدیل می‌کند. یک مدل ممکن است همچنان متن‌های روان تولید کند، اما به محض اینکه شروع به فراخوانی APIها یا دستورات شل (shell commands) کند، تفسیر تحت‌اللفظی می‌تواند باعث آسیب‌های دنیای واقعی شود. از آنجایی که مدل فاقد کاربردشناسی (pragmatics) است – یعنی توانایی استنباط بافتار، انتظارات منطقی و محدودیت‌های بیان‌نشده – می‌تواند به کلمات وفادار باشد اما هدف پشت آن‌ها را نادیده بگیرد. استعاره «جنی» این موضوع را به خوبی نشان می‌دهد: برآورده شدن یک آرزو به گونه‌ای که درخواست تحت‌اللفظی را برآورده می‌کند اما هدف عمیق‌تر آرزوکننده را نادیده می‌گیرد.

ضریب جنی چه چیزی را اندازه‌گیری می‌کند

این ضریب یک عدد معیار واحد نیست؛ بلکه چارچوبی برای ارزیابی شکاف بین نتیجه مورد نظر و رفتار واقعی عامل است. این چارچوب بر چهار رکن استوار است:

  • معیارهای اختصاصی حوزه (Domain-specific benchmarks) که بازتاب‌دهنده وظایفی هستند که یک عامل در یک زمینه خاص با آن‌ها روبرو می‌شود.
  • محیط‌های شبیه‌سازی‌شده دنیای واقعی که در آن‌ها میان‌برها، موارد خاص (edge cases) و اثرات جانبی ناخواسته آشکار می‌شوند.
  • یک استاندارد «شخص منطقی» (reasonable-person standard) برای اقدامات هوش مصنوعی، که از مفاهیم حقوقی درباره آنچه یک فرد محتاط در همان موقعیت انجام می‌دهد، اقتباس شده است.
  • ارزیابی مشترک مدل و بستر نرم‌افزاری (software harness)، با در نظر گرفتن این واقعیت که باگ‌ها در کدهای پیرامونی می‌توانند به اندازه خطاهای مدل خطرناک باشند.

به‌کارگیری این عناصر به توسعه‌دهندگان اجازه می‌دهد ضریب جنی‌ای را تعیین کنند که هم صحت معنایی و هم ایمنی کاربردشناختی را در بر می‌گیرد.

مخاطرات برای توسعه‌دهندگان و کاربران

ضریب بالا نشان‌دهنده این است که یک عامل به ظاهر دستور را اجرا می‌کند اما روح آن را نقض می‌کند، که این امر کاربران را در معرض ضرر مالی، نشت داده‌ها یا جریمه‌های نظارتی قرار می‌دهد. ضریب پایین نشان می‌دهد که سیستم به محدودیت‌های ضمنی احترام می‌گذارد و استقرار در حوزه‌های پرخطر مانند امور مالی، مراقبت‌های بهداشتی یا زیرساخت‌های حیاتی را امکان‌پذیرتر می‌کند.

این معیار همچنین ابزاری تشخیصی در اختیار تیم‌های محصول قرار می‌دهد: آن‌ها می‌توانند شکست‌های سطح دستورالعمل (مدل دستور را اشتباه متوجه شده است) را از رفتار فنی نادرست (کد پیرامونی یک فراخوانی API را به مسیر اشتباه هدایت کرده است) تفکیک کنند. این تمایز برای عیب‌یابی، گزارش‌های انطباق و تخصیص هزینه‌ها اهمیت دارد.

دیدگاه‌های مخالف و پرسش‌های بی‌پاسخ

منتقدان می‌گویند کمّی‌سازی قصد و نیت امری ذهنی است و ممکن است چرخه‌های توسعه را کند کند. ایجاد یک خط پایه «شخص منطقی» برای هر حوزه ممکن است مستلزم تخصص گسترده حقوقی و اخلاقی باشد که هزینه‌های ارزیابی مدل را افزایش می‌دهد. همچنین این خطر وجود دارد که تیم‌ها با این ضریب به عنوان یک چک‌لیست برخورد کنند، نه به عنوان راهنمایی برای بازطراحی عمیق‌تر سیستم.

آنچه باید در آینده زیر نظر داشت

گام‌های بعدی شامل ادغام ضریب جنی در خط لوله‌های (pipelines) موجود تست هوش مصنوعی و استانداردسازی مجموعه‌ معیارهایی است که این ضریب را تغذیه می‌کنند. اگر گروه‌های صنعتی آن را به عنوان یک معیار پایه ایمنی بپذیرند، برنامه‌های صدور گواهینامه ممکن است پیش از عرضه عامل‌ها به مشتریان، تعیین یک حداقل ضریب را الزامی کنند. پژوهشگران احتمالاً تعریف «شخص منطقی» را اصلاح کرده و روش‌های خودکاری را برای ایجاد محیط‌های شبیه‌سازی‌شده مورد نیاز برای اندازه‌گیری قابل اعتماد، بررسی خواهند کرد.

خلاصه کلام: با حرکت عامل‌های هوش مصنوعی از متن به سمت عمل، اندازه‌گیری اینکه آن‌ها تا چه حد آنچه کاربران واقعاً می‌خواهند را درک می‌کنند – و نه فقط آنچه می‌گویند – ضروری می‌شود. ضریب جنی روشی ملموس و در حال تکامل برای عملی کردن این اندازه‌گیری ارائه می‌دهد.