عاملهای هوش مصنوعی که میتوانند APIها را فراخوانی کنند، دستورات سیستم را اجرا کنند یا فایلها را دستکاری کنند، اکنون از طرف کاربران عمل میکنند. وقتی این عاملها یک درخواست را بیش از حد تحتاللفظی اجرا میکنند – مثلاً با تحویل دادن یک «کوه طلا» که باعث فروپاشی یک خانه میشود – نتیجه میتواند مخرب، غیراخلاقی یا صرفاً بیاستفاده باشد. پژوهشگران در حال پر کردن این شکاف با معیار جدیدی به نام ضریب جنی (Genie coefficient) هستند که میزان انحراف خروجی یک عامل از قصد واقعی کاربر را اندازهگیری میکند.
چرا عدم تعیین دقیق (underspecification) اکنون اهمیت دارد
گذار از باتهای صرفاً چتمحور به عاملهایی که در دنیای واقعی عمل میکنند، یک مسئله مربوط به مدل زبانی را به یک مسئله ایمنی تبدیل میکند. یک مدل ممکن است همچنان متنهای روان تولید کند، اما به محض اینکه شروع به فراخوانی APIها یا دستورات شل (shell commands) کند، تفسیر تحتاللفظی میتواند باعث آسیبهای دنیای واقعی شود. از آنجایی که مدل فاقد کاربردشناسی (pragmatics) است – یعنی توانایی استنباط بافتار، انتظارات منطقی و محدودیتهای بیاننشده – میتواند به کلمات وفادار باشد اما هدف پشت آنها را نادیده بگیرد. استعاره «جنی» این موضوع را به خوبی نشان میدهد: برآورده شدن یک آرزو به گونهای که درخواست تحتاللفظی را برآورده میکند اما هدف عمیقتر آرزوکننده را نادیده میگیرد.
ضریب جنی چه چیزی را اندازهگیری میکند
این ضریب یک عدد معیار واحد نیست؛ بلکه چارچوبی برای ارزیابی شکاف بین نتیجه مورد نظر و رفتار واقعی عامل است. این چارچوب بر چهار رکن استوار است:
- معیارهای اختصاصی حوزه (Domain-specific benchmarks) که بازتابدهنده وظایفی هستند که یک عامل در یک زمینه خاص با آنها روبرو میشود.
- محیطهای شبیهسازیشده دنیای واقعی که در آنها میانبرها، موارد خاص (edge cases) و اثرات جانبی ناخواسته آشکار میشوند.
- یک استاندارد «شخص منطقی» (reasonable-person standard) برای اقدامات هوش مصنوعی، که از مفاهیم حقوقی درباره آنچه یک فرد محتاط در همان موقعیت انجام میدهد، اقتباس شده است.
- ارزیابی مشترک مدل و بستر نرمافزاری (software harness)، با در نظر گرفتن این واقعیت که باگها در کدهای پیرامونی میتوانند به اندازه خطاهای مدل خطرناک باشند.
بهکارگیری این عناصر به توسعهدهندگان اجازه میدهد ضریب جنیای را تعیین کنند که هم صحت معنایی و هم ایمنی کاربردشناختی را در بر میگیرد.
مخاطرات برای توسعهدهندگان و کاربران
ضریب بالا نشاندهنده این است که یک عامل به ظاهر دستور را اجرا میکند اما روح آن را نقض میکند، که این امر کاربران را در معرض ضرر مالی، نشت دادهها یا جریمههای نظارتی قرار میدهد. ضریب پایین نشان میدهد که سیستم به محدودیتهای ضمنی احترام میگذارد و استقرار در حوزههای پرخطر مانند امور مالی، مراقبتهای بهداشتی یا زیرساختهای حیاتی را امکانپذیرتر میکند.
این معیار همچنین ابزاری تشخیصی در اختیار تیمهای محصول قرار میدهد: آنها میتوانند شکستهای سطح دستورالعمل (مدل دستور را اشتباه متوجه شده است) را از رفتار فنی نادرست (کد پیرامونی یک فراخوانی API را به مسیر اشتباه هدایت کرده است) تفکیک کنند. این تمایز برای عیبیابی، گزارشهای انطباق و تخصیص هزینهها اهمیت دارد.
دیدگاههای مخالف و پرسشهای بیپاسخ
منتقدان میگویند کمّیسازی قصد و نیت امری ذهنی است و ممکن است چرخههای توسعه را کند کند. ایجاد یک خط پایه «شخص منطقی» برای هر حوزه ممکن است مستلزم تخصص گسترده حقوقی و اخلاقی باشد که هزینههای ارزیابی مدل را افزایش میدهد. همچنین این خطر وجود دارد که تیمها با این ضریب به عنوان یک چکلیست برخورد کنند، نه به عنوان راهنمایی برای بازطراحی عمیقتر سیستم.
آنچه باید در آینده زیر نظر داشت
گامهای بعدی شامل ادغام ضریب جنی در خط لولههای (pipelines) موجود تست هوش مصنوعی و استانداردسازی مجموعه معیارهایی است که این ضریب را تغذیه میکنند. اگر گروههای صنعتی آن را به عنوان یک معیار پایه ایمنی بپذیرند، برنامههای صدور گواهینامه ممکن است پیش از عرضه عاملها به مشتریان، تعیین یک حداقل ضریب را الزامی کنند. پژوهشگران احتمالاً تعریف «شخص منطقی» را اصلاح کرده و روشهای خودکاری را برای ایجاد محیطهای شبیهسازیشده مورد نیاز برای اندازهگیری قابل اعتماد، بررسی خواهند کرد.
خلاصه کلام: با حرکت عاملهای هوش مصنوعی از متن به سمت عمل، اندازهگیری اینکه آنها تا چه حد آنچه کاربران واقعاً میخواهند را درک میکنند – و نه فقط آنچه میگویند – ضروری میشود. ضریب جنی روشی ملموس و در حال تکامل برای عملی کردن این اندازهگیری ارائه میدهد.
