شکاف عملکرد هوش مصنوعی: چرا آزمونهای تحت نظارت حقیقت را آشکار میکنند
ادغام سریع مدلهای زبانی بزرگ (LLMs) در محیطهای آکادمیک، توهم فریبندهای از تسلط ایجاد کرده است؛ جایی که نمرات بالای تکالیف، فقدان عمیق درک واقعی را پنهان میکنند. یک مورد اخیر در دانشگاه براون (Brown University)، این «شکاف عملکرد» رو به رشد را برجسته کرده و هشداری جدی درباره خطرات شناختی بلندمدتِ اتکای بیش از حد به هوش مصنوعی مولد ارائه داده است.
مطالعه موردی دانشگاه براون: واقعیتِ ۴۸ درصدی
روبرتو سرانو (Roberto Serrano)، استاد اقتصاد در دانشگاه براون، اخیراً شاهد فروپاشی شدید عملکرد دانشجویان بود که وابستگی گسترده به هوش مصنوعی را آشکار کرد. در طول یک امتحان میانترم که به صورت خانگی انجام میشد، کلاس ۸۶ نفره او به میانگین خیرهکننده ۹۶٪ دست یافت؛ رقمی که بهطور قابلتوجهی بالاتر از میانگین تاریخی ۶۵٪ تا ۸۰٪ است.
شک و تردیدهای سرانو زمانی تأیید شد که او سوالات امتحان را در ChatGPT وارد کرد و نتایجی تقریباً یکسان دریافت نمود. نکته قابل توجه این بود که بسیاری از دانشجویان به جای استفاده از رویکرد شهودی و مستقیم که معمولاً از دانشجویان انسانی انتظار میرود، از یک اثبات ریاضی پیچیده و دشوار استفاده کرده بودند که ChatGPT آن را ترجیح میداد.
سرانو برای تأیید یافتههای خود، به سراغ امتحان نهایی حضوری و تحت نظارت رفت. نتایج فاجعهبار بود: میانگین کلاس به ۴۸.۶٪ سقوط کرد که کمترین میزان در تاریخ این دوره تحصیلی است. نوزده دانشجو مستقیماً مردود شدند و اختلاف بین نمرات خانگی و نمرات حضوری ثابت کرد که نمرات بالای قبلی تا حد زیادی مصنوعی بودند.
روندهای جهانی: همبستگی بین استفاده از هوش مصنوعی و کاهش تواناییهای شناختی
حادثه دانشگاه براون یک مورد استثنایی و منزوی نیست، بلکه بخشی از یک روند گستردهتر و مستند است. دو مطالعه بزرگ شواهد کمی از نحوه تأثیر ابزارهای هوش مصنوعی بر نتایج یادگیری ارائه میدهند:
- مطالعه چین: یک مطالعه طولی که ۲۶,۰۰۰ دانشآموز را در پایههای هفتم تا دوازدهم دنبال میکرد، نشان داد که پس از بهکارگیری هوش مصنوعی، نمرات تکالیف ۱۸٪ افزایش یافته، در حالی که زمان انجام آنها از ۶۴ به ۴۵ دقیقه کاهش یافته است. با این حال، نمرات امتحانات ۲۰٪ افت کرد. در سناریوهای بلندمدت، عملکرد در امتحانات ورودی تا ۲۴٪ کاهش یافت و دانشآموزان ممتاز بیشترین آسیب را دیدند.
- مطالعه دانشگاه کالیفرنیا، برکلی/تگزاس: تحلیل بیش از ۵۰۰,۰۰۰ نمره در یک دانشگاه تحقیقاتی بزرگ در تگزاس نشان داد که در دورههای دارای بخشهای سنگین نوشتاری و برنامهنویسی، سهم نمرات "A" پس از عرضه ChatGPT، ۱۳ واحد درصد افزایش یافته است. این تورم نمرات بیش از همه در تکالیف خانگی بدون نظارت متمرکز بود.
پیامدهای گستردهتر برای هوش مصنوعی و آموزش
برای توسعهدهندگان و مربیان، این یافتهها نشاندهنده یک نقطه عطف حیاتی در بحث «همکاری انسان و هوش مصنوعی» است. در حالی که هوش مصنوعی به عنوان یک ضریب افزایش بهرهوری قدرتمند عمل میکند، دادهها نشان میدهند که در حال حاضر ممکن است به عنوان یک «عصای کمکی شناختی» عمل کند که از چالشهای لازم برای یادگیری عمیق عبور میکند.
«کارایی» بهدستآمده در انجام تکالیف — که در برخی مطالعات با کاهش تقریباً ۳۰ درصدی زمان انجام وظایف مشاهده شده — مستقیماً به قیمت کاهش ماندگاری دانش تمام میشود. با ادغام بیشتر LLMها در جریانهای کاری حرفهای، شکاف بین کسانی که از هوش مصنوعی برای تقویت مهارتهای خود استفاده میکنند و کسانی که از آن برای جایگزینی تفکر خود استفاده میکنند، به مرز تعیینکننده در نیروی کار آینده تبدیل خواهد شد.
نکات کلیدی
- شکاف عملکرد: نمرات بالا در تکالیف بدون نظارت و در دسترس برای هوش مصنوعی، در حال تبدیل شدن به معیارهای غیرقابل اعتماد برای سنجش شایستگی واقعی دانشجو هستند.
- جایگزینی شناختی: مطالعات نشان میدهند که اگرچه هوش مصنوعی سرعت و نمرات تکالیف را افزایش میدهد، اما با ۲۰٪ کاهش در عملکرد امتحانات و ماندگاری دانش در بلندمدت همبستگی دارد.
- نیاز به مدلهای ارزیابی جدید: تغییر جهت به سمت ارزیابیهای تحت نظارت، حضوری یا بسیار تخصصی برای تمایز بین خروجیهای تولید شده توسط هوش مصنوعی و تخصص انسانی ضروری میشود.
