شکاف عملکرد هوش مصنوعی: چرا آزمون‌های تحت نظارت حقیقت را آشکار می‌کنند

ادغام سریع مدل‌های زبانی بزرگ (LLMs) در محیط‌های آکادمیک، توهم فریبنده‌ای از تسلط ایجاد کرده است؛ جایی که نمرات بالای تکالیف، فقدان عمیق درک واقعی را پنهان می‌کنند. یک مورد اخیر در دانشگاه براون (Brown University)، این «شکاف عملکرد» رو به رشد را برجسته کرده و هشداری جدی درباره خطرات شناختی بلندمدتِ اتکای بیش از حد به هوش مصنوعی مولد ارائه داده است.

مطالعه موردی دانشگاه براون: واقعیتِ ۴۸ درصدی

روبرتو سرانو (Roberto Serrano)، استاد اقتصاد در دانشگاه براون، اخیراً شاهد فروپاشی شدید عملکرد دانشجویان بود که وابستگی گسترده به هوش مصنوعی را آشکار کرد. در طول یک امتحان میان‌ترم که به صورت خانگی انجام می‌شد، کلاس ۸۶ نفره او به میانگین خیره‌کننده ۹۶٪ دست یافت؛ رقمی که به‌طور قابل‌توجهی بالاتر از میانگین تاریخی ۶۵٪ تا ۸۰٪ است.

شک و تردیدهای سرانو زمانی تأیید شد که او سوالات امتحان را در ChatGPT وارد کرد و نتایجی تقریباً یکسان دریافت نمود. نکته قابل توجه این بود که بسیاری از دانشجویان به جای استفاده از رویکرد شهودی و مستقیم که معمولاً از دانشجویان انسانی انتظار می‌رود، از یک اثبات ریاضی پیچیده و دشوار استفاده کرده بودند که ChatGPT آن را ترجیح می‌داد.

سرانو برای تأیید یافته‌های خود، به سراغ امتحان نهایی حضوری و تحت نظارت رفت. نتایج فاجعه‌بار بود: میانگین کلاس به ۴۸.۶٪ سقوط کرد که کمترین میزان در تاریخ این دوره تحصیلی است. نوزده دانشجو مستقیماً مردود شدند و اختلاف بین نمرات خانگی و نمرات حضوری ثابت کرد که نمرات بالای قبلی تا حد زیادی مصنوعی بودند.

روندهای جهانی: همبستگی بین استفاده از هوش مصنوعی و کاهش توانایی‌های شناختی

حادثه دانشگاه براون یک مورد استثنایی و منزوی نیست، بلکه بخشی از یک روند گسترده‌تر و مستند است. دو مطالعه بزرگ شواهد کمی از نحوه تأثیر ابزارهای هوش مصنوعی بر نتایج یادگیری ارائه می‌دهند:

  • مطالعه چین: یک مطالعه طولی که ۲۶,۰۰۰ دانش‌آموز را در پایه‌های هفتم تا دوازدهم دنبال می‌کرد، نشان داد که پس از به‌کارگیری هوش مصنوعی، نمرات تکالیف ۱۸٪ افزایش یافته، در حالی که زمان انجام آن‌ها از ۶۴ به ۴۵ دقیقه کاهش یافته است. با این حال، نمرات امتحانات ۲۰٪ افت کرد. در سناریوهای بلندمدت، عملکرد در امتحانات ورودی تا ۲۴٪ کاهش یافت و دانش‌آموزان ممتاز بیشترین آسیب را دیدند.
  • مطالعه دانشگاه کالیفرنیا، برکلی/تگزاس: تحلیل بیش از ۵۰۰,۰۰۰ نمره در یک دانشگاه تحقیقاتی بزرگ در تگزاس نشان داد که در دوره‌های دارای بخش‌های سنگین نوشتاری و برنامه‌نویسی، سهم نمرات "A" پس از عرضه ChatGPT، ۱۳ واحد درصد افزایش یافته است. این تورم نمرات بیش از همه در تکالیف خانگی بدون نظارت متمرکز بود.

پیامدهای گسترده‌تر برای هوش مصنوعی و آموزش

برای توسعه‌دهندگان و مربیان، این یافته‌ها نشان‌دهنده یک نقطه عطف حیاتی در بحث «همکاری انسان و هوش مصنوعی» است. در حالی که هوش مصنوعی به عنوان یک ضریب افزایش بهره‌وری قدرتمند عمل می‌کند، داده‌ها نشان می‌دهند که در حال حاضر ممکن است به عنوان یک «عصای کمکی شناختی» عمل کند که از چالش‌های لازم برای یادگیری عمیق عبور می‌کند.

«کارایی» به‌دست‌آمده در انجام تکالیف — که در برخی مطالعات با کاهش تقریباً ۳۰ درصدی زمان انجام وظایف مشاهده شده — مستقیماً به قیمت کاهش ماندگاری دانش تمام می‌شود. با ادغام بیشتر LLMها در جریان‌های کاری حرفه‌ای، شکاف بین کسانی که از هوش مصنوعی برای تقویت مهارت‌های خود استفاده می‌کنند و کسانی که از آن برای جایگزینی تفکر خود استفاده می‌کنند، به مرز تعیین‌کننده در نیروی کار آینده تبدیل خواهد شد.

نکات کلیدی

  • شکاف عملکرد: نمرات بالا در تکالیف بدون نظارت و در دسترس برای هوش مصنوعی، در حال تبدیل شدن به معیارهای غیرقابل اعتماد برای سنجش شایستگی واقعی دانشجو هستند.
  • جایگزینی شناختی: مطالعات نشان می‌دهند که اگرچه هوش مصنوعی سرعت و نمرات تکالیف را افزایش می‌دهد، اما با ۲۰٪ کاهش در عملکرد امتحانات و ماندگاری دانش در بلندمدت همبستگی دارد.
  • نیاز به مدل‌های ارزیابی جدید: تغییر جهت به سمت ارزیابی‌های تحت نظارت، حضوری یا بسیار تخصصی برای تمایز بین خروجی‌های تولید شده توسط هوش مصنوعی و تخصص انسانی ضروری می‌شود.