פער הביצועים של ה-AI: מדוע מבחנים מבוקרים חושפים את האמת

השילוב המהיר של מודלי שפה גדולים (LLMs) באקדמיה יצר אשליה מטעה של שליטה, שבה ציונים גבוהים במטלות מסתירים חוסר עמוק בהבנה ממשית. מקרה שנחשף לאחרונה באוניברסיטת בראון הדגיש את "פער הביצועים" הגדל הזה, ומספק אזהרה חמורה לגבי הסיכונים הקוגניטיביים ארוכי הטווח של הסתמכות יתר על בינה מלאכותית גנרטיבית.

מקרה בוחן מאוניברסיטת בראון: בדיקת מציאות של 48%

רוברטו סראנו, פרופסור לכלכלה באוניברסיטת בראון, היה עד לאחרונה לקריסה דרמטית בביצועי הסטודנטים שחשפה תלות נרחבת ב-AI. במהלך מבחן אמצע ביתי, כיתתו בת 86 הסטודנטים השיגה ממוצע מדהים של 96% — נתון גבוה משמעותית מהנורמה ההיסטורית של 65% עד 80%.

חשדותיו של סראנו אושרו כאשר הריץ את שאלות המבחן דרך ChatGPT וקיבל תוצאות כמעט זהות. בולט במיוחד הוא העובדה שסטודנטים רבים השתמשו בהוכחה מתמטית מסובכת ש-ChatGPT העדיף, במקום בגישה האינטואיטיבית והישירה המצופה בדרך כלל מסטודנטים אנושיים.

כדי לתקף את ממצאיו, סראנו עבר למבחן גמר פרונטלי ומבוקר. התוצאות היו קטסטרופליות: ממוצע הכיתה צנח ל-48.6%, הנמוך ביותר בתולדות הקורס. תשעה סטודנטים נכשלו לחלוטין, והפער בין הציונים במבחן הביתי לבין הציונים במבחן הפרונטלי הוכיח שהציונים הגבוהים הקודמים היו ברובם מלאכותיים.

מגמות עולמיות: המתאם בין שימוש ב-AI לבין ירידה קוגניטיבית

המקרה בבראון אינו חריגה מבודדת אלא חלק ממגמה רחבה ומתועדת יותר. שני מחקרים מרכזיים מספקים ראיות כמותיות לאופן שבו כלי AI משפיעים על תוצאות הלמידה:

  • מחקר סין: מחקר אורך שעקב אחר 26,000 תלמידים בכיתות ז' עד י"ב מצא כי לאחר אימוץ ה-AI, הציונים במטלות הבית עלו ב-18%, בעוד שזמן הביצוע ירד מ-64 ל-45 דקות. עם זאת, ציוני המבחנים ירדו ב-20%. בתרחישים ארוכי טווח, הביצועים במבחני הכניסה צנחו בשיעור של עד 24%, כאשר התלמידים בעלי הביצועים הגבוהים ביותר נפגעו בצורה הקשה ביותר.
  • מחקר UC Berkeley/Texas: ניתוח של למעלה מ-500,000 ציונים באוניברסיטת מחקר גדולה בטקסס חשף כי בקורסים עם מרכיבים כבדים של כתיבה ותכנות, חלקם של ציוני ה-"A" קפץ ב-13 נקודות אחוז בעקבות השקת ChatGPT. האינפלציה הזו הייתה מרוכזת ביותר במטלות בית ללא פיקוח.

ההשלכות הרחבות יותר על AI וחינוך

עבור מפתחים ואנשי חינוך, ממצאים אלו מייצגים נקודת מפנה קריטית בדיון על "שיתוף פעולה בין אדם ל-AI". בעוד ש-AI פועל כמכפיל פרודוקטיביות עוצמתי, הנתונים מצביעים על כך שהוא עשוי לתפקד כרגע כ"קביים קוגניטיביים" העוקפים את המאמץ הנחוץ ללמידה עמוקה.

ה"יעילות" שנרכשת בהשלמת מטלות הבית — כפי שנראה בהפחתה של כמעט 30% מזמן המשימה בחלק מהמחקרים — באה על חשבון ישיר של שימור הידע. ככל ש-LLMs יהפכו למשולבים יותר בתהליכי עבודה מקצועיים, הפער בין אלו המשתמשים ב-AI כדי להעצים את כישוריהם לבין אלו המשתמשים בו כדי להחליף את החשיבה שלהם, יהפוך למפלה המגדירה של כוח העבודה בעתיד.

נקודות מפתח

  • פער הביצועים: ציונים גבוהים במטלות ללא פיקוח ונגישות ל-AI הופכים למדדים לא אמינים עבור מיומנות סטודנטית ממשית.
  • תחליף קוגניטיבי: מחקרים מראים כי בעוד ש-AI מגביר את מהירות ביצוע מטלות הבית ואת הציונים, הוא נמצא במתאם לירידה של 20% בביצועי מבחנים ובשימור ידע לטווח ארוך.
  • הצורך במודלים חדשים להערכה: המעבר לעבר הערכות מבוקרות, פרונטליות או מתמחות מאוד הופך לנחוץ כדי להבחין בין תוצרים שנוצרו על ידי AI לבין מומחיות אנושית.