ช่องว่างด้านประสิทธิภาพของ AI: ทำไมการสอบแบบมีผู้คุมจึงเผยความจริง
การบูรณาการ Large Language Models (LLMs) เข้าสู่แวดวงวิชาการอย่างรวดเร็วได้สร้างภาพลวงตาของความเชี่ยวชาญที่หลอกตา โดยที่คะแนนการบ้านที่สูงนั้นบดบังการขาดความเข้าใจอย่างแท้จริง กรณีศึกษาล่าสุดที่มหาวิทยาลัย Brown ได้ชี้ให้เห็นถึง "ช่องว่างด้านประสิทธิภาพ" (performance gap) ที่กำลังเพิ่มขึ้น ซึ่งเป็นคำเตือนที่รุนแรงเกี่ยวกับความเสี่ยงทางสติปัญญาในระยะยาวจากการพึ่งพา Generative AI มากเกินไป
กรณีศึกษาของมหาวิทยาลัย Brown: การเผชิญหน้ากับความจริงที่ 48%
Roberto Serrano ศาสตราจารย์ด้านเศรษฐศาสตร์ที่มหาวิทยาลัย Brown เพิ่งได้เห็นความตกต่ำอย่างรุนแรงของผลการเรียนของนักศึกษา ซึ่งเผยให้เห็นถึงการพึ่งพา AI อย่างแพร่หลาย ในระหว่างการสอบกลางภาคแบบนำกลับไปทำที่บ้าน (take-home midterm exam) นักศึกษาในชั้นเรียนของเขาทั้ง 86 คน ทำคะแนนเฉลี่ยได้สูงถึง 96% ซึ่งเป็นตัวเลขที่สูงกว่าเกณฑ์ปกติในอดีตที่อยู่ระหว่าง 65% ถึง 80% อย่างมีนัยสำคัญ
ข้อสงสัยของ Serrano ได้รับการยืนยันเมื่อเขานำคำถามสอบไปใส่ใน ChatGPT และได้รับผลลัพธ์ที่แทบจะเหมือนกัน ที่น่าสังเกตที่สุดคือ นักศึกษาจำนวนมากใช้การพิสูจน์ทางคณิตศาสตร์ที่ซับซ้อนซึ่ง ChatGPT นิยมใช้ แทนที่จะใช้วิธีการที่ตรงไปตรงมาและเข้าใจง่ายกว่าซึ่งมักจะคาดหวังจากนักศึกษาที่เป็นมนุษย์
เพื่อพิสูจน์สิ่งที่เขาพบ Serrano จึงเปลี่ยนมาใช้การสอบปลายภาคแบบมีผู้คุมและต้องมาสอบด้วยตนเอง ผลลัพธ์ที่ได้นั้นเลวร้ายมาก: คะแนนเฉลี่ยของชั้นเรียนดิ่งลงเหลือเพียง 48.6% ซึ่งต่ำที่สุดในประวัติศาสตร์ของรายวิชานี้ มีนักศึกษา 19 คนสอบตกทันที และความแตกต่างระหว่างคะแนนแบบนำกลับไปทำที่บ้านกับคะแนนสอบในห้องเรียนพิสูจน์ให้เห็นว่า คะแนนที่สูงก่อนหน้านี้ส่วนใหญ่เป็นเพียงคะแนนที่ถูกสร้างขึ้นมา
แนวโน้มระดับโลก: ความสัมพันธ์ระหว่างการใช้ AI และความถดถอยทางสติปัญญา
เหตุการณ์ที่ Brown ไม่ใช่ความผิดปกติที่เกิดขึ้นเพียงลำพัง แต่เป็นส่วนหนึ่งของแนวโน้มที่กว้างขึ้นและมีการบันทึกไว้แล้ว การศึกษาหลักสองฉบับให้หลักฐานเชิงปริมาณว่าเครื่องมือ AI ส่งผลกระทบต่อผลลัพธ์การเรียนรู้อย่างไร:
- การศึกษาในประเทศจีน: การศึกษาเชิงยาว (longitudinal study) ที่ติดตามนักเรียน 26,000 คน ตั้งแต่เกรด 7 ถึง 12 พบว่าหลังจากนำ AI มาใช้ คะแนนการบ้านเพิ่มขึ้น 18% ในขณะที่เวลาที่ใช้ในการทำลดลงจาก 64 นาทีเหลือ 45 นาที อย่างไรก็ตาม คะแนนสอบกลับลดลง 20% ในสถานการณ์ระยะยาว ผลการสอบเข้าเรียนลดลงมากถึง 24% โดยกลุ่มนักเรียนที่มีผลการเรียนดีเยี่ยมได้รับผลกระทบหนักที่สุด
- การศึกษาของ UC Berkeley/Texas: การวิเคราะห์เกรดกว่า 500,000 เกรดในมหาวิทยาลัยวิจัยขนาดใหญ่ในรัฐเท็กซัส เผยให้เห็นว่าในรายวิชาที่มีส่วนประกอบของการเขียนและการเขียนโปรแกรมจำนวนมาก สัดส่วนของเกรด "A" พุ่งสูงขึ้น 13 เปอร์เซ็นต์พอยต์หลังจากมีการเปิดตัว ChatGPT การเฟ้อของคะแนนนี้กระจุกตัวมากที่สุดในการสั่งการบ้านแบบไม่มีการควบคุมดูแล
นัยสำคัญที่กว้างขึ้นสำหรับ AI และการศึกษา
สำหรับนักพัฒนาและนักการศึกษา สิ่งที่ค้นพบเหล่านี้ถือเป็นจุดเปลี่ยนสำคัญในการถกเถียงเรื่อง "ความร่วมมือระหว่างมนุษย์และ AI" (Human-AI Collaboration) แม้ว่า AI จะทำหน้าที่เป็นตัวคูณประสิทธิภาพการทำงานที่ทรงพลัง แต่ข้อมูลบ่งชี้ว่าในปัจจุบันมันอาจทำหน้าที่เป็น "ไม้เท้าทางสติปัญญา" (cognitive crutch) ที่ข้ามขั้นตอนการต่อสู้ดิ้นรนที่จำเป็นต่อการเรียนรู้เชิงลึก
"ประสิทธิภาพ" ที่ได้รับจากการทำการบ้านเสร็จเร็วขึ้น—ซึ่งเห็นได้จากการลดเวลาในการทำงานลงเกือบ 30% ในบางการศึกษา—ต้องแลกมาด้วยการสูญเสียความสามารถในการจดจำความรู้ เมื่อ LLMs เข้ามาเป็นส่วนหนึ่งของกระบวนการทำงานระดับมืออาชีพมากขึ้น ช่องว่างระหว่างผู้ที่ใช้ AI เพื่อเสริมทักษะของตน กับผู้ที่ใช้มันเพื่อแทนที่การคิด จะกลายเป็นเส้นแบ่งสำคัญของแรงงานในอนาคต
สรุปประเด็นสำคัญ
- ช่องว่างด้านประสิทธิภาพ: เกรดที่สูงในการสั่งงานที่ไม่มีการควบคุมดูแลและสามารถเข้าถึง AI ได้ กำลังกลายเป็นตัวชี้วัดที่ไม่น่าเชื่อถือสำหรับความสามารถที่แท้จริงของนักศึกษา
- การแทนที่ทางสติปัญญา: การศึกษาแสดงให้เห็นว่าแม้ AI จะช่วยเพิ่มความเร็วในการทำการบ้านและเพิ่มเกรด แต่ก็มีความสัมพันธ์กับการลดลงของคะแนนสอบ 20% และความสามารถในการจดจำความรู้ในระยะยาว
- ความจำเป็นของรูปแบบการประเมินใหม่: การเปลี่ยนไปสู่การประเมินแบบมีผู้คุม สอบในสถานที่จริง หรือการประเมินที่มีความเฉพาะทางสูง กำลังกลายเป็นสิ่งจำเป็นเพื่อแยกแยะระหว่างผลลัพธ์ที่สร้างโดย AI กับความเชี่ยวชาญของมนุษย์
