Khoảng cách Hiệu suất AI: Tại sao các kỳ thi có giám sát mới tiết lộ sự thật
Sự tích hợp nhanh chóng của các Mô hình Ngôn ngữ Lớn (LLM) trong học thuật đã tạo ra một ảo tưởng đánh lừa về sự tinh thông, nơi điểm số bài tập cao che lấp sự thiếu hụt sâu sắc về khả năng hiểu biết thực sự. Một trường hợp gần đây tại Đại học Brown đã làm nổi bật "khoảng cách hiệu suất" đang ngày càng gia tăng này, đưa ra một cảnh báo đanh thép về những rủi ro nhận thức dài hạn do việc quá phụ thuộc vào AI tạo sinh.
Nghiên cứu điển hình tại Đại học Brown: Một thực tế nghiệt ngã 48%
Roberto Serrano, một giáo sư kinh tế tại Đại học Brown, gần đây đã chứng kiến sự sụt giảm nghiêm trọng trong kết quả học tập của sinh viên, điều này đã phơi bày sự phụ thuộc rộng rãi vào AI. Trong một kỳ thi giữa kỳ làm tại nhà, lớp học gồm 86 sinh viên của ông đã đạt được mức điểm trung bình đáng kinh ngạc là 96%—một con số cao hơn đáng kể so với mức bình thường trong lịch sử là từ 65% đến 80%.
Những nghi ngờ của Serrano đã được xác nhận khi ông đưa các câu hỏi thi qua ChatGPT và nhận được kết quả gần như y hệt. Đáng chú ý nhất là nhiều sinh viên đã sử dụng một chứng minh toán học phức tạp mà ChatGPT ưa chuộng, thay vì cách tiếp cận trực tiếp và trực quan hơn thường thấy ở sinh viên là con người.
Để xác thực những phát hiện của mình, Serrano đã chuyển sang hình thức thi cuối kỳ trực tiếp có giám sát. Kết quả thật thảm khốc: điểm trung bình của lớp đã giảm xuống còn 48,6%, mức thấp nhất trong lịch sử khóa học. Mười chín sinh viên đã trượt hoàn toàn, và sự chênh lệch giữa điểm thi tại nhà và điểm thi trực tiếp đã chứng minh rằng những điểm số cao trước đó phần lớn là giả tạo.
Xu hướng toàn cầu: Mối tương quan giữa việc sử dụng AI và sự suy giảm nhận thức
Sự cố tại Brown không phải là một hiện tượng bất thường đơn lẻ mà là một phần của một xu hướng rộng lớn hơn đã được ghi nhận. Hai nghiên cứu lớn cung cấp bằng chứng định lượng về cách các công cụ AI tác động đến kết quả học tập:
- Nghiên cứu tại Trung Quốc: Một nghiên cứu theo chiều dọc theo dõi 26.000 học sinh từ lớp 7 đến lớp 12 cho thấy sau khi áp dụng AI, điểm bài tập về nhà tăng 18% trong khi thời gian hoàn thành giảm từ 64 xuống còn 45 phút. Tuy nhiên, điểm thi lại giảm 20%. Trong các kịch bản dài hạn, kết quả thi đầu vào giảm tới 24%, trong đó những học sinh có thành tích cao nhất lại chịu ảnh hưởng nặng nề nhất.
- Nghiên cứu tại UC Berkeley/Texas: Một phân tích trên hơn 500.000 điểm số tại một trường đại học nghiên cứu lớn ở Texas cho thấy trong các khóa học có nhiều thành phần viết lách và lập trình, tỷ lệ điểm "A" đã tăng thêm 13 điểm phần trăm sau khi ChatGPT ra mắt. Sự lạm phát điểm số này tập trung nhiều nhất ở các bài tập về nhà không có sự giám sát.
Những tác động rộng lớn hơn đối với AI và Giáo dục
Đối với các nhà phát triển và các nhà giáo dục, những phát hiện này đại diện cho một bước ngoặt quan trọng trong cuộc tranh luận về "Sự cộng tác giữa Người và AI". Mặc dù AI đóng vai trò như một nhân tố nhân bội năng suất mạnh mẽ, dữ liệu cho thấy hiện tại nó có thể đang hoạt động như một "chiếc nạng nhận thức", giúp bỏ qua quá trình nỗ lực cần thiết để học tập chuyên sâu.
Sự "hiệu quả" đạt được trong việc hoàn thành bài tập về nhà—được thấy qua việc giảm gần 30% thời gian thực hiện nhiệm vụ trong một số nghiên cứu—đến từ cái giá trực tiếp là khả năng ghi nhớ kiến thức. Khi các LLM ngày càng được tích hợp sâu hơn vào các quy trình làm việc chuyên nghiệp, khoảng cách giữa những người sử dụng AI để tăng cường kỹ năng và những người sử dụng nó để thay thế tư duy sẽ trở thành ranh giới phân định trong lực lượng lao động tương lai.
Những điểm chính cần lưu ý
- Khoảng cách hiệu suất: Điểm số cao trong các bài tập không có sự giám sát và có thể tiếp cận bằng AI đang trở thành những thước đo không đáng tin cậy cho năng lực thực sự của sinh viên.
- Sự thay thế nhận thức: Các nghiên cứu cho thấy mặc dù AI làm tăng tốc độ làm bài tập và điểm số, nhưng nó có mối tương quan với việc giảm 20% kết quả thi và khả năng ghi nhớ kiến thức dài hạn.
- Nhu cầu về các mô hình đánh giá mới: Sự chuyển dịch sang các hình thức đánh giá có giám sát, trực tiếp hoặc chuyên biệt hóa cao đang trở nên cần thiết để phân biệt giữa kết quả do AI tạo ra và chuyên môn của con người.
