AI 성능 격차: 감독 시험이 진실을 드러내는 이유
학계에서 거대 언어 모델(LLM)의 급격한 통합은 높은 과제 점수가 실제 이해도의 심각한 결여를 가리는, 숙달되었다는 기만적인 환상을 만들어냈습니다. 최근 브라운 대학교(Brown University)에서 발생한 사례는 이러한 점증하는 "성능 격차"를 부각하며, 생성형 AI에 대한 과도한 의존이 초래할 장기적인 인지적 위험에 대해 엄중한 경고를 던지고 있습니다.
브라운 대학교 사례 연구: 48%가 보여준 현실
브라운 대학교의 경제학 교수인 로베르토 세라노(Roberto Serrano)는 최근 학생들의 성적이 급격히 하락하는 것을 목격하며 광범위한 AI 의존도를 확인했습니다. 과제형 중간고사 기간 동안, 그의 수업을 듣는 86명의 학생은 평균 96%라는 경이로운 점수를 기록했습니다. 이는 과거 평균치인 65%~80%를 훨씬 상회하는 수치였습니다.
세라노 교수는 시험 문제를 ChatGPT에 입력해 본 결과 거의 동일한 답변을 얻으면서 자신의 의구심을 확신했습니다. 특히 주목할 점은, 많은 학생이 인간 학생에게 기대되는 직관적이고 직접적인 방식 대신, ChatGPT가 선호하는 복잡하고 난해한 수학적 증명 방식을 사용했다는 것입니다.
자신의 발견을 검증하기 위해 세라노 교수는 감독관이 있는 대면 기말고사로 전환했습니다. 결과는 참혹했습니다. 학급 평균은 해당 과목 역사상 최저치인 48.6%로 급락했습니다. 19명의 학생이 낙제했으며, 과제형 시험과 대면 시험 점수 사이의 격차는 이전의 높은 점수들이 대부분 인위적이었음을 증명했습니다.
글로벌 트렌드: AI 사용과 인지 능력 저하 사이의 상관관계
브라운 대학교의 사건은 단발적인 이례적 사례가 아니라, 이미 문서화된 광범위한 트렌드의 일부입니다. 두 가지 주요 연구는 AI 도구가 학습 결과에 어떤 영향을 미치는지에 대한 정량적 증거를 제시합니다.
- 중국 연구: 7~12학년 학생 26,000명을 추적 조사한 종단 연구에 따르면, AI를 도입한 후 숙제 점수는 18% 상승한 반면, 완료 시간은 64분에서 45분으로 단축되었습니다. 그러나 시험 점수는 20% 하락했습니다. 장기적인 관점에서 입시 성적은 최대 24%까지 떨어졌으며, 성적이 우수했던 학생들이 가장 큰 타격을 입었습니다.
- UC 버클리/텍사스 연구: 텍사스의 한 대형 연구 중심 대학에서 50만 개 이상의 성적을 분석한 결과, 글쓰기와 프로그래밍 비중이 높은 과목에서 ChatGPT 출시 이후 'A' 학점 비율이 13%포인트 급증했습니다. 이러한 성적 인플레이션은 감독이 없는 과제에서 가장 집중적으로 나타났습니다.
AI와 교육에 미치는 광범위한 시사점
개발자와 교육자들에게 이러한 발견은 "인간-AI 협업" 논쟁의 중요한 변곡점을 의미합니다. AI가 강력한 생산성 증폭기 역할을 하는 것은 사실이지만, 데이터에 따르면 AI는 현재 심층 학습에 필수적인 '고민의 과정'을 건너뛰게 만드는 "인지적 지팡이(cognitive crutch)"로 작용하고 있을 수 있습니다.
일부 연구에서 과제 수행 시간이 거의 30% 단축된 것에서 볼 수 있듯이, 숙제 완료에서 얻은 "효율성"은 지식 보유 능력의 직접적인 희생을 대가로 얻은 것입니다. LLM이 전문적인 업무 흐름에 더욱 통합됨에 따라, AI를 자신의 기술을 보완하는 데 사용하는 사람과 사고를 대체하는 데 사용하는 사람 사이의 격차는 미래 노동 시장을 결정짓는 분수령이 될 것입니다.
핵심 요약
- 성능 격차: 감독이 없고 AI 접근이 용이한 과제에서 얻은 높은 점수는 학생의 실제 역량을 측정하는 신뢰할 수 없는 지표가 되고 있습니다.
- 인지적 대체: 연구에 따르면 AI는 숙제 속도와 점수를 높여주지만, 시험 성적 및 장기적인 지식 보유 능력의 20% 하락과 상관관계가 있습니다.
- 새로운 평가 모델의 필요성: AI가 생성한 결과물과 인간의 전문성을 구분하기 위해 감독관이 있는 대면 시험이나 고도로 전문화된 평가 방식으로의 전환이 필수가 되고 있습니다.
