এআই পারফরম্যান্স গ্যাপ: কেন প্রক্টরিং পরীক্ষা সত্য প্রকাশ করে

শিক্ষাক্ষেত্রে লার্জ ল্যাঙ্গুয়েজ মডেলের (LLMs) দ্রুত সংযুক্তি দক্ষতার একটি বিভ্রান্তিকর বিভ্রম তৈরি করেছে, যেখানে অ্যাসাইনমেন্টের উচ্চ নম্বর প্রকৃত বোধগম্যতার অভাবকে ঢেকে রাখে। ব্রাউন ইউনিভার্সিটির একটি সাম্প্রতিক ঘটনা এই ক্রমবর্ধমান "পারফরম্যান্স গ্যাপ" বা পারফরম্যান্সের ব্যবধানকে সামনে এনেছে, যা জেনারেটিভ এআই-এর ওপর অতিরিক্ত নির্ভরতার দীর্ঘমেয়াদী জ্ঞানীয় (cognitive) ঝুঁকির বিষয়ে একটি কঠোর সতর্কবার্তা প্রদান করে।

ব্রাউন ইউনিভার্সিটি কেস স্টাডি: একটি ৪৮% বাস্তব চিত্র

ব্রাউন ইউনিভার্সিটির অর্থনীতির অধ্যাপক রবার্তো সেরানো সম্প্রতি শিক্ষার্থীদের পারফরম্যান্সের একটি নাটকীয় পতন প্রত্যক্ষ করেছেন যা ব্যাপক এআই নির্ভরতাকে প্রকাশ করেছে। একটি 'টেক-হোম' মিডটার্ম পরীক্ষার সময়, তার ৮৬ জন শিক্ষার্থীর ক্লাসের গড় নম্বর ছিল বিস্ময়কর ৯৬%—যা ঐতিহাসিক গড় ৬৫% থেকে ৮০%-এর তুলনায় উল্লেখযোগ্যভাবে বেশি।

সেরানোর সন্দেহ তখনই নিশ্চিত হয় যখন তিনি পরীক্ষার প্রশ্নগুলো ChatGPT-এ চালিয়ে প্রায় হুবহু ফলাফল পান। সবচেয়ে উল্লেখযোগ্যভাবে, অনেক শিক্ষার্থী মানুষের কাছ থেকে প্রত্যাশিত সহজ ও সরাসরি পদ্ধতির পরিবর্তে একটি জটিল গাণিতিক প্রমাণ ব্যবহার করেছিল যা ChatGPT পছন্দ করে।

তার প্রাপ্ত ফলাফল যাচাই করতে, সেরানো একটি প্রক্টরিং করা সরাসরি (in-person) ফাইনাল পরীক্ষার ব্যবস্থা করেন। ফলাফল ছিল বিপর্যয়কর: ক্লাসের গড় নম্বর কমে ৪৮.৬%-এ নেমে আসে, যা এই কোর্সের ইতিহাসে সর্বনিম্ন। উনিশ জন শিক্ষার্থী সরাসরি ফেল করে এবং 'টেক-হোম' ও সরাসরি পরীক্ষার নম্বরের মধ্যে এই পার্থক্য প্রমাণ করে যে আগের উচ্চ নম্বরগুলো মূলত কৃত্রিম ছিল।

বৈশ্বিক প্রবণতা: এআই ব্যবহার এবং জ্ঞানীয় অবক্ষয়ের মধ্যে সম্পর্ক

ব্রাউনের এই ঘটনাটি কোনো বিচ্ছিন্ন ঘটনা নয় বরং এটি একটি বৃহত্তর ও নথিভুক্ত প্রবণতার অংশ। দুটি প্রধান গবেষণা এআই টুলগুলো কীভাবে শেখার ফলাফলের ওপর প্রভাব ফেলে তার পরিমাণগত প্রমাণ প্রদান করে:

  • দ্য চায়না স্টাডি: ৭ থেকে ১২তম গ্রেডের ২৬,০০০ শিক্ষার্থীর ওপর পরিচালিত একটি দীর্ঘমেয়াদী গবেষণায় দেখা গেছে যে, এআই গ্রহণের পর হোমওয়ার্কের নম্বর ১৮% বৃদ্ধি পেয়েছে এবং সম্পন্ন করার সময় ৬৪ মিনিট থেকে কমে ৪৫ মিনিটে নেমে এসেছে। তবে, পরীক্ষার নম্বর ২০% কমে গেছে। দীর্ঘমেয়াদী প্রেক্ষাপটে, প্রবেশিকা পরীক্ষার পারফরম্যান্স ২৪% পর্যন্ত কমে গেছে, যেখানে মেধাবী শিক্ষার্থীরা সবচেয়ে বেশি ক্ষতিগ্রস্ত হয়েছে।
  • দ্য ইউসি বার্কলে/টেক্সাস স্টাডি: টেক্সাসের একটি বড় গবেষণা বিশ্ববিদ্যালয়ের ৫,০০,০০০-এরও বেশি গ্রেডের বিশ্লেষণে দেখা গেছে যে, লেখালেখি এবং প্রোগ্রামিং নির্ভর কোর্সগুলোতে ChatGPT চালুর পর "A" গ্রেডের হার ১৩ শতাংশ পয়েন্ট বৃদ্ধি পেয়েছে। এই বৃদ্ধি মূলত তদারকিহীন হোমওয়ার্ক অ্যাসাইনমেন্টগুলোতে বেশি দেখা গেছে।

এআই এবং শিক্ষার ওপর এর ব্যাপক প্রভাব

ডেভেলপার এবং শিক্ষাবিদদের জন্য, এই ফলাফলগুলো "মানুষ-এআই সহযোগিতা" বিতর্কের একটি গুরুত্বপূর্ণ মোড় নির্দেশ করে। যদিও এআই একটি শক্তিশালী উৎপাদনশীলতা বৃদ্ধিকারী (productivity multiplier) হিসেবে কাজ করে, তবে তথ্য বলছে এটি বর্তমানে একটি "জ্ঞানীয় সহায়ক" (cognitive crutch) হিসেবে কাজ করছে যা গভীর শিক্ষার জন্য প্রয়োজনীয় সংগ্রাম বা প্রচেষ্টাকে এড়িয়ে যায়।

হোমওয়ার্ক সম্পন্ন করার ক্ষেত্রে যে "দক্ষতা" অর্জিত হচ্ছে—যা কিছু গবেষণায় কাজের সময় প্রায় ৩০% হ্রাস হিসেবে দেখা গেছে—তা সরাসরি জ্ঞান ধরে রাখার (knowledge retention) বিনিময়ে আসছে। যেহেতু LLM পেশাদার কাজের ক্ষেত্রে আরও বেশি সমন্বিত হচ্ছে, তাই যারা তাদের দক্ষতা বাড়াতে এআই ব্যবহার করে এবং যারা তাদের চিন্তাশক্তিকে প্রতিস্থাপন করতে এটি ব্যবহার করে, তাদের মধ্যে এই ব্যবধানই ভবিষ্যতে কর্মীবাহিনীর প্রধান বিভাজন রেখা হয়ে দাঁড়াবে।

মূল বিষয়সমূহ

  • পারফরম্যান্স গ্যাপ: তদারকিহীন এবং এআই-নির্ভর অ্যাসাইনমেন্টে উচ্চ নম্বর শিক্ষার্থীদের প্রকৃত দক্ষতার জন্য একটি অনির্ভরযোগ্য মাপকাঠি হয়ে উঠছে।
  • জ্ঞানীয় প্রতিস্থাপন: গবেষণা দেখায় যে এআই হোমওয়ার্কের গতি এবং গ্রেড বাড়ালেও, এটি পরীক্ষার পারফরম্যান্স এবং দীর্ঘমেয়াদী জ্ঞান ধরে রাখার ক্ষেত্রে ২০% হ্রাসের সাথে সম্পর্কিত।
  • নতুন মূল্যায়ন মডেলের প্রয়োজনীয়তা: এআই-জেনারেটেড আউটপুট এবং মানুষের দক্ষতার মধ্যে পার্থক্য করার জন্য প্রক্টরিং করা, সরাসরি বা অত্যন্ত বিশেষায়িত মূল্যায়নের দিকে ঝুঁকে পড়া এখন প্রয়োজনীয় হয়ে উঠছে।