MIT গবেষকরা দেখিয়েছেন যে AI ব্যাখ্যাযোগ্যতা (explainability) টুলগুলো সাধারণ ব্যবহারকারীদের জন্য রোগ নির্ণয়ের নির্ভুলতা বাড়ায়, কিন্তু অভিজ্ঞ চিকিৎসকদের ক্ষেত্রে এটি বাধা হয়ে দাঁড়ায়, যা রোগীর নিরাপত্তা এবং স্বাস্থ্য-AI প্রয়োগের নির্ভরযোগ্যতাকে হুমকির মুখে ফেলে। তারা বিভিন্ন চিকিৎসা পটভূমির অংশগ্রহণকারীদের ওপর একটি চর্মরোগ ক্লাসিফায়ার পরীক্ষা করেছেন এবং একটি স্পষ্ট বিভাজন দেখতে পেয়েছেন: অ-বিশেষজ্ঞরা তাদের সিদ্ধান্ত উন্নত করেছেন, অন্যদিকে প্রাথমিক-সেবা প্রদানকারী চিকিৎসকরা প্রায়শই “কগনিটিভ ফ্রিকশন” (cognitive friction) বা মানসিক ঘর্ষণ অনুভব করেছেন যখন AI-এর যুক্তি তাদের নিজস্ব যুক্তির সাথে সাংঘর্ষিক হয়েছে।
সেই গবেষণা যা “একই মাপের সবার জন্য” (one-size-fits-all) ধারণাকে ওলটপালট করে দিয়েছে
কৃত্রিম বুদ্ধিমত্তা (AI) এখন অনেক হাসপাতালের তথ্য ব্যবস্থায় ব্যবহৃত হচ্ছে, তবুও বেশিরভাগ বিক্রেতা প্রতিটি ব্যবহারকারীর জন্য একটি মাত্র ব্যাখ্যা ইন্টারফেস প্রদান করে। MIT টিম অংশগ্রহণকারীদের চর্মরোগ (skin lesions) নির্ণয় করতে বলেছিলেন, প্রথমে তারা নিজেরাই এবং পরে একটি AI মডেলের সাহায্যে, যা ভিজ্যুয়াল হিটম্যাপ (visual heatmaps) এবং টেক্সটযুক্ত যৌক্তিকতা প্রদান করেছিল। তারা দুটি গ্রুপের মধ্যে তুলনা করেছেন: যাদের খুব সামান্য বা কোনো চিকিৎসা প্রশিক্ষণ নেই এবং প্রাথমিক-সেবা প্রদানকারী চিকিৎসকরা যারা প্রতিদিন রোগ নির্ণয় করেন।
ফলাফলগুলো ভিন্ন ভিন্ন ছিল। সাধারণ অংশগ্রহণকারীরা AI-এর আউটপুট দেখার পর নির্ভুলতায় ব্যাপক উন্নতি করেছেন, তবে এই উন্নতির বেশিরভাগই এসেছে কেবল মেশিনের পরামর্শ মেনে চলার মাধ্যমে—যা 'অটোমেশন বায়াস' (automation bias)-এর একটি ধ্রুপদী উদাহরণ। তবে, চিকিৎসকদের ক্ষেত্রে কোনো ধারাবাহিক উন্নতি দেখা যায়নি। যখন AI-এর ব্যাখ্যাগুলো অতিরিক্ত সহজ ছিল বা ক্লিনিক্যাল যুক্তির সাথে সামঞ্জস্যপূর্ণ ছিল না, তখন চিকিৎসকরা বিভ্রান্তি, মনোযোগ বিচ্যুতি এবং কিছু ক্ষেত্রে রোগ নির্ণয়ের আত্মবিশ্বাসের ঘাটতির কথা জানিয়েছেন।
নবীনদের জন্য “অটোমেশন বায়াস” এর অর্থ কী
অ-বিশেষজ্ঞদের জন্য, AI-এর কনফিডেন্স স্কোর এবং হাইলাইট করা অঞ্চলগুলো সঠিক উত্তরের একটি সংক্ষিপ্ত পথ হিসেবে কাজ করে। গবেষণায় দেখা গেছে যে, এই ব্যবহারকারীরা মডেলটিকে তখনই বিশ্বাস করতেন যখন ব্যাখ্যাটি অন্তর্নিহিত প্যাথলজি সম্পর্কে খুব সামান্য ধারণা প্রদান করত। এর বিপদ দ্বিমুখী: রোগীরা একজন ক্রমবর্ধমান চিকিৎসকের দক্ষতার পরিবর্তে একটি মেশিনের সিদ্ধান্তের ওপর ভিত্তি করে চিকিৎসা গ্রহণ করেন, এবং ব্যবহারকারীরা AI যে রোগ নির্ণয়ের সংকেতগুলো চিহ্নিত করে তা শেখার সুযোগ হারান।
গবেষকরা সতর্ক করেছেন যে, যদিও উচ্চতর নির্ভুলতা একটি তাৎক্ষণিক সাফল্য, তবে দীর্ঘমেয়াদী ক্ষতি হতে পারে এমন এক প্রজন্মের চিকিৎসক তৈরি হওয়া যারা কেন এমন হচ্ছে তা না বুঝেই 'ব্ল্যাক-বক্স' (black-box) সুপারিশের ওপর নির্ভর করবেন। এই নির্ভরশীলতা সমালোচনামূলক চিন্তাভাবনাকে (critical thinking) ক্ষয় করে দেয়, যা মডেলের ভুল বা ট্রেনিং ডেটার বাইরের বিরল ঘটনাগুলো শনাক্ত করা কঠিন করে তোলে।
কেন অভিজ্ঞ চিকিৎসকরা এর বিরোধিতা করেন
চিকিৎসকরা রোগের একটি মানসিক মডেল (mental model) নিয়ে কাজ করেন যার মধ্যে রোগীর ইতিহাস, এপিডেমিওলজি এবং সূক্ষ্ম ভিজ্যুয়াল প্যাটার্ন অন্তর্ভুক্ত থাকে। যখন একটি AI ইন্টারফেস কেবল উচ্চ-স্তরের সারসংক্ষেপ বা সাধারণ কনফিডেন্স নম্বর প্রদান করে, তখন তা সেই মডেলের সাথে সাংঘর্ষিক হয়। MIT পরীক্ষাটি দেখিয়েছে যে, AI-এর পরামর্শকে অর্থপূর্ণভাবে গ্রহণ করার জন্য চিকিৎসকদের প্রায়শই আরও বিস্তারিত তথ্যের প্রয়োজন হয়—যেমন ফিচার অ্যাট্রিবিউশন ম্যাপ (feature attribution maps), তুলনামূলক সাহিত্যের রেফারেন্স বা বিস্তারিত প্রোবাবিলিটি ডিস্ট্রিবিউশন।
যখন ব্যাখ্যাগুলো পর্যাপ্ত ছিল না, তখন চিকিৎসকরা “কগনিটিভ ফ্রিকশন” (cognitive friction) বা মানসিক ঘর্ষণের কথা জানিয়েছেন, যা সিদ্ধান্ত গ্রহণ প্রক্রিয়াকে ধীর করে দেয় এবং ভুলের সম্ভাবনা বাড়িয়ে দেয়। প্রাথমিক সেবায়, এই ঘর্ষণ দীর্ঘতর পরামর্শ, কাজের গতি হ্রাস এবং সম্ভাব্য ভুল রোগ নির্ণয়ের কারণ হয়ে দাঁড়ায়।
এমন AI ডিজাইন করা যা তার দর্শককে চেনে
লেখকরা “পারসোনা-ভিত্তিক ব্যাখ্যাযোগ্যতা” (persona-based explainability)-এর পক্ষে মত দিয়েছেন, যা স্ট্যাটিক ড্যাশবোর্ড থেকে অ্যাডাপ্টিভ ইন্টারফেসে স্থানান্তরিত হবে এবং ব্যবহারকারীর দক্ষতার ভিত্তিতে গভীরতা ও ফরম্যাট পরিবর্তন করবে। একটি ব্যবহারিক বাস্তবায়নে দুটি ভিন্ন স্তর থাকতে পারে:
- সাধারণ মানুষের স্তর (Layperson layer): একটি সংক্ষিপ্ত সারসংক্ষেপ, একটি কনফিডেন্স স্কোর এবং একটি সহজ ভিজ্যুয়াল সংকেত (যেমন, একটি হিটম্যাপ) যা ব্যবহারকারীকে বিভ্রান্ত না করে আশ্বস্ত করবে।
- পেশাদার স্তর (Professional layer): বিস্তারিত হিটম্যাপ, পরিমাণগত ফিচার অবদান (quantitative feature contributions), পিয়ার-রিভিউড স্টাডির লিঙ্ক এবং মডেলের অনিশ্চয়তাগুলো বিস্তারিতভাবে দেখার ক্ষমতা।
ডেভেলপারদের একটি ইউজার-প্রোফাইল শনাক্তকরণ প্রক্রিয়া অন্তর্ভুক্ত করতে হবে—সম্ভবত রোল ট্যাগসহ একটি সাধারণ লগইন—অথবা চিকিৎসকদের বিভিন্ন ব্যাখ্যা মোডের মধ্যে পরিবর্তন করার সুযোগ দিতে হবে। লক্ষ্য চিকিৎসকদের কাছ থেকে জটিলতা লুকিয়ে রাখা নয়, বরং যখন এটি মূল্যবান হয় তখন তা উপস্থাপন করা এবং যাদের কেবল নির্দেশনার প্রয়োজন তাদের জন্য এটি ন্যূনতম রাখা।
পাল্টা যুক্তি এবং ব্যবহারিক বাধাগুলো
কিছু AI বিক্রেতা দাবি করেন যে একটি অভিন্ন ইন্টারফেস প্রশিক্ষণের খরচ এবং নিয়ন্ত্রক জটিলতা কমায়। একটি একক ব্যাখ্যা ফরম্যাট বিভিন্ন স্বাস্থ্য ব্যবস্থায় প্রত্যয়িত করা এবং চালু করা সহজ। তদুপরি, চিকিৎসকরা ইতিমধ্যে 'অ্যালার্ট ফ্যাটিগ' (alert fatigue)-এর সম্মুখীন হন; তথ্যের আরও একটি স্তর যোগ করা অতিরিক্ত কোলাহল বা বিভ্রান্তি হিসেবে বিবেচিত হতে পারে।
MIT-এর প্রাপ্ত ফলাফলগুলো নির্দেশ করে যে, “একই মাপের সবার জন্য” পদ্ধতির খরচ এই স্বল্পমেয়াদী দক্ষতার চেয়ে বেশি হতে পারে। যদি চিকিৎসকরা একটি AI টুল প্রত্যাখ্যান করেন বা ভুলভাবে ব্যবহার করেন কারণ এর ব্যাখ্যাগুলো অপ্রাসঙ্গিক মনে হয়, তবে এর গ্রহণ প্রক্রিয়া থমকে যাবে, যা উন্নয়ন এবং সমন্বয়ে করা বিনিয়োগকে নষ্ট করবে।
পরবর্তীতে কী লক্ষ্য রাখতে হবে
এই গবেষণাটি health-AI স্টেকহোল্ডারদের জন্য বেশ কিছু তাৎক্ষণিক পদক্ষেপের কথা নির্দেশ করে:
- বিদ্যমান ডায়াগনস্টিক টুলগুলিতে অ্যাডাপ্টিভ এক্সপ্লানেশন মডিউল পাইলট করুন এবং কাজের ধারা (workflow) ও ত্রুটির হারের ওপর এর প্রভাব পরিমাপ করুন।
- পারসোনা লজিক (persona logic) আরও উন্নত করতে নতুন ব্যবহারকারী (যেমন: মেডিকেল শিক্ষার্থী, টেলি-ট্রায়াজ কর্মী) এবং অভিজ্ঞ চিকিৎসকদের কাছ থেকে ক্রমাগত ফিডব্যাক সংগ্রহ করুন।
- মাল্টি-টিয়ার্ড এক্সপ্লেনেবিলিটির (multi-tiered explainability) জন্য মানদণ্ড তৈরি করুন যা রেগুলেটরি সাবমিশনে অন্তর্ভুক্ত করা যেতে পারে, যাতে নিরাপত্তা মূল্যায়নগুলো ব্যবহারকারী-নির্দিষ্ট ঝুঁকিগুলো বিবেচনা করে।
- অটোমেশন বায়াস (automation bias) সম্পর্কে ব্যবহারকারীদের শিক্ষিত করুন, এবং এই বিষয়টির ওপর জোর দিন যে AI হলো একটি সিদ্ধান্ত সহায়ক মাধ্যম, ক্লিনিকাল বিচারবুদ্ধির বিকল্প নয়।
মূল কথা
AI ডায়াগনস্টিক পারফরম্যান্স উন্নত করতে পারে, তবে তা কেবল তখনই সম্ভব যদি এর ব্যাখ্যাগুলো সেই ব্যক্তির ভাষা বা বোঝার ক্ষমতা অনুযায়ী হয় যিনি সেগুলো দেখছেন। দক্ষতার ব্যবধানকে উপেক্ষা করলে নতুনদের মধ্যে অতিরিক্ত নির্ভরশীলতা তৈরি হয় এবং চিকিৎসকদের জন্য কাজের জটিলতা সৃষ্টি করে, যা রোগীর ফলাফল এবং health-AI এর নির্ভরযোগ্যতা—উভয়কেই ঝুঁকির মুখে ফেলে। অ্যাডাপ্টিভ এবং পারসোনা-অ্যাওয়ার (persona-aware) ইন্টারফেস এখন আর কেবল একটি অতিরিক্ত সুবিধা নয়—ক্লিনিকাল প্র্যাকটিসে নিরাপদ ও কার্যকর AI সংহতির জন্য এগুলো একটি পূর্বশর্ত।
