MIT के शोधकर्ताओं ने दिखाया है कि AI स्पष्टीकरण (explainability) उपकरण आम उपयोगकर्ताओं के लिए नैदानिक सटीकता (diagnostic accuracy) को बढ़ाते हैं, लेकिन अनुभवी चिकित्सकों के लिए बाधा बनते हैं, जिससे रोगी की सुरक्षा और स्वास्थ्य-AI के कार्यान्वयन की विश्वसनीयता को खतरा पैदा होता है। उन्होंने विभिन्न चिकित्सा पृष्ठभूमि वाले प्रतिभागियों पर एक त्वचा-रोग क्लासिफायर का परीक्षण किया और एक स्पष्ट अंतर पाया: गैर-विशेषज्ञों ने अपने निर्णयों में सुधार किया, जबकि प्राथमिक चिकित्सा चिकित्सकों ने अक्सर "संज्ञानात्मक घर्षण" (cognitive friction) महसूस किया जब AI का तर्क उनके अपने तर्क से मेल नहीं खाता था।
वह अध्ययन जिसने "एक ही आकार सबके लिए" (one-size-fits-all) की धारणा को उलट दिया
आर्टिफिशियल इंटेलिजेंस अब कई अस्पताल सूचना प्रणालियों (hospital information systems) का हिस्सा है, फिर भी अधिकांश विक्रेता प्रत्येक उपयोगकर्ता को एक ही प्रकार का स्पष्टीकरण इंटरफ़ेस प्रदान करते हैं। MIT की टीम ने प्रतिभागियों से त्वचा के घावों (skin lesions) का निदान करने के लिए कहा, पहले उन्होंने स्वयं किया और फिर एक AI मॉडल की मदद से, जो विजुअल हीटमैप्स (visual heatmaps) और टेक्स्टुअल तर्क (textual rationales) प्रदान करता था। उन्होंने दो समूहों की तुलना की: वे लोग जिन्हें बहुत कम या कोई चिकित्सा प्रशिक्षण नहीं था और प्राथमिक चिकित्सा चिकित्सक जो प्रतिदिन निदान करते हैं।
परिणाम अलग-अलग रहे। AI का आउटपुट देखने के बाद आम प्रतिभागियों की सटीकता में उछाल आया, लेकिन अधिकांश सुधार केवल मशीन के सुझाव को मान लेने से आया—जो कि 'ऑटोमेशन बायस' (automation bias) का एक क्लासिक मामला है। हालाँकि, चिकित्सकों को इसमें कोई निरंतर सुधार नहीं दिखा। जब AI के स्पष्टीकरण अत्यधिक सरल थे या नैदानिक तर्क (clinical reasoning) के साथ मेल नहीं खाते थे, तो डॉक्टरों ने भ्रम, व्याकुलता और कुछ मामलों में, नैदानिक आत्मविश्वास में कमी की सूचना दी।
नौसिखियों के लिए "ऑटोमेशन बायस" का क्या अर्थ है
गैर-विशेषज्ञों के लिए, AI के कॉन्फिडेंस स्कोर और हाइलाइट किए गए क्षेत्र सही उत्तर तक पहुँचने के लिए एक शॉर्टकट के रूप में कार्य करते हैं। अध्ययन में पाया गया कि ये उपयोगकर्ता मॉडल पर तब भी भरोसा करते थे जब स्पष्टीकरण अंतर्निहित पैथोलॉजी (underlying pathology) के बारे में बहुत कम जानकारी देता था। खतरा दोतरफा है: रोगी एक विकसित हो रहे चिकित्सक के कौशल के बजाय मशीन के निर्णय के आधार पर देखभाल प्राप्त करते हैं, और उपयोगकर्ता उन नैदानिक संकेतों (diagnostic cues) को सीखने का अवसर खो देते हैं जिन्हें AI चिह्नित करता है।
शोधकर्ताओं ने चेतावनी दी है कि हालांकि उच्च सटीकता एक तात्कालिक जीत है, लेकिन इसकी दीर्घकालिक लागत चिकित्सकों की ऐसी पीढ़ी हो सकती है जो बिना यह समझे कि क्यों, 'ब्लैक-बॉक्स' सिफारिशों पर निर्भर रहते हैं। यह निर्भरता आलोचनात्मक सोच (critical thinking) को कम करती है, जिससे मॉडल की त्रुटियों या प्रशिक्षण डेटा से बाहर के दुर्लभ मामलों को पहचानना कठिन हो जाता है।
अनुभवी चिकित्सक विरोध क्यों करते हैं
डॉक्टर बीमारी का एक मानसिक मॉडल (mental model) लेकर आते हैं जिसमें रोगी का इतिहास, महामारी विज्ञान (epidemiology) और सूक्ष्म दृश्य पैटर्न शामिल होते हैं। जब एक AI इंटरफ़ेस केवल उच्च-स्तरीय सारांश या सामान्य कॉन्फिडेंस नंबर प्रदान करता है, तो यह उस मॉडल से टकराता है। MIT के प्रयोग ने दिखाया कि चिकित्सकों को AI की सलाह को सार्थक रूप से एकीकृत करने के लिए अक्सर अधिक विस्तृत डेटा—जैसे फीचर एट्रिब्यूशन मैप्स (feature attribution maps), तुलनात्मक साहित्य संदर्भ, या विस्तृत संभाव्यता वितरण (probability distributions)—की आवश्यकता होती है।
जब स्पष्टीकरण अपर्याप्त रहे, तो चिकित्सकों ने "संज्ञानात्मक घर्षण" (cognitive friction) की सूचना दी, जो एक मानसिक प्रतिरोध है जो निर्णय लेने की प्रक्रिया को धीमा कर देता है और त्रुटि की संभावना को बढ़ाता है। प्राथमिक चिकित्सा में, वह घर्षण लंबे परामर्श, कम कार्यक्षमता और संभावित रूप से छूटे हुए निदान में बदल जाता है।
ऐसा AI डिज़ाइन करना जो अपने दर्शकों को जानता हो
लेखक "पर्सोना-आधारित स्पष्टीकरण" (persona-based explainability) का तर्क देते हैं, जो स्थिर डैशबोर्ड से हटकर अनुकूलन योग्य इंटरफ़ेस की ओर बढ़ने का सुझाव देते हैं जो उपयोगकर्ता की विशेषज्ञता के आधार पर गहराई और प्रारूप को समायोजित करते हैं। एक व्यावहारिक कार्यान्वयन में दो अलग-अलग स्तर शामिल हो सकते हैं:
- आम आदमी स्तर (Layperson layer): एक संक्षिप्त सारांश, एक कॉन्फिडेंस स्कोर, और एक सरल विजुअल संकेत (जैसे, एक हीटमैप) जो उपयोगकर्ता को बिना अभिभूत किए आश्वस्त करता है।
- पेशेवर स्तर (Professional layer): विस्तृत हीटमैप्स, मात्रात्मक फीचर योगदान, सहकर्मी-समीक्षित (peer-reviewed) अध्ययनों के लिंक, और मॉडल की अनिश्चितताओं की गहराई में जाने की क्षमता।
डेवलपर्स को एक यूजर-प्रोफाइल डिटेक्शन मैकेनिज्म—शायद रोल टैग के साथ एक साधारण लॉगिन—एम्बेड करने की आवश्यकता होगी या चिकित्सकों को स्पष्टीकरण मोड के बीच टॉगल करने की अनुमति देनी होगी। लक्ष्य डॉक्टरों से जटिलता को छिपाना नहीं है, बल्कि इसे तब प्रस्तुत करना है जब यह मूल्य जोड़ता है, जबकि उन्हें न्यूनतम रखना है जिन्हें केवल मार्गदर्शन की आवश्यकता है।
प्रति-तर्क और व्यावहारिक बाधाएं
कुछ AI विक्रेता दावा करते हैं कि एक समान इंटरफ़ेस प्रशिक्षण लागत और नियामक जटिलता को कम करता है। एक ही स्पष्टीकरण प्रारूप को प्रमाणित करना और विभिन्न स्वास्थ्य प्रणालियों में लागू करना आसान है। इसके अलावा, चिकित्सक पहले से ही 'अलर्ट थकान' (alert fatigue) का सामना कर रहे हैं; जानकारी की एक और परत को अधिक शोर (noise) के रूप में देखा जा सकता है।
MIT के निष्कर्ष बताते हैं कि "एक ही आकार सबके लिए" वाले दृष्टिकोण की लागत इन अल्पकालिक दक्षताओं से अधिक हो सकती है। यदि चिकित्सक किसी AI टूल को अस्वीकार कर देते हैं या उसका दुरुपयोग करते हैं क्योंकि उसके स्पष्टीकरण अप्रासंगिक लगते हैं, तो इसके अपनाए जाने की प्रक्रिया रुक जाती है, जिससे विकास और एकीकरण में किया गया निवेश बर्बाद हो जाता है।
आगे क्या देखने की आवश्यकता है
यह अध्ययन स्वास्थ्य-AI हितधारकों के लिए कई तत्काल कदमों की ओर संकेत करता है:
- मौजूदा डायग्नोस्टिक टूल्स में एडेप्टिव एक्सप्लेनेशन मॉड्यूल्स का पायलट परीक्षण करें और वर्कफ़्लो तथा त्रुटि दरों पर उनके प्रभाव का आकलन करें।
- पर्सोना लॉजिक (persona logic) को बेहतर बनाने के लिए नौसिखिया उपयोगकर्ताओं (जैसे, मेडिकल छात्र, टेली-ट्राइएज स्टाफ) और अनुभवी चिकित्सकों से निरंतर फीडबैक प्राप्त करें।
- मल्टी-टियर एक्सप्लेनेबिलिटी (multi-tiered explainability) के लिए मानक विकसित करें जिन्हें नियामक सबमिशन (regulatory submissions) में शामिल किया जा सके, जिससे यह सुनिश्चित हो सके कि सुरक्षा मूल्यांकन में उपयोगकर्ता-विशिष्ट जोखिमों को ध्यान में रखा गया है।
- ऑटोमेशन बायस (automation bias) के बारे में उपयोगकर्ताओं को शिक्षित करें, इस बात पर जोर देते हुए कि AI एक निर्णय सहायता (decision aid) है, न कि नैदानिक निर्णय (clinical judgment) का विकल्प।
निष्कर्ष
AI डायग्नोस्टिक प्रदर्शन को बढ़ा सकता है, लेकिन केवल तभी जब इसके स्पष्टीकरण उन्हें देखने वाले व्यक्ति की भाषा में हों। विशेषज्ञता के अंतर (expertise gap) को नज़रअंदाज़ करने से नौसिखियों में अत्यधिक निर्भरता बढ़ती है और डॉक्टरों के लिए बाधाएं पैदा होती हैं, जिससे रोगी के परिणाम और स्वास्थ्य-AI की विश्वसनीयता, दोनों खतरे में पड़ जाते हैं। एडेप्टिव और पर्सोना-जागरूक (persona-aware) इंटरफेस अब केवल एक अतिरिक्त सुविधा (nice-to-have feature) नहीं रह गए हैं—वे नैदानिक अभ्यास में सुरक्षित और प्रभावी AI एकीकरण के लिए एक अनिवार्य आवश्यकता हैं।
