टेक्स्ट बॉट्स से वीडियो डॉक्टर्स तक

लार्ज लैंग्वेज मॉडल्स (LLMs) लंबे समय से टेक्स्ट से मेडिकल तथ्य निकालने में माहिर रहे हैं, लेकिन उन्हें मरीजों के साथ बातचीत करने का मानवीय तरीका (bedside manner) देना कठिन साबित हुआ है। पारंपरिक AI असिस्टेंट एक स्थिर चैट विंडो में उत्तर देते हैं; वे मरीज के चेहरे के हाव-भाव नहीं पढ़ सकते या बातचीत के दौरान अपना लहजा नहीं बदल सकते। AMIE (Video) इस अंतर को मिटाने की कोशिश करता है, बातचीत को लाइव वीडियो लिंक पर ले जाकर, जहाँ AI को तालमेल बिठाना, फॉलो-अप सवाल पूछना और दृश्य संकेतों (visual cues) पर प्रतिक्रिया देना होता है।

टेक्स्ट से वीडियो पर स्विच करना केवल UI में एक मामूली बदलाव नहीं है। यह मॉडल को ऑडियोविजुअल डेटा की निरंतर धारा को प्रोसेस करने, एक वास्तविक अपॉइंटमेंट की लय की नकल करने और बिना रुके बातचीत के कई पहलुओं को संभालने के लिए मजबूर करता है। व्यवहार में, यह क्षमता AI को एक फ्रंट-लाइन ट्राइएज एजेंट के रूप में काम करने की अनुमति दे सकती है, जो नियमित समस्याओं को संभाल सके और डॉक्टरों को जटिल मामलों के लिए मुक्त कर सके।

परीक्षण कैसे किया गया

Google ने एक टेस्टिंग फ्रेमवर्क बनाया जिसमें जटिल लक्षणों वाले मरीजों का किरदार निभाने के लिए पंद्रह प्रशिक्षित अभिनेताओं को लिया गया। अभिनेताओं ने पांच अंग प्रणालियों (organ systems) तक फैले क्लिनिकल परिदृश्यों में तात्कालिक अभिनय (improvise) किया:

  • कार्डियोपल्मोनरी (हृदय और श्वसन संबंधी) शिकायतें
  • पेट संबंधी समस्याएं
  • सिर-आंख-कान-नाक-गला (HEENT) संबंधी समस्याएं
  • न्यूरोलॉजिकल और मनोरोग संबंधी स्थितियां
  • मस्कुलोस्केलेटल (मांसपेशियों और हड्डियों संबंधी) विकार

इसके बाद स्वतंत्र क्लिनिकल मूल्यांकनकर्ताओं ने नैदानिक सटीकता, सवाल पूछने की रणनीति और सहानुभूतिपूर्ण संचार के आधार पर AI को रेटिंग दी। प्राप्त स्कोर ने AMIE (Video) को उन रेटिंग्स के बराबर खड़ा कर दिया जो आमतौर पर उन्हीं मामलों को संभालने वाले प्राइमरी-केयर फिजिशियन को दी जाती हैं।

यह परिणाम क्यों महत्वपूर्ण है

यदि कोई AI भरोसेमंद तरीके से मरीज-अभिनेता के साथ बातचीत कर सकता है और एक मानव चिकित्सक के समान ही निष्कर्ष पर पहुँच सकता है, तो स्वास्थ्य प्रणालियाँ कार्यबल की कमी के बीच एक कम लागत वाला, स्केलेबल एंट्री पॉइंट तैनात कर सकती हैं। वीडियो-सक्षम AI गैर-जरूरी समस्याओं का ट्राइएज कर सकता है, फॉलो-अप शेड्यूल कर सकता है, या प्रारंभिक सलाह दे सकता है—वह भी बिना किसी फिजिकल एग्जामिनेशन रूम के खर्च के। दूरदराज या कम सेवा वाले क्षेत्रों के मरीजों के लिए, एक वर्चुअल "फर्स्ट-लाइन" चिकित्सक प्रतीक्षा समय को नाटकीय रूप से कम कर सकता है।

सावधानी का पहलू

यह अध्ययन सिमुलेशन ज़ोन तक ही सीमित रहा। अभिनेता, चाहे वे कितने भी कुशल क्यों न हों, वास्तविक मरीजों की अनिश्चितता की नकल नहीं कर सकते, जो अपने साथ व्यक्तिगत इतिहास, कोमोर्बिडिटीज (सह-रुग्णता) और भावनात्मक अस्थिरता लेकर आते हैं। मूल्यांकन मानव रेटर्स द्वारा AI के प्रदर्शन की व्याख्या करने पर भी निर्भर था; किसी भी स्कोरिंग सिस्टम में व्यक्तिपरक पूर्वाग्रह (subjective bias) आ सकता है।

नियामक मंजूरी एक और बाधा बनी हुई है। वर्तमान मेडिकल-डिवाइस फ्रेमवर्क को नैदानिक या ट्राइएज कार्यों को मंजूरी देने से पहले वास्तविक दुनिया के उपयोग के प्रमाण की आवश्यकता होती है। उस डेटा के बिना, कोई भी तैनाती अनुसंधान सेटिंग्स या भारी निगरानी वाले पायलट प्रोजेक्ट्स तक ही सीमित रहेगी। उत्तरदायित्व (Liability) का सवाल भी बना हुआ है: यदि कोई AI किसी दृश्य संकेत को गलत पढ़ता है और गलत उपचार की सिफारिश करता है, तो जिम्मेदारी किसकी होगी—डेवलपर की, होस्टिंग प्लेटफॉर्म की, या पर्यवेक्षण करने वाले चिकित्सक की?

आगे क्या होगा

Google ने संकेत दिया है कि अगले चरण में वास्तविक मरीजों के साथ परीक्षण शामिल होंगे, जिसमें प्रामाणिक स्वास्थ्य रिकॉर्ड और विविध जनसांख्यिकीय पृष्ठभूमि शामिल होगी। उन अध्ययनों को न केवल क्लिनिकल रीजनिंग में समानता साबित करनी होगी, बल्कि सुरक्षा, डेटा गोपनीयता और जनसंख्या समूहों में न्यायसंगत प्रदर्शन भी साबित करना होगा।

निष्कर्ष

AMIE (Video) दिखाता है कि लार्ज-लैंग्वेज-मॉडल-संचालित AI एक सिम्युलेटेड वीडियो अपॉइंटमेंट में सक्षम साबित हो सकता है, और विभिन्न प्रकार की स्थितियों में एक प्राइमरी-केयर डॉक्टर के समान ही क्लिनिकल रेटिंग प्राप्त कर सकता है। यह ब्रेकथ्रू AI-संचालित फ्रंट-लाइन देखभाल का रास्ता खोलता है, लेकिन वास्तविक-मरीज परीक्षण, नियामक मंजूरी और स्पष्ट उत्तरदायित्व ढांचे ही यह तय करेंगे कि यह तकनीक लैब से क्लिनिक तक पहुँच पाएगी या नहीं।