टेक्स्ट बॉट्सपासून व्हिडिओ डॉक्टरांपर्यंत

Large language models (LLMs) मजकुरातून वैद्यकीय तथ्ये शोधण्यात बऱ्याच काळापासून उत्कृष्ट राहिले आहेत, परंतु त्यांना 'बेडसाइड मॅनर' (रुग्णाशी संवाद साधण्याची पद्धत) देणे कठीण ठरले आहे. पारंपारिक AI सहाय्यक एका स्थिर चॅट विंडोमध्ये उत्तरे देतात; ते रुग्णाचे चेहऱ्यावरील हावभाव वाचू शकत नाहीत किंवा संवाद सुरू असताना आपला सूर बदलू शकत नाहीत. AMIE (Video) हा संवाद थेट व्हिडिओ लिंकवर नेऊन ही दरी भरून काढण्याचा प्रयत्न करतो, जिथे AI ला संवादाचा वेग राखणे, अनुवर्ती प्रश्न विचारणे आणि दृश्य संकेतांना प्रतिसाद देणे आवश्यक असते.

टेक्स्टवरून व्हिडिओवर स्विच करणे म्हणजे केवळ UI मध्ये केलेला बदल नाही. यामुळे मॉडेलला ऑडिओव्हिज्युअल डेटाचा अखंड प्रवाह प्रक्रिया करणे, प्रत्यक्ष भेटीचा लयबद्धपणा (cadence) अनुकरण करणे आणि न थांबता संवादाचे अनेक धागे हाताळणे भाग पडते. व्यवहारात, ही क्षमता AI ला 'फ्रंट-लाइन ट्रायज एजंट' (प्राथमिक तपासणी करणारा घटक) म्हणून काम करण्यास सक्षम करू शकते, ज्यामुळे डॉक्टर गुंतागुंतीच्या प्रकरणांसाठी मोकळे होतील आणि नियमित समस्या AI हाताळू शकेल.

चाचणी कशी घेण्यात आली

Google ने एक टेस्टिंग फ्रेमवर्क तयार केले ज्यामध्ये गुंतागुंतीची लक्षणे असलेल्या रुग्णांची भूमिका साकारण्यासाठी पंधरा प्रशिक्षित कलाकारांची नियुक्ती करण्यात आली होती. या कलाकारांनी पाच अवयव प्रणालींमध्ये पसरलेल्या क्लिनिकल परिस्थितींमध्ये (clinical scenarios) अभिनय केला:

  • कार्डिओपल्मोनरी तक्रारी (हृदय आणि फुफ्फुस संबंधित)
  • पोटाच्या समस्या
  • डोके-डोळा-कान-नाक-घसा (HEENT) समस्या
  • मज्जासंस्था आणि मानसोपचार स्थिती
  • मस्कुलोस्केलेटल (स्नायू आणि अस्थि) विकार

त्यानंतर स्वतंत्र क्लिनिकल मूल्यमापनकर्त्यांनी निदानाचा अचूकता, प्रश्न विचारण्याची रणनीती आणि सहानुभूतीपूर्ण संवाद यावर AI चे मूल्यांकन केले. मिळालेल्या गुणांनुसार, AMIE (Video) चे रेटिंग हे त्याच प्रकरणांची हाताळणी करणाऱ्या प्राथमिक आरोग्य डॉक्टरांच्या (primary-care physicians) रेटिंगच्या बरोबरीचे होते.

हे निकाल का महत्त्वाचे आहेत

जर एखादे AI रुग्ण-कलाकाराशी विश्वासार्हतेने संवाद साधू शकले आणि मानवी क्लिनिशियनप्रमाणेच निष्कर्षापर्यंत पोहोचू शकले, तर आरोग्य यंत्रणा कर्मचारी टंचाईच्या काळात कमी खर्चाचा आणि विस्तारण्यायोग्य (scalable) प्रवेश बिंदू म्हणून याचा वापर करू शकतात. व्हिडिओ-सक्षम AI तातडीच्या नसलेल्या समस्यांची प्राथमिक तपासणी (triage) करू शकते, फॉलो-अप शेड्यूल करू शकते किंवा प्राथमिक सल्ला देऊ शकते—तेही प्रत्यक्ष तपासणी कक्षाचा खर्च न करता. दुर्गम किंवा सेवा न मिळालेल्या भागातील रुग्णांसाठी, व्हर्च्युअल "फर्स्ट-लाइन" क्लिनिशियन प्रतीक्षा वेळ लक्षणीयरीत्या कमी करू शकतो.

सावधगिरीचे पैलू

हे संशोधन सिम्युलेशन (कृत्रिम परिस्थिती) मर्यादेतच राहिले. कलाकार कितीही कुशल असले तरी, ते प्रत्यक्ष रुग्णांची अनपेक्षितता निर्माण करू शकत नाहीत, जे त्यांच्या वैयक्तिक इतिहास, सह-रुग्णता (comorbidities) आणि भावनिक अस्थिरता सोबत घेऊन येतात. मूल्यमापन हे देखील AI च्या कामगिरीचा अर्थ लावणाऱ्या मानवी रेटर्सवर अवलंबून होते; कोणत्याही स्कोअरिंग सिस्टममध्ये व्यक्तिनिष्ठ पूर्वग्रह (subjective bias) येऊ शकतो.

नियामक मंजुरी (Regulatory clearance) हा आणखी एक अडथळा आहे. सध्याच्या वैद्यकीय-उपकरण फ्रेमवर्कनुसार, निदानात्मक किंवा ट्रायज कार्ये मंजूर करण्यापूर्वी वास्तविक जगातील वापराचा पुरावा आवश्यक असतो. त्या डेटाशिवाय, कोणतेही उपयोजन केवळ संशोधन किंवा कडक देखरेखीखालील पायलट प्रोजेक्ट्सपुरते मर्यादित राहील. जबाबदारीचा (Liability) प्रश्न देखील समोर येतो: जर AI ने एखादा दृश्य संकेत चुकीचा वाचला आणि चुकीचा उपचार सुचवला, तर त्याची जबाबदारी कोणाची असेल—डेव्हलपरची, होस्टिंग प्लॅटफॉर्मची की देखरेख करणाऱ्या क्लिनिशियनची?

पुढे काय?

Google ने संकेत दिले आहे की पुढील टप्प्यात वास्तविक रुग्णांसह चाचण्या घेतल्या जातील, ज्यामध्ये अस्सल आरोग्य नोंदी आणि विविध लोकसंख्याशास्त्रीय पार्श्वभूमींचा समावेश असेल. त्या अभ्यासांना केवळ क्लिनिकल तर्कामध्ये समानताच नाही, तर सुरक्षा, डेटा गोपनीयता आणि विविध लोकसंख्या गटांमध्ये समान कामगिरी देखील सिद्ध करावी लागेल.

सारांश

AMIE (Video) हे दर्शवते की Large-language-model आधारित AI सिम्युलेटेड व्हिडिओ अपॉइंटमेंटमध्ये स्वतःचे स्थान टिकवून ठेवू शकते आणि विविध प्रकारच्या आजारांमध्ये प्राथमिक आरोग्य डॉक्टरांप्रमाणेच क्लिनिकल रेटिंग मिळवू शकते. हा शोध AI-चालित फ्रंट-लाइन केअरसाठी मार्ग मोकळा करतो, परंतु ही तंत्रज्ञान प्रयोगशाळेतून क्लिनिकपर्यंत पोहोचेल की नाही, हे प्रत्यक्ष-रुग्ण चाचण्या, नियामक मंजुरी आणि स्पष्ट जबाबदारीच्या चौकटींवर अवलंबून असेल.