از بات‌های متنی تا پزشکان ویدئویی

مدل‌های زبانی بزرگ (LLMs) مدت‌هاست که در استخراج حقایق پزشکی از متن مهارت پیدا کرده‌اند، اما بخشیدن «رفتار پزشکانه» (bedside manner) به آن‌ها دشوار بود. دستیارهای هوش مصنوعی سنتی در یک پنجره چت ایستا پاسخ می‌دهند؛ آن‌ها نمی‌توانند حالات چهره بیمار را بخوانند یا با پیشرفت گفتگو، لحن خود را تغییر دهند. AMIE (Video) تلاش می‌کند با انتقال تعامل به یک لینک ویدئویی زنده، این شکاف را پر کند؛ جایی که هوش مصنوعی باید همگام با گفتگو پیش برود، سوالات تکمیلی بپرسد و به نشانه‌های بصری واکنش نشان دهد.

تغییر از متن به ویدئو صرفاً یک تغییر در رابط کاربری (UI) نیست. این کار مدل را مجبور می‌کند تا جریانی مداوم از داده‌های صوتی-تصویری را پردازش کند، آهنگ و ریتم یک نوبت معاینه واقعی را تقلید کند و چندین رشته گفتگویی را بدون وقفه مدیریت کند. در عمل، این قابلیت می‌تواند به هوش مصنوعی اجازه دهد تا به عنوان یک عامل تریاژ خط مقدم عمل کند، نگرانی‌های روتین را مدیریت کند و پزشکان را برای موارد پیچیده آزاد بگذارد.

نحوه انجام آزمایش

گوگل یک چارچوب آزمایشی ایجاد کرد که در آن پانزده بازیگر آموزش‌دیده برای ایفای نقش بیمارانی با علائم پیچیده استخدام شدند. بازیگران در سناریوهای بالینی که پنج سیستم ارگانی را در بر می‌گرفت، به بداهه‌پردازی پرداختند:

  • شکایات قلبی-ریوی
  • مشکلات شکمی
  • مشکلات سر، چشم، گوش، بینی و گلو (HEENT)
  • شرایط عصبی و روان‌پزشکی
  • اختلالات اسکلتی-عضلانی

سپس ارزیابان بالینی مستقل، هوش مصنوعی را از نظر دقت تشخیص، استراتژی پرسشگری و ارتباط همدلانه رتبه‌بندی کردند. امتیازات به‌دست‌آمده، AMIE (Video) را در سطح رتبه‌هایی قرار داد که معمولاً به پزشکان مراقبت‌های اولیه در مواجهه با همان موارد داده می‌شود.

چرا این نتیجه اهمیت دارد

اگر یک هوش مصنوعی بتواند به‌طور قابل‌اعتمادی با یک بیمار-بازیگر گفتگو کند و به همان نتایجی برسد که یک پزشک انسانی می‌رساند، سیستم‌های سلامت می‌توانند در میان کمبود نیروی کار، یک نقطه ورود کم‌هزینه و مقیاس‌پذیر را مستقر کنند. یک هوش مصنوعی مجهز به ویدئو می‌تواند موارد غیرفوری را تریاژ کند، نوبت‌های پیگیری را برنامه‌ریزی کند یا توصیه‌های اولیه ارائه دهد؛ همگی بدون نیاز به هزینه‌های اضافی یک اتاق معاینه فیزیکی. برای بیماران در مناطق دورافتاده یا محروم، یک پزشک مجازی «خط مقدم» می‌تواند زمان انتظار را به‌طور چشمگیری کاهش دهد.

جنبه‌های احتیاطی

این مطالعه در محدوده شبیه‌سازی باقی ماند. بازیگران، هر چقدر هم که ماهر باشند، نمی‌توانند غیرقابل‌پیش‌بینی بودن بیماران واقعی را که تاریخچه شخصی، بیماری‌های همراه و بی‌ثباتی عاطفی را با خود به ملاقات می‌آورند، بازسازی کنند. همچنین ارزیابی بر تفسیر ارزیابان انسانی از عملکرد هوش مصنوعی متکی بود؛ سوگیری‌های ذهنی می‌تواند در هر سیستم امتیازدهی نفوذ کند.

مجوزهای نظارتی همچنان مانع دیگری است. چارچوب‌های فعلی تجهیزات پزشکی، پیش از تأیید عملکردهای تشخیصی یا تریاژ، به شواهدی از استفاده در دنیای واقعی نیاز دارند. بدون آن داده‌ها، هرگونه استقرار در محیط‌های تحقیقاتی یا طرح‌های آزمایشی تحت نظارت شدید باقی خواهد ماند. مسئله مسئولیت نیز مطرح است: اگر هوش مصنوعی یک نشانه بصری را اشتباه تفسیر کند و مسیر درمانی نادرستی را توصیه کند، چه کسی مسئول خواهد بود؛ توسعه‌دهنده، پلتفرم میزبان یا پزشک ناظر؟

گام‌های بعدی

گوگل اعلام کرده است که مرحله بعدی شامل آزمایش‌هایی با بیماران واقعی، همراه با پرونده‌های سلامت واقعی و پیشینه‌های جمعیت‌شناختی متنوع خواهد بود. این مطالعات باید نه تنها برابری در استدلال بالینی، بلکه ایمنی، حریم خصوصی داده‌ها و عملکرد منصفانه در میان گروه‌های مختلف جمعیتی را نیز ثابت کنند.

خلاصه کلام

AMIE (Video) نشان می‌دهد که یک هوش مصنوعی مبتنی بر مدل‌های زبانی بزرگ می‌تواند در یک نوبت ویزیت ویدئویی شبیه‌سازی‌شده، از خود توانایی نشان دهد و در طیف گسترده‌ای از شرایط، همان امتیازات بالینی یک پزشک مراقبت‌های اولیه را کسب کند. این پیشرفت راه را برای مراقبت‌های خط مقدم مبتنی بر هوش مصنوعی باز می‌کند، اما آزمایش با بیماران واقعی، تأییدیه‌های نظارتی و چارچوب‌های شفاف مسئولیت تعیین خواهد کرد که آیا این فناوری از آزمایشگاه به کلینیک منتقل می‌شود یا خیر.