چگونه PRISM2 با استفاده از گفتگوی بالینی، هوش مصنوعی آسیبشناسی را متحول میکند
چگونه PRISM2 با استفاده از گفتگوی بالینی، هوش مصنوعی آسیبشناسی را متحول میکند
همکاری پیشگامانه بین Paige و Microsoft مدل PRISM2 را معرفی کرده است؛ یک مدل هوش مصنوعی چندوجهی (multimodal) که برای پر کردن شکاف میان آسیبشناسی بصری و استدلال بالینی طراحی شده است. این مدل با ادغام تصویربرداری کل اسلاید (whole-slide imaging) با ظرافتهای گفتگوی پزشکی، از تشخیص الگوهای ساده فراتر رفته و به سمت تفسیر تشخیصی واقعی حرکت میکند.
فراتر رفتن از طبقهبندی پیکسلها
هوش مصنوعی سنتی در آسیبشناسی دیجیتال عمدتاً بر وظایف یادگیری نظارتشده، مانند طبقهبندی پیکسلهای خاص یا شناسایی ساختارهای سلولی، تمرکز داشته است. اگرچه این مدلها مؤثر هستند، اما اغلب فاقد عمق زمینهای مورد نیاز برای تصمیمگیریهای بالینی پیچیده میباشند. PRISM2 با استفاده از یک رمزگذار مبتنی بر perceiver که تصاویر کل اسلاید (WSIs) را به روشی اساساً متفاوت پردازش میکند، این پارادایم را تغییر میدهد.
PRISM2 به جای صرفاً برچسبگذاری تصاویر، برای تفسیر کاشیهای بافتی (tissue tiles) از دریچه گفتگوی بالینی استخراجشده از گزارشهای آسیبشناسی آموزش دیده است. این امر به مدل اجازه میدهد تا نه تنها ظاهر یک سلول، بلکه معنای حضور آن را در بافت گستردهتر بالینیِ تشخیص بیمار درک کند.
معماری فنی و مقیاس آموزش
پیچیدگی فنی PRISM2 در توانایی آن برای مدیریت تراکم عظیم دادههای ذاتی در آسیبشناسی نهفته است. یک تصویر کل اسلاید (whole-slide image) حاوی حجم عظیمی از اطلاعات است که اغلب بسیار فراتر از ظرفیت ترنسفورمرهای بینایی (vision transformers) استاندارد است. PRISM2 این مسئله را با تجمیع هزاران جاسازی کاشی (tile embeddings) مجزا در هر اسلاید در قالب یک نمایش واحد و منسجم برطرف میکند.
مقیاس دادههای آموزشی نیز به همان اندازه چشمگیر است. این مدل بر روی یک مجموعه داده عظیم شامل ۲.۳ میلیون تصویر کل اسلاید آموزش دیده است. با آموزش مشترک بر روی این کاشیهای بصری و متن بالینی مربوطه، مدل یک همترازی چندوجهی را میآموزد که به آن اجازه میدهد متن قابل خواندن برای انسان تولید کند. PRISM2 به جای ارائه یک طبقهبندی باینری (دوگانه)، میتواند به سوالات تشخیصی خاص پاسخ دهد و فرآیند استدلال یک آسیبشناس انسانی را شبیهسازی کند.
چرا این موضوع برای آینده هوش مصنوعی در مراقبتهای بهداشتی اهمیت دارد
ظهور PRISM2 نشاندهنده تغییری در چشمانداز هوش مصنوعی از «هوش مصنوعی متمایزکننده» (که دستهبندی میکند) به «هوش مصنوعی استدلالگر مولد» (که توضیح میدهد) است. برای توسعهدهندگان و بنیانگذاران در حوزه MedTech، این نشاندهنده حرکت به سمت ابزارهای بالینی شفافتر و کاربردیتر است.
وقتی یک هوش مصنوعی بتواند یافتههای خود را از طریق گفتگو منتقل کند، به جای یک ابزار «جعبه سیاه»، به یک شریک همکاری تبدیل میشود. این قابلیت برای پذیرش بالینی حیاتی است، زیرا آسیبشناسان برای اعتماد به بینشهای مبتنی بر هوش مصنوعی، به قابلیت توضیحپذیری نیاز دارند. PRISM2 با ادغام ظرافتهای زبانی موجود در گزارشهای آسیبشناسی، معیار جدیدی را برای نحوه استفاده از مدلهای چندوجهی در حوزههای تخصصی و حساس مانند انکولوژی و تشخیص تعیین میکند.
نکات کلیدی
- ادغام چندوجهی: PRISM2 از یک رمزگذار مبتنی بر perceiver برای پیوند دادن کاشیهای بافتی کل اسلاید با گفتگوی بالینی گزارشهای آسیبشناسی استفاده میکند.
- مقیاس عظیم: این مدل با استفاده از یک مجموعه آموزشی وسیع شامل ۲.۳ میلیون تصویر کل اسلاید توسعه یافته است تا استخراج ویژگیهای قدرتمند را تضمین کند.
- استدلال به جای طبقهبندی: برخلاف مدلهای سنتی که فقط پیکسلها را طبقهبندی میکنند، PRISM2 میتواند برای پاسخ به سوالات تشخیصی پیچیده، متن تولید کند.
مقاله: مایکروسافت و Paige از PRISM2 رونمایی کردهاند؛ یک مدل هوش مصنوعی چندوجهی که میتواند ۲.۳ میلیون تصویر آسیبشناسی کل اسلاید را دریافت کرده و به سوالات تشخیصی با زبان طبیعی پاسخ دهد. این سیستم با جفت کردن تحلیل بصری با گفتگوی بالینی موجود در گزارشهای آسیبشناسی، نویدبخش انتقال هوش مصنوعی در آسیبشناسی از طبقهبندی صرف تصاویر به استدلالی است که فرآیند فکری یک آسیبشناس انسانی را بازسازی میکند.
از پیکسلها تا استدلال
آسیبشناسی دیجیتال مدتهاست که بر هوش مصنوعیای متکی بوده که با یک اسلاید به عنوان شبکهای از پیکسلها برای برچسبگذاری برخورد میکند. چنین مدلهایی در وظایفی مانند شمارش میتوز یا علامتگذاری هستههای غیرطبیعی عالی عمل میکنند، اما از توضیح اینکه چرا یک یافته در تصویر کلی بیمار اهمیت دارد، باز میمانند. PRISM2 این وضعیت را تغییر میدهد. هسته اصلی آن یک رمزگذار مبتنی بر perceiver است؛ نوعی شبکه عصبی که میتواند هزاران کاشی تصویر را در یک نمایش واحد با ابعاد بالا فشرده کند. سپس آن نمایش با متن استخراجشده از گزارش آسیبشناسی مربوطه همتراز میشود و به مدل میآموزد که الگوهای بصری را با زبانی که پزشکان برای توصیف آنها به کار میبرند، مرتبط کند.
نتیجه، هوش مصنوعیای است که میتواند فراتر از گفتنِ «این ناحیه بدخیم است» عمل کند. این مدل میتواند جملهای مانند «وجود ساختارهای غدهای نامنظم، همراه با واکنش استرومایی مشاهدهشده، نشاندهنده آدنوکارسینوم با تمایز متوسط است که با تاریخچه بالینی سرطان کولورکتال مطابقت دارد» تولید کند. به عبارت دیگر، PRISM2 میتواند استدلال پشت یک تشخیص را بیان کند، نه فقط برچسب آن را.
مقیاسی که اهمیت دارد
آموزش یک مدل بر روی تصاویر کل اسلاید (whole-slide images)، تمرینی دادهمحور و سنگین است. یک اسلاید واحد میتواند حاوی میلیاردها پیکسل باشد که بسیار فراتر از ظرفیت vision transformerهای استاندارد است؛ همانهایی که ستون فقرات بسیاری از سیستمهای هوش مصنوعی مبتنی بر تصویر هستند. PRISM2 با تقسیم هر اسلاید به کاشیهای (tiles) قابل مدیریت، جاسازی (embedding) هر کاشی و سپس تجمیع جاسازیها در یک بردار در سطح اسلاید، از این محدودیت عبور میکند. این رویکرد ضمن حفظ جزئیات دقیق، نیازهای محاسباتی را نیز در سطحی قابل کنترل نگه میدارد.
این همکاری از مجموعهدادهای شامل ۲.۳ میلیون تصویر کل اسلاید بهره برده است که یکی از بزرگترین مجموعههای گردآوریشده برای هوش مصنوعی آسیبشناسی (pathology AI) تاکنون است. هر تصویر با توضیحات متنی که آسیبشناسان پس از بررسی اسلاید نوشته بودند، جفت شده بود. PRISM2 با آموزش همزمان بر روی هر دو حالت (modalities)، یاد گرفت که نشانههای بصری را به زبان تشخیص نگاشت کند؛ این امر آن را قادر میسازد تا پاسخهای منسجمی به سوالاتی نظیر «محتملترین محل اولیه کجاست؟» یا «آیا بافت شواهدی از تهاجم لنفواسکولار نشان میدهد؟» ارائه دهد.
چرا این فناوری میتواند شیوه عملکرد بالینی را تغییر دهد
آسیبشناسان نگهبانان تشخیص سرطان هستند، اما حجم اسلایدهایی که باید بررسی کنند، سریعتر از توان نیروی کار در حال افزایش است. هوش مصنوعی که صرفاً نواحی مشکوک را علامتگذاری میکند مفید است، اما اغلب پزشکان را در مورد دلیل این علامتگذاری در ابهام رها میکند. توانایی PRISM2 در توضیح یافتههایش میتواند اعتماد و پذیرش این فناوری را تسریع کند. وقتی یک الگوریتم میگوید: «من به دلیل این ویژگیهای ساختاری خاص، یک تومور با درجه بالا را مشاهده میکنم»، آسیبشناس میتواند به جای اینکه با خروجی مانند یک حکم مبهم برخورد کند، آن استدلال را تأیید، رد یا بر پایه آن نظر خود را بسازد.
برای استارتاپهای MedTech و تیمهای هوش مصنوعی در سیستمهای سلامت بزرگتر، این مدل معیار جدیدی تعیین میکند. این مدل نشان میدهد که آموزش چندوجهی (multimodal training) — یعنی ترکیب تصاویر با زبان تخصصی حوزه — میتواند ابزارهایی تولید کند که هم دقیق و هم تفسیرپذیر باشند. این ترکیب بهویژه در آنکولوژی (سرطانشناسی) ارزشمند است، جایی که تصمیمات درمانی به زیرگروهبندیهای دقیق آسیبشناختی بستگی دارد.
موانع و نکات متقابل
وعده گفتگوهای تشخیصی، چالشهای باقیمانده را از بین نمیبرد. نخست اینکه، عملکرد مدل در محیطهای تحقیقاتی گزارش شده است؛ اعتبارسنجی در دنیای واقعی در جریانهای کاری متنوع آزمایشگاهی، پروتکلهای رنگآمیزی و سازندگان اسکنر هنوز در انتظار انجام است. سیستمی که روی یک مجموعهداده منتخب کار میکند، ممکن است هنگام مواجهه با تنوعِ عملکردهای روزمره دچار مشکل شود.
دوم اینکه، دادههای آموزشی — ۲.۳ میلیون اسلاید و گزارشهای آنها — احتمالاً از مجموعه محدودی از مؤسسات استخراج شدهاند. اگر گروه مورد مطالعه، طیف کامل ویژگیهای جمعیتشناختی بیماران را منعکس نکند، مدل ممکن است دچار سوگیری شود و احتمالاً تظاهرات بیماریهایی را که کمتر در دادهها حضور داشتهاند، به اشتباه طبقهبندی کند.
سوم اینکه، مسیرهای نظارتی برای هوش مصنوعی که خروجی روایی (narrative) تولید میکند، نسبت به طبقهبندیکنندههای باینری (binary classifiers) کمتر تثبیت شده است. نهادهای نظارتی باید نه تنها دقت، بلکه ایمنیِ توضیحات اشتباه را نیز ارزیابی کنند، چرا که این توضیحات در صورت عدم علامتگذاری صحیح، میتوانند پزشکان را گمراه کنند.
در نهایت، هزینه محاسباتی اجرای یک رمزگذار مبتنی بر perceiver بر روی دادههای کل اسلاید، ناچیز نیست. بیمارستانها به زیرساختهای GPU کافی یا قراردادهای ابری نیاز خواهند داشت که این موضوع پرسشهایی را در مورد مقرونبهصرفه بودن، بهویژه برای آزمایشگاههای آسیبشناسی کوچکتر، ایجاد میکند.
آنچه باید در آینده زیر نظر داشت
- کارآزماییهای بالینی: شواهد حاصل از مطالعات آیندهنگر که تشخیصهای کمکگرفته از PRISM2 را با روشهای استاندارد مقایسه میکنند، عامل تعیینکننده برای تأییدیه نظارتی و پذیرش خواهد بود.
- خطوط لوله یکپارچهسازی: میزان سهولت اتصال مدل به پلتفرمهای موجود آسیبشناسی دیجیتال بر سرعت عرضه تأثیر خواهد گذاشت. دسترسی بیوقفه به API و سازگاری با نرمافزارهای رایج مشاهده اسلاید ضروری است.
- معیارهای تفسیرپذیری: بنچمارکهای مستقلی که میزان همسویی گفتگوی تولیدشده با استدلال متخصصان را کمیسازی میکنند، به رفع نگرانیهای مربوط به «جعبه سیاه» کمک خواهند کرد.
- قیمتگذاری و مجوز: مدل کسبوکار این همکاری — اینکه فناوری به صورت اشتراکی، با هزینه در ازای هر اسلاید، یا به صورت راهکار در محل (on-premise) ارائه شود — بر اینکه کدام مؤسسات توانایی پرداخت آن را دارند، تأثیر میگذارد.
خلاصه کلام
PRISM2 نشان میدهد که هوش مصنوعی میتواند از مرحلهی صرفاً برچسبگذاری سلولها فراتر رفته و روایت داستان بالینی نهفته در آن سلولها را بیان کند. مایکروسافت و Paige با آموزش مدل بر روی مجموعهی عظیمی از تصاویر اسلاید کامل (whole-slide images) که با زبان روزمرهی آسیبشناسان همراه شده است، سیستمی ساختهاند که میتواند به پرسشهای تشخیصی به شیوهای پاسخ دهد که گویی در حال گفتگو است. اگر این مدل در واقعیتهای پیچیدهی آزمایشگاههای روزمره قابل اعتماد از آب درآید، میتواند هوش مصنوعی را از یک آشکارساز خاموش به یک همکار واقعی تبدیل کرده و شیوهی تأثیرگذاری آسیبشناسی بر مراقبت از بیمار را دگرگون کند.
