PRISM2가 임상 대화를 활용하여 병리 AI를 혁신하는 방법

Paige와 Microsoft의 획기적인 협업을 통해 시각적 병리와 임상적 추론 사이의 간극을 메우기 위해 설계된 멀티모달 AI 모델인 PRISM2가 공개되었습니다. 이 모델은 전체 슬라이드 이미지(whole-slide imaging)를 의료 대화의 미묘한 차이와 통합함으로써, 단순한 패턴 인식을 넘어 진정한 진단적 해석 단계로 나아갑니다.

픽셀 분류를 넘어

디지털 병리 분야의 기존 AI는 특정 픽셀을 분류하거나 세포 구조를 식별하는 것과 같은 지도 학습 작업에 주로 집중해 왔습니다. 이러한 모델은 효과적이긴 하지만, 복잡한 임상 의사결정에 필요한 맥락적 깊이가 부족한 경우가 많습니다. PRISM2는 전체 슬라이드 이미지(WSI)를 근본적으로 다른 방식으로 처리하는 perceiver 기반 인코더를 활용하여 이러한 패러다임을 뒤흔듭니다.

단순히 이미지를 라벨링하는 대신, PRISM2는 병리 보고서에서 추출한 임상 대화의 관점을 통해 조직 타일(tissue tiles)을 해석하도록 학습되었습니다. 이를 통해 모델은 세포가 어떻게 보이는지뿐만 아니라, 환자의 진단이라는 더 넓은 임상적 맥락 내에서 해당 세포의 존재가 무엇을 의미하는지 이해할 수 있습니다.

기술적 아키텍처 및 학습 규모

PRISM2의 기술적 정교함은 병리 분야 고유의 방대한 데이터 밀도를 처리하는 능력에 있습니다. 단일 전체 슬라이드 이미지는 엄청난 양의 정보를 포함하고 있어, 종종 표준 비전 트랜스포머(vision transformers)의 용량을 훨씬 초과합니다. PRISM2는 슬라이드당 수천 개의 개별 타일 임베딩을 하나의 응집된 표현으로 통합함으로써 이 문제를 해결합니다.

학습 데이터의 규모 또한 매우 인상적입니다. 이 모델은 230만 개의 전체 슬라이드 이미지를 아우르는 방대한 데이터셋으로 학습되었습니다. 이러한 시각적 타일과 그에 상응하는 임상 텍스트를 공동 학습함으로써, 모델은 사람이 읽을 수 있는 텍스트를 생성할 수 있는 멀티모달 정렬(multimodal alignment)을 학습합니다. PRISM2는 이진 분류 결과를 출력하는 대신, 실제 인간 병리학자의 추론 과정을 모방하여 구체적인 진단 질문에 답할 수 있습니다.

이것이 헬스케어 AI의 미래에 중요한 이유

PRISM2의 등장은 AI 지형이 '판별형 AI'(분류하는 AI)에서 '생성형 추론 AI'(설명하는 AI)로 변화하고 있음을 시사합니다. MedTech 분야의 개발자와 창업자들에게 이는 더욱 투명하고 유용한 임상 도구로 나아가는 움직임을 의미합니다.

AI가 대화를 통해 분석 결과를 전달할 수 있게 되면, AI는 '블랙박스' 도구가 아닌 협력적인 파트너가 됩니다. 병리학자들이 AI 기반의 통찰력을 신뢰하기 위해서는 설명 가능성(explainability)이 필요하기 때문에, 이러한 능력은 임상 도입에 있어 매우 중요합니다. 병리 보고서에 담긴 언어적 미묘함을 통합함으로써, PRISM2는 종양학 및 진단과 같이 위험도가 높고 전문적인 분야에 멀티모달 모델이 어떻게 적용될 수 있는지에 대한 새로운 기준을 제시합니다.

핵심 요약

  • 멀티모달 통합: PRISM2는 perceiver 기반 인코더를 사용하여 전체 슬라이드 조직 타일을 병리 보고서의 임상 대화와 연결합니다.
  • 방대한 규모: 견고한 특징 추출을 보장하기 위해 230만 개의 전체 슬라이드 이미지로 구성된 방대한 학습 세트를 사용하여 개발되었습니다.
  • 분류를 넘어선 추론: 픽셀만 분류하는 기존 모델과 달리, PRISM2는 복잡한 진단 질문에 답하기 위해 텍스트를 생성할 수 있습니다.

기사 요약: Microsoft와 Paige는 230만 개의 전체 슬라이드 병리 이미지를 입력받아 자연어로 진단 질문에 답할 수 있는 멀티모달 AI 모델인 PRISM2를 공개했습니다. 시각적 분석과 병리 보고서의 임상 대화를 결합함으로써, 이 시스템은 병리 분야의 AI를 단순한 이미지 분류에서 인간 병리학자의 사고 과정을 반영하는 추론 단계로 격상시킬 것을 약속합니다.

픽셀에서 추론으로

디지털 병리는 오랫동안 슬라이드를 라벨링해야 할 픽셀 그리드로 취급하는 AI에 의존해 왔습니다. 이러한 모델은 유사분열(mitoses)을 계산하거나 비정형 핵(atypical nuclei)을 표시하는 작업에는 뛰어나지만, 특정 소견이 환자의 전체적인 상황에서 왜 중요한지에 대한 설명은 하지 못합니다. PRISM2는 이를 변화시킵니다. 그 핵심은 수천 개의 이미지 타일을 하나의 고차원 표현으로 압축할 수 있는 신경망의 일종인 perceiver 기반 인코더입니다. 이 표현은 해당 병리 보고서에서 추출한 텍스트와 정렬되어, 모델이 시각적 패턴을 의사들이 이를 설명할 때 사용하는 언어와 연관시키도록 학습합니다.

그 결과, 단순히 "이 영역은 악성입니다"라고 말하는 것 이상의 역할을 수행하는 AI가 탄생했습니다. 이 AI는 "불규칙한 선 구조의 존재와 관찰된 기질 반응을 종합해 볼 때, 대장암의 임상 기록과 일치하는 중분화 선암종이 의심됩니다"와 같은 문장을 생성할 수 있습니다. 즉, PRISM2는 단순히 진단명을 내리는 것에 그치지 않고, 진단 뒤에 숨겨진 근거를 명확히 설명할 수 있습니다.

중요한 규모(Scale)

전체 슬라이드 이미지(whole-slide images)를 기반으로 모델을 학습시키는 것은 매우 방대한 데이터가 필요한 작업입니다. 슬라이드 한 장에는 수십억 개의 픽셀이 포함될 수 있으며, 이는 많은 이미지 기반 AI 시스템의 핵심인 표준 비전 트랜스포머(vision transformers)의 처리 용량을 훨씬 초과합니다. PRISM2는 각 슬라이드를 관리 가능한 타일 단위로 나누고, 각 타일을 임베딩한 후, 이를 슬라이드 수준의 벡터로 통합함으로써 이러한 한계를 극복합니다. 이 접근 방식은 계산 요구 사항을 감당 가능한 수준으로 유지하면서도 미세한 세부 사항을 보존합니다.

이번 파트너십은 병리 AI 분야에서 구축된 역대 최대 규모 중 하나인 230만 장의 전체 슬라이드 이미지 데이터셋을 활용했습니다. 각 이미지는 병리학자가 슬라이드를 검토한 후 작성한 텍스트 설명과 쌍을 이룹니다. 두 가지 양식(modality)을 동시에 학습함으로써, PRISM2는 시각적 단서를 진단 언어와 매핑하는 법을 익혔으며, 이를 통해 "가장 가능성 높은 원발 부위는 어디인가?" 또는 "조직에서 림프혈관 침범의 증거가 보이는가?"와 같은 질문에 일관성 있는 답변을 생성할 수 있게 되었습니다.

임상 현장을 변화시킬 수 있는 이유

병리학자는 암 진단의 문지기 역할을 하지만, 검토해야 할 슬라이드의 양은 인력이 따라잡을 수 없을 정도로 빠르게 증가하고 있습니다. 단순히 의심스러운 영역을 표시해 주는 AI도 도움이 되지만, 왜 그 영역을 표시했는지에 대한 근거를 알려주지 않아 임상의들이 판단을 내리는 데 어려움을 겪는 경우가 많습니다. PRISM2의 소견 설명 능력은 신뢰도와 도입 속도를 높일 수 있습니다. 알고리즘이 "특정 구조적 특징 때문에 고등급 종양으로 판단됩니다"라고 말하면, 병리학자는 그 결과를 불투명한 판결로 받아들이는 대신, 해당 근거를 검증하거나 반박하거나 혹은 이를 바탕으로 추가 판단을 내릴 수 있습니다.

메드테크(MedTech) 스타트업과 대형 의료 시스템의 AI 팀에게 이 모델은 새로운 기준을 제시합니다. 이미지와 도메인 특화 언어를 결합하는 멀티모달(multimodal) 학습이 정확성과 해석 가능성을 모두 갖춘 도구를 만들 수 있음을 입증했기 때문입니다. 이러한 결합은 미세한 병리학적 아형 분류(subtyping)에 따라 치료 결정이 달라지는 종양학 분야에서 특히 가치가 높습니다.

과제와 반론

진단적 대화가 가져올 기대감이 남아있는 과제들을 없애주는 것은 아닙니다. 첫째, 모델의 성능은 연구 환경에서 보고된 것이며, 다양한 실험실 워크플로, 염색 프로토콜, 스캐너 제조사에 걸친 실제 현장에서의 검증은 아직 남아 있습니다. 정제된 데이터셋에서는 잘 작동하는 시스템이라도 일상적인 진료 현장의 가변성에 직면하면 문제가 생길 수 있습니다.

둘째, 230만 장의 슬라이드와 보고서로 구성된 학습 데이터는 특정 기관들로부터 수집되었을 가능성이 높습니다. 만약 기초 코호트(cohort)가 환자 인구 통계의 전체 스펙트럼을 반영하지 못한다면, 모델은 편향성을 물려받아 소수 집단의 질병 양상을 잘못 분류할 위험이 있습니다.

셋째, 서술형 결과물을 생성하는 AI에 대한 규제 경로는 이진 분류기(binary classifiers)에 비해 아직 확립되지 않았습니다. 규제 기관은 정확성뿐만 아니라, 적절히 경고되지 않을 경우 임상의를 오도할 수 있는 잘못된 설명의 안전성까지도 평가해야 합니다.

마지막으로, 전체 슬라이드 데이터에 perceiver 기반 인코더를 실행하는 데 드는 계산 비용은 만만치 않습니다. 병원은 충분한 GPU 인프라나 클라우드 계약이 필요하며, 이는 특히 규모가 작은 병리 검사소의 비용 효율성 측면에서 의문을 제기합니다.

향후 주목해야 할 점

  • 임상 시험: PRISM2의 지원을 받은 진단과 표준 진료를 비교하는 전향적 연구(prospective studies)의 결과는 규제 승인 및 도입 여부를 결정짓는 결정적인 요인이 될 것입니다.
  • 통합 파이프라인: 모델이 기존 디지털 병리 플랫폼에 얼마나 쉽게 통합되느냐가 도입 속도에 영향을 미칠 것입니다. 원활한 API 접근성과 일반적인 슬라이드 뷰어 소프트웨어와의 호환성이 필수적입니다.
  • 설명 가능성 지표: 생성된 대화가 전문가의 추론과 얼마나 잘 일치하는지를 정량화하는 독립적인 벤치마크는 "블랙박스" 문제를 해결하는 데 도움이 될 것입니다.
  • 가격 책정 및 라이선스: 기술이 구독형으로 제공될지, 슬라이드당 비용을 지불할지, 아니면 온프레미스(on-premise) 솔루션으로 제공될지 등 파트너십의 비즈니스 모델에 따라 도입 가능한 기관의 범위가 달라질 것입니다.

요약

PRISM2는 AI가 단순히 세포를 분류하는 수준을 넘어, 그 세포들이 담고 있는 임상적 서사를 설명할 수 있음을 보여줍니다. Microsoft와 Paige는 병리학자들이 매일 사용하는 언어와 결합된 방대한 양의 전체 슬라이드 이미지(whole-slide images)를 학습시켜, 마치 대화를 나누는 듯한 방식으로 진단 질문에 답할 수 있는 시스템을 구축했습니다. 만약 이 모델이 실제 실험실 현장의 복잡한 환경에서도 신뢰성을 입증한다면, AI는 단순한 '침묵의 탐지기'를 넘어 진정한 '협업자'가 될 것이며, 병리학이 환자 진료에 기여하는 방식을 근본적으로 변화시킬 것입니다.