কীভাবে PRISM2 ক্লিনিক্যাল ডায়ালগ ব্যবহার করে প্যাথলজি AI-তে বিপ্লব ঘটাচ্ছে

কীভাবে PRISM2 ক্লিনিক্যাল ডায়ালগ ব্যবহার করে প্যাথলজি AI-তে বিপ্লব ঘটাচ্ছে

Paige এবং Microsoft-এর মধ্যে একটি যুগান্তকারী সহযোগিতার মাধ্যমে PRISM2 প্রবর্তিত হয়েছে, যা একটি মাল্টিমোডাল AI মডেল এবং এটি ভিজ্যুয়াল প্যাথলজি ও ক্লিনিক্যাল রিজনিংয়ের (clinical reasoning) মধ্যে ব্যবধান ঘুচিয়ে দেওয়ার জন্য ডিজাইন করা হয়েছে। হোল-স্লাইড ইমেজিংয়ের (whole-slide imaging) সাথে মেডিকেল ডায়ালগের সূক্ষ্মতাগুলোকে সমন্বিত করার মাধ্যমে, এই মডেলটি সাধারণ প্যাটার্ন রিকগনিশনের ঊর্ধ্বে উঠে প্রকৃত ডায়াগনস্টিক ব্যাখ্যার দিকে এগিয়ে যাচ্ছে।

পিক্সেল ক্লাসিফিকেশনের ঊর্ধ্বে ওঠা

ডিজিটাল প্যাথলজিতে প্রথাগত AI মূলত সুপারভাইজড লার্নিং টাস্কের ওপর গুরুত্ব দেয়, যেমন নির্দিষ্ট পিক্সেল ক্লাসিফাই করা বা কোষীয় গঠন শনাক্ত করা। কার্যকর হলেও, জটিল ক্লিনিক্যাল সিদ্ধান্ত গ্রহণের জন্য প্রয়োজনীয় প্রেক্ষাপট বা কনটেক্সচুয়াল ডেপথ (contextual depth) এই মডেলগুলোর প্রায়শই থাকে না। PRISM2 একটি perceiver-based encoder ব্যবহার করে এই প্রচলিত ধারণা বদলে দিচ্ছে, যা হোল-স্লাইড ইমেজ (WSIs)-কে সম্পূর্ণ ভিন্নভাবে প্রসেস করে।

কেবল ছবি লেবেলিং করার পরিবর্তে, PRISM2-কে প্যাথলজি রিপোর্ট থেকে সংগৃহীত ক্লিনিক্যাল ডায়ালগের মাধ্যমে টিস্যু টাইলস (tissue tiles) ব্যাখ্যা করার জন্য প্রশিক্ষণ দেওয়া হয়েছে। এটি মডেলটিকে কেবল একটি কোষ দেখতে কেমন তা বুঝতে সাহায্য করে না, বরং রোগীর রোগ নির্ণয়ের বৃহত্তর ক্লিনিক্যাল প্রেক্ষাপটে সেই কোষের উপস্থিতি কী নির্দেশ করে তাও বুঝতে সক্ষম করে।

টেকনিক্যাল আর্কিটেকচার এবং ট্রেনিং স্কেল

PRISM2-এর প্রযুক্তিগত উৎকর্ষতা রয়েছে প্যাথলজিতে বিদ্যমান বিশাল ডেটা ডেনসিটি হ্যান্ডেল করার ক্ষমতার মধ্যে। একটি মাত্র হোল-স্লাইড ইমেজে প্রচুর পরিমাণে তথ্য থাকে, যা প্রায়শই স্ট্যান্ডার্ড ভিশন ট্রান্সফরমারগুলোর (vision transformers) ক্ষমতার চেয়ে অনেক বেশি। PRISM2 প্রতি স্লাইডে হাজার হাজার স্বতন্ত্র টাইল এমবেডিংকে (tile embeddings) একটি একক ও সুসংগত রিপ্রেজেন্টেশনে একত্রিত করার মাধ্যমে এই সমস্যার সমাধান করে।

ট্রেনিং ডেটার স্কেলও সমানভাবে চিত্তাকর্ষক। মডেলটিকে ২.৩ মিলিয়ন হোল-স্লাইড ইমেজ সম্বলিত একটি বিশাল ডেটাসেটের ওপর প্রশিক্ষণ দেওয়া হয়েছে। এই ভিজ্যুয়াল টাইলস এবং সংশ্লিষ্ট ক্লিনিক্যাল টেক্সট—উভয়ের ওপর যৌথভাবে প্রশিক্ষণের মাধ্যমে, মডেলটি একটি মাল্টিমোডাল অ্যালাইনমেন্ট শেখে যা একে মানুষের পাঠযোগ্য টেক্সট তৈরি করতে সাহায্য করে। কেবল বাইনারি ক্লাসিফিকেশন আউটপুট দেওয়ার পরিবর্তে, PRISM2 প্রকৃতপক্ষে নির্দিষ্ট ডায়াগনস্টিক প্রশ্নের উত্তর দিতে পারে, যা একজন মানব প্যাথলজিস্টের রিজনিং প্রক্রিয়াকে অনুকরণ করে।

কেন এটি হেলথকেয়ার AI-এর ভবিষ্যতের জন্য গুরুত্বপূর্ণ

PRISM2-এর আবির্ভাব AI জগতের একটি পরিবর্তনের ইঙ্গিত দেয়—"discriminative AI" (যা শ্রেণীবদ্ধ করে) থেকে "generative reasoning AI" (যা ব্যাখ্যা করে)-এর দিকে। MedTech ক্ষেত্রে ডেভেলপার এবং উদ্যোক্তাদের জন্য এটি আরও স্বচ্ছ এবং কার্যকর ক্লিনিক্যাল টুলের দিকে একটি পদক্ষেপ।

যখন একটি AI ডায়ালগের মাধ্যমে তার প্রাপ্ত ফলাফল প্রকাশ করতে পারে, তখন এটি একটি "ব্ল্যাক বক্স" টুলের পরিবর্তে একটি সহযোগিতামূলক অংশীদারে পরিণত হয়। ক্লিনিক্যাল ক্ষেত্রে এর গ্রহণযোগ্যতার জন্য এই সক্ষমতা অত্যন্ত গুরুত্বপূর্ণ, কারণ প্যাথলজিস্টদের AI-চালিত ইনসাইট বা অন্তর্দৃষ্টির ওপর আস্থা রাখতে হলে সেগুলোর ব্যাখ্যাযোগ্যতা (explainability) প্রয়োজন। প্যাথলজি রিপোর্টে পাওয়া ভাষাগত সূক্ষ্মতাগুলোকে সমন্বিত করার মাধ্যমে, PRISM2 অনকোলজি এবং ডায়াগনস্টিকসের মতো উচ্চ-ঝুঁকিপূর্ণ ও বিশেষায়িত ক্ষেত্রে মাল্টিমোডাল মডেল কীভাবে প্রয়োগ করা যেতে পারে তার একটি নতুন মানদণ্ড স্থাপন করেছে।

মূল বিষয়সমূহ

  • মাল্টিমোডাল ইন্টিগ্রেশন: PRISM2 হোল-স্লাইড টিস্যু টাইলসকে প্যাথলজি রিপোর্ট থেকে প্রাপ্ত ক্লিনিক্যাল ডায়ালগের সাথে যুক্ত করতে একটি perceiver-based encoder ব্যবহার করে।
  • বিশাল স্কেল: শক্তিশালী ফিচার এক্সট্রাকশন নিশ্চিত করতে ২.৩ মিলিয়ন হোল-স্লাইড ইমেজ সম্বলিত একটি বিশাল ট্রেনিং সেট ব্যবহার করে মডেলটি তৈরি করা হয়েছে।
  • ক্লাসিফিকেশনের চেয়ে রিজনিং-এ গুরুত্ব: প্রথাগত মডেলগুলোর মতো কেবল পিক্সেল ক্লাসিফাই করার পরিবর্তে, PRISM2 জটিল ডায়াগনস্টিক প্রশ্নের উত্তর দিতে টেক্সট তৈরি করতে পারে।

ARTICLE: Microsoft এবং Paige PRISM2 উন্মোচন করেছে, যা একটি মাল্টিমোডাল AI মডেল। এটি ২.৩ মিলিয়ন হোল-স্লাইড প্যাথলজি ইমেজ গ্রহণ করতে পারে এবং প্রাকৃতিক ভাষায় (natural language) ডায়াগনস্টিক প্রশ্নের উত্তর দিতে পারে। ভিজ্যুয়াল অ্যানালাইসিসের সাথে প্যাথলজি রিপোর্টে পাওয়া ক্লিনিক্যাল ডায়ালগের সমন্বয় ঘটিয়ে, এই সিস্টেমটি প্যাথলজিতে AI-কে কেবল ইমেজ ক্লাসিফিকেশন থেকে মানব প্যাথলজিস্টের চিন্তাপ্রক্রিয়ার মতো রিজনিং বা যুক্তিনির্ভর বিশ্লেষণের দিকে নিয়ে যাওয়ার প্রতিশ্রুতি দেয়।

পিক্সেল থেকে রিজনিং-এর দিকে

ডিজিটাল প্যাথলজি দীর্ঘকাল ধরে এমন AI-এর ওপর নির্ভরশীল ছিল যা একটি স্লাইডকে লেবেলিং করার জন্য পিক্সেলের একটি গ্রিড হিসেবে বিবেচনা করে। এই ধরনের মডেলগুলো মাইটোসিস (mitoses) গণনা করা বা অস্বাভাবিক নিউক্লিয়াস (atypical nuclei) শনাক্ত করার মতো কাজে দক্ষ, কিন্তু একটি ফলাফল রোগীর সামগ্রিক অবস্থায় কেন গুরুত্বপূর্ণ, তা ব্যাখ্যা করার ক্ষেত্রে এগুলো সীমাবদ্ধ। PRISM2 সেটি পরিবর্তন করে দিচ্ছে। এর মূল ভিত্তি হলো একটি perceiver-based encoder—এক ধরণের নিউরাল নেটওয়ার্ক যা হাজার হাজার ইমেজ টাইলসকে একটি একক, উচ্চ-মাত্রিক (high-dimensional) রিপ্রেজেন্টেশনে সংকুচিত করতে পারে। সেই রিপ্রেজেন্টেশনটিকে এরপর সংশ্লিষ্ট প্যাথলজি রিপোর্ট থেকে সংগৃহীত টেক্সটের সাথে অ্যালাইন করা হয়, যা মডেলটিকে ভিজ্যুয়াল প্যাটার্নগুলোকে ডাক্তারদের ব্যবহৃত ভাষার সাথে সম্পর্কিত করতে শেখায়।

এর ফলাফল হলো এমন একটি AI যা কেবল "এই অঞ্চলটি ম্যালিগন্যান্ট (malignant)" বলার চেয়েও বেশি কিছু করতে পারে। এটি এমন একটি বাক্য তৈরি করতে পারে যেমন, "অস্বাভাবিক গ্রন্থি গঠন (irregular glandular formations) এবং পর্যবেক্ষিত স্ট্রোমাল রিঅ্যাকশনের (stromal reaction) উপস্থিতি একটি মাঝারি মাত্রার ডিফারেনশিয়েটেড অ্যাডিনোকার্সিনোমা (moderately differentiated adenocarcinoma) নির্দেশ করে, যা কোলোরেক্টাল ক্যান্সারের ক্লিনিকাল ইতিহাসের সাথে সামঞ্জস্যপূর্ণ।" অন্য কথায়, PRISM2 কেবল একটি লেবেল নয়, বরং একটি রোগ নির্ণয়ের পেছনের যুক্তিটিও স্পষ্টভাবে ব্যাখ্যা করতে পারে।

প্রভাব বিস্তারকারী স্কেল

হোল-স্লাইড ইমেজের (whole-slide images) ওপর একটি মডেলকে প্রশিক্ষণ দেওয়া একটি অত্যন্ত তথ্য-নিবিড় (data-intensive) প্রক্রিয়া। একটি মাত্র স্লাইডে বিলিয়ন বিলিয়ন পিক্সেল থাকতে পারে, যা অনেক ইমেজ-ভিত্তিক AI সিস্টেমের মূল চালিকাশক্তি হলো স্ট্যান্ডার্ড vision transformers-এর ক্ষমতার চেয়ে অনেক বেশি। PRISM2 প্রতিটি স্লাইডকে ছোট ছোট ম্যানেজেবল টাইলসে (tiles) বিভক্ত করে, প্রতিটি টাইলকে এমবেড (embedding) করে এবং তারপর সেই এমবেডিংগুলোকে একটি স্লাইড-লেভেল ভেক্টরে একত্রিত করার মাধ্যমে এই সীমাবদ্ধতা কাটিয়ে ওঠে। এই পদ্ধতিটি কম্পিউটেশনাল চাহিদা নিয়ন্ত্রণে রেখে সূক্ষ্ম ডিটেইল বা খুঁটিনাটি বজায় রাখে।

এই অংশীদারিত্বটি ২.৩ মিলিয়ন হোল-স্লাইড ইমেজের একটি ডেটাসেট ব্যবহার করেছে—যা প্যাথলজি AI-এর জন্য এ পর্যন্ত সংগৃহীত বৃহত্তম সংগ্রহগুলোর মধ্যে একটি। প্রতিটি ইমেজকে প্যাথলজিস্টদের লেখা টেক্সট কমেন্ট্রির সাথে যুক্ত করা হয়েছিল, যা তারা স্লাইডটি পর্যালোচনার পর লিখেছিলেন। একই সাথে উভয় মোডালিটির (modalities) ওপর প্রশিক্ষণ নেওয়ার মাধ্যমে, PRISM2 ভিজ্যুয়াল সংকেতগুলোকে রোগ নির্ণয়ের ভাষার সাথে মানিয়ে নিতে শিখেছে, যা একে "সবচেয়ে সম্ভাব্য প্রাইমারি সাইট কোনটি?" বা "টিস্যুতে কি লিম্ফোভাসকুলার ইনভেশনের (lymphovascular invasion) প্রমাণ আছে?"—এর মতো প্রশ্নের সুসংগত উত্তর দিতে সক্ষম করে তোলে।

কেন এটি ক্লিনিক্যাল প্র্যাকটিস বদলে দিতে পারে

প্যাথলজিস্টরা হলেন ক্যান্সার রোগ নির্ণয়ের প্রধান নিয়ন্ত্রক, কিন্তু তাদের পর্যালোচনা করার জন্য স্লাইডের সংখ্যা জনবলের তুলনায় দ্রুতগতিতে বাড়ছে। যে AI কেবল সন্দেহজনক অঞ্চলগুলোকে চিহ্নিত (flag) করে তা সহায়ক হলেও, এটি প্রায়শই কেন চিহ্নিত করা হলো সেই ভিত্তি সম্পর্কে চিকিৎসকদের অন্ধকারে রেখে দেয়। PRISM2-এর তার প্রাপ্ত ফলাফল ব্যাখ্যা করার ক্ষমতা বিশ্বাসযোগ্যতা এবং এর ব্যবহার দ্রুততর করতে পারে। যখন একটি অ্যালগরিদম বলে, "আমি এই নির্দিষ্ট আর্কিটেকচারাল ফিচারের কারণে একটি হাই-গ্রেড টিউমার দেখতে পাচ্ছি," তখন একজন প্যাথলজিস্ট সেই ফলাফলকে একটি অস্পষ্ট রায় হিসেবে গ্রহণ না করে বরং সেই যুক্তির সত্যতা যাচাই করতে পারেন, প্রতিবাদ করতে পারেন বা সেই যুক্তির ওপর ভিত্তি করে সিদ্ধান্ত নিতে পারেন।

MedTech স্টার্টআপ এবং বড় স্বাস্থ্যসেবা ব্যবস্থার AI টিমগুলোর জন্য এই মডেলটি একটি নতুন মানদণ্ড স্থাপন করেছে। এটি প্রমাণ করে যে মাল্টিমোডাল ট্রেনিং (multimodal training)—অর্থাৎ ইমেজ এবং ডোমেইন-নির্দিষ্ট ভাষার সংমিশ্রণ—এমন টুল তৈরি করতে পারে যা নির্ভুল এবং ব্যাখ্যাযোগ্য উভয়ই। এই সংমিশ্রণটি অনকোলজিতে (oncology) বিশেষভাবে মূল্যবান, যেখানে চিকিৎসার সিদ্ধান্তগুলো সূক্ষ্ম প্যাথলজিক্যাল সাবটাইপিংয়ের (pathological subtyping) ওপর নির্ভর করে।

বাধা এবং পাল্টা যুক্তি

ডায়াগনস্টিক ডায়ালগের প্রতিশ্রুতি বিদ্যমান চ্যালেঞ্জগুলোকে মুছে ফেলে না। প্রথমত, মডেলটির পারফরম্যান্স গবেষণার পরিবেশে রিপোর্ট করা হয়েছে; বিভিন্ন ল্যাব ওয়ার্কফ্লো, স্টেনিং প্রোটোকল এবং স্ক্যানার ভেন্ডরগুলোর ক্ষেত্রে বাস্তব জগতের যাচাইকরণ (real-world validation) এখনও বাকি। একটি কিউরেটেড ডেটাসেটে কাজ করা সিস্টেম দৈনন্দিন কাজের বৈচিত্র্যের মুখোমুখি হলে হোঁচট খেতে পারে।

দ্বিতীয়ত, ট্রেনিং ডেটা—২.৩ মিলিয়ন স্লাইড এবং তাদের রিপোর্ট—সম্ভবত সীমিত সংখ্যক প্রতিষ্ঠান থেকে নেওয়া হয়েছে। যদি মূল কোহর্টটি (cohort) রোগীর জনতাত্ত্বিক বৈচিত্র্যের (demographics) পূর্ণ চিত্র প্রতিফলিত না করে, তবে মডেলটি পক্ষপাতিত্ব (bias) অর্জন করতে পারে, যা সম্ভাব্যভাবে কম প্রতিনিধিত্বকারী রোগের লক্ষণগুলোকে ভুলভাবে শ্রেণীবদ্ধ করতে পারে।

তৃতীয়ত, বর্ণনামূলক আউটপুট (narrative output) তৈরি করে এমন AI-এর জন্য রেগুলেটরি পাথওয়ে বা নিয়ন্ত্রণমূলক পথগুলো বাইনারি ক্লাসিফায়ারের তুলনায় কম প্রতিষ্ঠিত। সংস্থাগুলোকে কেবল নির্ভুলতা নয়, বরং ভুল ব্যাখ্যার নিরাপত্তাটিও মূল্যায়ন করতে হবে, যা সঠিকভাবে চিহ্নিত না করা হলে চিকিৎসকদের বিভ্রান্ত করতে পারে।

পরিশেষে, হোল-স্লাইড ডেটার ওপর একটি perceiver-based encoder চালানোর কম্পিউটেশনাল খরচ মোটেও কম নয়। হাসপাতালগুলোর পর্যাপ্ত GPU ইনফ্রাস্ট্রাকচার বা ক্লাউড চুক্তির প্রয়োজন হবে, যা বিশেষ করে ছোট প্যাথলজি ল্যাবগুলোর জন্য খরচ-সাশ্রয়ী হওয়ার বিষয়ে প্রশ্ন তোলে।

পরবর্তীতে যা লক্ষ্য রাখতে হবে

  • ক্লিনিক্যাল ট্রায়াল: প্রস্পেক্টিভ স্টাডিজ থেকে প্রাপ্ত প্রমাণ, যা PRISM2-এর সাহায্যে করা রোগ নির্ণয়ের সাথে প্রচলিত পদ্ধতির তুলনা করবে, তা রেগুলেটরি অনুমোদন এবং গ্রহণের ক্ষেত্রে নির্ণায়ক ভূমিকা পালন করবে।
  • ইন্টিগ্রেশন পাইপলাইন: মডেলটি বিদ্যমান ডিজিটাল প্যাথলজি প্ল্যাটফর্মের সাথে কতটা সহজে যুক্ত হতে পারে তা এর প্রসারের গতিকে প্রভাবিত করবে। নিরবচ্ছিন্ন API অ্যাক্সেস এবং সাধারণ স্লাইড-ভিউয়ার সফটওয়্যারের সাথে সামঞ্জস্যতা অত্যন্ত জরুরি।
  • এক্সপ্লেইনাবিলিটি মেট্রিক্স: স্বাধীন বেঞ্চমার্ক যা পরিমাপ করবে যে তৈরি করা ডায়ালগটি বিশেষজ্ঞের যুক্তির সাথে কতটা সামঞ্জস্যপূর্ণ, তা "ব্ল্যাক-বক্স" সংক্রান্ত উদ্বেগ নিরসনে সাহায্য করবে।
  • মূল্য নির্ধারণ এবং লাইসেন্সিং: অংশীদারিত্বের ব্যবসায়িক মডেল—প্রযুক্তিটি সাবস্ক্রিপশন হিসেবে, প্রতি স্লাইড ফি হিসেবে, নাকি অন-প্রিমিস (on-premise) সমাধান হিসেবে অফার করা হবে—তা কোন প্রতিষ্ঠানগুলো এটি বহন করতে পারবে তা নির্ধারণ করবে।

সারকথা

PRISM2 দেখায় যে AI কেবল কোষ শনাক্ত করার (labeling) মধ্যেই সীমাবদ্ধ না থেকে, সেই কোষগুলো যে ক্লিনিক্যাল প্রেক্ষাপট বা গল্প তুলে ধরে তা স্পষ্টভাবে বর্ণনা করতে পারে। প্যাথলজিস্টরা প্রতিদিন যে ভাষা ব্যবহার করেন, তার সাথে বিশাল সংখ্যক whole-slide images-এর সমন্বয়ে প্রশিক্ষণ দিয়ে Microsoft এবং Paige এমন একটি সিস্টেম তৈরি করেছে, যা রোগ নির্ণয়ের (diagnostic) প্রশ্নের উত্তর এমনভাবে দিতে পারে যা অনেকটা কথোপকথনের মতো মনে হয়। যদি এই মডেলটি প্রতিদিনের ল্যাবরেটরির জটিল ও বাস্তব পরিস্থিতিতে নির্ভরযোগ্য প্রমাণিত হয়, তবে এটি AI-কে কেবল একটি নীরব শনাক্তকারী (silent detector) হিসেবে না রেখে বরং একজন প্রকৃত সহযোগী হিসেবে প্রতিষ্ঠিত করতে পারে, যা প্যাথলজির মাধ্যমে রোগীর চিকিৎসায় তথ্য প্রদানের পদ্ধতিকে আমূল বদলে দেবে।