فشل محرك التنبيه من إنتان الدم (Sepsis) التابع لشركة Epic في عملية تحقق أجريت عام 2021 في Michigan Medicine، حيث أغفل ثلثي المرضى الذين أصيبوا لاحقًا بإنتان الدم، بينما أطلق إنذارًا لـ 18% من جميع حالات الدخول. ويعود هذا الخطأ إلى خطأ كلاسيكي في "تسرب البيانات" (data-leakage): حيث اعتبر النموذج طلب الطبيب للمضادات الحيوية — وهو علامة تدل بالفعل على الاشتباه في وجود عدوى — كعامل تنبؤ، مما أدى في الأساس إلى تكرار قرار اتخذه الطبيب بالفعل.
لماذا فشل النموذج
فحص فريق Michigan 38,455 إقامة في المستشفى، وهو حجم مشروع نموذجي لتحسين الجودة يستمر لعدة سنوات. وعدت المعايير المرجعية الداخلية لشركة Epic بدقة عالية، لكن الاختبار المستقل أظهر عكس ذلك. أطلقت تنبيهات "المخاطر العالية" للنموذج في ما يقرب من خُمس المرضى، ومع ذلك أفلتت ثلثا حالات إنتان الدم الحقيقية دون ملاحظتها. ومن الناحية العملية، كان النظام يصرخ "احذر" بشكل مفرط للغاية بينما يغفل عن الأحداث ذاتها التي كان من المفترض أن يرصدها.
لم يكن السبب الجذري خللاً في خوارزمية تعلم الآلة نفسها، بل في البيانات التي تم تغذيتها بها. فمن خلال استخدام وجود طلب مضاد حيوي كمدخل، تعلم النموذج التنبؤ بخيار الطبيب الذي اتخذه بالفعل. وعندما كان النموذج يضع علامة على مريض ما، كان يفعل ذلك غالبًا لأن الطبيب قد طلب بالفعل مضادات حيوية، وليس لأن فسيولوجيا المريض تشير إلى إنتان دم وشيك.
مشكلة أوسع في الذكاء الاصطناعي بالمستشفيات
تم نشر نموذج إنتان الدم الخاص بـ Epic في مئات المستشفيات لسنوات، ومع ذلك ظل خطأ تسرب البيانات مخفيًا حتى كشفت عنه جهود تحقق مركزة. وتوضح هذه الواقعة ضعفًا منهجيًا: تفتقر معظم مشاريع الذكاء الاصطناعي في الأنظمة الصحية إلى الضوابط التشغيلية اللازمة لاكتشاف مثل هذه المشكلات مبكرًا.
- غياب الاختبارات الخارجية – لم تخضع المستشفيات لاختبارات خارجية.
- غياب المراقبة المستمرة – لم تكن هناك مراقبة.
- غياب الملكية الواضحة – بدون فريق معين مسؤول عن جودة البيانات وأداء النموذج، تضيع المشكلات بين الثغرات.
تترك هذه الفجوات العديد من مبادرات الذكاء الاصطناعي عالقة في "مرحلة المشاريع التجريبية العالقة" (pilot purgatory)، دون أن تنتقل أبدًا إلى ما بعد مرحلة إثبات المفهوم.
التكلفة الخفية للبيانات المجزأة
تُظهر حالة إنتان الدم أيضًا كيف تؤدي الأنظمة البيئية المجزأة لتكنولوجيا المعلومات الصحية إلى إفشال الذكاء الاصطناعي. وتشمل العقبات الشائعة ما يلي:
- سجلات المرضى المحبوسة في وحدات EHR قديمة لا تتبادل البيانات تلقائيًا.
- أنظمة التصوير والمختبرات التي لا يمكنها التواصل مع بعضها البعض، مما يضطر الموظفين إلى نقل الملفات يدويًا.
- تكرار معرفات المرضى مما يؤدي إلى تقسيم بيانات الشخص الواحد عبر سجلات متعددة.
- الملاحظات السريرية والعلامات الحيوية المخزنة في صوامع بيانات منفصلة، دون دمجها أبدًا لتدريب النموذج.
عندما يتم تدريب نموذج على مجموعة بيانات نظيفة ومنسقة، ثم يتم تغذيته ببيانات حية وفوضوية، يتدهور الأداء بصمت. ويفقد الأطباء ثقتهم بسرعة؛ فالممرضة التي تضطر لملاحقة التنبيهات عبر شاشات متعددة ستتجاهلها، حتى لو كانت الخوارزمية الأساسية سليمة تقنيًا.
أربع ركائز "مملة" لذكاء اصطناعي موثوق
يعتمد نشر الذكاء الاصطناعي الفعال على أربع قدرات عملية نادرًا ما تتصدر العناوين:
- التوافق التشغيلي (Interoperability) – يجب أن تتدفق البيانات بين السجلات الصحية الإلكترونية (EHRs)، والمختبرات، ومنصات التصوير، وأدوات دعم القرار دون خطوات تصدير واستيراد يدوية.
- الحوكمة (Governance) – يجب أن يكون هناك شخص أو فريق مسؤول عن جودة البيانات ومراقبة مخرجات النموذج بمرور الوقت.
- التكامل مع سير العمل (Workflow integration) – يجب أن تظهر التنبيهات ضمن قائمة العمل الحالية للطبيب؛ فكثرة النقرات أو الشاشات الإضافية تقتل معدلات الاعتماد.
- العمليات القابلة للتوسع (Scalable operations) – تعد المراقبة الآلية، وتحليل إجهاد التنبيهات، ومسارات إعادة التدريب الدورية أمورًا ضرورية قبل وصول النموذج إلى مرحلة الإنتاج.
إن تخطي أي من هذه الخطوات يترك المشروع عرضة لنوع الفشل الصامت الذي شوهد في نموذج إنتان الدم الخاص بـ Epic.
أسئلة يجب طرحها قبل شراء حل للذكاء الاصطناعي
يمكن للمستشفيات تجنب الأخطاء المكلفة من خلال المطالبة بإجابات ملموسة:
- هل يمكنك تتبع بيانات مريض واحد عبر كل نظام سيستخدمه النموذج؟
- من هو الشخص (بالاسم) المسؤول عن الحفاظ على جودة البيانات والإشراف على أداء النموذج؟
- هل تم اختبار التنبيهات مع الأطباء خلال نوبة عمل حقيقية، وليس فقط في بيئة تجريبية (sandbox)؟
- هل هناك خطة مراقبة موثقة تحدد كيفية تحديد انحراف الأداء ومعالجته؟
إذا لم يستطع المورد الإشارة إلى شخص أو عملية أو لوحة مراقبة، فيجب على المؤسسة التوقف وإعادة التقييم.
الخلاصة
لم يفشل نموذج Epic للتنبؤ بتسمم الدم (sepsis) لأن تعلم الآلة غير مناسب للمستشفيات؛ بل فشل بسبب غياب خطوط أنابيب البيانات وهياكل الحوكمة المحيطة به. إن النموذج الذي يتنبأ بقرار الطبيب نفسه يبعث برسالة تحذير مفادها أن طبقة هندسة البيانات، وليس الخوارزمية، هي التي تحتاج إلى تطوير. يتطلب بناء ذكاء اصطناعي موثوق في مجال الرعاية الصحية نفس البنية التحتية "المملة" التي تضمن استمرارية عمل أي نظام تقني حيوي: بيانات نظيفة ومترابطة، ومساءلة واضحة، وتنبيهات مدمجة في سير العمل، ومراقبة استباقية. وبدون هذه العناصر، حتى أكثر النماذج تطوراً سينتهي بها الأمر إلى إطلاق تحذيرات خاطئة للأشخاص الخطأ.
