قضت السيارات ذاتية القيادة سنوات في اتباع مجموعات تعليمات صارمة. كتب المهندسون الآلاف من عبارات "إذا-إذن"؛ إذا عبر أحد المشاة، اضغط على المكابح. إذا تحولت الإشارة إلى اللون الأحمر، توقف. إذا انحنى المسار، وجه المقود. يعمل هذا النهج عندما يتصرف العالم تماماً كما هو متوقع، لكن القيادة الحقيقية أكثر تعقيداً وفوضوية. لا يمكن لكتاب القواعد أن يغطي كل طريق ريفي طيني، أو تقاطع غير محدد، أو دراجة هوائية تتنقل عبر حركة المرور. عندما تتغير البيئة، تنهار الأوامر الصارمة. نحن بحاجة إلى أنظمة تتعلم معنى القيادة الجيدة بدلاً من مجرد اتباع قائمة مهام.

ما وراء القواعد المبرمجة مسبقاً

تعتمد الأنظمة المستقلة التقليدية على البرمجة الصريحة، وهي تعمل بشكل جيد في البيئات المغلقة مثل أرضيات المستودعات، والمسارات المخصصة، والطقس المتوقع. أما على الطرق العامة، فغالباً ما ينهار المنطق نفسه.

تخيل منطقة بناء بها لافتات مكتوبة بخط اليد، وأقماع مبعثرة بزوايا غريبة، وعامل إشارات يوجه حركة المرور. يريد النظام القائم على القواعد إشارة مرور واضحة، لكنه لا يرى سوى الفوضى. فبدون قاعدة محددة لـ "شخص يرتدي سترة برتقالية ويشير بيده إلى اليسار"، تتجمد السيارة أو تخمن بشكل خاطئ. يتعامل السائقون البشر مع هذا الموقف فوراً لأننا نفسر النوايا والسياق، وليس مجرد البكسلات؛ فنحن نقرأ المشهد. ويتطلب تعليم الآلة القيام بالمثل نهجاً مختلفاً جذرياً.

التعلم بالمراقبة: التعلم التعزيزي العكسي

هنا يأتي دور التعلم التعزيزي العكسي (Inverse Reinforcement Learning) ليغير قواعد اللعبة. في التعلم التعزيزي القياسي، تعطي الذكاء الاصطناعي هدفاً ودالة مكافأة؛ الوصول إلى الوجهة بسرعة يمنحك نقاطاً، والاصطدام بالرصيف يفقدك نقاطاً. يتخبط الوكيل (agent) حتى يكتشف سياسة تزيد من درجته إلى أقصى حد. لكن القيادة لا تتعلق بالكفاءة فحسب، بل تتعلق بالراحة، والسلامة، والقانونية، والأعراف الاجتماعية. إن كتابة مكافأة رياضية لـ "القيادة مثل إنسان حذر ولكن كفء" أمر مستحيل تقريباً.

يقلب التعلم التعزيزي العكسي المشكلة رأساً على عقب. فبدلاً من تسليم الذكاء الاصطناعي هدفاً، تعرض عليه أمثلة. تراقب الخوارزمية ساعات من لقطات القيادة البشرية، وتلاحظ متى يبطئ الإنسان سرعته، أو يغير المسار مبكراً، أو يفسح المجال لشاحنة تندمج في الطريق. هي لا تحفظ زاوية التوجيه الدقيقة فحسب، بل تعمل بشكل عكسي لاستنتاج السبب. ربما أبطأ السائق لأنه رأى طفلاً يقف بالقرب من الرصيف، رغم أن الشارع كان خالياً قانونياً. يستخلص الذكاء الاصطناعي المكافأة الخفية: القرب من المشاة أمر مهم، حتى بدون وجود ممر مشاة.

من خلال التعامل مع الإنسان كخبير قام بالفعل بحل مشكلة التحسين (optimization problem)، تستعيد الخوارزمية دالة التكلفة (cost function) التي يعمل هذا الخبير على تقليلها. وبمجرد أن يفهم النظام التفضيلات الأساسية، مثل تفضيل الكبح السلس على التوقف المفاجئ أو الحفاظ على مركز المسار بدلاً من اختصار المنعطفات، يمكنه التعميم. فعندما يواجه طريقاً جديداً في مدينة مختلفة، يعرف تقريباً ما الذي سيقدره السائق الجيد في ذلك الإعداد غير المألوف.

اتخاذ القرارات: شبكات Q العميقة

فهم المكافآت هو نصف المعركة فقط، فالسيارة لا تزال بحاجة إلى التصرف. تتولى شبكات Q العميقة (Deep Q-Networks) عملية اتخاذ القرار من خلال معالجة البيانات الحسية لاختيار أفضل إجراء.

لقد وُجد تعلم Q الكلاسيكي (Classic Q-learning) منذ عقود، حيث يتعلم الوكيل قيمة اتخاذ إجراء معين في حالة معينة. المشكلة هي أن حالات القيادة الحقيقية لا حصر لها تقريباً؛ فبث الكاميرا ليس مجرد عالم شبكي بسيط، بل هو ملايين البكسلات التي تتغير بمعدل ستين إطاراً في الثانية، مدمجة مع سحب نقاط الليدار (lidar point clouds)، وقراءات السرعة، ومتجهات نظام تحديد المواقع (GPS vectors).

تحل شبكات Q العميقة هذه المشكلة باستخدام شبكة عصبية كمُقرب دالة (function approximator). تأخذ الشبكة البيانات الحسية الخام وتخرج قيمة متوقعة لكل إجراء ممكن: التوجيه لليسار، الكبح بلطف، التسارع، أو الحفاظ على المسار. وبدلاً من تخزين جدول بحث لكل سيناريو، تقوم الشبكة بالتعميم؛ فهي تدرك أن كتلة مظلمة في ليلة ممطرة هي على الأرجح سيارة متوقفة، تماماً كما تعلمت أثناء التدريب في يوم مشمس، وتخصص قيمة منخفضة لإجراء "التسارع".

يتضمن التدريب "إعادة تشغيل الخبرات" (experience replay)؛ حيث يقوم النظام بتخزين لحظات من الرحلات السابقة، مثل تغيير المسار بنجاح، أو تجنب الاصطدامات الوشيكة، أو التباطؤ السلس، ثم يأخذ منها عينات عشوائية لتحديث شبكته. هذا يكسر الارتباطات الضارة ويزيد من استقرار التعلم. وعلى مدار آلاف الساعات المحاكية، تتعلم الشبكة أي الإجراءات تؤدي إلى تقدم آمن وأيها يؤدي إلى المشاكل.

تجميع كل ذلك معاً

Neither method alone builds a competent driver. Inverse Reinforcement Learning without a decision engine is just an observer. It knows that humans value smoothness but cannot touch the wheel. A Deep Q-Network without a well-crafted reward function optimizes for the wrong thing. It might discover that driving in circles avoids collisions perfectly, achieving a high score while going nowhere.

Combined, they create a powerful loop. Inverse Reinforcement Learning watches human experts and distills a reward function that captures real-world priorities. The Deep Q-Network then uses that reward function to train itself through trial and error, processing live sensor data to choose actions. The AI learns complex behaviors through observation, but also through practice.

Consider a highway merge. The Inverse Reinforcement Learning component has inferred that human drivers balance speed matching with gap acceptance. The Deep Q-Network receives this nuanced cost signal and practices merging ten thousand times in simulation. It learns when to speed up, when to hang back, and when a gap is too tight. The result is not a parrot repeating recorded human moves. It is a system that internalized the logic and can adapt when the highway is wet or the gap is smaller than usual.

Why This Matters for Real Roads