إعادة توجيه الحركة من كاميرا الويب إلى VRM في الوقت الفعلي

هل يمكن للمتصفح تشغيل شخصية ثلاثية الأبعاد (avatar) باستخدام كاميرا الويب فقط؟

قمت باختبار MediaPipe Holistic لمعرفة ما إذا كان بإمكانه تقدير حركات الجسم والوجه واليد للتحكم في شخصية VRM 1.0 في الوقت الفعلي. أجريت هذا الاختبار على جهاز Apple M1 Max باستخدام المعالج (CPU) وتقنية WASM.

تُظهر النتائج أن كاميرا الويب القياسية يمكنها تشغيل شخصية ثلاثية الأبعاد دون الحاجة إلى معدات باهظة الثمن لالتقاط الحركة.

نتائج الاختبار: • الأجهزة: Apple M1 Max • المدخلات: بث كاميرا ويب بدقة 1280x720 • السرعة الفعلية: 17.3 إطاراً في الثانية (FPS) • متوسط وقت الاستدلال: 49.17 مللي ثانية • النجاح: قامت جميع إطارات الوضع الـ 141 المكتشفة بتحديث هيكل VRM

كيف يعمل النظام: يستخدم النظام مسار معالجة متعدد المراحل لتتبع 553 نقطة:

  • 33 نقطة لوضعية الجسم
  • 478 نقطة لشبكة الوجه (face mesh) (بما في ذلك قزحية العين)
  • 21 نقطة لكل يد

تتبع العملية الخطوات التالية:

  • يكتشف MediaPipe المعالم (landmarks) من كاميرا الويب
  • يتم تحويل الإحداثيات إلى مساحة Three.js
  • يتم ربط البيانات بـ 34 عظمة وتعبيرًا من تعبيرات VRM
  • تعمل خوارزميات التنعيم على تقليل الارتعاش (jitter) من خلال استكمال الحركات (interpolating)

تعمل عملية إعادة التوجيه (Retargeting) عن طريق محاذاة الاتجاه بين معلمتين مع اتجاه عظمة VRM. على سبيل المثال، يتم ربط الكتف بالمرفق لضبط دوران الذراع. كما يتم ربط المعاملات الوجهية مباشرة بتعبيرات الشخصية مثل رمش العين أو فتح الفك.

القيود:

  • السرعة: 17.3 إطاراً في الثانية (FPS) جيدة للعروض التوضيحية ولكنها ليست سلسة بما يكفي لالتقاط الحركة الاحترافي بسرعة 60 إطاراً في الثانية.
  • الدوران: هذا تقريب اتجاهي، ولا يحل مشكلة الالتواء الدقيق للساعدين أو الكاحلين.
  • التعقيد: لم يثبت الاختبار إمكانية التتبع المستقر والمتزامن للوجه وكلتا اليدين في وقت واحد بسبب قصر مدة الاختبار.

يوفر هذا الإعداد طريقة خفيفة الوزن لإنشاء عروض توضيحية للشخصيات (avatars) وواجهات إيماءات داخل المتصفح.

المصدر: https://dev.to/kiarina/real-time-webcam-to-vrm-retargeting-with-mediapipe-holistic-173-fps-on-m1-max-4be3