يتطور عصر الذكاء الاصطناعي الرقمي الخالص مع توجه الشركات الناشئة لسد الفجوة بين الذكاء البرمجي والتنفيذ المادي. تقود Perceptron، وهي شركة ناشئة أسسها باحثون سابقون في Meta AI، هذا التوجه من خلال تطوير نماذج رؤية متطورة مصممة لمساعدة الآلات على التنقل والتفاعل مع العالم الحقيقي.
كسر الثنائية: النماذج العامة مقابل النماذج الضيقة
لسنوات طويلة، ظل الأتمتة الصناعية عالقة في مأزق تقني. كان على المطورين عادةً الاختيار بين نماذج تأسيسية ضخمة وعامة تتطلب وحدات معالجة رسومية (GPUs) سحابية مخصصة ومكلفة لكل حالة على حدة، أو نماذج ضيقة ومتخصصة يمكنها التعامل مع الإدراك أو التحكم، ولكنها تفتقر إلى القدرة على القيام بكليهما.
يحاول المؤسسان المشاركان لشركة Perceptron، وهما Armen Aghajanyan وAkshat Shrivastava — وكلاهما من خريجي قسم أبحاث الذكاء الاصطناعي الأساسية (FAIR) في Meta — حل هذه المشكلة من خلال نموذجهما الجديد، Isaac 0.5. وبخلاف البرمجيات الحالية المصممة لمهام فردية متكررة، يعد Isaac 0.5 نموذجاً للأغراض العامة؛ حيث يمنح الروبوتات القدرة على "الإدراك والاستنتاج والعمل"، مما يسمح لها بالتكيف مع بيئات متنوعة بدلاً من كونها مبرمجة مسبقاً لحركة واحدة محددة.
آليات الذكاء المادي
لفهم مدى تعقيد نهج Perceptron، يجب النظر إلى مهمة مستودع قياسية، مثل فرز الطرود. لا يمكن للروبوت ببساطة "التقاط صندوق"؛ بل يجب عليه أولاً قراءة الملصقات، وإجراء تحليل مكاني لرسم خريطة لمحيطه، وتحديد ترتيب الالتقاط الأمثل، وتخطيط مساره المادي.
تم تصميم Isaac 0.5 لإدارة هذه العمليات المعرفية متعددة الخطوات. تم تدريب النموذج على نطاق هائل، حيث استوعب مليون ساعة من بيانات الفيديو العامة للتعرف على الإعدادات والسيناريوهات المتنوعة. ولإتقان البراعة البدنية، استخدمت الشركة "ego video" (منظور الشخص الأول من كاميرات قابلة للارتداء) وفيديوهات UMI (تسجيلات لأفعال بشرية متكررة) لتعليم الذكاء الاصطناعي كيفية ترجمة الحركة إلى إتمام المهام. وأشار Shrivastava إلى أن الشركة قامت ببناء مجموعات بيانات بمقياس بيتابايت تشمل الصور والنصوص والفيديو والمسارات الروبوتية لتحقيق هذا المستوى من "الخيمياء الخوارزمية".
استراتيجية الأوزان المفتوحة والتوسع في السوق
في خطوة تشجع على الشفافية واعتماد المطورين، تطلق Perceptron نموذج Isaac 0.5 كنموذج مفتوح الأوزان (open-weight). يتيح ذلك للباحثين والمهندسين فحص معلماته ومواد تدريبه، وهي خطوة حاسمة لدمج الذكاء الاصطناعي في البيئات الصناعية عالية المخاطر حيث تكون القدرة على التنبؤ أمراً بالغ الأهمية.
بدعم من جولة تمويل بقيمة 21 مليون دولار بقيادة Bessemer Venture Partners، تضع Perceptron نفسها كطبقة ذكاء لمجموعة واسعة من القطاعات. وبينما ينصب التركيز الأساسي على الخدمات اللوجستية والتصنيع، ترى الشركة تطبيقات فورية في مجالات الأمن والتنقل وحتى الإعلام والترفيه. ومن خلال توفير طبقة ذكاء مرنة، تهدف Perceptron إلى تحويل كيفية تشغيل الروبوتات الموجهة بالرؤية عبر المشهد الصناعي العالمي.
النقاط الرئيسية
- سد الفجوة: يهدف Isaac 0.5 إلى القضاء على الاختيار بين النماذج العامة كثيفة الموارد والنماذج الضيقة المحدودة من خلال تقديم إطار عمل للأغراض العامة يقوم على "الإدراك والاستنتاج والعمل".
- نطاق تدريب هائل: يستفيد النموذج من مليون ساعة من بيانات الفيديو، بما في ذلك فيديوهات ego-centric وفيديوهات UMI، لتعليم الروبوتات المهام المكانية واليدوية المعقدة.
- سهولة الوصول عبر الأوزان المفتوحة: من خلال إصدار Isaac 0.5 بأوزان مفتوحة، تمكن Perceptron من إجراء فحص أعمق ودمج أسرع للذكاء الاصطناعي المتطور للرؤية في سير العمل الصناعي.
كشفت Perceptron عن Isaac 0.5، وهو نموذج رؤية مفتوح الأوزان يعد بمنح الروبوتات "دماغاً" موحداً يقوم بـ "الإدراك والاستنتاج والعمل". جمعت الشركة الناشئة 21 مليون دولار، بقيادة Bessemer Venture Partners، وتطرح النموذج كطبقة ذكاء جاهزة للاستخدام في الخدمات اللوجستية والتصنيع وأسواق الأتمتة المادية الأخرى.
لماذا يكتسب هذا الإطلاق أهمية
لطالما أُجبرت الروبوتات الصناعية على المفاضلة بين خيارين: نشر نموذج تأسيسي ضخم للأغراض العامة، مما يعني دفع تكاليف الوصول المستمر إلى وحدات معالجة الرسومات (GPU) السحابية؛ أو الالتزام بنظام رؤية ضيق ومخصص لمهمة معينة، مما يؤدي إلى فقدان المرونة عند تغير البيئة. ويُسوق Isaac 0.5 كحل وسط — نموذج واحد يمكنه التعامل مع الإدراك والتخطيط والتحكم دون الحاجة إلى حوسبة سحابية لكل حالة.
المشكلة في أدمغة الروبوتات الحالية
يقوم روبوت المستودعات التقليدي بأكثر من مجرد التقاط صندوق. إذ يتعين عليه قراءة الملصق، وتحديد موقع العنصر وسط الفوضى، وتحديد أفضل تسلسل للالتقاط، وحساب مسار الذراع الخالي من الاصطدامات — كل ذلك في الوقت الفعلي. عادةً ما تقسم الحلول الحالية هذه الخطوات عبر مكونات برمجية منفصلة: كاشف خفيف الوزن للملصق، ومخطط مصمم يدويًا للحركة، ووحدة تحكم قائمة على القواعد للتنفيذ. ويؤدي هذا التقسيم إلى زيادة أعباء التكامل ويحد من قدرة الروبوت على التكيف عند ظهور منتج جديد أو نمط تغليف أو تخطيط مختلف.
كيف يحاول Isaac 0.5 سد هذه الفجوة
قام المؤسسان المشاركان لشركة Perceptron، وهما Armen Aghajanyan وAkshat Shrivastava، وكلاهما باحث سابق في Meta FAIR، ببناء Isaac 0.5 كشبكة واحدة متكاملة (end-to-end). تم تدريب النموذج على ما يقرب من مليون ساعة من بيانات الفيديو العامة، والتي تغطي مجموعة واسعة من المشاهد الداخلية والخارجية. والأهم من ذلك، تتضمن مجموعة التدريب أيضًا "ego video" - وهي لقطات من منظور الشخص الأول تم التقاطها بواسطة كاميرات قابلة للارتداء - و"UMI video"، وهي تسجيلات لأفعال بشرية متكررة. ومن خلال تغذية الشبكة بتدفقات مرئية مقترنة ببيانات مسار الروبوت، تزعم Perceptron أن النموذج يتعلم كيفية ترجمة الإشارات المرئية إلى حركات فيزيائية.
تقول الشركة إن مجموعة بياناتها تشمل بيتابايت من الصور والنصوص والفيديو ومسارات الروبوتات. ويهدف هذا النطاق الواسع إلى منح Isaac 0.5 القدرة على التعرف على جسم جديد، واستنتاج إمكانيات استخدامه (كيفية الإمساك به)، وإنشاء خطة حركة، كل ذلك دون الحاجة إلى وحدة تحكم منفصلة.
نموذج مفتوح الأوزان: الشفافية تلتقي بالعملية
على عكس معظم عروض الذكاء الاصطناعي التجارية التي توفر واجهة برمجة تطبيقات (API) فقط، تطلق Perceptron نموذج Isaac 0.5 بأوزان مفتوحة. يمكن للمهندسين فحص المعلمات، أو ضبط الشبكة بدقة باستخدام بيانات خاصة، أو دمج النموذج مباشرة في أجهزة الحافة (edge hardware).
