تُظهر تصنيفات أوراق Hugging Face البحثية لهذا الشهر مجالاً في طور النمو. العمل البارز لا يتعلق بزيادة عدد المعلمات (parameters) الخام بقدر ما يتعلق بجعل النماذج ترى، وتتذكر، وتُكمل ما بدأته. تتناول الأوراق العشر الواردة أدناه الفيديو في الوقت الفعلي، وإدراك الروبوتات، والتقييم الصادق، والثورة الهادئة المتمثلة في معاملة المولدات كمعلمين.

فيديو في الوقت الفعلي يمكنك استخدامه فعلياً

لا تزال معظم نماذج الفيديو تتصرف مثل تجارب مخبرية مكلفة؛ فهي تستغرق دقائق من المعالجة على أجهزة قوية وتنتج مقاطع لا يمكنك توجيهها أثناء العمل. يغير Vidu S1 هذه المعادلة، حيث يستهدف التفاعل في الوقت الفعلي، مما يسمح للمستخدمين بتوجيه الشخصيات الرقمية عبر الأوامر الصوتية بينما يعمل النموذج على وحدات معالجة الرسومات (GPUs) الاستهلاكية القياسية من خلال تقنية تسمى TurboDiffusion.

هذا التحول في الأجهزة أمر بالغ الأهمية. فعندما لا يعود النموذج يتطلب مجموعة من المسرعات عالية المستوى، فإنه يتوقف عن كونه مجرد عرض تجريبي ويصبح بنية تحتية. فكر في الصور الرمزية (avatars) للبث المباشر التي تتفاعل مع الدردشة في الوقت الفعلي، أو شخصيات خدمة العملاء التي تتواصل بصرياً وتغير نبرة صوتها عند الطلب. يشير Vidu S1 نحو ذكاء اصطناعي للفيديو يُطرح كمنتج، وليس مجرد ورقة بحثية أخرى.

روبوتات تفهم التوجيهات

لا تزال الملاحة تمثل العقبة الأساسية للذكاء الاصطناعي المادي. يعالج ABot-N1 هذه المشكلة من خلال اقتراح نموذج أساسي (foundation model) لملاحة الروبوتات مدفوعاً بتعليمات لغوية عادية. وبدلاً من المسارات الهشة والمحددة مسبقاً، يتعلم النظام التحرك عبر بيئات متنوعة من خلال التعرف على الأنماط فيما يراه ويسمعه.

تكمن الفائدة المباشرة في الخدمات اللوجستية. فروبوت التوصيل الذي يتلقى إشارة لفظية مثل "ضع الطرد عند المدخل الجانبي بعد حامل الدراجات" يمكنه تحليل تلك التعليمات والتكيف عندما يتحرك الحامل. كما تكتسب المساعدات المنزلية مرونة مماثلة، حيث تتجول في الشقق دون الحاجة إلى رفع مخططات طوابق دقيقة مسبقاً.

روبوتات تتذكر الأمس

يعمل ABot-AgentOS بالتكامل مع عمل الملاحة هذا من خلال حل مشكلة مختلفة: عادة ما تعيد الروبوتات ضبط نفسها بعد كل أمر. يتعامل هذا النظام مع الآلة كوكيل مستمر (persistent agent) يتمتع بذاكرة طويلة المدى للمستخدمين والأشياء والعادات اليومية.

الفرق بين المعالج لمرة واحدة والوكيل المستمر هو الفرق بين الأداة والزميل في العمل. في أتمتة المستودعات، يلاحظ الروبوت الذي يمتلك ذاكرة أن شحنات يوم الثلاثاء تتضمن دائماً عناصر قابلة للكسر ويقوم بتعديل قبضته. أما في الرعاية المنزلية، فإنه يتذكر أن مقيماً معيناً يفضل أن تكون الستائر مفتوحة جزئياً في الساعة الثالثة مساءً. هذا الاستمرار يجعل التخصيص ممكناً على نطاق واسع.

كشف زيف معايير تقييم الفيديو

يقدم Video-Oasis تشخيصاً مزعجاً: العديد من معايير تقييم فهم الفيديو الشائعة معطلة. فغالباً ما تجيب النماذج على الأسئلة باستخدام المعرفة النصية وحدها، دون تكبد عناء النظر إلى الإطارات الفعلية. وتوضح الورقة البحثية أن نصف أسئلة المعايير الحالية يمكن حلها دون أي مدخلات بصرية على الإطلاق.

هذا يعني أن الباحثين كانوا يكافئون التخمين الذكي، وليس الإدراك الحقيقي. يحتاج المجتمع إلى بروتوكولات تقييم تجبر النماذج على ربط كل إجابة بأدلة على مستوى البكسل. وإلا فإننا نُخاطر بطرح أنظمة تهلوس بثقة عندما تتغير الإضاءة.

وكلاء برمجة ينهون المهام الطويلة

تكتب مساعدات البرمجة مقتطفات برمجية بشكل جيد، لكن سير عمل DevOps المكون من مئات الخطوات لا يزال يمثل مقبرة للمهام. يختبر Long-Horizon-Terminal-Bench كيفية تعامل الوكلاء مع المهام الممتدة، والتعافي من الأخطاء في منتصف المسار، وإعادة التخطيط دون تدخل بشري.

هذا الأمر مهم لأي شخص يحلم بإدارة الأنظمة المستقلة. فالوكيل الذي يمكنه إصلاح خادم، وإجراء تشخيصات عبر التبعيات، والتراجع إذا فشلت خطوة ما، هو أكثر قيمة بكثير من وكيل يكتب لغة Python مثالية ولكنه يتوقف عن العمل عند أول مفتاح API مفقود. يوفر هذا المعيار للباحثين لوحة نتائج لهذا النوع من القدرة على التحمل.

تعلم تعزيزي أقل تكلفة

يعالج Direct OPD مشكلة التكلفة في التعلم التعزيزي (Reinforcement Learning). فالتعلم التعزيزي للنماذج الكبيرة يستهلك الكثير من المال وساعات معالجة GPU. الاختصار المقترح بسيط: قم بتدريب نموذج صغير باستخدام التعلم التعزيزي أولاً، ثم انقل تلك السياسة المتعلمة إلى نموذج كبير.

المستكشفون الصغار يرتكبون الأخطاء بتكلفة منخفضة. وبمجرد التحقق من صحة الاستراتيجية، يرث النموذج الكبير الدروس دون دفع التكاليف الكاملة. بالنسبة للفرق الصغيرة التي تحاول مواءمة النماذج اللغوية الكبيرة أو ضبط الوكلاء بدقة،