رتبه‌بندی مقالات Hugging Face در این ماه نشان‌دهنده بلوغ این حوزه است. کارهای برجسته کمتر بر افزایش تعداد پارامترهای خام تمرکز دارند و بیشتر بر توانایی مدل‌ها برای دیدن، به خاطر سپردن و به پایان رساندن کارهایشان متمرکز هستند. ده مقاله زیر به ویدیوهای بلادرنگ، شناخت رباتیک، بنچمارک‌های صادقانه و انقلاب آرامِ برخورد با مولدها به عنوان معلم می‌پردازند.

ویدیوهای بلادرنگی که واقعاً می‌توانید از آن‌ها استفاده کنید

بیشتر مدل‌های ویدئویی هنوز مانند آزمایش‌های گران‌قیمت آزمایشگاهی عمل می‌کنند. آن‌ها دقایق طولانی روی سخت‌افزارهای سنگین زمان می‌برند و کلیپ‌هایی تحویل می‌دهند که نمی‌توانید در حین تولید آن‌ها را هدایت کنید. Vidu S1 معادله را تغییر می‌دهد. این مدل تعامل بلادرنگ را هدف قرار داده و به کاربران اجازه می‌دهد با دستورات صوتی، شخصیت‌های دیجیتال را هدایت کنند، در حالی که مدل از طریق تکنیکی به نام TurboDiffusion روی GPUهای استاندارد مصرف‌کننده اجرا می‌شود.

این تغییر سخت‌افزاری اهمیت دارد. وقتی یک مدل دیگر نیازی به مجموعه‌ای از شتاب‌دهنده‌های سطح بالا نداشته باشد، از یک نسخه نمایشی فراتر رفته و به یک زیرساخت تبدیل می‌شود. آواتارهای پخش زنده را تصور کنید که در لحظه به چت واکنش نشان می‌دهند، یا شخصیت‌های خدمات مشتری که تماس چشمی برقرار می‌کنند و لحن خود را بنا به درخواست تغییر می‌دهند. Vidu S1 به سمت هوش مصنوعی ویدئویی حرکت می‌کند که به عنوان یک محصول عرضه می‌شود، نه فقط یک پیش‌چاپ تحقیقاتی دیگر.

ربات‌هایی که دستورالعمل‌ها را درک می‌کنند

ناوبری همچنان مانع اصلی برای هوش مصنوعی فیزیکی است. ABot-N1 با پیشنهاد یک مدل پایه برای ناوبری ربات که توسط دستورالعمل‌های زبان معمولی هدایت می‌شود، به این مشکل می‌پردازد. به جای مسیرهای شکننده و از پیش نقشه‌برداری شده، این سیستم یاد می‌گیرد با تشخیص الگوها در آنچه می‌بیند و می‌شنود، در محیط‌های متنوع حرکت کند.

دستاورد فوری آن در بخش لجستیک نهفته است. یک ربات تحویل‌دهنده که دستور شفاهی مانند «بسته را از ورودی جانبی، بعد از قفسه دوچرخه‌ها رها کن» را دریافت می‌کند، می‌تواند آن دستور را تجزیه کرده و در صورت جابه‌جا شدن قفسه، خود را با شرایط وفق دهد. دستیارهای خانگی نیز انعطاف‌پذیری مشابهی پیدا می‌کنند و می‌توانند بدون نیاز به نقشه‌های دقیق از پیش بارگذاری شده، در آپارتمان‌ها تردد کنند.

ربات‌هایی که دیروز را به خاطر می‌آورند

ABot-AgentOS با حل مشکلی متفاوت، مکمل آن کارِ ناوبری است: ربات‌ها معمولاً بعد از هر دستور بازنشانی (reset) می‌شوند. این سیستم با ماشین به عنوان یک عامل پایدار با حافظه بلندمدت برای کاربران، اشیاء و عادت‌های روزانه برخورد می‌کند.

تفاوت بین یک پردازشگر یک‌باره و یک عامل مستمر، تفاوت بین یک ابزار و یک همکار است. در اتوماسیون انبار، رباتی که حافظه دارد متوجه می‌شود که محموله‌های روز سه‌شنبه همیشه شامل اقلام شکننده هستند و قدرت گرفتن خود را تنظیم می‌کند. در مراقبت‌های خانگی، ربات به خاطر می‌آورد که یک ساکن خاص ترجیح می‌دهد پرده‌ها ساعت ۳ بعد از ظهر نیمه‌باز باشند. این تداوم، شخصی‌سازی را در مقیاس بزرگ امکان‌پذیر می‌کند.

افشای فریب در بنچمارک‌های ویدئویی

Video-Oasis یک تشخیص ناخوشایند ارائه می‌دهد: بسیاری از بنچمارک‌های محبوب درک ویدئو معیوب هستند. مدل‌ها اغلب با استفاده از دانش متنی به تنهایی به سوالات پاسخ می‌دهند و هرگز زحمت نگاه کردن به فریم‌های واقعی را به خود نمی‌دهند. این مقاله نشان می‌دهد که نیمی از سوالات بنچمارک‌های فعلی را می‌توان بدون هیچ ورودی بصری‌ای حل کرد.

این بدان معناست که محققان به جای ادراک واقعی، به حدس‌های هوشمندانه پاداش داده‌اند. جامعه علمی به پروتکل‌های ارزیابی نیاز دارد که مدل‌ها را مجبور کند هر پاسخ را بر اساس شواهد در سطح پیکسل مستند کنند. در غیر این صورت، با خطر عرضه سیستم‌هایی روبرو هستیم که با تغییر نور، با اعتماد به نفس کامل دچار توهم (hallucinate) می‌شوند.

عوامل کدنویسی که کارهای طولانی را به پایان می‌رسانند

دستیارهای کدنویسی قطعه‌کدها را به خوبی می‌نویسند، اما جریان‌های کاری DevOps با صدها مرحله، همچنان یک قبرستان هستند. Long-Horizon-Terminal-Bench بررسی می‌کند که عوامل چگونه با وظایف طولانی مقابله می‌کنند، از خطاهای میانی بازیابی می‌شوند و بدون کمک انسان دوباره برنامه‌ریزی می‌کنند.

این موضوع برای هر کسی که رویای مدیریت خودکار سیستم را در سر دارد، اهمیت دارد. عاملی که بتواند یک سرور را وصله (patch) کند، عیب‌یابی را در میان وابستگی‌ها انجام دهد و در صورت شکست یک مرحله، عملیات را به حالت قبل برگرداند (roll back)، بسیار ارزشمندتر از عاملی است که پایتون بی‌نقص می‌نویسد اما با اولین کلید API مفقود شده، متوقف می‌شود. این بنچمارک به محققان امتیازدهی برای این نوع استقامت را می‌دهد.

یادگیری تقویتی ارزان‌تر

Direct OPD با مشکل هزینه در یادگیری تقویتی (RL) مقابله می‌کند. RL برای مدل‌های بزرگ، پول و ساعت‌های GPU را می‌سوزاند. میان‌بر پیشنهادی ساده است: ابتدا یک مدل کوچک را با RL آموزش دهید، سپس آن سیاست (policy) آموخته‌شده را به یک مدل بزرگ منتقل کنید.

کاوشگران کوچک با هزینه کم مرتکب اشتباه می‌شوند. هنگامی که استراتژی تأیید شد، مدل بزرگ بدون پرداخت شهریه کامل، درس‌های آموخته‌شده را به ارث می‌برد. برای تیم‌های کوچکی که سعی در همسو کردن مدل‌های زبانی بزرگ یا تنظیم دقیق (fine-tune) عوامل دارند،