رتبهبندی مقالات Hugging Face در این ماه نشاندهنده بلوغ این حوزه است. کارهای برجسته کمتر بر افزایش تعداد پارامترهای خام تمرکز دارند و بیشتر بر توانایی مدلها برای دیدن، به خاطر سپردن و به پایان رساندن کارهایشان متمرکز هستند. ده مقاله زیر به ویدیوهای بلادرنگ، شناخت رباتیک، بنچمارکهای صادقانه و انقلاب آرامِ برخورد با مولدها به عنوان معلم میپردازند.
ویدیوهای بلادرنگی که واقعاً میتوانید از آنها استفاده کنید
بیشتر مدلهای ویدئویی هنوز مانند آزمایشهای گرانقیمت آزمایشگاهی عمل میکنند. آنها دقایق طولانی روی سختافزارهای سنگین زمان میبرند و کلیپهایی تحویل میدهند که نمیتوانید در حین تولید آنها را هدایت کنید. Vidu S1 معادله را تغییر میدهد. این مدل تعامل بلادرنگ را هدف قرار داده و به کاربران اجازه میدهد با دستورات صوتی، شخصیتهای دیجیتال را هدایت کنند، در حالی که مدل از طریق تکنیکی به نام TurboDiffusion روی GPUهای استاندارد مصرفکننده اجرا میشود.
این تغییر سختافزاری اهمیت دارد. وقتی یک مدل دیگر نیازی به مجموعهای از شتابدهندههای سطح بالا نداشته باشد، از یک نسخه نمایشی فراتر رفته و به یک زیرساخت تبدیل میشود. آواتارهای پخش زنده را تصور کنید که در لحظه به چت واکنش نشان میدهند، یا شخصیتهای خدمات مشتری که تماس چشمی برقرار میکنند و لحن خود را بنا به درخواست تغییر میدهند. Vidu S1 به سمت هوش مصنوعی ویدئویی حرکت میکند که به عنوان یک محصول عرضه میشود، نه فقط یک پیشچاپ تحقیقاتی دیگر.
رباتهایی که دستورالعملها را درک میکنند
ناوبری همچنان مانع اصلی برای هوش مصنوعی فیزیکی است. ABot-N1 با پیشنهاد یک مدل پایه برای ناوبری ربات که توسط دستورالعملهای زبان معمولی هدایت میشود، به این مشکل میپردازد. به جای مسیرهای شکننده و از پیش نقشهبرداری شده، این سیستم یاد میگیرد با تشخیص الگوها در آنچه میبیند و میشنود، در محیطهای متنوع حرکت کند.
دستاورد فوری آن در بخش لجستیک نهفته است. یک ربات تحویلدهنده که دستور شفاهی مانند «بسته را از ورودی جانبی، بعد از قفسه دوچرخهها رها کن» را دریافت میکند، میتواند آن دستور را تجزیه کرده و در صورت جابهجا شدن قفسه، خود را با شرایط وفق دهد. دستیارهای خانگی نیز انعطافپذیری مشابهی پیدا میکنند و میتوانند بدون نیاز به نقشههای دقیق از پیش بارگذاری شده، در آپارتمانها تردد کنند.
رباتهایی که دیروز را به خاطر میآورند
ABot-AgentOS با حل مشکلی متفاوت، مکمل آن کارِ ناوبری است: رباتها معمولاً بعد از هر دستور بازنشانی (reset) میشوند. این سیستم با ماشین به عنوان یک عامل پایدار با حافظه بلندمدت برای کاربران، اشیاء و عادتهای روزانه برخورد میکند.
تفاوت بین یک پردازشگر یکباره و یک عامل مستمر، تفاوت بین یک ابزار و یک همکار است. در اتوماسیون انبار، رباتی که حافظه دارد متوجه میشود که محمولههای روز سهشنبه همیشه شامل اقلام شکننده هستند و قدرت گرفتن خود را تنظیم میکند. در مراقبتهای خانگی، ربات به خاطر میآورد که یک ساکن خاص ترجیح میدهد پردهها ساعت ۳ بعد از ظهر نیمهباز باشند. این تداوم، شخصیسازی را در مقیاس بزرگ امکانپذیر میکند.
افشای فریب در بنچمارکهای ویدئویی
Video-Oasis یک تشخیص ناخوشایند ارائه میدهد: بسیاری از بنچمارکهای محبوب درک ویدئو معیوب هستند. مدلها اغلب با استفاده از دانش متنی به تنهایی به سوالات پاسخ میدهند و هرگز زحمت نگاه کردن به فریمهای واقعی را به خود نمیدهند. این مقاله نشان میدهد که نیمی از سوالات بنچمارکهای فعلی را میتوان بدون هیچ ورودی بصریای حل کرد.
این بدان معناست که محققان به جای ادراک واقعی، به حدسهای هوشمندانه پاداش دادهاند. جامعه علمی به پروتکلهای ارزیابی نیاز دارد که مدلها را مجبور کند هر پاسخ را بر اساس شواهد در سطح پیکسل مستند کنند. در غیر این صورت، با خطر عرضه سیستمهایی روبرو هستیم که با تغییر نور، با اعتماد به نفس کامل دچار توهم (hallucinate) میشوند.
عوامل کدنویسی که کارهای طولانی را به پایان میرسانند
دستیارهای کدنویسی قطعهکدها را به خوبی مینویسند، اما جریانهای کاری DevOps با صدها مرحله، همچنان یک قبرستان هستند. Long-Horizon-Terminal-Bench بررسی میکند که عوامل چگونه با وظایف طولانی مقابله میکنند، از خطاهای میانی بازیابی میشوند و بدون کمک انسان دوباره برنامهریزی میکنند.
این موضوع برای هر کسی که رویای مدیریت خودکار سیستم را در سر دارد، اهمیت دارد. عاملی که بتواند یک سرور را وصله (patch) کند، عیبیابی را در میان وابستگیها انجام دهد و در صورت شکست یک مرحله، عملیات را به حالت قبل برگرداند (roll back)، بسیار ارزشمندتر از عاملی است که پایتون بینقص مینویسد اما با اولین کلید API مفقود شده، متوقف میشود. این بنچمارک به محققان امتیازدهی برای این نوع استقامت را میدهد.
یادگیری تقویتی ارزانتر
Direct OPD با مشکل هزینه در یادگیری تقویتی (RL) مقابله میکند. RL برای مدلهای بزرگ، پول و ساعتهای GPU را میسوزاند. میانبر پیشنهادی ساده است: ابتدا یک مدل کوچک را با RL آموزش دهید، سپس آن سیاست (policy) آموختهشده را به یک مدل بزرگ منتقل کنید.
کاوشگران کوچک با هزینه کم مرتکب اشتباه میشوند. هنگامی که استراتژی تأیید شد، مدل بزرگ بدون پرداخت شهریه کامل، درسهای آموختهشده را به ارث میبرد. برای تیمهای کوچکی که سعی در همسو کردن مدلهای زبانی بزرگ یا تنظیم دقیق (fine-tune) عوامل دارند،
