Bu ayki Hugging Face makale sıralamaları, olgunlaşan bir alanı gözler önüne seriyor. Öne çıkan çalışmalar, ham parametre sayılarını ölçeklendirmekten ziyade modellerin görmesini, hatırlamasını ve başladıkları işi bitirmesini sağlamaya odaklanıyor. Aşağıdaki on makale; gerçek zamanlı video, robot bilişi, dürüst kıyaslama ve üreticileri öğretmen olarak görmeye yönelik sessiz devrim konularına değiniyor.
Gerçekten Kullanabileceğiniz Gerçek Zamanlı Video
Çoğu video modeli hâlâ pahalı laboratuvar deneyleri gibi davranıyor. Ağır donanımlar üzerinde dakikalarca çalışıyorlar ve uçuş sırasında yönlendiremeyeceğiniz klipler üretiyorlar. Vidu S1 denklemi değiştiriyor. TurboDiffusion adı verilen bir teknik sayesinde model standart tüketici GPU'larında çalışırken, kullanıcılara dijital karakterleri sesli komutlarla yönlendirme imkanı tanıyarak gerçek zamanlı etkileşimi hedefliyor.
Bu donanım değişimi önemli. Bir model artık üst düzey hızlandırıcı rafları gerektirmediğinde, bir demodan çıkıp altyapıya dönüşür. Sohbetle gerçek zamanlı etkileşime giren canlı yayın avatarlarını veya talep üzerine göz teması kurup ton değiştiren müşteri hizmetleri karakterlerini düşünün. Vidu S1, sadece bir araştırma ön baskısı (preprint) değil, bir ürün olarak sunulan video yapay zekasına işaret ediyor.
Komutları Anlayan Robotlar
Navigasyon, fiziksel yapay zeka için temel engel olmaya devam ediyor. ABot-N1, sıradan dil talimatlarıyla yönlendirilen bir robot navigasyon temel modeli önererek bu soruna odaklanıyor. Sistem, kırılgan ve önceden haritalanmış rotalar yerine, gördükleri ve duyduklarındaki kalıpları tanıyarak çeşitli ortamlarda hareket etmeyi öğreniyor.
Buradaki doğrudan fayda lojistik sektöründe yatıyor. Bir teslimat robotuna "paketi bisiklet rafının yanındaki yan girişten bırak" gibi sözlü bir komut verildiğinde, robot bu talimatı çözümleyebilir ve raf hareket ettiğinde duruma uyum sağlayabilir. Ev asistanları da benzer bir esneklik kazanarak, önceden yüklenmiş kesin kat planları olmadan dairelerde dolaşabilirler.
Dünü Hatırlayan Robotlar
ABot-AgentOS, farklı bir sorunu çözerek o navigasyon çalışmasıyla eşleşiyor: Robotlar genellikle her komuttan sonra sıfırlanır. Bu sistem, makineyi kullanıcılar, nesneler ve günlük alışkanlıklar için uzun süreli belleğe sahip kalıcı bir ajan olarak ele alıyor.
Tek seferlik bir işlemci ile sürekli bir ajan arasındaki fark, bir araç ile bir iş arkadaşı arasındaki fark gibidir. Depo otomasyonunda, belleği olan bir robot Salı günü sevkiyatlarının her zaman kırılgan ürünler içerdiğini fark eder ve tutuşunu ayarlar. Evde bakım için ise belirli bir sakinin saat 15:00'te jaluzilerin yarı açık olmasını tercih ettiğini hatırlar. Bu süreklilik, ölçeklenebilir kişiselleştirmeyi mümkün kılar.
Video Kıyaslamalarına Meydan Okumak
Video-Oasis rahatsız edici bir teşhis koyuyor: Birçok popüler video anlama kıyaslaması (benchmark) hatalı. Modeller, gerçek karelere bakmaya zahmet etmeden, sıklıkla sadece metin bilgisi kullanarak soruları yanıtlıyor. Makale, mevcut kıyaslama sorularının yarısının hiçbir görsel girdi olmadan çözülebileceğini kanıtlıyor.
Bu, araştırmacıların gerçek algıyı değil, zekice tahminleri ödüllendirdiği anlamına geliyor. Topluluğun, modelleri her yanıtı piksel düzeyinde kanıtlara dayandırmaya zorlayan değerlendirme protokollerine ihtiyacı var. Aksi takdirde, ışık değiştiğinde kendinden emin bir şekilde halüsinasyon gören sistemler piyasaya sürme riskiyle karşı karşıyayız.
Uzun İşleri Bitiren Kodlama Ajanları
Kodlama asistanları kod parçacıklarını iyi yazıyor ancak yüz adımlık DevOps iş akışları hâlâ birer mezarlık niteliğinde. Long-Horizon-Terminal-Bench; ajanların uzun süreli görevlerle nasıl başa çıktığını, süreç ortasındaki hatalardan nasıl kurtulduğunu ve insan yardımı olmadan nasıl yeniden planlama yaptığını test ediyor.
Bu, otonom sistem yönetimi hayali kuran herkes için önemlidir. Bir sunucuyu yamalayabilen, bağımlılıklar genelinde teşhis yürütebilen ve bir adım başarısız olursa işlemi geri alabilen bir ajan, mükemmel Python yazan ancak eksik ilk API anahtarında donup kalan bir ajandan çok daha değerlidir. Bu kıyaslama, araştırmacılara bu tür bir dayanıklılık için bir skor tablosu sunuyor.
Daha Ucuz Takviyeli Öğrenme
Direct OPD, takviyeli öğrenmedeki (reinforcement learning) maliyet sorununu ele alıyor. Büyük modeller için RL, para ve GPU saatlerini tüketiyor. Önerilen kestirme yol basit: Önce küçük bir modeli RL ile eğitin, ardından öğrenilen bu politikayı büyük bir modele aktarın.
Küçük kaşifler hataları ucuza yapar. Strateji doğrulandıktan sonra, büyük model tüm maliyete katlanmadan bu dersleri devralır. Büyük dil modellerini hizalamaya veya ajanları ince ayar (fine-tune) yapmaya çalışan yalın ekipler için,
