Kedudukan kertas kajian Hugging Face bulan ini mendedahkan bidang yang sedang berkembang pesat. Kerja yang menonjol bukan lagi tentang meningkatkan jumlah parameter mentah, sebaliknya lebih kepada membolehkan model melihat, mengingati, dan menyelesaikan apa yang dimulakan. Sepuluh kertas kajian di bawah menyentuh tentang video masa nyata, kognisi robot, penanda aras yang jujur, dan revolusi senyap dalam melayan penjana (generators) sebagai guru.
Video Masa Nyata yang Benar-benar Boleh Digunakan
Kebanyakan model video masih berkelakuan seperti eksperimen makmal yang mahal. Ia mengambil masa bermenti-menti pada perkakasan berat dan menghasilkan klip yang tidak boleh dikawal semasa proses sedang berjalan. Vidu S1 mengubah keadaan tersebut. Ia menyasarkan interaksi masa nyata, membolehkan pengguna mengarahkan watak digital dengan arahan suara sementara model tersebut berjalan pada GPU pengguna standard melalui teknik yang dipanggil TurboDiffusion.
Peralihan perkakasan itu penting. Apabila sesebuah model tidak lagi memerlukan rak pemecut (accelerators) tahap tinggi, ia berhenti menjadi sekadar demo dan menjadi infrastruktur. Bayangkan avatar penstriman langsung yang bertindak balas terhadap sembang secara masa nyata, atau watak khidmat pelanggan yang melakukan hubungan mata dan mengubah nada mengikut permintaan. Vidu S1 menunjukkan hala tuju AI video yang dilancarkan sebagai produk, bukan sekadar pracetak penyelidikan yang lain.
Robot yang Memahami Arahan
Navigasi kekal sebagai halangan asas bagi AI fizikal. ABot-N1 menangani isu ini dengan mencadangkan model asas untuk navigasi robot yang dipacu oleh arahan bahasa biasa. Berbanding laluan pra-peta yang rapuh, sistem ini belajar untuk bergerak melalui pelbagai persekitaran dengan mengenali corak daripada apa yang dilihat dan didengarinya.
Manfaat segera dapat dilihat dalam logistik. Robot penghantaran yang menerima isyarat lisan seperti “letakkan bungkusan di pintu masuk sisi melepasi rak basikal” boleh menganalisis arahan tersebut dan menyesuaikan diri apabila rak itu beralih. Pembantu rumah juga mendapat fleksibiliti yang sama, bergerak di dalam apartmen tanpa perlu memuat naik pelan lantai yang tepat terlebih dahulu.
Robot yang Mengingati Semalam
ABot-AgentOS melengkapi kerja navigasi tersebut dengan menyelesaikan masalah yang berbeza: robot biasanya ditetapkan semula (reset) selepas setiap arahan. Sistem ini melayan mesin sebagai ejen berterusan dengan memori jangka panjang untuk pengguna, objek, dan tabiat harian.
Perbezaan antara pemproses sekali guna dan ejen berterusan adalah perbezaan antara alat dan rakan sekerja. Dalam automasi gudang, robot dengan memori akan menyedari bahawa penghantaran hari Selasa sentiasa mengandungi barangan mudah pecah dan akan melaraskan genggamannya. Untuk penjagaan di rumah, ia mengingati bahawa penghuni tertentu lebih suka langsir dibuka separuh pada pukul 3 petang. Kesinambungan itu membolehkan pemperibadian dilakukan pada skala besar.
Membongkar Kepalsuan Penanda Aras Video
Video-Oasis memberikan diagnosis yang meresahkan: banyak penanda aras pemahaman video yang popular sebenarnya cacat. Model sering menjawab soalan hanya menggunakan pengetahuan teks, tanpa perlu melihat bingkai (frames) sebenar. Kertas kajian tersebut menunjukkan bahawa separuh daripada soalan penanda aras semasa boleh diselesaikan tanpa sebarang input visual sama sekali.
Ini bermakna penyelidik selama ini telah memberi ganjaran kepada tekaan yang bijak, bukannya persepsi yang tulen. Komuniti memerlukan protokol penilaian yang memaksa model untuk mendasarkan setiap jawapan pada bukti tahap piksel. Jika tidak, kita berisiko melancarkan sistem yang berhalusinasi dengan yakin apabila pencahayaan berubah.
Ejen Pengkodan yang Menyiapkan Tugasan Panjang
Pembantu pengkodan menulis keratan kod (snippets) dengan baik, tetapi aliran kerja DevOps yang melibatkan ratusan langkah masih menjadi kegagalan. Long-Horizon-Terminal-Bench menguji bagaimana ejen menangani tugasan yang panjang, pulih daripada ralat di tengah jalan, dan merancang semula tanpa bantuan manusia.
Ini penting bagi sesiapa yang mengimpikan pentadbiran sistem autonomi. Ejen yang boleh menampal (patch) pelayan, menjalankan diagnostik merentasi kebergantungan (dependencies), dan melakukan 'roll back' jika sesuatu langkah gagal adalah jauh lebih berharga daripada ejen yang menulis Python dengan sempurna tetapi terhenti apabila menghadapi kunci API yang hilang. Penanda aras ini memberikan papan skor kepada penyelidik untuk tahap stamina sedemikian.
Pembelajaran Pengukuhan (Reinforcement Learning) yang Lebih Murah
Direct OPD menangani masalah kos dalam pembelajaran pengukuhan. RL untuk model besar membakar banyak wang dan jam penggunaan GPU. Jalan pintas yang dicadangkan adalah mudah: latih model kecil dengan RL terlebih dahulu, kemudian pindahkan polisi yang dipelajari itu kepada model besar.
Peneroka kecil melakukan kesilapan dengan kos yang rendah. Sebaik sahaja strategi disahkan, model besar akan mewarisi pengajaran tersebut tanpa perlu membayar "yuran pengajian" sepenuhnya. Bagi pasukan kecil yang cuba menyelaraskan (align) model bahasa besar atau melakukan penalaan halus (fine-tune) ejen,
