World Labs meluncurkan Atlas, sebuah omni-model yang mengubah segelintir foto biasa menjadi dunia 3D yang dapat dinavigasi sepenuhnya dan merender video 1440p hingga satu menit. Perusahaan tersebut menyatakan bahwa teknologi ini menciptakan alur kerja "real-to-sim".

Mengapa peralihan dari urutan datar itu penting

Sebagian besar sistem AI multimodal saat ini memperlakukan input sebagai aliran satu atau dua dimensi—string teks, kisi gambar, atau frame video. Desain tersebut memaksa model untuk menyimpulkan hubungan spasial dari data yang tidak memiliki geometri eksplisit, sehingga membatasi fidelitas video yang dihasilkan dan rekonstruksi 3D. Atlas meninggalkan pendekatan tersebut. Setiap token yang diproses model terikat pada titik konkret dalam ruang tiga dimensi, sebuah teknik yang disebut perusahaan sebagai spatial anchoring. Dengan melatih model dari awal menggunakan data teks, gambar, video, dan 3D dengan arsitektur yang memahami struktur 3D—atau bahkan 4D (waktu)—Atlas dapat memahami dan memanipulasi geometri secara langsung.

Dari video “mesin slot” ke generasi yang dikendalikan kamera

Alat pembuat video generatif saat ini mengandalkan perintah teks (prompt) yang samar untuk menggerakkan kamera virtual, yang sering kali menghasilkan hasil yang tidak terduga. Atlas mengganti prompt tersebut dengan input geometris: pengguna menentukan pose atau jalur kamera, dan model merender adegan dari sudut pandang yang tepat tersebut. Dalam demo, sistem ini menghasilkan video beresolusi tinggi yang mulus dan tetap konsisten di seluruh pergerakan kamera—sebuah langkah menuju kontrol tingkat profesional.

Merekonstruksi dunia dengan citra minimal

Atlas dapat membangun kembali lingkungan yang kompleks hanya dari satu gambar hingga beberapa lusin, tanpa perangkat keras penangkap khusus apa pun. Dalam demo publik, model ini mengambil sekumpulan kecil foto setinggi permukaan tanah dari sebuah halaman universitas dan menyintesis perspektif udara yang sesuai dengan tata letak yang diharapkan. Model pesaing seperti VGGT dan InfiniteVGGT sering kali memunculkan tekstur kabur atau gangguan geometris saat kamera bergerak; Atlas mampu mempertahankan integritas struktural di sepanjang proses tersebut.

Selain video, model ini menghasilkan format 3D asli—point clouds dan 3-D Gaussian splats. Point clouds adalah kumpulan titik dalam ruang yang menyandikan bentuk permukaan; Gaussian splats menyimpan setiap titik sebagai gumpalan (blob) kecil yang bervariasi secara halus, memungkinkan perenderan detail halus yang efisien. Dengan menyediakan kedalaman di samping warna RGB, Atlas mengubah beberapa jepretan ponsel pintar menjadi kembaran digital (digital twin) yang dapat dijelajahi dari sudut mana pun.

Real-to-sim untuk robot

Pengembang robotika telah lama bergulat dengan kesenjangan antara data dunia nyata dan lingkungan pelatihan simulasi. Atlas berjanji untuk menjembatani kesenjangan tersebut dengan menghasilkan umpan sensor yang persis sama dengan yang akan dilihat robot di dalam ruangan yang direkonstruksi. Pengembang kemudian dapat mengubah objek, pencahayaan, atau latar belakang pada kembaran digital tersebut, menciptakan ribuan skenario varian dari satu tangkapan dunia nyata. World Labs mendemonstrasikan alur kerja ini menggunakan teknologi yang diperoleh dari sebuah startup yang berfokus pada sintesis pemandangan; alur kerja tersebut menghasilkan variasi yang cukup untuk menjaga lima platform robot berbeda tetap berjalan secara otonom selama satu jam tanpa campur tangan manusia.

Tolok ukur dan klaim performa

Dalam pengujian head-to-head, evaluator manusia lebih menyukai video panduan kamera Atlas dibandingkan pesaing utama dalam 94% perbandingan berpasangan, dan dibandingkan model besar lainnya dalam 81% kasus. Untuk rekonstruksi, Atlas mencapai median kesalahan sebesar 25,3, mengalahkan rival yang melaporkan skor kesalahan lebih tinggi. Model ini menggabungkan keunggulan kecepatan model bahasa besar—menggunakan key-value (KV) caching untuk menggunakan kembali perhitungan perantara—dengan output berkualitas tinggi dari model difusi, yang menyempurnakan gambar secara iteratif.

Potensi kekurangan dan pertanyaan terbuka

Pengumuman World Labs didukung oleh demo yang mengesankan, tetapi teknologinya masih dalam tahap awal. Melatih dan menjalankan model yang menangani teks, gambar, video, dan data 3D pada resolusi tinggi membutuhkan komputasi yang besar, dan perusahaan belum mengungkapkan spesifikasi perangkat keras atau biaya inferensi. Tolok ukur tersebut bergantung pada preferensi manusia dan metrik kesalahan median; hal tersebut belum menunjukkan bagaimana performa Atlas dalam tugas-tugas hilir seperti tingkat keberhasilan manipulasi robot dibandingkan dengan data yang murni nyata. Kritikus juga mungkin mencatat bahwa meskipun model ini dapat menghasilkan geometri yang masuk akal dari sedikit gambar, ia tidak dapat menggantikan fidelitas pemindaian lidar atau tangkapan structured-light saat pengukuran yang tepat diperlukan.

Apa yang perlu diperhatikan selanjutnya

  • Adopsi oleh platform robotika – Jika tim robot mengintegrasikan dunia yang dihasilkan Atlas ke dalam loop pelatihan mereka dan melaporkan peningkatan yang terukur, klaim mengenai simulasi yang lebih murah dan lebih bervariasi akan mendapatkan kredibilitas.
  • Alur kerja pembuatan konten – Studio dan pengembang game yang bereksperimen dengan Atlas untuk pembuatan prototipe cepat dapat mengungkap apakah output 3D asli model tersebut sesuai dengan alur kerja aset yang sudah ada.
  • Evaluasi sumber terbuka atau pihak ketiga – Peneliti independen yang mereproduksi angka tolok ukur akan membantu mengonfirmasi keunggulan model ini dibandingkan standar saat ini.
  • Pengungkapan perangkat keras dan biaya – Memahami anggaran komputasi untuk inferensi akan menentukan apakah Atlas dapat berjalan di perangkat edge atau tetap menjadi layanan berbasis cloud saja.

Intinya

Atlas menunjukkan bahwa menambatkan token AI dalam ruang fisik memungkinkan satu model tunggal untuk menghasilkan, merekonstruksi, dan mensimulasikan seluruh lingkungan dari input visual yang minimal. Jika performa yang dijanjikan dapat ditingkatkan ke penerapan dunia nyata tanpa biaya komputasi yang sangat tinggi, model ini dapat mengubah cara robot belajar dan cara konten imersif dibangun, mengubah beberapa foto menjadi dunia digital yang sepenuhnya interaktif.