Timeline Studio, editor video sumber terbuka yang dibangun dengan React, kini menjalankan semua fitur AI-nya sepenuhnya di dalam browser. Kode penulis memungkinkan pengguna untuk menghasilkan pengisi suara (voiceover), mentranskripsi audio, mendeteksi subjek, membuat potret berbicara, dan mengekspor klip yang sudah jadi tanpa pernah mengirimkan file ke server jarak jauh.

Mengapa editor berbasis lokal (local-first) itu penting

Alat video bertenaga AI pada umumnya mengirimkan rekaman mentah ke layanan cloud, lalu menunggu server menjalankan model speech-to-text, alur kerja (pipeline) analisis gambar, atau generator deep-fake. Proses bolak-balik tersebut menambah latensi selama beberapa detik atau menit, dan memaksa pengguna untuk memercayai pihak ketiga dengan media yang berpotensi sensitif. Dengan menjaga setiap komputasi tetap berada di perangkat klien, Timeline Studio menghilangkan kekhawatiran privasi tersebut dan menghindari biaya berulang dari inferensi berbasis cloud.

Bagaimana browser menjadi mesin komputasi

Menjalankan jaringan saraf (neural nets) yang berat di halaman web bukan sekadar masalah memuat file model. Browser menerapkan batasan ketat pada memori, penggunaan CPU, dan penjadwalan thread. Penulis menemukan bahwa implementasi yang berhasil harus memperlakukan browser sebagai sistem operasi yang lengkap: mengalokasikan memori dengan hati-hati, melakukan cache data secara cerdas, dan mengalihkan pekerjaan ke thread latar belakang.

Langkah-langkah teknik utama

  • Jalur model khusus tugas – Berbagai tugas AI menggunakan runtime yang paling sesuai. Transkripsi ucapan menjalankan Whisper yang dikompilasi ke WebAssembly (WASM), sementara generator potret saraf menggunakan WebGPU, API graphics-compute yang sedang berkembang di browser.
  • Web Workers untuk tugas berat – Inferensi model, dekode audio, dan langkah intensif CPU lainnya dieksekusi dalam worker khusus. Thread UI tetap responsif, sehingga saat menggeser (scrubbing) timeline, layar tidak pernah membeku.
  • Lazy-loading model – Editor mengunduh model hanya saat pengguna memanggil fitur yang sesuai. Oleh karena itu, instalasi baru dapat dimuat dalam hitungan detik, alih-alih menunggu ratusan megabyte data.
  • Pra-analisis temporal – Alih-alih memeriksa satu frame saja, kode ini mengambil sampel video pada interval reguler dan membangun peta subjek yang diperbarui saat orang bergerak. Hal ini menjaga akurasi deteksi di seluruh klip.
  • Matematika khusus untuk WebGPU – Alur kerja potret asli bergantung pada operasi pengambilan sampel 5-dimensi yang tidak didukung oleh WebGPU. Penulis menulis ulang kernel tersebut sebagai padanan 4-dimensi dan memverifikasinya terhadap ambang batas kesalahan numerik yang ketat.
  • Caching service-worker – Setelah model diambil, service worker menyimpannya di cache browser. Sesi berikutnya akan dimuat secara instan, menghindari pengunduhan berulang blob biner yang besar.

Harga dari tetap berada di lokal

AI berbasis lokal mengalihkan beban dari penyedia cloud ke perangkat pengguna. Model memakan ruang disk dan mengonsumsi RAM saat dijalankan, yang dapat menjadi masalah pada perangkat spesifikasi rendah. Cache service-worker memitigasi lalu lintas jaringan yang berulang.

Apa yang perlu diperhatikan selanjutnya

Prototipe ini menunjukkan bahwa browser modern dapat menampung alur kerja kecerdasan media yang canggih, tetapi pendekatan ini masih bergantung pada standar yang sedang berkembang seperti WebGPU.

Kesimpulan: Dengan memperlakukan browser sebagai platform komputasi full-stack—membagi pekerjaan ke berbagai worker, melakukan cache model, dan menyesuaikan setiap tugas AI ke runtime yang paling efisien—Timeline Studio membuktikan bahwa editor video AI yang sepenuhnya lokal bukan hanya mungkin dilakukan; hal ini bisa praktis bagi kreator sehari-hari yang mengutamakan kecepatan dan privasi.