Timeline Studio, penyunting video sumber terbuka yang dibina dengan React, kini menjalankan semua ciri AI sepenuhnya di dalam pelayar. Kod penulis membolehkan pengguna menjana alih suara, mentranskripsi audio, mengesan subjek, mencipta potret bercakap dan mengeksport klip yang telah siap tanpa perlu menghantar fail ke pelayan jauh.
Mengapa penyunting berorientasikan tempatan (local-first) itu penting
Alatan video berkuasa AI yang tipikal menghantar rakaman mentah ke perkhidmatan awan, kemudian menunggu pelayan menjalankan model pertuturan-ke-teks, saluran paip analisis imej atau penjana deep-fake. Perjalanan dua hala tersebut menambah saat atau minit kependaman (latency), dan ia memaksa pengguna untuk mempercayai pihak ketiga dengan media yang berpotensi sensitif. Dengan mengekalkan setiap pengiraan pada peranti klien, Timeline Studio menghapuskan kebimbangan privasi tersebut dan mengelakkan kos berulang bagi inferens berasaskan awan.
Bagaimana pelayar menjadi enjin pengkomputeran
Menjalankan rangkaian neural yang berat dalam halaman web bukan sekadar memuatkan fail model. Pelayar mengenakan had ketat pada memori, penggunaan CPU dan penjadualan bebenang (thread). Penulis mendapati bahawa pelaksanaan yang berjaya perlu melayan pelayar sebagai sistem operasi yang lengkap: memperuntukkan memori dengan teliti, menyimpan cache data secara bijak dan memindahkan kerja ke bebenang latar belakang.
Langkah kejuruteraan utama
- Laluan model khusus tugas – Tugasan AI yang berbeza menggunakan masa larian (runtime) yang paling sesuai. Transkripsi pertuturan menjalankan Whisper yang dikompilasi ke WebAssembly (WASM), manakala penjana potret neural menggunakan WebGPU, API pengkomputeran-grafik pelayar yang sedang berkembang.
- Web Workers untuk kerja berat – Inferens model, penyahkodan audio dan langkah intensif CPU yang lain dilaksanakan dalam pekerja (workers) khusus. Bebenang UI kekal responsif, jadi proses menyemak (scrubbing) garis masa tidak akan membekukan skrin.
- Pemuatan malas (lazy-loading) model – Penyunting hanya memuat turun model apabila pengguna menggunakan ciri yang berkaitan. Oleh itu, pemasangan baharu dimuatkan dalam beberapa saat sahaja berbanding menunggu ratusan megabait data.
- Pra-analisis temporal – Daripada memeriksa satu bingkai sahaja, kod tersebut mengambil sampel video pada selang masa yang tetap dan membina peta subjek yang dikemas kini apabila orang bergerak. Ini memastikan pengesanan kekal tepat sepanjang klip.
- Matematik tersuai untuk WebGPU – Saluran paip potret asal bergantung pada operasi pensampelan 5-dimensi yang tidak disokong oleh WebGPU. Penulis menulis semula kernel tersebut sebagai setara 4-dimensi dan mengesahkannya terhadap ambang ralat numerik yang ketat.
- Caching service-worker – Sebaik sahaja model diambil, service worker menyimpannya dalam cache pelayar. Sesi seterusnya dimuatkan serta-merta, mengelakkan muat turun berulang bagi blob binari yang besar.
Harga untuk kekal secara tempatan
AI berorientasikan tempatan memindahkan beban daripada penyedia awan kepada peranti pengguna. Model menggunakan ruang cakera dan memakan RAM semasa dijalankan, yang boleh menjadi masalah pada mesin spesifikasi rendah. Cache service-worker mengurangkan trafik rangkaian yang berulang.
Apa yang perlu diperhatikan seterusnya
Prototaip ini menunjukkan bahawa pelayar moden boleh menampung saluran paip kecerdasan media yang canggih, tetapi pendekatan ini masih bergantung pada piawaian yang sedang berkembang seperti WebGPU.
Rumusan: Dengan melayan pelayar sebagai platform pengkomputeran stack penuh—membahagikan kerja merentasi pekerja, menyimpan cache model, dan menyesuaikan setiap tugas AI kepada masa larian yang paling cekap—Timeline Studio membuktikan bahawa penyunting video AI yang sepenuhnya tempatan bukan sahaja boleh dilakukan; ia juga boleh menjadi praktikal untuk pencipta harian yang mementingkan kelajuan dan privasi.
