React ile oluşturulmuş açık kaynaklı bir video düzenleyici olan Timeline Studio, artık tüm yapay zeka özelliklerini tamamen tarayıcı içinde çalıştırıyor. Yazarın kodu; kullanıcıların hiçbir dosyayı uzak bir sunucuya göndermeden seslendirme oluşturmasına, sesi yazıya dökmesine, nesneleri algılamasına, konuşan portreler oluşturmasına ve bitmiş klipleri dışa aktarmasına olanak tanıyor.
Yerel öncelikli (local-first) bir düzenleyicinin önemi
Tipik yapay zeka destekli video araçları, ham görüntüleri bulut hizmetlerine aktarır ve ardından sunucunun konuşmayı metne dönüştürme modellerini, görüntü analiz süreçlerini veya deep-fake oluşturucularını çalıştırmasını bekler. Bu gidiş-dönüş süreci saniyeler veya dakikalarca gecikmeye neden olur ve kullanıcıları potansiyel olarak hassas medya içerikleri için üçüncü bir tarafa güvenmeye zorlar. Timeline Studio, her türlü hesaplamayı istemci cihazında tutarak bu gizlilik endişelerini ortadan kaldırır ve bulut tabanlı çıkarım (inference) maliyetlerinden kaçınır.
Tarayıcı nasıl bir hesaplama motoruna dönüştü
Ağır sıklet sinir ağlarını bir web sayfasında çalıştırmak, sadece bir model dosyasını yüklemekten ibaret değildir. Tarayıcı; bellek, CPU kullanımı ve iş parçacığı (thread) zamanlaması üzerinde katı sınırlar uygular. Yazar, başarılı bir uygulamanın tarayıcıyı tam teşekküllü bir işletim sistemi gibi ele alması gerektiğini keşfetti: belleği dikkatlice tahsis etmek, verileri akıllıca önbelleğe almak ve iş yükünü arka plan iş parçacıklarına aktarmak.
Temel mühendislik hamleleri
- Göreve özel model yolları – Farklı yapay zeka görevleri en uygun çalışma zamanını (runtime) kullanır. Konuşma yazıya dökme işlemi, WebAssembly (WASM) ile derlenmiş Whisper'ı çalıştırırken, sinirsel portre oluşturucu tarayıcının gelişmekte olan grafik-hesaplama API'si olan WebGPU'yu kullanır.
- Ağır işler için Web Workers – Model çıkarımı, ses kod çözme ve diğer CPU yoğunluklu adımlar özel işçilerde (workers) yürütülür. Kullanıcı arayüzü (UI) iş parçacığı yanıt vermeye devam eder, böylece zaman çizelgesinde (timeline) gezinmek ekranın donmasına neden olmaz.
- Modellerin tembel yüklemesi (lazy-loading) – Düzenleyici, bir modeli yalnızca kullanıcı ilgili özelliği çağırdığında indirir. Bu sayede yeni bir kurulum, yüzlerce megabaytlık veri beklemek yerine saniyeler içinde yüklenir.
- Zamansal ön analiz – Kod, tek bir kareyi incelemek yerine videoyu düzenli aralıklarla örnekler ve insanlar hareket ettikçe güncellenen bir nesne haritası oluşturur. Bu, klip boyunca algılamanın doğru kalmasını sağlar.
- WebGPU için özel matematik – Orijinal portre işleme hattı, WebGPU'nun desteklemediği 5 boyutlu örnekleme işlemlerine dayanıyordu. Yazar, bu çekirdekleri (kernels) 4 boyutlu eşdeğerleri olarak yeniden yazdı ve katı sayısal hata eşiklerine göre doğruladı.
- Service-worker önbelleğe alma – Bir model bir kez getirildikten sonra, bir service worker onu tarayıcı önbelleğinde saklar. Sonraki oturumlar, büyük ikili blokların (binary blobs) tekrar tekrar indirilmesini önleyerek anında yüklenir.
Yerelde kalmanın bedeli
Yerel öncelikli yapay zeka, yükü bulut sağlayıcılarından kullanıcının cihazına kaydırır. Modeller disk alanını kaplar ve çalışırken RAM tüketir; bu da düşük donanımlı makinelerde sorun olabilir. Service-worker önbelleği, tekrarlanan ağ trafiğini azaltır.
Sırada ne var
Prototip, modern tarayıcıların gelişmiş medya zekası işleme hatlarına ev sahipliği yapabileceğini gösteriyor, ancak bu yaklaşım hala WebGPU gibi gelişmekte olan standartlara bağlıdır.
Özet: Timeline Studio, tarayıcıyı işi işçiler arasında paylaştıran, modelleri önbelleğe alan ve her yapay zeka görevini en verimli çalışma zamanına göre uyarlayan tam kapsamlı bir hesaplama platformu olarak ele alarak; tamamen yerel bir yapay zeka video düzenleyicinin sadece mümkün olmadığını, aynı zamanda hız ve gizliliğe önem veren günlük içerik üreticileri için pratik olabileceğini kanıtlıyor.
