Timeline Studio, видеоредактор с открытым исходным кодом, созданный на React, теперь запускает все свои функции ИИ полностью внутри браузера. Код автора позволяет пользователям генерировать закадровый голос, транскрибировать аудио, распознавать объекты, создавать «говорящие» портреты и экспортировать готовые клипы, никогда не отправляя файлы на удаленный сервер.

Почему важен подход local-first

Типичные видеоинструменты на базе ИИ передают необработанные футажи в облачные сервисы, а затем ждут, пока сервер выполнит модели распознавания речи, конвейеры анализа изображений или генераторы дипфейков. Этот цикл добавляет секунды или минуты задержки и вынуждает пользователей доверять потенциально конфиденциальные медиафайлы третьей стороне. Оставляя все вычисления на клиентском устройстве, Timeline Studio устраняет эти проблемы конфиденциальности и позволяет избежать регулярных затрат на облачный инференс.

Как браузер стал вычислительным движком

Запуск тяжеловесных нейросетей на веб-странице — это не просто загрузка файла модели. Браузер накладывает жесткие ограничения на память, использование ЦП и планирование потоков. Автор обнаружил, что для успешной реализации браузер нужно рассматривать как полноценную операционную систему: тщательно распределять память, интеллектуально кэшировать данные и переносить задачи в фоновые потоки.

Ключевые инженерные решения

  • Пути моделей под конкретные задачи — для различных задач ИИ используются наиболее подходящие среды выполнения. Транскрипция речи выполняется с помощью Whisper, скомпилированного в WebAssembly (WASM), в то время как нейросетевой генератор портретов использует WebGPU — развивающийся графический вычислительный API браузера.
  • Web Workers для тяжелых задач — инференс моделей, декодирование аудио и другие ресурсоемкие операции выполняются в выделенных воркерах. Поток пользовательского интерфейса остается отзывчивым, поэтому прокрутка таймлайна никогда не приводит к зависанию экрана.
  • Ленивая загрузка моделей — редактор загружает модель только тогда, когда пользователь вызывает соответствующую функцию. Благодаря этому чистая установка загружается за секунды, а не заставляет ждать загрузки сотен мегабайт данных.
  • Временной предварительный анализ — вместо проверки одного кадра код делает выборку видео через регулярные интервалы и строит карту объектов, которая обновляется при движении людей. Это обеспечивает точность распознавания на протяжении всего клипа.
  • Собственная математика для WebGPU — исходный конвейер создания портретов опирался на 5-мерные операции выборки, которые WebGPU не поддерживает. Автор переписал эти ядра как 4-мерные эквиваленты и проверил их на соответствие строгим порогам численной погрешности.
  • Кэширование через Service Worker — после загрузки модели service worker сохраняет её в кэше браузера. Последующие сессии запускаются мгновенно, что позволяет избежать повторного скачивания больших бинарных объектов.

Цена локальной работы

Локально-ориентированный ИИ перекладывает нагрузку с облачных провайдеров на устройство пользователя. Модели занимают место на диске и потребляют оперативную память во время работы, что может стать проблемой на слабых машинах. Кэширование через service worker смягчает проблему повторного сетевого трафика.

За чем следить дальше

Прототип показывает, что современные браузеры способны поддерживать сложные конвейеры обработки медиаданных с помощью ИИ, но этот подход по-прежнему зависит от развивающихся стандартов, таких как WebGPU.

Итог: Рассматривая браузер как полнофункциональную вычислительную платформу — распределяя работу между воркерами, кэшируя модели и адаптируя каждую задачу ИИ под наиболее эффективную среду выполнения — Timeline Studio доказывает, что полностью локальный видеоредактор с ИИ не просто возможен; он может быть практичным для обычных создателей контента, которые ценят скорость и приватность.