Timeline Studio, ਜੋ ਕਿ React ਨਾਲ ਬਣਾਇਆ ਗਿਆ ਇੱਕ open-source ਵੀਡੀਓ ਐਡੀਟਰ ਹੈ, ਹੁਣ ਆਪਣੀਆਂ ਸਾਰੀਆਂ AI ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬ੍ਰਾਊਜ਼ਰ ਦੇ ਅੰਦਰ ਚਲਾਉਂਦਾ ਹੈ। ਲੇਖਕ ਦਾ ਕੋਡ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਵੌਇਸਓਵਰ (voiceovers) ਬਣਾਉਣ, ਆਡੀਓ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨ, ਵਿਸ਼ਿਆਂ (subjects) ਦੀ ਪਛਾਣ ਕਰਨ, ਗੱਲ ਕਰਦੇ ਹੋਏ ਚਿੱਤਰ (talking portraits) ਬਣਾਉਣ ਅਤੇ ਕਿਸੇ ਰਿਮੋਟ ਸਰਵਰ 'ਤੇ ਫਾਈਲ ਭੇਜੇ ਬਿਨਾਂ ਤਿਆਰ ਕਲਿੱਪਾਂ ਨੂੰ ਐਕਸਪੋਰਟ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।

ਇੱਕ local-first ਐਡੀਟਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਆਮ AI-ਪਾਵਰਡ ਵੀਡੀਓ ਟੂਲ ਕੱਚੀ ਫੁਟੇਜ (raw footage) ਨੂੰ ਕਲਾਉਡ ਸੇਵਾਵਾਂ 'ਤੇ ਸਟ੍ਰੀਮ ਕਰਦੇ ਹਨ, ਫਿਰ speech-to-text ਮਾਡਲਾਂ, image-analysis ਪਾਈਪਲਾਈਨਾਂ ਜਾਂ deep-fake ਜਨਰੇਟਰਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਸਰਵਰ ਦੀ ਉਡੀਕ ਕਰਦੇ ਹਨ। ਇਹ ਪ੍ਰਕਿਰਿਆ ਕੁਝ ਸਕਿੰਟ ਜਾਂ ਮਿੰਟਾਂ ਦੀ ਦੇਰੀ (latency) ਪੈਦਾ ਕਰਦੀ ਹੈ, ਅਤੇ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਸੰਵੇਦਨਸ਼ੀਲ ਮੀਡੀਆ ਦੇ ਨਾਲ ਕਿਸੇ ਤੀਜੀ ਧਿਰ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦੀ ਹੈ। ਹਰ ਕੰਪਿਊਟੇਸ਼ਨ ਨੂੰ ਕਲਾਇੰਟ ਡਿਵਾਈਸ 'ਤੇ ਰੱਖ ਕੇ, Timeline Studio ਪ੍ਰਾਈਵੇਸੀ ਦੀਆਂ ਉਹ ਚਿੰਤਾਵਾਂ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ ਅਤੇ ਕਲਾਉਡ-ਅਧਾਰਤ inference ਦੀ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲੀ ਲਾਗਤ ਤੋਂ ਬਚਦਾ ਹੈ।

ਬ੍ਰਾਊਜ਼ਰ ਇੱਕ ਕੰਪਿਊਟ ਇੰਜਣ ਕਿਵੇਂ ਬਣਿਆ

ਇੱਕ ਵੈੱਬ ਪੇਜ ਵਿੱਚ ਭਾਰੀ neural nets ਚਲਾਉਣਾ ਸਿਰਫ਼ ਇੱਕ ਮਾਡਲ ਫਾਈਲ ਲੋਡ ਕਰਨ ਦੀ ਗੱਲ ਨਹੀਂ ਹੈ। ਬ੍ਰਾਊਜ਼ਰ ਮੈਮੋਰੀ, CPU ਦੀ ਵਰਤੋਂ ਅਤੇ thread scheduling 'ਤੇ ਸਖ਼ਤ ਸੀਮਾਵਾਂ ਲਗਾਉਂਦਾ ਹੈ। ਲੇਖਕ ਨੇ ਖੋਜਿਆ ਕਿ ਇੱਕ ਸਫਲ ਲਾਗੂਕਰਨ (implementation) ਲਈ ਬ੍ਰਾਊਜ਼ਰ ਨੂੰ ਇੱਕ ਪੂਰੇ ਆਪਰੇਟਿੰਗ ਸਿਸਟਮ ਵਾਂਗ ਮੰਨਣਾ ਪਵੇਗਾ: ਮੈਮੋਰੀ ਨੂੰ ਧਿਆਨ ਨਾਲ ਅਲਾਟ ਕਰਨਾ, ਡੇਟਾ ਨੂੰ ਸਮਝਦਾਰੀ ਨਾਲ ਕੈਸ਼ ਕਰਨਾ ਅਤੇ ਕੰਮ ਨੂੰ background threads ਨੂੰ ਸੌਂਪਣਾ।

ਮੁੱਖ ਇੰਜੀਨੀਅਰਿੰਗ ਕਦਮ

  • Task-specific model paths – ਵੱਖ-ਵੱਖ AI ਕੰਮਾਂ ਲਈ ਸਭ ਤੋਂ ਢੁਕਵੇਂ runtime ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। Speech transcription ਲਈ WebAssembly (WASM) ਵਿੱਚ ਕੰਪਾਈਲ ਕੀਤੇ Whisper ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਜਦੋਂ ਕਿ neural portrait generator WebGPU ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਬ੍ਰਾਊਜ਼ਰ ਦੀ ਉੱਭਰ ਰਹੀ graphics-compute API ਹੈ।
  • Web Workers for heavy lifting – Model inference, audio decoding ਅਤੇ ਹੋਰ CPU-ਭਾਰੀ ਕਦਮ ਸਮਰਪਿਤ (dedicated) workers ਵਿੱਚ ਚਲਦੇ ਹਨ। UI thread responsive ਰਹਿੰਦਾ ਹੈ, ਤਾਂ ਜੋ timeline ਨੂੰ scrub ਕਰਨ ਨਾਲ ਸਕ੍ਰੀਨ ਕਦੇ ਵੀ ਫ੍ਰੀਜ਼ ਨਾ ਹੋਵੇ।
  • Lazy-loading of models – ਐਡੀਟਰ ਮਾਡਲ ਨੂੰ ਉਦੋਂ ਹੀ ਡਾਊਨਲੋਡ ਕਰਦਾ ਹੈ ਜਦੋਂ ਉਪਭੋਗਤਾ ਸੰਬੰਧਿਤ ਵਿਸ਼ੇਸ਼ਤਾ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਇਸ ਲਈ, ਇੱਕ ਨਵਾਂ ਇੰਸਟਾਲੇਸ਼ਨ ਸੈਂਕੜੇ ਮੈਗਾਬਾਈਟ ਡੇਟਾ ਦੀ ਉਡੀਕ ਕਰਨ ਦੀ ਬਜਾਏ ਕੁਝ ਸਕਿੰਟਾਂ ਵਿੱਚ ਲੋਡ ਹੋ ਜਾਂਦਾ ਹੈ।
  • Temporal pre-analysis – ਇੱਕ ਸਿੰਗਲ ਫਰੇਮ ਦੀ ਜਾਂਚ ਕਰਨ ਦੀ ਬਜਾਏ, ਕੋਡ ਨਿਯਮਤ ਅੰਤਰਾਲਾਂ 'ਤੇ ਵੀਡੀਓ ਦੇ ਸੈਂਪਲ ਲੈਂਦਾ ਹੈ ਅਤੇ ਇੱਕ subject map ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਲੋਕਾਂ ਦੇ ਹਿੱਲਣ ਨਾਲ ਅਪਡੇਟ ਹੁੰਦਾ ਰਹਿੰਦਾ ਹੈ। ਇਹ ਪੂਰੀ ਕਲਿੱਪ ਦੌਰਾਨ ਡਿਟੈਕਸ਼ਨ ਨੂੰ ਸਹੀ ਰੱਖਦਾ ਹੈ।
  • Custom math for WebGPU – ਅਸਲ portrait pipeline 5-dimensional sampling operations 'ਤੇ ਨਿਰਭਰ ਸੀ ਜਿਨ੍ਹਾਂ ਨੂੰ WebGPU ਸਪੋਰਟ ਨਹੀਂ ਕਰਦਾ। ਲੇਖਕ ਨੇ ਉਹਨਾਂ kernels ਨੂੰ 4-dimensional equivalents ਵਜੋਂ ਦੁਬਾਰਾ ਲਿਖਿਆ ਅਤੇ ਸਖ਼ਤ numerical error thresholds