Timeline Studio, React ಬಳಿ ನಿರ್ಮಿಸಲಾದ ಓಪನ್-ಸೋರ್ಸ್ ವಿಡಿಯೋ ಎಡಿಟರ್, ಈಗ ತನ್ನ ಎಲ್ಲಾ AI ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಬ್ರೌಸರ್ನ ಒಳಗೇ ಚಲಾಯಿಸುತ್ತದೆ. ಲೇಖಕರ ಕೋಡ್ ಬಳಕೆದಾರರಿಗೆ ಯಾವುದೇ ಫೈಲ್ ಅನ್ನು ರಿಮೋಟ್ ಸರ್ವರ್ಗೆ ಕಳುಹಿಸದೆ ವಾಯ್ಸ್ಓವರ್ಗಳನ್ನು ರಚಿಸಲು, ಆಡಿಯೋವನ್ನು ಟ್ರಾನ್ಸ್ಕ್ರೈಬ್ ಮಾಡಲು, ವಿಷಯಗಳನ್ನು (subjects) ಪತ್ತೆಹಚ್ಚಲು, ಮಾತನಾಡುವ ಭಾವಚಿತ್ರಗಳನ್ನು (talking portraits) ಸೃಷ್ಟಿಸಲು ಮತ್ತು ಪೂರ್ಣಗೊಂಡ ಕ್ಲಿಪ್ಗಳನ್ನು ಎಕ್ಸ್ಪೋರ್ಟ್ ಮಾಡಲು ಅನುಮತಿಸುತ್ತದೆ.
ಲೋಕಲ್-ಫಸ್ಟ್ ಎಡಿಟರ್ ಏಕೆ ಮುಖ್ಯ
ಸಾಮಾನ್ಯ AI-ಚಾಲಿತ ವಿಡಿಯೋ ಪರಿಕರಗಳು ಕಚ್ಚಾ ದೃಶ್ಯಗಳನ್ನು (raw footage) ಕ್ಲೌಡ್ ಸೇವೆಗಳಿಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡುತ್ತವೆ, ನಂತರ ಸ್ಪೀಚ್-ಟು-ಟೆಕ್ಸ್ಟ್ ಮಾಡೆಲ್ಗಳು, ಇಮೇಜ್-ಅನಾಲಿಸಿಸ್ ಪೈಪ್ಲೈನ್ಗಳು ಅಥವಾ ಡೀಪ್-ಫೇಕ್ ಜನರೇಟರ್ಗಳನ್ನು ರನ್ ಮಾಡಲು ಸರ್ವರ್ನ ನಿರೀಕ್ಷಿಸಬೇಕಾಗುತ್ತದೆ. ಈ ಪ್ರಕ್ರಿಯೆಯು ಸೆಕೆಂಡುಗಳು ಅಥವಾ ನಿಮಿಷಗಳ ವಿಳಂಬವನ್ನು (latency) ಉಂಟುಮಾಡುತ್ತದೆ ಮತ್ತು ಬಳಕೆದಾರರು ತಮ್ಮ ಸಂವೇದನಾಶೀಲ ಮಾಧ್ಯಮಗಳನ್ನು (sensitive media) ಮೂರನೇ ವ್ಯಕ್ತಿಯ ಮೇಲೆ ನಂಬುವಂತೆ ಮಾಡುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಕಂಪ್ಯೂಟೇಶನ್ ಅನ್ನು ಕ್ಲೈಂಟ್ ಸಾಧನದಲ್ಲೇ ಇರಿಸುವ ಮೂಲಕ, Timeline Studio ಆ ಗೌಪ್ಯತೆಯ ಕಾಳಜಿಗಳನ್ನು ನಿವಾರಿಸುತ್ತದೆ ಮತ್ತು ಕ್ಲೌಡ್ ಆಧಾರಿತ ಇನ್ಫರೆನ್ಸ್ನ ಪುನರಾವರ್ತಿತ ವೆಚ್ಚವನ್ನು ತಪ್ಪಿಸುತ್ತದೆ.
ಬ್ರೌಸರ್ ಕಂಪ್ಯೂಟ್ ಇಂಜಿನ್ ಆಗಿ ಹೇಗೆ ಬದಲಾಯಿತು
ವೆಬ್ ಪೇಜ್ನಲ್ಲಿ ಭಾರೀ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ಗಳನ್ನು (heavyweight neural nets) ರನ್ ಮಾಡುವುದು ಕೇವಲ ಮಾಡೆಲ್ ಫೈಲ್ ಅನ್ನು ಲೋಡ್ ಮಾಡುವ ವಿಷಯವಲ್ಲ. ಬ್ರೌಸರ್ ಮೆಮೊರಿ, CPU ಬಳಕೆ ಮತ್ತು ಥ್ರೆಡ್ ಶೆಡ್ಯೂಲಿಂಗ್ ಮೇಲೆ ಕಟ್ಟುನಿಟ್ಟಿನ ಮಿತಿಗಳನ್ನು ಹೇರುತ್ತದೆ. ಯಶಸ್ವಿ ಅನುಷ್ಠಾನಕ್ಕಾಗಿ ಬ್ರೌಸರ್ ಅನ್ನು ಪೂರ್ಣ ಪ್ರಮಾಣದ ಆಪರೇಟಿಂಗ್ ಸಿಸ್ಟಮ್ ಆಗಿ ಪರಿಗಣಿಸಬೇಕೆಂದು ಲೇಖಕರು ಕಂಡುಕೊಂಡರು: ಮೆಮೊರಿಯನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ಹಂಚಿಕೆ ಮಾಡುವುದು, ಡೇಟಾವನ್ನು ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ಕ್ಯಾಶ್ ಮಾಡುವುದು ಮತ್ತು ಕೆಲಸವನ್ನು ಬ್ಯಾಕ್ಗ್ರೌಂಡ್ ಥ್ರೆಡ್ಗಳಿಗೆ ವರ್ಗಾಯಿಸುವುದು.
ಪ್ರಮುಖ ಎಂಜಿನಿಯರಿಂಗ್ ಕ್ರಮಗಳು
- ಕಾರ್ಯ-ನಿರ್ದಿಷ್ಟ ಮಾಡೆಲ್ ಮಾರ್ಗಗಳು (Task-specific model paths) – ವಿಭಿನ್ನ AI ಕೆಲಸಗಳು ಅತ್ಯಂತ ಸೂಕ್ತವಾದ ರನ್ಟೈಮ್ ಅನ್ನು ಬಳಸುತ್ತವೆ. ಸ್ಪೀಚ್ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ Whisper ಅನ್ನು WebAssembly (WASM) ಗೆ ಕಾಂಪೈಲ್ ಮಾಡಿ ರನ್ ಮಾಡುತ್ತದೆ, ಆದರೆ ನ್ಯೂರಲ್ ಪೋರ್ಟ್ರೇಟ್ ಜನರೇಟರ್ ಬ್ರೌಸರ್ನ ಉದಯೋನ್ಮುಖ ಗ್ರಾಫಿಕ್ಸ್-ಕಂಪ್ಯೂಟ್ API ಆದ WebGPU ಅನ್ನು ಬಳಸುತ್ತದೆ.
- ಭಾರೀ ಕೆಲಸಗಳಿಗಾಗಿ Web Workers – ಮಾಡೆಲ್ ಇನ್ಫರೆನ್ಸ್, ಆಡಿಯೋ ಡಿಕೋಡಿಂಗ್ ಮತ್ತು ಇತರ CPU-ದಟ್ಟವಾದ ಹಂತಗಳು ಮೀಸಲಾದ ವರ್ಕರ್ಸ್ಗಳಲ್ಲಿ ಕಾರ್ಯಗತಗೊಳ್ಳುತ್ತವೆ. UI ಥ್ರೆಡ್ ಸ್ಪಂದನೀಯವಾಗಿ ಇರುತ್ತದೆ, ಆದ್ದರಿಂದ ಟೈಮ್ಲೈನ್ ಸ್ಕ್ರಬ್ಬಿಂಗ್ ಮಾಡುವುದರಿಂದ ಸ್ಕ್ರೀನ್ ಎಂದಿಗೂ ಫ್ರೀಜ್ ಆಗುವುದಿಲ್ಲ.
- ಮಾಡೆಲ್ಗಳ ಲೇಜಿ-ಲೋಡಿಂಗ್ (Lazy-loading of models) – ಬಳಕೆದಾರರು ಸಂಬಂಧಿತ ವೈಶಿಷ್ಟ್ಯವನ್ನು ಬಳಸಿದಾಗ ಮಾತ್ರ ಎಡಿಟರ್ ಮಾಡೆಲ್ ಅನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡುತ್ತದೆ. ಆದ್ದರಿಂದ, ಹೊಸ ಇನ್ಸ್ಟಾಲೇಶನ್ ನೂರಾರು ಮೆಗಾಬೈಟ್ಗಳ ಡೇಟಾಕ್ಕಾಗಿ ಕಾಯುವ ಬದಲು ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಲೋಡ್ ಆಗುತ್ತದೆ.
- ಟೆಂಪೊರಲ್ ಪ್ರೀ-ಅನಾಲಿಸಿಸ್ (Temporal pre-analysis) – ಕೇವಲ ಒಂದು ಫ್ರೇಮ್ ಅನ್ನು ಪರೀಕ್ಷಿಸುವ ಬದಲು, ಕೋಡ್ ವಿಡಿಯೋವನ್ನು ನಿಯಮಿತ ಅಂತರದಲ್ಲಿ ಸ್ಯಾಂಪಲ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಜನರು ಚಲಿಸಿದಂತೆ ಅಪ್ಡೇಟ್ ಆಗುವ ಸಬ್ಜೆಕ್ಟ್ ಮ್ಯಾಪ್ ಅನ್ನು ನಿರ್ಮಿಸುತ್ತದೆ. ಇದು ಕ್ಲಿಪ್ನಾದ್ಯಂತ ಪತ್ತೆಹಚ್ಚುವಿಕೆಯನ್ನು ನಿಖರವಾಗಿರಿಸುತ್ತದೆ.
- WebGPU ಗಾಗಿ ಕಸ್ಟಮ್ ಮ್ಯಾಥ್ – ಮೂಲ ಪೋರ್ಟ್ರೇಟ್ ಪೈಪ್ಲೈನ್ WebGPU ಬೆಂಬಲಿಸದ 5-ಆಯಾಮದ ಸ್ಯಾಂಪಲಿಂಗ್ ಕಾರ್ಯಾಚರಣೆಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿತ್ತು. ಲೇಖಕರು ಆ ಕರ್ನೆಲ್ಗಳನ್ನು 4-ಆಯಾಮದ ಸಮಾನ ರೂಪಗಳಾಗಿ ಮರುಬರೆದರು ಮತ್ತು ಕಟ್ಟುನಿಟ್ಟಾದ ನ್ಯೂಮರಿಕಲ್ ಎರರ್ ಥ್ರೆಶೋಲ್ಡ್ಗಳ ವಿರುದ್ಧ ಅವುಗಳನ್ನು ಪರಿಶೀಲಿಸಿದರು.
- Service-worker ಕ್ಯಾಶಿಂಗ್ – ಒಮ್ಮೆ ಮಾಡೆಲ್ ಅನ್ನು ಪಡೆದ ನಂತರ, service worker ಅದನ್ನು ಬ್ರೌಸರ್ ಕ್ಯಾಶ್ನಲ್ಲಿ ಸಂಗ್ರಹಿಸುತ್ತದೆ. ಮುಂದಿನ ಸೆಷನ್ಗಳು ತಕ್ಷಣವೇ ಲೋಡ್ ಆಗುತ್ತವೆ, ಇದರಿಂದ ದೊಡ್ಡ ಬೈನರಿ ಬ್ಲೋಬ್ಗಳ ಪದೇ ಪದೇ ಡೌನ್ಲೋಡ್ ಮಾಡುವುದನ್ನು ತಪ್ಪಿಸಬಹುದು.
ಲೋಕಲ್ ಆಗಿ ಉಳಿಯುವ ಬೆಲೆ
ಲೋಕಲ್-ಫಸ್ಟ್ AI ಕ್ಲೌಡ್ ಪ್ರೊವೈಡರ್ಗಳಿಂದ ಹೊರೆಯನ್ನು ಬಳಕೆದಾರರ ಸಾಧನಕ್ಕೆ ವರ್ಗಾಯಿಸುತ್ತದೆ. ಮಾಡೆಲ್ಗಳು ಡಿಸ್ಕ್ ಸ್ಪೇಸ್ ಅನ್ನು ಆಕ್ರಮಿಸುತ್ತವೆ ಮತ್ತು ರನ್ ಆಗುವಾಗ RAM ಅನ್ನು ಬಳಸುತ್ತವೆ, ಇದು ಕಡಿಮೆ ಸಾಮರ್ಥ್ಯದ (low-end) ಯಂತ್ರಗಳಲ್ಲಿ ಸಮಸ್ಯೆಯಾಗಬಹುದು. Service-worker ಕ್ಯಾಶ್ ಪದೇ ಪದೇ ಆಗುವ ನೆಟ್ವರ್ಕ್ ಟ್ರಾಫಿಕ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಈ ಪ್ರೊಟೊಟೈಪ್ ಆಧುನಿಕ ಬ್ರೌಸರ್ಗಳು ಸಂಕೀರ್ಣ ಮಾಧ್ಯಮ-ಬುದ್ಧಿಮತ್ತೆ ಪೈಪ್ಲೈನ್ಗಳನ್ನು (media-intelligence pipelines) ಹೊಂದಲು ಸಾಧ್ಯ ಎಂದು ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಈ ವಿಧಾನವು ಇನ್ನೂ WebGPU ನಂತಹ ಉದಯೋನ್ಮುಖ ಮಾನದಂಡಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ.
ಸಾರಾಂಶ: ಬ್ರೌಸರ್ ಅನ್ನು ಫುಲ್-ಸ್ಟಾಕ್ ಕಂಪ್ಯೂಟ್ ಪ್ಲಾಟ್ಫಾರ್ಮ್ ಆಗಿ ಪರಿಗಣಿಸುವ ಮೂಲಕ—ಕೆಲಸವನ್ನು ವರ್ಕರ್ಸ್ಗಳ ನಡುವೆ ವಿಂಗಡಿಸುವುದು, ಮಾಡೆಲ್ಗಳನ್ನು ಕ್ಯಾಶ್ ಮಾಡುವುದು ಮತ್ತು ಪ್ರತಿ AI ಕಾರ್ಯವನ್ನು ಅತ್ಯಂತ ಪರಿಣಾಮಕಾರಿ ರನ್ಟೈಮ್ಗೆ ಅನುಗುಣವಾಗಿ ರೂಪಿಸುವುದು—Timeline Studio ಸಂಪೂರ್ಣವಾಗಿ ಲೋಕಲ್ AI ವಿಡಿಯೋ ಎಡಿಟರ್ ಕೇವಲ ಸಾಧ್ಯವಷ್ಟೇ ಅಲ್ಲ; ವೇಗ ಮತ್ತು ಗೌಪ್ಯತೆಯನ್ನು ಗೌರವಿಸುವ ದೈನಂದಿನ ಕ್ರಿಯೇಟರ್ಗಳಿಗೆ ಇದು ಪ್ರಾಯೋಗಿಕವಾಗಿದೆ ಎಂದು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
