Timeline Studio، یک ویرایشگر ویدیو متن‌باز که با React ساخته شده است، اکنون تمام ویژگی‌های هوش مصنوعی خود را کاملاً درون مرورگر اجرا می‌کند. کد نویسنده به کاربران اجازه می‌دهد بدون ارسال حتی یک فایل به سرور از راه دور، صداگذاری کنند، صوت را به متن تبدیل کنند، سوژه‌ها را شناسایی کنند، پرتره‌های سخنگو بسازند و کلیپ‌های نهایی را خروجی بگیرند.

چرا یک ویرایشگر با اولویت محلی (local-first) اهمیت دارد

ابزارهای ویدئویی معمول که از هوش مصنوعی بهره می‌برند، تصاویر خام را به سرویس‌های ابری ارسال می‌کنند و سپس منتظر می‌مانند تا سرور مدل‌های تبدیل گفتار به متن، خط لوله‌های تحلیل تصویر یا مولدهای جعل عمیق (deep-fake) را اجرا کند. این رفت‌وبرگشت باعث ایجاد تأخیر چند ثانیه‌ای یا چند دقیقه‌ای می‌شود و کاربران را مجبور می‌کند تا رسانه‌هایی را که پتانسیل حساس بودن دارند، به یک شخص ثالث بسپارند. Timeline Studio با نگه داشتن تمام محاسبات روی دستگاه کاربر، این نگرانی‌های مربوط به حریم خصوصی را از بین می‌برد و از هزینه‌های مکرر استنتاج (inference) مبتنی بر ابر جلوگیری می‌کند.

چگونه مرورگر به موتور محاسباتی تبدیل شد

اجرای شبکه‌های عصبی سنگین در یک صفحه وب، صرفاً به معنای بارگذاری یک فایل مدل نیست. مرورگر محدودیت‌های سختی را بر حافظه، استفاده از CPU و زمان‌بندی رشته‌ها (thread scheduling) اعمال می‌کند. نویسنده دریافت که برای یک پیاده‌سازی موفق، باید با مرورگر مانند یک سیستم‌عامل کامل رفتار کرد: تخصیص دقیق حافظه، ذخیره‌سازی هوشمندانه داده‌ها (cache) و انتقال کارها به رشته‌های پس‌زمینه.

اقدامات کلیدی مهندسی

  • مسیرهای مدل مختص به وظیفه – وظایف مختلف هوش مصنوعی از مناسب‌ترین محیط اجرا (runtime) استفاده می‌کنند. تبدیل گفتار به متن از Whisper که به WebAssembly (WASM) کامپایل شده استفاده می‌کند، در حالی که مولد پرتره عصبی از WebGPU، یعنی API نوظهور گرافیک-محاسباتی مرورگر، بهره می‌برد.
  • استفاده از Web Workers برای کارهای سنگین – استنتاج مدل، رمزگشایی صوتی و سایر مراحل سنگین از نظر پردازشی در ورکرهای اختصاصی اجرا می‌شوند. رشته رابط کاربری (UI thread) پاسخگو باقی می‌ماند، بنابراین پیمایش در خط زمان (timeline) هرگز باعث هنگ کردن صفحه نمی‌شود.
  • بارگذاری تنبل (Lazy-loading) مدل‌ها – ویرایشگر تنها زمانی یک مدل را دانلود می‌کند که کاربر ویژگی مربوطه را فراخوانی کند. بنابراین، یک نصب تازه در عرض چند ثانیه بارگذاری می‌شود، به جای اینکه کاربر منتظر دانلود صدها مگابایت داده بماند.
  • پیش‌تحلیل زمانی – کد به جای بررسی تک‌فریم‌ها، ویدیو را در فواصل زمانی منظم نمونه‌برداری کرده و یک نقشه سوژه می‌سازد که با حرکت افراد به‌روز می‌شود. این کار دقت تشخیص را در طول کلیپ حفظ می‌کند.
  • ریاضیات سفارشی برای WebGPU – خط لوله اصلی پرتره بر عملیات نمونه‌برداری ۵ بعدی متکی بود که WebGPU از آن پشتیبانی نمی‌کند. نویسنده آن هسته‌ها (kernels) را به معادل‌های ۴ بعدی بازنویسی کرد و آن‌ها را با آستانه‌های خطای عددی سخت‌گیرانه تأیید کرد.
  • ذخیره‌سازی در Service-worker – پس از دریافت یک مدل، یک service worker آن را در حافظه پنهان (cache) مرورگر ذخیره می‌کند. جلسات بعدی بلافاصله بارگذاری می‌شوند و از دانلودهای مکرر بلوک‌های باینری بزرگ جلوگیری می‌شود.

هزینه محلی ماندن

هوش مصنوعی با اولویت محلی، بار پردازشی را از ارائه‌دهندگان ابری به دستگاه کاربر منتقل می‌کند. مدل‌ها فضای دیسک را اشغال کرده و هنگام اجرا RAM را مصرف می‌کنند که می‌تواند در دستگاه‌های ضعیف یک مشکل باشد. حافظه پنهان service-worker ترافیک شبکه مکرر را کاهش می‌دهد.

آنچه باید در آینده منتظر آن بود

این نمونه اولیه نشان می‌دهد که مرورگرهای مدرن می‌توانند خط لوله‌های پیچیده هوش رسانه‌ای را میزبانی کنند، اما این رویکرد همچنان به استانداردهای نوظهور مانند WebGPU وابسته است.

نتیجه‌گیری: Timeline Studio با برخورد با مرورگر به عنوان یک پلتفرم محاسباتی تمام‌عیار (full-stack)—از طریق تقسیم کار بین ورکرها، ذخیره‌سازی مدل‌ها در حافظه پنهان و متناسب‌سازی هر وظیفه هوش مصنوعی با کارآمدترین محیط اجرا—ثابت می‌کند که یک ویرایشگر ویدیوی هوش مصنوعی کاملاً محلی نه تنها ممکن است، بلکه می‌تواند برای تولیدکنندگان محتوای روزمره که برای سرعت و حریم خصوصی ارزش قائل هستند، کاربردی باشد.