اکثر نرمافزارهای خلاقانه همچنان انتظار دارند که یک انسان میان ایده و فایل نهایی قرار بگیرد. ممکن است یک ویرایش ویدیو را برای یک هوش مصنوعی توصیف کنید، اما کار واقعیِ کوتاه کردن کلیپها، تنظیم لایهها و خروجی گرفتن از فریمها معمولاً بر عهده خود شماست. این شکاف به این دلیل وجود دارد که ویرایش رسانه یک وظیفه تکمرحلهای «پرسش و پاسخ» نیست؛ بلکه زنجیره طولانی از تصمیمات وابسته است که در آن مرحله سوم تنها زمانی معنا پیدا میکند که مرحله دوم واقعاً تایملاین را تغییر داده باشد. پروژهای که اخیراً به اشتراک گذاشته شده است، با متصل کردن Claude Code به یک خط لوله (pipeline) ویرایش ویدیوی حالتمند (stateful) که توسط Gemini Interactions API قدرت گرفته است، دقیقاً با همین اصطکاک مقابله میکند. نتیجه، یک نمایش عملی از این است که چگونه میتوان یک عامل هوش مصنوعی (AI agent) را وادار کرد تا به جای صرفاً پیشنهاد دادن یک گردش کار، واقعاً آن را هدایت کند.
یک کارگردان و یک تدوینگر
معماری این سیستم به عمد تقسیم شده است. Claude Code به عنوان کارگردان عمل میکند؛ برنامهریزی سطح بالا را مدیریت میکند، دستورالعملهای خلاقانه مبهم را تفسیر میکند و تصمیم میگیرد که مرحله بعدی چه باید باشد. این مدل درخواستی مانند «سکوتهای اضافی را حذف کن و یک کارت عنوان اضافه کن» را به وظایف مجزا تقسیم کرده و سپس پیش از رفتن به مرحله بعد، موفقیت هر وظیفه را نظارت میکند.
Gemini Interactions API منطق تخصصی ویرایش را مدیریت میکند. به جای اینکه یک مدل عمومی را مجبور به شبیهسازی یک تدوینگر ویدیو کنیم، این ساختار از Gemini Interactions API به عنوان اپراتور عملیاتی استفاده میکند که برشها را اجرا، وضعیت تایملاین را ارزیابی و نتایج ملموس را گزارش میکند. سیستم هر دو وظیفه را در یک مدل واحد ادغام نمیکند، بلکه لایه استدلال را از لایه استفاده از ابزار جدا نگه میدارد؛ این یعنی هر بخش میتواند بر کاری که در آن بهترین است تمرکز کند.
این تقسیمبندی بازتابدهنده نحوه عملکرد تیمهای واقعی پس از تولید (post-production) است. کارگردان داستان را میشناسد و تصمیم نهایی را میگیرد. تدوینگر نرمافزار را میشناسد و پیکسلها را دستکاری میکند. وقتی یک عامل سعی میکند هر دو کار را در یک پنجره کانتکست (context window) انجام دهد، اغلب با مشکلات سینتکس مواجه میشود یا فراموش میکند که کدام کلیپ در کدام ترک قرار دارد. تقسیم بار کاری این مشکل را حل میکند.
چرا حافظه همه چیز را تغییر میدهد
ویرایش ویدیو ذاتاً حالتمند (stateful) است. اگر یک کلیپ را چهار ثانیه کوتاه کنید، تمام انتقالها (transitions)، نشانههای صوتی و جایگذاری زیرنویسهای بعدی باید برای مطابقت تغییر کنند. اکثر عوامل هوش مصنوعی در اینجا با مشکل مواجه میشوند، زیرا با هر مرحله به عنوان یک پرسوجوی (query) مجزا برخورد میکنند. آنها ممکن است در یک پاسخ یک برش را پیشنهاد دهند، سپس در پاسخ بعدی تایملاین متفاوتی را توهم (hallucinate) کنند، یا اثری را برای بخشی پیشنهاد دهند که دیگر وجود ندارد.
Gemini Interactions API برای حفظ حالت (state) در طول این عملیات ساخته شده است. این API وضعیت واقعی پروژه را همزمان با کارکرد عامل دنبال میکند. این یعنی سیستم میداند که آیا خروجی (export) با شکست مواجه شده، آیا یک کلیپ قبلاً پردازش شده، یا آیا اصلاح رنگ (color grade) اعمال شده است یا خیر. وقتی Claude دستور بعدی را صادر میکند، بر اساس وضعیت واقعی و فعلی تایملاین کار میکند، نه بر اساس یک حدس.
برای هر کسی که دیده است یک هوش مصنوعی با اعتماد به نفس یک اصلاح «ساده» پنجمرحلهای را پیشنهاد دهد که چهار مرحله قبلی را کاملاً نادیده میگیرد، ارزش حالت پایدار (persistent state) کاملاً بدیهی است. وظایف خلاقانه بدون حافظه به سرعت کیفیت خود را از دست میدهند. یک بکاِند (backend) حالتمند، یک چتبات را به مشارکتکنندهای تبدیل میکند که واقعاً میتواند یک کار را به پایان برساند.
گردش کار چگونه به نظر میرسد
یک توالی عملی را تصور کنید. شما چندین کلیپ خام را به سیستم میدهید و درخواست یک نسخه نهایی برای شبکههای اجتماعی را میکنید. ابتدا Claude Code درخواست را ارزیابی میکند. ممکن است تصمیم بگیرد که فوتیج نیاز به لرزشگیر (stabilization)، سپس استخراج صدا (voice-over extraction)، سپس زیرنویس و در نهایت برش عمودی (vertical crop) دارد. این مدل آنها را به صورت یک برنامه ساختاردهی کرده و شروع به فراخوانی Gemini Interactions API میکند تا هر مورد را به ترتیب اجرا کند.
Gemini عملیات رسانهای را انجام داده و بازخورد ساختاریافتهای را برمیگرداند. شاید لرزشگیر با موفقیت انجام شده باشد، اما جداسازی صدا دیالوگهای همپوشانی را پیدا کرده باشد که باعث میشود زیرنویسها غیرقابل اعتماد باشند. Claude آن بهروزرسانی را دریافت میکند، برنامه را اصلاح میکند و از Gemini میخواهد رویکرد متفاوتی را امتحان کند، مانند شناسایی بخشهای گوینده قبل از تولید لایههای متنی (text overlays). از آنجایی که API حالت را حفظ میکند، میتواند تأیید کند که ترک زیرنویس با ویدیوی جدیداً تثبیتشده مطابقت دارد، نه با فوتیج لرزان اصلی.
این حلقه تا زمانی که چکلیست کامل شود ادامه مییابد. سیستم به جای تولید یک اسکریپت تکباره، یک گردش کار واقعی برای وظایف پیچیده ویدئویی ایجاد میکند. اگر رندر به دلیل ناسازگاری تنظیمات کدک (codec) با شکست مواجه شود، خطا به Claude بازگردانده میشود که میتواند پارامترها را تنظیم کرده و دوباره تلاش کند. عامل هوش مصنوعی پس از اولین مانع، پروژه را رها نمیکند.
استفاده از مدلهای مختلف برای نقاط قوت متفاوت
این پروژه همچنین یک الگوی طراحی گستردهتر در مهندسی هوش مصنوعی را نشان میدهد: از تلاش برای وادار کردن یک مدل به انجام همه کارها دست بردارید. Claude Code در استدلال از طریق دستورالعملهای مبهم، مدیریت منطق شاخهای و حفظ بافتار (context) گفتگو در طول یک نشست طولانی مهارت دارد. Gemini Interactions API، بهویژه در تعامل با رسانههای غنی و استفاده از ابزارها، قابلیتهای چندوجهی (multimodal) عمیق و اجرای حالتمند (stateful) را به ارمغان میآورد. با اتصال آنها به یکدیگر، شما محدودیتهای هر یک را دور میزنید.
یک مدل استدلالگر که هرگز با یک ویرایشگر غیرخطی کار نکرده است، همچنان میتواند یک تدوین عالی را هدایت کند، به شرطی که به یک لایه اجرا با دسترسی به کدکها، فریمهای کلیدی (keyframes) و سلسلهمراتب ترکها داشته باشد. برعکس، یک API مسلط به رسانه نیازی به تجزیه یادداشتهای خلاقانه انتزاعی ندارد، اگر یک مدل برنامهریز قبلاً آنها را به مراحل ملموس ترجمه کرده باشد. نقاط قوت یکی، نقاط ضعف دیگری را جبران میکند.
این یک بحث تئوری نیست. این ساختار بهوضوح نشان میدهد که چگونه مدلهای مختلف هوش مصنوعی برای مدیریت دستهای از کارها، یعنی تدوین خلاقانه ویدیو، که عاملهای تکمدلی اغلب در اتمام آن شکست میخورند، با هم همکاری میکنند. برای توسعهدهندگانی که در حال ساخت سیستمهای عاملمحور (agentic systems) هستند، این درس را نمیتوان نادیده گرفت. از لایه ارکستراسیون (orchestration) خود نخواهید که متخصص شما باشد، و از متخصص خود نخواهید که استراتژیست شما باشد.
آنچه سازندگان باید بیاموزند
برای مفید دانستن این الگو، نیازی نیست که یک استودیو ویدیو مدیریت کنید. هر حوزهای که نیازمند کارهای چندمرحلهای در یک محیط متغیر باشد، مانند جریانهای کاری CAD، مهندسی صدا، تجسم دادهها یا محاسبات علمی، میتواند از همین ساختار بهره ببرد. یک مدل به عنوان مدیر پروژه پایدار عمل میکند. یک API یا ابزار تخصصی، عملیات حالتمند را در داخل نرمافزار مربوط به آن حوزه مدیریت میکند.
وظیفه توسعهدهنده از نوشتن پرامپتهای عظیم که در آنها دعا میکنید مدل همه چیز را به یاد بیاورد، به طراحی انتقالهای (handoffs) تمیز بین استدلال و اجرا تغییر مییابد. مدیریت وضعیت (State management) به بخش حیاتی تبدیل میشود. اگر عامل شما نتواند ببیند که پس از آخرین اقدامش چه چیزی تغییر کرده است، نمیتواند دوباره با اطمینان عمل کند.
میتوانید تحلیل کامل نحوه عملکرد این یکپارچهسازی، شامل تعاملات خاص API و ساختار پروژه را در پست مفصل در dev.to مطالعه کنید.
نتیجهگیری اصلی
حل کارهای خلاقانه پیچیده با هوش مصنوعی نیازمند انتظار برای یک مدل واحد و بینقص نیست که بتواند همه چیز را به طور همزمان برنامهریزی، به خاطر بسپارد و اجرا کند. بلکه نیازمند دادن حافظهای به عامل است که بین مراحل حفظ شود و یک متخصص که بتواند واقعاً کارها را به او واگذار کند. اجازه دهید متفکر، فکر کند. اجازه دهید تدوینگر، تدوین کند.
