اکثر نرم‌افزارهای خلاقانه همچنان انتظار دارند که یک انسان میان ایده و فایل نهایی قرار بگیرد. ممکن است یک ویرایش ویدیو را برای یک هوش مصنوعی توصیف کنید، اما کار واقعیِ کوتاه کردن کلیپ‌ها، تنظیم لایه‌ها و خروجی گرفتن از فریم‌ها معمولاً بر عهده خود شماست. این شکاف به این دلیل وجود دارد که ویرایش رسانه یک وظیفه تک‌مرحله‌ای «پرسش و پاسخ» نیست؛ بلکه زنجیره طولانی از تصمیمات وابسته است که در آن مرحله سوم تنها زمانی معنا پیدا می‌کند که مرحله دوم واقعاً تایم‌لاین را تغییر داده باشد. پروژه‌ای که اخیراً به اشتراک گذاشته شده است، با متصل کردن Claude Code به یک خط لوله (pipeline) ویرایش ویدیوی حالت‌مند (stateful) که توسط Gemini Interactions API قدرت گرفته است، دقیقاً با همین اصطکاک مقابله می‌کند. نتیجه، یک نمایش عملی از این است که چگونه می‌توان یک عامل هوش مصنوعی (AI agent) را وادار کرد تا به جای صرفاً پیشنهاد دادن یک گردش کار، واقعاً آن را هدایت کند.

یک کارگردان و یک تدوینگر

معماری این سیستم به عمد تقسیم شده است. Claude Code به عنوان کارگردان عمل می‌کند؛ برنامه‌ریزی سطح بالا را مدیریت می‌کند، دستورالعمل‌های خلاقانه مبهم را تفسیر می‌کند و تصمیم می‌گیرد که مرحله بعدی چه باید باشد. این مدل درخواستی مانند «سکوت‌های اضافی را حذف کن و یک کارت عنوان اضافه کن» را به وظایف مجزا تقسیم کرده و سپس پیش از رفتن به مرحله بعد، موفقیت هر وظیفه را نظارت می‌کند.

Gemini Interactions API منطق تخصصی ویرایش را مدیریت می‌کند. به جای اینکه یک مدل عمومی را مجبور به شبیه‌سازی یک تدوینگر ویدیو کنیم، این ساختار از Gemini Interactions API به عنوان اپراتور عملیاتی استفاده می‌کند که برش‌ها را اجرا، وضعیت تایم‌لاین را ارزیابی و نتایج ملموس را گزارش می‌کند. سیستم هر دو وظیفه را در یک مدل واحد ادغام نمی‌کند، بلکه لایه استدلال را از لایه استفاده از ابزار جدا نگه می‌دارد؛ این یعنی هر بخش می‌تواند بر کاری که در آن بهترین است تمرکز کند.

این تقسیم‌بندی بازتاب‌دهنده نحوه عملکرد تیم‌های واقعی پس از تولید (post-production) است. کارگردان داستان را می‌شناسد و تصمیم نهایی را می‌گیرد. تدوینگر نرم‌افزار را می‌شناسد و پیکسل‌ها را دستکاری می‌کند. وقتی یک عامل سعی می‌کند هر دو کار را در یک پنجره کانتکست (context window) انجام دهد، اغلب با مشکلات سینتکس مواجه می‌شود یا فراموش می‌کند که کدام کلیپ در کدام ترک قرار دارد. تقسیم بار کاری این مشکل را حل می‌کند.

چرا حافظه همه چیز را تغییر می‌دهد

ویرایش ویدیو ذاتاً حالت‌مند (stateful) است. اگر یک کلیپ را چهار ثانیه کوتاه کنید، تمام انتقال‌ها (transitions)، نشانه‌های صوتی و جایگذاری زیرنویس‌های بعدی باید برای مطابقت تغییر کنند. اکثر عوامل هوش مصنوعی در اینجا با مشکل مواجه می‌شوند، زیرا با هر مرحله به عنوان یک پرس‌وجوی (query) مجزا برخورد می‌کنند. آن‌ها ممکن است در یک پاسخ یک برش را پیشنهاد دهند، سپس در پاسخ بعدی تایم‌لاین متفاوتی را توهم (hallucinate) کنند، یا اثری را برای بخشی پیشنهاد دهند که دیگر وجود ندارد.

Gemini Interactions API برای حفظ حالت (state) در طول این عملیات ساخته شده است. این API وضعیت واقعی پروژه را همزمان با کارکرد عامل دنبال می‌کند. این یعنی سیستم می‌داند که آیا خروجی (export) با شکست مواجه شده، آیا یک کلیپ قبلاً پردازش شده، یا آیا اصلاح رنگ (color grade) اعمال شده است یا خیر. وقتی Claude دستور بعدی را صادر می‌کند، بر اساس وضعیت واقعی و فعلی تایم‌لاین کار می‌کند، نه بر اساس یک حدس.

برای هر کسی که دیده است یک هوش مصنوعی با اعتماد به نفس یک اصلاح «ساده» پنج‌مرحله‌ای را پیشنهاد دهد که چهار مرحله قبلی را کاملاً نادیده می‌گیرد، ارزش حالت پایدار (persistent state) کاملاً بدیهی است. وظایف خلاقانه بدون حافظه به سرعت کیفیت خود را از دست می‌دهند. یک بک‌اِند (backend) حالت‌مند، یک چت‌بات را به مشارکت‌کننده‌ای تبدیل می‌کند که واقعاً می‌تواند یک کار را به پایان برساند.

گردش کار چگونه به نظر می‌رسد

یک توالی عملی را تصور کنید. شما چندین کلیپ خام را به سیستم می‌دهید و درخواست یک نسخه نهایی برای شبکه‌های اجتماعی را می‌کنید. ابتدا Claude Code درخواست را ارزیابی می‌کند. ممکن است تصمیم بگیرد که فوتیج نیاز به لرزش‌گیر (stabilization)، سپس استخراج صدا (voice-over extraction)، سپس زیرنویس و در نهایت برش عمودی (vertical crop) دارد. این مدل آن‌ها را به صورت یک برنامه ساختاردهی کرده و شروع به فراخوانی Gemini Interactions API می‌کند تا هر مورد را به ترتیب اجرا کند.

Gemini عملیات رسانه‌ای را انجام داده و بازخورد ساختاریافته‌ای را برمی‌گرداند. شاید لرزش‌گیر با موفقیت انجام شده باشد، اما جداسازی صدا دیالوگ‌های هم‌پوشانی را پیدا کرده باشد که باعث می‌شود زیرنویس‌ها غیرقابل اعتماد باشند. Claude آن به‌روزرسانی را دریافت می‌کند، برنامه را اصلاح می‌کند و از Gemini می‌خواهد رویکرد متفاوتی را امتحان کند، مانند شناسایی بخش‌های گوینده قبل از تولید لایه‌های متنی (text overlays). از آنجایی که API حالت را حفظ می‌کند، می‌تواند تأیید کند که ترک زیرنویس با ویدیوی جدیداً تثبیت‌شده مطابقت دارد، نه با فوتیج لرزان اصلی.

این حلقه تا زمانی که چک‌لیست کامل شود ادامه می‌یابد. سیستم به جای تولید یک اسکریپت تک‌باره، یک گردش کار واقعی برای وظایف پیچیده ویدئویی ایجاد می‌کند. اگر رندر به دلیل ناسازگاری تنظیمات کدک (codec) با شکست مواجه شود، خطا به Claude بازگردانده می‌شود که می‌تواند پارامترها را تنظیم کرده و دوباره تلاش کند. عامل هوش مصنوعی پس از اولین مانع، پروژه را رها نمی‌کند.

استفاده از مدل‌های مختلف برای نقاط قوت متفاوت

این پروژه همچنین یک الگوی طراحی گسترده‌تر در مهندسی هوش مصنوعی را نشان می‌دهد: از تلاش برای وادار کردن یک مدل به انجام همه کارها دست بردارید. Claude Code در استدلال از طریق دستورالعمل‌های مبهم، مدیریت منطق شاخه‌ای و حفظ بافتار (context) گفتگو در طول یک نشست طولانی مهارت دارد. Gemini Interactions API، به‌ویژه در تعامل با رسانه‌های غنی و استفاده از ابزارها، قابلیت‌های چندوجهی (multimodal) عمیق و اجرای حالت‌مند (stateful) را به ارمغان می‌آورد. با اتصال آن‌ها به یکدیگر، شما محدودیت‌های هر یک را دور می‌زنید.

یک مدل استدلال‌گر که هرگز با یک ویرایشگر غیرخطی کار نکرده است، همچنان می‌تواند یک تدوین عالی را هدایت کند، به شرطی که به یک لایه اجرا با دسترسی به کدک‌ها، فریم‌های کلیدی (keyframes) و سلسله‌مراتب ترک‌ها داشته باشد. برعکس، یک API مسلط به رسانه نیازی به تجزیه یادداشت‌های خلاقانه انتزاعی ندارد، اگر یک مدل برنامه‌ریز قبلاً آن‌ها را به مراحل ملموس ترجمه کرده باشد. نقاط قوت یکی، نقاط ضعف دیگری را جبران می‌کند.

این یک بحث تئوری نیست. این ساختار به‌وضوح نشان می‌دهد که چگونه مدل‌های مختلف هوش مصنوعی برای مدیریت دسته‌ای از کارها، یعنی تدوین خلاقانه ویدیو، که عامل‌های تک‌مدلی اغلب در اتمام آن شکست می‌خورند، با هم همکاری می‌کنند. برای توسعه‌دهندگانی که در حال ساخت سیستم‌های عامل‌محور (agentic systems) هستند، این درس را نمی‌توان نادیده گرفت. از لایه ارکستراسیون (orchestration) خود نخواهید که متخصص شما باشد، و از متخصص خود نخواهید که استراتژیست شما باشد.

آنچه سازندگان باید بیاموزند

برای مفید دانستن این الگو، نیازی نیست که یک استودیو ویدیو مدیریت کنید. هر حوزه‌ای که نیازمند کارهای چندمرحله‌ای در یک محیط متغیر باشد، مانند جریان‌های کاری CAD، مهندسی صدا، تجسم داده‌ها یا محاسبات علمی، می‌تواند از همین ساختار بهره ببرد. یک مدل به عنوان مدیر پروژه پایدار عمل می‌کند. یک API یا ابزار تخصصی، عملیات حالت‌مند را در داخل نرم‌افزار مربوط به آن حوزه مدیریت می‌کند.

وظیفه توسعه‌دهنده از نوشتن پرامپت‌های عظیم که در آن‌ها دعا می‌کنید مدل همه چیز را به یاد بیاورد، به طراحی انتقال‌های (handoffs) تمیز بین استدلال و اجرا تغییر می‌یابد. مدیریت وضعیت (State management) به بخش حیاتی تبدیل می‌شود. اگر عامل شما نتواند ببیند که پس از آخرین اقدامش چه چیزی تغییر کرده است، نمی‌تواند دوباره با اطمینان عمل کند.

می‌توانید تحلیل کامل نحوه عملکرد این یکپارچه‌سازی، شامل تعاملات خاص API و ساختار پروژه را در پست مفصل در dev.to مطالعه کنید.

نتیجه‌گیری اصلی

حل کارهای خلاقانه پیچیده با هوش مصنوعی نیازمند انتظار برای یک مدل واحد و بی‌نقص نیست که بتواند همه چیز را به طور همزمان برنامه‌ریزی، به خاطر بسپارد و اجرا کند. بلکه نیازمند دادن حافظه‌ای به عامل است که بین مراحل حفظ شود و یک متخصص که بتواند واقعاً کارها را به او واگذار کند. اجازه دهید متفکر، فکر کند. اجازه دهید تدوینگر، تدوین کند.