મોટાભાગના સર્જનાત્મક સોફ્ટવેર હજુ પણ એવું અપેક્ષા રાખે છે કે વિચાર અને તૈયાર ફાઇલ વચ્ચે કોઈ માણસ હોવો જોઈએ. તમે AI ને વિડિયો એડિટિંગનું વર્ણન કરી શકો છો, પરંતુ ક્લિપ્સ ટ્રીમ કરવા, લેયર્સ એડજસ્ટ કરવા અને ફ્રેમ્સ એક્સપોર્ટ કરવા જેવા વાસ્તવિક કામો સામાન્ય રીતે તમારે જ કરવા પડે છે. આ અંતર એટલા માટે છે કારણ કે મીડિયા એડિટિંગ એ માત્ર એક પ્રોમ્પ્ટ અને પ્રતિસાદ (prompt-and-response) વાળું કાર્ય નથી. તે પરસ્પર નિર્ભર નિર્ણયોની એક લાંબી સાંકળ છે, જ્યાં ત્રીજું પગલું ત્યારે જ અર્થપૂર્ણ બને છે જો બીજું પગલું ખરેખર ટાઈમલાઈનને બદલી નાખ્યું હોય. તાજેતરમાં શેર કરવામાં આવેલ એક પ્રોજેક્ટ Claude Code ને Gemini Interactions API દ્વારા સંચાલિત સ્ટેટફુલ (stateful) વિડિયો એડિટિંગ પાઇપલાઇનમાં જોડીને આ ચોક્કસ અવરોધને દૂર કરે છે. તેનું પરિણામ એ દર્શાવે છે કે કેવી રીતે એક AI એજન્ટને માત્ર સૂચન કરવાને બદલે ખરેખર સર્જનાત્મક વર્કફ્લોનું નિર્દેશન કરવા માટે તૈયાર કરી શકાય છે.

એક ડાયરેક્ટર અને એક એડિટર

આ આર્કિટેક્ચરને જાણીજોઈને વિભાજિત કરવામાં આવ્યું છે. Claude Code એક ડાયરેક્ટર તરીકે કામ કરે છે, જે ઉચ્ચ સ્તરનું આયોજન સંભાળે છે, અસ્પષ્ટ સર્જનાત્મક બ્રીફ્સનું અર્થઘટન કરે છે અને આગળ શું થવું જોઈએ તેનો નિર્ણય લે છે. તે "ડેડ એર કાપો અને ટાઈટલ કાર્ડ ઉમેરો" જેવી વિનંતીને અલગ-અલગ કાર્યોમાં વિભાજિત કરે છે, અને પછી આગળ વધતા પહેલા દરેક કાર્ય સફળ થાય છે કે નહીં તેનું નિરીક્ષણ કરે છે.

Gemini Interactions API વિશિષ્ટ એડિટિંગ લોજિક સંભાળે છે. કોઈ જનરલિસ્ટ મોડેલને વિડિયો એડિટર તરીકે કામ કરવા માટે મજબૂર કરવાને બદલે, આ સેટઅપ Google ના API નો ઉપયોગ એક હેન્ડ્સ-ઓન ઓપરેટર તરીકે કરે છે જે કટ્સ (cuts) કરે છે, ટાઈમલાઈન સ્ટેટનું મૂલ્યાંકન કરે છે અને નક્કર પરિણામો સાથે રિપોર્ટ આપે છે. સિસ્ટમ આ બંને કામોને એક જ મોડેલમાં ભેગા કરતી નથી. તે રીઝનિંગ લેયરને ટૂલ-યુઝ લેયરથી અલગ રાખે છે, જેનો અર્થ છે કે દરેક ભાગ તેના શ્રેષ્ઠ કાર્ય પર ધ્યાન કેન્દ્રિત કરી શકે છે.

આ વિભાજન વાસ્તવિક પોસ્ટ-પ્રોડક્શન ટીમો કેવી રીતે કાર્ય કરે છે તેનું પ્રતિબિંબ પાડે છે. ડાયરેક્ટર વાર્તા જાણે છે અને અંતિમ નિર્ણય લે છે. એડિટર સોફ્ટવેર જાણે છે અને પિક્સેલ્સ સાથે કામ કરે છે. જ્યારે કોઈ એજન્ટ એક જ કોન્ટેક્સ્ટ વિન્ડોમાં બંને કામ કરવાનો પ્રયાસ કરે છે, ત્યારે તે ઘણીવાર સિન્ટેક્સમાં ભૂલ કરે છે અથવા કઈ ક્લિપ કયા ટ્રેક પર છે તે ભૂલી જાય છે. કામનું વિભાજન આ સમસ્યાને સુધારે છે.

મેમરી બધું જ શા માટે બદલી નાખે છે

વિડિયો એડિટિંગ સ્વાભાવિક રીતે સ્ટેટફુલ (stateful) હોય છે. જો તમે કોઈ ક્લિપને ચાર સેકન્ડ ટૂંકી કરો છો, તો તે મુજબ દરેક પછીનું ટ્રાન્ઝિશન, ઓડિયો ક્યુ અને સબટાઈટલનું સ્થાન બદલાવું જોઈએ. મોટાભાગના AI એજન્ટો અહીં સંઘર્ષ કરે છે કારણ કે તેઓ દરેક પગલાને એક અલગ ક્વેરી તરીકે જુએ છે. તેઓ એક પ્રતિસાદમાં કટની ભલામણ કરી શકે છે, પછી બીજામાં અલગ ટાઈમલાઈનનું ભ્રમ (hallucinate) કરી શકે છે, અથવા એવા સેગમેન્ટ માટે ઇફેક્ટ સૂચવી શકે છે જે હવે અસ્તિત્વમાં નથી.

Gemini Interactions API આ કામગીરી દરમિયાન સ્ટેટ જાળવી રાખવા માટે બનાવવામાં આવ્યું છે. એજન્ટ કામ કરતી વખતે તે પ્રોજેક્ટની વાસ્તવિક સ્થિતિને ટ્રેક કરે છે. તેનો અર્થ એ છે કે સિસ્ટમ જાણે છે કે એક્સપોર્ટ નિષ્ફળ ગયું છે, કોઈ ક્લિપ પહેલેથી જ પ્રોસેસ થઈ ગઈ છે, અથવા કલર ગ્રેડ લાગુ કરવામાં આવ્યો છે કે નહીં. જ્યારે Claude આગલી સૂચના આપે છે, ત્યારે તે ટાઈમલાઈનની વાસ્તવિક વર્તમાન સ્થિતિ પર કામ કરે છે, કોઈ અંદાજ પર નહીં.

જે કોઈએ AI ને આત્મવિશ્વાસ સાથે "સરળ" પાંચ-પગલાંવાળું ફિક્સ સૂચવતા જોયું હોય જે અગાઉના ચાર પગલાંને સંપૂર્ણપણે અવગણે છે, તેમના માટે પર્સિસ્ટન્ટ સ્ટેટ (persistent state) નું મૂલ્ય સ્પષ્ટ છે. મેમરી વગર સર્જનાત્મક કાર્યો ઝડપથી બગડી જાય છે. સ્ટેટફુલ બેકએન્ડ ચેટબોટને એક એવા સહભાગીમાં ફેરવે છે જે ખરેખર કામ પૂરું કરી શકે છે.

વર્કફ્લો કેવો દેખાય છે

એક વ્યવહારુ ક્રમની કલ્પના કરો. તમે સિસ્ટમને કેટલીક રો ક્લિપ્સ આપો છો અને સોશિયલ મીડિયા માટે તૈયાર કટ માંગો છો. Claude Code પહેલા વિનંતીનું મૂલ્યાંકન કરે છે. તે નક્કી કરી શકે છે કે ફૂટેજને સ્ટેબિલાઇઝેશનની જરૂર છે, પછી વોઈસ-ઓવર એક્સટ્રેક્શન, પછી સબટાઈટલ્સ અને પછી વર્ટિકલ ક્રોપની જરૂર છે. તે આને એક યોજના તરીકે તૈયાર કરે છે અને દરેક વસ્તુને ક્રમમાં અમલમાં લાવવા માટે Gemini Interactions API ને કોલ કરવાનું શરૂ કરે છે.

Gemini મીડિયા કામગીરી કરે છે અને સ્ટ્રક્ચર્ડ ફીડબેક આપે છે. કદાચ સ્ટેબિલાઇઝેશન સફળ થયું પણ ઓડિયો સેપરેશનમાં એવા સંવાદો મળ્યા જે એકબીજા પર ઓવરલેપ થાય છે, જેના કારણે સબટાઈટલ્સ અવિશ્વસનીય બની જાય છે. Claude તે અપડેટ મેળવે છે, યોજનામાં સુધારો કરે છે, અને Gemini ને ટેક્સ્ટ ઓવરલે જનરેટ કરતા પહેલા સ્પીકર સેગમેન્ટ્સને ઓળખવા જેવો અલગ અભિગમ અજમાવવા માટે કહે છે. કારણ કે API સ્ટેટ જાળવી રાખે છે, તે ખાતરી કરી શકે છે કે સબટાઈટલ ટ્રેક નવા સ્ટેબિલાઇઝ કરેલા વિડિયો સાથે સુસંગત છે, મૂળ ધ્રૂજતા ફૂટેજ સાથે નહીં.

જ્યાં સુધી ચેકલિસ્ટ પૂર્ણ ન થાય ત્યાં સુધી આ લૂપ ચાલુ રહે છે. સિસ્ટમ માત્ર એકવાર સ્ક્રિપ્ટ જનરેશન કરવાને બદલે જટિલ વિડિયો કાર્યો માટે વાસ્તવિક વર્કફ્લો બનાવે છે. જો કોડેક સેટિંગ્સ અસંગત હોવાને કારણે રેન્ડર નિષ્ફળ જાય છે, તો તે ભૂલ Claude ને પાછી મોકલવામાં આવે છે, જે પેરામીટર્સ એડજસ્ટ કરી શકે છે અને ફરી પ્રયાસ કરી શકે છે. એજન્ટ પ્રથમ અવરોધ પછી પ્રોજેક્ટ છોડી દેતો નથી.

વિવિધ શક્તિઓ માટે વિવિધ મોડેલ્સનો ઉપયોગ કરવો

આ પ્રોજેક્ટ AI એન્જિનિયરિંગમાં એક વ્યાપક ડિઝાઇન પેટર્ન પણ દર્શાવે છે: એક જ મોડેલ પાસે બધું કરાવવાનો પ્રયાસ કરવાનું બંધ કરો. Claude Code અસ્પષ્ટ સૂચનાઓ દ્વારા તર્ક કરવા, બ્રાન્ચિંગ લોજિકનું સંચાલન કરવા અને લાંબા સત્ર દરમિયાન વાતચીતનો સંદર્ભ જાળવી રાખવામાં શ્રેષ્ઠ છે. Gemini Interactions API, ખાસ કરીને રિચ મીડિયા અને ટૂલના ઉપયોગ સાથેની તેની ક્રિયાપ્રતિક્રિયા દ્વારા, ઊંડી મલ્ટિમોડલ ક્ષમતાઓ અને સ્ટેટફુલ એક્ઝિક્યુશન લાવે છે. તેમને એકસાથે જોડીને, તમે દરેકની મર્યાદાઓને દૂર કરી શકો છો.

એક તર્કબદ્ધ મોડેલ (reasoning model) જેણે ક્યારેય નોન-લીનિયર એડિટરનો ઉપયોગ કર્યો નથી, તે પણ એક ઉત્તમ કટનું નિર્દેશન કરી શકે છે જો તેની પાસે એક્ઝિક્યુશન લેયરની ઍક્સેસ હોય જે કોડેક્સ (codecs), કીફ્રેમ્સ (keyframes) અને ટ્રેક હાયરાર્કીઓને સમજી શકે. તેનાથી વિપરીત, જો પ્લાનર મોડેલે પહેલેથી જ તેને નક્કર પગલાઓમાં રૂપાંતરિત કરી દીધા હોય, તો મીડિયા-નિષ્ણાત API ને અમૂર્ત સર્જનાત્મક નોંધોનું વિશ્લેષણ કરવાની જરૂર નથી. એકની શક્તિ બીજાની નબળાઈઓને દૂર કરે છે.

આ માત્ર સૈદ્ધાંતિક નથી. આ સેટઅપ સ્પષ્ટપણે દર્શાવે છે કે કેવી રીતે વિવિધ AI મોડેલ્સ કામની એક શ્રેણી, એટલે કે સર્જનાત્મક વિડિયો એડિટિંગને સંભાળવા માટે સાથે મળીને કામ કરે છે, જે કામ સિંગલ-મોડેલ એજન્ટ્સ ઘણીવાર પૂર્ણ કરવામાં નિષ્ફળ જાય છે. એજન્ટિક સિસ્ટમ્સ બનાવતા ડેવલપર્સ માટે, આ પાઠ અવગણવો મુશ્કેલ છે. તમારા ઓર્કેસ્ટ્રેશન લેયરને સ્પેશિયાલિસ્ટ બનવા માટે કહેવાનું બંધ કરો, અને તમારા સ્પેશિયાલિસ્ટને વ્યૂહરચનાકાર (strategist) બનવા માટે કહેવાનું બંધ કરો.

બિલ્ડર્સ માટે મુખ્ય બાબતો

આ પેટર્નને ઉપયોગી માનવા માટે તમારે વિડિયો સ્ટુડિયો ચલાવવાની જરૂર નથી. કોઈપણ ક્ષેત્ર જેમાં બદલાતા વાતાવરણમાં બહુ-પગલાંવાળા કામની જરૂર હોય, જેમ કે CAD વર્કફ્લો, ઓડિયો એન્જિનિયરિંગ, ડેટા વિઝ્યુલાઇઝેશન અથવા સાયન્ટિફિક કમ્પ્યુટિંગ, તે આ જ માળખું અપનાવી શકે છે. એક મોડેલ સતત પ્રોજેક્ટ મેનેજર તરીકે કામ કરે છે. એક વિશિષ્ટ API અથવા ટૂલ ડોમેન-વિશિષ્ટ સોફ્ટવેરની અંદર સ્ટેટફુલ કામગીરી સંભાળે છે.

ડેવલપરનું કામ મોડેલ બધું યાદ રાખે તેવી પ્રાર્થના કરતી વિશાળ પ્રોમ્પ્ટ્સ લખવાથી બદલાઈને, તર્ક (reasoning) અને અમલીકરણ (execution) વચ્ચે ક્લીન હેન્ડઓફ ડિઝાઇન કરવા તરફ વળે છે. સ્ટેટ મેનેજમેન્ટ (State management) એક મહત્વપૂર્ણ ભાગ બની જાય છે. જો તમારો એજન્ટ તેની છેલ્લી ક્રિયા પછી શું બદલાયું તે જોઈ શકતો નથી, તો તે ફરીથી વિશ્વસનીય રીતે કાર્ય કરી શકશે નહીં.

ઇન્ટિગ્રેશન કેવી રીતે કામ કરે છે તેનો સંપૂર્ણ વિગતવાર અહેવાલ, જેમાં ચોક્કસ API ઇન્ટરેક્શન અને પ્રોજેક્ટ સ્ટ્રક્ચરનો સમાવેશ થાય છે, તે તમે dev.to પરની વિગતવાર પોસ્ટમાં વાંચી શકો છો.

વાસ્તવિક બોધપાઠ

AI સાથે જટિલ સર્જનાત્મક કામ ઉકેલવા માટે એક એવા સિંગલ, પરફેક્ટ મોડેલની રાહ જોવાની જરૂર નથી જે એકસાથે બધું આયોજન કરી શકે, યાદ રાખી શકે અને અમલમાં મૂકી શકે. તે એજન્ટને એવું મેમરી આપવાની જરૂર છે જે પગલાંઓ વચ્ચે ટકી રહે અને એક એવો સ્પેશિયાલિસ્ટ જેમને તે ખરેખર કામ સોંપી (delegate) શકે. વિચારકને વિચારવા દો. એડિટરને એડિટ કરવા દો.