নতুন Google Vids ইন্টারফেসের মাধ্যমে অ্যাক্সেসযোগ্য Google-এর Gemini Omni-কে একটি হাতে-কলমে ল্যাব টেস্টের মাধ্যমে পরীক্ষা করা হয়েছে, যাতে দেখা যায় যে তিনটি ধারাবাহিক ভিডিও এডিটের পরেও AI একটি একক বিষয়বস্তু বা ক্যুরিয়ারকে (subject-courier) স্থিতিশীল রাখতে পারে কি না।
কেন এই পরীক্ষাটি গুরুত্বপূর্ণ
জেনারেটিভ ভিডিও টুলগুলো প্রতিশ্রুতি দেয় যে যে কেউ একটি মাত্র টেক্সট কমান্ডের মাধ্যমে ব্যাকগ্রাউন্ড পরিবর্তন করতে পারে, লাইটিং যোগ করতে পারে বা বিভিন্ন ইফেক্ট দিতে পারে। একজন ক্রিয়েটরের জন্য এই প্রতিশ্রুতিটি সহজ: একটি র (raw) ক্লিপ দিয়ে শুরু করুন, টাইপ করুন “make it rain at night,” এবং একটি নিখুঁত শর্ট ভিডিও নিয়ে বেরিয়ে পড়ুন। বেশিরভাগ ব্যবহারকারী “drift”-এর লুকানো খরচটি দেখেন না—অর্থাৎ AI যখন প্রতিটি নতুন নির্দেশাবলী ব্যাখ্যা করে, তখন মূল বিষয়ের চেহারা, ভঙ্গি বা গতির ধীরে ধীরে হারিয়ে যাওয়া। যদি দ্বিতীয় এডিটের পর একজন ক্যুরিয়ারের মুখাবয়বে সামান্য পরিবর্তন আসে, তবে চূড়ান্ত কাজটি অপেশাদার দেখায় এবং এর জন্য ব্যয়বহুল ম্যানুয়াল ক্লিন-আপের প্রয়োজন হতে পারে।
পরীক্ষাটি
বেসলাইন ক্লিপ (Baseline clip) – একটি স্ট্যাটিক-ক্যামেরা স্টুডিও শট যেখানে একজন ব্যক্তি নেভি ব্লু রঙের উইন্ডব্রেকার পরে আছেন, বাম হাতে একটি ছোট কার্ডবোর্ড বক্স ধরে আছেন এবং ক্যামেরার দিকে দুটি পা ফেলছেন। লাইটিং ছিল সুষম, ব্যাকগ্রাউন্ড ছিল সাধারণ এবং মোশন বা নড়াচড়া ছিল সহজ।
এডিট সিকোয়েন্স – একটির পর একটি তিনটি এডিট প্রয়োগ করা হয়েছিল:
- ব্যাকগ্রাউন্ড সোয়াপ – স্টুডিওর পরিবর্তে রাতে একটি বৃষ্টির শহরপথ যুক্ত করা।
- লাইটিং টুইক – ক্যুরিয়ারের চারপাশে একটি নীল রিম লাইট এবং একটি দোকানের জানালা থেকে আসা উষ্ণ আভা যোগ করা।
- অ্যাটমোস্ফিয়ার লেয়ার – হালকা বৃষ্টির ফোঁটা এবং বাষ্পের একটি পাতলা আস্তরণ যোগ করা।
একটি “direct control” রান তিনটি নির্দেশাবলীকে একটি মাত্র প্রম্পটে যুক্ত করেছিল, যা AI-কে একবারে চূড়ান্ত ক্লিপটি তৈরি করতে সাহায্য করেছিল।
কীভাবে ধারাবাহিকতা (consistency) স্কোর করা হয়েছিল
চারটি থিমের অধীনে বিভক্ত বারোটি মানদণ্ড স্কোরকার্ড তৈরি করেছিল:
- চরিত্রের স্থিতিশীলতা (Character stability) – মুখমণ্ডল, চুল এবং পোশাক একই থাকে।
- দৃশ্যের স্থিতিশীলতা (Scene stability) – ক্যামেরার অ্যাঙ্গেল এবং বিষয়ের অবস্থান স্থির থাকে।
- এডিটের নির্ভুলতা (Edit precision) – AI অন্য কিছু পরিবর্তন না করে নির্দেশাবলী অনুসরণ করে।
- টেম্পোরাল কোয়ালিটি (Temporal quality) – নড়াচড়ার সময় কোনো ফ্লিকার, ওয়ার্পিং বা জিটার দেখা দেয় না।
প্রতিটি ক্লিপের প্রথম ফ্রেম, দুই ধাপ হাঁটার মধ্যবর্তী অংশ এবং শেষ ফ্রেমের ভিত্তিতে মূল্যায়ন করা হয়েছিল। স্কোরিং থেকে একটি স্পষ্ট প্যাটার্ন প্রকাশ পেয়েছে।
সংখ্যাগুলো কী বলে
যখন এডিটগুলো একের পর এক স্তরে (stacked) প্রয়োগ করা হয়েছিল, তখন স্কোরকার্ড ব্যবহার করে AI-কে মূল্যায়ন করা হয়েছিল। সিঙ্গেল-প্রম্পট কন্ট্রোলটিও একই মূল্যায়নের মধ্য দিয়ে গেছে।
কারা লাভবান এবং কারা ক্ষতিগ্রস্ত
যে স্টুডিওগুলো একটি একক এবং ব্যাপক প্রম্পট ব্যবহার করতে সক্ষম, তারা একটি মসৃণ ওয়ার্কফ্লো পায়। জেনারেটিভ ভিডিও সিস্টেমের ডেভেলপাররা একটি স্পষ্ট ইঞ্জিনিয়ারিং বা প্রকৌশলগত বাধার সম্মুখীন হচ্ছেন—আর তা হলো ধারাবাহিক রূপান্তরের (sequential transformations) মাধ্যমে বিষয়ের একটি স্থিতিশীল ল্যাটেন্ট রিপ্রেজেন্টেশন (latent representation) বজায় রাখা।
পাল্টা যুক্তি
কিছু ব্যবহারকারীর মতে, ইনক্রিমেন্টাল বা ধাপে ধাপে এডিটিং অধিক সৃজনশীল নিয়ন্ত্রণ প্রদান করে। একবারে একটি উপাদান পরিবর্তন করার মাধ্যমে, তারা পরবর্তী ধাপে যাওয়ার আগে প্রতিটি লেয়ারকে সূক্ষ্মভাবে টিউন করতে পারেন। পরীক্ষাটি দেখায় যে এই নমনীয়তার জন্য ভিজ্যুয়াল ফিডেলিটি বা দৃশ্যমান নির্ভুলতা বিসর্জন দিতে হয়। যদি একজন ক্রিয়েটর সূক্ষ্ম নিয়ন্ত্রণের জন্য বিষয়ের সামান্য পরিবর্তন মেনে নেন, তবে বর্তমান Gemini Omni ওয়ার্কফ্লো এখনও কার্যকর হতে পারে।
পরবর্তীতে যা লক্ষ্য রাখতে হবে
- মডেল রিফাইনমেন্ট (Model refinements) যা প্রম্পটগুলোর মধ্যে বিষয়ের ল্যাটেন্ট কোডকে লক করে রাখবে।
- ইউজার-ফিডব্যাক লুপ (User-feedback loops) যা ক্রিয়েটরদের 'drift' চিহ্নিত করতে এবং বিষয়ের একটি “re-anchor” বা পুনরায় স্থির করার অনুরোধ করতে সাহায্য করবে।
সারসংক্ষেপ
Gemini Omni যখন একবারে নির্দেশনার একটি সম্পূর্ণ সেট পায়, তখন এটি একটি নিখুঁত, বহু-উপাদান বিশিষ্ট ভিডিও তৈরি করতে পারে, কিন্তু এডিটগুলো যখন একের পর এক স্তরে প্রয়োগ করা হয়, তখন এর বিষয়ের নির্ভুলতা (subject fidelity) হ্রাস পায়।
