ফিজিক্যাল এআই (Physical AI)-এর অগ্রযাত্রা একটি বিশাল বাধার সম্মুখীন হচ্ছে: আমাদের কাছে উচ্চ-নির্ভুলতা সম্পন্ন (high-fidelity), বাস্তব জগতের ট্রেনিং ডেটা নেই। লার্জ ল্যাঙ্গুয়েজ মডেলগুলো (LLMs) ইন্টারনেটের টেক্সট স্ক্র্যাপ করার মাধ্যমে বিকশিত হয়েছে; কিন্তু রোবোটিক্সের জন্য অনেক বেশি ব্যয়বহুল পদ্ধতির প্রয়োজন।
রোবোটিক্সে ডেটার স্বল্পতার সমস্যা
হিউম্যানয়েড এবং ওয়্যারহাউস রোবটগুলোকে মানুষের মতো নিপুণতা অর্জন করতে হলে এমন একটি ডেটা স্কেল প্রয়োজন যা বর্তমানে নেই। Encord-এর রোবট লার্নিং প্রধান এবং OpenAI-এর রোবট ল্যাবের অভিজ্ঞ সদস্য Vineeth Velmurugan বলেন, এই ক্ষেত্রে বড় ধরনের সাফল্যের জন্য ইউটিউবের সম্পূর্ণ ভিডিও কর্পাসের তুলনায় প্রায় পাঁচ গুণ বড় একটি ডেটাসেট প্রয়োজন।
টেক্সট বা লেখা প্রচুর পরিমাণে পাওয়া যায় এবং এটি স্ক্র্যাপ করা সহজ ও বিনামূল্যে করা যায়। কিন্তু ফিজিক্যাল ডেটা বা ভৌত ডেটা তৈরি করতে হয়। শুধুমাত্র ভিডিও থেকে প্রশিক্ষণ দিলে জটিল কাজের (complex manipulation) জন্য প্রয়োজনীয় নির্ভুলতা পাওয়া যায় না। তাই শিল্পখাত এখন মডেল আর্কিটেকচার পরিবর্তনের পরিবর্তে উচ্চ-মানের, অ্যানোটেটেড (annotated) ফিজিক্যাল ডেটা তৈরির মতো অনেক কঠিন সমস্যার সমাধান করার দিকে মনোনিবেশ করছে।
ভিডিওর বাইরে: মস্তিষ্কের তরঙ্গ এবং পেশির সংকেত ব্যবহার
রোবটদের আরও গভীর প্রেক্ষাপট (context) প্রদানের জন্য Encord-এর মতো স্টার্টআপগুলো নতুন ডেটা মোডালিটি পরীক্ষা করছে। জার্মান নিউরোসায়েন্স স্টার্টআপ Zander Labs-এর সাথে একটি পাইলট প্রজেক্টে, Encord অপারেটরদের ব্রেইন-ওয়েভ হেডসেট সরবরাহ করছে। নিউরাল অ্যাক্টিভিটি বা স্নায়বিক কার্যকলাপ পরিমাপের মাধ্যমে গবেষকরা মানুষের উদ্দেশ্য, ভুল এবং বিস্ময় বুঝতে চান।
Zander-এর নিউরোসায়েন্টিস্ট Lucas Gehrke বলেন, মস্তিষ্কের কার্যকলাপ ট্র্যাক করার মাধ্যমে মডেল নির্মাতারা ঠিক বুঝতে পারবেন কখন একটি রোবটকে কোনো কঠিন কাজের জন্য তার সবচেয়ে শক্তিশালী কম্পিউটেশনাল মডেল ব্যবহার করতে হবে।
Encord আরও অন্বেষণ করছে:
- Electromyography (EMG): হাতের কবজিতে লাগানো সেন্সরগুলো পেশির বৈদ্যুতিক সংকেত সংগ্রহ করে হাতের নড়াচড়ার একটি 3-D ম্যাপ তৈরি করে, যা মাথায় লাগানো ক্যামেরাগুলো প্রায়ই ধরতে পারে না।
- Leader-Follower Rigs: জোড়া লাগানো রোবোটিক আর্ম যেখানে একটি মানুষের নড়াচড়া অনুকরণ করে এবং তরল ঢালা বা পোকার চিপ সাজানোর মতো সূক্ষ্ম কাজগুলো রেকর্ড করে।
- Dense Annotation: যেমন "ডান হাত দিয়ে বোল্টটি টাইট করা হচ্ছে।" Velmurugan-এর মতে, নির্দিষ্ট কাজের প্রশিক্ষণের জন্য এই ডেন্স অ্যানোটেশন সাধারণ ভিডিওর তুলনায় ১০০ গুণ বেশি মূল্যবান।
ফিজিক্যাল এআই-এর অর্থনৈতিক বাস্তবতা
ডিজিটাল-ফার্স্ট এআই থেকে ফিজিক্যাল এআই-তে স্থানান্তরিত হওয়া মেশিন লার্নিংয়ের অর্থনীতিকে পুরোপুরি বদলে দিচ্ছে। LLM ল্যাবগুলো ওয়েব থেকে ডেটা সংগ্রহ করে প্রায় শূন্য প্রান্তিক খরচে (near-zero marginal cost) মডেল তৈরি করেছে। কিন্তু রোবট ট্রেনিং ডেটা তৈরির জন্য হার্ডওয়্যার, মানব অপারেটর এবং অত্যন্ত নিখুঁত অ্যানোটেশনের প্রয়োজন। Encord-এর লক্ষ্য হলো উচ্চ-মানের ডেটাকে এর মূল্যের তুলনায় ২০ গুণ বেশি সাশ্রয়ী করা, তবুও বড় রোবট বহরের জন্য এটি মাল্টি-মিলিয়ন ডলারের প্রজেক্টে পরিণত হয়।
যে কোম্পানিগুলো প্রথমে বিশাল এবং সমৃদ্ধ অ্যানোটেটেড ডেটাসেট তৈরি করতে পারবে, তারা ইথারনেট কেবল লাগানো থেকে শুরু করে পণ্য বাছাই ও প্যাকিং করার মতো স্বয়ংক্রিয় কাজের (autonomous manipulation) ক্ষেত্রে আধিপত্য বিস্তার করবে। যারা শুধুমাত্র ভিডিওর ওপর নির্ভর করবে, তারা পিছিয়ে পড়ার ঝুঁকিতে থাকবে কারণ প্রতিযোগীরা মানুষের শরীর এবং মস্তিষ্ক থেকে আরও সমৃদ্ধ সংকেত সংগ্রহ করছে।
মূল বিষয়সমূহ
- ডেটা ম্যানুফ্যাকচারিং বনাম সংগ্রহ: LLM-এর মতো ইন্টারনেট থেকে ডেটা স্ক্র্যাপ করার পরিবর্তে, ফিজিক্যাল এআই-এর জন্য অত্যন্ত ব্যয়বহুল এবং ম্যানুয়াল পদ্ধতিতে উচ্চ-নির্ভুল ডেটাসেট তৈরি করতে হয়।
- নিউরোলজিক্যাল মোডালিটি: ব্রেইন-ওয়েভ এবং EMG যুক্ত করার ফলে রোবটগুলো ভিডিওর তুলনায় মানুষের উদ্দেশ্য, ভুল এবং হাতের 3-D নড়াচড়া আরও কার্যকরভাবে বুঝতে পারে।
- স্কেলের চ্যালেঞ্জ: রোবোটিক্স মডেলগুলোর জন্য ইউটিউবের সম্পূর্ণ আর্কাইভের চেয়েও অনেক বড় ডেটাসেট প্রয়োজন; ডেটা জেনারেশন এখন ব্যবসার প্রধান নতুন দিগন্ত।
Encord জার্মান নিউরোসায়েন্স স্টার্টআপ Zander Labs-এর সাথে একটি পাইলট প্রজেক্ট শুরু করেছে, যেখানে অপারেটরদের ব্রেইন-ওয়েভ হেডসেট এবং হাতের কবজিতে EMG সেন্সর দেওয়া হচ্ছে যাতে ফিজিক্যাল এআই-এর জন্য উচ্চ-নির্ভুল ট্রেনিং ডেটা সংগ্রহ করা যায়। এই অংশীদারিত্বের লক্ষ্য হলো ইউটিউবের মোট ভিডিওর আয়তনের চেয়ে পাঁচ গুণ বড় একটি ডেটাসেট তৈরি করা—গবেষকদের মতে, রোবটদের মানুষের মতো নিপুণতা অর্জনের জন্য এই স্কেল প্রয়োজন এবং এটি রোবোটিক্স শেখার পদ্ধতিকে বদলে দিতে পারে।
কেন রোবোটিক্স ডেটা একটি বাধা
লার্জ ল্যাঙ্গুয়েজ মডেলগুলো ওপেন ওয়েব স্ক্র্যাপ করার মাধ্যমে বিকশিত হয়েছে; এর কাঁচামাল ছিল প্রচুর এবং সস্তা। বিপরীতে, ফিজিক্যাল এআই-এর জন্য এমন ডেটা প্রয়োজন যা তৈরি করতে হয়। প্রতিটি ধরা (grasp), মোচড়ানো (twist) বা ঢালার (pour) প্রক্রিয়া রেকর্ড করতে হয়, অ্যানোটেট করতে হয় এবং যে শক্তি ও উদ্দেশ্যের মাধ্যমে তা করা হয়েছে তার সাথে যুক্ত করতে হয়। সাধারণ ভিডিও প্রায়ই জটিল কাজের জন্য প্রয়োজনীয় সূক্ষ্ম সংকেতগুলো ধরতে পারে না, যা বর্তমানের মডেল এবং কারখানা, ওয়্যারহাউস ও ঘরবাড়ির চাহিদার মধ্যে একটি ব্যবধান তৈরি করে।
Encord-এর রোবট লার্নিং প্রধান এবং সাবেক OpenAI রোবট-ল্যাব সদস্য Vineeth Velmurugan বলেন, ইউটিউবের ভিডিও কর্পাসের তুলনায় প্রায় পাঁচ গুণ বড় ডেটাসেট না আসা পর্যন্ত এই ক্ষেত্রটি সামনের দিকে এগোতে পারবে না। সমস্যাটি এখন আর মডেল আর্কিটেকচারের নয়; সমস্যাটি হলো কীভাবে ডেটা তৈরি (manufacture) করতে হয়।
মস্তিষ্কের তরঙ্গ এবং পেশির সংকেত যুক্ত করা
Encord-Zander পাইলট প্রজেক্টটি ভিজ্যুয়াল রেকর্ডের সাথে শারীরবৃত্তীয় সংকেত (physiological signals) যুক্ত করার মাধ্যমে সেই শূন্যতা পূরণের চেষ্টা করছে। অপারেটররা এমন হেডসেট পরেন যা ইলেক্ট্রোএনসেফালোগ্রাফি (EEG) – অর্থাৎ মস্তিষ্কের বৈদ্যুতিক কার্যকলাপ – পরিমাপ করে, আর হাতের কবজিতে থাকা EMG সেন্সরগুলো পেশির স্পন্দন বা ইমপালস সংগ্রহ করে। এর লক্ষ্য হলো মানুষের মানসিক অবস্থা যেমন—উদ্দেশ্য, বিস্ময় বা ভুল শনাক্ত করা এবং পেশির কাঁচা কার্যকলাপকে হাতের নড়াচড়ার একটি ত্রিমাত্রিক ম্যাপে রূপান্তর করা, যা শুধুমাত্র ভিডিওর মাধ্যমে সম্ভব নয়।
Zander-এর একজন নিউরোসায়েন্টিস্ট লুカス গের্কে (Lucas Gehrke) ব্যাখ্যা করেছেন যে, একজন মানুষ কখন একটি কঠিন উপ-কাজের (sub-task) পূর্বাভাস দিচ্ছে তা জানতে পারলে একটি রোবট সঠিক সময়ে তার সবচেয়ে শক্তিশালী কম্পিউটেশনাল মডেলগুলো ব্যবহার করতে পারে।
নিউরো-ডেটার বাইরেও, Encord কিছু পরিপূরক কৌশল পরীক্ষা করছে:
- Electromyography (EMG): হাতের কবজিতে থাকা সেন্সরগুলো পেশির সক্রিয়তার একটি লাইভ রিড-আউট প্রদান করে, যা আঙুলের চলাচলের (finger trajectories) একটি নিখুঁত পুনর্গঠন করতে সক্ষম, যা প্রায়শই হেড-মাউন্টেড ক্যামেরাগুলো ধরতে পারে না।
- Leader-follower rigs: একজোড়া রোবোটিক আর্ম একত্রে কাজ করে, যার একটি মানুষের অপারেটরের নড়াচড়া হুবহু অনুকরণ করে। এটি অত্যন্ত সূক্ষ্ম কাজগুলো—যেমন তরল ঢালা বা চিপস স্তূপ করা—সংগ্রহ করতে পারে, যেখানে মিলিমিটার স্কেলের ভুলও গুরুত্বপূর্ণ হয়ে দাঁড়ায়।
- Dense annotation: শুধুমাত্র উচ্চ-স্তরের কাজগুলোকে লেবেল করার পরিবর্তে, ভেলমুরুগানের (Velmurugan) দল "ডান হাত দিয়ে বোল্ট টাইট করা" এর মতো সূক্ষ্ম বর্ণনাকারী শব্দ যুক্ত করে। তার মতে, একটি নির্দিষ্ট ম্যানিপুলেশন দক্ষতা প্রশিক্ষণের জন্য সাধারণ ইগো-সেন্ট্রিক (ego-centric) ভিডিওর তুলনায় এই ধরনের বিস্তারিত তথ্য প্রায় ১০০ গুণ বেশি মূল্যবান।
ডেটা ম্যানুফ্যাকচারিংয়ের অর্থনীতি
Physical AI মেশিন লার্নিংয়ের আর্থিক হিসাব বদলে দিচ্ছে। LLM ল্যাবগুলো প্রায় শূন্য প্রান্তিক খরচে (near-zero marginal cost) মডেল তৈরি করতে পারে কারণ ইন্টারনেট থেকে অগণিত টেক্সট পাওয়া যায়। তবে রোবট প্রশিক্ষণের ডেটা তৈরি করতে হার্ডওয়্যার, মানব অপারেটর এবং অত্যন্ত পরিশ্রমসাধ্য অ্যানোটেশনের প্রয়োজন হয়। Encord-এর অভ্যন্তরীণ লক্ষ্য হলো উচ্চ-মানের ডেটাকে গ্রাহকদের কাছে এর মূল্যের তুলনায় ২০ গুণ বেশি সাশ্রয়ী করে তোলা, তবে সেই আক্রমণাত্মক দক্ষতা সত্ত্বেও বড় আকারের রোবট বহরের জন্য এটি এখনও মাল্টি-মিলিয়ন ডলারের প্রকল্প হিসেবেই গণ্য হয়।
এখানে ঝুঁকি বা বাজি অত্যন্ত স্পষ্ট: যে কোম্পানিগুলো প্রথমে বিশাল এবং সমৃদ্ধ অ্যানোটেশনযুক্ত ডেটাসেট তৈরি করতে পারবে, তারা স্বায়ত্তশাসিত ম্যানিপুলেশনের (autonomous manipulation) উদীয়মান বাজারে আধিপত্য বিস্তার করবে—তা ডেটা-সেন্টারের মেঝেতে ইথারনেট কেবল লাগানো হোক বা ডিস্ট্রিবিউশন সেন্টারে পণ্য বাছাই ও প্যাকিং করা হোক। যারা শুধুমাত্র ভিডিও-নির্ভর পাইপলাইনের ওপর নির্ভর করা চালিয়ে যাবে, তারা প্রতিযোগীদের তুলনায় পিছিয়ে পড়ার ঝুঁকিতে থাকবে, কারণ প্রতিযোগীরা মানুষের শরীর এবং মস্তিষ্ক থেকে আরও সমৃদ্ধ সংকেত সংগ্রহ করতে সক্ষম হচ্ছে।
পাল্টা যুক্তি এবং উন্মুক্ত প্রশ্নসমূহ
সবাই এই বিষয়ে একমত নন যে নিউরো-সংকেতই হলো সেই হারানো অংশ। সমালোচকরা যুক্তি দেন যে, অতিরিক্ত হার্ডওয়্যার জটিলতা এর সুবিধার চেয়ে বেশি ক্ষতি করতে পারে, বিশেষ করে যখন ভিডিও এবং ফোর্স-টর্ক সেন্সর ব্যবহার করেই অনেক শিল্প কার্যের জন্য যথেষ্ট ভালো পারফরম্যান্স পাওয়া সম্ভব। স্কেলেবিলিটি বা সম্প্রসারণযোগ্যতা আরেকটি উদ্বেগের বিষয়: হাজার হাজার অপারেটরকে EEG হেডসেট এবং EMG রিগ দিয়ে সজ্জিত করা ছোট নির্মাতাদের জন্য অত্যন্ত ব্যয়বহুল প্রমাণিত হতে পারে।
ডেটা-জেনারেট করার পাইপলাইনটি এখনও শ্রমসাধ্য। এমনকি লিডার-ফলোয়ার রিগ থাকলেও, একটি সত্যিকারের সাধারণ রোবটের জন্য প্রয়োজনীয় কাজের ব্যাপকতা ক্যাপচার করতে একাধিক ল্যাব এবং কারখানার মধ্যে একটি নিরবচ্ছিন্ন ও সমন্বিত প্রচেষ্টার প্রয়োজন হবে। এই সামান্য পারফরম্যান্স বৃদ্ধির জন্য প্রাথমিক বিনিয়োগ যুক্তিযুক্ত কি না, তা বাজারকেই সিদ্ধান্ত নিতে হবে।
পরবর্তীতে যা লক্ষ্য রাখা উচিত
- ডেটা ভলিউমের মাইলফলক: Encord-এর দাবি অনুযায়ী তাদের ডেটাসেট ইউটিউবের আকারের চেয়ে পাঁচ গুণ বড় হওয়া একটি বাস্তব মাপকাঠি হিসেবে কাজ করবে। এটি প্রকাশ করা হলে, অন্যান্য প্রতিযোগীদের কাছে এটি মেলানোর বা ছাড়িয়ে যাওয়ার একটি স্পষ্ট লক্ষ্য থাকবে।
- হার্ডওয়্যার গ্রহণের হার: ডেটা-সংগ্রহের রিগগুলোতে EEG এবং EMG ডিভাইসগুলো কত দ্রুত মানদণ্ড হিসেবে প্রতিষ্ঠিত হয়, তা থেকে বোঝা যাবে এই পদ্ধতিটি পরীক্ষামূলক পাইলট প্রকল্পের বাইরেও সম্প্রসারণ করা সম্ভব কি না।
- ব্যয় সংক্রান্ত মেট্রিক্স: Encord যদি প্রতিশ্রুতি অনুযায়ী ২০ গুণ সাশ্রয়ী সুবিধা দিতে পারে, তবে এটি মডেল ডিজাইনের পরিবর্তে "ডেটা ম্যানুফ্যাকচারিং"-এর ওপর গুরুত্ব দেওয়া নতুন কোম্পানিগুলোর একটি জোয়ার সৃষ্টি করতে পারে।
- পারফরম্যান্সের ব্যবধান
