বড় আকারের AI মডেল চালানো এখন আর কেবল একটি বৈজ্ঞানিক সাফল্য নয়, বরং বিদ্যুৎ বিল এবং ডেটাসেন্টারের ভাড়ার মতো একটি কঠিন গাণিতিক সমস্যা হয়ে দাঁড়িয়েছে। Gemini প্রতিটি টোকেন তৈরি করতে Google-এর জন্য বাস্তব খরচ বহন করে—সিলিকন সাইকেল, মেমরি ব্যান্ডউইথ এবং বিদ্যুৎ খরচ। কুয়েরির (query) পরিমাণ বাড়ার সাথে সাথে, এক সেন্টের ক্ষুদ্র অংশগুলোও এমন বিশাল অংকে পরিণত হয় যা লাভের মার্জিনকে পুরোপুরি গ্রাস করতে পারে। এই নীরব জরুরি অবস্থার পেছনেই রয়েছে Frozen v2, যা Google-এর ভেতরে একটি অভ্যন্তরীণ সার্ভার চিপ প্রকল্প হিসেবে রূপ নিতে শুরু করেছে। কোম্পানিটি তাদের সাধারণ উদ্দেশ্যে ব্যবহৃত Tensor Processing Units-কে আরও উন্নত করার পরিবর্তে আরও আমূল কিছু করার চেষ্টা করছে: Gemini মডেলের কাঠামোকে সরাসরি সিলিকনের মধ্যেই গেঁথে দেওয়া।

নমনীয় অ্যাক্সিলারেটর থেকে মডেল-নির্দিষ্ট সিলিকন

Google-এর TPU প্রায় এক দশক ধরে তাদের অবকাঠামোর মূল চালিকাশক্তি হিসেবে কাজ করছে। এগুলো মডেল প্রশিক্ষণ দেয়, সার্চ র‍্যাঙ্কিং অ্যালগরিদম পরিচালনা করে এবং এমনকি Meta-সহ অন্যান্য ক্লাউড গ্রাহকদের কাছে প্রতি ঘণ্টায় ভাড়া দেওয়া হয়, যারা Nvidia-র GPU-র বিকল্প খুঁজছেন। এই বহুমুখী ক্ষমতাই একটি TPU-কে TPU হিসেবে পরিচিত করে তোলে। এটি ম্যাট্রিক্স মাল্টিপ্লিকেশন এবং মেমরি মুভমেন্টের একটি সাধারণ ভাষা ব্যবহার করে, যা সফটওয়্যারের মাধ্যমে বর্ণনা করা যায় এমন প্রায় যেকোনো নিউরাল নেটওয়ার্কে ব্যবহার করা সম্ভব।

Frozen v2 উদ্দেশ্যমূলকভাবেই সেই নমনীয়তা ত্যাগ করেছে। চিপটি একটি ডোমেইন-স্পেসিফিক অ্যাক্সিলারেটর হিসেবে ডিজাইন করা হচ্ছে যার সার্কিটগুলো Gemini-র নিজস্ব আর্কিটেকচারের অংশগুলোকে শারীরিকভাবে প্রতিফলিত করে। যেখানে একটি TPU নির্দেশাবলী সংগ্রহ করে এবং সেগুলোকে সফটওয়্যার অপারেশন হিসেবে ব্যাখ্যা করে, সেখানে Frozen v2 মডেলের কাঠামোগত ব্লুপ্রিন্ট—এর লেয়ার এবং ডেটা পাথ-এর বিন্যাস—সরাসরি চিপের লেআউটে গেঁথে দেবে। Google আশা করছে মডেল এবং মেটালের এই নিবিড় সমন্বয় AI রেসপন্স প্রদানের ক্ষেত্রে চিপটিকে বর্তমান TPU-র তুলনায় ছয় থেকে দশ গুণ বেশি দক্ষ করে তুলবে। প্রতিটি কুয়েরির জন্য কম কম্পিউট স্টেপ মানে একটি টোকেন আসার জন্য অপেক্ষার সময় কম এবং এটি তৈরি করতে অনেক কম শক্তি ব্যয় হবে।

এটি কেবল একই ধারণার একটি দ্রুততর সংস্করণ নয়। এটি চিপের একটি ভিন্ন বিভাগ, যা বহুমুখী ক্ষমতার পরিবর্তে একটি নির্দিষ্ট মডেল পরিবারের প্রতি নিবেদিত।

কেন প্রথম “Frozen” ধারণাটি ব্যর্থ হয়েছিল

এই পদ্ধতির শিকড় রয়েছে Google DeepMind-এর চিফ সায়েন্টিস্ট জেফ ডিনের একটি পূর্ববর্তী ধারণার মধ্যে। মূল “Frozen” প্রস্তাবে কেবল আর্কিটেকচার নয়, বরং প্রকৃত মডেল ওয়েটস (weights)—অর্থাৎ Gemini-র শেখা আচরণের জন্য দায়ী বিলিয়ন বিলিয়ন টিউন করা প্যারামিটারগুলোকে—সরাসরি চিপের ভেতরেই হার্ডকোড করার মাধ্যমে বিশেষায়নকে আরও এক ধাপ এগিয়ে নেওয়ার কথা বলা হয়েছিল।

যুক্তিটি ছিল সঠিক। আপনি যদি হুবহু জানেন যে মডেলটি কোন সংখ্যাগুলো ব্যবহার করবে, তবে কেন সেগুলো এক্সটার্নাল মেমরি থেকে আনার ঝামেলা করবেন? আপনি সেগুলো ট্রানজিস্টরের মধ্যেই খোদাই করে দিতে পারতেন এবং বিলম্বের পুরো বিভাগগুলোকেই নির্মূল করতে পারতেন।

সমস্যাটি ছিল স্থায়িত্ব নিয়ে। AI মডেলগুলো স্থির থাকে না। Google ক্রমাগত Gemini আপডেট করে, নতুন ডেটার ওপর পুনরায় প্রশিক্ষণ দেয়, প্যারামিটার সমন্বয় করে এবং উন্নত সংস্করণ প্রকাশ করে। সিলিকনে ওয়েটস ফ্রিজ করা একটি চিপ নতুন মডেল সংস্করণ আসার সাথে সাথেই একটি অকেজো বস্তুতে পরিণত হবে। সেই নমনীয়তার অভাবই মূল ধারণাটিকে ধ্বংস করে দিয়েছিল।

নোঙরহীন আর্কিটেকচার

Frozen v2 আর্কিটেকচারকে হার্ডকোড করে এবং ওয়েটস পরিবর্তন করার সুযোগ রেখে দিয়ে এই অপ্রাসঙ্গিক হয়ে পড়ার ফাঁদটি কাটিয়ে ওঠে। এটিকে রাস্তার সাথে গাড়িটি ওয়েল্ডিং করে দেওয়ার পরিবর্তে একটি কাস্টম রেসট্র্যাক তৈরি করার মতো ভাবুন। সার্কিটের আকৃতি স্থির থাকে, যা Gemini-র নির্দিষ্ট কম্পিউটেশনাল প্যাটার্নের জন্য অপ্টিমাইজ করা, কিন্তু সেই সার্কিটগুলোর মধ্য দিয়ে প্রবাহিত বিষয়বস্তু মেমরি থেকে নতুন ওয়েটস লোড করার মাধ্যমে রিফ্রেশ করা যেতে পারে।

বাস্তবে এই পার্থক্যটি গুরুত্বপূর্ণ। যখন প্রকৌশলীরা একটি নতুন Gemini চেকপয়েন্ট প্রশিক্ষণ দেন, তখন তারা একটি নতুন চিপ তৈরি না করেই এটিকে Frozen v2 হার্ডওয়্যারে ডেপ্লয় করতে পারেন। হার্ডকোডিংয়ের সঠিক মাত্রাটি Google-এর ভেতরে এখনও একটি অমীমাংসিত প্রশ্ন; কোন কাঠামোগত উপাদানগুলো সিলিকনের অমরত্ব পাওয়ার যোগ্য এবং কোনগুলো কনফিগারযোগ্য থাকা উচিত, তা টিমগুলোকে সুনির্দিষ্টভাবে সিদ্ধান্ত নিতে হবে। তবে মূল নীতিটি নির্ধারিত। আকৃতিটি স্থির রেখে এবং প্যারামিটারগুলো সাবলীলভাবে পরিবর্তন করার মাধ্যমে, Google পুনরাবৃত্তি করার ক্ষমতা বিসর্জন না দিয়েই দক্ষতার সুবিধা বজায় রাখে।

এটি অভ্যন্তরীণ রাখার অর্থনীতি

আরও একটি কারণ হলো আপনি Google Cloud-এর প্রাইসিং শিটে Frozen v2-কে দেখতে পাবেন না। যেহেতু চিপটি Gemini-র অভ্যন্তরীণ কাঠামোর সাথে এত নিবিড়ভাবে তৈরি করা হয়েছে, তাই PyTorch বা কাস্টম Transformer ভেরিয়েন্ট ব্যবহারকারী বাইরের ডেভেলপারদের জন্য এটি খুব একটা কার্যকর হবে না। Google এটিকে সাধারণ উদ্দেশ্যে ব্যবহারের পণ্য হিসেবে বিক্রি করার কোনো পরিকল্পনা নেই। এটি একটি অভ্যন্তরীণ সরঞ্জাম হিসেবেই থাকবে, যার লক্ষ্য হলো Google-এর নিজস্ব ডেটাসেন্টারের ক্রমবর্ধমান ইনফারেন্স ক্যাপাসিটির চাহিদা মেটানো।

এই পছন্দটি একটি রূঢ় অর্থনৈতিক বাস্তবতাকে প্রতিফলিত করে। বর্তমান জেনারেটিভ এআই (generative AI) বাজারে, মডেলের সক্ষমতাগুলো দ্রুত একে অপরের কাছাকাছি চলে আসছে। প্রতিযোগীদের মধ্যে ব্যবধানটি প্রায়শই এই বিষয়টির ওপর নির্ভর করে যে, কে প্রতি টোকেনে (per token) সর্বনিম্ন খরচে সবচেয়ে বড় মডেলটি চালাতে সক্ষম। ইনফারেন্স (Inference) এখন আর ট্রেনিংয়ের পরবর্তী কোনো বিষয় নয়; Gemini-এর মতো বহুল ব্যবহৃত পণ্যের ক্ষেত্রে এটিই প্রধান খরচ। যদি Frozen v2 সেই খরচ ছয় গুণ বা তার বেশি কমিয়ে দেয়, তবে Google এমন একটি বাড়তি সুবিধা পাবে যা প্রতিযোগীরা সহজে মোকাবিলা করতে পারবে না। এটি সেই সাশ্রয় করা অর্থ মার্জিন হিসেবে নিজেদের পকেটে রাখতে পারে অথবা API ব্যবহারকারী এবং প্রোডাক্ট ইন্টিগ্রেশনের জন্য কম দাম হিসেবে দিতে পারে, যা OpenAI, Anthropic এবং অন্যদের ওপর চাপ বাড়িয়ে দেবে।

এটি শিল্পের জন্য কী নির্দেশ করে

Google-এর এই পদক্ষেপটি বৃহত্তর হার্ডওয়্যার কৌশল কোন দিকে যাচ্ছে তারও ইঙ্গিত দেয়। বছরের পর বছর ধরে, প্রচলিত কৌশল ছিল যতটা সম্ভব নমনীয় অ্যাক্সিলারেটর তৈরি করা এবং বিশেষায়িত কাজের জন্য সফটওয়্যারের ওপর নির্ভর করা। Nvidia-এর GPU-গুলো আধিপত্য বিস্তার করে কারণ এগুলো মলিকুলার ডায়নামিক্স থেকে শুরু করে ভিডিও গেম এবং লার্জ ল্যাঙ্গুয়েজ মডেল পর্যন্ত সবকিছু চালাতে পারে। Google-এর নিজস্ব TPU-গুলোও সেই ব্যাপক উপযোগিতার লক্ষ্যেই তৈরি করা হয়েছিল।

Frozen v2 সেই ঐতিহ্য থেকে বেরিয়ে এসেছে। এটি একটি স্বীকৃতি যে, যখন একটি নির্দিষ্ট মডেল ফ্যামিলি প্রচুর পরিমাণে কুয়েরি (query) পরিচালনা করে, তখন সেই মডেলের জন্য বিশেষভাবে তৈরি কাস্টম সিলিকন অনেক গুণ বেশি লাভজনক হতে পারে। অন্যান্য হাইপারস্কেলাররাও একই ধরনের যুক্তি অনুসরণ করেছে—উদাহরণস্বরূপ Amazon-এর Trainium এবং Inferentia চিপ—তবে Google-এর পদ্ধতিটি আরও গভীর, কারণ তারা সাধারণ নেটওয়ার্ক ক্লাসের পরিবর্তে একটি নির্দিষ্ট মডেল আর্কিটেকচারের ওপর ভিত্তি করে হার্ডওয়্যার কো-ডিজাইন করছে।

অবশ্যই, এর ঝুঁকি হলো অনমনীয়তা। যদি Gemini-এর আর্কিটেকচার এমন কোনো দিকে বিবর্তিত হয় যা হার্ডকোডেড সার্কিটগুলো গ্রহণ করতে পারে না, তবে Google এমন ব্যয়বহুল সিলিকনের সম্মুখীন হতে পারে যা তাদের নতুন ধারণাগুলো চালাতে পারবে না। ঠিক এই কারণেই শুধুমাত্র আর্কিটেকচারের ওপর ভিত্তি করে করা এই আপসটি গুরুত্বপূর্ণ। এটি একটি মধ্যপন্থা প্রদান করে: নাটকীয় দক্ষতা বৃদ্ধির জন্য যথেষ্ট বিশেষায়ন, এবং কোম্পানিকে কোণঠাসা করা এড়ানোর জন্য যথেষ্ট নমনীয়তা।

আসল সারমর্ম

Frozen v2-কে কেবল একটি চিপ ঘোষণা হিসেবে না দেখে, এআই (AI) প্রতিযোগিতার ভবিষ্যৎ রূপের ওপর একটি কৌশলগত বাজি হিসেবে দেখা উচিত। Google বাজি ধরছে যে, বিজয়ীরা কেবল সেরা মডেলই তৈরি করবে না, বরং তারা পুরো স্ট্যাকের (stack) মালিক হবে—মডেলের ব্লুপ্রিন্ট থেকে শুরু করে ট্রানজিস্টরের মধ্য দিয়ে প্রবাহিত ইলেকট্রন পর্যন্ত। যদি প্রকল্পটি সফল হয়, তবে এর সুফল বেঞ্চমার্ক স্কোরে দেখা যাবে না। এটি ত্রৈমাসিক আয়ের রিপোর্টের খরচ কলামে দেখা যাবে, যেখানে প্রতি মিলিয়ন টোকেনে কয়েক সেন্ট সাশ্রয় করা জেনারেটিভ এআই-তে বাণিজ্যিকভাবে কী কী সম্ভব তার সীমানা নতুন করে নির্ধারণ করতে পারে।