ট্রান্সফরমারের ঊর্ধ্বে: সেই স্টার্টআপগুলো যারা LLM-এর পরবর্তী যুগকে নতুন করে সংজ্ঞায়িত করছে

ট্রান্সফরমারের যুগ এখন একটি মৌলিক বাধার (bottleneck) সম্মুখীন হচ্ছে, কারণ লার্জ ল্যাঙ্গুয়েজ মডেলের (LLMs) কম্পিউটেশনাল চাহিদা একটি চরম সীমায় পৌঁছে যাচ্ছে। যদিও ২০১৭ সালের "Attention Is All You Need" পেপারটি বর্তমান এআই (AI) বিপ্লবের ভিত্তি স্থাপন করেছিল, এখন স্টার্টআপের একটি নতুন প্রজন্ম প্রকৃত দক্ষতা অর্জনের জন্য মূল আর্কিটেকচার পরিবর্তন বা নতুন করে উদ্ভাবন করার প্রতিযোগিতায় নেমেছে।

ট্রান্সফরমার বটলেনেক: কেন ডেন্স অ্যাটেনশন (Dense Attention) ব্যর্থ হচ্ছে

প্রায় এক দশক ধরে ট্রান্সফরমার এআই শিল্পের চালিকাশক্তি হিসেবে কাজ করছে, যা "dense attention" নামক একটি মেকানিজম দ্বারা পরিচালিত। এই প্রক্রিয়াটি একটি টেক্সট ব্লকের প্রতিটি টোকেনকে বিশাল পরিসরের গুণফলের মাধ্যমে অন্য প্রতিটি টোকেনের সাথে তুলনা করে। এটি অর্থগত তাৎপর্য (semantic meaning) ধরার ক্ষেত্রে অবিশ্বাস্যভাবে নির্ভুল হলেও, এর গাণিতিক জটিলতা খুব দ্রুত বৃদ্ধি পায়।

উদাহরণস্বরূপ, একটি ১০,০০০ শব্দের ডকুমেন্টের জন্য একটি ট্রান্সফরমারকে প্রায় ৫০ মিলিয়ন গুণ করতে হতে পারে। কম্পিউটেশনে এই দ্বিঘাত বৃদ্ধি (quadratic growth) দুটি বিশাল চ্যালেঞ্জের জন্ম দেয়: আকাশচুম্বী বিদ্যুৎ খরচ এবং সীমিত কনটেক্সট উইন্ডো (context windows)। রিপোর্ট অনুযায়ী, OpenAI এই বছর কম্পিউটিংয়ের জন্য ৫০ বিলিয়ন ডলার ব্যয় করতে যাচ্ছে এবং ২০৩০ সালের মধ্যে ডেটা সেন্টারের বিদ্যুতের চাহিদা দ্বিগুণ হওয়ার সম্ভাবনা রয়েছে; ফলে শিল্পটি খরচ এবং পদার্থবিজ্ঞানের উভয় সীমাবদ্ধতার সম্মুখীন হচ্ছে।

অ্যাটেনশন নিয়ে নতুন ভাবনা: স্পার্স মেকানিজমের উত্থান

দক্ষতার এই সংকট সমাধানের জন্য বেশ কিছু স্টার্টআপ "dense attention" থেকে সরে এসে "sparse attention"-এর দিকে মনোনিবেশ করছে। প্রতিটি সম্ভাব্য শব্দের জোড়া গণনা করার পরিবর্তে, sparse attention শুধুমাত্র সবচেয়ে প্রাসঙ্গিক সংযোগগুলোর ওপর গুরুত্ব দেয়, যা কম্পিউটেশনাল লোড বা কাজের চাপ উল্লেখযোগ্যভাবে কমিয়ে দেয়।

মিয়ামি-ভিত্তিক স্টার্টআপ Subquadratic তাদের SubQ মডেলের মাধ্যমে এই ক্ষেত্রে নেতৃত্ব দিচ্ছে। পূর্ববর্তী স্পার্স মেকানিজমগুলো নির্ভুলতা বজায় রাখতে হিমশিম খেত, কিন্তু Subquadratic দাবি করছে যে তাদের প্রযুক্তি কোডিং এবং সার্চের মতো বিশেষায়িত কাজে মূলধারার LLM-গুলোর সমতুল্য। তাদের পদ্ধতিটি একটি ডায়নামিক সিস্টেম ব্যবহার করে যা অপ্রাসঙ্গিক টোকেনগুলোতে সময় নষ্ট না করে, একটি নির্দিষ্ট টেক্সটের জন্য কোন শব্দগুলো আসলে গুরুত্বপূর্ণ তা তাৎক্ষণিকভাবে শনাক্ত করে।

পাওয়ার রিটেনশন: রোলিং সামারির দিকে যাত্রা

আরেকটি পদ্ধতি হলো অ্যাটেনশন মেকানিজমকে পুরোপুরি বাদ দেওয়া। সান ফ্রান্সিসকো-ভিত্তিক Manifest AI "power retention" নামক একটি কৌশলের পথপ্রদর্শক। SubQ-এর মতো স্পার্স অ্যাটেনশন মডেলগুলো যেখানে পুরো কনটেক্সট উইন্ডোর একটি মোটামুটি ধারণা রাখার চেষ্টা করে, সেখানে power retention মডেলটিকে তার মেমরির একটি রোলিং সামারি (rolling summary) প্রদানের মাধ্যমে কাজ করে।

কনটেক্সট উইন্ডোতে নতুন তথ্য প্রবেশ করার সাথে সাথে, মডেলটি কম প্রাসঙ্গিক ডেটা শনাক্ত করে বাদ দিয়ে দেয়, যা ইনপুট সাইজ যাই হোক না কেন কম্পিউটেশনাল লোড নিয়ন্ত্রণে রাখতে সাহায্য করে। Manifest AI ইতিমধ্যে এই পদ্ধতির কার্যকারিতা প্রমাণ করেছে:

  • power retention ব্যবহার করে ওপেন-সোর্স StarCoder মডেলটিকে PowerCoder-এ রূপান্তর করা।
  • Brumby রিলিজ করা, যা তাদের মতে আলিবাবার জনপ্রিয় Qwen ওপেন-সোর্স মডেলগুলোর সমতুল্য।

ন্যূনতম রিট্রেনিংয়ের মাধ্যমে বিদ্যমান ট্রান্সফরমার মডেলগুলোকে power retention মডেলে রূপান্তরিত করার ক্ষমতা ইঙ্গিত দেয় যে, "LLMs+"—মডেলের পরবর্তী প্রজন্মে উত্তরণ প্রত্যাশার চেয়ে অনেক দ্রুত হতে পারে।

মূল বিষয়সমূহ

  • ট্রান্সফরমারের সীমাবদ্ধতা: ডেন্স অ্যাটেনশনের দ্বিঘাত স্কেলিং (quadratic scaling) বর্তমান LLM-গুলোকে চালানো অত্যন্ত ব্যয়বহুল করে তোলে এবং বিশাল ডেটাসেট বা দীর্ঘস্থায়ী যুক্তির (long-form reasoning) জন্য স্কেল করা কঠিন করে তোলে।
  • স্পার্স বনাম রিটেনশন: স্টার্টআপগুলো দুটি দিক থেকে এই সমস্যার সমাধান করছে: Subquadratic স্পার্স ক্যালকুলেশনের (SubQ) মাধ্যমে অ্যাটেনশন অপ্টিমাইজ করছে, অন্যদিকে Manifest AI এটিকে রোলিং সামারি (Power Retention) দিয়ে প্রতিস্থাপন করছে।
  • অর্থনৈতিক প্রয়োজনীয়তা: এআই কম্পিউটিং খরচ যখন কয়েক বিলিয়ন ডলারে পৌঁছে যাচ্ছে, তখন পরবর্তী এআই যুগের বিজয়ী সম্ভবত তারাই হবে যারা কেবল বিশাল স্কেলের পরিবর্তে দক্ষতার (efficiency) সমাধান দেবে।