The Pelican Benchmark: 2 Years of AI Evolution
২০২৪ সালের অক্টোবরে, সাইমন উইলিসন ১৬টি LLM-কে একটি প্রম্পট দিয়েছিলেন: "একটি সাইকেল চালানো পেলিকানের একটি SVG তৈরি করো।"
তিনি গত দুই বছর ধরে প্রতিটি নতুন মডেলে এই একই প্রম্পট চালিয়েছেন। এখন তার কাছে ৬৬টি ভিন্ন মডেল থেকে পাওয়া ১০৩টি ছবি রয়েছে।
আমরা এই ছবিগুলোকে এক জায়গায় সংগ্রহ করেছি: pelicanzoo.ai।
এই পরীক্ষাটি এআই (AI) সম্পর্কে আমাদের যা শেখায় তা নিচে দেওয়া হলো:
- SVG হলো কোড, পিক্সেল নয়। LLM দেখতে পায় না, কিন্তু তারা কোড লিখতে পারে। তাদের শুধুমাত্র coordinates এবং radii ব্যবহার করে একটি ছবি তৈরি করতে হয়।
- কাজটি কঠিন। মানুষের পক্ষে স্মৃতি থেকে সাইকেল আঁকা বেশ কঠিন। আবার পেলিকানদের শারীরিক গঠনও সাইকেল চালানোর উপযোগী নয়।
- শুরুর দিকের মডেলগুলো মজার সব ভুল করত। কেউ কেউ ত্রিভুজ এবং বৃত্ত আঁকত। কেউ কেউ এমন আকৃতি আঁকত যা দেখতে সিঙ্ক বা ট্রাক্টরের মতো লাগত।
- সক্ষমতা যাচাইয়ের ধরন বদলে গেছে। প্রথম বছরে, উন্নত পেলিকান মানেই ছিল উন্নত কোডিং দক্ষতা। এখন সেই সম্পর্ক আর নেই।
- ছোট মডেলও জয়ী হতে পারে। ল্যাপটপে চলা একটি ছোট মডেল একবার একটি বিশাল ফ্ল্যাগশিপ মডেলের চেয়েও ভালো পেলিকান এঁকেছিল।
Why keep running a "stupid" test?
এটি দুটি ব্যবহারিক উদ্দেশ্যে কাজ করে:
- এটি প্রমাণ করে যে মডেলটি কাজ করছে। একটি পেলিকানের ছবি পোস্ট করা মানে আপনি শুধু খবর পড়েননি, বরং মডেলটি সত্যিই চালিয়েছেন।
- এটি লুকানো তথ্য প্রকাশ করে। আপনি দেখতে পারেন একটি মডেল কতগুলো টোকেন ব্যবহার করে এবং একটি সাধারণ ছবি তৈরি করতে কত খরচ হয়।
পেলিকান পরীক্ষাটি এখন আর সেরা এআই (AI) র্যাঙ্কিং করার উপায় নয়। এটি একটি রীতি। এটি একটি মডেলের ব্যক্তিত্ব প্রকাশ করে। আপনি হয়তো দেখবেন একটি মডেল পাখির মাথায় একটি ছোট টুপি এঁকে দিচ্ছে, আবার অন্যটি সাইকেল আঁকতে একেবারেই অস্বীকার করছে কারণ পাখিরা সাইকেল চালাতে পারে না।
একটি মডেল এমনকি একটি পাখি আঁকতে ১৩,০০০ টোকেন এবং ২৫ সেন্ট খরচ করেছে।
এই ছবিগুলো কোডের মাধ্যমে এআই (AI)-এর ইতিহাস তুলে ধরে।
সংগ্রহটি দেখতে pelicanzoo.ai ভিজিট করুন।
