पेलिकन बेंचमार्क: AI उत्क्रांतीची २ वर्षे

ऑक्टोबर २०२४ मध्ये, सायमन विलिसन यांनी सोळा LLMs ला एक प्रॉम्प्ट दिला: "सायकल चालवणाऱ्या पेलिकनचे SVG तयार करा."

त्यांनी गेल्या दोन वर्षांपासून प्रत्येक नवीन मॉडेलवर हाच प्रॉम्प्ट चालवला आहे. आता त्यांच्याकडे ६६ वेगवेगळ्या मॉडेल्सपासून मिळालेली १०३ चित्रे आहेत.

आम्ही ही चित्रे एका ठिकाणी जमा केली आहेत: pelicanzoo.ai.

या प्रयोगातून आपल्याला AI बद्दल काय शिकायला मिळते ते खालीलप्रमाणे आहे:

  • SVG हा कोड आहे, पिक्सेल नाही. LLMs पाहू शकत नाहीत, पण ते कोड लिहू शकतात. त्यांना केवळ कोऑर्डिनेट्स (coordinates) आणि रेडिअस (radii) वापरून चित्र तयार करावे लागते.
  • हे काम कठीण आहे. माणसांनाही सायकली स्मरणातून काढणे कठीण जाते. पेलिकनचा आकारही सायकल चालवण्यासाठी योग्य नसतो.
  • सुरुवातीची मॉडेल्स मजेशीर पद्धतीने अपयशी ठरली. काही मॉडेल्सनी त्रिकोण आणि वर्तुळे काढली, तर काहींनी सिंक किंवा ट्रॅक्टरसारखे आकार काढले.
  • क्षमतेचा मागोवा घेणे (Capability tracking) बदलले आहे. पहिल्या वर्षी, चांगले पेलिकन म्हणजे उत्तम कोडिंग कौशल्य असा अर्थ होता. आता, तो संबंध उरलेला नाही.
  • लहान मॉडेल्स देखील जिंकू शकतात. लॅपटॉपवर चालणाऱ्या एका लहान मॉडेलने एकदा एका प्रचंड मोठ्या फ्लॅगशिप मॉडेलपेक्षा चांगले पेलिकन काढले होते.

"मूर्खपणाचा" वाटणारा हा टेस्ट का चालू ठेवायचा?

याचे दोन व्यावहारिक उद्देश आहेत:

  • हे मॉडेल काम करते हे सिद्ध करते. पेलिकनचे चित्र पोस्ट करणे हे दर्शवते की तुम्ही केवळ बातम्या वाचण्याऐवजी प्रत्यक्षात मॉडेल चालवून पाहिले आहे.
  • हे लपलेली माहिती समोर आणते. मॉडेल किती टोकन्स वापरते आणि एक साधे चित्र तयार करण्यासाठी किती खर्च येतो, हे तुम्ही पाहू शकता.

पेलिकन टेस्ट आता सर्वोत्तम AI ठरवण्याचे साधन राहिलेले नाही. ती एक विधी (ritual) बनली आहे. ती तुम्हाला मॉडेलचे व्यक्तिमत्व दाखवते. तुम्ही पाहू शकता की एखादे मॉडेल पक्षाला एक छोटी टोपी घालते, तर दुसरे मॉडेल