The Pelican Benchmark: 2 Years of AI Evolution
ઓક્ટોબર ૨૦૨૪ માં, સાયમન વિલિસને સોળ LLMs ને એક પ્રોમ્પ્ટ આપ્યો: "સાયકલ ચલાવતા પેલિકનનું એક SVG બનાવો."
તેમણે છેલ્લા બે વર્ષથી દરેક નવા મોડેલ પર આ જ પ્રોમ્પ્ટ ચલાવ્યો છે. હવે તેમની પાસે ૬૬ અલગ-અલગ મોડેલ્સમાંથી ૧૦૩ ડ્રોઇંગ્સ છે.
અમે આ છબીઓને એક જગ્યાએ એકત્રિત કરી છે: pelicanzoo.ai.
આ પ્રયોગ આપણને AI વિશે શું શીખવે છે તે અહીં છે:
- SVG એ કોડ છે, પિક્સેલ્સ નથી. LLMs જોઈ શકતા નથી, પરંતુ તેઓ કોડ લખી શકે છે. તેમણે માત્ર કોઓર્ડિનેટ્સ (coordinates) અને ત્રિજ્યા (radii) નો ઉપયોગ કરીને ચિત્ર બનાવવું પડે છે.
- આ કાર્ય અઘરું છે. મનુષ્યો માટે યાદશક્તિના આધારે સાયકલ દોરવી મુશ્કેલ છે. પેલિકન પાસે સાયકલ ચલાવવા માટે યોગ્ય આકાર હોતો નથી.
- શરૂઆતના મોડેલ્સ રમુજી રીતે નિષ્ફળ ગયા હતા. કેટલાકએ ત્રિકોણ અને વર્તુળો દોર્યા હતા. અન્ય લોકોએ સિંક અથવા ટ્રેક્ટર જેવા દેખાતા આકારો દોર્યા હતા.
- ક્ષમતા ટ્રેકિંગ (Capability tracking) બદલાઈ ગયું છે. પ્રથમ વર્ષમાં, સારા પેલિકનનો અર્થ વધુ સારી કોડિંગ કુશળતા હતો. હવે, તે સંબંધ જતો રહ્યો છે.
- નાના મોડેલ્સ જીતી શકે છે. લેપટોપ પર ચાલતા એક નાના મોડેલે એકવાર વિશાળ ફ્લેગશિપ મોડેલ કરતા વધુ સારું પેલિકન દોર્યું હતું.
"મૂર્ખતાપૂર્ણ" ટેસ્ટ ચલાવવાનું શા માટે ચાલુ રાખવું?
તે બે વ્યવહારિક હેતુઓ પૂરા પાડે છે:
- તે સાબિત કરે છે કે મોડેલ કામ કરે છે. પેલિકન પોસ્ટ કરવાથી ખબર પડે છે કે તમે માત્ર સમાચાર વાંચવાને બદલે ખરેખર મોડેલ ચલાવ્યું છે.
- તે છુપાયેલ ડેટાને પ્રગટ કરે છે. તમે જોઈ શકો છો કે મોડેલ કેટલા ટોકન્સનો ઉપયોગ કરે છે અને એક સાદી છબી બનાવવા માટે કેટલો ખર્ચ થાય છે.
પેલિકન ટેસ્ટ હવે શ્રેષ્ઠ AI ને રેન્ક આપવાનો રસ્તો નથી રહ્યો. તે એક વિધિ (ritual) છે. તે તમને મોડેલનું વ્યક્તિત્વ બતાવે છે. તમે જોઈ શકો છો કે એક મોડેલ પક્ષીને નાની ટોપી પહેરાવે છે, જ્યારે બીજું મોડેલ સાયકલ દોરવાનો જ ઇનકાર કરે છે કારણ કે પક્ષીઓ સાયકલ ચલાવી શકતા નથી.
એક મોડેલે માત્ર એક પક્ષી દોરવા માટે ૧૩,૦૦૦ ટોકન્સ અને ૨૫ સેન્ટનો ઉપયોગ કર્યો હતો.
આ ડ્રોઇંગ્સ કોડ દ્વારા AI નો ઇતિહાસ દર્શાવે છે.
કલેક્શન જોવા માટે pelicanzoo.ai ની મુલાકાત લો.
