The Pelican Benchmark: 2 Years of AI Evolution
У жовтні 2024 року Саймон Віллісон дав шістнадцяти LLM один промпт: «Згенеруй SVG-зображення пелікана, який їде на велосипеді».
Він застосовував цей самий промпт до кожної нової моделі протягом двох років. Тепер у нього є 103 малюнки від 66 різних моделей.
Ми зібрали ці зображення в одному місці: pelicanzoo.ai.
Ось чого цей експеримент навчає нас щодо ШІ:
- SVG — це код, а не пікселі. LLM не можуть бачити, але вони вміють писати код. Вони мають будувати малюнок, використовуючи лише координати та радіуси.
- Це складне завдання. Людям важко малювати велосипеди з пам'яті. Пелікани не мають відповідної форми, щоб на них їздити.
- Ранні моделі зазнавали невдач у кумедний спосіб. Деякі малювали трикутники та кола. Інші — фігури, схожі на раковини або трактори.
- Відстеження можливостей змінилося. У перший рік кращі пелікани означали кращі навички програмування. Тепер цей зв'язок зник.
- Малі моделі можуть перемагати. Мала модель, що працює на ноутбуці, одного разу намалювала кращого пелікана, ніж масивна флагманська модель.
Навіщо продовжувати проводити «дурний» тест?
Він має дві практичні мети:
- Він доводить, що модель працює. Публікація пелікана показує, що ви дійсно запустили модель, а не просто прочитали новини.
- Він виявляє приховані дані. Ви можете побачити, скільки токенів використовує модель і скільки коштує генерація одного простого зображення.
Тест із пеліканом більше не є способом рейтингування найкращого ШІ. Це ритуал. Він демонструє характер моделі. Ви можете побачити, як одна модель додає птахові маленьку шапочку, тоді як інша взагалі відмовляється малювати велосипед, бо птахи не можуть на них їздити.
Одна модель використала навіть 13 000 токенів і 25 центів лише для того, щоб намалювати одного птаха.
Малюнки показують історію ШІ через код.
Відвідайте pelicanzoo.ai, щоб переглянути колекцію.
