Бенчмарк «Пеликан»: 2 года эволюции ИИ
В октябре 2024 года Саймон Виллисон дал шестнадцати LLM один промпт: «Сгенерируй SVG-изображение пеликана, едущего на велосипеде».
Он запускал этот же промпт на каждой новой модели в течение двух лет. Теперь у него есть 103 рисунка от 66 различных моделей.
Мы собрали эти изображения в одном месте: pelicanzoo.ai.
Вот чему этот эксперимент учит нас в отношении ИИ:
- SVG — это код, а не пиксели. LLM не могут видеть, но они умеют писать код. Они должны строить изображение, используя только координаты и радиусы.
- Задача сложная. Людям трудно рисовать велосипеды по памяти. У пеликанов нет подходящей формы тела, чтобы на них ездить.
- Ранние модели терпели забавные неудачи. Одни рисовали треугольники и круги. Другие создавали фигуры, похожие на раковины или тракторы.
- Отслеживание возможностей изменилось. В первый год более качественные пеликаны означали улучшение навыков программирования. Теперь эта связь исчезла.
- Малые модели могут побеждать. Однажды небольшая модель, запущенная на ноутбуке, нарисовала пеликана лучше, чем массивная флагманская модель.
Зачем продолжать проводить «глупый» тест?
Он преследует две практические цели:
- Он доказывает работоспособность модели. Публикация пеликана показывает, что вы действительно запустили модель, а не просто прочитали новости.
- Он раскрывает скрытые данные. Вы можете увидеть, сколько токенов использует модель и сколько стоит генерация одного простого изображения.
Тест с пеликаном больше не является способом ранжирования лучшего ИИ. Это ритуал. Он раскрывает характер модели. Вы можете увидеть, как одна модель надевает на птицу маленькую шляпу, в то время как другая вовсе отказывается рисовать велосипед, потому что птицы не умеют на них ездить.
Одна модель потратила даже 13 000 токенов и 25 центов только на то, чтобы нарисовать одну птицу.
Эти рисунки показывают историю ИИ через код.
Посетите pelicanzoo.ai, чтобы увидеть коллекцию.
