El Benchmark del Pelícano: 2 años de evolución de la IA
En octubre de 2024, Simon Willison les dio un único prompt a dieciséis LLM: "Genera un SVG de un pelícano montando en bicicleta".
Ha ejecutado este mismo prompt en cada modelo nuevo durante dos años. Ahora tiene 103 dibujos de 66 modelos diferentes.
Hemos recopilado estas imágenes en un solo lugar: pelicanzoo.ai.
Esto es lo que este experimento nos enseña sobre la IA:
- El SVG es código, no píxeles. Los LLM no pueden ver, pero pueden escribir código. Deben construir una imagen utilizando únicamente coordenadas y radios.
- La tarea es difícil. Las bicicletas son difíciles de dibujar para los humanos de memoria. Los pelícanos no tienen la forma adecuada para montarlas.
- Los primeros modelos fallaron de formas divertidas. Algunos dibujaron triángulos y círculos. Otros dibujaron formas que parecían fregaderos o tractores.
- El seguimiento de capacidades cambió. En el primer año, mejores pelícanos significaban mejores habilidades de programación. Ahora, ese vínculo ha desaparecido.
- Los modelos pequeños pueden ganar. Un modelo pequeño ejecutándose en un portátil llegó a dibujar un pelícano mejor que un modelo insignia masivo.
¿Por qué seguir realizando una prueba "estúpida"?
Cumple dos propósitos prácticos:
- Demuestra que un modelo funciona. Publicar un pelícano demuestra que realmente ejecutaste el modelo en lugar de solo leer las noticias.
- Revela datos ocultos. Puedes ver cuántos tokens utiliza un modelo y cuánto cuesta generar una sola imagen sencilla.
La prueba del pelícano ya no es una forma de clasificar la mejor IA. Es un ritual. Te muestra la personalidad de un modelo. Podrías ver a un modelo añadirle un pequeño sombrero a un ave, mientras que otro se niega por completo a dibujar una bicicleta porque las aves no pueden montarlas.
Un modelo incluso utilizó 13.000 tokens y 25 centavos solo para dibujar un ave.
Los dibujos muestran la historia de la IA a través del código.
Visita pelicanzoo.ai para ver la colección.
