Pelican Benchmark: 2 Yıllık Yapay Zeka Evrimi
Ekim 2024'te Simon Willison, on altı LLM'e tek bir istem verdi: "Bisiklet süren bir pelikanın SVG'sini oluştur."
İki yıldır bu aynı istemi her yeni modelde çalıştırıyor. Şu an elinde 66 farklı modelden gelen 103 çizim var.
Bu görselleri tek bir yerde topladık: pelicanzoo.ai.
Bu deneyin bize yapay zeka hakkında öğrettikleri şunlardır:
- SVG piksellerden değil, koddan oluşur. LLM'ler göremez ancak kod yazabilirler. Bir resmi yalnızca koordinatlar ve yarıçaplar kullanarak oluşturmak zorundadırlar.
- Görev zor. İnsanların hafızalarından bisiklet çizmesi zordur. Pelikanların ise bisiklet sürmek için uygun bir vücut yapısı yoktur.
- İlk modeller komik şekillerde başarısız oldu. Bazıları üçgenler ve daireler çizdi. Diğerleri ise lavabo veya traktöre benzeyen şekiller çizdi.
- Yetenek takibi değişti. İlk yıl, daha iyi pelikanlar daha iyi kodlama becerileri anlamına geliyordu. Artık bu bağlantı kalmadı.
- Küçük modeller kazanabilir. Bir dizüstü bilgisayarda çalışan küçük bir model, bir keresinde devasa bir amiral gemisi modelinden daha iyi bir pelikan çizdi.
Neden "aptalca" bir testi çalıştırmaya devam ediyorsunuz?
İki pratik amaca hizmet ediyor:
- Bir modelin çalıştığını kanıtlar. Bir pelikan paylaşmak, sadece haberleri okumak yerine modeli gerçekten çalıştırdığınızı gösterir.
- Gizli verileri ortaya çıkarır. Bir modelin kaç token kullandığını ve tek bir basit görsel oluşturmanın maliyetini görebilirsiniz.
Pelikan testi artık en iyi yapay zekayı sıralamanın bir yolu değil. Bu bir ritüel. Size bir modelin kişiliğini gösteriyor. Bir modelin kuşa küçük bir şapka taktığını görebilirken, bir diğeri kuşlar bisiklet süremeyeceği için bisiklet çizmeyi tamamen reddedebilir.
Bir model, sadece bir kuş çizmek için 13.000 token ve 25 sent harcadı bile.
Çizimler, yapay zekanın tarihini kod aracılığıyla gösteriyor.
Koleksiyonu görmek için pelicanzoo.ai adresini ziyaret edin.
