Pelican Benchmark: 2 ปีแห่งวิวัฒนาการของ AI
ในเดือนตุลาคม 2024 Simon Willison ได้ให้คำสั่ง (prompt) เดียวกันกับ LLM 16 โมเดล คือ: "Generate an SVG of a pelican riding a bicycle."
เขาใช้คำสั่งเดิมนี้กับทุกโมเดลใหม่ที่ออกมาตลอดระยะเวลาสองปี จนตอนนี้เขามีภาพวาดถึง 103 ภาพ จากโมเดลที่แตกต่างกันถึง 66 โมเดล
เราได้รวบรวมภาพเหล่านี้ไว้ในที่เดียวที่: pelicanzoo.ai
นี่คือสิ่งที่การทดลองนี้สอนเราเกี่ยวกับ AI:
- SVG คือโค้ด ไม่ใช่พิกเซล LLM มองไม่เห็น แต่พวกมันสามารถเขียนโค้ดได้ พวกมันต้องสร้างรูปภาพขึ้นมาโดยใช้เพียงพิกัด (coordinates) และรัศมี (radii) เท่านั้น
- งานนี้เป็นงานที่ยาก จักรยานเป็นสิ่งที่มนุษย์วาดจากความจำได้ยาก และนกเพลิกันก็มีรูปร่างที่ไม่เหมาะกับการขี่จักรยาน
- โมเดลในยุคแรกล้มเหลวในรูปแบบที่น่าตลกขบขัน บางโมเดลวาดออกมาเป็นรูปสามเหลี่ยมและวงกลม บางโมเดลวาดรูปทรงที่ดูเหมือนอ่างล้างหน้าหรือรถแทรกเตอร์
- การติดตามความสามารถมีการเปลี่ยนแปลง ในปีแรก นกเพลิกันที่ดูดีขึ้นหมายถึงทักษะการเขียนโค้ดที่ดีขึ้น แต่ในตอนนี้ ความเชื่อมโยงนั้นได้หายไปแล้ว
- โมเดลขนาดเล็กก็สามารถชนะได้ ครั้งหนึ่งโมเดลขนาดเล็กที่รันบนแล็ปท็อปเคยวาดนกเพลิกันได้ดีกว่าโมเดลเรือธงขนาดมหึมาเสียอีก
ทำไมยังต้องทำการทดสอบที่ดู "ไร้สาระ" นี้ต่อไป?
มันมีวัตถุประสงค์ในเชิงปฏิบัติอยู่สองประการ:
- มันพิสูจน์ว่าโมเดลใช้งานได้จริง การโพสต์ภาพนกเพลิกันแสดงให้เห็นว่าคุณได้รันโมเดลนั้นจริงๆ ไม่ใช่แค่เพียงอ่านข่าวมา
- มันเผยให้เห็นข้อมูลที่ซ่อนอยู่ คุณสามารถดูได้ว่าโมเดลใช้โทเคน (tokens) ไปเท่าไหร่ และมีค่าใช้จ่ายเท่าใดในการสร้างภาพง่ายๆ เพียงภาพเดียว
การทดสอบนกเพลิกันไม่ใช่เครื่องมือสำหรับจัดอันดับ AI ที่ดีที่สุดอีกต่อไป แต่มันคือพิธีกรรม มันแสดงให้เห็นถึงบุคลิกของแต่ละโมเดล คุณอาจเห็นโมเดลหนึ่งสวมหมวกใบเล็กๆ ให้กับนก ในขณะที่อีกโมเดลปฏิเสธที่จะวาดจักรยานเลย เพราะนกไม่สามารถขี่จักรยานได้
มีโมเดลหนึ่งถึงกับใช้โทเคนถึง 13,000 โทเคน และเสียเงินไป 25 เซนต์ เพียงเพื่อวาดนกตัวเดียว
ภาพวาดเหล่านี้แสดงให้เห็นถึงประวัติศาสตร์ของ AI ผ่านทางโค้ด
เยี่ยมชม pelicanzoo.ai เพื่อดูคอลเลกชันนี้
