Pelican Benchmark: 2 ปีแห่งวิวัฒนาการของ AI

ในเดือนตุลาคม 2024 Simon Willison ได้ให้คำสั่ง (prompt) เดียวกันกับ LLM 16 โมเดล คือ: "Generate an SVG of a pelican riding a bicycle."

เขาใช้คำสั่งเดิมนี้กับทุกโมเดลใหม่ที่ออกมาตลอดระยะเวลาสองปี จนตอนนี้เขามีภาพวาดถึง 103 ภาพ จากโมเดลที่แตกต่างกันถึง 66 โมเดล

เราได้รวบรวมภาพเหล่านี้ไว้ในที่เดียวที่: pelicanzoo.ai

นี่คือสิ่งที่การทดลองนี้สอนเราเกี่ยวกับ AI:

  • SVG คือโค้ด ไม่ใช่พิกเซล LLM มองไม่เห็น แต่พวกมันสามารถเขียนโค้ดได้ พวกมันต้องสร้างรูปภาพขึ้นมาโดยใช้เพียงพิกัด (coordinates) และรัศมี (radii) เท่านั้น
  • งานนี้เป็นงานที่ยาก จักรยานเป็นสิ่งที่มนุษย์วาดจากความจำได้ยาก และนกเพลิกันก็มีรูปร่างที่ไม่เหมาะกับการขี่จักรยาน
  • โมเดลในยุคแรกล้มเหลวในรูปแบบที่น่าตลกขบขัน บางโมเดลวาดออกมาเป็นรูปสามเหลี่ยมและวงกลม บางโมเดลวาดรูปทรงที่ดูเหมือนอ่างล้างหน้าหรือรถแทรกเตอร์
  • การติดตามความสามารถมีการเปลี่ยนแปลง ในปีแรก นกเพลิกันที่ดูดีขึ้นหมายถึงทักษะการเขียนโค้ดที่ดีขึ้น แต่ในตอนนี้ ความเชื่อมโยงนั้นได้หายไปแล้ว
  • โมเดลขนาดเล็กก็สามารถชนะได้ ครั้งหนึ่งโมเดลขนาดเล็กที่รันบนแล็ปท็อปเคยวาดนกเพลิกันได้ดีกว่าโมเดลเรือธงขนาดมหึมาเสียอีก

ทำไมยังต้องทำการทดสอบที่ดู "ไร้สาระ" นี้ต่อไป?

มันมีวัตถุประสงค์ในเชิงปฏิบัติอยู่สองประการ:

  • มันพิสูจน์ว่าโมเดลใช้งานได้จริง การโพสต์ภาพนกเพลิกันแสดงให้เห็นว่าคุณได้รันโมเดลนั้นจริงๆ ไม่ใช่แค่เพียงอ่านข่าวมา
  • มันเผยให้เห็นข้อมูลที่ซ่อนอยู่ คุณสามารถดูได้ว่าโมเดลใช้โทเคน (tokens) ไปเท่าไหร่ และมีค่าใช้จ่ายเท่าใดในการสร้างภาพง่ายๆ เพียงภาพเดียว

การทดสอบนกเพลิกันไม่ใช่เครื่องมือสำหรับจัดอันดับ AI ที่ดีที่สุดอีกต่อไป แต่มันคือพิธีกรรม มันแสดงให้เห็นถึงบุคลิกของแต่ละโมเดล คุณอาจเห็นโมเดลหนึ่งสวมหมวกใบเล็กๆ ให้กับนก ในขณะที่อีกโมเดลปฏิเสธที่จะวาดจักรยานเลย เพราะนกไม่สามารถขี่จักรยานได้

มีโมเดลหนึ่งถึงกับใช้โทเคนถึง 13,000 โทเคน และเสียเงินไป 25 เซนต์ เพียงเพื่อวาดนกตัวเดียว

ภาพวาดเหล่านี้แสดงให้เห็นถึงประวัติศาสตร์ของ AI ผ่านทางโค้ด

เยี่ยมชม pelicanzoo.ai เพื่อดูคอลเลกชันนี้

แหล่งที่มา: https://dev.to/_94be737e156beb4d74df2/two-years-of-pelicans-on-bicycles-103-svgs-66-models-and-what-the-guy-who-invented-the-benchmark-4c7e