The Pelican Benchmark: 2 Years of AI Evolution
في أكتوبر 2024، أعطى سايمون ويليسون ستة عشر نموذجاً لغوياً كبيراً (LLM) أمراً واحداً: "أنشئ ملف SVG لبجع يركب دراجة هوائية."
لقد قام بتشغيل هذا الأمر نفسه على كل نموذج جديد لمدة عامين. ولديه الآن 103 رسومات من 66 نموذجاً مختلفاً.
لقد جمعنا هذه الصور في مكان واحد: pelicanzoo.ai.
إليكم ما يعلمنا إياه هذا الاختبار حول الذكاء الاصطناعي:
- ملفات SVG هي كود برمجي، وليست بكسلات. النماذج اللغوية الكبيرة لا يمكنها الرؤية، لكن يمكنها كتابة الكود. يجب عليها بناء صورة باستخدام الإحداثيات وأنصاف الأقطار فقط.
- المهمة صعبة. فالدراجات الهوائية يصعب على البشر رسمها من الذاكرة، كما أن البجع لا يمتلك الشكل المناسب لركوبها.
- فشلت النماذج المبكرة بطرق مضحكة. فبعضها رسم مثلثات ودوائر، بينما رسم البعض الآخر أشكالاً تشبه أحواض الغسيل أو الجرارات.
- تغير تتبع القدرات. في العام الأول، كان الحصول على طيور بجع أفضل يعني مهارات برمجة أفضل، أما الآن، فقد انقطعت تلك الصلة.
- يمكن للنماذج الصغيرة أن تفوز. فقد رسم نموذج صغير يعمل على جهاز كمبيوتر محمول مرة واحدة بجعة أفضل من نموذج رائد ضخم.
لماذا الاستمرار في إجراء اختبار "غبي"؟
إنه يخدم غرضين عمليين:
- يثبت أن النموذج يعمل. فنشر صورة بجعة يظهر أنك قمت بتشغيل النموذج بالفعل بدلاً من مجرد قراءة الأخبار.
- يكشف عن بيانات مخفية. يمكنك رؤية عدد الرموز (tokens) التي يستخدمها النموذج وتكلفة إنشاء صورة بسيطة واحدة.
لم يعد اختبار البجع وسيلة لتصنيف أفضل نماذج الذكاء الاصطناعي، بل أصبح طقساً. فهو يظهر لك شخصية النموذج؛ فقد ترى نموذجاً يضيف قبعة صغيرة للطائر، بينما يرفض نموذج آخر رسم الدراجة تماماً لأن الطيور لا يمكنها ركوبها.
حتى أن أحد النماذج استهلك 13,000 رمز (token) و25 سنتاً فقط لرسم طائر واحد.
تُظهر الرسومات تاريخ الذكاء الاصطناعي من خلال الكود البرمجي.
قم بزيارة pelicanzoo.ai لمشاهدة المجموعة.
