بنچمارک پلیکان: ۲ سال تکامل هوش مصنوعی
در اکتبر ۲۰۲۴، سایمون ویلیسون به شانزده مدل زبانی بزرگ (LLM) یک دستور (prompt) داد: "یک فایل SVG از یک پلیکان در حال سوار شدن بر دوچرخه تولید کن."
او به مدت دو سال، همین دستور را روی هر مدل جدید اجرا کرده است. او اکنون ۱۰۳ نقاشی از ۶۶ مدل مختلف در اختیار دارد.
ما این تصاویر را در یک جا جمعآوری کردیم: pelicanzoo.ai.
این آزمایش چه نکاتی را درباره هوش مصنوعی به ما میآموزد:
- SVG کد است، نه پیکسل. مدلهای زبانی بزرگ نمیتوانند ببینند، اما میتوانند کد بنویسند. آنها باید تصویر را تنها با استفاده از مختصات و شعاعها بسازند.
- این کار دشوار است. کشیدن دوچرخه از حافظه برای انسانها سخت است. پلیکانها هم ساختار بدنی مناسبی برای سوار شدن بر آنها ندارند.
- مدلهای اولیه به روشهای خندهداری شکست خوردند. برخی مثلث و دایره کشیدند. برخی دیگر اشکالی کشیدند که شبیه سینک ظرفشویی یا تراکتور بود.
- روند ردیابی توانمندیها تغییر کرد. در سال اول، پلیکانهای بهتر به معنای مهارتهای کدنویسی بهتر بود. اکنون، این ارتباط از بین رفته است.
- مدلهای کوچک میتوانند پیروز شوند. یک بار یک مدل کوچک که روی یک لپتاپ اجرا میشد، پلیکانی بهتر از یک مدل پرچمدار عظیم کشید.
چرا همچنان یک تست «احمقانه» را ادامه میدهیم؟
این کار دو هدف کاربردی دارد:
- اثبات عملکرد مدل: انتشار تصویر یک پلیکان نشان میدهد که شما واقعاً مدل را اجرا کردهاید، نه اینکه فقط اخبار را خوانده باشید.
- آشکارسازی دادههای پنهان: شما میتوانید ببینید یک مدل از چند توکن استفاده میکند و هزینه تولید یک تصویر ساده چقدر است.
تست پلیکان دیگر راهی برای رتبهبندی بهترین هوش مصنوعی نیست؛ بلکه یک آیین (ritual) است. این تست شخصیت یک مدل را به شما نشان میدهد. ممکن است ببینید یک مدل کلاه کوچکی روی سر پرنده میگذارد، در حالی که مدل دیگر اصلاً از کشیدن دوچرخه خودداری میکند، چون پرندهها نمیتوانند سوار آن شوند.
یک مدل حتی برای کشیدن تنها یک پرنده، از ۱۳,۰۰۰ توکن و ۲۵ سنت استفاده کرد.
این نقاشیها تاریخچه هوش مصنوعی را از طریق کد نشان میدهند.
برای مشاهده مجموعه به pelicanzoo.ai سر بزنید.
