펠리컨 벤치마크: AI 진화의 2년

2024년 10월, Simon Willison은 16개의 LLM에 하나의 프롬프트를 주었습니다: "자전거를 타는 펠리컨의 SVG를 생성해줘."

그는 2년 동안 모든 새로운 모델에 동일한 프롬프트를 실행해 왔습니다. 현재 그는 66개의 서로 다른 모델로부터 얻은 103개의 그림을 보유하고 있습니다.

우리는 이 이미지들을 한곳에 모았습니다: pelicanzoo.ai.

이 실험이 AI에 대해 우리에게 가르쳐 주는 것은 다음과 같습니다:

  • SVG는 픽셀이 아니라 코드입니다. LLM은 볼 수 없지만 코드는 작성할 수 있습니다. 좌표와 반지름만을 사용하여 그림을 그려내야 합니다.
  • 이 작업은 어렵습니다. 인간도 자전거를 기억만으로 그리기는 어렵습니다. 펠리컨은 자전거를 타기에 적합한 형태도 아닙니다.
  • 초기 모델들은 우스꽝스러운 방식으로 실패했습니다. 어떤 모델은 삼각형과 원을 그렸고, 어떤 모델은 싱크대나 트랙터처럼 보이는 모양을 그렸습니다.
  • 능력 추적 방식이 변했습니다. 첫해에는 더 나은 펠리컨이 더 뛰어난 코딩 능력을 의미했습니다. 이제 그 상관관계는 사라졌습니다.
  • 작은 모델이 승리할 수도 있습니다. 노트북에서 실행되는 작은 모델이 거대한 플래그십 모델보다 더 나은 펠리컨을 그린 적도 있습니다.

왜 계속해서 "바보 같은" 테스트를 수행할까요?

이는 두 가지 실질적인 목적을 수행합니다:

  • 모델이 작동함을 증명합니다. 펠리컨 그림을 게시하는 것은 단순히 뉴스를 읽는 것이 아니라 실제로 모델을 실행했음을 보여줍니다.
  • 숨겨진 데이터를 드러냅니다. 모델이 얼마나 많은 토큰을 사용하는지, 그리고 단순한 이미지 하나를 생성하는 데 비용이 얼마나 드는지 확인할 수 있습니다.

펠리컨 테스트는 더 이상 최고의 AI를 순위 매기는 방법이 아닙니다. 그것은 하나의 의식입니다. 모델의 개성을 보여줍니다. 어떤 모델은 새에게 작은 모자를 씌우기도 하고, 어떤 모델은 새는 자전거를 탈 수 없다는 이유로 자전거 그리기를 아예 거부하기도 합니다.

어떤 모델은 새 한 마리를 그리는 데만 13,000개의 토큰과 25센트를 사용하기도 했습니다.

이 그림들은 코드를 통해 AI의 역사를 보여줍니다.

컬렉션을 보려면 pelicanzoo.ai를 방문하세요.

출처: https://dev.to/_94be737e156beb4d74df2/two-years-of-pelicans-on-bicycles-103-svgs-66-models-and-what-the-guy-who-invented-the-benchmark-4c7e