Andrew Ng와 DeepLearning.AI는 실험적인 프롬프트를 프로덕션급 AI 시스템으로 전환하는 데 필요한 6가지 핵심 역량을 그룹화한 프레임워크인 'AI 엔지니어링 기술 맵(AI Engineering Skills Map)'을 공개했습니다. 이 맵은 "바이브 코딩(vibe coding)"을 넘어 신뢰할 수 있고 확장 가능한 AI 제품을 제공하고자 하는 엔지니어를 대상으로 합니다.
"바이브 코딩"이 장애물이 되는 이유
많은 기업에서 개발자들은 대규모 언어 모델(LLM)을 마치 마법 지팡이처럼 다룹니다. 프롬프트를 작성하고 몇 개의 출력물을 훑어본 뒤 작업이 끝났다고 생각합니다. 이러한 지름길은 빠른 데모에는 효과적이지만, 실제 사용 환경에서는 무너집니다. LLM은 비결정론적(non-deterministic)입니다. 즉, 동일한 입력값이라도 매번 다른 결과를 낼 수 있습니다. 체계적인 검증이 없다면 실험실에서는 괜찮아 보였던 시스템이 프로덕션 환경에서 고장 나 막대한 비용이 드는 다운타임이나 안전하지 않은 동작을 초래할 수 있습니다.
기술 맵의 6가지 역량
기술 맵은 엔지니어링 프로세스를 6개의 별도 영역으로 나누며, 각 영역에는 고유한 모범 사례와 도구가 있습니다.
- 프롬프트 엔지니어링(Prompt Engineering) – 자유 형식의 텍스트를 넘어 JSON 스키마 등으로 강제되는 구조화된 템플릿으로 나아갑니다. 이는 모호성을 줄이고 후속 파싱(parsing)을 예측 가능하게 만듭니다.
- 검색 증강 생성(Retrieval-Augmented Generation, RAG) – 문서 수집(ingestion), 의미론적 청킹(semantic chunking), 그리고 모델에 관련 컨텍스트를 제공하는 검색 파이프라인 구축 역량이 필요합니다.
- 에이전트 워크플로우(Agentic Workflows) – 모델이 외부 도구를 호출하고, 상태를 관리하며, 자율적으로 의사결정을 내릴 수 있는 루프를 설계하는 것을 포함합니다.
- 파인튜닝(Fine-tuning) – 프롬프트 컨텍스트에만 의존하는 대신 모델의 가중치를 조정해야 할 시점을 결정하는 데 도움을 줍니다. 이는 일관성을 높이고 토큰 사용량을 줄일 수 있는 선택입니다.
- 평가(Evaluation, Evals) – 미리 정의된 기준에 따라 정확도, 편향성, 안전성을 측정하는 자동화된 테스트 스위트를 요구합니다. 다른 코드의 회귀(regression)와 마찬가지로, 테스트 실패 시 빌드가 중단되어야 합니다.
- 운영(Operations) – 지연 시간 예산(latency budgeting), 비용 모니터링, 그리고 데이터 진화에 따른 모델 동작의 점진적 변화인 모델 드리프트(model drift)를 실시간으로 처리하는 데 집중합니다.
LLM을 블랙박스가 아닌 신뢰할 수 없는 API로 취급함으로써, 팀은 전통적인 서비스에 사용하는 것과 동일한 엄격함을 적용할 수 있습니다.
누가 혜택을 보고 누가 뒤처지는가
머신러닝 박사 학위 소지자로만 팀을 구성하는 엔지니어링 리더들은 프로젝트가 정체되는 것을 경험할 수 있습니다. 이 맵은 API 설계, 캐싱 전략, 자동화된 테스트에 능숙한 시스템 엔지니어의 필요성을 강조합니다. 백엔드 엔지니어가 컨텍스트 윈도우를 관리하고, 평가 하네스(evaluation harnesses)를 구축하며, 운영 메트릭을 모니터링할 수 있도록 업스킬링(upskilling)하는 것은 인재 격차를 해소하고 제품 출시를 가속화할 수 있습니다.
