Andrew Ng氏とDeepLearning.AIは、実験的なプロンプトを本番環境レベルのAIシステムへと昇華させるために必要な6つのコア・コンピテンシーをまとめたフレームワーク「AI Engineering Skills Map」を発表しました。このマップは、「バイブ・コーディング(vibe coding)」の域を超え、信頼性が高くスケーラブルなAI製品を提供したいエンジニアを対象としています。

なぜ「バイブ・コーディング」が障害となるのか

多くの企業において、開発者は大規模言語モデル(LLM)をまるで魔法の杖のように扱っています。プロンプトを書き、いくつかの出力をパッと見て、それで完了としてしまうのです。このショートカットは迅速なデモには有効ですが、実際の運用環境では破綻します。LLMは非決定論的であり、同じ入力に対しても毎回異なる結果をもたらす可能性があるからです。体系的なチェックがなければ、ラボ環境では問題なさそうに見えたシステムが、本番環境で壊れ、多大なコストを伴うダウンタイムや安全性の欠如を招く恐れがあります。

マップが示す6つのコンピテンシー

スキルマップは、エンジニアリングのプロセスを6つの明確な領域に分類しており、それぞれに独自のベストプラクティスとツールが存在します。

  • プロンプトエンジニアリング (Prompt Engineering) – 自由形式のテキストから、JSONスキーマなどで構造化されたテンプレートへと進化させます。これにより曖昧さが軽減され、後続のパース(解析)が予測可能になります。
  • 検索拡張生成 (Retrieval-Augmented Generation: RAG) – ドキュメントの取り込み、セマンティック・チャンキング、およびモデルに関連するコンテキストを供給する検索パイプラインの構築に関する能力が求められます。
  • エージェンティック・ワークフロー (Agentic Workflows) – モデルが外部ツールを呼び出し、状態を管理し、自律的に意思決定を行えるようなループの設計を含みます。
  • ファインチューニング (Fine-tuning) – プロンプトのコンテキストだけに頼るのではなく、いつモデルの重みを調整すべきかを判断するのに役立ちます。この選択により、一貫性が向上し、トークン使用量を削減できます。
  • 評価 (Evaluation: Evals) – 事前に定義された基準に基づき、精度、バイアス、安全性を測定する自動テストスイートを必要とします。他のコードの回帰テストと同様に、テストの失敗はビルドを停止させるべきです。
  • オペレーションズ (Operations) – レイテンシの予算管理、コスト監視、およびリアルタイムでのモデルドリフト(データの進化に伴うモデルの挙動の緩やかな変化)への対応に焦点を当てます。

LLMをブラックボックスとしてではなく、信頼できないAPIとして扱うことで、チームは従来のサービスと同じ厳格さを適用できるようになります。

誰が恩恵を受け、誰が取り残されるのか

機械学習の博士号保持者だけでチームを構成しているエンジニアリングリーダーは、プロジェクトが停滞する可能性があります。このマップは、API設計、キャッシング戦略、自動テストに精通したシステムエンジニアの必要性を強調しています。バックエンドエンジニアがコンテキストウィンドウの管理、評価用ハーネスの構築、運用メトリクスの監視といったスキルを習得(アップスキリング)することで、人材不足を解消し、デリバリーを加速させることができます。