Andrew Ng et DeepLearning.AI ont dévoilé l'AI Engineering Skills Map, un cadre qui regroupe six compétences clés nécessaires pour transformer des prompts expérimentaux en systèmes d'IA de qualité production. La carte s'adresse aux ingénieurs qui souhaitent dépasser le « vibe coding » pour livrer des produits d'IA fiables et évolutifs.

Pourquoi le « vibe coding » est un obstacle

Dans de nombreuses entreprises, les développeurs traitent les grands modèles de langage (LLM) comme une baguette magique : ils écrivent un prompt, jettent un coup d'œil à quelques résultats, et considèrent que le travail est fait. Ce raccourci fonctionne pour des démonstrations rapides, mais s'effondre lors d'une utilisation en conditions réelles. Les LLM sont non déterministes — des entrées identiques peuvent produire des résultats différents à chaque fois. Sans contrôles systématiques, un système qui semblait fonctionner en laboratoire peut tomber en panne en production, entraînant des temps d'arrêt coûteux ou des comportements dangereux.

Les six compétences de la carte

La Skills Map divise le processus d'ingénierie en six domaines distincts, chacun ayant ses propres meilleures pratiques et outils.

  • Prompt Engineering – Passe du texte libre à des modèles structurés, souvent imposés par des schémas JSON. Cela réduit l'ambiguïté et rend l'analyse en aval prévisible.
  • Retrieval-Augmented Generation (RAG) – Nécessite des compétences en ingestion de documents, en découpage sémantique (semantic chunking) et en construction de pipelines de récupération qui fournissent le contexte pertinent au modèle.
  • Agentic Workflows – Implique la conception de boucles où le modèle peut appeler des outils externes, gérer l'état et prendre des décisions de manière autonome.
  • Fine-tuning – Aide les ingénieurs à décider quand ajuster les poids d'un modèle plutôt que de s'appuyer uniquement sur le contexte du prompt, un choix qui peut améliorer la cohérence et réduire la consommation de tokens.
  • Evaluation (Evals) – Nécessite des suites de tests automatisées qui mesurent la précision, les biais et la sécurité par rapport à des critères prédéfinis. Un test échoué doit bloquer la build, tout comme n'importe quelle autre régression de code.
  • Operations – Se concentre sur la budgétisation de la latence, la surveillance des coûts et la gestion de la dérive du modèle (le changement progressif du comportement du modèle à mesure que les données évoluent) en temps réel.

En traitant le LLM comme une API non fiable plutôt que comme une boîte noire, les équipes peuvent appliquer la même rigueur qu'elles utilisent pour les services traditionnels.

Qui en bénéficie et qui est laissé pour compte

Les responsables de l'ingénierie qui ne recrutent que des doctorants en machine learning pourraient voir leurs projets stagner. La carte souligne la nécessité d'ingénieurs systèmes — des personnes maîtrisant la conception d'API, les stratégies de mise en cache et les tests automatisés. La montée en compétences des ingénieurs backend pour gérer les fenêtres de contexte, construire des dispositifs d'évaluation et surveiller les métriques opérationnelles peut combler le manque de talents et accélérer la livraison.