Andrew Ng và DeepLearning.AI vừa công bố AI Engineering Skills Map, một khung tham chiếu nhóm sáu năng lực cốt lõi cần thiết để chuyển đổi các câu lệnh (prompt) thử nghiệm thành các hệ thống AI cấp độ sản xuất (production-grade). Bản đồ này hướng tới các kỹ sư muốn vượt xa khỏi lối "vibe coding" để cung cấp các sản phẩm AI đáng tin cậy và có khả năng mở rộng.

Tại sao “vibe coding” là một rào cản

Trong nhiều doanh nghiệp, các nhà phát triển coi các mô hình ngôn ngữ lớn (LLM) như một cây gậy phép: họ viết một câu lệnh, liếc qua một vài kết quả đầu ra và coi như xong việc. Cách làm tắt này có hiệu quả cho các bản demo nhanh, nhưng sẽ sụp đổ khi đưa vào sử dụng thực tế. LLM có tính phi định hướng (non-deterministic)—các đầu vào giống hệt nhau có thể tạo ra các kết quả khác nhau mỗi lần chạy. Nếu không có các bước kiểm tra có hệ thống, một hệ thống có vẻ ổn trong phòng thí nghiệm có thể bị lỗi khi triển khai thực tế, gây ra thời gian ngừng hoạt động (downtime) tốn kém hoặc các hành vi không an toàn.

Sáu năng lực của bản đồ

Bản đồ Kỹ năng chia quy trình kỹ thuật thành sáu lĩnh vực riêng biệt, mỗi lĩnh vực đều có các phương pháp hay nhất và công cụ riêng.

  • Prompt Engineering – Vượt qua việc viết văn bản tự do để chuyển sang các mẫu (template) có cấu trúc, thường được áp dụng bằng các JSON schema. Điều này giúp giảm sự mơ hồ và giúp việc phân tích dữ liệu ở các bước sau trở nên dễ dự đoán hơn.
  • Retrieval-Augmented Generation (RAG) – Đòi hỏi năng lực về nạp tài liệu (document ingestion), phân đoạn ngữ nghĩa (semantic chunking) và xây dựng các đường ống truy xuất (retrieval pipelines) để cung cấp ngữ cảnh liên quan cho mô hình.
  • Agentic Workflows – Bao gồm việc thiết kế các vòng lặp mà tại đó mô hình có thể gọi các công cụ bên ngoài, quản lý trạng thái và đưa ra quyết định một cách tự chủ.
  • Fine-tuning – Giúp các kỹ sư quyết định khi nào nên điều chỉnh trọng số của mô hình thay vì chỉ dựa vào ngữ cảnh của prompt, một lựa chọn có thể cải thiện tính nhất quán và giảm mức tiêu thụ token.
  • Evaluation (Evals) – Đòi hỏi các bộ kiểm thử tự động để đo lường độ chính xác, tính thiên kiến và độ an toàn dựa trên các tiêu chí đã định trước. Một bài kiểm tra thất bại phải làm gián đoạn quá trình build, giống như bất kỳ lỗi hồi quy (regression) mã nguồn nào khác.
  • Operations – Tập trung vào việc lập ngân sách độ trễ (latency budgeting), giám sát chi phí và xử lý sự trôi dạt mô hình (model drift - sự thay đổi dần dần trong hành vi của mô hình khi dữ liệu tiến hóa) trong thời gian thực.

Bằng cách coi LLM như một API không đáng tin cậy thay vì một "hộp đen", các nhóm có thể áp dụng sự nghiêm ngặt tương tự như cách họ sử dụng cho các dịch vụ truyền thống.

Ai được hưởng lợi và ai bị bỏ lại phía sau

Các nhà lãnh đạo kỹ thuật nếu chỉ tuyển dụng các tiến sĩ về học máy (machine-learning PhDs) có thể thấy các dự án bị đình trệ. Bản đồ này nhấn mạnh nhu cầu về các kỹ sư hệ thống—những người thành thạo về thiết kế API, chiến lược bộ nhớ đệm (caching) và kiểm thử tự động. Việc nâng cao kỹ năng cho các kỹ sư backend để quản lý cửa sổ ngữ cảnh (context windows), xây dựng khung đánh giá (evaluation harnesses) và giám sát các chỉ số vận hành (operational metrics) có thể lấp đầy khoảng trống tài năng và đẩy nhanh tốc độ bàn giao sản phẩm.