Andrew Ng و DeepLearning.AI از «نقشه مهارت‌های مهندسی هوش مصنوعی» رونمایی کردند؛ چارچوبی که شش شایستگی اصلی مورد نیاز برای تبدیل پرامپت‌های آزمایشی به سیستم‌های هوش مصنوعی در سطح تولید (production-grade) را گروه‌بندی می‌کند. این نقشه، مهندسانی را هدف قرار می‌دهد که می‌خواهند از «کدنویسی بر اساس حس و حال» (vibe coding) فراتر رفته و محصولات هوش مصنوعی قابل اعتماد و مقیاس‌پذیری ارائه دهند.

چرا «کدنویسی بر اساس حس و حال» یک مانع است

در بسیاری از سازمان‌ها، توسعه‌دهندگان با مدل‌های زبانی بزرگ (LLMs) مانند یک عصای جادویی رفتار می‌کنند: آن‌ها یک پرامپت می‌نویسند، نگاهی گذرا به چند خروجی می‌اندازند و کار را تمام شده می‌پندارند. این میان‌بر برای دموهای سریع جواب می‌دهد، اما در استفاده‌های دنیای واقعی از هم می‌پاشد. مدل‌های LLM غیرقطعی (non-deterministic) هستند؛ یعنی ورودی‌های کاملاً یکسان می‌توانند هر بار نتایج متفاوتی تولید کنند. بدون بررسی‌های سیستماتیک، سیستمی که در محیط آزمایشگاهی خوب به نظر می‌رسید، می‌تواند در مرحله تولید دچار مشکل شود و باعث از کار افتادگی‌های پرهزینه یا رفتارهای ناایمن گردد.

شش شایستگیِ این نقشه

این نقشه مهارت‌ها، فرآیند مهندسی را به شش حوزه متمایز تقسیم می‌کند که هر کدام دارای بهترین روش‌ها و ابزارهای خاص خود هستند.

  • مهندسی پرامپت (Prompt Engineering) – فراتر رفتن از متن‌های آزاد و استفاده از قالب‌های ساختاریافته که اغلب با طرحواره‌های JSON اعمال می‌شوند. این کار ابهام را کاهش داده و تجزیه (parsing) داده‌ها در مراحل بعدی را قابل پیش‌بینی می‌کند.
  • تولید تقویت‌شده با بازیابی (RAG) – نیازمند مهارت در دریافت اسناد (document ingestion)، تکه‌بندی معنایی (semantic chunking) و ساخت خط لوله‌های بازیابی (retrieval pipelines) است که بافت (context) مرتبط را به مدل تزریق می‌کنند.
  • جریان‌های کاری عامل‌محور (Agentic Workflows) – شامل طراحی حلقه‌هایی است که در آن مدل می‌تواند ابزارهای خارجی را فراخوانی کند، وضعیت (state) را مدیریت کند و به‌طور خودکار تصمیم‌گیری نماید.
  • تنظیم دقیق (Fine-tuning) – به مهندسان کمک می‌کند تصمیم بگیرند چه زمانی به جای تکیه صرف بر بافت پرامپت، وزن‌های مدل را تنظیم کنند؛ انتخابی که می‌تواند ثبات را بهبود بخشیده و مصرف توکن را کاهش دهد.
  • ارزیابی (Evals) – مستلزم مجموعه‌ تست‌های خودکاری است که دقت، سوگیری و ایمنی را بر اساس معیارهای از پیش تعیین‌شده اندازه‌گیری می‌کنند. یک تست ناموفق باید فرآیند ساخت (build) را متوقف کند، درست مانند هر نوع پس‌رفت کد (code regression) دیگر.
  • عملیات (Operations) – بر بودجه‌بندی تأخیر (latency budgeting)، نظارت بر هزینه و مدیریت رانش مدل (model drift) – یعنی تغییر تدریجی رفتار مدل با تکامل داده‌ها – در لحظه تمرکز دارد.

با برخورد با LLM به عنوان یک API غیرقابل اعتماد (به جای یک جعبه سیاه)، تیم‌ها می‌توانند همان دقت و سخت‌گیری‌ای را که برای سرویس‌های سنتی به کار می‌برند، اعمال کنند.

چه کسانی سود می‌برند و چه کسانی عقب می‌مانند

رهبران مهندسی که تیم‌های خود را تنها با متخصصان دکتری یادگیری ماشین پر می‌کنند، ممکن است با متوقف شدن پروژه‌ها مواجه شوند. این نقشه بر نیاز به مهندسان سیستم تأکید دارد؛ افرادی که در طراحی API، استراتژی‌های کشینگ (caching) و تست خودکار مهارت دارند. ارتقای مهارت‌های مهندسان بک‌اند (backend engineers) برای مدیریت پنجره‌های بافت (context windows)، ساخت بسترهای ارزیابی (evaluation harnesses) و نظارت بر معیارهای عملیاتی، می‌تواند شکاف استعدادها را پر کرده و سرعت تحویل پروژه‌ها را افزایش دهد.