Andrew Ng و DeepLearning.AI از «نقشه مهارتهای مهندسی هوش مصنوعی» رونمایی کردند؛ چارچوبی که شش شایستگی اصلی مورد نیاز برای تبدیل پرامپتهای آزمایشی به سیستمهای هوش مصنوعی در سطح تولید (production-grade) را گروهبندی میکند. این نقشه، مهندسانی را هدف قرار میدهد که میخواهند از «کدنویسی بر اساس حس و حال» (vibe coding) فراتر رفته و محصولات هوش مصنوعی قابل اعتماد و مقیاسپذیری ارائه دهند.
چرا «کدنویسی بر اساس حس و حال» یک مانع است
در بسیاری از سازمانها، توسعهدهندگان با مدلهای زبانی بزرگ (LLMs) مانند یک عصای جادویی رفتار میکنند: آنها یک پرامپت مینویسند، نگاهی گذرا به چند خروجی میاندازند و کار را تمام شده میپندارند. این میانبر برای دموهای سریع جواب میدهد، اما در استفادههای دنیای واقعی از هم میپاشد. مدلهای LLM غیرقطعی (non-deterministic) هستند؛ یعنی ورودیهای کاملاً یکسان میتوانند هر بار نتایج متفاوتی تولید کنند. بدون بررسیهای سیستماتیک، سیستمی که در محیط آزمایشگاهی خوب به نظر میرسید، میتواند در مرحله تولید دچار مشکل شود و باعث از کار افتادگیهای پرهزینه یا رفتارهای ناایمن گردد.
شش شایستگیِ این نقشه
این نقشه مهارتها، فرآیند مهندسی را به شش حوزه متمایز تقسیم میکند که هر کدام دارای بهترین روشها و ابزارهای خاص خود هستند.
- مهندسی پرامپت (Prompt Engineering) – فراتر رفتن از متنهای آزاد و استفاده از قالبهای ساختاریافته که اغلب با طرحوارههای JSON اعمال میشوند. این کار ابهام را کاهش داده و تجزیه (parsing) دادهها در مراحل بعدی را قابل پیشبینی میکند.
- تولید تقویتشده با بازیابی (RAG) – نیازمند مهارت در دریافت اسناد (document ingestion)، تکهبندی معنایی (semantic chunking) و ساخت خط لولههای بازیابی (retrieval pipelines) است که بافت (context) مرتبط را به مدل تزریق میکنند.
- جریانهای کاری عاملمحور (Agentic Workflows) – شامل طراحی حلقههایی است که در آن مدل میتواند ابزارهای خارجی را فراخوانی کند، وضعیت (state) را مدیریت کند و بهطور خودکار تصمیمگیری نماید.
- تنظیم دقیق (Fine-tuning) – به مهندسان کمک میکند تصمیم بگیرند چه زمانی به جای تکیه صرف بر بافت پرامپت، وزنهای مدل را تنظیم کنند؛ انتخابی که میتواند ثبات را بهبود بخشیده و مصرف توکن را کاهش دهد.
- ارزیابی (Evals) – مستلزم مجموعه تستهای خودکاری است که دقت، سوگیری و ایمنی را بر اساس معیارهای از پیش تعیینشده اندازهگیری میکنند. یک تست ناموفق باید فرآیند ساخت (build) را متوقف کند، درست مانند هر نوع پسرفت کد (code regression) دیگر.
- عملیات (Operations) – بر بودجهبندی تأخیر (latency budgeting)، نظارت بر هزینه و مدیریت رانش مدل (model drift) – یعنی تغییر تدریجی رفتار مدل با تکامل دادهها – در لحظه تمرکز دارد.
با برخورد با LLM به عنوان یک API غیرقابل اعتماد (به جای یک جعبه سیاه)، تیمها میتوانند همان دقت و سختگیریای را که برای سرویسهای سنتی به کار میبرند، اعمال کنند.
چه کسانی سود میبرند و چه کسانی عقب میمانند
رهبران مهندسی که تیمهای خود را تنها با متخصصان دکتری یادگیری ماشین پر میکنند، ممکن است با متوقف شدن پروژهها مواجه شوند. این نقشه بر نیاز به مهندسان سیستم تأکید دارد؛ افرادی که در طراحی API، استراتژیهای کشینگ (caching) و تست خودکار مهارت دارند. ارتقای مهارتهای مهندسان بکاند (backend engineers) برای مدیریت پنجرههای بافت (context windows)، ساخت بسترهای ارزیابی (evaluation harnesses) و نظارت بر معیارهای عملیاتی، میتواند شکاف استعدادها را پر کرده و سرعت تحویل پروژهها را افزایش دهد.
