Andrew Ng-ഉം DeepLearning.AI-യും ചേർന്ന് 'AI എഞ്ചിനീയറിംഗ് സ്കിൽസ് മാപ്പ്' (AI Engineering Skills Map) പുറത്തിറക്കി. പരീക്ഷണാടിസ്ഥാനത്തിലുള്ള പ്രോംപ്റ്റുകളെ പ്രൊഡക്ഷൻ-ഗ്രേഡ് AI സിസ്റ്റങ്ങളാക്കി മാറ്റുന്നതിന് ആവശ്യമായ ആറ് പ്രധാന നൈപുണ്യങ്ങളെ ഈ ഫ്രെയിംവർക്ക് തരംതിരിക്കുന്നു. "vibe coding"-ൽ നിന്ന് മാറി വിശ്വസനീയവും സ്കെയിലബിൾ ആയതുമായ AI ഉൽപ്പന്നങ്ങൾ വികസിപ്പിക്കാൻ ആഗ്രഹിക്കുന്ന എഞ്ചിനീയർമാരെയാണ് ഈ മാപ്പ് ലക്ഷ്യമിടുന്നത്.
എന്തുകൊണ്ടാണ് “vibe coding” ഒരു തടസ്സമാകുന്നത്
പല സംരംഭങ്ങളിലും, ഡെവലപ്പർമാർ ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (LLMs) ഒരു മാന്ത്രിക വടി പോലെയാണ് കാണുന്നത്: അവർ ഒരു പ്രോംപ്റ്റ് എഴുതുന്നു, കുറച്ച് ഔട്ട്പുട്ടുകൾ നോക്കുന്നു, അത് കഴിഞ്ഞു എന്ന് കരുതുന്നു. ഈ രീതി വേഗത്തിലുള്ള ഡെമോകൾക്ക് അനുയോജ്യമാണെങ്കിലും, യഥാർത്ഥ ലോകത്തെ ഉപയോഗങ്ങളിൽ ഇത് പരാജയപ്പെടും. LLM-കൾ നിശ്ചിതമല്ലാത്തവയാണ് (non-deterministic)—ഒരേ ഇൻപുട്ടുകൾ തന്നെ ഓരോ തവണയും വ്യത്യസ്ത ഫലങ്ങൾ നൽകിയേക്കാം. വ്യവസ്ഥാപിതമായ പരിശോധനകൾ ഇല്ലാതെ, ലാബിൽ ശരിയായി തോന്നുന്ന ഒരു സിസ്റ്റം പ്രൊഡക്ഷനിൽ പരാജയപ്പെടുകയും വലിയ സാമ്പത്തിക നഷ്ടമോ സുരക്ഷിതമല്ലാത്ത പെരുമാറ്റമോ ഉണ്ടാക്കുകയും ചെയ്തേക്കാം.
മാപ്പിലെ ആറ് നൈപുണ്യങ്ങൾ
ഈ സ്കിൽസ് മാപ്പ് എഞ്ചിനീയറിംഗ് പ്രക്രിയയെ ആറ് വ്യത്യസ്ത മേഖലകളായി തിരിക്കുന്നു, അവ ഓരോന്നിനും അതിന്റേതായ മികച്ച രീതികളും (best practices) ടൂളുകളും ഉണ്ട്.
- Prompt Engineering – സ്വതന്ത്രമായ ടെക്സ്റ്റുകളിൽ നിന്ന് മാറി, പലപ്പോഴും JSON സ്കീമകൾ ഉപയോഗിച്ച് നിർമ്മിച്ച ഘടനാപരമായ ടെംപ്ലേറ്റുകളിലേക്ക് ഇത് മാറുന്നു. ഇത് അവ്യക്തത കുറയ്ക്കുകയും ഡൗൺസ്ട്രീം പാഴ്സിംഗ് (downstream parsing) പ്രവചനാത്മകമാക്കുകയും ചെയ്യുന്നു.
- Retrieval-Augmented Generation (RAG) – ഡോക്യുമെന്റ് ഇൻജഷൻ (document ingestion), സെമാന്റിക് ചങ്കിംഗ് (semantic chunking), മോഡലിന് ആവശ്യമായ കോൺടെക്സ്റ്റ് നൽകുന്ന റിട്രീവൽ പൈപ്പ്ലൈനുകൾ നിർമ്മിക്കൽ എന്നിവയിൽ വൈദഗ്ധ്യം ആവശ്യമാണ്.
- Agentic Workflows – മോഡലിന് ബാഹ്യ ടൂളുകൾ ഉപയോഗിക്കാനും, സ്റ്റേറ്റ് (state) കൈകാര്യം ചെയ്യാനും, സ്വയം തീരുമാനങ്ങൾ എടുക്കാനും കഴിയുന്ന ലൂപ്പുകൾ രൂപകൽപ്പന ചെയ്യുന്നത് ഇതിൽ ഉൾപ്പെടുന്നു.
- Fine-tuning – പ്രോംപ്റ്റ് കോൺടെക്സ്റ്റിനെ മാത്രം ആശ്രയിക്കുന്നതിന് പകരം, എപ്പോഴാണ് ഒരു മോഡലിന്റെ വെയ്റ്റുകൾ (weights) ക്രമീകരിക്കേണ്ടതെന്ന് തീരുമാനിക്കാൻ ഇത് എഞ്ചിനീയർമാരെ സഹായിക്കുന്നു. ഇത് കൃത്യത വർദ്ധിപ്പിക്കാനും ടോക്കൺ ഉപയോഗം കുറയ്ക്കാനും സഹായിക്കും.
- Evaluation (Evals) – മുൻകൂട്ടി നിശ്ചയിച്ച മാനദണ്ഡങ്ങൾക്കനുസരിച്ച് കൃത്യത, പക്ഷപാതം (bias), സുരക്ഷ എന്നിവ അളക്കുന്ന ഓട്ടോമേറ്റഡ് ടെസ്റ്റ് സ്യൂട്ടുകൾ ഇതിന് ആവശ്യമാണ്. മറ്റേതൊരു കോഡ് റഗ്രഷൻ പോലെ തന്നെ, പരാജയപ്പെട്ട ഒരു ടെസ്റ്റ് ബിൽഡ് തടയുകയും വേണം.
- Operations – ലേറ്റൻസി ബഡ്ജറ്റിംഗ് (latency budgeting), ചിലവ് നിരീക്ഷണം (cost monitoring), മോഡൽ ഡ്രിഫ്റ്റ് (model drift - ഡാറ്റ മാറുന്നതിനനുസരിച്ച് മോഡലിന്റെ പെരുമാറ്റത്തിൽ ഉണ്ടാകുന്ന ക്രമാനുഗതമായ മാറ്റം) എന്നിവ തത്സമയം കൈകാര്യം ചെയ്യുന്നതിൽ ഇത് ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു.
LLM-നെ ഒരു 'ബ്ലാക്ക് ബോക്സ്' ആയി കാണുന്നതിന് പകരം വിശ്വസിക്കാൻ കൊള്ളാത്ത ഒരു API ആയി പരിഗണിക്കുന്നതിലൂടെ, പരമ്പരാഗത സേവനങ്ങൾക്ക് ഉപയോഗിക്കുന്ന അതേ കൃത്യത ടീമുകൾക്ക് പ്രയോഗിക്കാൻ കഴിയും.
ആർക്കൊക്കെ ഗുണമുണ്ടാകും, ആരെല്ലാം പിന്നിലാകും
മെഷീൻ ലേണിംഗ് പിഎച്ച്ഡി (machine-learning PhDs) ഉള്ളവരെ മാത്രം നിയമിക്കുന്ന എഞ്ചിനീയറിംഗ് ലീഡർമാർക്ക് പ്രോജക്റ്റുകൾ തടസ്സപ്പെടുന്നത് കാണേണ്ടി വന്നേക്കാം. API ഡിസൈൻ, കാഷിംഗ് സ്ട്രാറ്റജികൾ (caching strategies), ഓട്ടോമേറ്റഡ് ടെസ്റ്റിംഗ് എന്നിവയിൽ പ്രാവീണ്യമുള്ള സിസ്റ്റംസ് എഞ്ചിനീയർമാരുടെ ആവശ്യകത ഈ മാപ്പ് ഊന്നിപ്പറയുന്നു. കോൺടെക്സ്റ്റ് വിൻഡോകൾ (context windows) കൈകാര്യം ചെയ്യാനും, ഇവാലുവേഷൻ ഹാർനെസ്സുകൾ (evaluation harnesses) നിർമ്മിക്കാനും, ഓപ്പറേഷണൽ മെട്രിക്സ് നിരീക്ഷിക്കാനും ബാക്കെൻഡ് എഞ്ചിനീയർമാരെ നൈപുണ്യവികസനം (upskilling) നൽകുന്നത് കഴിവുകളുടെ കുറവ് പരിഹരിക്കാനും വിതരണം വേഗത്തിലാക്കാനും സഹായിക്കും.
