ഉപഭോക്താക്കളുമായി സംവദിക്കുന്ന AI അവതാറുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർ നേരിടുന്ന ഏറ്റവും വലിയ തടസ്സം: ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) ഹാലൂസിനേഷൻ (hallucination) നടത്തുന്നത് എങ്ങനെ തടയുക എന്നതാണ്. സ്വാഭാവികമായി തോന്നിക്കുന്ന ഒരു ശബ്ദം, നിസ്സാരമായ ഒരു തെറ്റിനെപ്പോലും വിശ്വസനീയമായ ഒരു കള്ളമാക്കി മാറ്റിയേക്കാം; ഇത് ബ്രാൻഡ് വിശ്വാസ്യതയെ തകർക്കുകയും കമ്പനികളെ നിയമപരമായ റിസ്കുകളിലേക്ക് എത്തിക്കുകയും ചെയ്യുന്നു.

എന്തുകൊണ്ടാണ് ഹാലൂസിനേഷനുകൾ പ്രധാനമാകുന്നത്

ഒരു സാധാരണ LLM കോൾ, അടിസ്ഥാനപരമായ ഒരു സിസ്റ്റം പ്രോംപ്റ്റ് നൽകിയാൽ പോലും, പലപ്പോഴും വിലനിർണ്ണയം, പോളിസി അല്ലെങ്കിൽ ഉൽപ്പന്ന സവിശേഷതകൾ എന്നിവയെക്കുറിച്ച് തെറ്റായ വിവരങ്ങൾ നിർമ്മിച്ചെടുക്കാറുണ്ട്. മറുപടി നൽകുന്നത് സ്വാഭാവികമായി തോന്നുന്ന ഒരു അവതാർ ആണെങ്കിൽ, ഉപഭോക്താക്കൾ അത് ചോദ്യം ചെയ്യാൻ സാധ്യത കുറവാണ്. പ്രശ്നം വോയ്‌സ് സിന്തസിസിലോ വിഷ്വൽ റെൻഡറിംഗിലോ അല്ല; മറിച്ച്, വിവരങ്ങളുടെ കുറവ് ആത്മവിശ്വാസത്തോടെ തോന്നിക്കുന്ന അർത്ഥശൂന്യമായ കാര്യങ്ങൾ പറഞ്ഞ് നികത്താനുള്ള മോഡലിന്റെ ശീലമാണ്. ബാങ്കുകൾ, ഇൻഷുറൻസ് കമ്പനികൾ, ടെലികോം, കൃത്യമായ വിവരങ്ങളെ ആശ്രയിക്കുന്ന മറ്റേതൊരു ബിസിനസ്സിനും, ഒരു തെറ്റായ മറുപടി പോലും പരാതികൾക്കും റീഫണ്ടുകൾക്കും നിയമനടപടികൾക്കും കാരണമായേക്കാം.

മൂന്ന് ഘട്ടങ്ങളുള്ള സുരക്ഷാ സംവിധാനം (guardrail)

1. കർശനമായ റിട്രീവൽ-ഓഗ്മെന്റഡ് ജനറേഷൻ (RAG)

RAG സാങ്കേതികവിദ്യ LLM-നെ കൃത്യമായി തയ്യാറാക്കിയ ഒരു നോളജ് ബേസുമായി (knowledge base) ബന്ധിപ്പിക്കുകയും, മോഡൽ മറുപടി നൽകുന്നതിന് മുമ്പ് പ്രസക്തമായ രേഖകൾ ശേഖരിക്കുകയും ചെയ്യുന്നു. ഇവിടെ പ്രധാനമായും ചെയ്യേണ്ടത് വ്യക്തമായ 'ഫാൾബാക്ക്' (fallback) നിർദ്ദേശങ്ങൾ നൽകുക എന്നതാണ്: ഊഹിച്ചു പറയുന്നതിന് പകരം "എനിക്കറിയില്ല" എന്ന് മറുപടി നൽകാൻ മോഡലിനോട് നിർദ്ദേശിക്കുക. മോഡലിന്റെ "സഹായമനസ്കത" എന്ന ശീലത്തെ മാത്രം ആശ്രയിക്കുന്ന പ്രോംപ്റ്റുകൾ പരാജയപ്പെടാൻ സാധ്യതയുണ്ട്, കാരണം ശേഖരിച്ച വിവരങ്ങൾ പ്രസക്തമല്ലെങ്കിൽ പോലും LLM മറുപടി നൽകാൻ ശ്രമിച്ചുകൊണ്ടേയിരിക്കും.

2. കോൺഫിഡൻസ് ത്രെഷോൾഡിംഗ് (Confidence thresholding)

ഉപഭോക്താവിന്റെ ചോദ്യം LLM കാണുന്നതിന് മുമ്പ്, ശേഖരിച്ച വിവരങ്ങളുടെ പ്രസക്തി പരിശോധിക്കുക. പൊരുത്തം മുൻകൂട്ടി നിശ്ചയിച്ച കോൺഫിഡൻസ് ലെവലിനേക്കാൾ താഴെയാണെങ്കിൽ, മറുപടി നൽകുന്ന ഘട്ടം ഒഴിവാക്കുക. പകരം ഉപഭോക്താവിനെ ഒരു മനുഷ്യ ഏജന്റിനെയോ അല്ലെങ്കിൽ ലീഡ്-ക്യാപ്ചർ ഫോമിനെയോ അടുത്തേക്ക് എത്തിക്കുക. ഇത് തെറ്റായ വിവരങ്ങൾ നൽകുന്നത് തടയുകയും അനാവശ്യമായ LLM കോളുകൾ ഒഴിവാക്കി കമ്പ്യൂട്ട് ചിലവ് കുറയ്ക്കുകയും ചെയ്യുന്നു.

3. സുഗമമായ കൈമാറ്റം (Graceful handoffs)

വിജയകരമായ സംഭാഷണങ്ങൾ പോലെ തന്നെ പരാജയപ്പെടുന്ന ഘട്ടങ്ങളും കൃത്യമായി രൂപകൽപ്പന ചെയ്യുക. കുറഞ്ഞ കോൺഫിഡൻസ് ഉള്ള മറുപടികൾ തിരിച്ചറിയുകയും അവ രേഖപ്പെടുത്തുകയും (log) ചെയ്യുക; ഈ വിവരങ്ങൾ ഉപയോഗിച്ച് നോളജ് ബേസിലെ പോരായ്മകൾ കണ്ടെത്താം. തുടർന്ന് ഒരു മനുഷ്യ ഓപ്പറേറ്ററിലേക്ക് സംഭാഷണം കൈമാറുന്നതിനുള്ള വ്യക്തമായ മാർഗ്ഗം ഒരുക്കുക. AI-ക്ക് മറുപടി നൽകാൻ കഴിയാത്ത സാഹചര്യത്തിലും കൃത്യമായ രീതിയിൽ കൈമാറ്റം നടക്കുന്നത് ഉപഭോക്താവിന്റെ അനുഭവം മെച്ചപ്പെടുത്തുന്നു.

അവതാർ പ്ലാറ്റ്‌ഫോമുകൾ പരിശോധിക്കുമ്പോൾ ചോദിക്കേണ്ട കാര്യങ്ങൾ

നിങ്ങൾ HeyGen അല്ലെങ്കിൽ D-ID പോലുള്ള സേവനങ്ങളെ താരതമ്യം ചെയ്യുകയാണെങ്കിൽ, അവയുടെ ഹാലൂസിനേഷൻ സുരക്ഷാ സംവിധാനങ്ങളെക്കുറിച്ച് ചോദിച്ചറിയുക:

  • സിസ്റ്റം മറുപടികളെ ഒരു പ്രത്യേക നോളജ് ബേസിലേക്ക് പരിമിതപ്പെടുത്തുന്നുണ്ടോ?
  • കോൺഫിഡൻസ് കുറയുമ്പോൾ അത് എങ്ങനെ പ്രവർത്തിക്കുന്നു—നിശബ്ദമായിരിക്കുകയാണോ, ഹാലൂസിനേഷൻ നടത്തുകയാണോ, അതോ കൈമാറുകയാണോ?
  • കുറഞ്ഞ കോൺഫിഡൻസുള്ള സംഭാഷണങ്ങൾ രേഖപ്പെടുത്താനും അവ മെച്ചപ്പെടുത്താനും എന്തൊക്കെ സംവിധാനങ്ങളുണ്ട്?

വോയ്‌സ് ക്വാളിറ്റി ഇനി ഒരു വ്യത്യാസമുണ്ടാക്കുന്ന ഘടകമല്ല; അവതാറിനെ സത്യസന്ധമായി നിലനിർത്താനുള്ള കഴിവിനാണ് ഇപ്പോൾ പ്രാധാന്യം.

ചുരുക്കത്തിൽ

മികച്ച ശബ്ദമുണ്ടായിട്ടും വസ്തുതകൾ തെറ്റായി പറയുന്ന ഒരു AI അവതാർ വലിയൊരു ബാധ്യതയാണ്. മോഡലിനെ പരിശോധിച്ചുറപ്പുവരുത്തിയ ഒരു നോളജ് ബേസുമായി ബന്ധിപ്പിച്ചും, കോൺഫിഡൻസ് കുറയുമ്പോൾ മറുപടി നൽകാൻ വിസമ്മതിച്ചും, പരാജയപ്പെടുന്ന ഘട്ടങ്ങളിൽ മനുഷ്യ ഏജന്റുമാരുടെ സഹായം തേടിയും ഡെവലപ്പർമാർക്ക് ഒരു വിശ്വസനീയമായ ശബ്ദം സൃഷ്ടിക്കാൻ സാധിക്കും. ഒരു സിസ്റ്റം എത്ര സ്വാഭാവികമായി സംസാരിക്കുന്നു എന്നതിലല്ല, മറിച്ച് ഹാലൂസിനേഷനുകളെ എത്രത്തോളം നന്നായി തടയുന്നു എന്നതിലാണ് യഥാർത്ഥ മത്സരശേഷി ഇരിക്കുന്നത്.