ਗਾਹਕਾਂ ਦੇ ਸਾਹਮਣੇ ਆਉਣ ਵਾਲੇ AI avatars ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇੱਕ ਅਜਿਹੀ ਰੁਕਾਵਟ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ ਜੋ ਸਭ ਕੁਝ ਬਦਲ ਸਕਦੀ ਹੈ: large language models (LLMs) ਨੂੰ ਹਲੂਸੀਨੇਸ਼ਨ (hallucinating) ਕਰਨ ਤੋਂ ਰੋਕਣਾ। ਇੱਕ ਰਵਾਨਗੀ ਵਾਲੀ ਆਵਾਜ਼ ਇੱਕ ਨਿਰਦੋਸ਼ ਗਲਤੀ ਨੂੰ ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਝੂਠ ਵਿੱਚ ਬਦਲ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਬ੍ਰਾਂਡ ਦੇ ਭਰੋਸੇ ਨੂੰ ਖ਼ਤਰਾ ਪੈਦਾ ਹੁੰਦਾ ਹੈ ਅਤੇ ਕੰਪਨੀਆਂ ਨੂੰ ਰੈਗੂਲੇਟਰੀ ਜੋਖਮਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ।

ਹਲੂਸੀਨੇਸ਼ਨ (hallucinations) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹਨ

ਇੱਕ ਸਧਾਰਨ LLM ਕਾਲ, ਇੱਥੋਂ ਤੱਕ ਕਿ ਇੱਕ ਬੇਸਿਕ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਦੇ ਨਾਲ ਵੀ, ਅਕਸਰ ਕੀਮਤਾਂ, ਨੀਤੀਆਂ ਜਾਂ ਉਤਪਾਦ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਬਾਰੇ ਗਲਤ ਜਾਣਕਾਰੀ (fabricates) ਦਿੰਦਾ ਹੈ। ਜਦੋਂ ਜਵਾਬ ਇੱਕ ਕੁਦਰਤੀ ਸੁਣਾਈ ਦੇਣ ਵਾਲੇ avatar ਦੁਆਰਾ ਬੋਲਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਪਭੋਗਤਾਵਾਂ ਦੁਆਰਾ ਇਸ 'ਤੇ ਸ਼ੱਕ ਕਰਨ ਦੀ ਸੰਭਾਵਨਾ ਘੱਟ ਹੁੰਦੀ ਹੈ। ਸਮੱਸਿਆ voice synthesis ਜਾਂ visual rendering ਦੀ ਨਹੀਂ ਹੈ; ਇਹ ਮਾਡਲ ਦੀ ਵਿਸ਼ਵਾਸਯੋਗ ਲੱਗਣ ਵਾਲੇ ਬੇਤੁਕੇ ਜਵਾਬਾਂ ਨਾਲ ਖਾਲੀ ਥਾਵਾਂ ਨੂੰ ਭਰਨ ਦੀ ਆਦਤ ਹੈ। ਬੈਂਕਾਂ, ਬੀਮਾ ਕੰਪਨੀਆਂ, ਟੈਲੀਕਾਮ ਅਤੇ ਕਿਸੇ ਵੀ ਅਜਿਹੇ ਕਾਰੋਬਾਰ ਲਈ ਜੋ ਸਹੀ ਜਾਣਕਾਰੀ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ, ਇੱਕ ਗਲਤ ਜਵਾਬ ਸ਼ਿਕਾਇਤਾਂ, ਰਿਫੰਡ ਜਾਂ ਕਾਨੂੰਨੀ ਕਾਰਵਾਈ ਦਾ ਕਾਰਨ ਬਣ ਸਕਦਾ ਹੈ।

ਤਿੰਨ-ਪੜਾਵੀ ਗਾਰਡਰੇਲ (guardrail)

1. ਸਖ਼ਤ Retrieval-Augmented Generation (RAG)

RAG, LLM ਨੂੰ ਇੱਕ ਚੁਣਵੇਂ ਗਿਆਨ ਦੇ ਅਧਾਰ (knowledge base) ਨਾਲ ਜੋੜਦਾ ਹੈ ਅਤੇ ਮਾਡਲ ਦੁਆਰਾ ਜਵਾਬ ਤਿਆਰ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਸਬੰਧਤ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਕੱਢਦਾ ਹੈ। ਮੁੱਖ ਗੱਲ ਸਪੱਸ਼ਟ fallback ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਲਾਗੂ ਕਰਨਾ ਹੈ: ਮਾਡਲ ਨੂੰ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਬਜਾਏ "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਜਵਾਬ ਦੇਣ ਲਈ ਕਹੋ। ਅਜਿਹੇ ਅਸਪਸ਼ਟ ਪ੍ਰੋਂਪਟ ਜੋ ਮਾਡਲ ਦੀ "ਮਦਦਗਾਰ" ਹੋਣ ਦੀ ਆਦਤ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ, ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ ਕਿਉਂਕਿ LLM ਉਦੋਂ ਵੀ ਜਵਾਬ ਦੇਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੇਗਾ ਜਦੋਂ ਪ੍ਰਾਪਤ ਕੀਤਾ ਗਿਆ ਡੇਟਾ ਅਪ੍ਰਸੰਗਿਕ ਹੋਵੇਗਾ।

2. ਕਨਫੀਡੈਂਸ ਥ੍ਰੈਸ਼ਹੋਲਡਿੰਗ (Confidence thresholding)

LLM ਦੁਆਰਾ ਯੂਜ਼ਰ ਦੇ ਸਵਾਲ ਨੂੰ ਦੇਖਣ ਤੋਂ ਪਹਿਲਾਂ, ਪ੍ਰਾਪਤ ਕੀਤੇ ਗਏ ਟੁਕੜਿਆਂ (snippets) ਦੀ ਪ੍ਰਸੰਗਿਕਤਾ ਨੂੰ ਸਕੋਰ ਕਰੋ। ਜੇਕਰ ਮੇਲ ਇੱਕ ਨਿਰਧਾਰਤ ਕਨਫੀਡੈਂਸ ਪੱਧਰ ਤੋਂ ਹੇਠਾਂ ਡਿੱਗ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਜਨਰੇਸ਼ਨ ਸਟੈਪ ਨੂੰ ਰੋਕ ਦਿਓ। ਯੂਜ਼ਰ ਨੂੰ ਕਿਸੇ ਮਨੁੱਖੀ ਏਜੰਟ ਜਾਂ ਲੀਡ-ਕੈਪਚਰ ਫਾਰਮ ਵੱਲ ਭੇਜ ਦਿਓ। ਇਹ ਗਲਤ ਜਾਣਕਾਰੀ ਨੂੰ ਰੋਕਦਾ ਹੈ ਅਤੇ ਬੇਲੋੜੀਆਂ LLM ਕਾਲਾਂ ਤੋਂ ਬਚ ਕੇ ਕੰਪਿਊਟਿੰਗ ਲਾਗਤਾਂ ਨੂੰ ਬਚਾਉਂਦਾ ਹੈ।

3. ਗ੍ਰੇਸਫੁੱਲ ਹੈਂਡਆਫ (Graceful handoffs)

ਫੇਲ੍ਹ ਹੋਣ ਵਾਲੇ ਰਸਤੇ (failure path) ਨੂੰ ਉਨੀ ਹੀ ਸਫਾਈ ਨਾਲ ਡਿਜ਼ਾਈਨ ਕਰੋ ਜਿੰਨੀ ਸਫਲਤਾ ਵਾਲੇ ਰਸਤੇ ਨੂੰ। ਘੱਟ-ਕਨਫੀਡੈਂਸ ਵਾਲੇ ਮੋੜਾਂ ਦਾ ਪਤਾ ਲਗਾਓ, ਉਹਨਾਂ ਨੂੰ ਲੌਗ ਕਰੋ, ਅਤੇ ਗਿਆਨ ਦੇ ਅਧਾਰ (knowledge base) ਵਿੱਚ ਖਾਮੀਆਂ ਲੱਭਣ ਲਈ ਉਹਨਾਂ ਲੌਗਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ। ਫਿਰ ਇੱਕ ਮਨੁੱਖੀ ਓਪਰੇਟਰ ਲਈ ਇੱਕ ਸਪੱਸ਼ਟ ਐਸਕੇਲੇਸ਼ਨ ਰੂਟ ਬਣਾਓ। ਇੱਕ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸੰਭਾਲਿਆ ਗਿਆ ਹੈਂਡਆਫ ਉਪਭੋਗਤਾ ਦੇ ਅਨੁਭਵ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ, ਭਾਵੇਂ AI ਜਵਾਬ ਨਾ ਦੇ ਸਕੇ।

Avatar ਪਲੇਟਫਾਰਮਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਸਮੇਂ ਕੀ ਪੁੱਛਣਾ ਹੈ

ਜੇਕਰ ਤੁਸੀਂ HeyGen ਜਾਂ D-ID ਵਰਗੀਆਂ ਸੇਵਾਵਾਂ ਦੀ ਤੁਲਨਾ ਕਰਦੇ ਹੋ, ਤਾਂ ਉਹਨਾਂ ਦੇ ਹਲੂਸੀਨੇਸ਼ਨ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਬਾਰੇ ਪੁੱਛੋ:

  • ਕੀ ਸਿਸਟਮ ਜਵਾਬਾਂ ਨੂੰ ਇੱਕ ਖਾਸ ਗਿਆਨ ਦੇ ਅਧਾਰ (knowledge base) ਤੱਕ ਸੀਮਤ ਰੱਖਦਾ ਹੈ?
  • ਜਦੋਂ ਕਨਫੀਡੈਂਸ ਘਟਦੀ ਹੈ ਤਾਂ ਇਹ ਕਿਵੇਂ ਵਿਵਹਾਰ ਕਰਦਾ ਹੈ—ਚੁੱਪ ਰਹਿੰਦਾ ਹੈ, ਹਲੂਸੀਨੇਸ਼ਨ ਕਰਦਾ ਹੈ, ਜਾਂ ਹੈਂਡ ਆਫ ਕਰਦਾ ਹੈ?
  • ਕਿਹੜੇ ਮਕੈਨਿਜ਼ਮ ਘੱਟ-ਕਨਫੀਡੈਂਸ ਵਾਲੀਆਂ ਗੱਲਬਾਤਾਂ ਨੂੰ ਲੌਗ ਕਰਦੇ ਹਨ ਅਤੇ ਉਹਨਾਂ ਵਿੱਚ ਸੁਧਾਰ ਕਰਦੇ ਹਨ?

ਆਵਾਜ਼ ਦੀ ਗੁਣਵੱਤਾ ਹੁਣ ਕੋਈ ਅੰਤਰ ਨਹੀਂ ਰੱਖਦੀ; avatar ਨੂੰ ਇਮਾਨਦਾਰ ਰੱਖਣ ਦੀ ਸਮਰੱਥਾ ਅਸਲੀ ਅੰਤਰ ਪੈਦਾ ਕਰਦੀ ਹੈ।

ਸਿੱਖਿਆ (Takeaway)

ਇੱਕ AI avatar ਜੋ ਸੁਣਨ ਵਿੱਚ ਬਿਲਕੁਲ ਸਹੀ ਲੱਗਦਾ ਹੈ ਪਰ ਤੱਥਾਂ ਨੂੰ ਗਲਤ ਦੱਸਦਾ ਹੈ, ਉਹ ਇੱਕ ਦੇਣਦਾਰੀ (liability) ਹੈ। ਮਾਡਲ ਨੂੰ ਇੱਕ ਜਾਂਚੇ ਹੋਏ ਗਿਆਨ ਦੇ ਅਧਾਰ (knowledge base) ਨਾਲ ਜੋੜ ਕੇ, ਕਨਫੀਡੈਂਸ ਘੱਟ ਹੋਣ 'ਤੇ ਜਵਾਬ ਦੇਣ ਤੋਂ ਇਨਕਾਰ ਕਰਕੇ, ਅਤੇ ਫੇਲ੍ਹ ਹੋਣ ਦੀ ਸਥਿਤੀ ਵਿੱਚ ਮਨੁੱਖੀ ਏਜੰਟਾਂ ਕੋਲ ਭੇਜ ਕੇ, ਡਿਵੈਲਪਰ ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਆਵਾਜ਼ ਨੂੰ ਭਰੋਸੇਯੋਗ ਆਵਾਜ਼ ਵਿੱਚ ਬਦਲ ਸਕਦੇ ਹਨ। ਅਸਲੀ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਹੁਣ ਇਸ ਗੱਲ ਵਿੱਚ ਹੈ ਕਿ ਇੱਕ ਸਿਸਟਮ ਹਲੂਸੀਨੇਸ਼ਨ ਨੂੰ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਰੋਕਦਾ ਹੈ, ਨਾ ਕਿ ਇਸ ਵਿੱਚ ਕਿ ਉਸਦੀ ਬੋਲਚਾਲ ਕਿੰਨੀ ਕੁਦਰਤੀ ਸੁਣਾਈ ਦਿੰਦੀ ਹੈ।