ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ ਖੁਦਮੁਖਤਿਆਰ AI agents ਨੂੰ ਤੈਨਾਤ ਕਰਨ ਦੀ ਦੌੜ ਲਗਾ ਰਹੀਆਂ ਹਨ, ਪਰ ਅੰਦਰੂਨੀ ਟੈਸਟਾਂ ਅਤੇ ਅਸਲ ਦੁਨੀਆ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਵਿਚਕਾਰ ਇੱਕ ਖ਼ਤਰਨਾਕ ਪਾੜਾ ਪੈ ਰਿਹਾ ਹੈ। ਸੰਸਥਾਵਾਂ agents ਨੂੰ ਵਧੇਰੇ ਖੁਦਮੁਖਤਿਆਰੀ ਦੇ ਰਹੀਆਂ ਹਨ ਜਦੋਂ ਕਿ governance frameworks ਗਾਹਕਾਂ ਦੇ ਸਾਹਮਣੇ ਹੋਣ ਵਾਲੀਆਂ ਗਲਤੀਆਂ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ।

ਹਕੀਕਤ-ਅਨੁਕੂਲਤਾ ਦੀ ਸਮੱਸਿਆ (The Reality-Alignment Problem)

VentureBeat Pulse Research ਨੇ एंटरਪ੍ਰਾਈਜ਼ AI ਵਿੱਚ ਇੱਕ ਹੈਰਾਨੀਜਨਕ "evaluation gap" (ਮੁਲਾਂਕਣ ਪਾੜਾ) ਦਾ ਖੁਲਾਸਾ ਕੀਤਾ ਹੈ। ਪੰਜਾਹ ਫੀਸਦੀ ਕੰਪਨੀਆਂ ਨੇ ਅਜਿਹਾ AI agent ਜਾਂ LLM feature ਲਾਂਚ ਕੀਤਾ ਜੋ ਹਰ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਵਿੱਚ ਸਫਲ ਰਿਹਾ, ਪਰ ਜਿਵੇਂ ਹੀ ਕਿਸੇ ਅਸਲੀ ਗਾਹਕ ਨੇ ਇਸ ਨਾਲ ਸੰਪਰਕ ਕੀਤਾ, ਇਹ ਅਸਫਲ ਹੋ ਗਿਆ।

ਇਸ ਤੋਂ ਵੀ ਮਾੜਾ ਇਹ ਹੈ ਕਿ ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ 24% ਕੰਪਨੀਆਂ ਨੇ ਉਸੇ ਅਸਫਲਤਾ ਨੂੰ ਦੁਬਾਰਾ ਦੇਖਿਆ, ਜੋ ਕਿ ਗੁੰਝਲਦਾਰ edge cases ਨੂੰ ਸਿਮੂਲੇਟ ਕਰਨ ਦੀ ਪੁਰਾਣੀ ਅਸਮਰੱਥਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਗਲਤੀਆਂ ਅਕਸਰ ਵੱਖਰੇ ਗਲਤ ਜਵਾਬਾਂ ਦੀ ਬਜਾਏ ਟੁੱਟੀਆਂ ਹੋਈਆਂ reasoning chains (ਤਰਕ ਕੜੀਆਂ) ਕਾਰਨ ਹੁੰਦੀਆਂ ਹਨ, ਜੋ ਇਹ ਦਰਸਾਉਂਦੀਆਂ ਹਨ ਕਿ ਮੌਜੂਦਾ benchmarks agentic workflows ਦੀ ਅਣਪਛਾਤੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਸਮਝਣ ਵਿੱਚ ਅਸਫਲ ਹਨ।

ਆਟੋਮੇਟਡ Evals ਵਿੱਚ ਵਿਸ਼ਵਾਸ ਦਾ ਸੰਕਟ

ਅੱਜ ਸਰਵੇਖਣ ਕੀਤੇ ਗਏ ਸਿਰਫ 5% ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ ਹੀ ਆਟੋਮੇਟਡ ਮੁਲਾਂਕਣਾਂ (automated evaluations) 'ਤੇ ਪੂਰਾ ਵਿਸ਼ਵਾਸ ਕਰਦੀਆਂ ਹਨ। ਇਹ ਅਵਿਸ਼ਵਾਸ ਦੋ ਤਕਨੀਕੀ 결 (flaws) ਕਾਰਨ ਪੈਦਾ ਹੁੰਦਾ ਹੈ:

  • ਖ਼ਰਾਬ ਅਸਲ-ਦੁਨੀਆ ਅਨੁਕੂਲਤਾ: 29% ਨੇਤਾ ਕਹਿੰਦੇ ਹਨ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਮੁਲਾਂਕਣ ਉਹ ਨਹੀਂ ਦਰਸਾਉਂਦੇ ਜੋ ਅਸਲ ਵਿੱਚ ਗਾਹਕਾਂ ਦੇ ਨਾਲ ਹੋ ਰਿਹਾ ਹੈ।
  • ਪੱਖਪਾਤ ਅਤੇ ਅਸੰਗਤਤਾ: 21% ਆਪਣੇ ਟੈਸਟਿੰਗ ਫਰੇਮਵਰਕ ਤੋਂ ਪੱਖਪਾਤੀ ਜਾਂ ਅਸਥਿਰ ਨਤੀਜਿਆਂ ਦੀ ਰਿਪੋਰਟ ਕਰਦੇ ਹਨ।

ਮੁਲਾਂਕਣ ਸਟੈਕ (evaluation stack) ਖਿੰਡਿਆ ਹੋਇਆ ਹੈ। ਕਈ ਕੰਪਨੀਆਂ ਸਿਰਫ਼ ਮਾਡਲ ਡਿਵੈਲਪਰਾਂ ਦੇ ਮੂਲ (native) ਟੂਲਸ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀਆਂ ਹਨ; 17% ਕੋਲ ਕੋਈ ਸਮਰਪਿਤ ਮੁਲਾਂਕਣ ਟੂਲਿੰਗ (evaluation tooling) ਨਹੀਂ ਹੈ। ਲਗਭਗ ਇੱਕ ਚੌਥਾਈ ਕੰਪਨੀਆਂ ਲਾਈਵ ਟ੍ਰੈਫਿਕ 'ਤੇ ਰੀਅਲ-ਟਾਈਮ ਕੁਆਲਿਟੀ ਚੈੱਕ ਕਰਦੀਆਂ ਹਨ, ਜਦੋਂ ਕਿ ਬਾਕੀ ਜ਼ਿਆਦਾਤਰ ਸਮੱਸਿਆਵਾਂ ਉਦੋਂ ਪਤਾ ਲੱਗਣ ਦਿੰਦੇ ਹਨ ਜਦੋਂ ਉਹ ਉਪਭੋਗਤਾਵਾਂ ਤੱਕ ਪਹੁੰਚ ਜਾਂਦੀਆਂ ਹਨ।

ਖੁਦਮੁਖਤਿਆਰੀ ਦੀ ਰਫ਼ਤਾਰ ਬਨਾਮ ਭਰੋਸੇ ਦੀ ਹੌਲੀ ਗਤੀ

ਦੋ-ਤਿਹਾਈ (66%) ਸੰਸਥਾਵਾਂ 'zero-human-in-the-loop' ਤੈਨਾਤੀ ਵੱਲ ਵਧ ਰਹੀਆਂ ਹਨ। ਚੌਤੀਆਂ ਫੀਸਦੀ ਕੰਪਨੀਆਂ ਪਹਿਲਾਂ ਹੀ ਘੱਟ-ਜੋਖਮ ਵਾਲੇ agents ਲਈ ਪੂਰੀ ਤਰ੍ਹਾਂ ਆਟੋਮੇਟਡ ਰੋਲਆਊਟ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀਆਂ ਹਨ, ਅਤੇ ਹੋਰ 33% ਅਗਲੇ ਬਾਰਾਂ ਮਹੀਨਿਆਂ ਦੇ ਅੰਦਰ ਉਸ ਪੜਾਅ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਪਾਈਪਲਾਈਨਾਂ ਤਿਆਰ ਕਰ ਰਹੀਆਂ ਹਨ।

Agents ਨੂੰ ਫੈਸਲੇ ਲੈਣ ਦੀ ਸ਼ਕਤੀ ਉਨ੍ਹਾਂ ਦੀ ਨਿਗਰਾਨੀ ਅਤੇ ਸੁਧਾਰ ਕਰਨ ਲਈ ਬਣਾਏ ਗਏ ਮਕੈਨਿਜ਼ਮਾਂ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਮਿਲ ਰਹੀ ਹੈ। ਬਾਜ਼ਾਰ ਹੁਣ ਵਿਸ਼ੇਸ਼ized observability ਅਤੇ evaluation platforms ਦੀ ਮੰਗ ਕਰ ਰਿਹਾ ਹੈ ਜੋ ਸਥਿਰ benchmarks ਦੀ ਬਜਾਏ ਲਾਈਵ, ਅਣਪਛਾਤੇ ਉਪਭੋਗਤਾ ਵਿਵਹਾਰ ਦੇ ਅਧਾਰ 'ਤੇ agents ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕਣ।

ਮੁੱਖ ਨੁਕਤੇ

  • ਸਫਲਤਾ ਦਾ ਵਿਰੋਧਾਭਾਸ: 50% ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ ਨੇ ਅਜਿਹੇ agents ਲਾਂਚ ਕੀਤੇ ਜੋ ਅੰਦਰੂਨੀ ਟੈਸਟਾਂ ਵਿੱਚ ਸਫਲ ਰਹੇ ਪਰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਅਸਫਲ ਹੋ ਗਏ।
  • ਵਿਸ਼ਵਾਸ ਦੀ ਕਮੀ: ਸਿਰਫ 5% ਪੂਰੀ ਤਰ੍ਹਾਂ ਆਟੋਮੇਟਡ ਮੁਲਾਂਕਣਾਂ 'ਤੇ ਵਿਸ਼ਵਾਸ ਕਰਦੇ ਹਨ, ਮੁੱਖ ਤੌਰ 'ਤੇ ਇਸ ਲਈ ਕਿਉਂਕਿ ਟੈਸਟ ਅਸਲ ਦੁਨੀਆ ਦੇ ਨਤੀਜਿਆਂ ਨਾਲ ਮੇਲ ਨਹੀਂ ਖਾਂਦੇ।
  • ਖੁਦਮੁਖਤਿਆਰੀ ਦੀ ਦੌੜ: 66% ਕੰਪਨੀਆਂ ਪਹਿਲਾਂ ਹੀ 'zero-human-in-the-loop' ਤੈਨਾਤੀ ਦੀ ਵਰਤੋਂ ਕਰ ਰਹੀਆਂ ਹਨ ਜਾਂ ਯੋਜਨਾ ਬਣਾ ਰਹੀਆਂ ਹਨ।

VentureBeat Pulse ਖੋਜ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਅੰਦਰੂਨੀ ਟੈਸਟਾਂ ਨੂੰ ਪਾਸ ਕਰਨ ਵਾਲੇ ਅੱਧੇ एंटरਪ੍ਰਾਈਜ਼ AI agents ਅਸਲੀ ਗਾਹਕ ਨਾਲ ਮਿਲਦੇ ਹੀ ਅਸਫਲ ਹੋ ਜਾਂਦੇ ਹਨ, ਜੋ ਕਿ ਉਸ ਸਮੇਂ "evaluation gap" ਦੇ ਵਧਣ ਦੀ ਸਪੱਸ਼ਟ ਨਿਸ਼ਾਨੀ ਹੈ ਜਦੋਂ ਕੰਪਨੀਆਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖੁਦਮੁਖਤਿਆਰ ਤੈਨਾਤੀ ਵੱਲ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਰਹੀਆਂ ਹਨ।

ਇਸ ਅਧਿਐਨ ਵਿੱਚ ਉਨ੍ਹਾਂ ਕੰਪਨੀਆਂ ਦਾ ਸਰਵੇਖਣ ਕੀਤਾ ਗਿਆ ਜਿਨ੍ਹਾਂ ਨੇ LLM-ਅਧਾਰਤ agents ਲਾਂਚ ਕੀਤੇ ਹਨ ਜਾਂ ਕਰਨ ਦੀ ਤਿਆਰੀ ਕਰ ਰਹੀਆਂ ਹਨ। ਇਸ ਵਿੱਚ ਪਾਇਆ ਗਿਆ ਕਿ 50% ਉੱਤਰਦਾਤਾਵਾਂ ਨੇ ਅਜਿਹਾ agent ਲਾਂਚ ਕੀਤਾ ਜੋ ਹਰ ਅੰਦਰੂਨੀ benchmark ਵਿੱਚ ਸਫਲ ਰਿਹਾ ਪਰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਅਸਫਲ ਹੋ ਗਿਆ। ਇੱਕ ਵਾਧੂ 24% ਨੇ ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਇਸੇ ਅਸਫਲਤਾ ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ, ਜੋ ਇਹ ਪੁਸ਼ਟੀ ਕਰਦਾ ਹੈ ਕਿ ਇਹ ਸਮੱਸਿਆ ਅੱਜ ਦੇ ਟੈਸਟਿੰਗ ਪ੍ਰਬੰਧਾਂ ਵਿੱਚ ਇੱਕ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲੀ ਕਮੀ ਹੈ।

ਅੰਦਰੂਨੀ ਟੈਸਟ ਕਿਉਂ ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ

ਇਹ ਪਾੜਾ ਸਿਰਫ ਕਵਰੇਜ ਬਾਰੇ ਨਹੀਂ ਹੈ। ਉੱਤਰਦਾਤਾਵਾਂ ਨੇ ਲੈਬ ਸਿਮੂਲੇਸ਼ਨਾਂ ਅਤੇ ਅਸਲ ਦੁਨੀਆ ਦੀਆਂ ਗੁੰਝਲਦਾਰ ਅੰਤਰਕਿਰਿਆਵਾਂ ਵਿਚਕਾਰ ਇੱਕ ਡੂੰਘੇ ਅਨੁਕੂਲਤਾ ਦੀ ਕਮੀ ਨੂੰ ਉਜਾਗਰ ਕੀਤਾ। ਗਲਤੀਆਂ ਅਕਸਰ ਵੱਖਰੇ ਗਲਤ ਜਵਾਬਾਂ ਦੀ ਬਜਾਏ ਟੁੱਟੀਆਂ ਹੋਈਆਂ reasoning chains ਤੋਂ ਪੈਦਾ ਹੁੰਦੀਆਂ ਹਨ—ਅਜਿਹੀਆਂ ਸਥਿਤੀਆਂ ਜਿੱਥੇ agent ਦਾ ਅੰਦਰੂਨੀ ਤਰਕ ਉਮੀਦ ਕੀਤੇ ਨਤੀਜਿਆਂ ਤੋਂ ਭਟਕ ਜਾਂਦਾ ਹੈ।

ਸ਼ਿਕਾਇਤਾਂ ਵਿੱਚ ਦੋ ਤਕਨੀਕੀ ਕਮੀਆਂ ਪ੍ਰਧਾਨ ਹਨ:

  • ਖ਼ਰਾਬ ਅਸਲ-ਦੁਨੀਆ ਅਨੁਕੂਲਤਾ – 29% ਨੇਤਾਵਾਂ ਨੇ ਕਿਹਾ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਮੁਲਾਂਕਣ ਇਹ ਦਰਸਾਉਣ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ ਕਿ ਜਦੋਂ ਕੋਈ ਗਾਹਕ agent ਨਾਲ ਗੱਲਬਾਤ ਕਰਦਾ ਹੈ ਤਾਂ ਅਸਲ ਵਿੱਚ ਕੀ ਹੁੰਦਾ ਹੈ।
  • ਪੱਖਪਾਤ ਅਤੇ ਅਸੰਗਤਤਾ – 21% ਨੇ ਦੱਸਿਆ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਟੈਸਟਿੰਗ ਫਰੇਮਵਰਕ ਪੱਖਪਾਤੀ ਜਾਂ ਅਸਥਿਰ ਨਤੀਜੇ ਦਿੰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਉਨ੍ਹਾਂ ਦੇ ਮਾਪਦੰਡਾਂ (metrics) ਵਿੱਚ ਵਿਸ਼ਵਾਸ ਘਟਦਾ ਹੈ।

ਇਸ ਮੁੱਦੇ ਨੂੰ ਹੋਰ ਗ

ਖੁਦਮੁਖਤਿਆਰੀ ਯਕੀਨੀਕਰਨ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧ ਰਹੀ ਹੈ

ਟੈਸਟਿੰਗ ਵਿੱਚ ਘੱਟ ਵਿਸ਼ਵਾਸ ਦੇ ਬਾਵਜੂਦ, ਖੁਦਮੁਖਤਿਆਰੀ ਲਈ ਦਬਾਅ ਲਗਾਤਾਰ ਬਣਿਆ ਹੋਇਆ ਹੈ। ਤਿੰਨ-ਦਿੱਤੀ ਜਵਾਬਦੇਤਾਵਾਂ—66%—'zero-human-in-the-loop' ਤੈਨਾਤੀਆਂ ਵੱਲ ਵਧ ਰਹੀਆਂ ਹਨ। ਉਸ ਸਮੂਹ ਦੇ ਅੰਦਰ, 34% ਪਹਿਲਾਂ ਹੀ ਘੱਟ-ਜੋਖਮ ਵਾਲੇ ਏਜੰਟਾਂ ਲਈ ਪੂਰੀ ਤਰ੍ਹਾਂ ਸਵੈਚਾਲਿਤ ਰੋਲਆਊਟ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੇ ਹਨ, ਅਤੇ ਹੋਰ 33% ਅਗਲੇ ਬਾਰਾਂ ਮਹੀਨਿਆਂ ਦੇ ਅੰਦਰ ਉਸੇ ਬਿੰਦੂ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਪਾਈਪਲਾਈਨਾਂ ਤਿਆਰ ਕਰ ਰਹੇ ਹਨ।

ਏਜੰਟਾਂ ਨੂੰ ਉਹਨਾਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਅਤੇ ਸੁਧਾਰਨ ਲਈ ਤਿਆਰ ਕੀਤੇ ਗਏ ਮਕੈਨਿਜ਼ਮਾਂ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਫੈਸਲਾ ਲੈਣ ਦੀ ਸ਼ਕਤੀ ਮਿਲ ਰਹੀ ਹੈ। ਬਾਜ਼ਾਰ ਦਾ ਪ੍ਰਭਾਵ ਸਪੱਸ਼ਟ ਹੈ: ਵਿਸ਼ੇਸ਼ observability ਅਤੇ evaluation ਪਲੇਟਫਾਰਮਾਂ ਦੀ ਵਧਦੀ ਮੰਗ, ਜੋ ਸਥਿਰ ਬੈਂਚਮਾਰਕਾਂ ਦੀ ਬਜਾਏ ਲਾਈਵ, ਅਨਿਸ਼ਚਿਤ ਉਪਭੋਗਤਾ ਵਿਵਹਾਰ ਦੇ ਅਧਾਰ 'ਤੇ ਏਜੰਟਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕਣ।