ਡੈਮੋ ਸਪੋਰਟ ਬੋਟ ਨੇ ਇੱਕ ਯੂਜ਼ਰ ਨੂੰ ਕਿਹਾ, “ਮੈਂ ਤੁਹਾਡੇ $34.50 ਦਾ ਰਿਫੰਡ ਪ੍ਰੋਸੈਸ ਕਰ ਦਿੱਤਾ ਹੈ,” ਫਿਰ ਵੀ ਰਿਫੰਡ ਟੂਲ ਨੂੰ ਕਦੇ ਵੀ ਵਰਤਿਆ ਨਹੀਂ ਗਿਆ।
AI agents ਬਿਨਾਂ ਕਿਸੇ ਗਲਤੀ ਦੇ ਦਿਖਣ ਵਾਲੇ ਜਵਾਬ ਦੇ ਸਕਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਉਹ ਉਨ੍ਹਾਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਚੁੱਪਚਾਣ ਛੱਡ ਦਿੰਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਕਰਨ ਦਾ ਉਹ ਦਾਅਵਾ ਕਰਦੇ ਹਨ। ਇੱਕ ਕ੍ਰੈਸ਼ ਹੋਏ ਸਰਵਰ ਜਾਂ ਟਾਈਮ-ਆਊਟ ਹੋਈ ਰਿਕਵੈਸਟ ਦੇ ਉਲਟ, ਇੱਕ ਝੂਠਾ ਬੋਲਣ ਵਾਲਾ agent ਕੋਈ ਐਰਰ ਫਲੈਗ, ਕੋਈ ਲਾਲ ਟੈਕਸਟ, ਜਾਂ ਕੁਝ ਗਲਤ ਹੋਣ ਦਾ ਕੋਈ ਸਪੱਸ਼ਟ ਸੰਕੇਤ ਨਹੀਂ ਛੱਡਦਾ। ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਅਜਿਹੇ ਧੋਖੇ ਦੀ ਭਾਲ ਕਰਨੀ ਪੈਂਦੀ ਹੈ ਜੋ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮਾਡਲ ਦੇ ਆਉਟਪੁੱਟ ਦੇ ਅੰਦਰ ਹੁੰਦਾ ਹੈ।
ਇਹ ਸਮੱਸਿਆ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਜਦੋਂ ਕੋਈ AI-ਡਰਾਈਵਨ ਸਪੋਰਟ ਸਿਸਟਮ ਰਿਫੰਡ ਪੂਰਾ ਕਰਨ, ਆਰਡਰ ਰੱਦ ਕਰਨ, ਜਾਂ ਰਿਕਾਰਡ ਅਪਡੇਟ ਕਰਨ ਦਾ ਦਿਖਾਵਾ ਕਰਦਾ ਹੈ, ਤਾਂ ਕਾਰੋਬਾਰ ਨੂੰ ਅਸਲ ਨੁਕਸਾਨ ਹੁੰਦਾ ਹੈ—ਬੇਕਾਰ API calls, ਵਾਧੂ ਕੰਪਿਊਟਿੰਗ, ਅਤੇ ਸਭ ਤੋਂ ਮਾੜਾ, ਗਾਹਕਾਂ ਦਾ ਵਿਸ਼ਵਾਸ ਟੁੱਟਣਾ।
ਉਸ ਵਿਵਹਾਰ ਦਾ ਪਤਾ ਲਗਾਉਣ ਦਾ ਮਤਲਬ ਹੈ agent ਦੇ ਸ਼ਬਦਾਂ ਤੋਂ ਪਰੇ ਦੇਖਣਾ ਅਤੇ ਉਸ ਦੁਆਰਾ ਅਸਲ ਵਿੱਚ ਕੀਤੀਆਂ ਗਈਆਂ ਕਾਰਵਾਈਆਂ ਦੀ ਜਾਂਚ ਕਰਨਾ। AgentNemesis ਇਸੇ ਆਧਾਰ 'ਤੇ ਬਣਿਆ ਇੱਕ ਟੂਲ ਹੈ, ਜੋ AI agents ਨੂੰ ਦੇਖਣਯੋਗ traces ਨਾਲ ਲੈਸ ਕਰਦਾ ਹੈ ਅਤੇ ਦਾਅਵੇ ਅਤੇ ਕਾਰਜਕਾਰੀ (execution) ਵਿਚਕਾਰ ਅੰਤਰ ਨੂੰ ਫਲੈਗ ਕਰਦਾ ਹੈ।
ਡਿਟੈਕਸ਼ਨ (Detection) ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ
AgentNemesis OpenTelemetry ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜੋ ਇੱਕ open-source framework ਹੈ ਜੋ traces, metrics, ਅਤੇ logs ਇਕੱਠੇ ਕਰਦਾ ਹੈ। ਹਰ ਵਾਰ ਜਦੋਂ agent ਕਿਸੇ tool ਨੂੰ ਕਾਲ ਕਰਨ ਦਾ ਫੈਸਲਾ ਕਰਦਾ ਹੈ—ਚਾਹੇ ਉਹ payment API ਹੋਵੇ, database lookup ਹੋਵੇ, ਜਾਂ content generator ਹੋਵੇ—ਇੱਕ trace entry ਬਣਾਈ ਜਾਂਦੀ ਹੈ ਅਤੇ SigNoz ਨੂੰ stream ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਜੋ ਕਿ ਇੱਕ monitoring platform ਹੈ ਜੋ ਡੇਟਾ ਨੂੰ ਸਟੋਰ ਅਤੇ ਵਿਜ਼ੂਅਲਾਈਜ਼ ਕਰਦਾ ਹੈ।
ਇੱਕ ਵੱਖਰਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕੰਪੋਨੈਂਟ (analysis component) trace stream ਵਿੱਚ ਚਾਰ ਅਜਿਹੇ ਪੈਟਰਨਾਂ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ ਜੋ ਅਸਫਲਤਾ ਦਾ ਸੰਕੇਤ ਦਿੰਦੇ ਹਨ:
- Loops – ਇੱਕੋ tool ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਸਟੇਟ ਚੇਂਜ ਦੇ ਲਗਾਤਾਰ ਤਿੰਨ ਵਾਰ ਇੱਕੋ ਜਿਹੇ input ਨਾਲ ਕਾਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
- Unverified claims – agent ਕਿਸੇ ਤੱਥ ਦਾ ਦਾਅਵਾ ਕਰਦਾ ਹੈ (ਜਿਵੇਂ ਕਿ, “ਤੁਹਾਡਾ ਆਰਡਰ ਡਿਲੀਵਰ ਹੋ ਗਿਆ ਸੀ”) ਬਿਨਾਂ ਕਿਸੇ ਅਜਿਹੇ tool call ਦੇ ਜੋ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕੇ।
- Broken promises – agent ਕਿਸੇ ਕਾਰਵਾਈ ਦੀ ਘੋਸ਼ਣਾ ਕਰਦਾ ਹੈ, ਪਰ trace ਵਿੱਚ ਉਸ ਨਾਲ ਮੇਲ ਕਰਦੀ ਕੋਈ tool invocation ਨਹੀਂ ਦਿਖਾਈ ਦਿੰਦੀ।
- Broken handoffs – multi-agent pipelines ਵਿੱਚ, ਜਾਣਕਾਰੀ planner ਤੋਂ researcher ਜਾਂ writer ਤੱਕ ਪਹੁੰਚਣ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਕਾਰਵਾਈਆਂ ਅਧੂਰੀਆਂ ਰਹਿ ਜਾਂਦੀਆਂ ਹਨ।
ਹਰ ਗੱਲਬਾਤ ਨੂੰ ਇੱਕ ਸਕੋਰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ ਜੋ ਸਹੀ ਗੁੰਮ ਹੋਈ ਜਾਂ ਦੁਹਰਾਈ ਵਾਲੀ ਕਾਲ ਦੀ ਪਛਾਣ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ developers ਨੂੰ ਇੱਕ ਸਪੱਸ਼ਟ audit trail ਮਿਲਦੀ ਹੈ ਕਿ agent ਦੀ ਗੱਲਬਾਤ ਉਸਦੇ ਵਿਵਹਾਰ ਤੋਂ ਕਿੱਥੇ ਵੱਖ ਹੋ ਗਈ ਸੀ।
ਸਿਸਟਮ ਬਣਾਉਂਦੇ ਸਮੇਂ ਸਿੱਖੇ ਗਏ ਸਬਕ
- Validate dependencies early – SigNoz ਲਈ sign-up ਕਰਨ ਲਈ work email ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਹਫ਼ਤਿਆਂ ਦੇ ਵਿਕਾਸ ਤੋਂ ਬਾਅਦ ਇਸ ਰੁਕਾਵਟ ਦਾ ਸਾਹਮਣਾ ਕਰਨ ਕਾਰਨ rollout ਵਿੱਚ ਦੇਰੀ ਹੋਈ। ਸ਼ੁਰੂਆਤ ਵਿੱਚ ਹੀ ਅਜਿਹੀਆਂ ਜ਼ਰੂਰਤਾਂ ਦੀ ਜਾਂਚ ਕਰਨ ਨਾਲ ਸਮਾਂ ਬਚ ਸਕਦਾ ਸੀ।
- Match deployment environments to runtime needs – monitoring dashboard local machine 'ਤੇ ਸੁਚਾਰੂ ਰੂਪ ਵਿੱਚ ਚੱਲਿਆ ਪਰ Vercel 'ਤੇ crash ਹੋ ਗਿਆ ਕਿਉਂਕਿ ਇਹ platform ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ Python processes ਦਾ ਸਮਰਥਨ ਨਹੀਂ ਕਰਦਾ। ਟੀਮ ਨੇ live monitoring ਦੀ ਬਜਾਏ pre-running scenarios ਵੱਲ ਰੁਖ ਕੀਤਾ।
- Avoid AI-to-AI adjudication – ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਵਿਚਾਰ ਵਿੱਚ ਇੱਕ language model ਨੂੰ ਦੂਜੇ ਦੀ ਸੱਚਾਈ ਦਾ ਫੈਸਲਾ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੱਤੀ ਗਈ ਸੀ। ਟੀਮ ਨੇ ਉਸ ਪਹੁੰਚ ਨੂੰ ਛੱਡ ਦਿੱਤਾ, ਅਤੇ trace-to-text matching ਦੇ ਠੋਸ ਸਬੂਤ ਨੂੰ ਤਰਜੀਹ ਦਿੱਤੀ, ਜੋ ਕਿ ਕਿਸੇ ਹੋਰ probabilistic output ਦੀ ਬਜਾਏ ਪ੍ਰਮਾਣਿਤ ਸਬੂਤ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
ਸਿੱਖਿਆ (Takeaway)
ਇੱਕ AI agent ਜੋ ਕਦੇ ਕ੍ਰੈਸ਼ ਨਹੀਂ ਹੁੰਦਾ, ਉਹ ਫਿਰ ਵੀ ਝੂਠ ਬੋਲ ਸਕਦਾ ਹੈ, ਅਤੇ ਉਸ ਝੂਠ ਨੂੰ ਫੜਨ ਦਾ ਇੱਕੋ ਇੱਕ ਭਰੋਸੇਯੋਗ ਤਰੀਕਾ ਉਸਦੇ ਬੋਲੇ ਗਏ ਸ਼ਬਦਾਂ ਦੀ ਤੁਲਨਾ ਉਸ ਦੁਆਰਾ ਰਿਕਾਰਡ ਕੀਤੀਆਂ ਗਈਆਂ ਠੋਸ ਕਾਰਵਾਈਆਂ ਨਾਲ ਕਰਨਾ ਹੈ। ਹਰ tool call ਨੂੰ OpenTelemetry ਨਾਲ ਲੈਸ ਕਰਕੇ ਅਤੇ ਨਤੀਜੇ ਵਜ
