ਮੈਟ ਸ਼ੂਮਰ (Matt Shumer) ਆਪਣੇ ਕੰਪਿਊਟਰ ਦੇ ਸਾਹਮਣੇ ਬੈਠੇ ਅਤੇ ਆਪਣੇ AI ਏਜੰਟ ਨੂੰ ਇੱਕ ਸਧਾਰਨ ਹਦਾਇਤ ਦਿੱਤੀ: ਫਾਈਲਾਂ ਸਾਫ਼ ਕਰੋ। ਉਹ ਇਸ ਰੁਟੀਨ ਨੂੰ ਸੈਂਕੜੇ ਵਾਰ ਬਿਨਾਂ ਕਿਸੇ ਸਮੱਸਿਆ ਦੇ ਚਲਾ ਚੁੱਕੇ ਸਨ। ਇਸ ਵਾਰ, ਇੱਕ ਪਾਥ ਰੈਜ਼ੋਲਿਊਸ਼ਨ (path resolution) ਦੀ ਗਲਤੀ ਨੇ ਇੱਕ ਆਮ ਸਫ਼ਾਈ ਦੇ ਕੰਮ ਨੂੰ ਇੱਕ ਵੱਡੀ ਤਬਾਹੀ ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ। ਸਾਲਾਂ ਦਾ ਕੋਡ, ਦਸਤਾਵੇਜ਼ ਅਤੇ ਫੋਟੋਆਂ ਸਕਿੰਟਾਂ ਵਿੱਚ ਗਾਇਬ ਹੋ ਗਈਆਂ।
ਇਹ ਕੋਈ ਕਲਪਨਾਤਮਕ ਜੋਖਮ ਨਹੀਂ ਹੈ। ਇਹ ਇੱਕ ਅਸਲੀ ਡਿਵੈਲਪਰ ਨਾਲ ਉਸਦੀ ਅਸਲੀ ਮਸ਼ੀਨ 'ਤੇ ਵਾਪਰਿਆ ਹੈ, ਅਤੇ ਜਿਸ ਏਜੰਟ ਦੀ ਗੱਲ ਕੀਤੀ ਜਾ ਰਹੀ ਹੈ, ਉਸਦਾ ਰਿਕਾਰਡ ਫੇਲ੍ਹ ਹੋਣ ਦੇ ਪਲ ਤੱਕ ਬਿਲਕੁਲ ਸਹੀ ਲੱਗ ਰਿਹਾ ਸੀ। AI ਏਜੰਟ ਜੋ ਫਾਈਲਾਂ ਲਿਖ ਸਕਦੇ ਹਨ, ਟਰਮੀਨਲ ਕਮਾਂਡਾਂ ਚਲਾ ਸਕਦੇ ਹਨ, ਅਤੇ ਸਬ-ਏਜੰਟ (subagents) ਬਣਾ ਸਕਦੇ ਹਨ, ਹੁਣ IDEs, ਚੈਟ ਇੰਟਰਫੇਸਾਂ ਅਤੇ ਆਟੋਮੇਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ। ਉਹਨਾਂ ਨੂੰ ਆਪਰੇਟਿੰਗ ਸਿਸਟਮਾਂ ਤੱਕ ਸਿੱਧੀ ਪਹੁੰਚ ਦੇ ਨਾਲ ਭਰੋਸਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਇਹੀ ਭਰੋਸਾ ਖ਼ਤਰੇ ਦਾ ਕਾਰਨ ਬਣਦਾ ਹੈ। ਉਹੀ ਫੇਲ੍ਹ ਹੋਣ ਦੇ ਤਰੀਕੇ ਜਿਨ੍ਹਾਂ ਨੇ ਸ਼ੂਮਰ ਦੀ ਮਸ਼ੀਨ ਨੂੰ ਤਬਾਹ ਕਰ ਦਿੱਤਾ, ਟੂਲ ਐਕਸੈਸ ਵਾਲੇ ਹਰ ਏਜੰਟ ਵਿੱਚ ਮੌਜੂਦ ਹਨ। ਉਹ ਕਿਉਂ ਫੇਲ੍ਹ ਹੁੰਦੇ ਹਨ, ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਸਹੀ ਤਰੀਕੇ ਨਾਲ ਕਿਵੇਂ ਕਾਬੂ ਵਿੱਚ ਰੱਖਣਾ ਹੈ, ਇਹ ਹੁਣ ਇਹਨਾਂ ਟੂਲਸ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ ਇੱਕ ਬੁਨਿਆਦੀ ਜੀਵਨ-ਰੱਖਿਆ ਹੁਨਰ ਹੈ।
ਜਦੋਂ ਪੈਟਰਨ ਮੈਚਿੰਗ (Pattern Matching) ਫਾਈਲਸਿਸਟਮ ਨਾਲ ਮਿਲਦੀ ਹੈ
AI ਏਜੰਟ ਸੋਚਦੇ ਨਹੀਂ ਹਨ। ਉਹ ਪੈਟਰਨਾਂ ਨੂੰ ਮੈਚ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਤੁਸੀਂ "ਫਾਈਲਾਂ ਸਾਫ਼ ਕਰੋ" ਕਹਿੰਦੇ ਹੋ, ਤਾਂ ਮਾਡਲ ਆਪਣੀ ਟ੍ਰੇਨਿੰਗ ਮੈਮੋਰੀ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਸਮਾਨ ਇੰਟਰੈਕਸ਼ਨਾਂ ਦੀ ਭਾਲ ਕਰਦਾ ਹੈ ਅਤੇ ਇੱਕ ਅਜਿਹੀ ਕਮਾਂਡ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜੋ ਅੰਕੜਾ ਵਿਗਿਆਨਕ ਤੌਰ 'ਤੇ (statistically) ਉਸ ਪੈਟਰਨ ਦੇ ਅਨੁਕੂਲ ਹੋਵੇ। ਜੇਕਰ ਹਦਾਇਤ ਬਿਲਡ ਡਾਇਰੈਕਟਰੀ ਵਿੱਚ ਟੈਂਪਰੇਰੀ ਫਾਈਲਾਂ ਨੂੰ ਡਿਲੀਟ ਕਰਨ ਦੀ ਹੈ, ਤਾਂ ਇਹ rm -rf /tmp/build-cache/* ਵਰਗੀ ਕਮਾਂਡ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਜਾਇਜ਼ ਲੱਗਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਹਰ ਉਸ ਹੋਰ ਸਫ਼ਾਈ ਕਮਾਂਡ ਵਰਗਾ ਹੈ ਜੋ ਮਾਡਲ ਨੇ ਹੁਣ ਤੱਕ ਦੇਖੀ ਹੈ।
ਪਰ ਕੀ ਹੁੰਦਾ ਹੈ ਜਦੋਂ $HOME ਵਰਗਾ ਵੇਰੀਏਬਲ (variable) ਰੈਜ਼ੋਲਵ ਨਹੀਂ ਹੋ ਪਾਉਂਦਾ? ਇੱਕ ਇਨਸਾਨ ਇੱਕ ਖਾਲੀ ਸਟ੍ਰਿੰਗ ਜਾਂ ਇੱਕ ਅਣਕਿਆਸੇ ਪਾਥ ਨੂੰ ਦੇਖਦਾ ਹੈ, ਰੁਕਦਾ ਹੈ, ਅਤੇ ਸਵਾਲ ਪੁੱਛਦਾ ਹੈ। ਇੱਕ ਏਜੰਟ ਦੇਖਦਾ ਹੈ ਕਿ ਪੈਟਰਨ ਅਜੇ ਵੀ ਮੈਚ ਹੋ ਰਿਹਾ ਹੈ ਅਤੇ 'ਐਂਟਰ' ਦਬਾ ਦਿੰਦਾ ਹੈ। ਸ਼ੂਮਰ ਦੇ ਮਾਮਲੇ ਵਿੱਚ, ਇੱਕ ਕਮਾਂਡ ਜੋ ਕਿਸੇ ਖਾਸ ਫੋਲਡਰ ਨੂੰ ਸਾਫ਼ ਕਰਨ ਲਈ ਸੀ, ਉਸਨੇ ਇਸ ਦੀ ਬਜਾਏ ਯੂਜ਼ਰ ਡਾਇਰੈਕਟਰੀ ਦੇ ਰੂਟ (root) ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾ ਲਿਆ। ਏਜੰਟ ਇਹ ਸੋਚਣ ਲਈ ਨਹੀਂ ਰੁਕਿਆ ਕਿ ਪਾਥ ਅਜੀਬ ਕਿਉਂ ਲੱਗ ਰਿਹਾ ਹੈ। ਉਸਨੇ ਟਾਰਗੇਟ ਦੀ ਪੁਸ਼ਟੀ ਨਹੀਂ ਕੀਤੀ। ਉਸਨੇ ਕਮਾਂਡ ਨੂੰ ਇਸ ਲਈ ਚਲਾ ਦਿੱਤਾ ਕਿਉਂਕਿ ਉਸਦਾ ਕੰਮ "ਸਫ਼ਾਈ" ਦੇ ਪੈਟਰਨ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ।
ਇਹ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (large language models) ਅਤੇ ਸਿਸਟਮ ਐਡਮਿਨਿਸਟ੍ਰੇਸ਼ਨ ਵਿਚਕਾਰ ਮੁੱਖ ਅਸੰਗਤੀ ਹੈ। ਅਸਲੀ ਤਰਕ (reasoning) ਵਿੱਚ ਸੰਦਰਭ (context) ਨੂੰ ਸਮਝਣਾ, ਅਨੁਮਾਨਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨਾ ਅਤੇ ਐਜ ਕੇਸਾਂ (edge cases) ਨੂੰ ਸੰਭਾਲਣਾ ਸ਼ਾਮਲ ਹੁੰਦਾ ਹੈ। ਪੈਟਰਨ ਮੈਚਿੰਗ ਵਿੱਚ ਅਜਿਹਾ ਟੈਕਸਟ ਤਿਆਰ ਕਰਨਾ ਸ਼ਾਮਲ ਹੈ ਜੋ ਅੰਕੜਾ ਵਿਗਿਆਨਕ ਤੌਰ 'ਤੇ ਇੱਕ ਸਹੀ ਜਵਾਬ ਵਰਗਾ ਲੱਗੇ। ਜਦੋਂ ਉਹ ਜਵਾਬ ਇੱਕ ਰੀਕਰਸਿਵ ਡਿਲੀਟ ਫਲੈਗ (recursive delete flag) ਵਾਲੀ ਟਰਮੀਨਲ ਕਮਾਂਡ ਹੋਵੇ, ਤਾਂ ਸਿਰਫ਼ ਅੰਕੜਾ ਵਿਗਿਆਨਕ ਸਮਾਨਤਾ ਕਾਫ਼ੀ ਨਹੀਂ ਹੁੰਦੀ।
ਸਬ-ਏਜੰਟ ਦਾ ਬਲਾਈਂਡ ਸਪੌਟ (Blind Spot)
ਬਹੁਤ ਸਾਰੇ ਆਧੁਨਿਕ ਏਜੰਟ ਫਰੇਮਵਰਕ ਇੱਕ ਮੁੱਖ ਆਰਕੈਸਟਰੇਟਰ (orchestrator) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ ਜੋ ਸਬ-ਏਜੰਟਾਂ ਨੂੰ ਕੰਮ ਸੌਂਪਦਾ ਹੈ। ਮੇਨ ਏਜੰਟ ਕੋਲ ਸਖ਼ਤ ਹਦਾਇਤਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ: ਹੋਮ ਡਾਇਰੈਕਟਰੀ ਨੂੰ ਕਦੇ ਨਾ ਛੇੜੋ, ਡਿਲੀਟ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਹਮੇਸ਼ਾ ਪੁੱਛੋ, ਇੱਕ ਆਡਿਟ ਲੌਗ ਰੱਖੋ। ਫਿਰ ਇਹ "ਪੁਰਾਣੇ ਲੌਗ ਸਾਫ਼ ਕਰੋ" ਵਰਗੇ ਇੱਕ ਸੀਮਤ ਪ੍ਰੋਂਪਟ ਨਾਲ ਇੱਕ ਵਰਕਰ ਬਣਾਉਂਦਾ ਹੈ।
ਉਹ ਸਬ-ਏਜੰਟ ਅਕਸਰ ਇੱਕ ਅਲੱਗ-ਥਲੱਗ (silo) ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਹ ਟੂਲ ਤਾਂ ਵਿਰਾਸਤ ਵਿੱਚ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਪਰ ਮੇਨ ਏਜੰਟ ਦੀ ਸੁਰੱਖਿਆ ਸੱਭਿਆਚਾਰ ਨੂੰ ਨਹੀਂ। ਉਹ ਪਾਬੰਦੀਆਂ ਜੋ ਮੁੱਖ ਏਜੰਟ ਨੂੰ ਸਾਵਧਾਨ ਰੱਖਦੀਆਂ ਹਨ, ਉਹ ਕੰਟੈਕਸਟ ਵਿੰਡੋ ਮੈਨੇਜਮੈਂਟ ਦੌਰਾਨ ਸੰਕੁਚਿਤ, ਸੰਖੇਪ ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਹਟਾ ਦਿੱਤੀਆਂ ਜਾਂਦੀਆਂ ਹਨ। ਸਬ-ਏਜੰਟ ਨੂੰ ਇੱਕ ਕੰਮ ਅਤੇ ਇੱਕ ਟੂਲਕਿੱਟ ਮਿਲਦੀ ਹੈ, ਪਰ ਉਸਨੂੰ ਉਹ ਘੰਟਿਆਂ ਦੀ ਸਾਵਧਾਨੀ ਭਰੀ ਪ੍ਰੋਂਪਟਿੰਗ ਨਹੀਂ ਮਿਲਦੀ ਜਿਸਨੇ ਗਾਰਡਰੇਲ (guardrails) ਸਥਾਪਿਤ ਕੀਤੇ ਸਨ।
ਇਸਦਾ ਨਤੀਜਾ ਇੱਕ ਕਿਸਮ ਦੀ ਸੰਗਠਨਾਤਮਕ ਵਿਸਮ੍ਰਿਤੀ (organizational amnesia) ਹੈ। ਇੱਕ ਸੁਰੱਖਿਆ ਨਿਯਮ ਜੋ ਮੇਨ ਏਜੰਟ ਦੇ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਹੁੰਦਾ ਹੈ, ਉਹ ਸਬ-ਏਜੰਟ ਲਈ ਮੌਜੂਦ ਹੀ ਨਹੀਂ ਹੁੰਦਾ। ਇਹ ਖਾਸ ਤੌਰ 'ਤੇ ਖ਼ਤਰਨਾਕ ਹੈ ਕਿਉਂਕਿ ਸਬ-ਏਜੰਟਾਂ ਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਅਜਿਹੇ ਦੁਹਰਾਉਣ ਵਾਲੇ, ਘੱਟ ਮਹੱਤਵਪੂਰਨ ਕੰਮ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਦੀ ਨਿਗਰਾਨੀ ਆਪਰੇਟਰ ਨੇੜਿਓਂ ਕਰਨਾ ਬੰਦ ਕਰ ਦਿੰਦੇ ਹਨ। ਕੋਈ ਵੀ ਲੌਗ ਸਫ਼ਾਈ ਦੇ ਕੰਮ 'ਤੇ ਉਦੋਂ ਤੱਕ ਨਜ਼ਰ ਨਹੀਂ ਰੱਖਦਾ ਜਦੋਂ ਤੱਕ ਇਹ ਪ੍ਰੋਡਕਸ਼ਨ ਡੇਟਾਬੇਸ ਨੂੰ ਡਿਲੀਟ ਨਹੀਂ ਕਰ ਦਿੰਦਾ।
ਫੈਸਲਾ ਲੈਣ ਦੀ ਤਰਤੀਬ ਦਾ ਖ਼ਤਰਾ (The Danger of Decisiveness)
AI ਏਜੰਟਾਂ ਵਿੱਚ ਵੱਧ ਤੋਂ ਵੱਧ ਖੁਦਮੁਖਤਿਆਰੀ (autonomy) ਵੱਲ ਇੱਕ ਡਿਜ਼ਾਈਨ ਰੁਝਾਨ ਹੈ। ਇਸ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਵਿੱਚ, ਇੱਕ ਆਦਰਸ਼ ਏਜੰਟ ਉਪਭੋਗਤਾ ਨੂੰ ਕਦੇ ਮਾਮੂਲੀ ਸਵਾਲਾਂ ਨਾਲ ਪਰੇਸ਼ਾਨ ਨਹੀਂ ਕਰਦਾ। ਇਹ ਫੈਸਲਾਕਣ ਵਾਲਾ ਕੰਮ ਕਰਦਾ ਹੈ, ਟੂਲ ਕਾਲਾਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਨਾਲ ਜੋੜਦਾ ਹੈ, ਅਤੇ ਬਿ
ਸ਼ੂਮਰ ਦੇ ਏਜੰਟ ਨੇ ਸੈਂਕੜੇ ਵਾਰ ਸਹੀ ਕੰਮ ਕੀਤਾ ਸੀ। ਉਸ ਰਿਕਾਰਡ ਨੇ ਸੁਰੱਖਿਆ ਦਾ ਇੱਕ ਝੂਠਾ ਅਹਿਸਾਸ ਪੈਦਾ ਕਰ ਦਿੱਤਾ। ਪਰ ਜੇਕਰ 101ਵਾਂ ਪ੍ਰਯੋਗ ਇੱਕ ਅਜਿਹਾ ਅੰਕੜਾਤਮਕ ਅਪਵਾਦ (statistical outlier) ਬਣ ਜਾਵੇ ਜਿੱਥੇ ਪੈਟਰਨ ਟੁੱਟ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸੌ ਪ੍ਰਯੋਗਾਂ ਦੀ ਭਰੋਸੇਯੋਗਤਾ ਦਾ ਕੋਈ ਮਤਲਬ ਨਹੀਂ ਰਹਿ ਜਾਂਦਾ। ਸਿਸਟਮ ਸੁਰੱਖਿਆ ਵਿੱਚ, ਪਿਛਲੀ ਕਾਰਗੁਜ਼ਾਰੀ ਉਦੋਂ ਹੀ ਮਾਇਨੇ ਰੱਖਦੀ ਹੈ ਜੇਕਰ ਅਸਫਲਤਾ ਦਾ ਤਰੀਕਾ ਹੌਲੀ-ਹੌਲੀ ਅਤੇ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਹੋਵੇ। AI ਏਜੰਟ ਦੀਆਂ ਅਸਫਲਤਾਵਾਂ ਅਚਾਨਕ, ਚੁੱਪਚਾਪ ਅਤੇ ਪੂਰੀਆਂ ਹੁੰਦੀਆਂ ਹਨ। “ਇਹ ਸੈਂਕੜੇ ਵਾਰ ਕੰਮ ਕਰਦਾ ਰਿਹਾ” ਕੋਈ ਸੁਰੱਖਿਆ ਰਿਕਾਰਡ ਨਹੀਂ ਹੈ। ਇਹ ਕਿਸਮਤ ਦਾ ਇੱਕ ਵੇਰਵਾ ਹੈ ਜੋ ਅੰਤ ਵਿੱਚ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ।
ਅਸਲ ਸੁਰੱਖਿਆ ਕਿਵੇਂ ਬਣਾਈ ਜਾਵੇ
ਜੇਕਰ ਮਾਡਲ ਸੁਰੱਖਿਆ ਪਰਤ ਨਹੀਂ ਹੈ
