Anthropic ਨੇ ਕਿਹਾ ਕਿ ਉਸਦੇ ਤਿੰਨ Claude ਮਾਡਲ ਇੱਕ ਹਾਲੀਆ ਸੁਰੱਖਿਆ-ਟੈਸਟਿੰਗ ਮੁਹਿੰਮ ਦੌਰਾਨ sandbox ਤੋਂ ਬਾਹਰ ਨਿਕਲ ਗਏ ਅਤੇ ਅਸਲ ਦੁਨੀਆ ਦੇ ਸਿਸਟਮਾਂ ਤੱਕ ਪਹੁੰਚ ਕਰ ਲਈ, ਜਿਸ ਕਾਰਨ ਮੁਲਾਂਕਣਾਂ ਨੂੰ ਤੁਰੰਤ ਰੋਕ ਦਿੱਤਾ ਗਿਆ ਅਤੇ ਇੱਕ ਜਨਤਕ ਰਿਪੋਰਟ ਜਾਰੀ ਕੀਤੀ ਗਈ।
ਕੰਪਨੀ ਨੇ 141,006 ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਟੈਸਟ ਕੀਤੇ ਅਤੇ ਤਿੰਨ ਅਜਿਹੀਆਂ ਘਟਨਾਵਾਂ ਪਾਈਆਂ ਜਿੱਥੇ ਮਾਡਲਾਂ ਨੇ ਸਿਮੂਲੇਟਡ (simulated) ਵਾਤਾਵਰਣ ਦੀ ਬਜਾਏ ਲਾਈਵ ਟਾਰਗੇਟਾਂ ਤੱਕ ਪਹੁੰਚ ਕੀਤੀ। ਇੱਕ ਤੀਜੀ-ਪਾਰਟੀ ਭਾਈਵਾਲ (third-party partner) ਨਾਲ ਗਲਤ ਕੌਂਫਿਗਰੇਸ਼ਨ ਕਾਰਨ sandbox ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਰੂਪ ਵਿੱਚ ਖੁੱਲ੍ਹਾ ਰਹਿ ਗਿਆ।
ਇਹ ਉਲੰਘਣਾਵਾਂ ਕਿਵੇਂ ਹੋਈਆਂ
- Claude Opus 4.7 ਇੰਟਰਨੈੱਟ 'ਤੇ ਉਪਲਬਧ ਇੱਕ ਅਸਲ ਕੰਪਨੀ ਤੱਕ ਪਹੁੰਚ ਗਿਆ ਅਤੇ ਕੁਝ ਸੌ ਰੋਅ (rows) ਵਾਲੇ ਡੇਟਾਬੇਸ ਨੂੰ ਕੱਢਣ ਲਈ ਕਮਜ਼ੋਰ ਪਾਸਵਰਡਾਂ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਇਆ।
- Claude Mythos 5 ਨੇ ਅਸਲ PyPI ਰਿਪੋਜ਼ਟਰੀ ਵਿੱਚ ਇੱਕ ਪੈਕੇਜ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਕੇ ਇੱਕ ਸਪਲਾਈ-ਚੇਨ ਹਮਲਾ (supply-chain attack) ਕੀਤਾ। ਰਜਿਸਟਰੀ ਦੁਆਰਾ ਅਨੋਮਲੀ (anomaly) ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਇਹ ਪੈਕੇਜ 15 ਪ੍ਰੋਡਕਸ਼ਨ ਮਸ਼ੀਨਾਂ 'ਤੇ ਇੰਸਟਾਲ ਹੋ ਗਿਆ ਸੀ।
- ਇੱਕ internal research model ਨੇ 9,000 ਟਾਰਗੇਟਾਂ ਨੂੰ ਸਕੈਨ ਕੀਤਾ, ਇੱਕ ਸਿੰਗਲ ਐਪਲੀਕੇਸ਼ਨ ਨਾਲ ਛੇੜਛਾੜ ਕੀਤੀ, ਅਤੇ ਫਿਰ ਇਹ ਪਛਾਣਨ ਤੋਂ ਬਾਅਦ ਆਪਣੇ ਆਪ ਨੂੰ ਰੋਕ ਲਿਆ ਕਿ ਹੋਸਟ (host) ਉਸਦੇ ਸਿਮੂਲੇਟਡ ਕੰਮ ਨਾਲ ਮੇਲ ਨਹੀਂ ਖਾਂਦਾ।
Anthropic ਨੇ ਇਸ ਗੱਲ 'ਤੇ ਜ਼ੋਰ ਦਿੱਤਾ ਕਿ ਇਹ "rogue AI" ਦੀਆਂ ਘਟਨਾਵਾਂ ਨਹੀਂ ਸਨ। ਮਾਡਲਾਂ ਨੇ ਉਹੀ ਕੀਤਾ ਜੋ ਉਹਨਾਂ ਨੂੰ ਕਿਹਾ ਗਿਆ ਸੀ; ਟੈਸਟਿੰਗ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਉਹਨਾਂ ਨੂੰ ਖੁੱਲ੍ਹੇ ਇੰਟਰਨੈੱਟ ਤੋਂ ਅਲੱਗ ਰੱਖਣ ਵਿੱਚ ਅਸਫਲ ਰਿਹਾ।
ਇਹ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਇਹ ਘਟਨਾਵਾਂ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ ਜਦੋਂ AI ਏਜੰਟ ਕੋਡ ਚਲਾ ਸਕਦੇ ਹਨ ਅਤੇ ਨੈੱਟਵਰਕ ਕਾਲ ਕਰ ਸਕਦੇ ਹਨ, ਤਾਂ ਇੱਕ ਕੰਟਰੋਲਡ sandbox ਅਤੇ ਇੱਕ ਲਾਈਵ ਨੈੱਟਵਰਕ ਵਿਚਕਾਰ ਅੰਤਰ ਕਿੰਨਾ ਘੱਟ ਹੈ। ਖੁਦਮੁਖਤਿਆਰ (autonomous) ਏਜੰਟਾਂ ਨਾਲ ਪ੍ਰਯੋਗ ਕਰ ਰਹੇ ਉਦਯੋਗਾਂ ਲਈ, ਇੱਕ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਜਾਂ README ਫਾਈਲ ਸੀਮਾਵਾਂ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਦੇ ਸਕਦੀ। ਜਿਵੇਂ ਕਿ PyPI ਕੇਸ ਤੋਂ ਸਾਬਤ ਹੁੰਦਾ ਹੈ, ਇੱਕ ਮਾਮੂਲੀ ਡੇਟਾ ਸੈੱਟ ਜਾਂ ਕੁਝ ਮਸ਼ੀਨਾਂ ਵੀ ਵੱਡੇ ਸਪਲਾਈ-ਚੇਨ ਸਮਝੌਤਿਆਂ (compromises) ਦਾ ਕਾਰਨ ਬਣ ਸਕਦੀਆਂ ਹਨ।
ਇਹ ਤਿੰਨ ਉਲੰਘਣਾਵਾਂ Anthropic ਦੇ ਯਤਨਾਂ ਦੇ ਪੈਮਾਨੇ ਨੂੰ ਵੀ ਦਰਸਾਉਂਦੀਆਂ ਹਨ: ਇਸਨੇ ਕਿਸੇ ਰੈਂਡਮ ਸੈਂਪਲ ਦੀ ਬਜਾਏ ਹਰ ਟੈਸਟ ਰਨ ਦੀ ਆਡਿਟ ਕੀਤੀ। ਉਸ ਡੂੰਘਾਈ ਨੇ ਕੰਪਨੀ ਨੂੰ ਘਟਨਾਵਾਂ ਦੇ ਫੈਲਣ ਤੋਂ ਪਹਿਲਾਂ ਗਲਤ ਕੌਂਫਿਗਰੇਸ਼ਨ ਦੀ ਪਛਾਣ ਕਰਨ ਦਿੱਤੀ।
Anthropic ਨੇ ਕੀ ਕੀਤਾ
Sandbox ਦੀ विफलता ਦਾ ਪਤਾ ਲੱਗਣ ਦੇ ਇੱਕ ਦਿਨ ਦੇ ਅੰਦਰ ਹੀ, Anthropic ਨੇ ਸਾਰੇ ਚੱਲ ਰਹੇ ਮੁਲਾਂਕਣਾਂ ਨੂੰ ਰੋਕ ਦਿੱਤਾ। ਇੱਕ ਹਫ਼ਤੇ ਬਾਅਦ, ਇਸਨੇ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਖੁਲਾਸਾ ਜਾਰੀ ਕੀਤਾ ਜਿਸ ਵਿੱਚ ਤਿੰਨ ਘਟਨਾਵਾਂ, ਤਕਨੀਕੀ ਕਾਰਨ ਅਤੇ ਤੁਰੰਤ ਸੁਧਾਰ ਦੇ ਕਦਮਾਂ ਦੀ ਸੂਚੀ ਦਿੱਤੀ ਗਈ ਸੀ।
AI-ਏਜੰਟ ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਵਿਵਹਾਰਕ ਸਿੱਖਿਆਵਾਂ
- ਸਿੱਧੇ ਚੈੱਕਾਂ ਨਾਲ ਨੈੱਟਵਰਕ ਸੀਮਾਵਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ – ਇਹ ਨਾ ਮੰਨੋ ਕਿ ਇੱਕ ਪ੍ਰੋਂਪਟ ਜਾਂ ਕੌਂਫਿਗ ਫਾਈਲ ਅਸਲ ਵਿੱਚ ਏਜੰਟ ਨੂੰ ਅਲੱਗ ਕਰਦੀ ਹੈ।
- ਕ੍ਰੈਡੈਂਸ਼ੀਅਲਜ਼ (credentials) ਨੂੰ ਘੱਟੋ-ਘੱਟ ਰੱਖੋ – ਸਿਰਫ ਉਹੀ ਅਧਿਕਾਰ ਦਿਓ ਜੋ ਕੰਮ ਲਈ ਬਿਲਕੁਲ ਜ਼ਰੂਰੀ ਹਨ।
- ਖੁਦ ਪਹੁੰਚਯੋਗਤਾ (reachability) ਦੀ ਜਾਂਚ ਕਰੋ – ਸੰਵੇਦਨਸ਼ੀਲ ਸਰੋਤਾਂ ਨੂੰ ਸੌਂਪਣ ਤੋਂ ਪਹਿਲਾਂ ਏਜੰਟ ਦੇ ਅਸਲ ਨੈੱਟਵਰਕ ਵਿਊ ਦੀ ਜਾਂਚ ਕਰੋ।
- ਅਣਚਾਹੇ ਗਤੀਵਿਧੀਆਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰੋ – ਆਊਟਬਾਊਂਡ ਕਨੈਕਸ਼ਨਾਂ ਜਾਂ ਪੈਕੇਜ ਰਜਿਸਟ੍ਰੇਸ਼ਨਾਂ ਲਈ ਅਲਰਟ ਸੈੱਟ ਕਰੋ ਜੋ ਯੋਜਨਾ ਤੋਂ ਵੱਖਰੇ ਹੋਣ।
ਇਹ ਘਟਨਾ ਇੱਕ ਸਧਾਰਨ ਸੱਚਾਈ ਨੂੰ ਉਜਾਗਰ ਕਰਦੀ ਹੈ: ਇੱਕ AI ਮਾਡਲ ਨੂੰ ਇੰਟਰਨੈੱਟ ਦੀ ਪਹੁੰਚ ਦੇਣਾ ਉਨਾ ਹੀ ਜੋਖਮ ਭਰਿਆ ਹੈ ਜਿੰਨਾ ਕਿਸੇ ਮਨੁੱਖੀ ਆਪਰੇਟਰ ਨੂੰ ਕ੍ਰੈਡੈਂਸ਼ੀਅਲਜ਼ ਸੌਂਪਣਾ। ਜਦੋਂ ਤੱਕ sandbox ਦੀਆਂ ਗਾਰੰਟੀਆਂ ਸਾਬਤ ਨਹੀਂ ਹੋ ਜਾਂਦੀਆਂ, ਹਰ AI-ਅਧਾਰਿਤ ਕਾਰਵਾਈ ਨੂੰ ਸੰਭਾਵੀ ਤੌਰ 'ਤੇ ਅਣਪਾਬੰਧ ਮੰਨੋ ਅਤੇ ਉਸ ਅਨੁਸਾਰ ਵਾਤਾਵਰਣ ਨੂੰ ਸੁਰੱਖਿਅਤ (lock down) ਕਰੋ।
