ਕਲਪਨਾ ਕਰੋ ਕਿ ਤੁਸੀਂ ਇੱਕ ਵਿੱਤੀ ਸੇਵਾਵਾਂ ਦੀ ਫਰਮ ਵਿੱਚ ਇੱਕ ਸੀਨੀਅਰ ਐਪਲੀਕੇਸ਼ਨ ਸੁਰੱਖਿਆ ਇੰਜੀਨੀਅਰ ਹੋ। ਤੁਸੀਂ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ ਵਿਕਸਤ ਕੀਤੇ ਗਏ ਪ੍ਰਮਾਣਿਕਤਾ ਕੋਡ (authentication code) ਦਾ ਇੱਕ ਟੁਕੜਾ ਇੱਕ ਫਰੰਟੀਅਰ AI ਮਾਡਲ ਵਿੱਚ ਪਾਉਂਦੇ ਹੋ ਅਤੇ ਇਸਨੂੰ ਲੌਜਿਕ ਫਲੌਜ਼ (logic flaws) ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਕਹਿੰਦੇ ਹੋ। ਵਿਸ਼ਲੇਸ਼ਣ ਦੀ ਬਜਾਏ, ਤੁਹਾਨੂੰ ਇੱਕ ਲੈਕਚਰ ਮਿਲਦਾ ਹੈ। ਮਾਡਲ ਇਸ ਅਧਾਰ 'ਤੇ ਇਨਕਾਰ ਕਰ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਇਸ ਜਾਣਕਾਰੀ ਦੀ ਵਰਤੋਂ "ਸਿਸਟਮ ਨੂੰ ਐਕਸਪਲੋਇਟ (exploit)" ਕਰਨ ਲਈ ਕਰ ਸਕਦੇ ਹੋ। ਤੁਸੀਂ ਕੋਈ ਅਪਰਾਧੀ ਨਹੀਂ ਹੋ। ਤੁਸੀਂ ਉਹ ਵਿਅਕਤੀ ਹੋ ਜਿਸਨੂੰ ਅਪਰਾਧੀਆਂ ਨੂੰ ਰੋਕਣ ਲਈ ਨੌਕਰੀ 'ਤੇ ਰੱਖਿਆ ਗਿਆ ਹੈ। ਫਿਰ ਵੀ, ਗਾਰਡਰੇਲ (guardrail) ਦੋਵਾਂ ਭੂਮਿਕਾਵਾਂ ਨੂੰ ਅਲੱਗ-ਅਲੱਗ ਨਹੀਂ ਮੰਨਦਾ।

ਇਹ ਸਥਿਤੀ ਰੁਟੀਨ ਬਣਦੀ ਜਾ ਰਹੀ ਹੈ। ਜਿਵੇਂ-ਜਿਵੇਂ ਵੱਡੀਆਂ AI ਲੈਬਾਂ ਦੁਰਭਾਗਜਨਕ ਦੁਰਵਰਤੋਂ ਨੂੰ ਰੋਕਣ ਲਈ ਸੁਰੱਖਿਆ ਪ੍ਰੋਟੋਕੋਲ ਨੂੰ ਸਖ਼ਤ ਕਰ ਰਹੀਆਂ ਹਨ, ਉਹ ਜਾਇਜ਼ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਪੇਸ਼ੇਵਰਾਂ ਦੇ ਕੰਮ ਦੇ ਤਰੀਕਿਆਂ ਨਾਲ ਸਿੱਧਾ ਟਕਰਾ ਰਹੀਆਂ ਹਨ। ਨਤੀਜਾ ਇੱਕ ਵਧਦਾ ਹੋਇਆ ਵਿਰੋਧਾਭਾਸ ਹੈ: ਉਹ ਸਾਧਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਲਈ ਸ਼ਕਤੀ ਵਧਾਉਣ ਵਾਲੇ ਸਾਧਨਾਂ ਵਜੋਂ ਪ੍ਰਮੋਟ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਉਹ ਉਨ੍ਹਾਂ ਮਾਹਰਾਂ ਤੋਂ ਰੋਕੇ ਜਾ ਰਹੇ ਹਨ ਜੋ ਮਹੱਤਵਪੂਰਨ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੀ ਰੱਖਿਆ ਕਰਦੇ ਹਨ।

ਸੁਰੱਖਿਆ (Safety) ਅਤੇ ਸੁਰੱਖਿਆ (Security) ਵਿਚਕਾਰ ਰਗੜ

ਪ੍ਰਮੁੱਖ AI ਡਿਵੈਲਪਰਾਂ ਨੇ ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਭਾਈਚਾਰੇ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਜ਼ਰਅੰਦਾਜ਼ ਨਹੀਂ ਕੀਤਾ ਹੈ। OpenAI Trusted Access for Cyber ਨਾਮ ਦਾ ਇੱਕ ਪ੍ਰੋਗਰਾਮ ਚਲਾਉਂਦਾ ਹੈ। Anthropic ਇੱਕ Cyber Verification Program ਚਲਾਉਂਦਾ ਹੈ। ਦੋਵੇਂ ਇਸ ਤਰ੍ਹਾਂ ਤਿਆਰ ਕੀਤੇ ਗਏ ਹਨ ਤਾਂ ਜੋ ਪ੍ਰਮਾਣਿਤ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਕੁਝ ਇਨਕਾਰ ਕਰਨ ਵਾਲੇ ਮਕੈਨਿਜ਼ਮਾਂ ਤੋਂ ਬਚਣ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲ ਸਕੇ ਤਾਂ ਜੋ ਉਹ ਜਾਇਜ਼ ਖੋਜ ਕਰ ਸਕਣ। ਸਿਧਾਂਤਕ ਤੌਰ 'ਤੇ, ਇਹ ਦਰਵਾਜ਼ੇ ਚੰਗੇ ਕਾਰਜਕਰਤਾਵਾਂ ਨੂੰ ਬੁਰੇ ਕਾਰਜਕਰਤਾਵਾਂ ਤੋਂ ਵੱਖ ਕਰਦੇ ਹਨ।

ਅਭਿਆਸ ਵਿੱਚ, ਕਈ ਆਫੈਂਸਿਵ ਸੁਰੱਖਿਆ ਖੋਜਕਰਤਾ ਅਤੇ ਨੈੱਟਵਰਕ ਰੱਖਿਅਕ ਇਸਨੂੰ ਦਫ਼ਤਰੀ ਰੁਕਾਵਟਾਂ ਵਜੋਂ ਮਹਿਸੂਸ ਕਰਦੇ ਹਨ। ਵੈਰੀਫਿਕੇਸ਼ਨ ਪ੍ਰਕਿਰਿਆਵਾਂ ਅਸਪਸ਼ਟ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮਨਜ਼ੂਰੀ ਦੇ ਸਮੇਂ ਬਾਰੇ ਸਪੱਸ਼ਟਤਾ ਨਹੀਂ ਹੁੰਦੀ। ਸਵੀਕਾਰਤਾ ਤੋਂ ਬਾਅਦ ਵੀ, ਖੋਜਕਰਤਾ ਦੱਸਦੇ ਹਨ ਕਿ ਵਧਿਆ ਹੋਇਆ ਐਕਸੈਸ ਹਮੇਸ਼ਾ ਵੱਖ-ਵੱਖ ਮਾਡਲ ਵਰਜਨਾਂ ਜਾਂ ਗੱਲਬਾਤ ਦੇ ਥ੍ਰੈਡਾਂ ਵਿੱਚ ਭਰੋਸੇਯੋਗ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਨਹੀਂ ਕਰਦਾ। ਉਹ ਟੀਮਾਂ ਜੋ ਸਰਗਰਮ ਐਕਸਪਲੋਇਟੇਸ਼ਨ ਦੇ ਅਧੀਨ ਕਮੀਆਂ (vulnerabilities) ਨੂੰ ਪੈਚ ਕਰਨ ਲਈ ਦੌੜ ਰਹੀਆਂ ਹਨ, ਉਨ੍ਹਾਂ ਲਈ ਇਹ ਰਗੜ ਮਾਇਨੇ ਰੱਖਦੀ ਹੈ।

ਵਾਸ਼ਿੰਗਟਨ ਅਤੇ ਸਿਲੀਕਾਨ ਵੈਲੀ ਵਿਚਕਾਰ ਤਣਾਅ ਉਦੋਂ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਮੋੜ 'ਤੇ ਪਹੁੰਚ ਗਿਆ ਜਦੋਂ ਅਮਰੀਕੀ ਸਰਕਾਰ ਨੇ Anthropic ਦੇ Mythos ਅਤੇ Fable ਮਾਡਲਾਂ 'ਤੇ ਨਿਰਯਾਤ ਕੰਟਰੋਲ ਲਗਾ ਦਿੱਤਾ। ਇਹ ਪਾਬੰਦੀਆਂ ਉਨ੍ਹਾਂ ਰਿਪੋਰਟਾਂ ਤੋਂ ਬਾਅਦ ਲਗਾਈਆਂ ਗਈਆਂ ਸਨ ਕਿ ਵਿਅਕਤੀਆਂ ਨੇ ਸਾਈਬਰ ਹਮਲਿਆਂ ਦੀ ਸਹੂਲਤ ਲਈ ਮਾਡਲਾਂ ਦੇ ਸੁਰੱਖਿਆ ਗਾਰਡਰੇਲਾਂ ਨੂੰ ਬਾਈਪਾਸ ਕੀਤਾ ਸੀ। ਨਿਯਮਕਾਂ ਨੇ ਇਹਨਾਂ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਵਿਲੱਖਣ ਤੌਰ 'ਤੇ ਖ਼ਤਰਨਾਕ ਨਿਰਯਾਤ ਵਸਤੂਆਂ ਵਜੋਂ ਮੰਨਣ ਲਈ ਤੇਜ਼ੀ ਨਾਲ ਕਦਮ ਚੁੱਕੇ। ਇਹ ਕੰਟਰੋਲ ਉਦੋਂ ਤੋਂ ਹਟਾ ਦਿੱਤੇ ਗਏ ਹਨ ਜਾਂ ਸੋਧੇ ਗਏ ਹਨ, ਪਰ ਇਸ ਘਟਨਾ ਨੇ ਇੱਕ ਸਪੱਸ਼ਟ ਸੰਕੇਤ ਦਿੱਤਾ: ਉੱਚ-ਯੋਗਤਾ ਵਾਲੇ AI ਮਾਡਲਾਂ ਨੂੰ ਆਮ ਉਦੇਸ਼ ਵਾਲੇ ਤਕਨੀਕੀ ਸਾਧਨਾਂ ਦੀ ਬਜਾਏ ਵਧੇਰੇ ਸੰਭਾਵੀ 'ਡੂਮਸਡੇ ਡਿਵਾਈਸ' (doomsday devices) ਵਜੋਂ ਦੇਖਿਆ ਜਾ ਰਿਹਾ ਹੈ। ਉਨ੍ਹਾਂ ਰੱਖਿਅਕਾਂ ਲਈ ਜੋ ਉਹਨਾਂ 'ਤੇ ਨਿਰਭਰ ਹਨ, ਉਹ ਅਨੁਭਵ ਵਧੇਰੇ ਜਾਂਚ, ਹੌਲੀ ਐਕਸੈਸ, ਅਤੇ ਇੱਕ ਅੰਦਰੂਨੀ ਸ਼ੱਕ ਵਿੱਚ ਬਦਲ ਜਾਂਦਾ ਹੈ ਕਿ ਸੁਰੱਖਿਆ ਖੋਜ ਸਿਰਫ਼ ਇੱਕ ਹੋਰ ਨਾਮ ਹੇਠ ਹੈਕਿੰਗ ਹੈ।

ਰੱਖਿਆ (Defense) ਅਤੇ ਹਮਲਾ (Offense) ਅਟੁੱਟ ਕਿਉਂ ਹਨ

ਟਕਰਾਅ ਦਾ ਕੇਂਦਰ ਪ੍ਰਸ਼ਾਸਨਿਕ ਨਹੀਂ ਹੈ। ਇਹ ਤਕਨੀਕੀ ਹੈ। ਇੱਕ ਨੈੱਟਵਰਕ ਦੀ ਰੱਖਿਆ ਕਰਨ ਲਈ ਲੋੜੀਂਦੀਆਂ ਸਮਾਨ ਸਮਰੱਥਾਵਾਂ ਹਮਲਾ ਕਰਨ ਲਈ ਲੋੜੀਂਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦੇ ਲਗਭਗ ਇੱਕੋ ਜਿਹੀਆਂ ਹਨ।

NCC Group ਦੇ ਚੀਫ ਸਾਇੰਟਿਸਟ ਕ੍ਰਿਸ ਐਨਲੀ ਇੱਕ ਸਧਾਰਨ ਉਦਾਹਰਣ ਦਿੰਦੇ ਹਨ: AI ਇੱਕ ਹਥੌੜਾ ਹੈ। ਤੁਸੀਂ ਇਸਦੀ ਵਰਤੋਂ ਘਰ ਬਣਾਉਣ ਲਈ ਜਾਂ ਖਿੜਕੀ ਤੋੜਨ ਲਈ ਕਰ ਸਕਦੇ ਹੋ। ਸਾਧਨ ਨੂੰ ਖੁਦ ਅੰਤਰ ਨਹੀਂ ਪਤਾ ਹੁੰਦਾ। ਸਾਈਬਰ ਸੁਰੱਖਿਆ ਵਿੱਚ, ਇਹ ਦੁਵਿਧਾ ਅਟਲ ਹੈ। ਜਦੋਂ ਕੋਈ ਅਭਿਆਸਕਰਤਾ ਮਾਡਲ ਨੂੰ "ਇਸ ਕੋਡ ਨੂੰ ਠੀਕ ਕਰੋ" ਕਹਿੰਦਾ ਹੈ, ਤਾਂ ਬੇਨਤੀ ਇੱਕ ਰੱਖਿਆਤਮਕ ਕਾਰਵਾਈ ਨੂੰ ਟ੍ਰਿਗਰ ਕਰਦੀ ਹੈ। ਪਰ ਉਹ ਤਰਕ ਪ੍ਰਕਿਰਿਆ ਜੋ ਫਿਕਸ ਪੈਦਾ ਕਰਦੀ ਹੈ—ਅਸੁਰੱਖਿਅਤ ਫੰਕਸ਼ਨਾਂ ਦੀ ਪਛਾਣ ਕਰਨਾ, ਅਭਿਮਤ (untrusted) ਇਨਪੁਟ ਦਾ ਪਤਾ ਲਗਾਉਣਾ, ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਫਲੋਅ ਦਾ ਨਕਸ਼ਾ ਤਿਆਰ ਕਰਨਾ—ਅਟਲ ਤੌਰ 'ਤੇ ਇਹ ਪ੍ਰਗਟ ਕਰਦੀ ਹੈ ਕਿ ਕਮੀ (vulnerability) ਨੂੰ ਕਿਵੇਂ ਟ੍ਰਿਗਰ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਵਿਆਖਿਆ ਐਕਸਪਲੋਇਟੇਸ਼ਨ ਲਈ ਇੱਕ ਰੋਡਮੈਪ ਵਜੋਂ ਕੰਮ ਕਰਦੀ ਹੈ।

ਕਿਉਂਕਿ AI ਸੁਰੱਖਿਆ ਟੀਮਾਂ ਅਕਸਰ ਮਾਡਲਾਂ ਨੂੰ ਕਿਸੇ ਵੀ ਅਜਿਹੇ ਪ੍ਰੋਂਪਟ ਨੂੰ ਇਨਕਾਰ ਕਰਨ ਲਈ ਸਿਖਲਾਈ ਦਿੰਦੀਆਂ ਹਨ ਜਿਸ ਵਿੱਚ ਐਕਸਪਲੋਇਟੇਸ਼ਨ ਦੀ ਗੰਧ ਆਉਂਦੀ ਹੈ, ਪ੍ਰਣਾਲੀਆਂ ਅਕਸਰ ਜ਼ਿਆਦਾ ਸੁਧਾਰ (overcorrect) ਕਰਦੀਆਂ ਹਨ। ਇੱਕ ਖੋਜਕਰਤਾ ਜੋ ਇਹ ਪੁੱਛ ਰਿਹਾ ਹੈ ਕਿ ਯੂਜ਼ਰ ਇਨਪੁਟ ਨੂੰ ਕਿਵੇਂ ਸਾਫ਼ (sanitize) ਕੀਤਾ ਜਾਵੇ, ਉਸਨੂੰ ਜਵਾਬ ਮਿਲਦਾ ਹੈ। ਇੱਕ ਖੋਜਕਰਤਾ ਜੋ ਪੁੱਛ ਰਿਹਾ ਹੈ ਕਿ ਕਿਵੇਂ ਇੱਕ