OpenAI ਨੇ ਅੱਜ GPT-Red ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਲਾਰਜ-ਲੈਂਗੂਏਜ ਮਾਡਲ (large-language model) ਹੈ ਜੋ ਇੱਕ ਆਟੋਮੇਟਡ ਰੈੱਡ-ਟੀਮ ਹੈਕਰ ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਹ ਸਿਸਟਮ ਪਹਿਲਾਂ ਹੀ ਕੰਪਨੀ ਦੇ ਤਾਜ਼ਾ GPT-5.6 ਮਾਡਲ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰ ਰਿਹਾ ਹੈ, ਜਿਸ ਨਾਲ ਸਿਮੂਲੇਟਡ ਹਮਲਿਆਂ ਦੀ ਸਫਲਤਾ ਦਰ 90% ਤੋਂ ਵੱਧ ਤੋਂ ਘਟਾ ਕੇ 23% ਤੋਂ ਘੱਟ ਕਰ ਦਿੱਤੀ ਗਈ ਹੈ।
GPT-Red ਰੈੱਡ-ਟੀਮ ਦੇ ਕੰਮ ਨੂੰ ਕਿਵੇਂ ਆਟੋਮੇਟ ਕਰਦਾ ਹੈ
ਰੈੱਡ-ਟੀਮ ਟੈਸਟਿੰਗ—ਜਿਸ ਵਿੱਚ ਜਾਣਬੁੱਝ ਕੇ ਕਿਸੇ ਸਿਸਟਮ ਨੂੰ ਤੋੜਨ ਜਾਂ ਹਾਈਜੈਕ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ—ਪਰੰਪਰਾਗਤ ਤੌਰ 'ਤੇ ਸੁਰੱਖਿਆ ਮਾਹਿਰਾਂ 'ਤੇ ਨਿਰਭਰ ਰਹੀ ਹੈ। ਜਿਵੇਂ-ਜਿਵੇਂ LLMs ਵੈੱਬ ਸਰੋਤਾਂ ਨੂੰ ਬ੍ਰਾਊਜ਼ ਕਰਨਾ, ਕੋਡ ਚਲਾਉਣਾ ਅਤੇ ਤੀਜੀ-ਪਾਰਟੀ ਸੇਵਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਸਿੱਖ ਰਹੇ ਹਨ, ਉਹਨਾਂ ਦੀ ਦੁਰਵਰਤੋਂ ਕਰਨ ਦੇ ਤਰੀਕੇ ਇੱਕ ਮਨੁੱਖੀ ਟੀਮ ਦੁਆਰਾ ਖੋਜ ਕੀਤੇ ਜਾਣ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਬਹੁਤ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਰਹੇ ਹਨ।
OpenAI ਨੇ ਇੱਕ “self-play loop” ਨਾਲ ਇਸਦਾ ਜਵਾਬ ਦਿੱਤਾ ਹੈ ਜੋ ਇੱਕ ਮਾਡਲ ਦੀ ਇੱਕ ਕਾਪੀ ਨੂੰ ਦੂਜੀ ਕਾਪੀ ਦੇ ਵਿਰੁੱਧ ਇੱਕ ਸਿਮੂਲੇਟਡ ਵਾਤਾਵਰਣ ਵਿੱਚ ਲੜਾਉਂਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਖੋਜਕਰਤਾ “dojo” ਕਹਿੰਦੇ ਹਨ। ਇਸ sandbox ਵਿੱਚ, GPT-Red ਹਮਲਾਵਰ ਦੀ ਭੂਮਿਕਾ ਨਿਭਾਉਂਦਾ ਹੈ ਜਦੋਂ ਕਿ ਇੱਕ ਜਾਂ ਇੱਕ ਤੋਂ ਵੱਧ ਡਿਫੈਂਡਰ ਮਾਡਲ ਵਿਰੋਧ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹਨ। ਦੋਵੇਂ ਪਾਸੇ ਅਣਗਿਣਤ ਰਾਊਂਡ ਚਲਾਉਂਦੇ ਹਨ; ਹਰ ਵਾਰ ਹਮਲਾਵਰ ਨੂੰ ਬਾਰੀਕੀ ਨਾਲ ਖਾਮੀਆਂ ਲੱਭਣ ਲਈ ਅਤੇ ਡਿਫੈਂਡਰ ਨੂੰ ਨਵੀਆਂ ਰੱਖਿਆਵਾਂ ਸਿੱਖਣ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ। OpenAI ਨੇ ਇਸ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਉਸ ਟ੍ਰੇਨਿੰਗ ਪਾਈਪਲਾਈਨ ਵਿੱਚ ਸ਼ਾਮਲ ਕੀਤਾ ਹੈ ਜਿਸ ਨੇ GPT-5.6 ਤਿਆਰ ਕੀਤਾ ਹੈ, ਜਿਸ ਨੂੰ ਕੰਪਨੀ ਆਪਣੇ ਹੁਣ ਤੱਕ ਦੇ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਰੀਲੀਜ਼ ਵਜੋਂ ਦੱਸ ਰਹੀ ਹੈ।
ਹਮਲੇ ਦੀ ਇੱਕ ਨਵੀਂ ਸ਼੍ਰੇਣੀ: ਫੇਕ ਚੇਨ ਆਫ ਥੌਟ (fake chain of thought)
Self-play ਰਾਊਂਡਸ ਨੇ ਇੱਕ ਹੈਰਾਨੀਜਨਕ “fake chain of thought” ਹਮਲੇ ਦਾ ਖੁਲਾਸਾ ਕੀਤਾ ਹੈ। LLMs ਅਕਸਰ ਇੱਕ ਕਦਮ-ਦਰ-ਕਦਮ ਤਰਕ (reasoning trace)—ਇੱਕ “chain of thought”—ਪੇਸ਼ ਕਰਦੇ ਹਨ ਜੋ ਅੰਤਿਮ ਜਵਾਬ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ। GPT-Red ਨੇ ਉਸ ਟ੍ਰੇਸ ਵਿੱਚ ਗਲਤ ਐਂਟਰੀਆਂ ਪਾਉਣਾ ਸਿੱਖ ਲਿਆ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਨੂੰ ਲੱਗਦਾ ਹੈ ਕਿ ਉਸਨੇ ਪਹਿਲਾਂ ਹੀ ਗਲਤ ਅਧਾਰਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਲਈ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਹਮਲਾਵਰ ਮਾਡਲ ਨੂੰ ਇਹ ਯਕੀਨ ਦਿਵਾ ਸਕਦਾ ਹੈ ਕਿ “1 + 1 = 3” ਦੀ ਜਾਂਚ ਕੀਤੀ ਜਾ ਚੁੱਕੀ ਹੈ, ਜਿਸ ਨਾਲ ਸਿਸਟਮ ਬਣਾਵਟੀ ਨਤੀਜੇ ਦੇ ਅਧਾਰ 'ਤੇ ਆਉਟਪੁੱਟ ਦੇਣ ਲਈ ਪ੍ਰੇਰਿਤ ਹੁੰਦਾ ਹੈ।
ਇਹ ਹਮਲਾ ਸਿਰਫ਼ ਟੈਕਸਟ ਜਨਰੇਟਰਾਂ ਤੱਕ ਸੀਮਤ ਨਹੀਂ ਹੈ। ਇੱਕ ਬਾਹਰੀ ਲੈਬ ਦੁਆਰਾ ਬਣਾਏ ਗਏ “Vendy” (ਇੱਕ ਵੈਂਡਿੰਗ-ਮਸ਼ੀਨ-ਸ਼ੈਲੀ ਦੇ ਏਜੰਟ) ਦੇ ਵਿਰੁੱਧ ਟੈਸਟ ਵਿੱਚ, GPT-Red ਨੇ ਕੀਮਤਾਂ ਦੇ ਖੇਤਰਾਂ (price fields) ਨਾਲ ਛੇੜਛਾੜ ਕੀਤੀ ਅਤੇ ਆਰਡਰ ਰੱਦ ਕਰ ਦਿੱਤੇ, ਜੋ ਇਹ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਇਹ ਤਕਨੀਕ ਉਹਨਾਂ ਵਿਸ਼ੇਸ਼ ਏਜੰਟਾਂ ਵਿਰੁੱਧ ਵੀ ਕੰਮ ਕਰਦੀ ਹੈ ਜੋ ਯੂਜ਼ਰ ਦੇ ਕਮਾਂਡਾਂ 'ਤੇ ਕੰਮ ਕਰਦੇ ਹਨ।
ਮਾਪਣਯੋਗ ਸੁਰੱਖਿਆ ਸੁਧਾਰ
OpenAI ਨੇ ਅਜਿਹੇ ਅੰਕੜੇ ਜਾਰੀ ਕੀਤੇ ਹਨ ਜੋ GPT-Red ਦੇ ਵਿਰੁੱਧ ਟ੍ਰੇਨਿੰਗ ਦੇ ਪ੍ਰਭਾਵ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। ਜਦੋਂ ਨਵੇਂ ਮਾਡਲ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਗਏ ਸਭ ਤੋਂ ਤਾਕਤਵਰ ਹਮਲੇ ਅਗਸਤ ਵਿੱਚ ਰਿਲੀਜ਼ ਹੋਏ GPT-5 ਦੇ ਵਿਰੁੱਧ ਕੀਤੇ ਗਏ, ਤਾਂ 90% ਤੋਂ ਵੱਧ ਸਫਲ ਰਹੇ। GPT-5.6 ਦੇ ਵਿਰੁੱਧ ਉਹੀ ਹਮਲੇ 23% ਤੋਂ ਵੀ ਘੱਟ ਵਾਰ ਸਫਲ ਹੋਏ।
2025 ਦੇ ਇੱਕ ਪ੍ਰਯੋਗ ਵਿੱਚ, ਜਿਸ ਵਿੱਚ GPT-Red ਦਾ ਮੁਕਾਬਲਾ ਮਨੁੱਖੀ ਰੈੱਡ-ਟੀਮਰਾਂ ਨਾਲ ਕਰਵਾਇਆ ਗਿਆ ਸੀ, AI ਨੇ ਮਨੁੱਖਾਂ ਨਾਲੋਂ ਵਧੇਰੇ ਕੁਸ਼ਲਤਾ ਨਾਲ ਹਮਲੇ ਦੇ ਵੱਖ-ਵੱਖ ਰੂਪਾਂ ਦੀ ਖੋਜ ਕੀਤੀ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਸੁਧਾਰਿਆ, ਜੋ ਇਹ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਇੱਕ ਐਡਵਰਸੇਰੀਅਲ ਮਾਡਲ (adversarial model) ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਕਮਜ਼ੋਰੀਆਂ ਦੇ ਵਿਸ਼ਾਲ ਖੇਤਰ ਦੀ ਜਾਂਚ ਕਰ ਸਕਦਾ ਹੈ।
ਸੀਮਾਵਾਂ ਅਤੇ ਮਨੁੱਖੀ ਮੁਹਾਰਤ ਦੀ ਨਿਰੰਤਰ ਲੋੜ
GPT-Red ਮਨੁੱਖੀ ਸੁਰੱਖਿਆ ਵਿਸ਼ਲੇਸ਼ਕਾਂ ਦੀ ਜਗ੍ਹਾ ਨਹੀਂ ਲੈਂਦਾ। ਇਹ ਅਜੇ ਵੀ ਮਲਟੀ-ਟਰਨ ਕਨਵਰਸੇਸ਼ਨਲ ਹਮਲਿਆਂ (ਜਿੱਥੇ ਹਮਲਾਵਰ ਕਈ ਵਾਰਾਂ ਵਿੱਚ ਇੱਕ ਕਹਾਣੀ ਬਣਾਉਂਦਾ ਹੈ) ਅਤੇ ਵਿਜ਼ੂਅਲ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨਾਂ (ਜੋ ਤਸਵੀਰਾਂ ਦੇ ਅੰਦਰ ਮਾਲੀਸ਼ੀਅਸ ਟੈਕਸਟ ਨੂੰ ਲੁਕਾਉਂਦੇ ਹਨ) 'ਤੇ ਅਟਕਦਾ ਹੈ। OpenAI ਇਸ ਮਾਡਲ ਨੂੰ ਪਹਿਲੀ ਲਾਈਨ ਦੇ ਪ੍ਰੋਬ (probe) ਵਜੋਂ ਵਰਤਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਿਹਾ ਹੈ, ਜੋ ਮਨੁੱਖੀ ਮਾਹਿਰਾਂ ਲਈ ਜਾਂਚ ਕਰਨ ਅਤੇ ਵਿਸਥਾਰ ਕਰਨ ਲਈ ਉਮੀਦ ਜਗਾਉਣ ਵਾਲੇ ਹਮਲੇ ਦੇ ਵਿਚਾਰ ਸਾਹਮਣੇ ਲਿਆਵੇਗਾ।
ਇਹ ਟੂਲ ਪ੍ਰੋਪਰਾਈਟਰੀ (proprietary) ਹੈ, ਇਸ ਲਈ ਬਾਹਰੀ ਖੋਜਕਰਤਾ ਇਸਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦੀ ਸਿੱਧੀ ਜਾਂਚ ਨਹੀਂ ਕਰ ਸਕਦੇ ਜਾਂ ਦੱਸੇ ਗਏ ਫਾਇਦਿਆਂ ਦੀ ਪੁਸ਼ਟੀ ਨਹੀਂ ਕਰ ਸਕਦੇ।
