OpenAI ਨੇ 15 ਜੁਲਾਈ, 2026 ਨੂੰ GPT-Red ਲਾਂਚ ਕੀਤਾ, ਜੋ ਕਿ ਇੱਕ ਅੰਦਰੂਨੀ ਮਾਡਲ ਹੈ ਜੋ ਆਪਣੀਆਂ ਆਉਟਪੁੱਟਸ (outputs) ਵਿੱਚ ਕਮਜ਼ੋਰੀਆਂ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ। ਅੰਦਰੂਨੀ ਟੈਸਟਿੰਗ ਵਿੱਚ, GPT-Red ਨੇ GPT-5.6 Sol ਲਾਈਨ ਵਿੱਚ ਅਸਫਲਤਾਵਾਂ ਨੂੰ ਛੇ ਗੁਣਾ ਤੱਕ ਘਟਾਉਣ ਵਿੱਚ ਮਦਦ ਕੀਤੀ, ਇੱਕ ਅਜਿਹੀ ਪ੍ਰਾਪਤੀ ਜੋ ਡਿਵੈਲਪਰਾਂ ਦੇ ਪ੍ਰੋਂਪਟ-ਇੰਜੈਕਸ਼ਨ ਸੁਰੱਖਿਆ (prompt-injection safety) ਬਾਰੇ ਸੋਚਣ ਦੇ ਤਰੀਕੇ ਨੂੰ ਬਦਲ ਸਕਦੀ ਹੈ।

ਹਾਲਾਂਕਿ, ਇਹ ਖੋਜ OpenAI ਦੀਆਂ ਕੰਧਾਂ ਦੇ ਅੰਦਰ ਤੱਕ ਸੀਮਤ ਹੈ। ਮਾਡਲ ਅਤੇ ਇਸਦਾ ਸੇਫਟੀ ਸਕੋਰ (safety score) ਡਾਊਨਲੋਡ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ, ਅਤੇ ਪੇਪਰ ਕੋਈ ਤਿਆਰ ਟੂਲਸੈੱ

OpenAI ਦਾ GPT-Red ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਯੋਜਨਾਬੱਧ ਵਿਰੋਧੀ ਟੈਸਟਿੰਗ (systematic adversarial testing) ਅਸਫਲਤਾ ਦੀ ਦਰ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਘਟਾ ਸਕਦੀ ਹੈ। ਛੋਟੀਆਂ ਟੀਮਾਂ ਪੂਰੇ ਰਿਸਰਚ ਸਟੈਕ ਦੀ ਨਕਲ ਕੀਤੇ ਬਿਨਾਂ, ਹਰ ਦੇਖੇ ਗਏ ਹਮਲੇ ਨੂੰ ਇੱਕ ਸੰਰਚਿਤ ਅਤੇ ਨਿਸ਼ਚਿਤ ਟੈਸਟ (structured, deterministic test) ਵਿੱਚ ਬਦਲ ਕੇ, ਜੋ CI ਵਿੱਚ ਚੱਲਦਾ ਹੈ, ਉਸ ਲਾਭ ਨੂੰ ਹਾਸਲ ਕਰ ਸਕਦੀਆਂ ਹਨ। ਮੈਟ੍ਰਿਕਸ ਦੇ ਇੱਕ ਘੱਟਤਮ ਸਮੂਹ ਦੁਆਰਾ ਸਮਰਥਿਤ, fail-prove-fix-prove ਦਾ ਇੱਕ ਅਨੁਸ਼ਾਸਿਤ ਲੂਪ, ਇੱਕ ਰਿਸਰਚ ਪੇਪਰ ਨੂੰ ਰੋਜ਼ਾਨਾ ਦੀ ਸੁਰੱਖਿਆ ਅਭਿਆਸ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ।