Anthropic ਦੇ Opus 5 ਨੇ ਬ੍ਰਾਊਜ਼ਰ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨਾਂ ਵਿੱਚ ਜ਼ੀਰੋ ਪ੍ਰਤੀਸ਼ਤ ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕੀਤੀ

Anthropic ਨੇ Opus 5 ਦੀ ਰਿਲੀਜ਼ ਨਾਲ AI ਸੁਰੱਖਿਆ ਵਿੱਚ ਇੱਕ ਮਹਾਨ ਉਪਲਬਧੀ ਹਾਸਲ ਕੀਤੀ ਹੈ, ਜੋ ਕਿ ਖੁਦਮੁਖਤਿਆਰ (autonomous) ਏਜੰਟਾਂ ਵਿੱਚ ਸਭ ਤੋਂ ਲਗਾਤਾਰ ਰਹਿਣ ਵਾਲੀਆਂ ਕਮਜ਼ੋਰੀਆਂ ਵਿੱਚੋਂ ਇੱਕ ਨੂੰ ਹੱਲ ਕਰ ਸਕਦੀ ਹੈ। ਇੱਕ ਦੋਹਰੀ-ਪੱਧਰੀ ਰੱਖਿਆ ਪ੍ਰਣਾਲੀ ਨੂੰ ਲਾਗੂ ਕਰਕੇ, ਮਾਡਲ ਨੇ ਬ੍ਰਾਊਜ਼ਰ-ਅਧਾਰਤ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਹਮਲਿਆਂ ਵਿਰੁੱਧ ਲਗਭਗ ਪੂਰੀ ਰੋਧਕ ਸ਼ਕਤੀ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ ਹੈ।

AI ਏਜੰਟਾਂ ਵਿੱਚ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਦਾ ਸੰਕਟ

ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਮੌਜੂਦਾ AI ਯੁੱਗ ਦੀ "Achilles' heel" (ਕਮਜ਼ੋਰ ਬਿੰਦੂ) ਬਣਿਆ ਹੋਇਆ ਹੈ। ਇਹ ਕਮਜ਼ੋਰੀ ਉਦੋਂ ਵਾਪਰਦੀ ਹੈ ਜਦੋਂ ਕੋਈ ਹਮਲਾਵਰ ਕਿਸੇ ਵੈੱਬਪੇਜ ਦੇ ਅੰਦਰ—ਅਕਸਰ ਅਦਿੱਖ ਟੈਕਸਟ ਰਾਹੀਂ—ਦੁਸ਼ਮਣ ਭਰੇ ਨਿਰਦੇਸ਼ ਛੁਪਾ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਇੱਕ AI ਏਜੰਟ ਬ੍ਰਾਊਜ਼ਿੰਗ ਦੌਰਾਨ ਪੜ੍ਹਦਾ ਹੈ। ਇੱਕ ਵਾਰ ਪ੍ਰੋਸੈਸ ਹੋਣ ਤੋਂ ਬਾਅਦ, ਇਹ ਨਿਰਦੇਸ਼ ਮਾਡਲ ਨੂੰ ਹਾਈਜੈਕ ਕਰ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਉਹ ਸੁਰੱਖਿਆ ਪ੍ਰੋਟੋਕੋਲ ਨੂੰ ਤੋੜਨ ਜਾਂ ਅਣਅਧਿਕਾਰਤ ਕਾਰਵਾਈਆਂ ਕਰਨ ਲਈ ਮਜਬੂਰ ਹੋ ਜਾਂਦਾ ਹੈ। ਹਾਲਾਂਕਿ OpenAI ਵਰਗੇ ਉਦਯੋਗ ਦੇ ਮੋਹਰੀਆਂ ਨੇ ਪਹਿਲਾਂ ਸੁਝਾਅ ਦਿੱਤਾ ਸੀ ਕਿ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ LLMs ਦੀ ਇੱਕ ਅਣਸੁਲਝੀ ਮੌਲਿਕ ਖਾਮੀ ਹੋ ਸਕਦੀ ਹੈ, Anthropic ਦਾ ਤਾਜ਼ਾ ਡੇਟਾ ਉਸ ਨਿਰਾਸ਼ਾਵਾਦੀ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਨੂੰ ਚੁਣੌਤੀ ਦਿੰਦਾ ਹੈ।

ਜ਼ੀਰੋ ਪ੍ਰਤੀਸ਼ਤ ਬੈਂਚਮਾਰਕ ਪ੍ਰਾਪਤ ਕਰਨਾ

Anthropic ਦੇ ਸਿਸਟਮ ਕਾਰਡ ਅਨੁਸਾਰ, Opus 5 ਨੇ ਬ੍ਰਾਊਜ਼ਰ ਏਜੰਟਾਂ ਲਈ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਤਿਆਰ ਕੀਤੇ ਗਏ 129 ਵੱਖ-ਵੱਖ ਟੈਸਟ ਸਥਿਤੀਆਂ ਵਿੱਚ ਹੈਰਾਨੀਜਨਕ 0% ਹਮਲਾ ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕੀਤੀ। ਇਹ ਪਿਛਲੇ ਵਰਜ਼ਨਾਂ ਦੇ ਮੁਕਾਬਲੇ ਇੱਕ ਵੱਡੀ ਛਾਲ ਹੈ। ਸੁਰੱਖਿਆ ਫਰਮ Gray Swan ਦੁਆਰਾ ਕੀਤੇ ਗਏ ਆਮ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਟੈਸਟਿੰਗ ਵਿੱਚ, Opus 5 ਨੇ ਆਪਣੇ ਪਿਛਲੇ ਮਾਡਲ ਦੇ ਮੁਕਾਬਲੇ ਕਾਫ਼ੀ ਸੁਧਾਰ ਦਿਖਾਇਆ; 15 ਕੋਸ਼ਿਸ਼ਾਂ ਤੋਂ ਬਾਅਦ, ਹਮਲਾਵਰ ਦੀ ਸਫਲਤਾ ਦਰ 5.5% (ਜੋ Opus 4.8 ਵਿੱਚ ਦੇਖੀ ਗਈ ਸੀ) ਤੋਂ ਘਟ ਕੇ ਸਿਰਫ਼ 2.0% ਰਹਿ ਗਈ।

ਇਹ ਪ੍ਰਦਰਸ਼ਨ Opus 5 ਨੂੰ Gray Swan IPI ਬੈਂਚਮਾਰਕ ਦੇ ਸਿਖਰ 'ਤੇ ਰੱਖਦਾ ਹੈ, ਜੋ Mythos 5 (2.6%) ਅਤੇ Fable 5 (2.8%) ਵਰਗੇ ਹੋਰ ਉੱਚ-ਦਰਜੇ ਦੇ ਮਾਡਲਾਂ ਤੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ।

ਅਸਲੀ ਕਾਰਨ: Auto Mode ਅਤੇ ਦੋਹਰੀ-ਪੱਧਰੀ ਰੱਖਿਆ

ਇਹ ਉਪਲਬਧੀ ਸਿਰਫ਼ ਮਾਡਲ ਦੀ ਬੁੱਧੀ ਕਾਰਨ ਨਹੀਂ ਹੈ, ਸਗੋਂ ਵਿਸ਼ੇਸ਼ ਸਾਫਟਵੇਅਰ ਨਾਲ ਇਸਦੇ ਇੱਕੀਕਰਨ ਕਾਰਨ ਹੈ। "ਜ਼ੀਰੋ ਪ੍ਰਤੀਸ਼ਤ" ਸਫਲਤਾ ਦਰ ਖਾਸ ਤੌਰ 'ਤੇ Claude Cowork ਵਰਗੇ ਉਤਪਾਦਾਂ ਵਿੱਚ Auto Mode ਦੀ ਵਰਤੋਂ ਨਾਲ ਜੁੜੀ ਹੋਈ ਹੈ। Anthropic ਏਜੰਟ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖਣ ਲਈ ਇੱਕ ਉੱਨਤ ਦੋ-ਪੱਧਰੀ ਰੱਖਿਆ ਆਰਕੀਟੈਕਚਰ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ:

  1. Pre-processing Scan: ਇੱਕ ਸਮਰਪਿਤ ਪੱਧਰ ਮੁੱਖ LLM ਦੁਆਰਾ ਟੈਕਸਟ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਸਾਰੇ ਆਉਣ ਵਾਲੇ ਡੇਟਾ ਦੀ ਲੁਕੀਆਂ ਹੋਈਆਂ ਜਾਂ ਹੇਰਾਫੇਰੀ ਵਾਲੀਆਂ ਹਦਾਇਤਾਂ ਲਈ ਜਾਂਚ ਕਰਦਾ ਹੈ।
  2. Execution Blocking: ਇੱਕ ਦੂਜਾ ਪੱਧਰ ਏਜੰਟ ਦੀਆਂ ਇਰਾਦਤਨ ਕੀਤੀਆਂ ਕਾਰਵਾਈਆਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਦਾ ਹੈ, ਅਤੇ ਬ੍ਰਾਊਜ਼ਰ ਵਾਤਾਵਰਣ ਵਿੱਚ ਲਾਗੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਕਿਸੇ ਵੀ ਖ਼ਤਰਨਾਕ ਕਮਾਂਡ ਨੂੰ ਰੋਕ ਦਿੰਦਾ ਹੈ।

ਦਿਲਚਸਪ ਗੱਲ ਇਹ ਹੈ ਕਿ ਡੇਟਾ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਸਿਰਫ਼ ਮਾਡਲ ਹੀ ਸਭ ਕੁਝ ਠੀਕ ਨਹੀਂ ਕਰ ਸਕਦਾ। ਇਹਨਾਂ ਸੁਰੱਖਿਆ ਸਾਫਟਵੇਅਰ ਪੱਧਰਾਂ ਤੋਂ ਬਿਨਾਂ, Opus 5 ਦੀ ਕਮਜ਼ੋਰੀ 3.7% ਹੈ। ਅਸਲ ਵਿੱਚ, ਵਿਸ਼ੇਸ਼ Sonnet 5 ਮਾਡਲ ਇਕੱਲੇ 0.93% ਸਫਲਤਾ ਦਰ ਦੇ ਨਾਲ ਥੋੜ੍ਹਾ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ। ਇਹ ਕੋਰ ਮਾਡਲ ਅਤੇ ਰੱਖਿਆਤਮਕ ਸਾਫਟਵੇਅਰ ਸਟੈਕ ਵਿਚਕਾਰ ਸਾਂਝ (synergy) ਹੀ ਹੈ ਜੋ ਸੁਰੱਖਿਆ ਦੀ ਸੀਮਾ ਨੂੰ ਲਗਭਗ ਸੰਪੂਰਨਤਾ ਤੱਕ ਲੈ ਜਾਂਦੀ ਹੈ।

ਇਹ AI ਦੇ ਭਵਿੱਖ ਲਈ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਖੁਦਮੁਖਤਿਆਰ AI ਏਜੰਟ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਸੰਸਥਾਪਕਾਂ ਲਈ, ਇਹ ਵਿਕਾਸ ਇੱਕ ਵੱਡਾ ਬਦਲਾਅ (paradigm shift) ਹੈ। ਜੇਕਰ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਨੂੰ ਸਿਰਫ਼ ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ ਦੀ ਬਜਾਏ ਆਰਕੀਟੈਕਚਰਲ ਪੱਧਰਾਂ ਰਾਹੀਂ ਨਿਰਸਥਾਪਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਤਾਂ ਭਰੋਸੇਯੋਗ, "agentic" ਵਰਕਫਲੋਜ਼—ਜਿੱਥੇ AI ਈਮੇਲਾਂ, ਬ੍ਰਾਊਜ਼ਰਾਂ ਅਤੇ ਸੰਵੇਦਨਸ਼ੀਲ ਡੇਟਾ ਦਾ ਪ੍ਰਬੰਧਨ ਕਰਦਾ ਹੈ—ਦਾ ਰਸਤਾ ਬਹੁਤ ਸੁਰੱਖਿਅਤ ਹੋ ਜਾਂਦਾ ਹੈ। Anthropic ਨੇ ਇੱਕ ਨਕਸ਼ਾ (blueprint) ਪ੍ਰਦਾਨ ਕੀਤਾ ਹੈ ਕਿ ਕਿਵੇਂ ਉਦਯੋਗ "ਅਣਸੁਲਝੀ" ਕਹਾਣੀ ਤੋਂ ਅੱਗੇ ਵਧ ਕੇ ਮਜ਼ਬੂਤ, ਉਤਪਾਦਨ-ਤਿਆਰ (production-ready) AI ਖੁਦਮੁਖਤਿਆਰੀ ਵੱਲ ਵਧ ਸਕਦਾ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਉਦਯੋਗ-ਮੋਹਰੀ ਸੁਰੱਖਿਆ: Auto Mode ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਸਮੇਂ Opus 5 ਨੇ 129 ਬ੍ਰਾਊਜ਼ਰ-ਅਧਾਰਤ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਸਥਿਤੀਆਂ ਵਿੱਚ 0% ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕੀਤੀ।
  • Defense-in-Depth: ਸੁਰੱਖਿਆ ਪ੍ਰੀ-ਪ੍ਰੋਸੈਸਿੰਗ ਡੇਟਾ ਸਕੈਨ ਅਤੇ ਸਰਗਰਮ ਕਾਰਵਾਈ ਰੋਕਣ ਵਾਲੇ ਦੋਹਰੇ-ਪੱਧਰੀ ਪਹੁੰਚ ਰਾਹੀਂ ਪ੍ਰਾਪਤ ਕੀਤੀ ਗਈ ਹੈ।
  • ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਦਬਦਬਾ: Opus 5 Gray Swan IPI ਬੈਂਚਮਾਰਕ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ, ਜੋ ਪਿਛਲੇ ਮਾਡਲ ਵਰਜ਼ਨਾਂ ਦੇ ਮੁਕਾਬਲੇ ਹਮਲਾਵਰ ਦੀ ਸਫਲਤਾ ਦਰ ਨੂੰ ਕਾਫ਼ੀ ਘਟਾਉਂਦਾ ਹੈ।