ਦੁਰਵਰਤੋਂ ਦਾ ਪਤਾ ਕਿਵੇਂ ਲੱਗਾ

Anthropic ਦੀ ਅੰਦਰੂਨੀ ਨਿਗਰਾਨੀ ਨੇ "ਦੋਹਰੇ ਉਦੇਸ਼" (dual-use) ਵਾਲੀਆਂ ਬੇਨਤੀਆਂ ਦੀ ਇੱਕ ਲੜੀ ਨੂੰ ਫੜਿਆ—ਅਜਿਹੀਆਂ ਬੇਨਤੀਆਂ ਜੋ ਜਾਇਜ਼ ਖੋਜ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀਆਂ ਹਨ ਪਰ ਨੁਕਸਾਨਦੇਹ ਉਪਯੋਗਾਂ ਨੂੰ ਵੀ ਸਮਰੱਥ ਬਣਾ ਸਕਦੀਆਂ ਹਨ। ਇੱਕ ਖੋਜਕਰਤਾ ਨੇ Claude ਨੂੰ ਅਜਿਹੇ ਮਿਊਟੇਸ਼ਨ (mutations) ਡਿਜ਼ਾਈਨ ਕਰਨ ਲਈ ਕਿਹਾ ਜੋ Chikungunya ਵਾਇਰਸ ਨੂੰ ਵਧੇਰੇ ਪ੍ਰਸਾਰਿਤ ਕਰਨ ਯੋਗ ਬਣਾ ਸਕਣ। ਬੇਨਤੀ ਦੀ ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਜਿਉਂਦੇ ਜਾਨਵਰਾਂ 'ਤੇ ਵਾਰ-ਵਾਰ ਕੀਤੇ ਗਏ ਟੈਸਟਾਂ ਨੇ ਇੱਕ ਫੌਜੀ ਖੋਜ ਦੇ ਸੰਦਰਭ ਵੱਲ ਇਸ਼ਾਰਾ ਕੀਤਾ, ਨਾ ਕਿ ਜਨਤਕ ਸਿਹਤ ਦੇ ਯਤਨ ਵੱਲ। ਅਸਲ ਇਰਾਦੇ ਨੂੰ ਛੁਪਾਉਣ ਲਈ, ਉਪਭੋਗਤਾ ਨੇ ਧੋਖਾਧੜੀ ਵਾਲੀ ਭਾਸ਼ਾ ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਜਿਸ ਕਾਰਨ Anthropic ਨੂੰ ਆਪਣੇ ਨਵੇਂ ਅਤੇ ਵਧੇਰੇ ਸਮਰੱਥ ਮਾਡਲਾਂ 'ਤੇ ਜੀਵਿਕ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਨੂੰ ਸਖ਼ਤ ਕਰਨ ਲਈ ਮਜਬੂਰ ਹੋਣਾ ਪਿਆ।

ਸਮਾਨਾਂਤਰ ਜਾਂਚਾਂ ਵਿੱਚ ਹਥਿਆਰਬੰਦ ਬੰਦੂਕਾਂ, ਮਿਜ਼ਾਈਲ ਗਾਈਡੈਂਸ ਸਿਸਟਮ, ਹਥਿਆਰਬੰਦ ਡਰੋਨ ਅਤੇ ਬੰਬ ਦੇ ਹਿੱਸਿਆਂ ਲਈ ਸਕੀਮੈਟਿਕਸ (schematics) ਅਤੇ ਸੋਰਸ ਕੋਡ ਤਿਆਰ ਕਰਨ ਦੀਆਂ ਕੋਸ਼ਿਸ਼ਾਂ ਦਾ ਪਤਾ ਲੱਗਾ। ਛੇ ਬੇਨਤੀਆਂ ਚੀਨ, ਰੂਸ ਅਤੇ ਯਮਨ ਦੇ IP ਐਡਰੈੱਸਾਂ ਨਾਲ ਜੁੜੀਆਂ ਹੋਈਆਂ ਸਨ; ਯਮਨੀ ਗਤੀਵਿਧੀ ਇਰਾਨ-ਸਮਰਥਿਤ ਹੁਤੀ ਅੰਦੋਲਨ ਨਾਲ ਜੁੜੀ ਹੋਈ ਜਾਪਦੀ ਹੈ। ਇੱਕ ਵੱਖਰੇ ਪਹਿਲੂ ਵਿੱਚ, Anthropic ਨੇ AI-ਅਧਾਰਿਤ ਗਲਤ ਜਾਣਕਾਰੀ ਫੈਲਾਉਣ ਵਾਲੀਆਂ ਮੁਹਿੰਮਾਂ ਦੀ ਪਛਾਣ ਕੀਤੀ: ਚੀਨੀ ਅਤੇ ਇਰਾਨੀ ਸਰਕਾਰੀ ਅੰਗਾਂ ਨੇ ਪ੍ਰਵਾਸੀ ਭਾਈਚਾਰਿਆਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਲਈ Claude ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਜਦੋਂ ਕਿ ਰੂਸੀ ਸਰਕਾਰੀ ਮੀਡੀਆ ਨੇ ਮੋਲਡੋਵਾ ਵਿੱਚ ਚੋਣਾਂ ਬਾਰੇ ਗਲਤ ਦਾਅਵੇ ਫੈਲਾਉਣ ਵਾਲੇ "ਆਜ਼ਾਦ" ਲੇਖ ਤਿਆਰ ਕਰਨ ਲਈ ਇਸ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕੀਤੀ।

ਇਹ ਰਿਪੋਰਟ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਇਹ ਖੁਲਾਸੇ ਉਸ ਸਮੇਂ ਹੋਏ ਹਨ ਜਦੋਂ AI ਮਾਡਲ ਚੈਟਬੋਟਾਂ ਤੋਂ ਵਿਗਿਆਨਕ ਤਰਕ ਕਰਨ ਦੇ ਸਮਰੱਥ ਸਾਧਨਾਂ ਵਜੋਂ ਵਿਕਸਤ ਹੋ ਰਹੇ ਹਨ। ਸਰਕਾਰਾਂ ਲਈ, ਇਸ ਦੇ ਜੋਖਮ ਦੋਹਰੇ ਹਨ। ਪਹਿਲਾ, ਉੱਨਤ AI ਤੱਕ ਆਸਾਨ ਪਹੁੰਚ ਰਾਜ ਜਾਂ ਗੈਰ-ਰਾਜ ਅੰਗਾਂ ਲਈ ਗੈਰ-ਕਾਨੂੰਨੀ ਹਥਿਆਰ ਪ੍ਰੋਗਰਾਮ ਸ਼ੁਰੂ ਕਰਨ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ। ਦੂਜਾ, ਇਹੀ ਮਾਡਲ ਜਾਣਕਾਰੀ ਯੁੱਧ (information warfare) ਦੇ ਸਾਧਨ ਬਣ ਜਾਂਦੇ ਹਨ, ਜੋ ਅਜਿਹੇ ਗੁੰਝਲਦਾਰ ਪ੍ਰਚਾਰ ਨੂੰ ਸਮਰੱਥ ਬਣਾਉਂਦੇ ਹਨ ਜਿਸ ਦਾ ਪਤਾ ਲਗਾਉਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ। ਇਹ ਰਿਪੋਰਟ ਨੀਤੀ ਨਿਰਧਾਰਕਾਂ 'ਤੇ AI ਨੂੰ ਇੱਕ ਦੋਹਰੇ ਉਦੇਸ਼ ਵਾਲੀ ਤਕਨਾਲੋਜੀ ਵਜੋਂ ਮੰਨਣ ਲਈ ਦਬਾਅ ਪਾਉਂਦੀ ਹੈ ਜੋ ਨਿਰਯਾਤ ਨਿਯੰਤਰਣ, ਜੀਵ-ਸੁਰੱਖਿਆ ਨਿਯਮਾਂ ਅਤੇ ਸਾਈਬਰ-ਰੱਖਿਆ ਰਣਨੀਤੀਆਂ ਦੇ ਅਧੀਨ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।

Anthropic ਦਾ ਜਵਾਬ ਅਤੇ ਅੰਦਰੂਨੀ ਤਣਾਅ

ਪ੍ਰਤੀਕਿਰਿਆ ਵਜੋਂ, Anthropic ਨੇ ਆਪਣੇ ਨਵੇਂ ਮਾਡਲ ਪਰਿਵਾਰਾਂ 'ਤੇ ਸਖ਼ਤ ਸੁਰੱਖਿਆ ਉਪਾਅ ਲਾਗੂ ਕੀਤੇ ਹਨ, ਜੋ ਰੋਗਜਨਕ ਹੇਰਾਫੇਰੀ ਜਾਂ ਹਥਿਆਰ ਡਿਜ਼ਾਈਨ ਦੀ ਮੰਗ ਕਰਨ ਵਾਲੀਆਂ ਬੇਨਤੀਆਂ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਰੋਕਦੇ ਹਨ।

ਇਹ ਰਿਪੋਰਟ ਅੰਦਰੂਨੀ ਟਕਰਾਅ ਦੇ ਵਿਚਕਾਰ ਸਾਹਮਣੇ ਆਈ। ਖੋਜਕਰਤਾ Jacob Coxon ਨੇ ਇਸ ਸਾਲ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਅਸਤੀਫਾ ਦੇ ਦਿੱਤਾ ਸੀ, ਅਤੇ ਚੇਤਾਵਨੀ ਦਿੱਤੀ ਸੀ ਕਿ ਉਦਯੋਗ ਦਾ ਵਧੇਰੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਣਾਲੀਆਂ ਵੱਲ ਤੇਜ਼ੀ ਨਾਲ ਵਧਣਾ ਸੁਰੱਖਿਆ-ਜਾਲ (safety-net) ਦੇ ਵਿਕਾਸ ਤੋਂ ਤੇਜ਼ ਹੈ। ਉਨ੍ਹਾਂ ਦਾ ਜਾਣਾ ਇੱਕ ਵਿਆਪਕ ਬਹਿਸ ਨੂੰ ਉਜਾਗਰ ਕਰਦਾ ਹੈ: ਨਿੱਜੀ AI ਫਰਮਾਂ ਅਸਲ ਵਿੱਚ "ਡਿਜੀਟਲ ਪੁਲਿਸ" ਵਜੋਂ ਕੰਮ ਕਰ ਰਹੀਆਂ ਹਨ, ਜੋ ਬਿਨਾਂ ਕਿਸੇ ਸਪੱਸ਼ਟ ਸਰਕਾਰੀ ਢਾਂਚੇ ਦੇ ਇਹ ਫੈਸਲਾ ਕਰਦੀਆਂ ਹਨ ਕਿ ਕੀ ਸੁਰੱਖਿਆ ਖਤਰਾ ਹੈ। ਆਲੋਚਕਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਸਵੈ-ਨਿਯਮਨ ਵਿਰੋਧੀਆਂ ਦੀ ਚਤੁਰਾਈ ਨਾਲ ਤਾਲਮੇਲ ਨਹੀਂ ਰੱਖ ਸਕਦਾ, ਜਦੋਂ ਕਿ ਸਮਰਥਕ Anthropic ਦੇ ਤੇਜ਼ ਨੀਤੀਗਤ ਬਦਲਾਅ ਨੂੰ ਇਸ ਗੱਲ ਦੇ ਸਬੂਤ ਵਜੋਂ ਦੇਖਦੇ ਹਨ

  • ਨਿਯਮਾਂ ਸੰਬੰਧੀ ਕਦਮ – ਐਕਸਪੋਰਟ-ਕੰਟਰੋਲ ਏਜੰਸੀਆਂ ਅਤੇ ਬਾਇਓ-ਸੁਰੱਖਿਆ ਰੈਗੂਲੇਟਰਾਂ ਤੋਂ ਵਧੇਰੇ ਸਖ਼ਤ ਨਿਗਰਾਨੀ ਦੀ ਉਮੀਦ ਹੈ, ਜਿਸ ਨਾਲ ਸੰਭਾਵਨਾ ਹੈ ਕਿ ਨਵੇਂ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ ਆਉਣ ਜੋ ਉੱਨਤ ਜਨਰੇਟਿਵ ਮਾਡਲਾਂ ਨੂੰ ਨਿਯੰਤਰਿਤ ਤਕਨਾਲੋਜੀਆਂ ਵਜੋਂ ਮੰਨਣਗੇ।
  • ਉਦਯੋਗਿਕ ਸਹਿਯੋਗ – Anthropic ਖਤਰੇ ਦੀ ਜਾਣਕਾਰੀ ਸਾਂਝੀ ਕਰਨ ਲਈ ਮੌਜੂਦਾ AI ਸੁਰੱਖਿਆ ਗਠਜੋੜਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋ ਸਕਦਾ ਹੈ ਜਾਂ ਉਹਨਾਂ ਦਾ ਵਿਸਤਾਰ ਕਰ ਸਕਦਾ ਹੈ, ਇੱਕ ਅਜਿਹਾ ਕਦਮ ਜੋ ਪੂਰੇ ਖੇਤਰ ਵਿੱਚ ਦੋਹਰੇ-ਵਰਤੋਂ (dual-use) ਦੇ ਯਤਨਾਂ ਦੀ ਰਿਪੋਰਟਿੰਗ ਨੂੰ ਮਿਆਰੀ ਬਣਾ ਸਕਦਾ ਹੈ।
  • ਰਾਜਾਂ ਦੇ ਹੁੰਗਾਰੇ – ਰਿਪੋਰਟ ਵਿੱਚ ਪਛਾਣੇ ਗਏ ਦੇਸ਼ਾਂ ਦੁਆਰਾ ਸ਼ਾਮਲ ਹੋਣ ਤੋਂ ਇਨਕਾਰ ਕਰਨ ਦੀ ਸੰਭਾਵਨਾ ਹੈ ਅਤੇ ਉਹ ਆਪਣੇ AI ਵਿਕਾਸ ਪ੍ਰੋਗਰਾਮਾਂ ਨੂੰ ਤੇਜ਼ ਕਰ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਇੱਕ ਅਜਿਹਾ ਫੀਡਬੈਕ ਲੂਪ ਬਣ ਸਕਦਾ ਹੈ ਜੋ ਰੱਖਿਆਤਮਕ ਅਤੇ ਹਮਲਾਵਰ AI ਦੀ ਵਰਤੋਂ ਵਿਚਕਾਰਲੇ ਫਰਕ ਨੂੰ ਹੋਰ ਵੀ ਧੁੰਦਲਾ ਕਰ ਸਕਦਾ ਹੈ।

Anthropic ਦੀ ਰਿਪੋਰਟ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਉਹੀ ਜਨਰੇਟਿਵ ਸ਼ਕਤੀ ਜੋ ਵਿਗਿਆਨੀਆਂ ਨੂੰ ਪ੍ਰੋਟੀਨ ਮਾਡਲ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ, ਉਸਨੂੰ ਹਥਿਆਰ ਵਜੋਂ ਵੀ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਅਤੇ AI ਸੁਰੱਖਿਆ ਹੁਣ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਭੂ-ਰਾਜਨੀਤੀ (geopolitics) ਦੇ ਖੇਤਰ ਵਿੱਚ ਆ ਗਈ ਹੈ। ਆਉਣ ਵਾਲੇ ਮਹੀਨੇ ਇਹ ਪਰਖਣਗੇ ਕਿ ਕੀ ਸਵੈ-ਨਿਯਮਨ, ਸਰਕਾਰੀ ਨੀਤੀ, ਜਾਂ ਇੱਕ ਹਾਈਬ੍ਰਿਡ ਪਹੁੰਚ ਇਸ ਤਕਨਾਲੋਜੀ ਨੂੰ ਸੰਘਰਸ਼ ਦਾ ਇੱਕ ਸਾਧਨ ਬਣਨ ਤੋਂ ਰੋਕ ਸਕਦੀ ਹੈ।