Anthropic ਨੇ ਇੱਕ mechanistic-interpretability ਅਧਿਐਨ ਜਾਰੀ ਕੀਤਾ ਹੈ ਜੋ ਦਾਅਵਾ ਕਰਦਾ ਹੈ ਕਿ ਇਸਦੇ Claude ਮਾਡਲ ਜਾਣਕਾਰੀ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰੋਸੈਸ ਕਰਦੇ ਹਨ। ਇਸ ਪੇਪਰ ਨੇ ਇੱਕ ਵੱਡੀ ਪ੍ਰਾਪਤੀ ਦਾ ਦਾਅਵਾ ਕਰਦੇ ਹੋਏ ਸੁਰਖੀਆਂ ਬਣਾਈਆਂ, ਪਰ ਡਿਵੈਲਪਰਾਂ ਅਤੇ AI ਸੁਰੱਖਿਆ ਲਈ ਇਸਦਾ ਵਿਹਾਰਕ ਪ੍ਰਭਾਵ ਸੀਮਤ ਹੈ।
ਇਹ ਖੋਜ ਹੁਣ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
Mechanistic interpretability ਸਿਰਫ਼ ਅੰਤਿਮ ਜਵਾਬ ਦੀ ਬਜਾਏ ਨਿਊਰਲ ਨੈੱਟਵਰਕ ਦੇ ਅੰਦਰ ਕਦਮ-ਦਰ-ਕਦਮ ਗਣਨਾ (computation) ਦਾ ਨਕਸ਼ਾ ਤਿਆਰ ਕਰਦੀ ਹੈ। Claude ਦੇ ਅੰਦਰੂਨੀ ਕੰਮਕਾਜ 'ਤੇ ਇੱਕ "ਖਿੜਕੀ" ਖੋਲ੍ਹਣ ਵਾਲੀ ਵਿਧੀ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਕੇ, Anthropic ਇਹ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਇਹ ਉਸ ਮਾਡਲ ਦੇ ਅੰਦਰ ਝਾਤੀ ਮਾਰ ਸਕਦਾ ਹੈ ਜੋ ਚੈਟ ਸਹਾਇਕਾਂ, ਕੰਟੈਂਟ-ਜਨਰੇਸ਼ਨ ਟੂਲਜ਼ ਅਤੇ ਹੋਰ ਵਪਾਰਕ ਉਤਪਾਦਾਂ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ। ਨਿਯਮਕਾਂ, ਨਿਵੇਸ਼ਕਾਂ ਅਤੇ ਉਦਯੋਗਾਂ ਲਈ, ਜਿਨ੍ਹਾਂ ਨੂੰ AI ਸੁਰੱਖਿਆ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਨਾ ਪੈਂਦਾ ਹੈ, ਦਿੱਖ (visibility) ਦਾ ਕੋਈ ਵੀ ਦਾਅਵਾ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ।
ਅਧਿਐਨ ਅਸਲ ਵਿੱਚ ਕੀ ਦਿਖਾਉਂਦਾ ਹੈ
- ਅੰਸ਼ਕ ਦ੍ਰਿਸ਼ਟੀ, ਪੂਰਾ ਨਕਸ਼ਾ ਨਹੀਂ। ਲੇਖਕ ਅਜਿਹੇ ਐਕਟੀਵੇਸ਼ਨ ਪੈਟਰਨਾਂ (activation patterns) ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੇ ਹਨ ਜੋ ਕੁਝ ਭਾਸ਼ਾਈ ਜਾਂ ਤਰਕ ਵਾਲੇ ਕੰਮਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ, ਪਰ ਉਹ ਇਨਪੁਟ ਤੋਂ ਆਉਟਪੁੱਟ ਤੱਕ ਕਾਰਨ ਅਤੇ ਪ੍ਰਭਾਵ ਦੀ ਇੱਕ ਮੁਕੰਮਲ ਕੜੀ ਦਾ ਪਾਲਣ ਨਹੀਂ ਕਰ ਸਕਦੇ।
- ਸਬੰਧ (Correlations), ਕਾਰਨ (causation) ਨਹੀਂ। ਇਹ ਪੈਟਰਨ ਅਕਸਰ ਮਾਡਲ ਦੇ ਫੈਸਲੇ ਦੇ ਨਾਲ ਹੁੰਦੇ ਹਨ, ਫਿਰ ਵੀ ਖੋਜ ਇਹ ਸਾਬਤ ਨਹੀਂ ਕਰਦੀ ਕਿ ਉਹ ਪੈਟਰਨ ਜਵਾਬ ਦਾ ਕਾਰਨ ਬਣਦੇ ਹਨ।
- ਮਾਡਲ-ਵਿਸ਼ੇਸ਼ ਨਤੀਜੇ। ਸਾਰੇ ਪ੍ਰਯੋਗ Claude 'ਤੇ ਕੀਤੇ ਗਏ ਸਨ; ਇਸਦਾ ਕੋਈ ਸਬੂਤ ਨਹੀਂ ਹੈ ਕਿ ਇਹੀ ਤਰੀਕੇ GPT, Gemini ਜਾਂ ਹੋਰ ਪ੍ਰਣਾਲੀਆਂ 'ਤੇ ਕੰਮ ਕਰਦੇ ਹਨ।
ਵਿਹਾਰ ਵਿੱਚ, ਇਹ ਟੂਲ ਇੱਕ ਖੋਜਕਾਰੀ ਮਾਈਕ੍ਰੋਸਕੋਪ ਵਾਂਗ ਕੰਮ ਕਰਦੇ ਹਨ। ਖੋਜਕਰਤਾ ਪਰਿਕਲਪਨਾਵਾਂ (hypotheses) ਤਿਆਰ ਕਰ ਸਕਦੇ ਹਨ—ਉਦਾਹਰਨ ਲਈ, "ਜਦੋਂ ਮਾਡਲ ਮਿਤੀਆਂ ਦਾ ਜ਼ਿਕਰ ਕਰਦਾ ਹੈ ਤਾਂ ਇਹ ਨਿਊਰੋਨ ਚਮਕਦਾ ਹੈ"—ਪਰ ਉਹ ਅਜੇ ਮਾਈਕ੍ਰੋਸਕੋਪ ਦੀ ਵਰਤੋਂ ਮਾਡਲ ਨੂੰ ਨਿਰਦੇਸ਼ ਦੇਣ ਲਈ ਜਾਂ ਇਹ ਪ੍ਰਮਾਣਿਤ ਕਰਨ ਲਈ ਨਹੀਂ ਕਰ ਸਕਦੇ ਕਿ ਇਹ ਕਦੇ ਵੀ ਨੁਕਸਾਨਦੇਹ ਆਉਟਪੁੱਟ ਨਹੀਂ ਦੇਵੇਗਾ।
ਵਪਾਰਕ ਦਾਅ ਅਤੇ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਫਾਇਦਾ
Anthropic ਦਾ ਤਾਜ਼ਾ ਮੁਲਾਂਕਣ (valuation) $1 ਟ੍ਰਿਲੀਅਨ ਦੇ ਆਸ-ਪਾਸ ਹੈ। ਅਜਿਹੇ ਬਾਜ਼ਾਰ ਵਿੱਚ ਜਿੱਥੇ "ਭਰੋਸੇਯੋਗ AI" ਵਿਕਦਾ ਹੈ, ਕੰਪਨੀ ਦੀ ਸੁਰੱਖਿਆ ਖੋਜ ਇੱਕ ਬ੍ਰਾਂਡ ਡਿਫਰੈਂਸ਼ੀਏਟਰ (brand differentiator) ਵਜੋਂ ਕੰਮ ਕਰਦੀ ਹੈ। ਅਧਿਐਨ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਕੇ, Anthropic ਨਿਵੇਸ਼ਕਾਂ ਅਤੇ ਸੰਭਾਵੀ ਗਾਹਕਾਂ ਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਉਹ ਪਾਰਦਰਸ਼ਤਾ ਨੂੰ ਗੰਭੀਰਤਾ ਨਾਲ ਲੈਂਦਾ ਹੈ, ਇੱਕ ਅਜਿਹੀ ਕਹਾਣੀ ਜੋ ਨਿਯਮਤ ਜਾਂਚ ਨੂੰ ਸੁਖਾਲਾ ਬਣਾ ਸਕਦੀ ਹੈ ਅਤੇ ਸਖ਼ਤ ਪਾਲਣਾ ਮਿਆਰਾਂ ਵਾਲੇ ਉਦਯੋਗਾਂ ਨੂੰ ਆਕਰਸ਼ਿਤ ਕਰ ਸਕਦੀ ਹੈ।
ਹਾਲਾਂਕਿ, ਇਸਦਾ ਫਾਇਦਾ ਇੱਕ ਲੁਕਿਆ ਹੋਇਆ ਜੋਖਮ ਵੀ ਲਿਆਉਂਦਾ ਹੈ। ਇੱਕ ਡੈਸ਼ਬੋਰਡ ਜੋ ਅੰਸ਼ਕ ਅੰਦਰੂਨੀ ਗਤੀਵਿਧੀ ਦਿਖਾਉਂਦਾ ਹੈ, ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਸੁਰੱਖਿਆ ਦਾ ਇੱਕ ਝੂਠਾ ਅਹਿਸਾਸ ਦੇ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਕੋਈ ਟੀਮ ਇਹ ਮੰਨ ਲੈਂਦੀ ਹੈ ਕਿ ਉਹ ਕੁਝ ਐਕਟੀਵੇਸ਼ਨ ਮੈਪ ਦੇਖ ਕੇ Claude ਨੂੰ "ਸਮਝਦੇ" ਹਨ, ਤਾਂ ਉਹ ਡੂੰਘੀ ਜਾਂਚ ਨੂੰ ਛੱਡ ਸਕਦੇ ਹਨ ਅਤੇ ਅਜਿਹੇ ਅਸਫਲਤਾ ਦੇ ਮੋਡਾਂ (failure modes) ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਸਕਦੇ ਹਨ ਜੋ ਮੌਜੂਦਾ ਟੂਲਜ਼ ਲਈ ਅਦਿੱਖ ਹਨ।
ਸੀਮਾਵਾਂ ਅਤੇ ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
Anthropic ਦੀ ਪ੍ਰਗਤੀ ਦਾ ਅਸਲ ਟੈਸਟ ਤਿੰਨ ਪੜਾਵਾਂ ਵਿੱਚ ਹੋਵੇਗਾ:
- ਬਾਹਰੀ ਰੀਪਲੀਕੇਸ਼ਨ (External replication)। ਸੁਤੰਤਰ ਲੈਬਾਂ ਨੂੰ ਉਹੀ ਐਕਟੀਵੇਸ਼ਨ ਪੈਟਰਨ ਦੁਬਾਰਾ ਤਿਆਰ ਕਰਨੇ ਚਾਹੀਦੇ ਹਨ ਅਤੇ ਪੁਸ਼ਟੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ ਕਿ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਂਪਟਾਂ ਅਤੇ ਡਾਊਨਸਟ੍ਰੀਮ ਕੰਮਾਂ ਵਿੱਚ ਇਹ ਸਬੰਧ ਬਣੇ ਰਹਿੰਦੇ ਹਨ।
- ਅੰਦਰੂਨੀ ਅਪਣਾਉਣਾ (Internal adoption)। Anthropic ਨੂੰ ਇਹਨਾਂ ਅੰਤਰਦਾਖਲ (insights) ਨੂੰ ਆਪਣੇ ਟ੍ਰੇਨਿੰਗ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਪਰੋਣ ਦੀ ਲੋੜ ਹੈ—ਜਿਵੇਂ ਕਿ ਲਾਸ ਫੰਕਸ਼ਨ (loss functions), ਡਾਟਾ ਕਿਊਰੇਸ਼ਨ ਜਾਂ ਮਾਡਲ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਐਡਜਸਟ ਕਰਨਾ—ਨਾ ਕਿ ਨਤੀਜਿਆਂ ਨੂੰ ਸਿਰਫ਼ ਅਕਾਦਮਿਕ ਪੇਪਰਾਂ ਤੱਕ ਸੀਮਤ ਰੱਖਣਾ।
- ਮਾਡਲ ਦੇ ਵਾਧੇ ਦੇ ਨਾਲ ਤਾਲਮੇਲ। ਜਿਵੇਂ-ਜਿਵੇਂ ਭਵਿੱਖ ਦੇ Claude ਵਰਜ਼ਨ ਪੈਰਾਮੀਟਰਾਂ ਅਤੇ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਵਧਣਗੇ, ਇੰਟਰਪ੍ਰੀਟੇਬਿਲਟੀ ਟੂਲਬਾਕਸ ਨੂੰ ਵੀ ਇਸ ਦੇ ਨਾਲ ਚੱਲਣਾ ਪਵੇਗਾ; ਨਹੀਂ ਤਾਂ ਮਾਡਲ ਦੀ ਗੁੰਝਲਤਾ ਦੇ ਮੁਕਾਬਲੇ "ਖਿੜਕੀ" ਛੋਟੀ ਹੁੰਦੀ ਜਾਵੇਗੀ।
ਆਲੋਚਕਾਂ ਦਾ ਤਰਕ ਹੈ ਕਿ ਮਕੈਨਿਸਟਿਕ ਇੰਟਰਪ੍ਰੀਟੇਬਿਲਟੀ ਦੀ ਮੌਜੂਦਾ ਸਥਿਤੀ ਸਖ਼ਤ ਸੁਰੱਖਿਆ ਨਾਲੋਂ ਜ਼ਿਆਦਾ ਹਾਈਪ (hype) ਹੈ। ਟੂਲ ਖੋਜਕਾਰੀ ਹਨ, ਨਿਰਦੇਸ਼ਕ ਨਹੀਂ, ਅਤੇ ਉਹ ਅਜੇ ਵੀ ਮਾਡਲ ਦੇ ਤਰਕ ਦੇ ਵੱਡੇ ਹਿੱਸੇ ਨੂੰ ਅਸਪਸ਼ਟ ਛੱਡਦੇ ਹਨ। ਜਦੋਂ ਤੱਕ ਖੋਜਕਰਤਾ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਇਨਪੁਟ ਤੋਂ ਹਰ ਵਿਚਕਾਰਲੇ ਪ੍ਰਤੀਨਿਧਤਾ (representation) ਰਾਹੀਂ ਆਉਟਪੁੱਟ ਤੱਕ ਫੈਸਲੇ ਦਾ ਪਤਾ ਨਹੀਂ ਲਗਾ ਸਕਦੇ, ਉਦੋਂ ਤੱਕ "AI ਦੇ ਮਨ ਨੂੰ ਪੜ੍ਹਨ" ਦਾ ਦਾਅਵਾ ਦੂਰ ਦੀ ਗੱਲ ਹੈ।
ਨਿਚੋੜ
Anthropic ਦਾ ਨਵਾਂ ਅਧਿਐਨ Claude ਦੇ ਅੰਦਰ ਝਲਕ ਦਿਖਾ ਕੇ ਇਸ ਖੇਤਰ ਨੂੰ ਅੱਗੇ ਵਧਾ
