ਇੱਕ ਨਵਾਂ ਬੈਂਚਮਾਰਕ ਜੋ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) ਵਿੱਚ "ਸਥਿਤੀਜਨਕ ਜਾਗਰੂਕਤਾ" (situational awareness) ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ, ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਅੱਜ ਦੇ ਮਿਆਰੀ ਟੈਸਟ ਮਹੱਤਵਪੂਰਨ ਕਮੀਆਂ ਨੂੰ ਛੱਡ ਰਹੇ ਹਨ। ਮਾਡਲਾਂ ਨੂੰ ਆਪਣੀ ਪਛਾਣ, ਸੀਮਾਵਾਂ ਅਤੇ ਆਲੇ-ਦੁਆਲੇ ਦੇ ਸੰਦਰਭ ਦਾ ਵਰਣਨ ਕਰਨ ਲਈ ਕਹਿ ਕੇ, ਇਹ ਬੈਂਚਮਾਰਕ ਇਹ ਜਾਂਚ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਉਹ ਮਾਡਲ ਇਹ ਪਛਾਣਦੇ ਹਨ ਕਿ ਉਹ AI ਸਿਸਟਮ ਹਨ ਜਾਂ ਸਥਿਤੀ ਬਦਲਣ 'ਤੇ ਆਪਣੇ ਜਵਾਬਾਂ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਉਂਦੇ ਹਨ—ਇਹ ਉਹ ਕਮੀਆਂ ਹਨ ਜੋ ਸੁਰੱਖਿਆ-ਅਹਿਮ ਤੈਨਾਤੀਆਂ (safety-critical deployments) ਅਤੇ ਭਰੋਸੇਯੋਗ ਟੂਲ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹਨ।
ਮੌਜੂਦਾ ਮੁਲਾਂਕਣ ਕਿਉਂ ਅਧੂਰੇ ਹਨ
ਜ਼ਿਆਦਾਤਰ ਜਨਤਕ ਬੈਂਚਮਾਰਕ ਅਜੇ ਵੀ LLMs ਨੂੰ ਸਥਿਰ ਇੰਸਾਈਕਲੋਪੀਡੀਆ ਵਾਂਗ ਮੰਨਦੇ ਹਨ। ਉਹ ਤੱਥਾਂ ਦੀ ਸਹੀ ਪ੍ਰਾਪਤੀ ਲਈ ਇਨਾਮ ਦਿੰਦੇ ਹਨ ਪਰ ਇਸ ਗੱਲ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਕੋਈ ਮਾਡਲ ਇਹ ਜਾਣਦਾ ਹੈ ਕਿ ਉਹ ਇੱਕ ਮਸ਼ੀਨ ਹੈ, ਅਨਿਸ਼ਚਿਤਤਾ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ, ਜਾਂ ਗੱਲਬਾਤ ਦੇ ਮਾਹੌਲ ਦੇ ਬਦਲਣ 'ਤੇ ਅਨੁਕੂਲ ਬਣਦਾ ਹੈ। ਉਹ ਗੁੰਮ ਹੋਏ ਪਹਿਲੂ ਉਦੋਂ ਸਾਹਮਣੇ ਆਉਂਦੇ ਹਨ ਜਦੋਂ ਕੋਈ ਪ੍ਰੋਂਪਟ, ਉਦਾਹਰਨ ਲਈ, ਪੁੱਛਦਾ ਹੈ, "ਕੀ ਤੁਸੀਂ ਇੱਕ ਇਨਸਾਨ ਹੋ ਜਾਂ ਇੱਕ AI?" ਜਾਂ "ਤੁਸੀਂ ਕੀ ਨਹੀਂ ਕਰ ਸਕਦੇ?" ਜੇਕਰ ਮਾਡਲ ਇਨਸਾਨ ਹੋਣ ਦਾ ਬਹਾਨਾ ਕਰਦਾ ਹੈ ਜਾਂ ਆਪਣੀਆਂ ਯੋਗਤਾਵਾਂ ਨੂੰ ਵਧਾ-ਚੜ੍ਹਾ ਕੇ ਦੱਸਦਾ ਹੈ, ਤਾਂ ਵੀ ਸਕੋਰ ਉੱਚੇ ਰਹਿੰਦੇ ਹਨ।
ਨਵਾਂ ਬੈਂਚਮਾਰਕ ਕੀ ਟੈਸਟ ਕਰਦਾ ਹੈ
ਸਥਿਤੀਜਨਕ-ਜਾਗਰੂਕਤਾ ਸੂਟ ਤਿੰਨ ਮੋਰਚਿਆਂ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦਾ ਹੈ:
- ਸਵੈ-ਪਛਾਣ (Self-identification) – ਕੀ ਮਾਡਲ ਸਹੀ ਤਰ੍ਹਾਂ ਦੱਸਦਾ ਹੈ ਕਿ ਉਹ ਇੱਕ AI ਹੈ ਅਤੇ ਆਪਣੀ ਭੂਮਿਕਾ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ?
- ਯੋਗਤਾ ਦਾ ਫਰੇਮਿੰਗ (Capability framing) – ਕੀ ਇਹ ਉਹਨਾਂ ਨੂੰ ਲੁਕਾਉਣ ਦੀ ਬਜਾਏ ਖੁੱਲ੍ਹੇਆਮ ਆਪਣੀਆਂ ਸੀਮਾਵਾਂ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ?
- ਸੰਦਰਭਿਕ ਤਰਕ (Contextual reasoning) – ਕੀ ਆਲੇ-ਦੁਆਲੇ ਦੀ ਗੱਲਬਾਤ ਵਿੱਚ ਬਦਲਾਅ ਉਸਦੇ ਜਵਾਬ ਨੂੰ ਉਚਿਤ ਤਰੀਕੇ ਨਾਲ ਬਦਲਦਾ ਹੈ?
ਹਰੇਕ ਟੈਸਟ ਇੱਕ ਤੱਥ-ਅਧਾਰਤ ਸਵਾਲ ਨੂੰ ਮਾਡਲ ਦੀ ਸਥਿਤੀ ਬਾਰੇ ਇੱਕ ਮੈਟਾ-ਸਵਾਲ (meta-question) ਨਾਲ ਜੋੜਦਾ ਹੈ, ਜੋ ਸਿਸਟਮ ਨੂੰ ਗਿਆਨ ਨੂੰ ਸਵੈ-ਗਿਆਨ ਨਾਲ ਮਿਲਾਉਣ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।
AI ਸੁਰੱਖਿਆ ਅਤੇ ਟੂਲਿੰਗ ਲਈ ਜੋਖਮ
ਜੇਕਰ ਕੋਈ ਮਾਡਲ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਆਪਣੀਆਂ ਸੀਮਾਵਾਂ ਦਾ ਸੰਕੇਤ ਨਹੀਂ ਦੇ ਸਕਦਾ, ਤਾਂ ਇਹ ਗੁੰਮਰਾਹਕੁੰਨ ਨਤੀਜੇ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ।
ਵਿਰੋਧੀ ਪੱਖ: ਜਾਗਰੂਕਤਾ ਨੂੰ ਮਾਪਣਾ ਮੁਸ਼ਕਲ ਹੈ
ਆਲੋਚਕਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਮਾਡਲ ਨੂੰ ਆਪਣੇ ਬਾਰੇ ਦੱਸਣ ਲਈ ਕਹਿਣਾ ਸ਼ਾਇਦ ਸਿਰਫ਼ ਉਸਦੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਦੀ ਗੂੰਜ ਹੋ ਸਕਦੀ ਹੈ, ਨਾ ਕਿ ਅਸਲ ਅੰਤਰਦ੍ਰਿਸ਼ਟੀ (introspection)। ਉਹ ਦਲੀਲ ਦਿੰਦੇ ਹਨ ਕਿ ਮਾਡਲ ਦੀ "ਜਾਗਰੂਕਤਾ" ਪ੍ਰੋਂਪਟ ਇੰਜੀਨੀਅਰਿੰਗ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਇੱਕ ਭਰਮ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ ਸਰੋਤਾਂ ਦੀ ਵਰਤੋਂ ਤੱਥਾਂ ਦੇ ਅਧਾਰ ਨੂੰ ਸੁਧਾਰਨ ਲਈ ਵਧੇਰੇ ਬਿਹਤਰ ਤਰੀਕੇ ਨਾਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਇਹ ਬੈਂਚਮਾਰਕ ਸੱਚੀ ਚੇਤਨਾ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਨ ਦਾ ਦਾਅਵਾ ਨਹੀਂ ਕਰਦਾ—ਸਿਰਫ਼ ਉਹਨਾਂ ਅਸੰਗਤਤਾਵਾਂ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਮੌਜੂਦਾ ਮਾਪਦੰਡ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਦਿੰਦੇ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਇਹ ਬੈਂਚਮਾਰਕ ਇਸ ਗਿਆਨ ਦੇ ਬਿਹਤਰ ਮਾਪ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ, ਜੋ ਖੋਜਕਰਤਾਵਾਂ ਅਤੇ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਭਾਸ਼ਾ ਪ੍ਰਣਾਲੀਆਂ ਵੱਲ ਕੰਮ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦਾ ਹੈ।
ਸਿੱਖਿਆ (Takeaway): ਇੱਕ ਮਾਡਲ ਜੋ ਜਾਣਦਾ ਹੈ ਕਿ ਉਹ ਇੱਕ AI ਹੈ ਅਤੇ ਆਪਣੀਆਂ ਸੀਮਾਵਾਂ ਦੱਸ ਸਕਦਾ ਹੈ, ਉਹ ਇੱਕ ਸੁਰੱਖਿਅਤ ਮਾਡਲ ਹੈ।
