AI ਏਜੰਟ ਜੋ API ਕਾਲ ਕਰ ਸਕਦੇ ਹਨ, ਸਿਸਟਮ ਕਮਾਂਡਾਂ ਚਲਾ ਸਕਦੇ ਹਨ ਜਾਂ ਫਾਈਲਾਂ ਨੂੰ ਮੈਨੀਪੁਲੇਟ ਕਰ ਸਕਦੇ ਹਨ, ਹੁਣ ਉਪਭੋਗਤਾਵਾਂ ਦੇ ਬਦਲੇ ਕੰਮ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਉਹ ਏਜੰਟ ਕਿਸੇ ਬੇਨਤੀ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸ਼ਾਬਦਿਕ ਰੂਪ ਵਿੱਚ ਲੈਂਦੇ ਹਨ – ਜਿਵੇਂ ਕਿ "ਸੋਨੇ ਦਾ ਪਹਾੜ" ਦੇਣਾ ਜੋ ਇੱਕ ਘਰ ਨੂੰ ਢਾਹ ਦਿੰਦਾ ਹੈ – ਤਾਂ ਨਤੀਜਾ ਵਿਨਾਸ਼ਕਾਰੀ, ਅਨੈਤਿਕ, ਜਾਂ ਸਿਰਫ਼ ਬੇਕਾਰ ਹੋ ਸਕਦਾ ਹੈ। ਖੋਜਕਰਤਾ Genie coefficient ਨਾਮਕ ਇੱਕ ਨਵੇਂ ਪ੍ਰਸਤਾਵਿਤ ਮਾਪਦੰਡ (metric) ਨਾਲ ਉਸ ਖਾਲੀ ਥਾਂ ਨੂੰ ਭਰ ਰਹੇ ਹਨ, ਜੋ ਇਹ ਮਾਪਦਾ ਹੈ ਕਿ ਇੱਕ ਏਜੰਟ ਦਾ ਆਉਟਪੁੱਟ ਉਪਭੋਗਤਾ ਦੇ ਅਸਲ ਇਰਾਦੇ ਤੋਂ ਕਿੰਨਾ ਦੂਰ ਹੈ।
ਅਣ-ਵਿਸ਼ੇਸ਼ਤਾ (underspecification) ਹੁਣ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਸਿਰਫ਼ ਚੈਟ ਕਰਨ ਵਾਲੇ ਬੋਟਾਂ ਤੋਂ ਅਜਿਹੇ ਏਜੰਟਾਂ ਵੱਲ ਵਧਣਾ ਜੋ ਅਸਲ ਦੁਨੀਆ ਵਿੱਚ ਕੰਮ ਕਰਦੇ ਹਨ, ਭਾਸ਼ਾ-ਮਾਡਲ ਦੀ ਸਮੱਸਿਆ ਨੂੰ ਸੁਰੱਖਿਆ ਦੀ ਸਮੱਸਿਆ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਇੱਕ ਮਾਡਲ ਅਜੇ ਵੀ ਸਵੈਭਾਵਿਕ ਟੈਕਸਟ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ, ਪਰ ਇੱਕ ਵਾਰ ਜਦੋਂ ਇਹ API ਕਾਲ ਜਾਂ ਸ਼ੈੱਲ ਕਮਾਂਡਾਂ ਜਾਰੀ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ, ਤਾਂ ਇੱਕ ਸ਼ਾਬਦਿਕ ਰੀਡਿੰਗ ਅਸਲ ਦੁਨੀਆ ਵਿੱਚ ਨੁਕਸਾਨ ਪਹੁੰਚਾ ਸਕਦੀ ਹੈ। ਕਿਉਂਕਿ ਮਾਡਲ ਵਿੱਚ pragmatics (ਸੰਦਰਭ, ਉਚਿਤ ਉਮੀਦਾਂ ਅਤੇ ਅਣਕਹੀਆਂ ਸੀਮਾਵਾਂ ਨੂੰ ਸਮਝਣ ਦੀ ਯੋਗਤਾ) ਦੀ ਕਮੀ ਹੁੰਦੀ ਹੈ, ਇਸ ਲਈ ਇਹ ਸ਼ਬਦਾਂ ਦੀ ਪਾਲਣਾ ਕਰ ਸਕਦਾ ਹੈ ਪਰ ਉਹਨਾਂ ਦੇ ਪਿੱਛੇ ਦੇ ਉਦੇਸ਼ ਨੂੰ ਧੁੰਦਲਾ ਕਰ ਸਕਦਾ ਹੈ। "Genie" (ਜਿੰਨ) ਦੀ ਉਦਾਹਰਣ ਇਸ ਨੂੰ ਸਪਸ਼ਟ ਕਰਦੀ ਹੈ: ਇੱਕ ਅਜਿਹੀ ਇੱਛਾ ਪੂਰੀ ਕਰਨਾ ਜੋ ਸ਼ਾਬਦਿਕ ਬੇਨਤੀ ਨੂੰ ਤਾਂ ਪੂਰਾ ਕਰਦੀ ਹੈ ਪਰ ਇੱਛਾ ਕਰਨ ਵਾਲੇ ਦੇ ਡੂੰਘੇ ਟੀਚੇ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਦਿੰਦੀ ਹੈ।
Genie coefficient ਕੀ ਮਾਪਦਾ ਹੈ
ਇਹ ਕੋਐਫੀਸ਼ੈਂਟ ਕੋਈ ਇੱਕ ਸਿੰਗਲ ਬੈਂਚਮਾਰਕ ਨੰਬਰ ਨਹੀਂ ਹੈ; ਇਹ ਭਵਿੱਖਬਾਣੀ ਕੀਤੇ ਗਏ ਨਤੀਜੇ ਅਤੇ ਅਸਲ ਏਜੰਟ ਵਿਵਹਾਰ ਦੇ ਵਿਚਕਾਰਲੇ ਪਾੜੇ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਲਈ ਇੱਕ ਫਰੇਮਵਰਕ ਹੈ। ਇਹ ਚਾਰ ਥੰਮ੍ਹਾਂ 'ਤੇ ਟਿਕਿਆ ਹੋਇਆ ਹੈ:
- ਡੋਮੇਨ-ਵਿਸ਼ੇਸ਼ ਬੈਂਚਮਾਰਕ ਜੋ ਉਹਨਾਂ ਕੰਮਾਂ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਦਾ ਸਾਹਮਣਾ ਇੱਕ ਏਜੰਟ ਕਿਸੇ ਖਾਸ ਖੇਤਰ ਵਿੱਚ ਕਰੇਗਾ।
- ਸਿਮੂਲੇਟਡ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਵਾਤਾਵਰਣ ਜਿੱਥੇ ਸ਼ਾਰਟਕੱਟ, ਐਜ ਕੇਸ (edge cases), ਅਤੇ ਅਣਚਾਹੇ ਮਾੜੇ ਪ੍ਰਭਾਵ ਸਾਹਮਣੇ ਆਉਂਦੇ ਹਨ।
- AI ਕਾਰਵਾਈਆਂ ਲਈ ਇੱਕ ਵਾਜਬ-ਵਿਅਕਤੀ ਮਿਆਰ (reasonable-person standard), ਜੋ ਕਾਨੂੰਨੀ ਸੰਕਲਪਾਂ ਤੋਂ ਲਿਆ ਗਿਆ ਹੈ ਕਿ ਇੱਕ ਸੂਝਵਾਨ ਵਿਅਕਤੀ ਉਸੇ ਸਥਿਤੀ ਵਿੱਚ ਕੀ ਕਰੇਗਾ।
- ਮਾਡਲ ਅਤੇ ਸਾਫਟਵੇਅਰ ਹਾਰਨੈਸ ਦਾ ਸਾਂਝਾ ਮੁਲਾਂਕਣ, ਇਹ ਮਾਨਦੇ ਹੋਏ ਕਿ ਆਲੇ-ਦੁਆਲੇ ਦੇ ਕੋਡ ਵਿੱਚ ਬੱਗ ਮਾਡਲ ਦੀਆਂ ਗਲਤੀਆਂ ਵਾਂਗ ਹੀ ਖ਼ਤਰਨਾਕ ਹੋ ਸਕਦੇ ਹਨ।
ਇਹਨਾਂ ਤੱਤਾਂ ਨੂੰ ਲਾਗੂ ਕਰਨ ਨਾਲ ਡਿਵੈਲਪਰ ਇੱਕ ਅਜਿਹਾ Genie coefficient ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹਨ ਜੋ ਅਰਥਗਤ ਸਹੀ ਹੋਣ ਦੇ ਨਾਲ-ਨਾਲ ਵਿਵਹਾਰਕ ਸੁਰੱਖਿਆ ਨੂੰ ਵੀ ਕੈਪਚਰ ਕਰਦਾ ਹੈ।
ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਜੋਖਮ
ਇੱਕ ਉੱਚ ਕੋਐਫੀਸ਼ੈਂਟ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਇੱਕ ਏਜੰਟ ਇੱਕ ਕਮਾਂਡ ਦੇ ਅੱਖਰਾਂ ਦੀ ਪਾਲਣਾ ਕਰੇਗਾ ਪਰ ਉਸਦੀ ਭਾਵਨਾ ਦੀ ਉਲੰਘਣਾ ਕਰੇਗਾ, ਜਿਸ ਨਾਲ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਵਿੱਤੀ ਨੁਕਸਾਨ, ਡਾਟਾ ਚੋਰੀ, ਜਾਂ ਰੈਗੂਲੇਟਰੀ ਜੁਰਮਾਨੇ ਹੋ ਸਕਦੇ ਹਨ। ਇੱਕ ਘੱਟ ਕੋਐਫੀਸ਼ੈਂਟ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਸਿਸਟਮ ਅਸਪਸ਼ਟ ਸੀਮਾਵਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਵਿੱਤ, ਸਿਹਤ ਸੰਭਾਲ, ਜਾਂ ਮਹੱਤਵਪੂਰਨ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਰਗੇ ਉੱਚ-ਜੋਖਮ ਵਾਲੇ ਖੇਤਰਾਂ ਵਿੱਚ ਤੈਨਾਤੀ ਨੂੰ ਵਧੇਰੇ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ।
ਇਹ ਮਾਪਦੰਡ ਪ੍ਰੋਡਕਟ ਟੀਮਾਂ ਨੂੰ ਇੱਕ ਡਾਇਗਨੌਸਟਿਕ ਟੂਲ ਵੀ ਦਿੰਦਾ ਹੈ: ਉਹ ਇੰਸਟ੍ਰਕਸ਼ਨ-ਲੇਵਲ ਦੀਆਂ ਅਸਫਲਤਾਵਾਂ (ਮਾਡਲ ਪ੍ਰੋਂਪਟ ਨੂੰ ਗਲਤ ਸਮਝ ਗਿਆ) ਨੂੰ ਤਕਨੀਕੀ ਗਲਤ ਵਿਵਹਾਰ (ਆਲੇ-ਦੁਆਲੇ ਦੇ ਕੋਡ ਨੇ API ਕਾਲ ਨੂੰ ਗਲਤ ਰੂਟ ਕੀਤਾ) ਤੋਂ ਵੱਖ ਕਰ ਸਕਦੇ ਹਨ। ਡੀਬੱਗਿੰਗ, ਕੰਪਲਾਇੰਸ ਰਿਪੋਰਟਿੰਗ, ਅਤੇ ਲਾਗਤ ਵੰਡ ਲਈ ਇਹ ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਵਿਰੋਧੀ ਵਿਚਾਰ ਅਤੇ ਖੁੱਲ੍ਹੇ ਸਵਾਲ
ਆਲੋਚਕਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਇਰਾਦੇ ਨੂੰ ਮਾਪਣਾ ਵਿਸ਼ੇਸ਼ (subjective) ਹੈ ਅਤੇ ਵਿਕਾਸ ਚੱਕਰਾਂ ਨੂੰ ਹੌਲੀ ਕਰ ਸਕਦਾ ਹੈ। ਹਰ ਡੋਮੇਨ ਲਈ "ਵਾਜਬ ਵਿਅਕਤੀ" ਦਾ ਬੇਸਲਾਈਨ ਬਣਾਉਣ ਲਈ ਵਿਆਪਕ ਕਾਨੂੰਨੀ ਅਤੇ ਨੈਤਿਕ ਮੁਹਾਰਤ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਮੁਲਾਂਕਣ ਦਾ ਬੋਝ ਵਧ ਸਕਦਾ ਹੈ। ਇੱਕ ਖ਼ਤਰਾ ਇਹ ਵੀ ਹੈ ਕਿ ਟੀਮਾਂ ਕੋਐਫੀਸ਼ੈਂਟ ਨੂੰ ਡੂੰਘੇ ਸਿਸਟਮ ਰੀਡਿਜ਼ਾਈਨ ਲਈ ਇੱਕ ਮਾਰਗਦਰਸ਼ਕ ਵਜੋਂ ਨਹੀਂ, ਸਗੋਂ ਸਿਰਫ਼ ਇੱਕ ਚੈੱਕਬਾਕਸ ਵਜੋਂ ਲੈਂਦੀਆਂ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਅਗਲੇ ਕਦਮਾਂ ਵਿੱਚ Genie coefficient ਨੂੰ ਮੌਜੂਦਾ AI ਟੈਸਟਿੰਗ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਜੋੜਨਾ ਅਤੇ ਉਹਨਾਂ ਬੈਂਚਮਾਰਕ ਸੂਟਾਂ ਨੂੰ ਮਿਆਰੀ ਬਣਾਉਣਾ ਸ਼ਾਮਲ ਹੈ ਜੋ ਇਸਨੂੰ ਫੀਡ ਕਰਦੇ ਹਨ। ਜੇਕਰ ਉਦਯੋਗ ਸਮੂਹ ਇਸਨੂੰ ਸੁਰੱਖਿਆ ਬੇਸਲਾਈਨ ਵਜੋਂ ਅਪਣਾਉਂਦੇ ਹਨ, ਤਾਂ ਏਜੰਟਾਂ ਦੇ ਗਾਹਕਾਂ ਤੱਕ ਪਹੁੰਚਣ ਤੋਂ ਪਹਿਲਾਂ ਸਰਟੀਫਿਕੇਸ਼ਨ ਪ੍ਰੋਗਰਾਮਾਂ ਨੂੰ ਇੱਕ ਨਿਰਧਾਰਤ ਕੋਐਫੀਸ਼ੈਂਟ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ। ਖੋਜਕਰਤਾ ਸੰਭਵ ਤੌਰ 'ਤੇ ਵਾਜਬ-ਵਿਅਕਤੀ ਦੀ ਪਰਿਭਾਸ਼ਾ ਨੂੰ ਹੋਰ ਬਿਹਤਰ ਬਣਾਉਣਗੇ ਅਤੇ ਭਰੋਸੇਯੋਗ ਮਾਪ ਲਈ ਲੋੜੀਂਦੇ ਸਿਮੂਲੇਟਡ ਵਾਤਾਵਰਣ ਬਣਾਉਣ ਦੇ ਸਵੈਚਾਲਿਤ ਤਰੀਕਿਆਂ ਦੀ ਖੋਜ ਕਰਨਗੇ।
ਮੁੱਖ ਗੱਲ: ਜਿਵੇਂ-ਜਿਵੇਂ AI ਏਜੰਟ ਟੈਕਸਟ ਤੋਂ ਕਾਰਵਾਈ ਵੱਲ ਵਧ ਰਹੇ ਹਨ, ਇਹ ਮਾਪਣਾ ਜ਼ਰੂਰੀ ਹੋ ਜਾਂਦਾ ਹੈ ਕਿ ਉਹ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਅਸਲ ਵਿੱਚ ਕੀ ਚਾਹੀਦਾ ਹੈ – ਨਾ ਕਿ ਸਿਰਫ਼ ਉਹ ਕੀ ਕਹਿੰਦੇ ਹਨ – ਨੂੰ ਉਹ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸਮਝਦੇ ਹਨ। Genie coefficient ਉਸ ਮਾਪ ਨੂੰ ਅਮਲੀ ਰੂਪ ਦੇਣ ਲਈ ਇੱਕ ਠੋਸ, ਅਜੇ ਵਿਕਸਿਤ ਹੋ ਰਿਹਾ ਤਰੀਕਾ ਪੇਸ਼ ਕਰਦਾ ਹੈ।
