SEED ਪੇਪਰ ਦੇ ਲੇਖਕਾਂ ਨੇ ਇੱਕ ਅਜਿਹੀ ਵਿਧੀ ਦਾ ਖੁਲਾਸਾ ਕੀਤਾ ਹੈ ਜੋ reinforcement-learning (RL) agents ਨੂੰ ਆਪਣੇ ਅਸਫਲਤਾ ਲੌਗਸ (failure logs) ਨੂੰ ਨਵੇਂ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਵਿੱਚ ਬਦਲਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ। ਇਹ ALFWorld benchmark 'ਤੇ ਔਸਤ ਸਕੋਰ ਨੂੰ ਵਧਾ ਕੇ 91.8 ਕਰ ਦਿੰਦਾ ਹੈ ਅਤੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਦੀ ਮਾਤਰਾ ਨੂੰ ਲਗਭਗ 40% ਘਟਾ ਦਿੰਦਾ ਹੈ। ਇਹੀ ਤਕਨੀਕ ਉਹਨਾਂ ਕੰਮਾਂ (tasks) 'ਤੇ 15.3-ਪੁਆਇੰਟ ਦਾ ਵਾਧਾ ਕਰਦੀ ਹੈ ਜੋ agents ਨੇ ਪਹਿਲਾਂ ਕਦੇ ਨਹੀਂ ਦੇਖੇ, ਜੋ ਇਹ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਵਾਧੂ ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ (human-written supervision) ਤੋਂ ਬਿਨਾਂ ਆਪਣੀਆਂ ਗਲਤੀਆਂ ਤੋਂ ਸਿੱਖ ਸਕਦਾ ਹੈ।
RL agents ਨੂੰ pass/fail ਫਲੈਗ ਤੋਂ ਵੱਧ ਦੀ ਲੋੜ ਕਿਉਂ ਹੈ
ਆਮ RL ਸੈੱਟਅੱਪ ਵਿੱਚ ਇੱਕ agent ਨੂੰ ਸਿਰਫ਼ ਇੱਕ ਲੰਬੇ episode ਦੇ ਅੰਤ ਵਿੱਚ ਇਨਾਮ (reward) ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਇਹ ਸਿਗਨਲ ਸਿਸਟਮ ਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਨਤੀਜਾ ਗਲਤ ਸੀ, ਪਰ ਇਹ ਇਸ ਬਾਰੇ ਕੁਝ ਨਹੀਂ ਦੱਸਦਾ ਕਿ ਗਲਤੀ ਕਿੱਥੇ ਹੋਈ ਸੀ। ਜੇਕਰ ਕੋਈ ਗਲਤੀ ਦਸ ਕਦਮ ਪਹਿਲਾਂ ਹੋਈ ਹੋਵੇ—ਸ਼ਾਇਦ ਕੋਈ ਗਲਤ ਸਰਚ ਟਰਮ ਵਰਤਿਆ ਗਿਆ ਹੋਵੇ ਜਾਂ ਕੋਈ ਗਲਤ ਫਾਈਲ ਖੋਲ੍ਹੀ ਗਈ ਹੋਵੇ—ਤਾਂ ਅੰਤਿਮ ਬਾਈਨਰੀ ਸਿਗਨਲ ਸਾਰੀ ਵਿਚਕਾਰਲੀ ਜਾਣਕਾਰੀ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ। ਇਸ ਨੁਕਸਾਨ ਕਾਰਨ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਸਿਰਫ਼ ਉਹਨਾਂ ਦੁਰਲੱਭ ਪੈਟਰਨਾਂ ਨੂੰ ਲੱਭਣ ਲਈ ਬਹੁਤ ਸਾਰੇ episodes ਇਕੱਠੇ ਕਰਨੇ ਪੈਂਦੇ ਹਨ ਜੋ ਅਸਫਲਤਾ ਦਾ ਕਾਰਨ ਬਣਦੇ ਹਨ।
SEED ਫੀਡਬੈਕ ਲੂਪ ਨੂੰ ਕਿਵੇਂ ਬਦਲਦਾ ਹੈ
SEED (Self-Evolving On-Policy Distillation) ਹਰ episode ਤੋਂ ਬਾਅਦ ਇੱਕ ਦੂਜਾ ਲਰਨਿੰਗ ਪਾਸ ਜੋੜਦਾ ਹੈ:
- ਕਾਰਜ (task) ਨੂੰ ਪੂਰਾ ਕਰੋ – agent ਕੰਮ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ, ਅਤੇ ਆਮ ਸਫਲਤਾ/ਅਸਫਲਤਾ (success/failure) ਲੇਬਲ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।
- ਆਪਣਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੜ੍ਹੋ – ਕਾਰਵਾਈਆਂ (actions), ਨਿਰੀਖਣ (observations), ਅਤੇ ਵਿਚਕਾਰਲੇ ਫੈਸਲਿਆਂ ਦੇ ਕ੍ਰਮ ਨੂੰ ਮਾਡਲ ਨੂੰ ਵਾਪਸ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ।
- ਕੁਦਰਤੀ ਭਾਸ਼ਾ (natural-language) ਵਿੱਚ ਸਬਕ ਲਿਖੋ – ਮਾਡਲ ਛੋਟੇ ਵਾਕ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਦੱਸਦੇ ਹਨ ਕਿ ਕੀ ਗਲਤ ਹੋਇਆ, ਜਿਵੇਂ ਕਿ, “search term ‘X’ ਨੇ ਅਪ੍ਰਸੰਗਿਕ ਨਤੀਜੇ ਦਿੱਤੇ” ਜਾਂ “‘Z’ ਦੀ ਬਜਾਏ ‘Y’ ਫਾਈਲ ਖੋਲ੍ਹੀ”।
- ਸਬਕਾਂ ਨੂੰ policy updates ਵਿੱਚ ਤਬਦੀਲ (distill) ਕਰੋ – ਉਹ ਵਾਕ ਇੱਕ ਨਵੇਂ on-policy distillation ਕਦਮ ਲਈ ਟੀਚਾ ਬਣ ਜਾਂਦੇ ਹਨ, ਜੋ ਮਾਡਲ ਨੂੰ ਸੁਧਾਰ ਦੇ ਪਿੱਛੇ ਦਾ ਤਰਕ ਸਿਖਾਉਂਦੇ ਹਨ।
ਤਿਆਰ ਕੀਤੇ ਗਏ ਸਬਕ inference time 'ਤੇ ਵਰਤੇ ਜਾਣ ਵਾਲੇ prompts ਨਹੀਂ ਹਨ; ਉਹ ਅੰਦਰੂਨੀ ਟ੍ਰੇਨਿੰਗ ਸਿਗਨਲ ਹਨ ਜੋ policy ਨੂੰ ਨਵਾਂ ਰੂਪ ਦਿੰਦੇ ਹਨ। ਅਸਲ ਵਿੱਚ, agent ਆਪਣਾ ਅਧਿਆਪਕ ਖੁਦ ਬਣ ਜਾਂਦਾ ਹੈ, ਜੋ ਕੱਚੇ failure logs ਨੂੰ ਸੰਰਚਿਤ ਗਿਆਨ (structured knowledge) ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ।
ਇਹ ਪਹੁੰਚ memory tricks ਨਾਲੋਂ ਵਧੇਰੇ ਕੁਸ਼ਲ ਕਿਉਂ ਹੈ
ਇੱਕ ਆਮ ਤਰੀਕਾ ਇੱਕ ਬਾਹਰੀ memory buffer ਨਾਲ ਜੋੜਨਾ ਹੈ ਜੋ ਬਾਅਦ ਵਿੱਚ ਵਰਤਣ ਲਈ ਮਹੱਤਵਪੂਰਨ ਸਟੇਟਸ ਜਾਂ ਨੋਟਸ ਨੂੰ ਸਟੋਰ ਕਰਦਾ ਹੈ। ਉਹ ਰਣਨੀਤੀ ਇੱਕ ਵਿਸ਼ਾਲ "ਫਾਈਲਿੰਗ ਕੈਬਨਿਟ" ਬਣਾਉਂਦੀ ਹੈ ਜਿੱਥੇ agent ਨੂੰ ਸਹੀ ਸਮੇਂ 'ਤੇ ਸਹੀ ਜਾਣਕਾਰੀ ਲੱਭਣਾ ਸਿੱਖਣਾ ਪੈਂਦਾ ਹੈ—ਇੱਕ ਗੁੰਝਲਦਾਰ ਸਮੱਸਿਆ ਜੋ ਵਾਧੂ ਬੋਝ ਪਾਉਂਦੀ ਹੈ ਅਤੇ ਕਾਰਵਾਈ ਅਤੇ ਨਤੀਜੇ ਵਿਚਕਾਰਲੇ ਕਾਰਨਕ ਸਬੰਧ (causal link) ਨੂੰ ਫਿਰ ਵੀ miss ਕਰ ਸਕਦੀ ਹੈ।
SEED retrieval ਦੀ ਸਮੱਸਿਆ ਤੋਂ ਬਚਦਾ ਹੈ। Distillation ਰਾਹੀਂ ਸਬਕ ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ policy ਵਿੱਚ ਜੋੜ ਕੇ, agent ਸੁਧਾਰ ਨੂੰ ਬਾਅਦ ਵਿੱਚ ਦੇਖਣ ਵਾਲੇ ਨੋਟ ਦੀ ਬਜਾਏ ਇੱਕ ਹੁਨਰ (skill) ਵਜੋਂ ਅਪਣਾ ਲੈਂਦਾ ਹੈ। ਨਤੀਜਾ ਗਲਤੀ ਦੀ ਪਛਾਣ ਅਤੇ ਵਿਵਹਾਰ ਵਿੱਚ ਬਦਲਾਅ ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਮਜ਼ਬੂਤ ਲੂਪ ਹੈ।
ਮਹੱਤਵਪੂਰਨ ਅੰਕੜੇ
- ALFWorld benchmark – 91.8 ਦਾ ਔਸਤ ਸਕੋਰ, ਜੋ ਉਸੇ ਵਾਤਾਵਰਣ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਰਵਾਇਤੀ RL baselines ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ।
- Data efficiency – ਲਗਭਗ 40% ਘੱਟ training episodes ਦੇ ਨਾਲ ਉਹੀ ਜਾਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।
- Generalization – ਅਣਡਿੱਠੇ ਕੰਮਾਂ (unseen tasks) 'ਤੇ, ਇਹ ਵਿਧੀ standard RL ਨਾਲੋਂ 15.3 ਪੁਆਇੰਟ ਵਧਾ ਦਿੰਦੀ ਹੈ, ਜੋ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਸਵੈ-ਤਿਆਰ ਕੀਤੇ ਗਏ ਸਬਕ ਅਨੁਕੂਲ ਤਰਕ ਪੈਟਰਨਾਂ (transferable reasoning patterns) ਨੂੰ ਕੈਪਚਰ ਕਰਦੇ ਹਨ।
ਇਹ ਅੰਕੜੇ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ SEED ਗੁੰਝਲਦਾਰ agents ਦੀ ਟ੍ਰੇਨਿੰਗ ਲਈ ਕੰਪਿਊਟੇਸ਼ਨਲ ਅਤੇ ਡੇਟਾ ਬਜਟ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ, ਜੋ ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਇੱਕ ਵਰਦਾਨ ਹੈ ਜਿਨ੍ਹਾਂ ਕੋਲ ਵੱਡੇ simulation ਸਰੋਤਾਂ ਦੀ ਘਾਟ ਹੈ।
ਜੋਖਮ ਅਤੇ ਸੀਮਾਵਾਂ
ਇਹ ਤਕਨੀਕ ਮਾਡਲ ਦੀ ਆਪਣੇ ਅਨੁਭਵ ਨੂੰ ਸਹੀ ਤਰ੍ਹਾਂ ਸਮਝਣ ਦੀ ਯੋਗਤਾ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ। ਜੇਕਰ agent ਵਾਤਾਵਰਣ ਨੂੰ ਗਲਤ ਸਮਝਦਾ ਹੈ—ਜਿਵੇਂ ਕਿ ਕਿਸੇ ਅਸਫਲਤਾ ਦਾ ਕਾਰਨ ਗਲਤ ਦੱਸਣਾ—ਤਾਂ ਇਹ ਇੱਕ ਭਰੋਸੇਮੰਦ ਪਰ ਗਲਤ ਸਬਕ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ। ਅਜਿਹੇ ਭਰਮ ਵਾਲੇ (hallucinated) ਸਲਾਹਾਂ 'ਤੇ ਟ੍ਰੇਨਿੰਗ ਕਰਨ ਨਾਲ ਮਾੜੀਆਂ ਆਦਤਾਂ ਹੋਰ ਮਜ਼ਬੂਤ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਲੇਖਕ ਨੋਟ ਕਰਦੇ ਹਨ ਕਿ ਇਹ ਮਨੁੱਖੀ post-mortems ਦੇ ਸਮਾਨ ਹੈ, ਜਿੱਥੇ ਵਿਸ਼ਲੇਸ਼ਕ ਕਈ ਵਾਰ ਅਜਿਹੇ ਬਹੁਤ ਹੀ ਸਾਫ਼-ਸੁਥਰੇ ਸਪੱਸ਼ਟੀਕਰਨ ਤਿਆਰ ਕਰਦੇ ਹਨ ਜੋ ਡੂੰਘੇ ਮੁੱਦਿਆਂ ਨੂੰ ਛੁਪਾ ਲੈਂਦੇ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- ਮੌਜੂਦਾ RL pipelines ਨਾਲ ਇੱਕੀਕਰਨ – ਕਿਉਂਕਿ SEED ਸਿਰਫ਼ ਇੱਕ post-episode processing ਕਦਮ ਜੋੜਦਾ ਹੈ, ਇਸ ਨੂੰ ਮਾਮੂਲੀ ਇੰਜੀਨੀਅਰਿੰਗ ਕੋਸ਼ਿਸ਼ ਨਾਲ ਕਈ ਮੌਜੂਦਾ ਟ੍ਰੇਨਿੰਗ ਲੂਪਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।
RL agents ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਨੂੰ episode logs ਨੂੰ ਸਿਰਫ਼ ਅਰਕਾਈਵਲ ਡੇਟਾ (archival data) ਤੋਂ ਵੱਧ ਸਮਝਣਾ ਸ਼ੁਰੂ ਕਰ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ। ਹਰ ਰਨ ਤੋਂ ਬਾਅਦ, ਸਿਸਟਮ ਨੂੰ ਇਹ ਦੱਸਣ ਲਈ ਕਹੋ:
- ਉਹ ਫੈਸਲਾ ਜਿਸ ਨੇ ਕਾਰਜ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਅੱਗੇ ਵਧਾਇਆ।
- ਉਹ ਅਨੁਮਾਨ (assumption) ਜਿਸ ਕਾਰਨ ਸਭ ਤੋਂ ਵੱਧ ਕਦਮਾਂ ਦੀ ਬਰਬਾਦੀ ਹੋਈ।
- ਇੱਕ ਸਧਾਰਨ ਚੈੱਕ ਜੋ ਗਲਤੀ ਨੂੰ ਪਹਿਲਾਂ ਹੀ ਫੜ ਸਕਦਾ ਸੀ।
ਉਹਨਾਂ ਨੋਟ
ਮੁੱਖ ਨਿਚੋੜ: ਅਸਫਲਤਾ ਦੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਨੂੰ ਖੁਦ-ਤਿਆਰ ਕੀਤੇ ਸਬਕਾਂ ਵਿੱਚ ਬਦਲਣਾ ਵਿਰਲ ਰਿਵਾਰਡ ਫੀਡਬੈਕ ਨੂੰ ਇੱਕ ਅਮੀਰ, ਮੁੜ-ਵਰਤੋਂਯੋਗ ਟ੍ਰੇਨਿੰਗ ਸਿਗਨਲ ਵਿੱਚ ਬਦਲ ਸਕਦਾ ਹੈ, ਜੋ ਕਿ ਤੇਜ਼ ਅਤੇ ਵਧੇਰੇ ਡਾਟਾ-ਕੁਸ਼ਲ RL ਲਈ ਇੱਕ ਵਿਹਾਰਕ ਮਾਰਗ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
