ਖੋਜਕਰਤਾਵਾਂ ਨੇ Ring-Zero ਨਾਮ ਦਾ ਇੱਕ ਨਵਾਂ ਰੀਇਨਫੋਰਸਮੈਂਟ-ਲਰਨਿੰਗ ਫਰੇਮਵਰਕ ਐਲਾਨਿਆ ਹੈ ਜੋ ਇੱਕ ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ ਭਾਸ਼ਾ ਮਾਡਲ ਨੂੰ ਟੋਕਨ-ਬਜਟ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਰਹਿੰਦਿਆਂ ਤਰਕ ਕਰਨਾ ਸਿਖਾਉਂਦਾ ਹੈ, ਅਤੇ ਮਾਡਲ ਨੇ 2026 AIME ਗਣਿਤ ਪ੍ਰੀਖਿਆ ਵਿੱਚ 84.2% ਅੰਕ ਪ੍ਰਾਪਤ ਕੀਤੇ। ਇਹ ਨਤੀਜਾ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਇਸ ਪੱਧਰ 'ਤੇ, ਮਾਡਲ ਉਹ ਕਦਮ-ਦਰ-ਕਦਮ ਸਮੱਸਿਆ ਹੱਲ ਕਰਨ ਦੀਆਂ ਆਦਤਾਂ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਇੰਜੀਨੀਅਰਾਂ ਨੇ ਰਵਾਇਤੀ ਤੌਰ 'ਤੇ ਪ੍ਰੋਂਪਟਾਂ ਵਿੱਚ ਹਾਰਡ-ਕੋਡ ਕੀਤੀਆਂ ਹੁੰਦੀਆਂ ਹਨ।
ਇਹ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
AIME-ਪੱਧਰ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਲੰਬੇ ਸਮੇਂ ਤੋਂ "ਮਨੁੱਖੀ-ਪੱਧਰ" ਦੀ ਮਾਤਰਾਤਮਕ ਤਰਕਸ਼ੀਲਤਾ ਲਈ ਇੱਕ ਮੀਨਾਰ (benchmark) ਰਹੀ ਹੈ। ਬਿਨਾਂ ਕਿਸੇ ਮਨੁੱਖ ਦੁਆਰਾ ਲਿਖੇ ਉਦਾਹਰਣਾਂ ਦੇ 84.2% ਦੀ ਰੇਂਜ ਤੱਕ ਪਹੁੰਚਣਾ ਇਹ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਮਾਡਲ ਦੀ ਤਰਕ ਕਰਨ ਦੀ ਯੋਗਤਾ ਟ੍ਰੇਨਿੰਗ ਡਾਇਨਾਮਿਕਸ ਤੋਂ ਆਪਣੇ ਆਪ ਉਭਰਦੀ ਹੈ, ਨਾ ਕਿ ਹੱਥਾਂ ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਗਏ ਸਕੈਫੋਲਡਸ (scaffolds) ਤੋਂ। AI ਏਜੰਟ ਬਣਾਉਣ ਵਾਲੀਆਂ ਕੰਪਨੀਆਂ ਲਈ, ਇਸਦਾ ਅਰਥ ਸਪੱਸ਼ਟ ਹੈ: ਵਿਸਤ੍ਰਿਤ ਪ੍ਰੋਂਪਟ ਰੈਸਿਪੀਜ਼ ਲਿਖਣ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਬਣਾਈ ਰੱਖਣ ਦੀ ਜਗ੍ਹਾ ਇੱਕ ਅਜਿਹੀ ਟ੍ਰੇਨਿੰਗ ਲੂਪ ਨਾਲ ਬਦਲੀ ਜਾ ਸਕਦੀ ਹੈ ਜੋ ਮਾਡਲ ਨੂੰ ਸਿਖਾਉਂਦੀ ਹੈ ਕਿ ਕਦੋਂ ਡੂੰਘਾਈ ਨਾਲ ਸੋਚਣਾ ਹੈ ਅਤੇ ਕਦੋਂ ਇੱਕ ਸਸਤਾ ਸ਼ਾਰਟਕੱਟ ਕਾਫੀ ਹੋਵੇਗਾ।
ਪ੍ਰੋਂਪਟ ਇੰਜੀਨੀਅਰਿੰਗ ਤੋਂ ਟ੍ਰੇਨਿੰਗ ਡਾਇਨਾਮਿਕਸ ਤੱਕ
ਸਾਲਾਂ ਤੋਂ, ਡਿਵੈਲਪਰਾਂ ਨੇ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਨੂੰ ਬਹੁ-ਪੜਾਵੀ ਤਰਕ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਨ ਲਈ "ਸਮੱਸਿਆ ਨੂੰ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡੋ" ਜਾਂ "ਆਪਣੇ ਉੱਤਰ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ" ਵਰਗੇ ਪ੍ਰੋਂਪਟ ਟੈਂਪਲੇਟਸ 'ਤੇ ਭਰੋਸਾ ਕੀਤਾ ਹੈ। ਉਹ ਟੈਂਪਲੇਟਸ ਬਾਹਰੀ ਸਕੈਫੋਲਡਿੰਗ ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹਨ; ਮਾਡਲ ਹਦਾਇਤਾਂ ਦੀ ਪਾਲਣਾ ਕਰਦਾ ਹੈ ਪਰ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ ਨਹੀਂ ਅਪਣਾਉਂਦਾ। Ring-Zero ਇਸ ਪੈਰਾਡਾਈਮ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਮਾਡਲ ਨੂੰ ਇੱਕ ਕਾਰਜ ਵੇਰਵਾ ਇੱਕ ਪ੍ਰਮਾਣਿਤ ਉੱਤਰ (verifiable answer) ਦੇ ਨਾਲ ਪ੍ਰਾਪਤ ਹੁੰਦਾ ਹੈ—ਇੱਕ ਅਜਿਹਾ ਗਰਾਊਂਡ-ਟਰੂਥ ਜਿਸਦੀ ਆਪਣੇ ਆਪ ਜਾਂਚ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਫਿਰ ਇਹ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਇੱਕ ਲੜੀ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਅਤੇ ਰਿਵਾਰਡ (reward) ਉਦੋਂ ਹੀ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਜਦੋਂ ਕੋਸ਼ਿਸ਼ ਪ੍ਰਮਾਣਿਤ ਉੱਤਰ ਨਾਲ ਮੇਲ ਖਾਂਦੀ ਹੈ, ਅਤੇ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਰਾਹੀਂ ਆਪਣੀ ਨੀਤੀ (policy) ਨੂੰ ਅਪਡੇਟ ਕਰਦਾ ਹੈ।
ਕਿਉਂਕਿ ਰਿਵਾਰਡ ਇੱਕ ਅਜਿਹੇ ਉਦੇਸ਼ ਨਾਲ ਜੁੜਿਆ ਹੋਇਆ ਹੈ ਜਿਸ ਵਿੱਚ ਧੋਖਾ ਦੇਣਾ ਮੁਸ਼ਕਲ ਹੈ (ਉੱਤਰ ਸਹੀ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ, ਨਾ ਕਿ ਸਿਰਫ਼ ਪ੍ਰਤਿਸ਼ਾਤਮਕ), ਮਾਡਲ ਆਪਣੇ ਆਪ ਤਰਕ ਦੇ ਪੈਟਰਨਾਂ ਦੀ ਖੋਜ ਕਰਦਾ ਹੈ। ਪੇਪਰ ਦਾ ਤਰਕ ਹੈ ਕਿ ਇੱਕ ਵਾਰ ਭਰੋਸੇਯੋਗ ਰਿਵਾਰਡ ਸਿਗਨਲ ਮਿਲ ਜਾਣ ਤੋਂ ਬਾਅਦ, ਮਾਡਲ ਨੂੰ ਟ੍ਰਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਤੱਕ ਵਧਾਉਣਾ ਆਪਣੇ ਆਪ ਉਹਨਾਂ ਪ੍ਰੋਂਪਟ-ਇੰਜੀਨੀਅਰਿੰਗ ਤਰੀਕਿਆਂ ਨੂੰ ਸਾਹਮਣੇ ਲਿਆਉਂਦਾ ਹੈ ਜੋ ਇੰਜੀਨੀਅਰਾਂ ਨੇ ਛੋਟੇ ਮਾਡਲਾਂ ਲਈ ਮੈਨੂਅਲੀ ਪਾਏ ਹੁੰਦੇ ਹਨ।
ਚਾਰ-ਪੜਾਅ ਵਾਲੀ ਟ੍ਰੇਨਿੰਗ ਪਾਈਪਲਾਈਨ
Ring-Zero ਦੀ ਟ੍ਰੇਨਿੰਗ ਚਾਰ ਵੱਖ-ਵੱਖ ਪੜਾਵਾਂ ਵਿੱਚੋਂ ਲੰਘਦੀ ਹੈ:
- ਪਹਿਲੇ ਪੜਾਅ ਦੀ RL – ਮਾਡਲ ਸੰਭਵ ਤਰਕਸ਼ੀਲਤਾ ਦੇ ਨਿਸ਼ਾਨਾਂ (reasoning traces) ਦੀ ਪੜਚੋਲ ਕਰਦਾ ਹੈ, ਇਹ ਸਿੱਖਦੇ ਹੋਏ ਕਿ ਕਿਹੜੇ ਟੋਕਨ ਸੀਕੁਐਂਸ ਸਹੀ ਉੱਤਰਾਂ ਵੱਲ ਲੈ ਜਾਂਦੇ ਹਨ।
- Self-distillation – ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਟ੍ਰੇਸ ਮਾਡਲ ਵਿੱਚ ਵਾਪਸ ਆਉਂਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਉਭਰਦੇ ਤਰਕਸ਼ੀਲਤਾ ਦੇ ਪੈਟਰਨ ਸਥਿਰ ਹੁੰਦੇ ਹਨ।
- ਦੂਜੇ ਪੜਾਅ ਦੀ RL – ਇੱਕ ਵਧੇਰੇ ਬਾਰੀਕ ਲੂਪ ਪਹਿਲਾਂ ਦੀਆਂ ਸੁਧਾਰਾਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਨੀਤੀ ਨੂੰ ਸੁਧਾਰਦਾ ਹੈ।
- Tiered training – ਮਾਡਲ ਸਮੱਸਿਆ ਦੀ ਮੁਸ਼ਕਲ ਦੇ ਅਧਾਰ 'ਤੇ ਛੋਟੇ (≈2 k tokens) ਅਤੇ ਲੰਬੇ (≈20 k tokens) ਤਰਕ ਮਾਰਗਾਂ ਵਿੱਚੋਂ ਚੁਣ ਕੇ ਬੁੱਧੀਮਾਨਤਾ ਨਾਲ ਟੋਕਨ ਬਜਟ ਅਲਾਟ ਕਰਨਾ ਸਿੱਖਦਾ ਹੈ।
Tiered training ਸਭ ਤੋਂ ਵੱਧ ਉਤਪਾਦਨ-ਸਬੰਧਤ (production-relevant) ਹਿੱਸਾ ਹੈ। ਅਸਲ ਤੈਨਾਤੀਆਂ (deployments) ਵਿੱਚ, ਹਰ ਵਾਧੂ ਟੋਕਨ ਕੰਪਿਊਟਿੰਗ ਲ
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
AI ਅਭਿਆਸੀਆਂ ਲਈ ਵਿਹਾਰਕ ਸਿੱਖਿਆਵਾਂ
- ਪ੍ਰੋਂਪਟਸ (prompts) ਨੂੰ ਇਕਲੌਤੇ ਸਾਧਨ ਵਜੋਂ ਨਾ ਦੇਖੋ – ਇਹ ਪੁੱਛੋ ਕਿ ਕੀ ਉਹ ਵਿਵਹਾਰ ਜਿਸਨੂੰ ਤੁਸੀਂ ਪ੍ਰੋਂਪਟਸ ਵਿੱਚ ਕੋਡ ਕਰ ਰਹੇ ਹੋ, ਇਸ ਦੀ ਬਜਾਏ ਰਿਵਾਰਡ-ਡਰਿਵਨ (reward-driven) ਟ੍ਰੇਨਿੰਗ ਲੂਪ ਰਾਹੀਂ ਸਿੱਖਿਆ ਜਾ ਸਕਦਾ ਹੈ।
- ਟੋਕਨ ਵਰਤੋਂ (token usage) ਨੂੰ ਇੱਕ ਮੁੱਖ ਉਦੇਸ਼ ਬਣਾਓ – ਸ਼ੁਰੂਆਤ ਵਿੱਚ ਹੀ ਬਜਟ-ਜਾਣੂ (budget-aware) ਸਿਗਨਲ ਸ਼ਾਮਲ ਕਰੋ; ਮਾਡਲ ਸ਼ੁੱਧਤਾ (accuracy) ਅਤੇ ਕੰਪਿਊਟ ਲਾਗਤ (compute cost) ਵਿਚਕਾਰ ਸੰਤੁਲਨ ਬਣਾਉਣਾ ਸਿੱਖ ਜਾਵੇਗਾ।
- ਫੀਡਬੈਕ ਲੂਪ ਨੂੰ ਪੂਰਾ ਕਰੋ – ਅਜਿਹੀ ਪ੍ਰਣਾਲੀ ਲਾਗੂ ਕਰੋ ਜੋ ਆਪਣੇ ਆਪ ਕੰਮ (tasks) ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ, ਪ੍ਰਮਾਣਿਤ ਉੱਤਰਾਂ ਦੇ ਵਿਰੁੱਧ ਨਤੀਜਿਆਂ ਨੂੰ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ ਵਾਪਸ ਟ੍ਰੇਨਿੰਗ ਵਿੱਚ ਭੇਜਦੀ ਹੈ। ਇਹ ਲੂਪ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਮਾਡਲ ਆਪਣਾ ਖੁਦ ਦਾ ਵਰਕਫਲੋ (workflow) ਲੱਭਦਾ ਹੈ।
ਜਦੋਂ ਰਿਵਾਰਡ ਸਪੱਸ਼ਟ ਹੁੰਦਾ ਹੈ ਅਤੇ ਵਾਤਾਵਰਣ ਭਰੋਸੇਯੋਗ ਤਰੀਕੇ ਨਾਲ ਸਫਲਤਾ ਨੂੰ ਮਾਪ ਸਕਦਾ ਹੈ, ਮਾਡਲ ਨੂੰ ਵਧਾਉਣਾ (scaling up) ਸਿਰਫ਼ ਸਮਰੱਥਾ ਵਧਾਉਣ ਤੋਂ ਕਿਤੇ ਵੱਧ ਹੈ—ਇਹ ਮਾਡਲ ਨੂੰ ਚੁਣਨਾ ਸਿਖਾਉਂਦਾ ਹੈ ਕਿ ਕਿਵੇਂ ਸੋਚਣਾ ਹੈ। ਹੱਥ ਨਾਲ ਲਿਖੇ ਸਕੈਫੋਲਡਿੰਗ (scaffolding) ਤੋਂ ਸਵੈ-ਨਿਰਦੇਸ਼ਿਤ ਤਰਕ (self-directed reasoning) ਵੱਲ ਇਹ ਤਬਦੀਲੀ AI ਏਜੰਟਾਂ ਨੂੰ ਬਣਾਉਣ ਅਤੇ ਉਹਨਾਂ ਦੀ ਕੀਮਤ ਨਿਰਧਾਰਤ ਕਰਨ ਦੇ ਤਰੀਕੇ ਨੂੰ ਮੁੜ-ਰੂਪ ਦੇ ਸਕਦੀ ਹੈ।
