ਟੈਂਪਲੇਟ ਟੋਕਨਜ਼ ਹੈਡ ਪ੍ਰੂਨਿੰਗ (Head Pruning) ਨੂੰ ਸੰਭਵ ਬਣਾਉਂਦੇ ਹਨ
ਟੈਂਪਲੇਟ ਟੋਕਨਜ਼ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਦੁਬਾਰਾ ਸਿਖਲਾਈ (retraining) ਦਿੱਤੇ ਬਿਨਾਂ ਇੱਕ ਡਿਫਿਊਜ਼ਨ ਟ੍ਰਾਂਸਫਾਰਮਰ ਦੇ ਕੰਮ ਦਾ ਲਗਭਗ ਪੰਜਵਾਂ ਹਿੱਸਾ ਘਟਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੇ ਹਨ; ਗੁਣਵੱਤਾ ਵਿੱਚ ਆਈ ਕਮੀ ਬਹੁਤ ਹੀ ਘੱਟ ਮਹਿਸੂਸ ਹੁੰਦੀ ਹੈ।
ਇੱਕ ਨਵੀਂ ਖੋਜ ਤੋਂ ਪਤਾ ਲੱਗਦਾ ਹੈ ਕਿ ਕੁਝ ਖਾਸ ਟੋਕਨਜ਼ 'ਸਿਮੈਂਟਿਕ ਰਜਿਸਟਰਾਂ' (semantic registers) ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹਨ—ਛੋਟੇ "ਸਿੰਕਸ" (sinks) ਜੋ ਪ੍ਰੋਂਪਟ ਤੋਂ ਜਾਣਕਾਰੀ ਇਕੱਠੀ ਕਰਦੇ ਹਨ। ਇਹ ਦੇਖ ਕੇ ਕਿ ਕਿਹੜੇ ਅਟੈਂਸ਼ਨ ਹੈਡਜ਼ (attention heads) ਇਹਨਾਂ ਰਜਿਸਟਰਾਂ 'ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੇ ਹਨ, ਲੇਖਕ ਉਹਨਾਂ ਹੈਡਜ਼ ਨੂੰ ਹਟਾ ਦਿੰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਦੇ ਅਟੈਂਸ਼ਨ FLOPs ਵਿੱਚ ਲਗਭਗ 20% ਦੀ ਕਮੀ ਆਉਂਦੀ ਹੈ, ਜਦੋਂ ਕਿ GenEval ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਸਿਰਫ 1.4 ਅੰਕਾਂ ਦੀ ਗਿਰਾਵਟ ਆਉਂਦੀ ਹੈ।
ਡਿਫਿਊਜ਼ਨ ਮਾਡਲਾਂ ਲਈ ਪ੍ਰੂਨਿੰਗ (pruning) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਡਿਫਿਊਜ਼ਨ ਟ੍ਰਾਂਸਫਾਰਮਰ ਕਈ ਟੈਕਸਟ-ਟੂ-ਇਮੇਜ (text-to-image) ਜਨਰੇਟਰਾਂ ਨੂੰ ਚਲਾਉਂਦੇ ਹਨ। ਇਨਫਰੈਂਸ (inference) ਦੌਰਾਨ ਉਹਨਾਂ ਦੀਆਂ ਅਟੈਂਸ਼ਨ ਲੇਅਰਾਂ ਕੰਪਿਊਟ ਬਜਟ ਦਾ ਵੱਡਾ ਹਿੱਸਾ ਲੈਂਦੀਆਂ ਹਨ, ਇਸ ਲਈ ਥੋੜ੍ਹੀ ਜਿਹੀ ਕਮੀ ਵੀ ਚਿੱਤਰ ਬਣਾਉਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਤੇਜ਼ ਕਰ ਸਕਦੀ ਹੈ ਅਤੇ ਊਰਜਾ ਦੀ ਵਰਤੋਂ ਘਟਾ ਸਕਦੀ ਹੈ। ਮੌਜੂਦਾ ਪ੍ਰੂਨਿੰਗ ਤਰੀਕੇ ਆਮ ਤੌਰ 'ਤੇ ਵੇਟ ਮੈਗਨੀਟਿਊਡ (weight magnitude) ਜਾਂ ਗ੍ਰੇਡੀਐਂਟ ਸਿਗਨਲਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਨ, ਇਹ ਮੰਨ ਕੇ ਕਿ ਹਰ ਹੈਡ ਬਰਾਬਰ ਯੋਗਦਾਨ ਪਾਉਂਦਾ ਹੈ। ਇਹ ਸਾਂਝਾ ਤਰੀਕਾ ਜਾਂ ਤਾਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਕੰਮ ਨੂੰ ਅਣਛੂਆ ਛੱਡ ਦਿੰਦਾ ਹੈ ਜਾਂ ਜਦੋਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਹੈਡਸ ਹਟਾ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ ਤਾਂ ਆਊਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਂਦਾ ਹੈ।
ਟੈਂਪਲੇਟ-ਟੋਕਨ ਤਰੀਕਾ
ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਦੇਖਿਆ ਕਿ ਕੁਝ ਟੋਕਨ ਲਗਾਤਾਰ ਟੈਕਸਟ ਪ੍ਰੋਂਪਟ ਤੋਂ ਆਬਜੈਕਟ-ਲੇਵਲ ਦੇ ਸੰਕੇਤ ਇਕੱਠੇ ਕਰਦੇ ਹਨ। ਇਹ "ਟੈਂਪਲੇਟ ਟੋਕਨਜ਼" ਸਮਰਪਿਤ ਰਜਿਸਟਰਾਂ ਵਾਂਗ ਕੰਮ ਕਰਦੇ ਹਨ: ਉਹ ਪ੍ਰੋਂਪਟ ਦੇ ਅਰਥਾਂ (semantics) ਨੂੰ ਸੋਖ ਲੈਂਦੇ ਹਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਅੱਗੇ ਭੇਜ ਦਿੰਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਮਾਡਲ ਦਾ ਬਾਕੀ ਹਿੱਸਾ ਵਿਜ਼ੂਅਲ ਵੇਰਵਿਆਂ ਦੀ ਪ੍ਰਕਿਰਿਆ ਜਾਰੀ ਰੱਖਦਾ ਹੈ।
ਪ੍ਰੂਨਿੰਗ ਪਾਈਪਲਾਈਨ ਸਿੱਧੀ ਹੈ:
- ਕੁਝ ਪ੍ਰੋਂਪਟਾਂ 'ਤੇ ਫਾਰਵਰਡ ਪਾਸ (forward pass) ਚਲਾਓ ਅਤੇ ਅਟੈਂਸ਼ਨ ਸਕੋਰ ਰਿਕਾਰਡ ਕਰੋ।
- ਉਹਨਾਂ ਹੈਡਜ਼ ਦੀ ਪਛਾਣ ਕਰੋ ਜਿਨ੍ਹਾਂ ਦੇ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਸੰਬੰਧ ਟੈਂਪਲੇਟ ਟੋਕਨਾਂ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੇ ਹਨ।
- ਮਾਡਲ ਵਿੱਚੋਂ ਉਹਨਾਂ ਹੈਡਜ਼ ਨੂੰ ਹਟਾ ਦਿਓ; ਇਸ ਲਈ ਕਿਸੇ ਵਾਧੂ ਡੇਟਾ, ਫਾਈਨ-ਟਿਊਨਿੰਗ (fine-tuning) ਜਾਂ ਆਰਕੀਟੈਕਚਰਲ ਤਬਦੀਲੀ ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ।
ਕਿਉਂਕਿ ਹਟਾਏ ਗਏ ਹੈਡਜ਼ ਮੁੱਖ ਤੌਰ 'ਤੇ ਉਹੀ ਪ੍ਰੋਂਪਟ ਜਾਣਕਾਰੀ ਦਿੰਦੇ ਸਨ ਜੋ ਟੈਂਪਲੇਟ ਟੋਕਨਾਂ ਕੋਲ ਪਹਿਲਾਂ ਹੀ ਮੌਜੂਦ ਸੀ, ਇਸ ਲਈ ਸਮੁੱਚਾ ਸਿਗਨਲ ਫਲੋ (signal flow) ਬਰਕਰਾਰ ਰਹਿੰਦਾ ਹੈ।
ਅੰਕੜੇ ਜੋ ਆਪਣੇ ਆਪ ਬੋਲਦੇ ਹਨ
ਸਟੈਂਡਰਡ ਟੈਕਸਟ-ਟੂ-ਇਮੇਜ ਡਿਫਿਊਜ਼ਨ ਟ੍ਰਾਂਸਫਾਰਮਰਾਂ 'ਤੇ ਇਸ ਵਿਧੀ ਨੂੰ ਲਾਗੂ ਕਰਨ ਨਾਲ ਇਹ ਨਤੀਜੇ ਮਿਲਦੇ ਹਨ:
- ਅਟੈਂਸ਼ਨ FLOPs ਵਿੱਚ ≈ 20% ਦੀ ਕਮੀ, ਜੋ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਇਨਫਰੈਂਸ ਦੀ ਗਤੀ ਵਧਾਉਂਦੀ ਹੈ।
- GenEval ਸਕੋਰ ਵਿੱਚ ਸਿਰਫ 1.4 ਅੰਕਾਂ ਦੀ ਗਿਰਾਵਟ, ਜੋ ਕੰਪਿਊਟ ਗੇਨ (compute gain) ਦੇ ਮੁਕਾਬਲੇ ਬਹੁਤ ਘੱਟ ਹੈ।
- ਵਿਜ਼ੂਅਲ ਫਿਡੈਲਿਟੀ (visual fidelity) ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਬਦਲੇ ਬਿਨਾਂ 20%–30% ਹੈਡਸ ਨੂੰ ਪ੍ਰੂਨ ਕਰਨ ਦੀ ਸਮਰੱਥਾ।
ਇਸ ਦੇ ਉਲਟ, ਸਧਾਰਨ ਹੈਡ-ਪ੍ਰਤੀਸ਼ਤ ਕਟੌਤੀਆਂ ਅਕਸਰ ਗੁਣਵੱਤਾ ਵਿੱਚ ਵੱਡੀ ਗਿਰਾਵਟ ਦਾ ਕਾਰਨ ਬਣਦੀਆਂ ਹਨ, ਕਿਉਂਕਿ ਉਹ ਬਿਨਾਂ ਕਿਸੇ ਵਿਤਕਰੇ ਦੇ ਉਪਯੋਗੀ ਕੰਟੈਕਸ-ਮਿਕਸਿੰਗ ਮਾਰਗਾਂ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦੀਆਂ ਹਨ।
ਸੀਮਾਵਾਂ ਅਤੇ ਖੁੱਲ੍ਹੇ ਸਵਾਲ
ਇਹ ਕੰਮ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਉਹਨਾਂ ਡਿਫਿਊਜ਼ਨ ਟ੍ਰਾਂਸਫਾਰਮਰਾਂ 'ਤੇ ਕੇਂਦਰਿਤ ਹੈ ਜੋ ਟੈਕਸਟ ਪ੍ਰੋਂਪਟਾਂ ਨੂੰ ਚਿੱਤਰਾਂ ਵਿੱਚ ਬਦਲਦੇ ਹਨ। ਇਹ ਅਜੇ ਵੀ ਅਸਪਸ਼ਟ ਹੈ ਕਿ ਕੀ ਇਹੀ ਟੈਂਪਲੇਟ-ਟੋਕਨ ਵਰਗਾ ਵਰਤਾਰਾ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ (language models) ਜਾਂ ਹੋਰ ਮਲਟੀਮੋਡਲ ਆਰਕੀਟੈਕਚਰਾਂ ਵਿੱਚ ਵੀ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ। ਜੇਕਰ ਰਜਿਸਟਰ ਮੌਜੂਦ ਨਹੀਂ ਹਨ ਜਾਂ ਵੱਖਰੇ ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਕਰਦੇ ਹਨ, ਤਾਂ ਪ੍ਰੂਨਿੰਗ ਦਾ ਇਹ ਤਰੀਕਾ ਆਪਣਾ ਪ੍ਰਭਾਵ ਗੁਆ ਸਕਦਾ ਹੈ।
ਸਾਵਧਾਨੀ ਦਾ ਇੱਕ ਹੋਰ ਨੁਕਤਾ ਗੁਣਵੱਤਾ ਵਿੱਚ ਹੋਣ ਵਾਲੀ ਮਾਮੂਲੀ ਗਿਰਾਵਟ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਭਵਿੱਖ ਦੀ ਖੋਜ ਸ਼ਾਇਦ ਇਹ ਪਤਾ ਲਗਾਏਗੀ:
- ਕੀ ਟੈਂਪਲੇਟ ਟੋਕਨ ਹੋਰ ਟ੍ਰਾਂਸਫਾਰਮਰ ਪਰਿਵਾਰਾਂ ਵਿੱਚ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਉਭਰਦੇ ਹਨ।
- ਮਾਡਲ ਦੇ ਆਕਾਰ ਅਤੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਦੀ ਮਾਤਰਾ ਦੇ ਨਾਲ ਇਹ ਤਰੀਕਾ ਕਿਵੇਂ ਵਧਦਾ ਹੈ।
ਮੁੱਖ ਨੁਕਤਾ (Takeaway): ਟੈਂਪਲੇਟ ਟੋਕਨਾਂ ਦੀ ਸਿਮੈਂਟਿਕ ਰਜਿਸਟਰਾਂ ਵਜੋਂ ਲੁਕੀ ਹੋਈ ਭੂਮਿਕਾ ਦਾ ਫਾਇਦਾ ਉਠਾਉਂਦੇ ਹੋਏ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਡਿਫਿਊਜ਼ਨ ਟ੍ਰਾਂਸਫਾਰਮਰਾਂ ਨੂੰ ਛਾਂਟਣ ਦਾ ਇੱਕ ਸਟੀਕ ਤਰੀਕਾ ਲੱਭ ਲਿਆ ਹੈ—ਕੰਮ ਦਾ ਲਗਭਗ ਪੰਜਵਾਂ ਹਿੱਸਾ ਘਟਾਉਂਦੇ ਹੋਏ ਆਊਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਲਗਭਗ ਬਰਕਰਾਰ ਰੱਖਣਾ। ਇਹ ਮਹਿੰਗੀ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦੇ ਬਿਨਾਂ AI-ਨਿਰਮਿਤ ਚਿੱਤਰਾਂ ਨੂੰ ਤੇਜ਼ ਅਤੇ ਸਸਤਾ ਬਣਾ ਸਕਦਾ ਹੈ।
