ਟ੍ਰਾਂਸਫਾਰਮਰਜ਼ ਤੋਂ ਪਰੇ: ਉਹ ਸਟਾਰਟਅੱਪਸ ਜੋ LLMs ਦੇ ਅਗਲੇ ਯੁੱਗ ਨੂੰ ਮੁੜ ਪਰਿਭਾਸ਼ਿਤ ਕਰ ਰਹੇ ਹਨ
ਟ੍ਰਾਂਸਫਾਰਮਰ ਦਾ ਯੁੱਗ ਇੱਕ ਮੂਲ ਰੁਕਾਵਟ (bottleneck) ਦਾ ਸਾਹਮਣਾ ਕਰ ਰਿਹਾ ਹੈ ਕਿਉਂਕਿ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) ਦੀਆਂ ਕੰਪਿਊਟੇਸ਼ਨਲ ਮੰਗਾਂ ਇੱਕ ਅਜਿਹੇ ਮੋੜ 'ਤੇ ਪਹੁੰਚ ਗਈਆਂ ਹਨ ਜਿੱਥੇ ਉਹ ਸੰਭਾਲਣ ਤੋਂ ਬਾਹਰ ਹੋ ਰਹੀਆਂ ਹਨ। ਹਾਲਾਂਕਿ 2017 ਦੇ "Attention Is All You Need" ਪੇਪਰ ਨੇ ਮੌਜੂਦਾ AI ਬੂਮ ਦੀ ਨੀਂਹ ਰੱਖੀ ਸੀ, ਪਰ ਹੁਣ ਸਟਾਰਟਅੱਪਸ ਦੀ ਇੱਕ ਨਵੀਂ ਪੀੜ੍ਹੀ ਅਸਲ ਕੁਸ਼ਲਤਾ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਇਸਦੇ ਮੁੱਖ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਬਦਲਣ ਜਾਂ ਮੁੜ ਸਿਰਜਣ ਲਈ ਦੌੜ ਰਹੀ ਹੈ।
ਟ੍ਰਾਂਸਫਾਰਮਰ ਰੁਕਾਵਟ: ਡੈਂਸ ਅਟੈਂਸ਼ਨ (Dense Attention) ਕਿਉਂ ਅਸਫਲ ਹੋ ਰਹੀ ਹੈ
ਲਗਭਗ ਇੱਕ ਦਹਾਕੇ ਤੋਂ, ਟ੍ਰਾਂਸਫਾਰਮਰ AI ਉਦਯੋਗ ਦਾ ਇੰਜਣ ਰਿਹਾ ਹੈ, ਜੋ "ਡੈਂਸ ਅਟੈਂਸ਼ਨ" ਵਜੋਂ ਜਾਣੇ ਜਾਂਦੇ ਮਕੈਨਿਜ਼ਮ ਦੁਆਰਾ ਚਲਾਇਆ ਜਾਂਦਾ ਹੈ। ਇਹ ਪ੍ਰਕਿਰਿਆ ਟੈਕਸਟ ਦੇ ਇੱਕ ਬਲਾਕ ਵਿੱਚ ਹਰ ਟੋਕਨ ਦੀ ਤੁਲਨਾ ਵਿਸ਼ਾਲ ਪੱਧਰ 'ਤੇ ਗੁਣਾ ਰਾਹੀਂ ਦੂਜੇ ਹਰ ਟੋਕਨ ਨਾਲ ਕਰਦੀ ਹੈ। ਭਾਵੇਂ ਇਹ ਅਰਥਾਂ (semantic meaning) ਨੂੰ ਫੜਨ ਵਿੱਚ ਬਹੁਤ ਸਹੀ ਹੈ, ਪਰ ਇਸਦੀ ਗਣਿਤਕ ਜਟਿਲਤਾ (mathematical complexity) ਬਹੁਤ ਤੇਜ਼ੀ ਨਾਲ ਵਧਦੀ ਹੈ।
ਉਦਾਹਰਨ ਲਈ, 10,000 ਸ਼ਬਦਾਂ ਦੇ ਦਸਤਾਵੇਜ਼ ਲਈ ਇੱਕ ਟ੍ਰਾਂਸਫਾਰਮਰ ਨੂੰ ਲਗਭਗ 50 ਮਿਲੀਅਨ ਗੁਣਾ ਕਰਨ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ। ਕੰਪਿਊਟੇਸ਼ਨ ਵਿੱਚ ਇਹ ਕੁਆਡ੍ਰੈਟਿਕ ਵਾਧਾ (quadratic growth) ਦੋ ਵੱਡੀਆਂ ਚੁਣੌਤੀਆਂ ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ: ਬਹੁਤ ਜ਼ਿਆਦਾ ਊਰਜਾ ਦੀ ਖਪਤ ਅਤੇ ਸੀਮਤ ਕੰਟੈਕਸਟ ਵਿੰਡੋਜ਼ (context windows)। ਰਿਪੋਰਟਾਂ ਅਨੁਸਾਰ OpenAI ਇਸ ਸਾਲ ਕੰਪਿਊਟਿੰਗ 'ਤੇ 50 ਅਰਬ ਡਾਲਰ ਖਰਚਣ ਲਈ ਤਿਆਰ ਹੈ ਅਤੇ 2030 ਤੱਕ ਡਾਟਾ ਸੈਂਟਰਾਂ ਦੀ ਬਿਜਲੀ ਦੀ ਮੰਗ ਦੁੱਗਣੀ ਹੋਣ ਦੀ ਉਮੀਦ ਹੈ, ਜਿਸ ਕਾਰਨ ਉਦਯੋਗ ਲਾਗਤ ਅਤੇ ਭੌਤਿਕ ਵਿਗਿਆਨ (physics) ਦੋਵਾਂ ਦੀਆਂ ਸੀਮਾਵਾਂ ਨਾਲ ਟਕਰਾ ਰਿਹਾ ਹੈ।
ਅਟੈਂਸ਼ਨ ਬਾਰੇ ਮੁੜ ਸੋਚਣਾ: ਸਪਾਰਸ ਮਕੈਨਿਜ਼ਮਜ਼ (Sparse Mechanisms) ਦਾ ਉਭਾਰ
ਕੁਸ਼ਲਤਾ ਦੇ ਸੰਕਟ ਨੂੰ ਹੱਲ ਕਰਨ ਲਈ, ਕਈ ਸਟਾਰਟਅੱਪਸ "ਡੈਂਸ ਅਟੈਂਸ਼ਨ" ਤੋਂ ਹਟ ਕੇ "ਸਪਾਰਸ ਅਟੈਂਸ਼ਨ" (sparse attention) ਵੱਲ ਵਧਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰ ਰਹੇ ਹਨ। ਹਰ ਸੰਭਵ ਸ਼ਬਦਾਂ ਦੇ ਜੋੜਾਂ ਦੀ ਗਣਨਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਸਪਾਰਸ ਅਟੈਂਸ਼ਨ ਸਿਰਫ ਸਭ ਤੋਂ ਪ੍ਰਸੰਗਿਕ ਕਨੈਕਸ਼ਨਾਂ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਕੰਪਿਊਟੇਸ਼ਨਲ ਲੋਡ ਵਿੱਚ ਕਾਫੀ ਕਮੀ ਆਉਂਦੀ ਹੈ।
ਮਿਆਮੀ ਸਥਿਤ ਸਟਾਰਟਅੱਪ Subquadratic ਆਪਣੇ SubQ ਮਾਡਲ ਨਾਲ ਇਸ ਖੇਤਰ ਵਿੱਚ ਮੋਹਰੀ ਹੈ। ਪਿਛਲੇ ਸਪਾਰਸ ਮਕੈਨਿਜ਼ਮਜ਼ ਦੇ ਉਲਟ, ਜੋ ਸ਼ੁੱਧਤਾ ਬਣਾਈ ਰੱਖਣ ਲਈ ਸੰਘਰਸ਼ ਕਰਦੇ ਸਨ, Subquadratic ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ ਇਸਦੀ ਤਕਨਾਲੋਜੀ ਕੋਡਿੰਗ ਅਤੇ ਸਰਚ ਵਰਗੇ ਵਿਸ਼ੇਸ਼ ਕੰਮਾਂ ਵਿੱਚ ਮੁੱਖਧਾਰਾ LLMs ਦੇ ਬਰਾਬਰ ਹੈ। ਉਹਨਾਂ ਦਾ ਤਰੀਕਾ ਇੱਕ ਡਾਇਨਾਮਿਕ ਸਿਸਟਮ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ ਜੋ ਗੈਰ-ਪ੍ਰਸੰਗਿਕ ਟੋਕਨਾਂ 'ਤੇ ਸਮਾਂ ਬਰਬਾਦ ਕਰਨ ਦੀ ਬਜਾਏ, ਇਹ ਪਛਾਣਦਾ ਹੈ ਕਿ ਦਿੱਤੇ ਗਏ ਟੈਕਸਟ ਲਈ ਕਿਹੜੇ ਸ਼ਬਦ ਅਸਲ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਹਨ।
ਪਾਵਰ ਰਿਟੈਂਸ਼ਨ (Power Retention): ਰੋਲਿੰਗ ਸਮਰੀਜ਼ ਵੱਲ ਵਧਣਾ
ਇੱਕ ਹੋਰ ਤਰੀਕਾ ਅਟੈਂਸ਼ਨ ਮਕੈਨਿਜ਼ਮ ਤੋਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਦੂਰ ਹੋਣਾ ਹੈ। ਸੈਨ ਫਰਾਂਸਿਸਕੋ ਸਥਿਤ Manifest AI "ਪਾਵਰ ਰਿਟੈਂਸ਼ਨ" ਨਾਮਕ ਇੱਕ ਤਕਨੀਕ ਦੀ ਅਗਵਾਈ ਕਰ ਰਿਹਾ ਹੈ। ਜਦੋਂ ਕਿ SubQ ਵਰਗੇ ਸਪਾਰਸ ਅਟੈਂਸ਼ਨ ਮਾਡਲ ਅਜੇ ਵੀ ਪੂਰੇ ਕੰਟੈਕਸਟ ਵਿੰਡੋ ਦੀ ਇੱਕ ਰੂਪ ਰੇਖਾ ਰੱਖਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹਨ, ਪਾਵਰ ਰਿਟੈਂਸ਼ਨ ਮਾਡਲ ਨੂੰ ਉਸਦੀ ਯਾਦਦਾਸ਼ਤ ਦੀ ਇੱਕ ਰੋਲਿੰਗ ਸਮਰੀ (rolling summary) ਪ੍ਰਦਾਨ ਕਰਕੇ ਕੰਮ ਕਰਦੀ ਹੈ।
ਜਿਵੇਂ ਹੀ ਨਵੀਂ ਜਾਣਕਾਰੀ ਕੰਟੈਕਸਟ ਵਿੰਡੋ ਵਿੱਚ ਦਾਖਲ ਹੁੰਦੀ ਹੈ, ਮਾਡਲ ਘੱਟ ਪ੍ਰਸੰਗਿਕ ਡੇਟਾ ਦੀ ਪਛਾਣ ਕਰਦਾ ਹੈ ਅਤੇ ਉਸਨੂੰ ਹਟਾ ਦਿੰਦਾ ਹੈ, ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ ਕਿ ਇਨਪੁਟ ਦੇ ਆਕਾਰ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਕੰਪਿਊਟੇਸ਼ਨਲ ਲੋਡ ਕੰਟਰੋਲ ਵਿੱਚ ਰਹੇ। Manifest AI ਨੇ ਪਹਿਲਾਂ ਹੀ ਇਸ ਤਰੀਕੇ ਦੀ ਵਿਵਹਾਰਕਤਾ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ ਹੈ:
- ਪਾਵਰ ਰਿਟੈਂਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਓਪਨ-ਸੋਰਸ StarCoder ਮਾਡਲ ਨੂੰ PowerCoder ਵਿੱਚ ਬਦਲ ਕੇ।
- Brumby ਨੂੰ ਰਿਲੀਜ਼ ਕਰਕੇ, ਜੋ ਕਿ ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਹੈ ਜਿਸਦਾ ਉਹ ਦਾਅਵਾ ਕਰਦੇ ਹਨ ਕਿ ਇਹ ਅਲੀਬਾਬਾ ਦੇ ਪ੍ਰਸਿੱਧ Qwen ਓਪਨ-ਸੋਰਸ ਮਾਡਲਾਂ ਦੇ ਬਰਾਬਰ ਹੈ।
ਘੱਟ ਤੋਂ ਘੱਟ ਰੀ-ਟ੍ਰੇਨਿੰਗ ਨਾਲ ਮੌਜੂਦਾ ਟ੍ਰਾਂਸਫਾਰਮਰ ਮਾਡਲਾਂ ਨੂੰ ਪਾਵਰ ਰਿਟੈਂਸ਼ਨ ਮਾਡਲਾਂ ਵਿੱਚ ਬਦਲਣ ਦੀ ਸਮਰੱਥਾ ਇਹ ਸੰਕੇਤ ਦਿੰਦੀ ਹੈ ਕਿ "LLMs+"—ਮਾਡਲਾਂ ਦੀ ਅਗਲੀ ਪੀੜ੍ਹੀ—ਵੱਲ ਤਬਦੀਲੀ ਉਮੀਦ ਨਾਲੋਂ ਕਿਤੇ ਤੇਜ਼ੀ ਨਾਲ ਹੋ ਸਕਦੀ ਹੈ।
ਮੁੱਖ ਗੱਲਾਂ
- ਟ੍ਰਾਂਸਫਾਰਮਰ ਦੀ ਸੀਮਾ: ਡੈਂਸ ਅਟੈਂਸ਼ਨ ਦਾ ਕੁਆਡ੍ਰੈਟਿਕ ਸਕੇਲਿੰਗ ਮੌਜੂਦਾ LLMs ਨੂੰ ਚਲਾਉਣ ਲਈ ਬਹੁਤ ਮਹਿੰਗਾ ਬਣਾਉਂਦਾ ਹੈ ਅਤੇ ਵਿਸ਼ਾਲ ਡੇਟਾਸੈਟਾਂ ਜਾਂ ਲੰਬੇ ਰੂਪ ਵਿੱਚ ਤਰਕ (reasoning) ਲਈ ਇਸਨੂੰ ਵਧਾਉਣਾ ਮੁਸ਼ਕਲ ਬਣਾਉਂਦਾ ਹੈ।
- ਸਪਾਰਸ ਬਨਾਮ ਰਿਟੈਂਸ਼ਨ: ਸਟਾਰਟਅੱਪਸ ਦੋ ਪਾਸਿਆਂ ਤੋਂ ਸਮੱਸਿਆ ਦਾ ਹੱਲ ਕਰ ਰਹੇ ਹਨ: Subquadratic ਸਪਾਰਸ ਕੈਲਕੂਲੇਸ਼ਨਜ਼ (SubQ) ਰਾਹੀਂ ਅਟੈਂਸ਼ਨ ਨੂੰ ਅਪਟੀਮਾਈਜ਼ ਕਰ ਰਿਹਾ ਹੈ, ਜਦੋਂ ਕਿ Manifest AI ਇਸਨੂੰ ਰੋਲਿੰਗ ਸਮਰੀਜ਼ (Power Retention) ਨਾਲ ਬਦਲ ਰਿਹਾ ਹੈ।
- ਆਰਥਿਕ ਲੋੜ: ਜਿਵੇਂ-ਜਿਵੇਂ AI ਕੰਪਿਊਟਿੰਗ ਦੀ ਲਾਗਤ ਦਸਾਂ ਅਰਬ ਡਾਲਰਾਂ ਤੱਕ ਪਹੁੰਚ ਰਹੀ ਹੈ, ਅਗਲੇ AI ਯੁੱਗ ਦਾ ਜੇਤੂ ਸ਼ਾਇਦ ਉਹ ਹੋਵੇਗਾ ਜੋ ਸਿਰਫ ਵਿਸ਼ਾਲ ਪੱਧਰ (raw scale) ਦੀ ਬਜਾਏ ਕੁਸ਼ਲਤਾ (efficiency) ਦਾ ਹੱਲ ਲੱਭੇਗਾ।
