ਚੀਨ ਦਾ Orca ਵਰਲਡ ਮਾਡਲ ਐਕਸ਼ਨ ਲੇਬਲਜ਼ ਤੋਂ ਬਿਨਾਂ ਵਿਸ਼ੇਸ਼ ਰੋਬੋਟਿਕਸ ਦੇ ਬਰਾਬਰ ਹੈ

ਚੀਨ ਦੇ ਖੋਜਕਰਤਾਵਾਂ ਦੀ ਇੱਕ ਵੱਡੀ ਪ੍ਰਾਪਤੀ AI ਬੁੱਧੀ ਦੀ ਮੂਲ ਪਰਿਭਾਸ਼ਾ ਨੂੰ ਚੁਣੌਤੀ ਦੇ ਰਹੀ ਹੈ, ਇਹ ਸਾਬਤ ਕਰਦੇ ਹੋਏ ਕਿ ਇੱਕ 通 (unified) ਵਰਲਡ ਮਾਡਲ ਸਿੱਧੇ ਨਿਗਰਾਨੀ ਤੋਂ ਬਿਨਾਂ ਰੋਬੋਟਿਕਸ ਵਿੱਚ ਮਾਹਰ ਹੋ ਸਕਦਾ ਹੈ। Orca ਮਾਡਲ ਇਹ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਵੀਡੀਓ ਰਾਹੀਂ ਦੁਨੀਆ ਕਿਵੇਂ ਬਦਲਦੀ ਹੈ, ਇਸ ਨੂੰ ਦੇਖ ਕੇ ਹੀ ਇੱਕ AI ਡੂੰਘੀ ਅੰਦਰੂਨੀ ਸਮਝ ਵਿਕਸਿਤ ਕਰ ਸਕਦਾ ਹੈ ਜੋ ਗੁੰਝਲਦਾਰ ਸਰੀਰਕ ਕਾਰਵਾਈਆਂ ਕਰਨ ਦੇ ਯੋਗ ਹੋਵੇ।

ਦੁਵਿਧਾ-ਪੱਖੀ ਸਿੱਖਣ ਇੰਜਣ: ਅਚੇਤ ਅਤੇ ਸੁਚੇਤ ਮੋਡ

Orca ਆਪਣੇ ਅੰਦਰੂਨੀ "world state" ਨੂੰ ਬਣਾਉਣ ਲਈ ਦੋ-ਪੱਖੀ ਸਿਖਲਾਈ ਪਹੁੰਚ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਰਵਾਇਤੀ ਵਿਸ਼ੇਸ਼ ਮਾਡਲਾਂ ਤੋਂ ਵੱਖਰਾ ਹੈ। ਪਹਿਲਾ ਤਰੀਕਾ, "unconscious learning" (ਅਚੇਤ ਸਿੱਖਣਾ), 125,000 ਘੰਟਿਆਂ ਦੇ ਅਣ-ਲੇਬਲਡ ਵੀਡੀਓ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨਾ ਹੈ। ਇਸ ਪੜਾਅ ਦੌਰਾਨ, ਮਾਡਲ ਇੱਕ ਅਮੂਰਤ (abstract) ਸਪੇਸ ਵਿੱਚ ਭਵਿੱਖ ਦੇ ਫਰੇਮਾਂ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇਹ ਇੱਕ ਵੀ ਕੈਪਸ਼ਨ ਦੀ ਲੋੜ ਤੋਂ ਬਿਨਾਂ ਗਤੀ ਦੇ ਪੈਟਰਨਾਂ, ਵਸਤੂਆਂ ਦੇ ਢੱਕੇ ਜਾਣ (occlusions), ਅਤੇ ਦ੍ਰਿਸ਼ ਦੀ ਗਤੀਸ਼ੀਲਤਾ ਨੂੰ ਸਮਝ ਸਕਦਾ ਹੈ।

ਦੂਜਾ ਤਰੀਕਾ, "conscious learning" (ਸੁਚੇਤ ਸਿੱਖਣਾ), ਜ਼ਬਾਨੀ ਹਦਾਇਤਾਂ ਅਤੇ ਵੇਰਵੇ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਵੀਡੀਓਜ਼ ਨੂੰ ਵੱਖ-ਵੱਖ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡ ਕੇ ਅਤੇ ਨਤੀਜੇ ਵਜੋਂ ਹੋਣ ਵਾਲੇ ਸਟੇਟ ਬਦਲਾਅ ਨੂੰ ਲੇਬਲ ਕਰਕੇ, Orca ਇੱਕ ਖਾਸ ਕਾਰਵਾਈ ਅਤੇ ਉਸਦੇ ਸਰੀਰਕ ਨਤੀਜੇ ਵਿਚਕਾਰ ਕਾਰਨ-ਅਸਰ (causal) ਸਬੰਧ ਨੂੰ ਸਿੱਖਦਾ ਹੈ। ਇਹ ਸੁਮੇਲ ਮਾਡਲ ਨੂੰ ਕੱਚੀ ਵਿਜ਼ੂਅਲ ਪਛਾਣ ਅਤੇ ਉੱਚ-ਪੱਧਰੀ ਭਾਸ਼ਾਈ ਤਰਕ ਵਿਚਕਾਰਲੇ ਪਾੜੇ ਨੂੰ ਪੂਰਾ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।

ਸਵੈਪ ਕਰਨ ਯੋਗ ਇੰਟੈਲੀਜੈਂਸ ਮੋਡਿਊਲਜ਼ ਦੇ ਨਾਲ ਇੱਕ ਫ੍ਰੋਜ਼ਨ ਕੋਰ (Frozen Core)

Orca ਦੀ ਆਰਕੀਟੈਕਚਰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਬਹੁਮੁਖਤਾ ਲਈ ਤਿਆਰ ਕੀਤੀ ਗਈ ਹੈ। ਇਹ ਪਹਿਲਾਂ ਤੋਂ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ Qwen3.5 language-image ਮਾਡਲ ਨੂੰ ਇੱਕ "frozen core" ਵਜੋਂ ਵਰਤਦਾ ਹੈ। ਹਰ ਕੰਮ ਲਈ ਪੂਰੇ ਸਿਸਟਮ ਨੂੰ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦੇਣ ਦੀ ਬਜਾਏ, ਖੋਜਕਰਤਾ ਇਸ ਸਥਿਰ ਅਧਾਰ ਨਾਲ ਵਿਸ਼ੇਸ਼, ਹਲਕੇ "heads" ਜੋੜਦੇ ਹਨ:

  • Text Output: ਮੌਜੂਦਾ Qwen3.5 language head ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।
  • Image Generation: ਅੰਦਰੂਨੀ world state ਨੂੰ ਵਿਜ਼ੂਅਲ ਭਵਿੱਖਬਾਣੀਆਂ ਵਿੱਚ ਬਦਲਣ ਲਈ Stable Diffusion 3.5 ਨਾਲ ਜੁੜੇ ਛੋਟੇ ਅਡੈਪਟਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।
  • Robot Control: World states ਨੂੰ ਸਰੀਰਕ ਹਰਕਤਾਂ ਵਿੱਚ ਬਦਲਣ ਲਈ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਇੱਕ ਕਸਟਮ-ਬਣਾਇਆ "Action Expert" ਮੋਡਿਊਲ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।

ਇਹ ਮੋਡੂਲਰਤਾ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੀ ਹੈ ਕਿ ਦੁਨੀਆ ਦੀ ਕੇਂਦਰੀ ਸਮਝ ਇਕਸਾਰ ਰਹੇ, ਚਾਹੇ ਮਾਡਲ ਕਿਸੇ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦੇ ਰਿਹਾ ਹੋਵੇ, ਵੀਡੀਓ ਬਣਾ ਰਿਹਾ ਹੋਵੇ, ਜਾਂ ਮਕੈਨੀਕਲ ਹੱਥ (mechanical arm) ਨੂੰ ਕੰਟਰੋਲ ਕਰ ਰਿਹਾ ਹੋਵੇ।

ਵਿਸ਼ੇਸ਼ ਮਾਡਲਾਂ ਅਤੇ ਦਿੱਗਜਾਂ ਤੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ

Orca-4B ਲਈ ਪ੍ਰਦਰਸ਼ਨ ਮਾਪਦੰਡ ਮਹੱਤਵਪੂਰਨ ਹਨ। ਟੈਕਸਟ-ਅਧਾਰਤ ਵੀਡੀਓ ਬੈਂਚਮਾਰਕਸ 'ਤੇ, Orca-4B ਨੇ ਔਸਤ 51.8 ਪ੍ਰਤੀਸ਼ਤ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ Emu3 (34B) ਵਰਗੇ ਬਹੁਤ ਵੱਡੇ ਮਾਡਲਾਂ ਅਤੇ DeepSeek-VL2-3B ਵਰਗੇ ਵਿਸ਼ੇਸ਼ VLMs ਤੋਂ ਬਿਹਤਰ ਹੈ। PRICE-V0.1 ਬੈਂਚਮਾਰਕ ਰਾਹੀਂ ਇਮੇਜ ਪ੍ਰੀਡਿਕਸ਼ਨ ਕਾਰਜਾਂ ਵਿੱਚ, Orca-4B ਨੇ 59.8 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਕੀਤਾ, ਜੋ FLUX.2 small ਵਰਗੇ ਉੱਚ-ਪੱਧਰੀ ਜਨਰੇਟਰਾਂ ਤੋਂ ਅੱਗੇ ਹੈ।

ਸਭ ਤੋਂ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤੌਰ 'ਤੇ, Orca ਪੰਜ ਮੈਨੀਪੂਲੇਸ਼ਨ (manipulation) ਕਾਰਜਾਂ ਵਿੱਚ $\pi$0.5—ਇੱਕ ਸਿਸਟਮ ਜੋ ਸਿਰਫ਼ ਰੋਬੋਟਿਕ ਐਕਸ਼ਨ ਡੇਟਾ 'ਤੇ ਬਣਾਇਆ ਗਿਆ ਹੈ—ਦੇ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਕੌਲਿਆਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਦੇ ਉੱਪਰ ਰੱਖਣਾ ਅਤੇ ਚੀਨੀ ਚੁੱਕਣਾ। ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ Orca ਨੇ ਆਪਣੇ ਵਿਸ਼ਾਲ ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ ਪੜਾਅ ਦੌਰਾਨ ਕਦੇ ਵੀ ਐਕਸ਼ਨ ਲੇਬਲ ਦੇਖੇ ਬਿਨਾਂ ਇਹ ਪ੍ਰਾਪਤ ਕੀਤਾ। ਇਸ ਨੇ ਬਿਹਤਰ ਗਲਤੀ ਸੁਧਾਰ (error recovery) ਵੀ ਦਿਖਾਇਆ, ਜਿੱਥੇ ਅਸਫਲ ਗ੍ਰਾਸਪ (grasps) ਨੂੰ ਦੁਬਾਰਾ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ, ਜਦੋਂ ਕਿ ਵਿਸ਼ੇਸ਼ ਮਾਡਲ ਅਕਸਰ ਦੁਹਰਾਓ ਵਾਲੇ ਲੂਪਾਂ ਵਿੱਚ ਫਸ ਜਾਂਦੇ ਹਨ।

ਇਹ AI ਦੇ ਭਵਿੱਖ ਲਈ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Orca ਆਧੁਨਿਕ ਰੋਬੋਟਿਕਸ ਵਿੱਚ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਰੁਕਾਵਟਾਂ ਵਿੱਚੋਂ ਇੱਕ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ: ਲੇਬਲਡ ਐਕਸ਼ਨ ਡੇਟਾ ਦੀ ਲਗਾਤਾਰ ਕਮੀ। ਇਹ ਸਾਬਤ ਕਰਕੇ ਕਿ ਇੱਕ AI ਪੈਸਿਵ ਨਿਰੀਖਣ (passive observation) ਰਾਹੀਂ "ਦੁਨੀਆ ਦੇ ਭੌਤਿਕ ਵਿਗਿਆਨ" (physics of the world) ਨੂੰ ਸਿੱਖ ਸਕਦਾ ਹੈ, ਇਹ ਖੋਜ ਅਜਿਹੇ ਜਨਰਲ-ਪਰਪਜ਼ ਰੋਬੋਟਾਂ ਲਈ ਰਾਹ ਪੱਧਰਾ ਕਰਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਮਿਲੀਅਨਾਂ ਘੰਟਿਆਂ ਦੇ ਮੈਨੂਅਲ, ਹੱਥ ਨਾਲ ਲੇਬਲ ਕੀਤੇ ਟੈਲੀਓਪਰੇਸ਼ਨ ਡੇਟਾ ਦੀ ਲੋੜ ਤੋਂ ਬਿਨਾਂ ਨਵੇਂ ਵਾਤਾਵਰਣਾਂ ਵਿੱਚ ਤਾਇਨਾਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ

  • Unsupervised Foundation: Orca ਅਣ-ਲੇਬਲਡ ਵੀਡੀਓ ਦੇ "unconscious learning" ਰਾਹੀਂ ਦੁਨੀਆ ਦੀ ਗਤੀਸ਼ੀਲਤਾ ਨੂੰ ਸਿੱਖਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਹਿੰਗੇ ਮਨੁੱਖੀ-ਅਨੋਟੇਟਡ ਡੇਟਾਸੈਟਾਂ 'ਤੇ ਨਿਰਭਰਤਾ ਘਟਦੀ ਹੈ।
  • Modular Architecture: ਸਵੈਪ ਕਰਨ ਯੋਗ ਅਡੈਪਟਰਾਂ ਦੇ ਨਾਲ ਇੱਕ ਫ੍ਰੋਜ਼ਨ Qwen3.5 ਕੋਰ ਦੀ ਵਰਤੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਇੱਕੋ ਸਮੇਂ ਟੈਕਸਟ, ਇਮੇਜ ਅਤੇ ਰੋਬੋਟਿਕ ਕੰਟਰੋਲ ਵਿੱਚ ਉੱਤਮ ਬਣਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ।
  • Robotic Parity: Orca-4B ਪ੍ਰੀ-ਟ੍ਰੇਨਿੰਗ ਦੌਰਾਨ ਐਕਸ਼ਨ ਲੇਬਲ ਦੇ ਕਿਸੇ ਵੀ ਪੂਰਵ ਅਨੁਭਵ ਦੇ ਬਾਵਜੂਦ ਮੈਨੀਪੂਲੇਸ਼ਨ ਕਾਰਜਾਂ ਵਿੱਚ ਵਿਸ਼ੇਸ਼ ਰੋਬੋਟਿਕ ਸਿਸਟਮਾਂ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਬਰਾਬਰ ਹੈ।