OpenAI ನ ಮಾಜಿ ಕಾರ್ಯನಿರ್ವಾಹಕ ಬ್ಯಾರೆಟ್ ಜೊಫ್ (Barret Zoph), Gemini ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳ (large-language models) ಕುಟುಂಬವನ್ನು ವೇಗಗೊಳಿಸಲು Google ನಲ್ಲಿ ಸಂಶೋಧನೆಯ ಉಪಾಧ್ಯಾಯರಾಗಿ (vice-president of research) ಸೇರಿದ್ದಾರೆ. Reinforcement learning ಮತ್ತು post-training ತಂತ್ರಗಳಲ್ಲಿನ ಜೊಫ್ ಅವರ ಪರಿಣತಿಯು Gemini ನ alignment, reasoning ಮತ್ತು safety ಅನ್ನು ಬಲಪಡಿಸುತ್ತದೆ ಎಂದು Google ನಿರೀಕ್ಷಿಸುತ್ತದೆ—ಈ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ಪ್ರಸ್ತುತ OpenAI ನ GPT ಸರಣಿಯು ಮುಂಚೂಣಿಯಲ್ಲಿದೆ.

AI ಗಣ್ಯರ ಅಲೆದಾಟದ ಪಯಣ

ಜೊಫ್ ಅವರ ರೆಸ್ಯೂಮೆ ಈ ವಲಯದ ಇತ್ತೀಚಿನ ಏರಿಳಿತಗಳ ನಕ್ಷೆಯಂತೆ ಕಾಣುತ್ತದೆ. OpenAI ನಲ್ಲಿ ಎರಡು ವರ್ಷಗಳ ನಂತರ, ಅವರು ಅಕ್ಟೋಬರ್ 2024 ರಲ್ಲಿ former OpenAI CTO Mira Murati ಅವರೊಂದಿಗೆ Thinking Machines ಎಂಬ ಸ್ಟಾರ್ಟ್‌ಅಪ್ ಅನ್ನು ಸ್ಥಾಪಿಸಲು ಹೊರಟರು. ಕೆಲವು ತಿಂಗಳುಗಳ ನಂತರ ಆ ಉದ್ಯಮವು ಮುಚ್ಚಲ್ಪಟ್ಟಿತು; ಜನವರಿ 2025 ರ ವೇಳೆಗೆ ಜೊಫ್ ಮತ್ತು ಸಹ-ಸ್ಥಾಪಕ Luke Metz ಅವರು AI ಎಂಟರ್‌ಪ್ರೈಸ್ ಸೇಲ್ಸ್ ಅನ್ನು ಮುನ್ನಡೆಸಲು ಮತ್ತೆ OpenAI ಗೆ ಮರಳಿದರು. ಆ ಪಾತ್ರದಲ್ಲಿ ಐದು ತಿಂಗಳುಗಳ ನಂತರ, ಜೊಫ್ ಅವರು ಜೂನ್ 2025 ರಲ್ಲಿ ಮತ್ತೆ ನಿರ್ಗಮಿಸಿದರು, ಇದು ಅವರು Google ಗೆ ಹೋಗಲು ದಾರಿ ಮಾಡಿಕೊಟ್ಟಿತು.

ಪ್ರತಿಯೊಂದು ಹಂತವು ಒಂದು ವಿಶಾಲವಾದ ಮಾದರಿಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ: ಪ್ರಮುಖ ಸಂಶೋಧಕರು ಸ್ಥಾಪಿತ ಪ್ರಯೋಗಾಲಯಗಳು, ನವೀನ ಸ್ಟಾರ್ಟ್‌ಅಪ್‌ಗಳು ಮತ್ತು ತಂತ್ರಜ್ಞಾನದ ದೈತ್ಯ ಕಂಪನಿಗಳ ನಡುವೆ ಅಲೆದಾಡುತ್ತಿರುತ್ತಾರೆ. ಜೊಫ್ ಅವರ ಇತ್ತೀಚಿನ ಬದಲಾವಣೆಯು AI ನಲ್ಲಿ ಶತಕೋಟಿಗಳನ್ನು ಹೂಡಿಕೆ ಮಾಡಿದ, ಆದರೆ OpenAI ನ ಗಮನ ಸೆಳೆಯುವ ಮಾದರಿ ಬಿಡುಗಡೆಗಳಿಗೆ ಸಮನಾಗಿ ಸ್ಪರ್ಧಿಸಲು ಹೆಣಗಾಡುತ್ತಿರುವ ಕಂಪನಿಗೆ ಅವರನ್ನು ಕರೆತಂದಿದೆ.

Reinforcement learning ಮತ್ತು “post-training” ಏಕೆ ಹೊಸ ಯುದ್ಧಭೂಮಿಯಾಗುತ್ತಿವೆ?

Large-language models ಗಳು ಬೃಹತ್ ಪಠ್ಯ ಸಂಗ್ರಹಗಳ (text corpora) ಮೇಲೆ pre-training ಮಾಡುವ ಮೂಲಕ ಮೂಲ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಪಡೆಯುತ್ತವೆ. ಮುಂದಿನ ಹಂತವನ್ನು—ಅದನ್ನು ಸಾಮಾನ್ಯವಾಗಿ post-training ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ—ವಾಸ್ತವಿಕ ಬಳಕೆಗೆ ಆ ಮಾದರಿಗಳನ್ನು ಸೂಕ್ಷ್ಮವಾಗಿ ಸರಿಹೊಂದಿಸಲಾಗುತ್ತದೆ (fine-tunes). ಅತ್ಯಂತ ಪ್ರಮುಖವಾದ post-training ವಿಧಾನವೆಂದರೆ Reinforcement Learning from Human Feedback (RLHF), ಇಲ್ಲಿ ಮಾನವ ಮೌಲ್ಯಮಾಪಕರು ಮಾದರಿಯ ಫಲಿತಾಂಶಗಳನ್ನು ನಿರ್ಧರಿಸುತ್ತಾರೆ ಮತ್ತು reinforcement-learning ಅಲ್ಗಾರಿದಮ್ ಆ ನಿರ್ಧಾರಗಳಿಗೆ ಅನುಗುಣವಾಗಿ ಮಾದರಿಯನ್ನು ಹೊಂದಿಸುತ್ತದೆ.

Google ನ Gemini ಸಾಲು ಉತ್ತಮವಾದ ಮೂಲ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಅದರ safety ಮತ್ತು instruction-following OpenAI ನ ಇತ್ತೀಚಿನ GPT ಗಿಂತ ಹಿಂದೆ ಬಿದ್ದಿವೆ ಎಂದು ವಿಮರ್ಶಕರು ಗಮನಿಸುತ್ತಾರೆ. RL ಮತ್ತು RLHF ನ ಮಿತಿಯನ್ನು ಪದೇ ಪದೇ ವಿಸ್ತರಿಸುವ ಸಂಶೋಧಕರನ್ನು ನೇಮಿಸುವ ಮೂಲಕ, ಆ ಅಂತರವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಉದ್ದೇಶವನ್ನು Google ಸೂಚಿಸುತ್ತಿದೆ. ಮಾನವ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಬಳಸಿಕೊಳ್ಳುವ પાઇಪ್‌ಲೈನ್‌ಗಳನ್ನು ನಿರ್ಮಿಸಲು, ಸೂಕ್ಷ್ಮ ಉದ್ದೇಶಗಳನ್ನು ಸೆರೆಹಿಡಿಯುವ reward models ಅನ್ನು ರೂಪಿಸಲು ಮತ್ತು ಸ್ಥಿರತೆಯನ್ನು ಬಲಿ ನೀಡದೆ reasoning ಅನ್ನು ಸುಧಾರಿಸುವ ನವೀನ RL ಅಲ್ಗಾರಿದಮ್‌ಗಳೊಂದಿಗೆ ಪ್ರಯೋಗ ಮಾಡಲು ಜೊಫ್ ಸಹಾಯ ಮಾಡಲಿದ್ದಾರೆ.

Google ಮತ್ತು OpenAI ಗೆ ಇರುವ ಪಣಗಳು

Google ಗೆ, ಈ ಕ್ರಮವು Gemini ಅನ್ನು cloud services, search ಮತ್ತು ಗ್ರಾಹಕ ಉತ್ಪನ್ನಗಳಾದ ವಾಣಿಜ್ಯಿಕ ಅಡಿಪಾಯವನ್ನಾಗಿ ಮಾಡುವ ಬಹು-ವರ್ಷದ ಪ್ರಯತ್ನದ ಒಂದು ನಿರ್ದಿಷ್ಟ ಹೆಜ್ಜೆಯಾಗಿದೆ. ಉತ್ತಮವಾಗಿ ಹೊಂದಾಣಿಕೆಯಾದ (Better-aligned) ಮಾದರಿಗಳು ಹೊಣೆಗಾರಿಕೆಯ ಅಪಾಯವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತವೆ ಮತ್ತು ಗ್ರಾಹಕರ ವಿಶ್ವಾಸವನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ—ಉದ್ಯಮಗಳು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ಸುರಕ್ಷಿತವಾಗಿ ಬಳಸಬಹುದಾದ AI ಅನ್ನು ಬಯಸುತ್ತಿರುವಾಗ ಇದು ನಿರ್ಣಾಯಕ ಅಂಶವಾಗಿದೆ.

ಮತ್ತೊಂದೆಡೆ, OpenAI ಕೇವಲ ಜೊಫ್ ಮಾತ್ರವಲ್ಲದೆ ಇತರ ಪ್ರತಿಭೆಗಳ ನಿರ್ಗಮನದ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸುತ್ತಿದೆ. ಕಳೆದ ಎಂಟು ತಿಂಗಳುಗಳಲ್ಲಿ, ಕಂಪನಿಯ ಮುಖ್ಯ ಕಾರ್ಯನಿರ್ವಾಹಕ ಅಧಿಕಾರಿ ಮತ್ತು ಹಿರಿಯ ಡೇಟಾ-ಸೆಂಟರ್ ನಾಯಕರು ಹೊರಹೋಗಿದ್ದಾರೆ, ಜೊತೆಗೆ ಹಲವಾರು ಕಾರ್ಯನಿರ್ವಾಹಕರು ಬದಲಾಗುತ್ತಿದ್ದಾರೆ. OpenAI ಸಂಭಾವ್ಯ IPO ಗಾಗಿ ಸಿದ್ಧತೆ ನಡೆಸುತ್ತಿರುವಾಗ ಈ ನಿರ್ಗಮನಗಳು ಸಂಭವಿಸುತ್ತಿವೆ, ಈ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಹೂಡಿಕೆದಾರರು ಸಾಮಾನ್ಯವಾಗಿ ನಾಯಕತ್ವದ ಸ್ಥಿರತೆಗಾಗಿ ಸೂಕ್ಷ್ಮವಾಗಿ ಗಮನಿಸುತ್ತಾರೆ. ಉದ್ಯೋಗಿಗಳ ಬದಲಾವಣೆ ಹೊಸ ದೃಷ್ಟಿಕೋನಗಳನ್ನು ತರಬಹುದು, ಆದರೆ ಇದು ದೀರ್ಘಾವಧಿಯ ಸಂಶೋಧನಾ ಕಾರ್ಯಕ್ರಮಗಳ ನಿರಂತರತೆಯನ್ನು ಅಡ್ಡಿಪಡಿಸುವ ಅಪಾಯವನ್ನೂ ಹೊಂದಿದೆ.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ಒಬ್ಬ ವ್ಯಕ್ತಿಯ ನೇಮಕಾತಿಯಿಂದ Gemini ರಾತ್ರೋರಾತ್ರಿ ಬದಲಾಗುವುದಿಲ್ಲ

Google ಈಗಾಗಲೇ RL, safety ಮತ್ತು model alignment ನಲ್ಲಿ ಸಂಶೋಧಕರ ದೊಡ್ಡ ತಂಡವನ್ನು ಹೊಂದಿದೆ. ಒಬ್ಬ ಉಪಾಧ್ಯಾಯರು, ಅವರು ಜೊಫ್ ಅವರಂತಹ ಅನುಭವಿಗಳಾಗಿದ್ದರೂ ಸಹ, Gemini ನಂತಹ ದೊಡ್ಡ ಉತ್ಪನ್ನದ ಸಾಲನ್ನು ಒಬ್ಬರೇ ಸಂಪೂರ್ಣವಾಗಿ ಬದಲಾಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ ಎಂದು ಕೆಲವು ವೀಕ್ಷಕರು ಎಚ್ಚರಿಸುತ್ತಾರೆ. ನಿಜವಾದ ಪ್ರಭಾವವು ಜೊಫ್ ತಮ್ಮ ವಿಚಾರಗಳನ್ನು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ತಂಡಗಳೊಂದಿಗೆ ಎಷ್ಟು ವೇಗವಾಗಿ ಸಂಯೋಜಿಸುತ್ತಾರೆ, ಸಂಪನ್ಮೂಲಗಳನ್ನು ಹೇಗೆ ಪಡೆಯುತ್ತಾರೆ ಮತ್ತು ವಿಶಾಲವಾದ ಉತ್ಪನ್ನದ ಮಾರ್ಗಸೂಚಿಯ ಮೇಲೆ ಹೇಗೆ ಪ್ರಭಾವ ಬೀರುತ್ತಾರೆ ಎಂಬುದರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.

ಪ್ರತಿಭೆಗಳ ವರ್ಗಾವಣೆಯು ಕೇವಲ ಕಾರ್ಯತಂತ್ರದ ಅನುಕೂಲಕ್ಕಾಗಿ ಮಾತ್ರವಲ್ಲದೆ ವೈಯಕ್ತಿಕ ಹೊಂದಾಣಿಕೆ ಮತ್ತು ವೃತ್ತಿಜೀವನದ ಹಾದಿಯ ಬಗ್ಗೆಯೂ ಇರುತ್ತದೆ. ಜೊಫ್ ಅವರ ಎಂಟರ್‌ಪ್ರೈಸ್ ಸೇಲ್ಸ್‌ನಲ್ಲಿನ ಅಲ್ಪಾವಧಿಯ ಅವಧಿಯು ಸಂಶೋಧನೆಯೊಂದಿಗೆ ಮಾರುಕಟ್ಟೆಯ ಪ್ರಭಾವವನ್ನು ಬೆರೆಸುವ ಪಾತ್ರಗಳಿಗಾಗಿ ಅವರ ಆಸಕ್ತಿಯನ್ನು ಸೂಚಿಸುತ್ತದೆ—ಕೇವಲ ಸಂಶೋಧನಾ ಪ್ರಯೋಗಾಲಯಕ್ಕಿಂತ Google ಇಂತಹ ಅವಕಾಶವನ್ನು ನೀಡಲು ಉತ್ತಮವಾಗಿ ಹೊಂದಾಣಿಕೆಯಾಗಬಹುದು.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • Gemini ಬಿಡುಗಡೆಗಳು – ಮುಂಬರುವ ಮಾದರಿ ಅಪ್‌ಡೇಟ್‌ಗಳು RL-ಕೇಂದ್ರಿತ ಸುಧಾರಣೆಗಳು safety ಸ್ಕೋರ್‌ಗಳು ಮತ್ತು reasoning benchmarks ಅನ್ನು ಸುಧಾರಿಸುತ್ತವೆಯೇ ಎಂಬುದನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ.
  • ಸಂಶೋಧನಾ ಪ್ರಕಟಣೆಗಳು – Google ಸಂಶೋಧನಾ ವಿಭಾಗದ ಪ್ರಬಂಧಗಳು ಜೊಫ್ ಅವರ ಹೆಸರನ್ನು ಅಥವಾ ಸಹ-ಲೇಖಕರತೆಯನ್ನು ಹೊಂದಿದ್ದರೆ, ಅವು ಆಂತರಿಕ ಪ್ರಯೋಗಗಳ ದಿಕ್ಕನ್ನು ಸೂಚಿಸುತ್ತವೆ.
  • OpenAI ನ ನಾಯಕತ್ವದ ಬದಲಾವಣೆಗಳು – ಹೆಚ್ಚಿನ ಪ್ರಮುಖ ನಿರ್ಗಮನಗಳು ಅಥವಾ ಹೊಸ ನೇಮಕಾತಿಗಳು ಸಾರ್ವಜನಿಕ ಹೂಡಿಕೆಗಿಂತ ಮೊದಲು ಕಂಪನಿಯ ಸಂಶೋಧನಾ ಕಾರ್ಯಸೂಚಿಯನ್ನು ಮರುರೂಪಿಸಬಹುದು.
  • ಮಾರುಕಟ್ಟೆಯ ಪ್ರತಿಕ್ರಿಯೆ – ಕ್ಲೌಡ್-ಸರ್ವಿಸ್ ಗ್ರಾಹಕರು ಮತ್ತು ಎಂಟರ್‌ಪ್ರೈಸ್ ಖರೀದಿದಾರರು Google ನ AI ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವ ಮೊದಲು Gemini ನ alignment ನಲ್ಲಿನ ನಿರ್ದಿಷ್ಟ ಸುಧಾರಣೆಗಳನ್ನು ಗಮನಿಸುತ್ತಾರೆ.

ಮುಖ್ಯಾಂಶಗಳು

Barrett Zoph ಅವರ OpenAI ನಿಂದ Google ಗೆ ವರ್ಗಾವಣೆಯು, AI ಶಸ್ತ್ರಾಸ್ತ್ರ ಸ್ಪರ್ಧೆಯು ಈಗ ಕಂಪ್ಯೂಟ್ (compute) ಸಾಮರ್ಥ್ಯದಷ್ಟೇ ಪ್ರತಿಭೆಯ (talent) ವಿಷಯದಲ್ಲೂ ನಡೆಯುತ್ತಿದೆ ಎಂಬುದನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ. Gemini ಸಂಶೋಧನೆಯ ನೇತೃತ್ವದಲ್ಲಿ reinforcement-learning ತಜ್ಞರನ್ನು ನೇಮಿಸುವ ಮೂಲಕ, post-training ಮೇಲೆ ಹೆಚ್ಚಿನ ಗಮನ ಹರಿಸುವುದರಿಂದ OpenAI ನ GPT ಮಾದರಿಗಳಿಗೂ ಮತ್ತು Gemini ಗೂ ಇರುವ ಕಾರ್ಯಕ್ಷಮತೆ ಹಾಗೂ ಸುರಕ್ಷತೆಯ ಅಂತರವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಎಂದು Google ಪಣತೊಟ್ಟಿದೆ — ಇದು ಉದ್ಯಮದ ಸ್ಪರ್ಧಾತ್ಮಕ ಚಲನಶೀಲತೆಯನ್ನು ಮರುರೂಪಿಸುವ ಒಂದು ಫಲಿತಾಂಶವಾಗಬಹುದು.