DeepMind ಈ ವಾರ DiffusionGemma ಅನ್ನು ಅನಾವರಣಗೊಳಿಸಿತು, ಇದು ಏಕೈಕ H100 GPU ಮೇಲೆ ಸೆಕೆಂಡಿಗೆ ಸುಮಾರು 1,500 ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸಬಲ್ಲ ಒಂದು ಓಪನ್-ವೇಟ್ (open-weight) ಭಾಷಾ ಮಾದರಿಯಾಗಿದೆ, ಆದರೆ ಪ್ರಮಾಣಿತ Gemma 4 ಮಾದರಿಯು ಸೆಕೆಂಡಿಗೆ 303 ಟೋಕನ್‌ಗಳ ಹತ್ತಿರ ತಲುಪುತ್ತದೆ. ಈ ವೇಗದ ಹೆಚ್ಚಳವು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಇದು ನೈಜ-ಸಮಯದ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಲ್ಲಿ AI-ಚಾಲಿತ ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿಧಾನಗೊಳಿಸುವ ವಿಳಂಬದ (latency) ಅಡಚಣೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು.

DiffusionGemma ಹೇಗೆ ಟೋಕನ್-ಬೈ-ಟೋಕನ್ ಅಭ್ಯಾಸವನ್ನು ಮುರಿಯುತ್ತದೆ

ಹೆಚ್ಚಿನ ಆಧುನಿಕ ಭಾಷಾ ಮಾದರಿಗಳು ಸ್ವಯಂ-ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕವಾಗಿ (autoregressively) ಪಠ್ಯವನ್ನು ಉತ್ಪಾದಿಸುತ್ತವೆ: ಅವು ಒಂದು ಟೋಕನ್ ಅನ್ನು ಊಹಿಸುತ್ತವೆ, ಅದನ್ನು ಮಾದರಿಗೆ ಮರಳಿ ನೀಡುತ್ತವೆ, ನಂತರ ಮುಂದಿನ ಟೋಕನ್ ಅನ್ನು ಊಹಿಸುತ್ತವೆ. ಆ "ಎಡದಿಂದ ಬಲಕ್ಕೆ" ಇರುವ ಲೂಪ್ ಕಂಪ್ಯೂಟ್ ಮತ್ತು ಮೆಮೊರಿ ನಡುವೆ ಕಟ್ಟುನಿಟ್ಟಾದ ಸಂಬಂಧವನ್ನು ಬಯಸುತ್ತದೆ, ಏಕೆಂದರೆ ಪ್ರತಿ ಟೋಕನ್‌ಗೆ ಮಾದರಿಯ ತೂಕಗಳನ್ನು (weights) ಪ್ರವೇಶಿಸಬೇಕಾಗುತ್ತದೆ. DiffusionGemma ಈ ಲೂಪ್ ಅನ್ನು ಒಂದು ಡಿಸ್ಕ್ರೀಟ್ ಡಿಫ್ಯೂಷನ್ ಪ್ರಕ್ರಿಯೆಯಿಂದ (discrete diffusion process) ಬದಲಾಯಿಸುತ್ತದೆ, ಇದು 256-ಟೋಕನ್ ಚಂಕ್ ಅನ್ನು ಶಬ್ದಯುಕ್ತ ಡೇಟಾದ (noisy data) ಒಂದೇ ಬ್ಲಾಕ್ ಆಗಿ ಪರಿಗಣಿಸುತ್ತದೆ. ನಂತರ ಮಾದರಿಯು ಇಡೀ ಬ್ಲಾಕ್ ಅನ್ನು ಸಮಾಂತರವಾಗಿ (parallel) ಡಿನಾಯ್ಸ್ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಕೆಲಸವು ಪದೇ ಪದೇ ತೂಕಗಳನ್ನು ಹುಡುಕುವ ಬದಲು ಪ್ರತಿ ಹಂತದಲ್ಲಿ ಹೆಚ್ಚಿನ ಕಂಪ್ಯೂಟ್ ಕೆಲಸಕ್ಕೆ ಬದಲಾಗುತ್ತದೆ. Nvidia ನ H100 ನಂತಹ ಸಮಾಂತರ ಗಣಿತದಲ್ಲಿ (parallel math) ಅತ್ಯುತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಹಾರ್ಡ್‌ವೇರ್‌ನಲ್ಲಿ, ಈ ಬದಲಾವಣೆಯು ಪ್ರಯೋಜನಕಾರಿಯಾಗುತ್ತದೆ.

AI ಏಜೆಂಟ್‌ಗಳಿಗೆ ವೇಗ ಏಕೆ ಮುಖ್ಯ

ಸ್ವಾಯತ್ತ ಏಜೆಂಟ್‌ಗಳು (Autonomous agents) ಸಾಮಾನ್ಯವಾಗಿ ಹುಡುಕಾಟ, ಸಾರಾಂಶ ಮತ್ತು ಪರೀಕ್ಷೆಯ ಚಕ್ರವನ್ನು ನಡೆಸುತ್ತವೆ. ಪ್ರತಿ ಹಂತವು ಹಲವಾರು ಮಾದರಿ ಕರೆಗಳನ್ನು ಒಳಗೊಂಡಿರಬಹುದು, ಆದ್ದರಿಂದ ಪ್ರತಿ ಟೋಕನ್‌ನ ವಿಳಂಬವು (latency) ವೇಗವಾಗಿ ಹೆಚ್ಚಾಗುತ್ತದೆ. ಮಾದರಿಯು ನಿಧಾನವಾದಾಗ, ಇಡೀ ಏಜೆಂಟ್ ಪೈಪ್‌ಲೈನ್ ವಿಳಂಬವಾಗುತ್ತದೆ, ಇದು ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ ಮತ್ತು ಬಳಕೆದಾರರ ಅನುಭವವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ.

ಕಾರ್ಯಕ್ಷಮತೆಯ ಹೊಂದಾಣಿಕೆ (Performance trade-off)

DiffusionGemma ನ ವೇಗವು ಅದರ ಮೂಲ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಗಮನಾರ್ಹ ವೆಚ್ಚವನ್ನು ತರುತ್ತದೆ. AIME ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ—ಇದು ತರ್ಕ (reasoning), ಸತ್ಯಾಸತ್ಯತೆ ಮತ್ತು ಭಾಷಾ ತಿಳುವಳಿಕೆಯನ್ನು ಅಳೆಯುವ ಒಂದು ಸರಣಿಯಾಗಿದೆ—DiffusionGemma 69.1 ಅಂಕಗಳನ್ನು ಪಡೆಯುತ್ತದೆ, ಆದರೆ Gemma 4 ಮಾದರಿಯು 88.3 ತಲುಪುತ್ತದೆ. ಡಿಫ್ಯೂಷನ್ ವಿಧಾನವು ಅತಿ ಕಡಿಮೆ ಪಠ್ಯದ ಹೊರಹರಿವು ಮತ್ತು ಸಾಂದರ್ಭಿಕ ಟೋಕನ್ "ಸಂದಿಗ್ಧತೆ"ಯೊಂದಿಗೆ (stuttering) ದೌರ್ಬಲ್ಯಗಳನ್ನು ತೋರಿಸುತ್ತದೆ, ಅಲ್ಲಿ ಉತ್ಪಾದಿತ ಪಠ್ಯವು ಪುನರಾವರ್ತನೆಯಾಗುತ್ತದೆ ಅಥವಾ ತಡಾಡಿಸುತ್ತದೆ. ಸುಮಾರು 32 ಕ್ಕೂ ಹೆಚ್ಚು ಬಳಕೆದಾರರು ಏಕಕಾಲದಲ್ಲಿ ಮಾದರಿಯನ್ನು ಪ್ರಶ್ನಿಸಿದಾಗ, ಸಮಾಂತರ ಪ್ರಯೋಜನವು ಕಡಿಮೆಯಾಗುತ್ತದೆ ಮತ್ತು ಪ್ರಮಾಣಿತ ಸ್ವಯಂ-ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕ ವಿಧಾನವು ಒಟ್ಟಾರೆ ಕಾರ್ಯಕ್ಷಮತೆಯಲ್ಲಿ (overall throughput) ಸಮಾನ ಮಟ್ಟಕ್ಕೆ ತಲುಪುತ್ತದೆ.

ಪ್ರತಿಯೊಂದು ವಿಧಾನವು ಎಲ್ಲಿ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ

ದತ್ತಾಂಶವು ಹೈಬ್ರಿಡ್ ನಿಯೋಜನಾ ತಂತ್ರವನ್ನು ಸೂಚಿಸುತ್ತದೆ:

  • Diffusion models: ಕಡಿಮೆ ಏಕಕಾಲಿಕ ಬಳಕೆ (low-concurrency), ಆಳವಾದ ತರ್ಕದ ಅಗತ್ಯವಿಲ್ಲದ ವಿಳಂಬಕ್ಕೆ ಸೂಕ್ಷ್ಮವಾದ ಕಾರ್ಯಗಳಿಗಾಗಿ—ಉದಾಹರಣೆಗೆ, ಸಣ್ಣ ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ರಚಿಸುವುದು, ಟೆಂಪ್ಲೇಟ್‌ಗಳನ್ನು ತುಂಬುವುದು ಅಥವಾ ಕರಡು ಪಠ್ಯವನ್ನು ತಯಾರಿಸುವುದು.
  • Autoregressive models: ಹೆಚ್ಚಿನ ಏಕಕಾಲಿಕ ಕೆಲಸದ ಹೊರೆ (high-concurrency workloads), ಸಂಕೀರ್ಣ ತರ್ಕ ಅಥವಾ ನಿಖರತೆಯು ವೇಗಕ್ಕಿಂತ ಮುಖ್ಯವಾಗಿರುವ ದೀರ್ಘ ರೂಪದ ಉತ್ಪಾದನೆಗಾಗಿ.

ಈ ಬದಲಾವಣೆಯು AI ಮೂಲಸೌಕರ್ಯಕ್ಕೆ ಏನನ್ನು ಸೂಚಿಸುತ್ತದೆ

ಮಾದರಿಯ ಗಾತ್ರವನ್ನು ಹೆಚ್ಚಿಸುವ ಬದಲು ಉತ್ಪಾದನಾ ಅಲ್ಗಾರಿದಮ್ ಅನ್ನು ಮರುಚಿಂತನೆ ಮಾಡುವ ಮೂಲಕ ವೇಗದ ಲಾಭವನ್ನು ಪಡೆಯಬಹುದಾದರೆ, ಅತಿದೊಡ್ಡ ದಕ್ಷತೆಯ ಗೆಲುವುಗಳು "ಪ್ಲಂಬಿಂಗ್" (plumbing) ಸುಧಾರಣೆಗಳಿಂದ ಬರಬಹುದು. ಈ ಹೊಂದಾಣಿಕೆಯು ಎಂದರೆ ಕೆಲವು ಬಳಕೆಗಳಿಗಾಗಿ ಡೆವಲಪರ್‌ಗಳು ಗುಣಮಟ್ಟದಲ್ಲಿನ ಸಣ್ಣ ಇಳಿಕೆಯನ್ನು ಒಪ್ಪಿಕೊಳ್ಳಲೇಬೇಕು ಎಂದರ್ಥ.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ಡಿಫ್ಯೂಷನ್ ಪ್ರೈಮ್ ಟೈಮ್‌ಗೆ ಸಿದ್ಧವಾಗಿದೆಯೇ?

ಡಿಫ್ಯೂಷನ್ ಅನುಷ್ಠಾನವು ಸಣ್ಣ ಪ್ರಾಂಪ್ಟ್‌ಗಳೊಂದಿಗೆ ಕಷ್ಟಪಡುತ್ತದೆ ಮತ್ತು ಅಸ್ಥಿರವಾದ (jittery) ಔಟ್‌ಪುಟ್ ಅನ್ನು ನೀಡಬಹುದು.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • Scaling studies: ದೊಡ್ಡ ಡಿಫ್ಯೂಷನ್ ಮಾದರಿಗಳು ವೇಗವನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತಲೇ ಸಾಮರ್ಥ್ಯದ ಅಂತರವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತವೆಯೇ?
  • Hardware optimizations: GPUಗಳು ವಿಕಸನಗೊಳ್ಳುತ್ತಿದ್ದಂತೆ, ಕಂಪ್ಯೂಟ್-ಭಾರಿತ ಡಿಫ್ಯೂಷನ್ ಹಂತಗಳು ಮತ್ತು ತೂಕ-ಭಾರಿತ ಸ್ವಯಂ-ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕತೆಯ ನಡುವಿನ ಸಮತೋಲನವು ಮತ್ತೆ ಬದಲಾಗಬಹುದು.
  • Routing algorithms: ಕಾರ್ಯ-ಅರಿವಿರುವ (task-aware) ಮಾದರಿ ರೂಟರ್‌ಗಳ ಆರಂಭಿಕ ಪ್ರೊಟೊಟೈಪ್‌ಗಳು, ಡೈನಾಮಿಕ್ ಆಯ್ಕೆಯ ಮೂಲಕ ಒಟ್ಟಾರೆ ಸಿಸ್ಟಮ್ ವಿಳಂಬವನ್ನು (latency) ಎಷ್ಟು ಕಡಿಮೆ ಮಾಡಬಹುದು ಎಂಬುದನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ.

ಸಾರಾಂಶ (Takeaway)

ಮೂಲ ಉತ್ಪಾದನಾ ಲೂಪ್ ಅನ್ನು ಮರುಚಿಂತನೆ ಮಾಡುವುದರಿಂದ ಹೆಚ್ಚಿನ ಚಿಪ್‌ಗಳನ್ನು ಸೇರಿಸದೆ ವಿಳಂಬವನ್ನು (latency) ಕಡಿಮೆ ಮಾಡಬಹುದು ಎಂದು DiffusionGemma ಸಾಬೀತುಪಡಿಸುತ್ತದೆ. ಈ ತಂತ್ರಜ್ಞಾನವು ಸ್ವಯಂ-ಪ್ರತಿಕ್ರಿಯಾತ್ಮಕ ಮಾದರಿಗಳಿಗೆ ಸಂಪೂರ್ಣ ಬದಲಾವಣೆಯಲ್ಲ, ಆದರೆ ವೇಗ ಮತ್ತು ನಿಖರತೆಯನ್ನು ಪ್ರತಿ ಕಾರ್ಯದ ಆಧಾರದ ಮೇಲೆ ಸಮತೋಲನಗೊಳಿಸುವ ಹೈಬ್ರಿಡ್ AI ಸ್ಟ್ಯಾಕ್‌ಗಾಗಿ ಇದು ಒಂದು ಆಕರ್ಷಕ ಸಾಧನವಾಗಿದೆ. AI ಮೂಲಸೌಕರ್ಯದ ಮುಂದಿನ ಅಲೆ ಕೇವಲ ಮಾದರಿಯ ಗಾತ್ರದಿಂದ ಮಾತ್ರವಲ್ಲದೆ, ಅದು ಸರಿಯಾದ ರೀತಿಯ ಇಂಜಿನ್ ಮೂಲಕ ಕೆಲಸವನ್ನು ಎಷ್ಟು ಚತುರತೆಯಿಂದ ನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದರ ಮೂಲಕ ನಿರ್ಣಯಿಸಲ್ಪಡಬಹುದು.