ಶೂನ್ಯದಿಂದ (from scratch) ಒಂದು vision-language ಮಾದರಿಯನ್ನು ತರಬೇತುಗೊಳಿಸುವುದು ಯಾವಾಗಲೂ ಸಂಪನ್ಮೂಲ-ಭಾರೀ ಪ್ರಕ್ರಿಯೆಯಾಗಿದೆ. ಹೆಚ್ಚಿನ ಆಧುನಿಕ ವಿಧಾನಗಳು distillation ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿವೆ, ಅಂದರೆ ನೀವು ಮೊದಲು ಶಕ್ತಿಯುತವಾದ ಶಿಕ್ಷಕ (teacher) ಮಾದರಿಯನ್ನು ಹೊಂದಿರಬೇಕು, ಇದು ನೀವು ತರಬೇತುಗೊಳಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿರುವ ವಿದ್ಯಾರ್ಥಿ (student) ಮಾದರಿಗಿಂತ ಸಾಮಾನ್ಯವಾಗಿ ದೊಡ್ಡದಾಗಿರುತ್ತದೆ. ಆ ಶಿಕ್ಷಕ ಮಾದರಿಯನ್ನು ನಡೆಸಲು ನೀವು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚವನ್ನು ಪಾವತಿಸಬೇಕಾಗುತ್ತದೆ, ಅದಕ್ಕೆ ಡೇಟಾವನ್ನು ಪೂರೈಸುವ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ನಿರ್ವಹಿಸಬೇಕಾಗುತ್ತದೆ ಮತ್ತು ಎರಡು ಮಾದರಿಗಳನ್ನು ಸಮಕಾಲೀನವಾಗಿ (in sync) ಇರಿಸುವ ಇಂಜಿನಿಯರಿಂಗ್ ಹೊರೆಯನ್ನು ಎದುರಿಸಬೇಕಾಗುತ್ತದೆ. ಸಣ್ಣ ತಂಡಗಳಿಗೆ ಅಥವಾ ಎಡ್ಜ್ ಹಾರ್ಡ್‌ವೇರ್ (edge hardware) ಗಾಗಿ ಮಾದರಿಗಳನ್ನು ನಿರ್ಮಿಸುವವರಿಗೆ, ಈ ವ್ಯವಸ್ಥೆಯು ಒಂದು ಕಠಿಣ ಮಿತಿಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ನೀವು ಬೃಹತ್ ದ್ವಿತೀಯ ನೆಟ್‌ವರ್ಕ್ ಗಾಗಿ ಬಜೆಟ್ ಹುಡುಕಬೇಕಾಗುತ್ತದೆ ಅಥವಾ ಕಳಪೆ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ಒಪ್ಪಿಕೊಳ್ಳಬೇಕಾಗುತ್ತದೆ.

Visual Contrastive Self-Distillation ಅಥವಾ VCSD, ಆ ಮಿತಿಯನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ತೆಗೆದುಹಾಕುತ್ತದೆ. ಬಾಹ್ಯ ಶಿಕ್ಷಕನನ್ನು ಹುಡುಕುವ ಬದಲು, ಮಾದರಿಯು ತಾನೇ ತನ್ನನ್ನು ತಾನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲು ಕಲಿಯುತ್ತದೆ. ಈ ತಂತ್ರವು ದೊಡ್ಡ ಮಾದರಿಗಳು ಮತ್ತು ಹೆಚ್ಚುವರಿ ಮೇಲ್ವಿಚಾರಣೆಯ ಮೇಲಿರುವ ಸಾಮಾನ್ಯ ಅವಲಂಬನೆಯನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ, ಆದರೂ ಇದು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸ್ಕೋರ್‌ಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ಸಿಗುವ ತರಬೇತಿ ಲೂಪ್ (training loop) ಹೆಚ್ಚು ಚುರುಕಾದ, ಅಗ್ಗದ ಮತ್ತು ಸುಲಭವಾಗಿ ಪುನರಾವರ್ತಿಸಬಹುದಾದದ್ದಾಗಿರುತ್ತದೆ.

ಬಾಹ್ಯ ಶಿಕ್ಷಕರ ಗುಪ್ತ ತೆರಿಗೆ

Vision-language ಜಗತ್ತಿನಲ್ಲಿ ಪ್ರಮಾಣಿತ ಜ್ಞಾನ ಡಿಸ್ಟಿಲೇಶನ್ (knowledge distillation) ಒಂದು ಪರಿಚಿತ ಮಾದರಿಯನ್ನು ಅನುಸರಿಸುತ್ತದೆ. ಒಂದು ದೊಡ್ಡ, ಸಮರ್ಥ ಮಾದರಿಯು ಸಾಫ್ಟ್ ಟಾರ್ಗೆಟ್‌ಗಳು (soft targets), ಅಟೆನ್ಶನ್ ಮ್ಯಾಪ್‌ಗಳು (attention maps) ಅಥವಾ ರೀಸನಿಂಗ್ ಟ್ರೇಸ್‌ಗಳನ್ನು (reasoning traces) ಸೃಷ್ಟಿಸುತ್ತದೆ. ಸಣ್ಣ ವಿದ್ಯಾರ್ಥಿ ಮಾದರಿಯು ಈ ಔಟ್‌ಪುಟ್‌ಗಳನ್ನು ಅನುಕರಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತದೆ. ಈ ಕಲ್ಪನೆಯು ಸರಿಯಾಗಿದ್ದರೂ, ಇದರ ಅನುಷ್ಠಾನವು ಭಾರೀ ಕೆಲಸವಾಗಿದೆ. ಶಿಕ್ಷಕ ಮಾದರಿಯನ್ನು ನಿರಂತರವಾಗಿ ನಡೆಸಲು ನಿಮಗೆ GPUs ಅಥವಾ TPUs ಬೇಕಾಗುತ್ತವೆ, ಅವು ಹೆಚ್ಚಾಗಿ ವಿದ್ಯಾರ್ಥಿ ಮಾದರಿಗಿಂತ ದೊಡ್ಡ ಬ್ಯಾಚ್ ಸೈಜ್ ಅಥವಾ ಹೆಚ್ಚಿನ ನಿಖರತೆಯಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬೇಕಾಗುತ್ತದೆ. ನಿಮಗೆ ಪರಿಷ್ಕೃತ ಡೇಟಾ ಪೇರಿಂಗ್‌ಗಳು ಬೇಕಾಗುತ್ತವೆ ಮತ್ತು ಕೆಲವೊಮ್ಮೆ ಗ್ರೌಂಡ್-ಟ್ರೂತ್ ರೀಸನಿಂಗ್ ಚೇನ್‌ಗಳಂತಹ (ground-truth reasoning chains) ವಿಶೇಷ ಮಾಹಿತಿಗಳು ಬೇಕಾಗುತ್ತವೆ, ಇವುಗಳನ್ನು ಸಂಗ್ರಹಿಸುವುದು ದುಬಾರಿಯಾಗಿದೆ ಅಥವಾ ನಿಮ್ಮ ಗುರಿ ಡೊಮೇನ್‌ಗೆ ಲಭ್ಯವಿರುವುದಿಲ್ಲ.

ಈ ಅವಶ್ಯಕತೆಗಳು ಪ್ರಯೋಗಗಳಲ್ಲಿ ವಿಳಂಬವನ್ನು (latency) ಉಂಟುಮಾಡುತ್ತವೆ. ಇವು ಮೂಲಸೌಕರ್ಯದ ಬಿಲ್‌ಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ. ಮತ್ತು ಇವು ನಿಮ್ಮ ಪೈಪ್‌ಲೈನ್‌ಗೆ ಒಂದು ದುರ್ಬಲ ಅವಲಂಬನೆಯನ್ನು ಸೇರಿಸುತ್ತವೆ: ಶಿಕ್ಷಕ ಮಾದರಿಯು ಬದಲಾದರೆ ಅಥವಾ ಲಭ್ಯವಿಲ್ಲದಂತಾದರೆ, ನಿಮ್ಮ ತರಬೇತಿ ತಂತ್ರವು ವಿಫಲವಾಗುತ್ತದೆ. VCSD ಅಂತಹ ಅಸ್ಥಿರತೆಯನ್ನು ಹೋಗಲಾಡಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ.

ಒಂದು ಸ್ವಯಂ-ನಿಯಂತ್ರಿತ ತರಬೇತಿ ಲೂಪ್

VCSD ಹಿಂದಿರುವ ಮೂಲ ಕಲ್ಪನೆಯು ಅತ್ಯಂತ ಸರಳವಾಗಿದೆ. ಸಿಸ್ಟಮ್ ವಿದ್ಯಾರ್ಥಿ ಮಾದರಿಯ ತನ್ನದೇ ಆದ Exponential Moving Average ಅಥವಾ EMA ಅನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. ಈ EMA ಒಂದು ಸ್ಥಿರವಾದ ಉಲ್ಲೇಖ ಬಿಂದುವಿನಂತೆ (reference point) ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಹೊರತು ಬಾಹ್ಯ ಭವಿಷ್ಯವಾಣಿಯಲ್ಲ (external oracle). ಪ್ರತಿಯೊಂದು ತರಬೇತಿ ಚಿತ್ರಕ್ಕಾಗಿ, ಪೈಪ್‌ಲೈನ್ ಎರಡು ಇನ್‌ಪುಟ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ಮೊದಲನೆಯದು ಮೂಲ ಚಿತ್ರ. ಎರಡನೆಯದು ಅದರ ವಿಷಯವನ್ನು ಅಳಿಸಿಹಾಕಲಾದ (erased) ಅದೇ ಚಿತ್ರ.

ನಂತರ ಮಾದರಿಯು ಎರಡೂ ಆವೃತ್ತಿಗಳಿಗೆ ತನ್ನದೇ ಆದ ಟೋಕನ್-ಮಟ್ಟದ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಹೋಲಿಸುತ್ತದೆ. ದೃಶ್ಯ ವಿಷಯವು ಅಳಿಸಿಹೋದಾಗ, ಕೆಲವು ಟೋಕನ್‌ಗಳು ತೀವ್ರವಾಗಿ ಬದಲಾಗುತ್ತವೆ. ಇತರೆಗಳು ಸರಿಸುಮಾರು ಒಂದೇ ಆಗಿರುತ್ತವೆ. ಬದಲಾಗುವ ಟೋಕನ್‌ಗಳು ನಿಜವಾಗಿಯೂ ಮಾದರಿಯ ನಿರ್ಧಾರಗಳನ್ನು ನೈಜ ದೃಶ್ಯ ಪುರಾವೆಗಳ ಮೇಲೆ ಆಧಾರಿತಗೊಳಿಸುತ್ತಿದ್ದವು. ಸ್ಥಿರವಾಗಿ ಉಳಿಯುವ ಟೋಕನ್‌ಗಳು ಬಹುಶಃ ಮೇಲ್ನೋಟದ ಮಾದರಿಗಳು, ಸಾಂಖ್ಯಿಕ ಪೂರ್ವಾಗ್ರಹಗಳು (statistical biases) ಅಥವಾ ಭಾಷಾ ಪೂರ್ವಾಪರಗಳ (language priors) ಮೇಲೆ ಮಾತ್ರ ಅವಲಂಬಿತವಾಗಿದ್ದವು.

ಅಳಿಸಿಹಾಕಿದ ಭಾಗಕ್ಕೆ ಪ್ರತಿಕ್ರಿಯಿಸುವ ಟೋಕನ್‌ಗಳ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸುವ ಮೂಲಕ, ಯಾವ ದೃಶ್ಯ ವೈಶಿಷ್ಟ್ಯಗಳು (visual features) ನಿಜವಾಗಿಯೂ ಮುಖ್ಯ ಎಂಬುದನ್ನು ಮಾದರಿಯು ಕಲಿಯುತ್ತದೆ. ಅದು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ತನ್ನನ್ನೇ ಕೇಳಿಕೊಳ್ಳುತ್ತದೆ, "ನಾನು ಏನನ್ನು ನೋಡುವುದನ್ನು ನಿಲ್ಲಿಸಿದೆ ಮತ್ತು ಅದು ನನ್ನ ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿ ಯಾವ ಬದಲಾವಣೆಯನ್ನು ತಂದಿತು?" ಆ ಪ್ರಶ್ನೆಯೇ ತರಬೇತಿ ಸಿಗ್ನಲ್ ಆಗುತ್ತದೆ. ಇಡೀ ಪ್ರಕ್ರಿಯೆಯು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಲೂಪ್‌ನ ಒಳಗೇ ನಡೆಯುತ್ತದೆ. ಇನ್ನೊಂದು ಸರ್ವರ್‌ನಲ್ಲಿ ಕುಳಿತಿರುವ ಬಿಲಿಯನ್ ಗಟ್ಟಲೆ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿರುವ ಶಿಕ್ಷಕ ಮಾದರಿಯ ಮೂಲಕ ಎರಡನೇ ಫಾರ್ವರ್ಡ್ ಪಾಸ್ ಮಾಡುವ ಅಗತ್ಯವಿಲ್ಲ.

ಕಾರ್ಯವಿಧಾನವನ್ನು ಅರ್ಥೈಸಿಕೊಳ್ಳುವುದು

ಇದು ಏಕೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, vision-language ಮಾದರಿಗಳು ಹೇಗೆ ವರ್ತಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಯೋಚಿಸಿ. ಒಂದು ಮಾದರಿಯು ಪಠ್ಯ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿರುವ ಸುತ್ತಮುತ್ತಲಿನ ಸಂದರ್ಭವನ್ನು ಗುರುತಿಸುವುದರಿಂದ ಅಥವಾ ಪ್ರಿ-ಟ್ರೈನಿಂಗ್ ಸಮಯದಲ್ಲಿ ಸಾವಿರಾರು ಬಾರಿ ಒಂದೇ ರೀತಿಯ ಚಿತ್ರ-ಪಠ್ಯ ಜೋಡಿಗಳನ್ನು ನೋಡಿದ ಕಾರಣದಿಂದ ಚಿತ್ರಕ್ಕೆ ಸರಿಯಾದ ಕ್ಯಾಪ್ಶನ್ ನೀಡಬಹುದು. ಅದು ನೀವು ಕಾಳಜಿ ವಹಿಸುತ್ತಿರುವ ನಿರ್ದಿಷ್ಟ ವಸ್ತುವನ್ನು ನಿಜವಾಗಿಯೂ ನೋಡುತ್ತಿರಲಿಕ್ಕಿಲ್ಲ. VCSD ಪ್ರಾಮಾಣಿಕತೆಯನ್ನು ಒತ್ತಾಯಿಸುತ್ತದೆ.

ವಿಷಯವನ್ನು ಅಳಿಸಿಹಾಕಿದಾಗ, ಮಾದರಿಯು ಆ ಪರಿಚಿತ ಮಾದರಿಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿ ಮೋಸ ಮಾಡಲು ಸಾಧ್ಯವಿಲ್ಲ. ಅದರ ಉತ್ತರವು ಕುಸಿದರೆ (collapses), ಮೂಲ ಉತ್ತರವು ದೃಶ್ಯದ ಮೇಲೆ ಆಧಾರಿತವಾಗಿತ್ತು ಎಂದು ಸಿಸ್ಟಮ್ ತಿಳಿಯುತ್ತದೆ. ಉತ್ತರವು ಒಂದೇ ಆಗಿದ್ದರೆ, ಮಾದರಿಯು ದೃಶ್ಯೇತರ ಶಾರ್ಟ್‌ಕಟ್‌ಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿತ್ತು ಎಂದು ಸಿಸ್ಟಮ್ ತಿಳಿಯುತ್ತದೆ. ಮೂಲ ಮತ್ತು ಅಳಿಸಿಹಾಕಲಾದ ಚಿತ್ರದ ನಡುವಿನ ವ್ಯತ್ಯಾಸವು ಅರ್ಥಪೂರ್ಣ ವೈಶಿಷ್ಟ್ಯಗಳಿಗಾಗಿ ಒಂದು ಕಠಿಣ ಫಿಲ್ಟರ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.

ಇದು ಈಗಾಗಲೇ ಸಂಕೀರ್ಣವಾಗಿರುವ ಸ್ಟ್ಯಾಕ್ ಮೇಲೆ ಸೇರಿಸಲಾದ ಹೆಚ್ಚುವರಿ ಲಾಸ್ (loss) ಅಲ್ಲ. ಇದು ಡಿಸ್ಟಿಲೇಶನ್ ಗುರಿಯನ್ನು ಮರುರೂಪಿಸುವುದಾಗಿದೆ. ಮಾದರಿಯು ತನ್ನದೇ ಆದ EMA ಶಿಕ್ಷಕನಿಂದ ಜ್ಞಾನವನ್ನು ಡಿಸ್ಟಿಲ್ ಮಾಡುತ್ತದೆ, ಇದಕ್ಕೆ ನೀವು ಈಗಾಗಲೇ ಹೊಂದಿರುವ ತರಬೇತಿ ಡೇಟಾವನ್ನು ಹೊರತುಪಡಿಸಿ ಬೇರೆ ಯಾವುದೂ ಅಗತ್ಯವಿಲ್ಲದ ಸ್ಥಿರತೆಯ ತಪಾಸಣೆ (consistency check) ಬೇಕಾಗುತ್ತದೆ.

ಅಂಕಿಅಂಶಗಳು ಏನು ತೋರಿಸುತ್ತವೆ

VCSD ಲೇಖಕರು Qwen3-VL ಮಾದರಿಗಳ ಮೇಲೆ ಮೂರು ವಿಧದ ಮಾಪನಗಳಲ್ಲಿ ಈ ವಿಧಾನವನ್ನು ಪರೀಕ್ಷಿಸಿದರು ಮತ್ತು ಫಲಿತಾಂಶಗಳು ಸ್ಥಿರವಾಗಿವೆ. 2 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾದರಿಯು 62.27 ಪ್ರತಿಶತದಿಂದ 67.04 ಪ್ರತಿಶತಕ್ಕೆ ಏರಿತು. 4 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾದರಿಯು 71.30 ಪ್ರತಿಶತದಿಂದ 73.16 ಪ್ರತಿಶತಕ್ಕೆ ಸುಧಾರಿಸಿತು. 8 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾದರಿಯು 72.51 ಪ್ರತಿಶತದಿಂದ 76.26 ಪ್ರತಿಶತಕ್ಕೆ ಜಿಗಿಯಿತು.

ಇವು ಕೇವಲ ಸಣ್ಣ ಏರಿಳಿತಗಳಲ್ಲ. 2B ಪ್ರಮಾಣದಲ್ಲಿ, ಅದು ಸುಮಾರು ಐದು ಶೇಕಡಾ ಪಾಯಿಂಟ್‌ಗಳಷ್ಟಿದೆ. 8B ಪ್ರಮಾಣದಲ್ಲಿ, ಈ ಏರಿಕೆ ಸುಮಾರು ನಾಲ್ಕು ಪಾಯಿಂಟ್‌ಗಳಷ್ಟಿದೆ. ವಿಸನ್-ಲ್ಯಾಂಗ್ವೇಜ್ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಲ್ಲಿ (vision-language benchmarks), ಸುಧಾರಣೆಗಳು ಹೆಚ್ಚಾಗಿ ಶೇಕಡಾವಾರು ಭಾಗಗಳಲ್ಲಿ ಕಂಡುಬರುವಾಗ, ಈ ಬದಲಾವಣೆಗಳು ಮಾಡೆಲ್ ಕೇವಲ ತನ್ನ ಟೆಕ್ಸ್ಟ್ ಡಿಕೋಡರ್ ಅನ್ನು (text decoder) ಟ್ಯೂನ್ ಮಾಡುತ್ತಿಲ್ಲ, ಬದಲಾಗಿ ಗಮನಾರ್ಹವಾಗಿ ಉತ್ತಮವಾದ ವಿಶುವಲ್ ಗ್ರೌಂಡಿಂಗ್ (visual grounding) ಅನ್ನು ಕಲಿಯುತ್ತಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತವೆ.

ಬಿಲ್ಡರ್‌ಗಳಿಗಾಗಿ ನೈಜ-ಪ್ರಪಂಚದ ಪ್ರಭಾವ

VCSD ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಇದು ಡಿಪ್ಲಾಯ್ಮೆಂಟ್‌ನ (deployment) ಆರ್ಥಿಕತೆಯನ್ನು ಬದಲಾಯಿಸದೆ ತರಬೇತಿಯ (training) ಆರ್ಥಿಕತೆಯನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ.

ಮೊದಲನೆಯದಾಗಿ, ವೆಚ್ಚವು ತಕ್ಷಣವೇ ಕಡಿಮೆಯಾಗುತ್ತದೆ. ನಿಮ್ಮ ಟ್ರೈನಿಂಗ್ ಕೆಲಸದ ಜೊತೆಗೆ ದೊಡ್ಡ ಮಟ್ಟದ ಟೀಚರ್ ಮಾಡೆಲ್ ಅನ್ನು (teacher model) ಪ್ರೊವಿಷನ್ ಮಾಡಲು, ಲೋಡ್ ಮಾಡಲು ಅಥವಾ ರನ್ ಮಾಡಲು ನಿಮಗೆ ಅಗತ್ಯವಿಲ್ಲ. ನಿಮ್ಮ ಕಂಪ್ಯೂಟ್ ಬಜೆಟ್ ಕೇವಲ ಸ್ಟೂಡೆಂಟ್ ಮಾಡೆಲ್ (student model) ಮತ್ತು ಅದರ EMA shadow ಗೆ ಸೀಮಿತವಾಗುತ್ತದೆ, ಇದನ್ನು ನೀವು ಈಗಾಗಲೇ ನಿರ್ವಹಿಸುತ್ತಿದ್ದೀರಿ.

ಎರಡನೆಯದಾಗಿ, ಡೇಟಾ ಪೈಪ್‌ಲೈನ್ ಸರಳವಾಗಿರುತ್ತದೆ. ನಿಮಗೆ ವಿಶೇಷ ಉತ್ತರಗಳು (privileged answers), chain-of-thought traces ಅಥವಾ ಇತರ ಕಷ್ಟಕರವಾದ ಸೂಪರ್‌ವಿಷನ್ ಸಿಗ್ನಲ್‌ಗಳ ಅಗತ್ಯವಿಲ್ಲ. ನಿಮ್ಮ ಬಳಿ ಇಮೇಜ್-ಟೆಕ್ಸ್ಟ್ ಜೋಡಿಗಳಿದ್ದರೆ (image-text pairs), ನಿಮಗೆ ಬೇಕಾದ ಎಲ್ಲವೂ ಲಭ್ಯವಿರುತ್ತದೆ. ಮಾನವನ ತಾರ್ಕಿಕ ಅ𝗻ೋಟೇಶನ್‌ಗಳನ್ನು (human reasoning annotations) ಸಂಗ್ರಹಿಸುವುದಕ್ಕೆ ಹೋಲಿಸಿದರೆ, ಪ್ರತಿ ಚಿತ್ರದ ಎರೇಸ್ಡ್ ಕಾಪಿಯನ್ನು (erased copy) ತಯಾರಿಸುವುದು ಅತ್ಯಂತ ಸುಲಭ.

ಮೂರನೆಯದಾಗಿ, ಇನ್ಫರೆನ್ಸ್ ವೇಗವು (inference speed) ಬದಲಾಗುವುದಿಲ್ಲ. VCSD ಮಾಡುವ ಎಲ್ಲವೂ ಟ್ರೈನಿಂಗ್ ಸಮಯದಲ್ಲಿಯೇ ನಡೆಯುತ್ತದೆ. ಒಮ್ಮೆ ನೀವು ಮಾಡೆಲ್ ಅನ್ನು ಡಿಪ್ಲಾಯ್ ಮಾಡಿದರೆ, ಅದು ಕೇವಲ ಒಂದು ಸ್ಟ್ಯಾಂಡರ್ಡ್ Qwen3-VL ಚೆಕ್‌ಪಾಯಿಂಟ್ ಆಗಿರುತ್ತದೆ. ಅಲ್ಲಿ ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಬ್ರಾಂಚ್‌ಗಳು, ಅಕ್ಸಿಲರಿ ಹೆಡ್‌ಗಳು (auxiliary heads) ಅಥವಾ ರನ್‌ಟೈಮ್ ಓವರ್‌ಹೆಡ್‌ಗಳಿರುವುದಿಲ್ಲ. ಆ ಶೂನ್ಯ-ವೆಚ್ಚದ ಡಿಪ್ಲಾಯ್ಮೆಂಟ್ ಪ್ರೊಫೈಲ್ ಅದನ್ನು ಎಡ್ಜ್ ಸಾಧನಗಳಿಗೆ (edge devices) ಸೂಕ್ತವಾಗಿಸುತ್ತದೆ