Google DeepMind ತನ್ನ Gemini Flash Lite ಮಾದರಿಗಳನ್ನು ಪರೀಕ್ಷಾ ಪ್ರಾಂಪ್ಟ್ಗಳು ಅಥವಾ ಮಾದರಿ ತೂಕಗಳನ್ನು (model weights) ಬಹಿರಂಗಪಡಿಸದೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು 'ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಡಬಲ್-ಬ್ಲೈಂಡ್ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್' ಅನ್ನು ಬಳಸುವ ಒಂದು ಪೈಲಟ್ ಯೋಜನೆಯನ್ನು ಪರಿಚಯಿಸಿದೆ. ಈ ಮೌಲ್ಯಮಾಪನವು Google Cloud ನ Confidential Space ಒಳಗೆ ನಡೆಯುತ್ತದೆ, ಆದ್ದರಿಂದ ಮೌಲ್ಯಮಾಪಕನಿಗೆ ಮಾದರಿಯು ಎಂದಿಗೂ ಕಾಣಿಸುವುದಿಲ್ಲ ಮತ್ತು ಮಾದರಿಗೆ ಪ್ರಶ್ನೆಗಳು ಎಂದಿಗೂ ಕಾಣಿಸುವುದಿಲ್ಲ—ಈ ವಿಧಾನವು AI ಕಾರ್ಯಕ್ಷಮತೆಯ ವರದಿಗಳಿಗೆ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಮರುಸ್ಥಾಪಿಸಬಹುದು.
ಬೆಂಚ್ಮಾರ್ಕ್ ಕಂಟಮಿನೇಷನ್ (contamination) ಏಕೆ ಮುಖ್ಯ
ಒಂದು ಮಾದರಿಯು ತರಬೇತಿ ಪಡೆದ ಡೇಟಾ ನಂತರ ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ಕಾಣಿಸಿಕೊಂಡರೆ, ಅದರ ಸ್ಕೋರ್ ತರ್ಕಶೀಲತೆಯನ್ನು ಅಳೆಯುವ ಬದಲು ಕಂಠಪಾಠ ಮಾಡುವುದನ್ನು ಅಳೆಯುತ್ತದೆ. ಕಂಟಮಿನೇಟೆಡ್ ಪರೀಕ್ಷೆಯ ಮೇಲೆ ಸಿಗುವ ಪರಿಪೂರ್ಣ ಫಲಿತಾಂಶವು ನಿಜವಾದ ಸಾಮರ್ಥ್ಯದ ಬಗ್ಗೆ ಏನನ್ನೂ ತಿಳಿಸುವುದಿಲ್ಲ. ಸಂಶೋಧಕರು ದೀರ್ಘಕಾಲದಿಂದ ಒಂದು ವಿರೋಧಾಭಾಸವನ್ನು ಎದುರಿಸುತ್ತಿದ್ದಾರೆ: ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಪರಿಶೀಲಿಸಲು ಅವರು ಮಾದರಿ ಒದಗಿಸುವವರಿಗೆ ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ನೀಡಬೇಕಾಗುತ್ತದೆ (ಇದು ಮಾದರಿಯ ಮುಂಚಿತ ಪ್ರದರ್ಶನದ ಅಪಾಯವನ್ನು ತರುತ್ತದೆ), ಅಥವಾ ಮಾಲೀಕತ್ವದ ತೂಕಗಳನ್ನು (proprietary weights) ರಕ್ಷಿಸಲು ಬಾಹ್ಯ ಪ್ರವೇಶವನ್ನು ನಿರಾಕರಿಸಬೇಕಾಗುತ್ತದೆ (ಇದು ಆಡಿಟ್ ಅನ್ನು ಪರಿಶೀಲಿಸದಂತೆ ಬಿಡುತ್ತದೆ). ARC-AGI ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ Anthropic ನ Fable 5 ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವಲ್ಲಿ ಇತ್ತೀಚೆಗೆ ಉಂಟಾದ ವಿಳಂಬವು, ಕಟ್ಟುನಿಟ್ಟಾದ ಡೇಟಾ-ರಿಟೆನ್ಷನ್ ನೀತಿಗಳು ಸ್ವತಂತ್ರ ಮೌಲ್ಯಮಾಪನವನ್ನು ಹೇಗೆ ತಡೆಯಬಹುದು ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.
ಒಂದು ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಪರಿಹಾರ
ಈ ಪೈಲಟ್ ಯೋಜನೆಯು ಕಾನೂನು ಒಪ್ಪಂದಗಳು ಮತ್ತು “ಜೀರೋ-ಲಾಗ್ಜಿಂಗ್” ಭರವಸೆಗಳ ಬದಲಿಗೆ ತಾಂತ್ರಿಕ ಸುರಕ್ಷತಾ ಕ್ರಮವನ್ನು ಬಳಸುತ್ತದೆ. Confidential Space ಎಂಬುದು Gemini Flash Lite ಮಾದರಿಯನ್ನು ಚಲಾಯಿಸುವ ಹಾರ್ಡ್ವೇರ್-ಐಸೊಲೇಟೆಡ್ ಎನ್ಕ್ಲೇವ್ (hardware-isolated enclave) ಅನ್ನು ರಚಿಸುತ್ತದೆ. ಮೌಲ್ಯಮಾಪಕರು ಪರೀಕ್ಷಾ ಸುಟ್ ಅನ್ನು ಅಪ್ಲೋಡ್ ಮಾಡುತ್ತಾರೆ, ಇದನ್ನು ಎನ್ಕ್ಲೇವ್ ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ “ಬಾಕ್ಸ್”ನಲ್ಲಿ ಮುಚ್ಚಿಡುತ್ತದೆ, ಇದನ್ನು ಮಾದರಿಯು ತೆರೆಯಲು ಸಾಧ್ಯವಿಲ್ಲ. ಅದೇ ಸಮಯದಲ್ಲಿ, ಮಾದರಿಯ ತೂಕಗಳು ಎನ್ಕ್ಲೇವ್ ಒಳಗೆ ಎನ್ಕ್ರಿಪ್ಟ್ ಆಗಿರುತ್ತವೆ, ಮೌಲ್ಯಮಾಪಕರಿಗೆ ಅವು ಕಾಣಿಸುವುದಿಲ್ಲ. ಇನ್ಫರೆನ್ಸ್ ಸಮಯದಲ್ಲಿ ಮಾದರಿಯು ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಎಂದಿಗೂ ಬಳಸಿಲ್ಲ ಎಂಬುದಕ್ಕೆ ಎನ್ಕ್ಲೇವ್ ಗಣಿತದ ಪುರಾವೆಯನ್ನು (mathematical proof) ನೀಡುತ್ತದೆ. ಇದರ ಫಲಿತಾಂಶವು ನಿಜವಾದ ಡಬಲ್-ಬ್ಲೈಂಡ್ ರನ್ ಆಗಿದೆ: ಎರಡೂ ಕಡೆಯವರು ತಮ್ಮ ರಹಸ್ಯಗಳನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತಾರೆ ಮತ್ತು ಮೂರನೇ ವ್ಯಕ್ತಿಗೆ ಪರಿಶೀಲಿಸಬಹುದಾದ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೆಟ್ರಿಕ್ ಸಿಗುತ್ತದೆ.
ಯಾರು ಪ್ರಯೋಜನ ಪಡೆಯಬಹುದು
- ನಿಯಂತ್ರಕರು ಮತ್ತು ಆಡಿಟರ್ಗಳು ಈಗ ವಾಣಿಜ್ಯ ರಹಸ್ಯಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಲು ಒದಗಿಸುವವರನ್ನು ಒತ್ತಾಯಿಸದೆ ಸಾಮರ್ಥ್ಯದ ಪುರಾವೆಯನ್ನು ಕೇಳಬಹುದು.
- ಸೈಬರ್ ಸೆಕ್ಯೂರಿಟಿ, ರಕ್ಷಣೆ ಅಥವಾ ವರ್ಗೀಕೃತ ಡೇಟಾವನ್ನು ನಿರ್ವಹಿಸುವ ಯಾವುದೇ ವಲಯದ ಉದ್ಯಮಗಳು ಡೇಟಾ ಸೋರಿಕೆಯ ಅಪಾಯವಿಲ್ಲದೆ AI ಪರಿಕರಗಳನ್ನು ಪರೀಕ್ಷಿಸಬಹುದು.
- ಮಾದರಿ ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರು ತಮ್ಮ ಸ್ಪರ್ಧಾತ್ಮಕತೆಯನ್ನು ಉಳಿಸಿಕೊಳ್ಳಬಹುದು; ಅವರು ಇನ್ನು ಮುಂದೆ ಮುಕ್ತತೆ ಮತ್ತು ರಕ್ಷಣೆ ಎರಡರ ನಡುವೆ ಒಂದನ್ನು ಆರಿಸಿಕೊಳ್ಳುವ ಅಗತ್ಯವಿಲ್ಲ.
ಈ ವಿಧಾನವು ವಿಸ್ತರಿಸಿದರೆ, ಇದು ಫ್ರಾಂಟಿಯರ್ ಮಾದರಿಗಳನ್ನು ಪ್ರಮಾಣೀಕರಿಸಲು ಡಿಫಾಲ್ಟ್ ವಿಧಾನವಾಗಬಹುದು, ಇದು ಉದ್ಯಮವನ್ನು ನಂಬಿಕೆ ಆಧಾರಿತ ವ್ಯವಸ್ಥೆಗಳಿಂದ ಗಣಿತ ಆಧಾರಿತ ಗ್ಯಾರಂಟಿಗಳತ್ತ ಬದಲಾಯಿಸಬಹುದು.
ಸಂಭಾವ್ಯ ಅಡಚಣೆಗಳು
ಈ ವ್ಯವಸ್ಥೆಯು Google Cloud ನ ಕಾನ್ಫಿಡೆನ್ಷಿಯಲ್ ಕಂಪ್ಯೂಟಿಂಗ್ ಸ್ಟ್ಯಾಕ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ, ಆದ್ದರಿಂದ ಇತರ ಕ್ಲೌಡ್ ಪ್ರೊವೈಡರ್ಗಳನ್ನು ಇಷ್ಟಪಡುವ ಸಂಸ್ಥೆಗಳು ಏಕೀಕರಣದ ಅಡೆತಡೆಗಳನ್ನು ಎದುರಿಸಬಹುದು. ಎನ್ಕ್ಲೇವ್ ಒಳಗೆ ಮಾದರಿಗಳನ್ನು ಚಲಾಯಿಸುವುದು ಲ್ಯಾಟೆನ್ಸಿಯನ್ನು (latency) ಹೆಚ್ಚಿಸುತ್ತದೆ ಮತ್ತು ಲಭ್ಯವಿರುವ ಹಾರ್ಡ್ವೇರ್ ಆಕ್ಸಿಲರೇಟರ್ಗಳನ್ನು ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ, ಇದು ಬೆಂಚ್ಮಾರ್ಕ್ ಸ್ಕೋರ್ಗಳ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರಬಹುದು. ಅಲ್ಲದೆ, ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಪುರಾವೆಯು ಮಾದರಿಯು ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ನೋಡಿಲ್ಲ ಎಂಬುದನ್ನು ಖಚಿತಪಡಿಸಿದರೂ, ಪರೀಕ್ಷೆ ಪ್ರಾರಂಭವಾದ ನಂತರ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಮಾಡುವಂತಹ ಇತರ ಕುಶಲತೆಗಳನ್ನು ತಡೆಯುವುದಿಲ್ಲ. ವಿಮರ್ಶಕರು ಈ ಪರಿಹಾರವು ವಿಶಾಲವಾದ ಮರು-ಉತ್ಪಾದನಾ ಸಾಮರ್ಥ್ಯದ (reproducibility) ಸಮಸ್ಯೆಯ ಒಂದು ಸಣ್ಣ ಭಾಗವನ್ನು ಮಾತ್ರ ಪರಿಹರಿಸುತ್ತದೆ ಎಂದು ವಾದಿಸಬಹುದು.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
- ಪೈಲಟ್ ಮೀರಿದ ಅಳವಡಿಕೆ – ಇತರ AI ಲ್ಯಾಬ್ಗಳು ಮತ್ತು ಕ್ಲೌಡ್ ಮಾರಾಟಗಾರರು ಹೊಂದಾಣಿಕೆಯಾಗುವ ಎನ್ಕ್ಲೇವ್ಗಳನ್ನು ನಿರ್ಮಿಸಬಹುದು, ಇದು ಮಾದರಿಯನ್ನು ವಿವಿಧ ಪ್ಲಾಟ್ಫಾರ್ಮ್ಗಳಲ್ಲಿ ಆಡಿಟ್ ಮಾಡಬಹುದೇ ಎಂದು ಪರೀಕ್ಷಿಸುತ್ತದೆ.
- ಪ್ರಮಾಣೀಕರಣ ಚೌಕಟ್ಟುಗಳು – AI-ಸುರಕ್ಷತಾ ಗುಂಪುಗಳು ಡಬಲ್-ಬ್ಲೈಂಡ್ ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಆಡಿಟ್ಗಳನ್ನು ಪ್ರಮಾಣೀಕರಣ ಚೌಕಟ್ಟುಗಳ ಭಾಗವಾಗಿ ಸಂಹಿತೀಕರಿಸಬಹುದು.
- ಕಾರ್ಯಕ್ಷಮತೆಯ ಹೊಂದಾಣಿಕೆಗಳು (Performance trade-offs) – ಕಾನ್ಫಿಡೆನ್ಷಿಯಲ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ನ ಹೆಚ್ಚಿನ ಹೊರೆಯು ದೊಡ್ಡ ಪ್ರಮಾಣದ ಮಾದರಿಗಳಿಗೆ ಸ್ವೀಕಾರಾರ್ಹವೇ ಎಂಬುದನ್ನು ನೈಜ-ಪ್ರಪಂಚದ ಬೆಂಚ್ಮಾರ್ಕ್ ರನ್ಗಳು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ.
ಅಂತಿಮವಾಗಿ
ಪರೀಕ್ಷಾ ಡೇಟಾ ಮತ್ತು ಮಾದರಿ ಎರಡನ್ನೂ ಪರಸ್ಪರ ಅಸ್ಪಷ್ಟವಾದ ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಪರಿಸರದಲ್ಲಿ ಲಾಕ್ ಮಾಡುವ ಮೂಲಕ, Google DeepMind ನ ಪೈಲಟ್ ಯೋಜನೆಯು ವಿಶ್ವಾಸಾರ್ಹ AI ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ಗೆ ಒಂದು ನಿರ್ದಿಷ್ಟ ಮಾರ್ಗವನ್ನು ನೀಡುತ್ತದೆ. ಈ ವಿಧಾನವು ಎಲ್ಲಾ ಆಡಿಟ್ ಸವಾಲುಗಳನ್ನು ನಿವಾರಿಸುವುದಿಲ್ಲ, ಆದರೆ ಯಾವುದೇ ಕಡೆಯನ್ನು ತನ್ನ ಅತ್ಯಂತ ಅಮೂಲ್ಯವಾದ ಆಸ್ತಿಗಳನ್ನು ಬಿಟ್ಟುಕೊಡಲು ಒತ್ತಾಯಿಸದೆ, ಬೆಂಚ್ಮಾರ್ಕ್ ಕಂಟಮಿನೇಷನ್ನಂತಹ ಅತ್ಯಂತ ಸ್ಪಷ್ಟವಾದ ಪೂರ್ವಾಗ್ರಹದ ಮೂಲವನ್ನು ಇದು ತೆಗೆದುಹಾಕುತ್ತದೆ. ಸಮುದಾಯವು ಈ ತಂತ್ರವನ್ನು ಅಳವಡಿಸಿಕೊಂಡರೆ, ಭವಿಷ್ಯದ AI ಪ್ರಗತಿ ವರದಿಗಳನ್ನು ಅಂತಿಮವಾಗಿ ನಂಬಬಹುದು.
