ವ್ಯಾಪಕವಾದ ಲೀಡರ್ಬೋರ್ಡ್ಗಳಲ್ಲಿ ಮಾಡೆಲ್ ಅನ್ನು ಬೆಂಚ್ಮಾರ್ಕ್ ಮಾಡುವುದು ಅದು ಟ್ರಿವಿಯಾ ಮತ್ತು ಪ್ರಮಾಣೀಕೃತ ಪರೀಕ್ಷೆಗಳನ್ನು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ನಿಭಾಯಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿಸುತ್ತದೆ. ಆದರೆ ನಿಮ್ಮ ಪ್ರೊಡಕ್ಷನ್ ಸಿಸ್ಟಮ್ಗಳು ಎದುರಿಸುವ ಗೊಂದಲಮಯ ಮತ್ತು ನಿರ್ಬಂಧಿತ ಸಮಸ್ಯೆಗಳ ಮೂಲಕ ಅದು ಹೇಗೆ ತರ್ಕಬದ್ಧವಾಗಿ ಯೋಚಿಸುತ್ತದೆ (reason) ಎಂಬುದರ ಬಗ್ಗೆ ಅದು ನಿಮಗೆ ಬಹುತೇಕ ಏನನ್ನೂ ಹೇಳುವುದಿಲ್ಲ. ಯಾವುದೇ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ ಅನ್ನು ಬಳಕೆದಾರರಿಗೆ ಕಳುಹಿಸುವ ಮೊದಲು, ನಿಮ್ಮ ಅಪ್ಲಿಕೇಶನ್ ಬಯಸುವ ನಿರ್ದಿಷ್ಟ ಸಂಜ್ಞಾನಾತ್ಮಕ ಮಾದರಿಗಳನ್ನು (cognitive patterns) ಪರೀಕ್ಷಿಸುವ ಒಂದು ಹಾರ್ನೆಸ್ (harness) ನಿಮಗೆ ಬೇಕಾಗುತ್ತದೆ. ರೀಸನಿಂಗ್ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಮಾಡೆಲ್ಗಳು ಚಾಟ್ಬಾಟ್ಗಳಿಂದ ಹೇಗೆ ಭಿನ್ನವಾಗಿವೆ ಎಂಬುದನ್ನು ತೋರಿಸುವ ಸ್ಥಳಗಳಾಗಿವೆ.
ಈ ಮಾರ್ಗದರ್ಶಿಯು ಮೊದಲಿನಿಂದಲೇ ಒಂದು ಕೇಂದ್ರೀಕೃತ ರೀಸನಿಂಗ್ ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸುವುದು ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ. ನೀವು ಮೂರು ವಿಭಿನ್ನ ಆರ್ಕಿಟೆಕ್ಚರ್ಗಳನ್ನು ಹೋಲಿಸುತ್ತೀರಿ: DeepSeek R1 671B MoE, Llama 3.3 70B, ಮತ್ತು Qwen 3 32B. GPU ಕ್ಲಸ್ಟರ್ಗಳನ್ನು ಜೋಡಿಸುವ ಬದಲು, ನೀವು ಇವು ಮೂರನ್ನೂ Oxlo.ai ಮೂಲಕ ರನ್ ಮಾಡುತ್ತೀರಿ. ಮೌಲ್ಯಮಾಪನಕ್ಕಾಗಿ, ನೀವು Kimi K2.6 ಅನ್ನು ಜಡ್ಜ್ ಆಗಿ ಬಳಸಿ ರೀಸನಿಂಗ್ ಸ್ಪಷ್ಟತೆ, ನಿಖರತೆ ಮತ್ತು ಕೋಡ್ ಗುಣಮಟ್ಟದ ಮೇಲೆ ಔಟ್ಪುಟ್ಗಳಿಗೆ ಸ್ಕೋರ್ ನೀಡುತ್ತೀರಿ.
ರೀಸನಿಂಗ್ ಮೊದಲು ಏಕೆ ವಿಫಲವಾಗುತ್ತದೆ
ಪ್ರೊಡಕ್ಷನ್ ವೈಫಲ್ಯಗಳು ವ್ಯಾಕರಣದ ತಪ್ಪುಗಳು ಅಥವಾ ನಿರಾಕರಣೆಗಳಂತೆ ಕಾಣಿಸಿಕೊಳ್ಳುವುದು ಅಪರೂಪ. ಅವು ಸೂಕ್ಷ್ಮವಾದ ತಾರ್ಕಿಕ ತಪ್ಪುಗಳಂತೆ ಕಾಣುತ್ತವೆ. ಒಂದು ಮಾಡೆಲ್ ಒಂದು ನಿರ್ಬಂಧವನ್ನು ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳುವಾಗ, ಒಂದು ಹಂತವನ್ನು ಬಿಟ್ಟುಬಿಡುವಾಗ ಅಥವಾ ಮಧ್ಯದಲ್ಲಿ ಒಂದು ವೇರಿಯಬಲ್ ಅನ್ನು ಮೌನವಾಗಿ ಬದಲಾಯಿಸುವಾಗ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಕೂಡಿದ ಪಠ್ಯವನ್ನು ಸೃಷ್ಟಿಸಬಹುದು. ಸಾರ್ವಜನಿಕ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಹೆಚ್ಚಾಗಿ ಆಳಕ್ಕಿಂತ ವ್ಯಾಪ್ತಿಗೆ (breadth over depth) ಹೆಚ್ಚಿನ ಪ್ರಾಮುಖ್ಯತೆ ನೀಡುತ್ತವೆ, ಆದ್ದರಿಂದ ಒಂದು ಮಾಡೆಲ್ ಕಠಿಣವಾದ ಕಾಂಬಿನೇಟೋರಿಯಲ್ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸದೆಯೇ ಉತ್ತಮ ಸ್ಕೋರ್ ಪಡೆಯಬಹುದು.
ಒಂದು ಗುರಿ ಹೊಂದಿದ ಬೆಂಚ್ಮಾರ್ಕ್ ಈ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸುತ್ತದೆ. ಇದು ಪ್ರತಿಯೊಂದು ಮಾಡೆಲ್ಗೆ ಒಂದೇ ರೀತಿಯ ನಿರ್ಬಂಧಿತ ಆಪ್ಟಿಮೈಸೇಶನ್ ಕಾರ್ಯವನ್ನು ನೀಡುತ್ತದೆ, ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ಚೈನ್ ಆಫ್ ಥಾಟ್ (chain of thought) ಅನ್ನು ಬಯಸುತ್ತದೆ ಮತ್ತು ಸೃಷ್ಟಿಸಿದ ಪರಿಹಾರವು ನಿಜವಾಗಿಯೂ ನಿಯಮಗಳನ್ನು ಪಾಲಿಸುತ್ತದೆಯೇ ಎಂದು ಅಳೆಯುತ್ತದೆ. ಒಂದು ಮಾಡೆಲ್ ಡಿಸ್ಕ್ರೀಟ್ ಮ್ಯಾಥ್ (discrete math) ಮೂಲಕ ಸ್ಥಿರವಾಗಿ ತರ್ಕಬದ್ಧವಾಗಿ ಯೋಚಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ಅದು ನಿಮ್ಮ ಇನ್ವೆಂಟರಿ ಅಲೋಕೇಶನ್, ಶೆಡ್ಯೂಲಿಂಗ್ ಇಂಜಿನ್ ಅಥವಾ ರಿಸೋರ್ಸ್ ರೂಟರ್ ಅನ್ನು ಸಹ ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ನಿರ್ವಹಿಸಲಾಗುವುದಿಲ್ಲ.
ಮಾಡೆಲ್ಗಳು ಮತ್ತು ಪ್ಲಾಟ್ಫಾರ್ಮ್
DeepSeek R1 671B MoE ಎಂಬುದು mixture-of-experts ವಿನ್ಯಾಸವನ್ನು ಬಳಸುತ್ತದೆ. ಯಾವುದೇ ಒಂದು ಟೋಕನ್ಗಾಗಿ ಅದರ 671 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ಗಳಲ್ಲಿ ಒಂದು ಸಣ್ಣ ಭಾಗ ಮಾತ್ರ ಸಕ್ರಿಯಗೊಳ್ಳುತ್ತದೆ, ಇದು ವೆಚ್ಚ-ಕಾರ್ಯಕ್ಷಮತೆಯ ವಕ್ರರೇಖೆಯನ್ನು (cost-to-performance curve) ಮತ್ತು ಕೆಲವೊಮ್ಮೆ ಅದರ ರೀಸನಿಂಗ್ನ ಗುಣಮಟ್ಟವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. Llama 3.3 70B ಒಂದು ಡೆನ್ಸ್ (dense) ಮಾಡೆಲ್ ಆಗಿದೆ, ಮತ್ತು Qwen 3 32B ಸಣ್ಣ ಪ್ರಮಾಣದಲ್ಲಿದ್ದು ಬಲವಾದ ಬಹುಭಾಷಾ ಮತ್ತು ಕೋಡಿಂಗ್ ಸಾಮರ್ಥ್ಯವನ್ನು ಹೊಂದಿದೆ. ಈ ಮೂರನ್ನು ಹೋಲಿಸುವುದರಿಂದ ರೀಸನಿಂಗ್ ಗುಣಮಟ್ಟವು ಒಟ್ಟು ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆ, ಸಕ್ರಿಯ ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆ ಅಥವಾ ತರಬೇತಿ ವಿಧಾನದೊಂದಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆಯೇ ಎಂದು ತಿಳಿಯುತ್ತದೆ.
Oxlo.ai ಈ ಮಾಡೆಲ್ಗಳನ್ನು ಏಕೀಕೃತ API ಮೂಲಕ ಹೋಸ್ಟ್ ಮಾಡುತ್ತದೆ. ನೀವು ಇನ್ಫರೆನ್ಸ್ ಇನ್ಫ್ರಾಸ್ಟ್ರಕ್ಚರ್ ಅನ್ನು ನಿರ್ವಹಿಸುವ ಅಥವಾ ಪ್ರತ್ಯೇಕ ಪೂರೈಕೆದಾರರ ಒಪ್ಪಂದಗಳೊಂದಿಗೆ ಹೋರಾಡುವ ಅಗತ್ಯವಿಲ್ಲ. ಈ ಪ್ಲಾಟ್ಫಾರ್ಮ್ ಪ್ರತಿ-ಟೋಕನ್ ಬೆಲೆಗಿಂತ ಪ್ರತಿ-ಕೋರಿಕೆ (per-request) ಬೆಲೆ ಮಾದರಿಯನ್ನು ಬಳಸುತ್ತದೆ. ಎರಡು ಸಾವಿರ ಪದಗಳ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಒಂದು ಸಾಲಿನ ಸಂಕ್ಷಿಪ್ತ ಪ್ರಾಂಪ್ಟ್ ಎರಡಕ್ಕೂ ಒಂದೇ ಬೆಲೆ ಇರುತ್ತದೆ. ಈ ವಿವರವು ಕೇಳಿದಷ್ಟು ಮುಖ್ಯವಾಗಿದೆ. ಇದರರ್ಥ ನೀವು ಇನ್ಪುಟ್ ಟೋಕನ್ ವೆಚ್ಚಗಳು ಹೆಚ್ಚಾಗುವುದನ್ನು ಗಮನಿಸದೆ ಸಮಗ್ರ ಸೂಚನೆಗಳನ್ನು ಬರೆಯಬಹುದು, ವಿವರವಾದ ಫಾರ್ಮ್ಯಾಟಿಂಗ್ ಅಗತ್ಯತೆಗಳನ್ನು ಸೇರಿಸಬಹುದು ಮತ್ತು few-shot ಉದಾಹರಣೆಗಳನ್ನು ಸೇರಿಸಬಹುದು. ನೀವು ಕೇವಲ ಕರೆಯನ್ನು (call) ಮಾತ್ರ ಪಾವತಿಸುತ್ತೀರಿ, ಪದಗಳ ಸಂಖ್ಯೆಗೆ ಅಲ್ಲ.
ನಿಮಗೆ Python 3.10 ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೊಸದಾದದ್ದು, OpenAI Python ಲೈಬ್ರರಿ ಮತ್ತು Oxlo.ai API ಕೀ ಬೇಕಾಗುತ್ತದೆ.
ಹಂತ 1: ಎಂಡ್ಪಾಯಿಂಟ್ಗೆ ಕನೆಕ್ಟ್ ಮಾಡಿ
Oxlo.ai ಎಂಬುದು OpenAI-ಅನುಸರಣೀಯ API ಅನ್ನು ಒದಗಿಸುವುದರಿಂದ, ಇದನ್ನು ಸಂಯೋಜಿಸುವುದು (integration) ಸುಲಭವಾಗಿದೆ. OpenAI SDK ಅನ್ನು Oxlo ಬೇಸ್ URL ಗೆ ಕಳುಹಿಸಿ, ನಿಮ್ಮ API ಕೀ ಅನ್ನು ಪ್ಲಗ್ ಮಾಡಿ ಮತ್ತು DeepSeek R1 ಗೆ ಒಂದು ಲೈಟ್ವೇಟ್ ರಿಕ್ವೆಸ್ಟ್ ಮಾಡುವ ಮೂಲಕ ಕನೆಕ್ಷನ್ ಅನ್ನು ಪರಿಶೀಲಿಸಿ. ಸ್ಯಾನಿಟಿ ಚೆಕ್ (sanity check) ಅನ್ನು ಬಿಡಬೇಡಿ. લેಟೆನ್ಸಿ (latency) ಅನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ, ಮಾಡೆಲ್ ಐಡೆಂಟಿಫೈಯರ್ ಅನ್ನು ಗುರುತಿಸಲಾಗಿದೆಯೇ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ ಮತ್ತು ನೀವು ಸಂಗ್ರಹಿಸಲು ಉದ್ದೇಶಿಸಿರುವ ರೆಸ್ಪಾನ್ಸ್ ಫಾರ್ಮ್ಯಾಟ್ ಅನ್ನು ನಿಮ್ಮ ಎನ್ವಿರಾನ್ಮೆಂಟ್ ಸ್ಟ್ರೀಮ್ ಅಥವಾ ಬಫರ್ ಮಾಡಬಲ್ಲದು ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ. ಒಮ್ಮೆ ಹ್ಯಾಂಡ್ಶೇಕ್ ಕೆಲಸ ಮಾಡಿದರೆ, ನೀವು ಕೇವಲ ಒಂದು ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು ಬದಲಾಯಿಸುವ ಮೂಲಕ ಮೂರೂ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸಬಹುದಾದ ಏಕೈಕ ಕ್ಲೈಂಟ್ ಅನ್ನು ಹೊಂದಿರುತ್ತೀರಿ.
ಹಂತ 2: ಕಾರ್ಯವನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ
ಹಂತ ಹಂತದ ತರ್ಕವನ್ನು ಬಯಸುವ ಮತ್ತು ವಸ್ತುನಿಷ್ಠವಾಗಿ ಅಳೆಯಬಹುದಾದ ಉತ್ತರವನ್ನು ಹೊಂದಿರುವ ಸಮಸ್ಯೆಯನ್ನು ಆರಿಸಿ. ಬಿನ್-ಪ್ಯಾಕಿಂಗ್ (Bin-packing) ಅತ್ಯುತ್ತಮವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ಇದು NP-hard ಆಗಿದೆ, ಅಂದರೆ ಗ್ರಿಡಿ ಹ್ಯೂರಿಸ್ಟಿಕ್ಸ್ (greedy heuristics) ನಿರೀಕ್ಷಿತ ರೀತಿಯಲ್ಲಿ ವಿಫಲವಾಗುತ್ತವೆ ಮತ್ತು ಇದು ಮಾಡೆಲ್ ಏಕಕಾಲದಲ್ಲಿ ಹಲವಾರು ನಿರ್ಬಂಧಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವಂತೆ ಮಾಡುತ್ತದೆ. ವಿವಿಧ ಗಾತ್ರದ ವಸ್ತುಗಳು ನಿಗದಿತ ಸಾಮರ್ಥ್ಯದ ಬಿನ್ಗಳಿಗೆ ಮಿತಿಗಳನ್ನು ಮೀರದಂತೆ ಹೊಂದಿಕೊಳ್ಳಬೇಕು.
ಮಾಡೆಲ್ ಎರಡು ಕೆಲಸಗಳನ್ನು ಮಾಡಬೇಕಾದಂತೆ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ರೂಪಿಸಿ: ಅದರ ರೀಸನಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯನ್ನು ವಿವರಿಸಬೇಕು, ನಂತರ ಆ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುವ ವರ್ಕಿಂಗ್ Python ಕೋಡ್ ಅನ್ನು ಒದಗಿಸಬೇಕು. ಯಾವುದೇ ಕೋಡ್ ಬರೆಯುವ ಮೊದಲು ಮಾಡೆಲ್ ತನ್ನ ಚೈನ್ ಆಫ್ ಥಾಟ್ ಅನ್ನು ತೋರಿಸಬೇಕೆಂದು ಸ್ಪಷ್ಟವಾಗಿ ಬಯಸುವ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ಬಳಸಿ. ಇದು ವಿಶೇಷವಾಗಿ ವಿಸ್ತೃತ ರೀಸನಿಂಗ್ ಟ್ರೇಸ್ಗಳಿಗಾಗಿ (reasoning traces) ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲಾದ DeepSeek R1 ಗೆ ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ. ಮಾಡೆಲ್ ಸಾಮರ್ಥ್ಯದ ಪರಿಶೀಲನೆಗಳ ಮೂಲಕ ಯೋಚಿಸುತ್ತಿದೆಯೇ ಅಥವಾ ಕೇವಲ ತರಬೇತಿ ಡೇಟಾದ ವಿರುದ್ಧ ಪ್ಯಾಟರ್ನ್-ಮ್ಯಾಚಿಂಗ್ ಮಾಡುತ್ತಿದೆಯೇ ಎಂಬುದನ್ನು ನೀವು ನೋಡಲು ಬಯಸುತ್ತೀರಿ. ಒಂದು ಉತ್ತಮ ಕಾರ್ಯವು ಟೆಂಪ್ಲೇಟ್ ಪ್ರತಿಕ್ರಿಯೆಗಳು ವಿಫಲವಾಗುವಷ್ಟು ಸವಾಲಿನಿಂದ ಕೂಡಿರಬೇಕು.
ಹಂತ 3: ಬೆಂಚ್ಮಾರ್ಕ್ ರನ್ ಮಾಡಿ
DeepSeek R1, Llama 3.3 70B, ಮತ್ತು Qwen 3 32B ಗೆ ಒಂದೇ ರೀತಿಯ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ನೀಡಿ. ಕೇವಲ ಅಂತಿಮ ಕೋಡ್ ಬ್ಲಾಕ್ಗಳನ್ನು ಮಾತ್ರವಲ್ಲದೆ, ಪೂರ್ಣ ಪಠ್ಯ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು (text responses) ಸೆರೆಹಿಡಿಯಿರಿ. ಅವುಗಳನ್ನು ಟೈಮ್ಸ್ಟ್ಯಾಂಪ್ಗಳು ಮತ್ತು ಮಾಡೆಲ್ ಐಡೆಂಟಿಫೈಯರ್ಗಳೊಂದಿಗೆ ಸಂಗ್ರಹಿಸಿ. Oxlo.ai ಪ್ರತಿ ವಿನಂತಿಗೆ (request) ಶುಲ್ಕ ವಿಧಿಸುವುದರಿಂದ, ಹಣ ಉಳಿಸಲು ನೀವು ನಿಮ್ಮ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಕತ್ತರಿಸುವ ಅಥವಾ ಸ್ಪಷ್ಟೀಕರಿಸುವ ಸೂಚನೆಗಳನ್ನು ತೆಗೆದುಹಾಕುವ ಅಗತ್ಯವಿಲ್ಲ. ನೀವು ನಿಖರವಾಗಿರಲು ಸಾಧ್ಯವಿದೆ. ಆ ಸ್ಥಿರತೆಯು ನಿಮಗೆ ವೆಚ್ಚದ ಆತಂಕವಿಲ್ಲದೆ ಪ್ರಾಂಪ್ಟ್ ವಿನ್ಯಾಸವನ್ನು ಪುನರಾವರ್ತಿಸಲು (iterate) ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ, ಇದು ಹೆಚ್ಚು ಸ್ವಚ್ಛವಾದ ಪ್ರಯೋಗಗಳು ಮತ್ತು ಹೆಚ್ಚು ಪುನರಾವರ್ತಿಸಬಹುದಾದ (reproducible) ಫಲಿತಾಂಶಗಳಿಗೆ ಕಾರಣವಾಗುತ್ತದೆ.
ನಿಮ್ಮ ಬಜೆಟ್ ಅನುಮತಿಸಿದರೆ ಪ್ರತಿಯೊಂದು ಮಾಡೆಲ್ ಅನ್ನು ಹಲವಾರು ಬಾರಿ ಚಲಾಯಿಸಿ. ರೀಸನಿಂಗ್ ಮಾಡೆಲ್ಗಳು ಸ್ಟೋಕ್ಯಾಸ್ಟಿಕ್ ಜನರೇಷನ್ಗಳಲ್ಲಿ (stochastic generations) ವ್ಯತ್ಯಾಸವಾಗಬಹುದು, ಮತ್ತು ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಸ್ಥಿರವಾದ ಸಾಮರ್ಥ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ ಅಥವಾ ಕೇವಲ ಒಂದು ಅದೃಷ್ಟದ ಮಾದರಿಯೇ (lucky sample) ಎಂಬುದನ್ನು ನೀವು ತಿಳಿಯಬೇಕಾಗುತ್ತದೆ.
ಹಂತ 4: LLM ಜಡ್ಜ್ ಬಳಸಿ ಗ್ರೇಡ್ ಮಾಡಿ
ಮ್ಯಾನುಯಲ್ ಸ್ಕೋರಿಂಗ್ ದೊಡ್ಡ ಮಟ್ಟದಲ್ಲಿ ಅನ್ವಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ (does not scale), ಆದರೆ ಕೇವಲ ಸಂಖ್ಯಾತ್ಮಕ ರೂಬ್ರಿಕ್ಗಳು ಸೂಕ್ಷ್ಮತೆಗಳನ್ನು (nuance) 놓ಕುತ್ತವೆ. ಮಧ್ಯಮ ಮಾರ್ಗವೆಂದರೆ LLM ಜಡ್ಜ್. ಇಲ್ಲಿ, ನೀವು Kimi K2.6 ಅನ್ನು ಬಳಸುತ್ತೀರಿ. ಅದಕ್ಕೆ ಮೂಲ ಸಮಸ್ಯೆ, ರೂಬ್ರಿಕ್ ಮತ್ತು ಪ್ರತಿ ಅಭ್ಯರ್ಥಿ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ನೀಡಿ. ಈ ಮೂರು ನಿರ್ದಿಷ್ಟ ಆಯಾಮಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಅದಕ್ಕೆ ತಿಳಿಸಿ:
- Reasoning clarity (ತರ್ಕದ ಸ್ಪಷ್ಟತೆ): ವಿವರಣೆಯು ನಿಜವಾಗಿಯೂ ತರ್ಕವನ್ನು ಪತ್ತೆಹಚ್ಚುತ್ತದೆಯೇ ಅಥವಾ ಕೇವಲ ಮೇಲ್ನೋಟಕ್ಕೆ ಹೇಳುತ್ತಿದೆಯೇ?
- Correctness (ಸರಿಯಾದ ಉತ್ತರ): ಸೂಚಿಸಲಾದ ಎಲ್ಲಾ ನಿರ್ಬಂಧಗಳನ್ನು (constraints) ಪ್ರಸ್ತಾವಿತ ಪರಿಹಾರವು ಪೂರೈಸುತ್ತದೆಯೇ?
- Code quality (ಕೋಡ್ ಗುಣಮಟ್ಟ): Python ಕೋಡ್ ಸ್ವಚ್ಛವಾಗಿದೆಯೇ, ಚಲಾಯಿಸಬಹುದಾಗಿದೆಯೇ ಮತ್ತು ಸ್ಪಷ್ಟವಾದ ಬಗ್ಗಳಿಂದ ಮುಕ್ತವಾಗಿದೆಯೇ?
ಸ್ಕೋರ್ಗಳನ್ನು JSON ಫಾರ್ಮ್ಯಾಟ್ನಲ್ಲಿ ಹಿಂತಿರುಗಿಸಲು ಜಡ್ಜ್ಗೆ ಸೂಚಿಸಿ. ರಚನಾತ್ಮಕ ಔಟ್ಪುಟ್ (Structured output) ಫಲಿತಾಂಶಗಳನ್ನು ಹೋಲಿಸಲು (diff), ಟ್ರೆಂಡ್ಗಳನ್ನು ಪ್ಲಾಟ್ ಮಾಡಲು ಮತ್ತು ಡೌನ್ಸ್ಟ್ರೀಮ್ ಆಟೊಮೇಷನ್ಗೆ ಬಳಸಲು ಸುಲಭವಾಗುತ್ತದೆ. ಜಡ್ಜ್ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಕಟ್ಟುನಿಟ್ಟಾಗಿಡಿ. ನೀವು "ಉತ್ತರಕ್ಕೆ ರೇಟಿಂಗ್ ನೀಡಿ" ಎಂಬ ಅಸ್ಪಷ್ಟ ಸೂಚನೆಯನ್ನು ನೀಡಿದರೆ, ನಿಮಗೆ ಅಸ್ಪಷ್ಟ ಫಲಿತಾಂಶಗಳು ಸಿಗುತ್ತವೆ. ಬದಲಾಗಿ, ಸರಿಯಾದ bin-packing ಪರಿಹಾರ ಎಂದರೆ ಏನು ಎಂಬುದನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಿ. ಸಾಮರ್ಥ್ಯಗಳನ್ನು (Capacities) ಮೀರಬಾರದು. ಪ್ರತಿಯೊಂದು ಐಟಂ ಅನ್ನು ನಿಯೋಜಿಸಬೇಕು. ಕೋಡ್ ಸಿಂಟ್ಯಾಕ್ಟಿಕಲಿ (syntactically) ಸರಿಯಾಗಿರಬೇಕು. ನಿಮ್ಮ ಮಾನದಂಡಗಳು ಎಷ್ಟು ನಿರ್ದಿಷ್ಟವಾಗಿರುತ್ತವೆಯೋ, ನಿಮ್ಮ ಗ್ರೇಡ್ಗಳು ಅಷ್ಟು ವಿಶ್ವಾಸಾರ್ಹವಾಗುತ್ತವೆ.
ಯಾವಾಗಲೂ ಜಡ್ಜ್ ಅನ್ನು ಸ್ಪಾಟ್-ಚೆಕ್ ಮಾಡಿ. ಕೇವಲ ಮೇಲ್ಮಟ್ಟದ ಮೆರುಗು (surface-level polish) ಕಾರಣದಿಂದ Kimi K2.6 ನಿರಂತರವಾಗಿ ಒಂದು ಮಾಡೆಲ್ಗೆ ಹೆಚ್ಚಿನ ರೇಟಿಂಗ್ ನೀಡುತ್ತಿದ್ದರೆ, ನಿಮ್ಮ ಬೆಂಚ್ಮಾರ್ಕ್ ತಪ್ಪಾಗಿದೆ ಎಂದರ್ಥ. ಸಣ್ಣ ಮಾನವ ಆಡಿಟ್ ಪದರವು (human audit layer) 'garbage-in-garbage-out' ಮೌಲ್ಯಮಾಪನವನ್ನು ತಡೆಯುತ್ತದೆ.
ಹಂತ 5: ವರದಿಯನ್ನು ತಯಾರಿಸಿ
JSON ಸ್ಕೋರ್ಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸಿ ಮತ್ತು ಅವುಗಳನ್ನು ಮಾಡೆಲ್ನ ಮೂಲ ಔಟ್ಪುಟ್ಗಳ ಸಾರಾಂಶದೊಂದಿಗೆ (excerpts) ಜೋಡಿಸಿ. ಎಲ್ಲವನ್ನೂ ನಿಮ್ಮ ರೆಪೊಸಿಟರಿಯಲ್ಲಿರುವ (repository) ಒಂದೇ ಫೈಲ್ನಲ್ಲಿ ಇರಿಸಿ. ನೀವು ಮಾಡೆಲ್ ವರ್ಷನ್ ಅನ್ನು ಅಪ್ಡೇಟ್ ಮಾಡಿದಾಗ ಅಥವಾ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಬದಲಾಯಿಸಿದಾಗ, ನಿಮ್ಮ ಪುಲ್ ರಿಕ್ವೆಸ್ಟ್ನಲ್ಲಿನ (pull request) ವ್ಯತ್ಯಾಸವು ವರ್ತನೆಯು ಹೇಗೆ ಬದಲಾಗಿದೆ ಎಂಬುದನ್ನು ನಿಖರವಾಗಿ ತೋರಿಸುತ್ತದೆ. ಉತ್ತಮವಾಗಿ ನಿರ್ವಹಿಸಲ್ಪಟ್ಟ ಬೆಂಚ್ಮಾರ್ಕ್ ಒಂದು ಜೀವಂತ ದಾಖಲೆಯಾಗುತ್ತದೆ (living documentation). ಇದು ನಿಮ್ಮ ಪ್ರೊಡಕ್ಷನ್ ಪೈಪ್ಲೈನ್ ಏಕೆ ಒಂದು ಮಾಡೆಲ್ಗಿಂತ ಇನ್ನೊಂದನ್ನು ಬಳಸುತ್ತದೆ ಎಂಬುದನ್ನು ಸಮರ್ಥಿಸುತ್ತದೆ ಮತ್ತು ಬಳಕೆದಾರರಿಗೆ ತಲುಪುವ ಮೊದಲೇ ಸೈಲೆಂಟ್ ರಿಗ್ರೆಷನ್ಗಳನ್ನು (silent regressions) ಪತ್ತೆಹಚ್ಚುತ್ತದೆ.
ನಿಮ್ಮ ಸಹೋದ್ಯೋಗಿಯು ಕೋಡ್ ಅನ್ನು ರನ್ ಮಾಡದೆಯೇ ಓದಬಲ್ಲ ರೀತಿಯಲ್ಲಿ ವರದಿಯನ್ನು ರಚಿಸಿ. ಸಮಸ್ಯೆ ಹೇಳಿಕೆ (problem statement), ಪ್ರಾಂಪ್ಟ್ ಟೆಂಪ್ಲೇಟ್, ಸ್ಕೋರ್ಗಳು ಮತ್ತು ಪ್ರತಿ ಮಾಡೆಲ್ನ ರೀಸನಿಂಗ್ ಟ್ರೇಸ್ನಿಂದ ಪ್ರಮುಖ ಉಲ್ಲೇಖಗಳನ್ನು ಸೇರಿಸಿ. ಪಾರದರ್ಶಕತೆ ಮುಖ್ಯವಾಗಿದೆ. DeepSeek R1 ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಪಡೆದರೂ ಯಾವುದಾದರೂ ನಿರ್ಬಂಧವನ್ನು ತಪ್ಪಾಗಿ ಕಲ್ಪಿಸಿಕೊಂಡರೆ (hallucinates a constraint), ಅದು ಸರಾಸರಿಯಲ್ಲಿ ಅಡಗಿರಬಾರದು, ಬದಲಾಗಿ ಪಠ್ಯದ ಸಾರಾಂಶದಲ್ಲಿ ಸ್ಪಷ್ಟವಾಗಿ ಕಾಣಿಸಬೇಕು.
ಪೈಪ್ಲೈನ್ ಅನ್ನು ಆಟೊಮೇಷನ್ ಮಾಡುವುದು
ನಿಮ್ಮ ಲ್ಯಾಪ್ಟಾಪ್ನಲ್ಲಿ ಮಾತ್ರ ಇರುವ ಬೆಂಚ್ಮಾರ್ಕ್ ಒಂದು ವಾರದೊಳಗೆ ಮರೆತುಹೋಗುತ್ತದೆ. ಅದನ್ನು ನೈಟ್ಲಿ CI ಕೆಲಸಕ್ಕೆ (nightly CI job) ವರ್ಗಾಯಿಸಿ. ಪ್ರತಿದಿನ ರಾತ್ರಿ, ಹಾರ್ನೆಸ್ (harness) ಚಾಲನೆಯಾಗುತ್ತದೆ, Oxlo.ai ನಲ್ಲಿನ ಪ್ರಸ್ತುತ ಮಾಡೆಲ್ ವರ್ಷನ್ಗಳನ್ನು ಪ್ರಶ್ನಿಸುತ್ತದೆ, bin-packing ಕಾರ್ಯವನ್ನು ರನ್ ಮಾಡುತ್ತದೆ, ಔಟ್ಪುಟ್ಗಳನ್ನು ಗ್ರೇಡ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಫಲಿತಾಂಶಗಳನ್ನು ಕಮಿಟ್ ಮಾಡುತ್ತದೆ. ಮಾಡೆಲ್ ಅಪ್ಡೇಟ್ನಿಂದಾಗಿ ಸರಿಯಾದ ಉತ್ತರದ ಪ್ರಮಾಣದಲ್ಲಿ ಹತ್ತು ಪಾಯಿಂಟ್ಗಳ ಕುಸಿತ ಉಂಟಾದರೆ, ನಿಮ್ಮ ಬಳಕೆದಾರರಿಗಿಂತ ಮೊದಲೇ ನೀವು ಅದನ್ನು ತಿಳಿಯುವಿರಿ.
ಕೋರ್ ಹಾರ್ನೆಸ್ ಸ್ಥಿರವಾದ ನಂತರ, ಅದನ್ನು ವಿಸ್ತರಿಸಿ. ಪ್ರಾಂಪ್ಟ್ನಲ್ಲಿ ಅಪ್ರಸ್ತುತ ದಾಖಲೆಗಳನ್ನು ತುಂಬುವ ಮೂಲಕ ಮತ್ತು ಕೊನೆಯಲ್ಲಿ bin-packing ಪ್ರಶ್ನೆಯನ್ನು ಇಡುವ ಮೂಲಕ ಲಾಂಗ್-ಕಾಂಟೆಕ್ಸ್ಟ್ಗಳ (long-context variants) ಪರೀಕ್ಷೆ ಮಾಡಿ. ಶಬ್ದ ಅಥವಾ ಗೊಂದಲದ (noise) ನಡುವೆ ತರ್ಕವು ಕುಸಿದರೆ ದೊಡ್ಡ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋಗಳು ಪ್ರಯೋಜನವಿಲ್ಲದಂತಾಗುತ್ತವೆ. ಹತ್ತು ಸಾವಿರ ಟೋಕನ್ಗಳ ಗೊಂದಲದ ನಡುವೆಯೂ ಯಾವ ಮಾಡೆಲ್ಗಳು ತಾರ್ಕಿಕ ಶಿಸ್ತನ್ನು (logical discipline) ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತವೆ ಎಂಬುದನ್ನು ಗಮನಿಸಿ.
ನಿಜವಾದ ಸಾರಾಂಶ
ಸಾರ್ವಜನಿಕ ಲೀಡರ್ಬೋರ್ಡ್ಗಳು ಸಾಮಾನ್ಯ ಜ್ಞಾನವನ್ನು ಅಳೆಯುತ್ತವೆ. ನಿಮ್ಮ ಅಪ್ಲಿಕೇಶನ್ ಅದಕ್ಕಿಂತ ಕಿರಿದಾದ ಮತ್ತು ಕಠಿಣವಾದದ್ದನ್ನು ಅಳೆಯುತ್ತದೆ. ಮಾಡೆಲ್ಗಳನ್ನು ಕನ್ಸ್ಟ್ರೈನ್ಡ್ ಆಪ್ಟಿಮೈಸೇಶನ್ (constrained optimization) ಮೂಲಕ ತರ್ಕಿಸಲು ಒತ್ತಾಯಿಸುವ, ಸ್ಥಿರವಾದ ಮಾನದಂಡಗಳೊಂದಿಗೆ ಅವುಗಳನ್ನು ಗ್ರೇಡ್ ಮಾಡುವ ಮತ್ತು git ನಲ್ಲಿ ಫಲಿತಾಂಶಗಳ ವರ್ಷನ್ ಮಾಡುವ ಸರಳ, ಪುನರಾವರ್ತಿಸಬಹುದಾದ ಹಾರ್ನೆಸ್, ಯಾವುದೇ ಒಟ್ಟು ಸ್ಕೋರ್ಗಿಂತ ಹೆಚ್ಚು ಉಪಯುಕ್ತ ಮಾಹಿತಿಯನ್ನು ನೀಡುತ್ತದೆ. ನಿಮ್ಮ ಸಮಸ್ಯೆಗೆ ಹೊಂದಿಕೆಯಾಗುವ ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ನಿರ್ಮಿಸಿ, ನಿಮಗೆ ಮುಖ್ಯವಾದ ಆರ್ಕಿಟೆಕ್ಚರ್ಗಳಲ್ಲಿ ಅದನ್ನು ರನ್ ಮಾಡಿ ಮತ್ತು ಫಲಿತಾಂಶಗಳು ನಿಮ್ಮ ಪ್ರೊಡಕ್ಷನ್ ಆಯ್ಕೆಯನ್ನು ನಿರ್ಧರಿಸಲಿ.
ಮೂಲ: DeepSeek R1 Model Architecture and Benchmarks
ಸಮುದಾಯ: GyaanSetu AI on Telegram
