Kimi K3 ಮೂರು ಕಠಿಣ ಪ್ರಾಂಪ್ಟ್ಗಳಾದ ಸಂಭವನೀಯತೆಯ ಸಮಸ್ಯೆ (probability problem), ಪುಲ್ಲಿ-ಇನ್ನರ್शिया ಸನ್ನಿವೇಶ (pulley-inertia scenario) ಮತ್ತು ಸಂಕೀರ್ಣವಾದ Python ಬೆಕ್ಪ್ಯಾಕ್ ಸ್ಕ್ರಿಪ್ಟ್ನಲ್ಲಿ ವಿಫಲವಾದರೆ, GPT-5.6-SOL ಯಶಸ್ವಿಯಾಗಿ ಮುಕ್ತಾಯಗೊಳಿಸಿತು. ಬಹು-ಹಂತದ ಗಣಿತ, ಭೌತಶಾಸ್ತ್ರ ಮತ್ತು ಕೋಡ್ ಅನ್ನು ತಡೆಗಟ್ಟದೆ ವಿಶ್ಲೇಷಿಸಬಲ್ಲ ಮಾಡೆಲ್ ಬೇಕಾದಾಗ, ಟೋಕನ್ ಬಜೆಟ್ ಮತ್ತು ಲೇಟೆನ್ಸಿ (latency) ಏಕೆ ಮುಖ್ಯ ಎಂಬುದನ್ನು ಈ ವ್ಯತ್ಯಾಸವು ತೋರಿಸುತ್ತದೆ.
ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಏಕೆ ಮುಖ್ಯ
ಡೆವಲಪರ್ಗಳು ಮತ್ತು ಸಂಶೋಧಕರು ಹೆಚ್ಚಾಗಿ LLMಗಳನ್ನು ಕೇವಲ ಹೆಡ್ಲೈನ್ ಸ್ಕೋರ್ಗಳ ಆಧಾರದ ಮೇಲೆ ಆಯ್ಕೆ ಮಾಡುತ್ತಾರೆ, ಆದರೆ ನೈಜ ಪ್ರಪಂಚದ ಒತ್ತಡದಲ್ಲಿ ಅದು ಹೇಗೆ ವರ್ತಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಗಮನಿಸುವುದಿಲ್ಲ. ಈ ಮುಖಾಮುಖಿ ಪರೀಕ್ಷೆಯಲ್ಲಿ, ಪ್ರತಿಯೊಂದು ಮಾಡೆಲ್ ದೀರ್ಘವಾದ ತಾರ್ಕಿಕ ಸರಣಿಯನ್ನು (reasoning chain) ಬಯಸುವ ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸಿತು. GPT-5.6-SOL ಮೂರೂ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ಸಂಪೂರ್ಣ ಮತ್ತು ಸರಿಯಾದ ಉತ್ತರಗಳನ್ನು ನೀಡಿತು; Kimi K3 ಯಾವುದೇ ಉಪಯುಕ್ತ ಉತ್ತರವನ್ನು ನೀಡುವ ಮೊದಲೇ ತನ್ನ ಟೋಕನ್ ಬಜೆಟ್ ಮುಗಿಸಿಹಾಕಿತು ಅಥವಾ ಸಮಯ ಮೀರಿಹೋಯಿತು (timed out).
ಪರೀಕ್ಷೆಯ ಸಿದ್ಧತೆ
- ಗಣಿತ – ಪ್ಯಾಟರ್ನ್-ಓವರ್ಲ್ಯಾಪ್ ಸಂಭವನೀಯತೆ (pattern-overlap probability) ಮತ್ತು ಎಕ್ಸ್ಪೆಕ್ಟೇಶನ್ ಹಾಗೂ ವೇರಿಯನ್ಸ್ (expectation and variance - second moments) ಎರಡನ್ನೂ ಲೆಕ್ಕಹಾಕಬೇಕಾದ ಸಂಭವನೀಯತೆಯ ಪ್ರಶ್ನೆ.
- ಭೌತಶಾಸ್ತ್ರ – ಪುಲ್ಲಿಯ ಇನ್ನರ್शिया (pulley's inertia) ಮತ್ತು ಸ್ಪ್ರಿಂಗ್-ಟೆನ್ಶನ್ ಹೊಂದಿದ ಕೇಬಲ್ ಸಡಿಲವಾದಾಗ ಆಗುವ ಶಕ್ತಿ ನಷ್ಟವನ್ನು (energy loss) ಮಾಡೆಲಿಂಗ್ ಮಾಡುವುದು.
- ಪ್ರೋಗ್ರಾಮಿಂಗ್ – ಸಂಕೀರ್ಣ ಅವಲಂಬನೆಗಳು ಮತ್ತು ಟೈ-ಬ್ರೇಕ್ ನಿಯಮಗಳಿರುವ ಬೆಕ್ಪ್ಯಾಕ್-ಪ್ಯಾಕಿಂಗ್ ಸಮಸ್ಯೆಗೆ Python ಪರಿಹಾರವನ್ನು ಬರೆಯುವುದು, ನಂತರ ಆ ಆೌಟ್ಪುಟ್ ಅನ್ನು ಆರು ಸ್ವತಂತ್ರ ಟೆಸ್ಟ್ ಕೇಸ್ಗಳೊಂದಿಗೆ ಪರಿಶೀಲಿಸುವುದು.
ಅಂಕಿಅಂಶಗಳು ಏನು ಹೇಳುತ್ತವೆ
GPT-5.6-SOL
- ಗಣಿತ – ಎಕ್ಸ್ಪೆಕ್ಟೆಡ್ ವ್ಯಾಲ್ಯೂ ಮತ್ತು ವೇರಿಯನ್ಸ್ ಅನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ವಿವರಿಸುತ್ತಾ ಪೂರ್ಣವಾದ, ಸರಿಯಾದ ಪರಿಹಾರವನ್ನು ನೀಡಿತು.
- ಭೌತಶಾಸ್ತ್ರ – ಇನ್ನರ್शिया ಮಾಡೆಲ್ ಅನ್ನು ಸರಿಯಾಗಿ ನಿರ್ಮಿಸಿತು ಮತ್ತು ಶಕ್ತಿ ನಷ್ಟವನ್ನು ಪರಿಗಣಿಸಿತು, ಇದು ವಿಶ್ಲೇಷಣಾತ್ಮಕ ಉತ್ತರಕ್ಕೆ (analytical answer) ಹೊಂದಿಕೆಯಾಯಿತು.
- ಪ್ರೋಗ್ರಾಮಿಂಗ್ – ಕಂಪಿಲ್ ಆಗುವ, ರನ್ ಆಗುವ ಮತ್ತು ಎಲ್ಲಾ ಆರು ಬಾಹ್ಯ ಪರಿಶೀಲನೆಗಳನ್ನು ಪಾಸು ಮಾಡುವ ಕೋಡ್ ಅನ್ನು ಜನರೇಟ್ ಮಾಡಿತು. ಆದರೆ ಒಂದು ಆಂತರಿಕ ಟೆಸ್ಟ್ ಅಸರ್ಷನ್ (internal test assertion) ತಪ್ಪಾಗಿತ್ತು, ಇದು ಮಾಡೆಲ್ ಜನರೇಟ್ ಮಾಡಿದ ಪರೀಕ್ಷೆಗಳು ಅಚಲವಲ್ಲ ಎಂಬುದನ್ನು ನಮಗೆ ನೆನಪಿಸುತ್ತದೆ.
Kimi K3
- ಗಣಿತ – ತನ್ನ ಟೋಕನ್ ಮಿತಿಯನ್ನು ತಲುಪಿತು (ಮೊದಲು 6,500 ಟೋಕನ್ಗಳಲ್ಲಿ, ನಂತರ 10,000 ಟೋಕನ್ಗಳಲ್ಲಿ) ಮತ್ತು ಯಾವುದೇ ಉತ್ತರವನ್ನು ತೋರಿಸದೆ ನಿಂತುಹೋಯಿತು.
- ಭೌತಶಾಸ್ತ್ರ – ಯಾವುದೇ ದೃಶ್ಯಾವಳಿ ಔಟ್ಪುಟ್ ಕಾಣಿಸಿಕೊಳ್ಳುವ ಮೊದಲೇ ಟೋಕನ್ಗಳು ಮುಗಿದುಹೋದವು.
- ಪ್ರೋಗ್ರಾಮಿಂಗ್ – 245 ಸೆಕೆಂಡುಗಳ ನಂತರ ಸಮಯ ಮೀರಿಹೋಯಿತು (timed out), ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಏನನ್ನೂ ನೀಡಲಿಲ್ಲ.
ತಾರ್ಕಿಕ ದಕ್ಷತೆ vs. ಕಚ್ಚಾ ಸಾಮರ್ಥ್ಯ
ಪ್ರೊಡಕ್ಷನ್ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ನಿರ್ಮಿಸುವವರಿಗೆ ಇದರ ಸಂದೇಶ ಸ್ಪಷ್ಟವಾಗಿದೆ: ಯಾವುದೇ ಔಟ್ಪುಟ್ ನೀಡದೆ ಟೋಕನ್ಗಳನ್ನು ವ್ಯರ್ಥ ಮಾಡುವ ಮಾಡೆಲ್ ಮುಂದಿನ ಪ್ರಕ್ರಿಯೆಗಳನ್ನು (downstream processes) ಕುಂಠಿತಗೊಳಿಸಬಹುದು, ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸಬಹುದು ಮತ್ತು ಬಳಕೆದಾರರನ್ನು ನಿರಾಶರನ್ನಾಗಿಸಬಹುದು.
ವಿಶ್ವಾಸಾರ್ಹತೆ ಮತ್ತು "ಪರಿಪೂರ್ಣ" ಕೋಡ್ನ ಗುಪ್ತ ವೆಚ್ಚ
ಗೆದ್ದ ಮಾಡೆಲ್ ಕೂಡ ತಪ್ಪಿಹೋಯಿತು: GPT-5.6-SOL ಸ್ವತಃ ಜನರೇಟ್ ಮಾಡಿದ ಟೆಸ್ಟ್ ಕೇಸ್ನಲ್ಲಿ ಒಂದು ದೋಷಪೂರಿತ ಅಸರ್ಷನ್ ಇತ್ತು. ಮಾಡೆಲ್ ತಯಾರಿಸಿದ ವ್ಯಾಲಿಡೇಶನ್ (validation) ಮಾನವ ವಿಮರ್ಶೆಗೆ ಪರ್ಯಾಯವಲ್ಲ ಎಂಬುದನ್ನು ಇದು ತೋರಿಸುತ್ತದೆ. ಮಾಡೆಲ್ ಕೋಡ್ ಬರೆಯುವಾಗ, ನೀವು ಇಂದಿಗೂ ಸ್ವತಂತ್ರ ಪರಿಶೀಲನೆಗಳನ್ನು ನಡೆಸಬೇಕಾಗುತ್ತದೆ.
ಮುಂದೆ ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು
- ಫಿನಿಶ್ ರೀಸನ್ ಟ್ರ್ಯಾಕಿಂಗ್ (Finish reason tracking) – ಪ್ರತಿಕ್ರಿಯೆಯು ಟೋಕನ್ ಮಿತಿಯನ್ನು ತಲುಪಿದ ಕಾರಣದಿಂದ, ಟೈಮ್ಔಟ್ ಆದ ಕಾರಣದಿಂದ ಅಥವಾ ನೈಸರ್ಗಿಕವಾಗಿ ನಿಂತ ಕಾರಣದಿಂದ ಕೊನೆಗೊಂಡಿದೆಯೇ ಎಂಬುದನ್ನು ಲಾಗ್ ಮಾಡಿ.
- ರೀಸನಿಂಗ್ ಟೋಕನ್ ಕೌಂಟ್ (Reasoning token count) – ಪ್ರತಿಯೊಂದು ಮಾಡೆಲ್ ತನ್ನ ಆಂತರಿಕ ವಿವೇಚನೆಗೆ (internal deliberation) ಮತ್ತು ಅಂತಿಮ ಔಟ್ಪುಟ್ಗೆ ಎಷ್ಟು ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ ಎಂಬುದನ್ನು ಹೋಲಿಸಿ ನೋಡಿ.
- ಲೇಟೆನ್ಸಿ ಮಾನಿಟರಿಂಗ್ (Latency monitoring) – ಪ್ರತಿ ಹಂತಕ್ಕೂ ತಗಲುವ ಸಮಯವನ್ನು ಅಳೆಯಿರಿ; ಪ್ರತಿ ಕ್ವೆರಿಗೂ ನಿಮಿಷಗಟ್ಟಲೆ ತೆಗೆದುಕೊಳ್ಳುವ ಮಾಡೆಲ್ ಇಂಟರಾಕ್ಟಿವ್ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ಸೂಕ್ತವಾಗದಿರಬಹುದು.
ಡೆವಲಪರ್ಗಳು ಈ ಮೆಟ್ರಿಕ್ಗಳನ್ನು ಕೇವಲ ಅಂತಿಮ ಉತ್ತರ ಎಂದು ಪರಿಗಣಿಸದೆ, ಪ್ರಮುಖ ಸಂಕೇತಗಳಾಗಿ (first-class signals) ಪರಿಗಣಿಸಬೇಕು.
ಅಂತಿಮ ತೀರ್ಮಾನ
ಪೂರ್ಣತೆಯಲ್ಲಿ GPT-5.6-SOL, Kimi K3 ಗಿಂತ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. "ಸರಿಯಾದ ಉತ್ತರ" ನೀಡುವ ಮಾಡೆಲ್ ಕೂಡ ದೋಷಪೂರಿತ ಆಂತರಿಕ ಪರಿಶೀಲನೆಗಳನ್ನು ನೀಡಬಹುದು ಎಂಬುದನ್ನು ಈ ಪರೀಕ್ಷೆಯು ನಮಗೆ ನೆನಪಿಸುತ್ತದೆ, ಆದ್ದರಿಂದ ಮಾನವ ಮೇಲ್ವಿಚಾರಣೆ (human oversight) ಅತ್ಯಗತ್ಯವಾಗಿದೆ. ಫಿನಿಶ್ ರೀಸನ್, ಟೋಕನ್ ಬಳಕೆ ಮತ್ತು ಲೇಟೆನ್ಸಿಯನ್ನು ಟ್ರ್ಯಾಕ್ ಮಾಡುವುದು, ಯಾವುದೇ ಮೌನ ಟೈಮ್ಔಟ್ಗೆ ಸಿಲುಕದೆ ಕೆಲಸಕ್ಕೆ ಸರಿಯಾದ ಸಾಧನವನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ನಿಮಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ.
