GPT-5.6-SOL ಮೂರು ಹಂತದ ಗಣಿತ, ಭೌತಶಾಸ್ತ್ರ ಮತ್ತು ಕೋಡಿಂಗ್ ಕಾರ್ಯಗಳನ್ನು ಪೂರ್ಣಗೊಳಿಸಿತು, ಆದರೆ Kimi K3 ಅದೇ ಪ್ರಾಂಪ್ಟ್ಗಳಲ್ಲಿ ಟೋಕನ್ ಬಜೆಟ್ ಮುಗಿದು ಮತ್ತು ಟೈಮ್ ಔಟ್ ಆಯಿತು. ಇದು ವಿಶ್ವಾಸಾರ್ಹ, ಅಂತ್ಯದವರೆಗಿನ (end-to-end) ಉತ್ತರಗಳ ಅಗತ್ಯವಿರುವ ಡೆವಲಪರ್ಗಳಿಗೆ ಒಂದು ಪ್ರಾಯೋಗಿಕ ಮಿತಿಯನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.
ಈ ಪರೀಕ್ಷೆಯ ಮಹತ್ವವೇನು
ಎರಡೂ ಮಾದರಿಗಳಿಗೆ ಒಂದೇ ರೀತಿಯ ಟೋಕನ್ ಮಿತಿಯ ಅಡಿಯಲ್ಲಿ ಒಂದೇ ರೀತಿಯ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ನೀಡಲಾಗಿತ್ತು ಮತ್ತು ಯಾವುದೇ ಇಂಟರ್ನೆಟ್-ಸರ್ಚ್ ಪರಿಕರಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಲಾಗಿರಲಿಲ್ಲ. ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಹಂತ-ಹಂತದ ತಾರ್ಕಿಕತೆಯ (multi-step reasoning) ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸಿತು—ಇದು ವೈಜ್ಞಾನಿಕ ಲೆಕ್ಕಾಚಾರಗಳು ಮತ್ತು ಕೋಡ್ ಜನರೇಷನ್ನಲ್ಲಿ ಸಾಮಾನ್ಯ ಅಗತ್ಯವಾಗಿದೆ. ಪ್ರೊಡಕ್ಷನ್ನಲ್ಲಿ, ಅಂತಿಮ ಫಲಿತಾಂಶವನ್ನು ನೀಡುವ ಮೊದಲೇ ತನ್ನ ಟೋಕನ್ ಹಂಚಿಕೆಯನ್ನು ಖಾಲಿ ಮಾಡುವ ಮಾದರಿಯು ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಸ್ಥಗಿತಗೊಳಿಸಬಹುದು ಮತ್ತು ಡಿಬಗ್ ಮಾಡುವ ಕೆಲಸವನ್ನು ಹೆಚ್ಚಿಸಬಹುದು.
ಮುಖಾಮುಖಿ ಪರೀಕ್ಷೆಯಲ್ಲಿ ಏನಾಯಿತು
GPT-5.6-SOL
- ಮೂರು ಸವಾಲುಗಳ ಪ್ರತಿಯೊಂದಕ್ಕೂ ಸಂಪೂರ್ಣ ಉತ್ತರವನ್ನು ನೀಡಿತು.
- ಸರಿಯಾದ ಗಣಿತ ಮತ್ತು ಭೌತಶಾಸ್ತ್ರದ ಡೆರಿವೇಶನ್ಗಳನ್ನು (derivations) ನೀಡಿತು.
- ಲೋಕಲ್ ಇಂಟರ್ಪ್ರೆಟರ್ನಲ್ಲಿ ಕಂಪೈಲ್ ಆಗಿ ಚಲಿಸುವ Python ಸ್ಕ್ರಿಪ್ಟ್ ಅನ್ನು ಜನರೇಟ್ ಮಾಡಿತು.
- ಉದಾಹರಣೆ ಔಟ್ಪುಟ್ನಲ್ಲಿ ಒಂದು ಟೆಸ್ಟ್ ಕೇಸ್ ಅನ್ನು ಮಿಸ್ ಮಾಡಿಕೊಂಡಿತು, ಆದರೆ ಮೂಲ ತರ್ಕವು (core logic) ಸರಿಯಾಗಿತ್ತು.
Kimi K3
- ಗಣಿತ ಮತ್ತು ಭೌತಶಾಸ್ತ್ರದ ಸಮಸ್ಯೆಗಳಿಗೆ ಯಾವುದೇ ದೃಶ್ಯ ಪರಿಹಾರವನ್ನು ನೀಡಲು ವಿಫಲವಾಯಿತು.
- ಪದೇ ಪದೇ ಟೋಕನ್ ಮಿತಿಯನ್ನು ತಲುಪಿತು, ತೀರ್ಮಾನಕ್ಕೆ ಬರುವ ಮೊದಲೇ ತನ್ನ ತಾರ್ಕಿಕ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅರ್ಧಕ್ಕೆ ನಿಲ್ಲಿಸಿತು.
- ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಕಾರ್ಯದಲ್ಲಿ 245 ಸೆಕೆಂಡುಗಳ ನಂತರ ನಿಂತಿತು, ಯಾವುದೇ ರನ್ ಮಾಡಬಹುದಾದ ಕೋಡ್ ಅನ್ನು ನೀಡಲಿಲ್ಲ.
ವೃತ್ತಿಪರರಿಗಾಗಿ ಪ್ರಮುಖ ಅಂಶಗಳು
- Reasoning tokens vs. final output – Kimi K3 ತನ್ನ ಟೋಕನ್ ಬಜೆಟ್ನ ಹೆಚ್ಚಿನ ಭಾಗವನ್ನು ಆಂತರಿಕ ಆಲೋಚನಾ ಸರಪಳಿಗಳಿಗಾಗಿ (internal thought chains) ಬಳಸುತ್ತದೆ. ಬಜೆಟ್ ನಿಗದಿತವಾಗಿದ್ದಾಗ, ಮಾದರಿಯು ಉತ್ತರವನ್ನು ನೀಡುವ ಮೊದಲೇ ಸ್ಥಳಾವಕಾಶವನ್ನು ಖಾಲಿ ಮಾಡಿಕೊಳ್ಳುತ್ತದೆ, ಇದು ತಕ್ಷಣದ ಫಲಿತಾಂಶ ಬೇಕಾದ ವರ್ಕ್ಫ್ಲೋಗಳಿಗೆ ಅಸಮರ್ಪಕವಾಗಿದೆ.
- Logic versus testing – ತಾರ್ಕಿಕತೆಯನ್ನು ಸರಿಯಾಗಿ ಮಾಡುವ ಮಾದರಿಯೂ ಸಹ ಪೂರಕ ವಿವರಗಳಲ್ಲಿ ತಪ್ಪು ಮಾಡಬಹುದು. GPT-5.6-SOL ನ ತಪ್ಪಾದ ಟೆಸ್ಟ್ ಕೇಸ್, ಜನರೇಟ್ ಮಾಡಿದ ವ್ಯಾಲಿಡೇಶನ್ ಕೋಡ್ ಅನ್ನು ನಾವು ಮ್ಯಾನುಯಲ್ ಆಗಿ ಪರಿಶೀಲಿಸಬೇಕೆಂದು ನೆನಪಿಸುತ್ತದೆ.
- Latency and finish reasons matter – ಪ್ರೊಡಕ್ಷನ್ ಪೈಪ್ಲೈನ್ಗಳು ಕೇವಲ ಅಂತಿಮ ಉತ್ತರವನ್ನು ಮಾತ್ರವಲ್ಲದೆ, ಮಾದರಿಯು ಏಕೆ ನಿಂತಿತು (ಟೋಕನ್ ಮಿತಿ, ಟೈಮ್ ಔಟ್ ಇತ್ಯಾದಿ) ಮತ್ತು ತಾರ್ಕಿಕತೆಗಾಗಿ ಎಷ್ಟು ಟೋಕನ್ಗಳನ್ನು ಬಳಸಿತು ಎಂಬುದನ್ನು ಸಹ ಲಾಗ್ ಮಾಡಬೇಕು.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಇಂತಹ ಬದಲಾವಣೆಗಳು ಬರುವವರೆಗೆ, ವಿಶ್ವಾಸಾರ್ಹ ಅಂತ್ಯದವರೆಗಿನ (end-to-end) ಫಲಿತಾಂಶಗಳನ್ನು ಬಯಸುವ ಡೆವಲಪರ್ಗಳು, ಚೇನ್ಡ್ ಕ್ಯಾಲ್ಕುಲೇಶನ್ಗಳು ಅಥವಾ ಕೋಡ್ ಸಿಂಥೆಸಿಸ್ ಒಳಗೊಂಡಿರುವ ಕಾರ್ಯಗಳಿಗಾಗಿ GPT-5.6-SOL ನಂತಹ ಮಾದರಿಗಳನ್ನೇ ಹೆಚ್ಚು ಇಷ್ಟಪಡಬಹುದು.
ಸ್ವಯಂಚಾಲಿತ ವ್ಯವಸ್ಥೆಗಳನ್ನು (automated systems) ನಿರ್ಮಿಸುತ್ತಿರುವ ತಂಡಗಳಿಗೆ, ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಒಂದು ಸರಳ ನಿಯಮವನ್ನು ಒತ್ತಿಹೇಳುತ್ತದೆ: ಉತ್ತರದ ನಿಖರತೆ ಮತ್ತು ನೀವು ವಿಧಿಸಿದ ಕಾರ್ಯಾಚರಣೆಯ ಮಿತಿಗಳ ಒಳಗೆ ಆ ಉತ್ತರವನ್ನು ತಲುಪುವ ಮಾದರಿಯ ಸಾಮರ್ಥ್ಯ ಎರಡನ್ನೂ ಪರೀಕ್ಷಿಸಿ. "ಯೋಚಿಸುವ" ಆದರೆ ಎಂದಿಗೂ ಮುಗಿಸದ ಮಾದರಿಯು ಒಂದು ಅಂತ್ಯವಿಲ್ಲದ ದಾರಿಯಷ್ಟೇ (dead end).
