Claude Opus 5 ನ “max effort” ಸೆಟ್ಟಿಂಗ್, ಒಂದು ಸಾಮಾನ್ಯ ವಿನಂತಿಯ ಬೆಲೆಯನ್ನು $0.76 ರಿಂದ $19.21 ಕ್ಕೆ ಏರಿಸುತ್ತದೆ, ಆದರೆ ಇದು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಒಂದೇ ರೀತಿಯ ಫಲಿತಾಂಶವನ್ನೇ ನೀಡುತ್ತದೆ. ಈ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವು ಉತ್ತಮ ಪರಿಹಾರವನ್ನು ನೀಡುವ ಬದಲು ಕೇವಲ ಒಂದು ಆಂತರಿಕ ಆಡಿಟ್ (internal audit) ಪ್ರಕ್ರಿಯೆಯನ್ನು ಮಾತ್ರ ಒದಗಿಸುತ್ತದೆ ಮತ್ತು ಇದು ಕೇವಲ ಕಡಿಮೆ ಟೆಸ್ಟ್ ಕವರೇಜ್ (test coverage) ಹೊಂದಿರುವ ಕಾರ್ಯಗಳಲ್ಲಿ ಮಾತ್ರ ಅಳೆಯಬಹುದಾದ ಲಾಭವನ್ನು ತೋರಿಸುತ್ತದೆ.
ಪರೀಕ್ಷೆಯು ಏನನ್ನು ತೋರಿಸಿಕೊಟ್ಟಿತು
ಈ ಪ್ರಯೋಗವು Claude Opus 5 ನ ಡಿಫಾಲ್ಟ್ ಎಫರ್ಟ್ ಮಟ್ಟವನ್ನು (default effort level) ಎರಡು ರೀತಿಯ ಪ್ರಾಂಪ್ಟ್ಗಳಲ್ಲಿ “max effort” ನಾಬ್ನೊಂದಿಗೆ ಹೋಲಿಕೆ ಮಾಡಿತು: ದೈನಂದಿನ ಕೋಡಿಂಗ್ ಕೆಲಸಗಳು ಮತ್ತು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಕಠಿಣವಾದ ಸಮಸ್ಯೆಗಳು.
- ಒಂದು ಸಾಮಾನ್ಯ ಕಾರ್ಯಕ್ಕಾಗಿ, ಕಡಿಮೆ ಎಫರ್ಟ್ನ (low-effort) ಕಾರ್ಯವು ಎರಡು ನಿಮಿಷಗಳಲ್ಲಿ ಮುಕ್ತಾಯವಾಯಿತು ಮತ್ತು $0.76 ವೆಚ್ಚವಾಯಿತು. ಸೆಟ್ಟಿಂಗ್ ಅನ್ನು 'max' ಗೆ ಏರಿಸಿದಾಗ ಬಿಲ್ $19.21 ಕ್ಕೆ ಏರಿತು, ಆದರೂ requirement-coverage ಸ್ಕೋರ್ — ಅಂದರೆ ಮಾಡೆಲ್ ಸೂಚನೆಗಳನ್ನು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ಪೂರೈಸಿದೆ ಎಂದು ವರದಿ ಮಾಡುವ ಮಾಪಕ — ಮೊದಲಿನಂತೆಯೇ ಇತ್ತು.
- ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಟ್ (transcript) ಸೃಷ್ಟಿಯಿಂದ ಪರಿಷ್ಕರಣೆಯತ್ತ (revision) ಬದಲಾವಣೆಯನ್ನು ತೋರಿಸುತ್ತದೆ. ಮಾಡೆಲ್ ಹೊಸ ಕೋಡ್ ಅನ್ನು ರಚಿಸುವುದನ್ನು ನಿಲ್ಲಿಸಿ, ಈಗಾಗಲೇ ಬರೆದಿದ್ದನ್ನು ಸುಧಾರಿಸಲು (polishing) ಪ್ರಾರಂಭಿಸಿತು. ಎಡಿಟ್ಗಳ ಸಂಖ್ಯೆಯು ಹೊಸ ಬರವಣಿಗೆಗಿಂತ 2.4 ಪಟ್ಟು ಹೆಚ್ಚಿತ್ತು. “read” ಟೂಲ್ಗೆ ಮಾಡಿದ ಕರೆಗಳು 18 ಪಟ್ಟು ಹೆಚ್ಚಿದವು ಮತ್ತು “bash” ಟೂಲ್ ಬಳಕೆಯು 6 ಪಟ್ಟು ಏರಿತು. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಮಾಡೆಲ್ ಕೇಳದೆಯೇ ಮಾಡ್ಯೂಲ್ಗಳನ್ನು ಮರುಪರಿಶೀಲಿಸಿತು, ತನ್ನದೇ ಆದ ಪರೀಕ್ಷೆಗಳನ್ನು ಮರುಪ್ರಯತ್ನಿಸಿತು, ಲಿಂಟಿಂಗ್ (linting) ಮತ್ತು ಮ್ಯುಟೇಶನ್ ಟೆಸ್ಟಿಂಗ್ (mutation testing) ಅನ್ನು ಮಾಡಿತು.
“max effort” ನಾಬ್ ಹೊಸ ಅಲ್ಗಾರಿದಮ್ ಅನ್ನು ಪರಿಚಯಿಸುವುದಿಲ್ಲ; ಇದು ಕೇವಲ ಮಾಡೆಲ್ ಬಳಸಬಹುದಾದ ಬಜೆಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಬಜೆಟ್ ಸಾಕಷ್ಟು ದೊಡ್ಡದಾದ一旦, ಮಾಡೆಲ್ ಸೆಲ್ಫ್-ಆಡಿಟ್ ಮೋಡ್ (self-audit mode) ಗೆ ಬದಲಾಗುತ್ತದೆ ಮತ್ತು ತಾನು ಖರ್ಚು ಮಾಡಲು ಸಮರ್ಥನಾಗುವ ಯಾವುದೇ ಸಣ್ಣ ಬದಲಾವಣೆಗಳಿಗಾಗಿ ಹುಡುಕತೊಡಗುತ್ತದೆ.
ವೆಚ್ಚ ಏಕೆ ಏರುತ್ತದೆ
ಮಾಡೆಲ್ ಆಡಿಟ್ ಮಾಡಲು ನಿರ್ಧರಿಸಿದಾಗ, ಪ್ರತಿಯೊಂದು ಹೆಚ್ಚುವರಿ 'read' ಅಥವಾ 'bash' ಕರೆಗಳು ಬಿಲ್ಗೆ ಸೇರ್ಪಡೆಯಾಗುತ್ತವೆ ಮತ್ತು ಮಲ್ಟಿಪ್ಲೈಯರ್ ಪರಿಣಾಮಗಳು ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ಅತಿಯಾಗಿ ಹೆಚ್ಚಿಸುತ್ತವೆ.
ಆಡಿಟ್ ಮೋಡ್ ಎಂಬುದು ಒಂದು ಸ್ಪಷ್ಟವಾದ ವಿನ್ಯಾಸದ ಆಯ್ಕೆಯಾಗಿದೆ. ಮಾಡೆಲ್ ದೊಡ್ಡ ಬಜೆಟ್ ಅನ್ನು “ಸರಿಪಡಿಸಲು ಯೋಗ್ಯವಾದದ್ದನ್ನು ಹುಡುಕು” ಎಂಬ ಅನುಮತಿಯಾಗಿ ಪರಿಗಣಿಸುತ್ತದೆ. ಏನೂ ಸುಧಾರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲದಿದ್ದರೆ, ಈ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವು ಯಾವುದೇ ಕಾರ್ಯಕಾರಿ ಪ್ರಯೋಜನವನ್ನು ನೀಡುವುದಿಲ್ಲ.
ಹೆಚ್ಚಿನ ಎಫರ್ಟ್ ಯಾವಾಗ ಸೂಕ್ತವಾಗುತ್ತದೆ
ಆರಂಭಿಕ ಫಲಿತಾಂಶವು ಸುಧಾರಣೆಗೆ ಅವಕಾಶ ನೀಡಿದಾಗ ಮಾತ್ರ ಆಡಿಟ್ ಮೋಡ್ ಪ್ರಯೋಜನಕಾರಿಯಾಗುತ್ತದೆ. 0.73 ಟೆಸ್ಟ್ ಕವರೇಜ್ ಹೊಂದಿರುವ ಒಂದು Go ಪ್ರಾಜೆಕ್ಟ್ನಲ್ಲಿ, ಎಫರ್ಟ್ ಅನ್ನು 'max' ಗೆ ಏರಿಸಿದಾಗ ಕವರೇಜ್ 0.88 ಕ್ಕೆ ಏರಿತು.
ಇದಕ್ಕೆ ವಿರುದ್ಧವಾಗಿ, ಈಗಾಗಲೇ 0.98 ಕವರೇಜ್ ಹೊಂದಿದ್ದ ಒಂದು Python ಕಾರ್ಯದಲ್ಲಿ, ಬಜೆಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸಿದಾಗ ಯಾವುದೇ ಬದಲಾವಣೆ ಕಂಡುಬರಲಿಲ್ಲ. ಮಾಡೆಲ್ ಕೇವಲ ಅದೇ ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಕೋಡ್ ಅನ್ನು ಮರುಪರಿಶೀಲಿಸಿತು, ಇದರಿಂದ ಮೌಲ್ಯವನ್ನು ಹೆಚ್ಚಿಸದೆ ವೆಚ್ಚ ಮಾತ್ರ ಹೆಚ್ಚಾಯಿತು.
ಸಂಭವನೀಯ ಅನಾನುಕೂಲಗಳು
- ಬಜೆಟ್ ಅತಿಯಾಗಿ ಹೆಚ್ಚಾಗುವುದು (Budget blowout) – ಕಡಿಮೆ ಎಫರ್ಟ್ ಬೆಲೆಗೆ ಅಭ್ಯಾಸವಿರುವ ಬಳಕೆದಾರರು, ಅದೇ ಫಲಿತಾಂಶಕ್ಕಾಗಿ 25 ಪಟ್ಟು ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವನ್ನು ಕಂಡು ಆಶ್ಚರ್ಯಚಕಿತರಾಗಬಹುದು.
ಡೆವಲಪರ್ಗಳಿಗೆ ಪ್ರಾಯೋಗಿಕ ಮಾರ್ಗದರ್ಶನ
- ದೈನಂದಿನ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಡಿಫಾಲ್ಟ್ ಎಫರ್ಟ್ ಮಟ್ಟದಲ್ಲಿ ಇರಿಸಿ. ನೀವು ಅತ್ಯಲ್ಪ ಬೆಲೆಯಲ್ಲಿ ಅದೇ ಕಾರ್ಯಕಾರಿ ಫಲಿತಾಂಶವನ್ನು ಪಡೆಯುತ್ತೀರಿ.
- ಸ್ಪಷ್ಟವಾದ ಗುಣಮಟ್ಟದ ಮಿತಿಯನ್ನು ತಲುಪಲು ವಿಫಲವಾಗುವ ಕೋಡ್ಗಳಿಗಾಗಿ — ಅಂದರೆ ಕಡಿಮೆ ಟೆಸ್ಟ್ ಕವರೇಜ್, ಮಿಸ್ಸಿಂಗ್ ಲಿಂಟ್ ವಾರ್ನಿಂಗ್ಗಳು ಅಥವಾ ಇತರ ಅಳೆಯಬಹುದಾದ ಕೊರತೆಗಳಿಗಾಗಿ — “max effort” ಅನ್ನು ಮೀಸಲಿಡಿ.
- ಈ ಸೆಟ್ಟಿಂಗ್ ಅನ್ನು ಒಂದು ಪ್ರತ್ಯೇಕ ಮೋಡ್ ಆಗಿ ಪರಿಗಣಿಸಿ: ಉತ್ತಮ ಉತ್ತರಗಳಿಗಾಗಿ ವೇಗವನ್ನು ಹೆಚ್ಚಿಸುವ ಸಾಧನವಾಗಿ ನೋಡುವ ಬದಲು, ಇದು ಒಂದು ಐಚ್ಛಿಕ ಸೆಲ್ಫ್-ರಿವ್ಯೂ (self-review) ಪ್ರಕ್ರಿಯೆಯಾಗಿದೆ.
ಸಾರಾಂಶ
Claude Opus 5 ನ max-effort ಸ್ವಿಚ್ ಹಣವನ್ನು ಉತ್ತಮ ಕೋಡ್ಗಾಗಿ ಅಲ್ಲದೆ, ಆಂತರಿಕ ಗುಣಮಟ್ಟದ ತಪಾಸಣೆಗಾಗಿ ವಿನಿಮಯ ಮಾಡಿಕೊಳ್ಳುತ್ತದೆ. ನಿಮ್ಮ ಮೂಲ ಫಲಿತಾಂಶಗಳಲ್ಲಿ ತುಂಬಲು ಅಳೆಯಬಹುದಾದ ಕೊರತೆ ಇದ್ದಾಗ ಮಾತ್ರ ಇದನ್ನು ಮಿತವಾಗಿ ಬಳಸಿ; ಇಲ್ಲದಿದ್ದರೆ, ಡಿಫಾಲ್ಟ್ ಸೆಟ್ಟಿಂಗ್ ಆಡಿಟ್ ಮೋಡ್ನ ಹೆಚ್ಚಿನ ಬೆಲೆ ಇಲ್ಲದೆ ಅದೇ ಫಲಿತಾಂಶವನ್ನು ನೀಡುತ್ತದೆ.
Community discussion: https://t.me/GyaanSetuAi
