ಎರಡು ವರ್ಷಗಳಿಗಿಂತ ಕಡಿಮೆ ಅವಧಿಯಲ್ಲಿ SWE-bench ಸ್ಕೋರ್‌ಗಳು 1.96% ರಿಂದ 72.7% ಕ್ಕೆ ಏರಿತು, ಇದನ್ನು AI ಕೋಡಿಂಗ್ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ 37 ಪಟ್ಟು ಜಿಗಿತ ಎಂದು ಸುದ್ದಿಗಳು ವಿವರಿಸುತ್ತಿವೆ. ಈ ಹೆಡ್‌ಲೈನ್ ಗಮನ ಸೆಳೆಯುತ್ತದೆ, ಆದರೆ ಈ ಅಂಕಿಅಂಶಗಳು ಎರಡು ವಿಭಿನ್ನ ಪರೀಕ್ಷೆಗಳನ್ನು ಹೋಲಿಸುತ್ತಿವೆಯೇ ಹೊರತು, ಸಾಫ್ಟ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಕೌಶಲ್ಯದಲ್ಲಿನ ಒಂದೇ ರೀತಿಯ ಸ್ಥಿರ ಸುಧಾರಣೆಯನ್ನಲ್ಲ.

ಕಚ್ಚಾ ಅಂಕಿಅಂಶಗಳು

2023 ರಲ್ಲಿ ಮೂಲ SWE-bench 2,294 ನೈಜ GitHub ಸಮಸ್ಯೆಗಳ (issues) ಆಧಾರದ ಮೇಲೆ AI ಏಜೆಂಟ್‌ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿತು. ಆ ಕಾರ್ಯಗಳು ಅಸ್ತವ್ಯಸ್ತವಾಗಿದ್ದವು: ಅಸ್ಪಷ್ಟ ವಿವರಣೆಗಳು, ಮುರಿದಿರುವ ಟೆಸ್ಟ್‌ಗಳು ಮತ್ತು ಮನುಷ್ಯರೂ ಸಹ ಪರಿಹರಿಸಲು ಕಷ್ಟಪಡುವ ಅನೇಕ ಸಮಸ್ಯೆಗಳು ಅಲ್ಲಿ ಇದ್ದವು. 2025 ರ ವೇಳೆಗೆ ಅದೇ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಹೆಸರು 72.7% ಸ್ಕೋರ್‌ನೊಂದಿಗೆ ಕಾಣಿಸಿಕೊಂಡಿತು, ಆದರೆ ಪರೀಕ್ಷೆಯನ್ನು ಕೇವಲ 500 ಕಾರ್ಯಗಳ "Verified" (ಪರಿಶೀಲಿತ) ಉಪಸಮೂಹಕ್ಕೆ ಸೀಮಿತಗೊಳಿಸಲಾಗಿತ್ತು, ಇವುಗಳನ್ನು ಮನುಷ್ಯರು ಸ್ಪಷ್ಟತೆ ಮತ್ತು ಪರಿಹರಿಸಬಹುದಾದ ಸಾಮರ್ಥ್ಯಕ್ಕಾಗಿ ಪರಿಶೀಲಿಸಿದ್ದರು.

ಪರೀಕ್ಷೆಯು ಹೇಗೆ ಬದಲಾಯಿತು

ಪೂರ್ಣ ಕ್ಯಾಟಲಾಗ್‌ನಿಂದ Verified ಸೆಟ್‌ಗೆ ಬದಲಾದದ್ದು ಮೊದಲ ಮತ್ತು ಅತ್ಯಂತ ಸ್ಪಷ್ಟವಾದ ಬದಲಾವಣೆಯಾಗಿದೆ. ಮೂಲ ಸಂಗ್ರಹವು ಓಪನ್-ಸೋರ್ಸ್ ಕೊಡುಗೆಗಳ ಗೊಂದಲಮಯ ವಾಸ್ತವವನ್ನು ಪ್ರತಿಬಿಂಬಿಸಲು ಪ್ರಯತ್ನಿಸಿತು—ಅಂದರೆ ಅಪೂರ್ಣವಾಗಿರುವ, ಸರಿಯಾಗಿ ದಾಖಲಿಸದ ಅಥವಾ ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳಿಲ್ಲದೆ ಪರಿಹರಿಸಲು ಅಸಾಧ್ಯವಾದ ಸಮಸ್ಯೆಗಳು. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, Verified ಆವೃತ್ತಿಯು ಅಂತಹ ಗೊಂದಲಗಳನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಹೊರಹಾಕುತ್ತದೆ. ಇದು ಹೆಚ್ಚು ಸ್ವಚ್ಛವಾದ ಮತ್ತು ಸುಲಭವಾಗಿ ನಿರ್ವಹಿಸಬಹುದಾದ ಸಮಸ್ಯೆಗಳ ಗುಂಪನ್ನು ನೀಡುತ್ತದೆ, ಅಲ್ಲಿ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್‌ಗಳನ್ನು ಪಡೆಯುವುದು ವಾಸ್ತವಿಕವಾಗಿ ಸಾಧ್ಯವಾಗುತ್ತದೆ.

ಈ ಎರಡು ಆವೃತ್ತಿಗಳು ಸಮಸ್ಯೆಯ ವಿಭಿನ್ನ ಭಾಗಗಳನ್ನು ಅಳೆಯುವುದರಿಂದ, ನೇರ ಶೇಕಡಾವಾರು ಹೋಲಿಕೆಯು ದಾರಿತಪ್ಪಿಸಬಹುದು. 1.96% ಅಂಕಿಅಂಶವು ಯಾವುದೇ ಫಿಲ್ಟರ್ ಮಾಡದ ಕಚ್ಚಾ ಕೆಲಸದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸುತ್ತದೆ; 72.7% ಅಂಕಿಅಂಶವು ಯಶಸ್ಸಿನ ಸಾಧ್ಯತೆಗಳು ಹೆಚ್ಚು ಇರುವ ವಿಶಿಷ್ಟವಾಗಿ ಆಯ್ಕೆಮಾಡಿದ ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸುತ್ತದೆ.

ಗುರಿ ಹೊಂದಿದ ಎಂಜಿನಿಯರಿಂಗ್

ಎರಡನೆಯದಾಗಿ, ಡೆವಲಪರ್‌ಗಳು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಅನ್ನು ಹೇಗೆ ಎದುರಿಸುತ್ತಾರೆ ಎಂಬಲ್ಲಿ ಒಂದು ಸೂಕ್ಷ್ಮ ಬದಲಾವಣೆ ಕಂಡುಬಂದಿತು. 2023 ರಲ್ಲಿ, ಯಾರೂ SWE-bench ಅನ್ನು ಗೆಲ್ಲಲು ನಿರ್ದಿಷ್ಟವಾಗಿ ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸಲಿಲ್ಲ; ಪರೀಕ್ಷೆಯು ಜಗತ್ತಿನ ಕೋಡಿಂಗ್ ಸವಾಲುಗಳ ಒಂದು ಯಾದೃಚ್ಛಿಕ ಮಾದರಿಯಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿತ್ತು. 2025 ರ ವೇಳೆಗೆ, ತಂಡಗಳು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಅನ್ನು ಒಂದು ಸ್ಕೋರ್‌ಬೋರ್ಡ್ ಆಗಿ ಪರಿವರ್ತಿಸಿದವು. ಅವರು Verified ಸೆಟ್‌ನಲ್ಲಿ ಉತ್ತಮ ಸ್ಕೋರ್ ಪಡೆಯುವ ಸ್ಪಷ್ಟ ಗುರಿಯೊಂದಿಗೆ ಸ್ಕ್ಯಾಫೋಲ್ಡಿಂಗ್ (scaffolding), ಪ್ರಾಂಪ್ಟಿಂಗ್ ತಂತ್ರಗಳು ಮತ್ತು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲಾದ ಮಾಡೆಲ್‌ಗಳನ್ನು ನಿರ್ಮಿಸಿದರು.

ಎಂಜಿನಿಯರ್‌ಗಳು ಒಂದು ನಿರ್ದಿಷ್ಟ ಪರೀಕ್ಷೆಯನ್ನು ಪಾಸು ಮಾಡಲು ಸಿಸ್ಟಮ್ ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿದಾಗ, ಆ ಸ್ಕೋರ್ ಆ ಸಿಸ್ಟಮ್ ಆ ಪರೀಕ್ಷೆಗೆ ಎಷ್ಟು ಚೆನ್ನಾಗಿ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆಯೇ ಹೊರತು, ಅದು ಎಷ್ಟು ವ್ಯಾಪಕವಾಗಿ ಸಾಮರ್ಥ್ಯ ಹೊಂದಿದೆ ಎಂಬುದನ್ನಲ್ಲ. ಬೆಂಚ್‌ಮಾರ್ಕ್ ಅನ್ನು "ರಿಪೇರಿ" ಮಾಡಿ ಒಂದು ಗುರಿಯನ್ನಾಗಿ ಪರಿವರ್ತಿಸಿದ ಕ್ಷಣದಲ್ಲೇ, ಅದು ನೈಜ ಪ್ರಪಂಚದ ಕೆಲಸದ ಪ್ರತಿನಿಧಿಸುವ ಮಾದರಿಯಾಗುವುದನ್ನು ನಿಲ್ಲಿಸಿತು.

ಈ ಜಿಗಿತದ ನಿಜವಾದ ಅರ್ಥವೇನು

ಪ್ರಸ್ತುತ ಕೋಡಿಂಗ್ ಏಜೆಂಟ್‌ಗಳು ಮೂಲ ಸೆಟ್‌ಗಿಂತ Verified ಕಾರ್ಯಗಳಲ್ಲಿ ಗಮನಾರ್ಹವಾಗಿ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿವೆ ಎಂಬ ಅರ್ಥದಲ್ಲಿ, ಸುದ್ದಿಯಲ್ಲಿರುವ ಈ ಸುಧಾರಣೆಯು ನಿಜವಾಗಿದೆ. ಅದೇ ವಿಶಿಷ್ಟ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಅನ್ನು ಅವಲಂಬಿಸಿರುವ ಸ್ಪರ್ಧೆಗಳು, ಸಂಶೋಧನಾ ಪ್ರಬಂಧಗಳು ಮತ್ತು ಉತ್ಪನ್ನ ಪ್ರದರ್ಶನಗಳಿಗೆ (product demos) ಈ ಸುಧಾರಣೆಯು ಮುಖ್ಯವಾಗಿದೆ.

ಆದಾಗ್ಯೂ, ಈ ಜಿಗಿತವು AI ಏಜೆಂಟ್‌ಗಳು ಈಗ ದೈನಂದಿನ ಸಾಫ್ಟ್‌ವೇರ್ ಅಭಿವೃದ್ಧಿಯ ಗೊಂದಲಗಳನ್ನು ನಿಭಾಯಿಸಬಲ್ಲವು ಎಂದು ಸಾಬೀತುಪಡಿಸುವುದಿಲ್ಲ. ಮೂಲ 2,294 ಸಮಸ್ಯೆಗಳ ಸೆಟ್ ಇಂದಿಗೂ ಅಸ್ತಿತ್ವದಲ್ಲಿದೆ ಮತ್ತು ಆ ಆವೃತ್ತಿಯ ಸ್ಕೋರ್‌ಗಳು ಇನ್ನೂ ಕಡಿಮೆಯೇ ಇವೆ.

ಕೇಳಬೇಕಾದ ಪ್ರಶ್ನೆಗಳು

ಬೆಂಚ್‌ಮಾರ್ಕ್ ಫಲಿತಾಂಶಗಳಲ್ಲಿ ನೀವು ದೊಡ್ಡ ಮಟ್ಟದ ಬದಲಾವಣೆಯನ್ನು ನೋಡಿದಾಗಲೆಲ್ಲಾ, ಈ ಮೂರು ಅಂಶಗಳನ್ನು ನೆನಪಿನಲ್ಲಿಡಿ:

  • ಯಾವ ಆವೃತ್ತಿಯನ್ನು ವರದಿ ಮಾಡಲಾಗುತ್ತಿದೆ? Original, Lite ಅಥವಾ Verified? ಒಂದೇ ರೀತಿಯ ಹೆಸರುಗಳು ವಿಭಿನ್ನವಾದ ಕಾರ್ಯಗಳ ಗುಂಪನ್ನು ಮರೆಮಾಚಬಹುದು.
  • ಏನನ್ನು ಹೊರಹಾಕಲಾಗಿದೆ? ಗೊಂದಲಮಯ ಅಥವಾ ಅಸಾಧ್ಯವಾದ ಕಾರ್ಯಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದರಿಂದ ಯಾವುದೇ ಸಿಸ್ಟಮ್‌ನ ಸಾಮರ್ಥ್ಯದ ಮಿತಿ ಹೆಚ್ಚಾಗುತ್ತದೆ; ಆದರೆ ಇದು ಉತ್ಪಾದನಾ ಹಂತದಲ್ಲಿ (production) ಮುಖ್ಯವಾಗುವ ಸವಾಲುಗಳನ್ನೇ ತೆಗೆದುಹಾಕುತ್ತದೆ.
  • ಈ ನಿರ್ದಿಷ್ಟ ಪರೀಕ್ಷೆಯನ್ನು ಪಾಸು ಮಾಡಲು ಸಿಸ್ಟಮ್ ಅನ್ನು ನಿರ್ಮಿಸಲಾಗಿದೆಯೇ? ಡೆವಲಪರ್‌ಗಳು ಬೆಂಚ್‌ಮಾರ್ಕ್ ಗಾಗಿ ಮಾಡೆಲ್‌ಗಳನ್ನು ಅಥವಾ ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ಟ್ಯೂನ್ ಮಾಡಿದ್ದರೆ, ಆ ಸ್ಕೋರ್ ಕೇವಲ ಆಪ್ಟಿಮೈಸೇಶನ್ ಅನ್ನು ಅಳೆಯುತ್ತದೆಯೇ ಹೊರತು ಕಚ್ಚಾ ಸಾಮರ್ಥ್ಯವನ್ನಲ್ಲ.

ಮುಂದಿನ ಹಾದಿ

ಇಂತಹ ಸುರಕ್ಷತಾ ಕ್ರಮಗಳು ಪ್ರಮಾಣಿತವಾಗುವವರೆಗೆ, ಒಬ್ಬ AI ಕೋಡರ್‌ನ ಉಪಯುಕ್ತತೆಯನ್ನು ಅಳೆಯಲು ಅತ್ಯುತ್ತಮ ಮಾರ್ಗವೆಂದರೆ ಡೆವಲಪರ್‌ಗಳು ಪ್ರತಿದಿನ ಎದುರಿಸುವ ಗೊಂದಲಮಯ, ನೈಜ ಪ್ರಪಂಚದ ಸಮಸ್ಯೆಗಳ ಮೇಲೆ ಅದರ ಕಾರ್ಯಕ್ಷಮತೆ.

ಸಾರಾಂಶ: ರಿಪೇರಿ ಮಾಡಲಾದ, ಗುರಿ ಹೊಂದಿದ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಪಡೆಯುವುದು AI ಏಜೆಂಟ್‌ಗಳು ನೈಜ ಪ್ರಪಂಚದ ಕೋಡಿಂಗ್ ಗೊಂದಲಗಳಿಗೆ ಸಿದ್ಧವಾಗಿವೆ ಎಂದು ತಾನಾಗಿಯೇ ಸಾಬೀತುಪಡಿಸುವುದಿಲ್ಲ; ಎಂಜಿನಿಯರ್‌ಗಳು ಪ್ರತಿದಿನ ಎದುರಿಸುವ ಯಾವುದೇ ಫಿಲ್ಟರ್ ಮಾಡದ ಸಮಸ್ಯೆಗಳೇ ನಿಜವಾದ ಪರೀಕ್ಷೆಯಾಗಿ ಉಳಿಯುತ್ತವೆ.