SWE-Prime ಸಂಶೋಧನೆಯು, "pass" ರನ್ಗಳ ಎಚ್ಚರಿಕೆಯಿಂದ ಆಯ್ದುಕೊಳ್ಳಲಾದ 10% ರಷ್ಟು ಡೇಟಾದ ಮೇಲೆ ತರಬೇತಿ ನೀಡುವುದು, ಪ್ರತಿಯೊಂದು ಯಶಸ್ವಿ ಟ್ರ್ಯಾಜೆಕ್ಟರಿಯನ್ನು (trajectory) ಮಾಡೆಲ್ಗೆ ಒದಗಿಸುವುದಕ್ಕಿಂತ ಹೆಚ್ಚು ಬಲಿಷ್ಠವಾದ AI ಏಜೆಂಟ್ಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಇದು "pass" ಲೇಬಲ್ ಅನ್ನು ವಿಶ್ವಾಸಾರ್ಹ ಗುಣಮಟ್ಟದ ಫಿಲ್ಟರ್ ಎಂದು ಪರಿಗಣಿಸುವ ದೀರ್ಘಕಾಲದ ಅಭ್ಯಾಸವನ್ನು ಪ್ರಶ್ನಿಸುತ್ತದೆ.
ಕೋಡ್-ಜನರೇಷನ್ ಅಥವಾ ಆಟೋಮೇಟೆಡ್ ડીಬಗ್ಗಿಂಗ್ ಏಜೆಂಟ್ಗಳನ್ನು ನಿರ್ಮಿಸುವವರಿಗೆ ಈ ಫಲಿತಾಂಶ ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ: ಹೆಚ್ಚಿನ ಡೇಟಾ ಎಂದರೆ ತಾನಾಗಿಯೇ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆ ಎಂದರ್ಥವಲ್ಲ. ಬೈನರಿ pass/fail ಫ್ಲಾಗ್ ಮೇಲೆ ಅತಿ ಸರಳವಾಗಿ ಅವಲಂಬಿತವಾಗುವುದು ಮಾಡೆಲ್ಗಳಿಗೆ ತರ್ಕದ ಬದಲು ಅಲೆದಾಡಲು, ಅನಗತ್ಯ ಟೂಲ್ ಕರೆಗಳನ್ನು (tool calls) ಪುನರಾವರ್ತಿಸಲು ಮತ್ತು ಅದೃಷ್ಟದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಲು ಕಲಿಸಬಹುದು.
"pass" ಫ್ಲಾಗ್ ಅನ್ನು ಏಕೆ ನಂಬಲಾಗಿತ್ತು
ಹೆಚ್ಚಿನ reinforcement-learning-from-human-feedback ಪೈಪ್ಲೈನ್ಗಳಲ್ಲಿ, ಅಂತಿಮ ಫಲಿತಾಂಶವು ಪರೀಕ್ಷೆಯ ಮಾನದಂಡಗಳನ್ನು ಪೂರೈಸಿದಾಗ, ಎಂಜಿನಿಯರ್ಗಳು ಒಂದು ಟ್ರ್ಯಾಜೆಕ್ಟರಿಯನ್ನು—ಅಬ್ಸರ್ವೇಶನ್ಗಳು, ಕ್ರಮಗಳು ಮತ್ತು ಟೂಲ್ ಇನ್ವೋಕೇಶನ್ಗಳ ಸಂಪೂರ್ಣ ಸರಣಿಯನ್ನು—"pass" ಎಂದು ಲೇಬಲ್ ಮಾಡುತ್ತಾರೆ. ಇದರ ಹಿಂದಿನ ಕಲ್ಪನೆ ಸರಳವಾಗಿದೆ: ಏಜೆಂಟ್ ಯಶಸ್ವಿಯಾದರೆ, ಇಡೀ ಎಪಿಸೋಡ್ ಉಪಯುಕ್ತ ನಡವಳಿಕೆಯನ್ನು ಹೊಂದಿರಲೇಬೇಕು. ಆದ್ದರಿಂದ, ಯಶಸ್ಸಿಗೆ ಕಾರಣವಾದ ಮಾದರಿಗಳನ್ನು ಮಾಡೆಲ್ ಕಲಿಯುತ್ತದೆ ಎಂಬ ಭರವಸೆಯಲ್ಲಿ, ಅವರು ಪ್ರತಿಯೊಂದು ಪಾಸ್ ಆಗುವ ರನ್ ಅನ್ನು ತರಬೇತಿ ಪೂಲ್ಗೆ ಸೇರಿಸುತ್ತಾರೆ.
ಈ ಕಲ್ಪನೆಯು ತಿಂಗಳುಗಟ್ಟಲೆ ಸಾಫ್ಟ್ವೇರ್-ಎಂಜಿನಿಯರಿಂಗ್ (SWE) ಏಜೆಂಟ್ಗಳ ದೊಡ್ಡ ಪ್ರಮಾಣದ ಡೇಟಾ ಸಂಗ್ರಹಣೆಗೆ ಮಾರ್ಗದರ್ಶನ ನೀಡಿದೆ. ಇದರ ತರ್ಕವು ಸರಿಯಾಗಿ ಕಾಣುತ್ತದೆ: "pass" ಎಂದರೆ ಏಜೆಂಟ್ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಿದೆ ಎಂದರ್ಥ, ಆದ್ದರಿಂದ ಆ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಲು ಕಾರಣವಾದ ನೀತಿಗಳನ್ನು (policies) ಈ ಎಪಿಸೋಡ್ ಬಲಪಡಿಸ
SWE-Prime ತರಬೇತಿ ಡೇಟಾಕ್ಕಾಗಿ ಬೈನರಿ “passed the test” ಎಂಬ ಫ್ಲಾಗ್ ಒಂದು ವಿಶ್ವಾಸಾರ್ಹವಲ್ಲದ ಫಿಲ್ಟರ್ ಆಗಿರುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಅಸ್ತವ್ಯಸ್ತವಾದ ಸಂಚಿಕೆಗಳು, ಅನಗತ್ಯ ಟೂಲ್ ಕರೆಗಳು ಮತ್ತು ಅತ್ಯಂತ ಸುಲಭವಾದ ರನ್ಗಳನ್ನು ತೆಗೆದುಹಾಕುವ ಮೂಲಕ, ಡೆವಲಪರ್ಗಳು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಜೊತೆಗೆ ಹೆಚ್ಚು ಸಮರ್ಥ ಮತ್ತು ದಕ್ಷ ಏಜೆಂಟ್ಗಳನ್ನು ತರಬೇತಿಗೊಳಿಸಬಹುದು. ಪಾಠವು ಸ್ಪಷ್ಟವಾಗಿದೆ: ಪ್ರಮಾಣಕ್ಕಿಂತ ಗುಣಮಟ್ಟವೇ ಮುಖ್ಯ, ಮತ್ತು ಸ್ಮಾರ್ಟ್ AI ಏಜೆಂಟ್ಗಳ ಕಡೆಗಿನ ಹಾದಿಯು ಪ್ರತಿಯೊಂದು ಹಂತವು ವಾಸ್ತವವಾಗಿ ಏನು ಕೊಡುಗೆ ನೀಡುತ್ತದೆ ಎಂಬುದರ ಸೂಕ್ಷ್ಮ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ ಅಡಗಿದೆ.
