ಪರೀಕ್ಷೆಯನ್ನು ಹೇಗೆ ರೂಪಿಸಲಾಯಿತು
ಲೇಖಕರು ಎರಡು ಪಾವತಿ-ನಿಯಮಾವಳಿ (payment-rulebook) ದಾಖಲೆಗಳ ಸುತ್ತ ಒಂದು ಸಣ್ಣ ರಿಟ್ರಿವಲ್-ಆಗ್ಮೆಂಟೆಡ್ ಜನರೇಷನ್ (RAG) ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸಿದರು ಮತ್ತು ಎರಡು ಪರಿசோதனೆಗಳನ್ನು ನಡೆಸಿದರು:
- ರಿಕಾಲ್ ಪರೀಕ್ಷೆ (Recall test) – ಸರಿಯಾದ ಪುಟವು ಮೊದಲ ಐದು ಫಲಿತಾಂಶಗಳಲ್ಲಿ ಕಂಡುಬಂದಿತೇ? ಫಲಿತಾಂಶ: 60 %.
- ಉತ್ತರ ಪರೀಕ್ಷೆ (Answer test) – ಜನರೇಟರ್ ನೀಡಿದ ಅಂತಿಮ ಉತ್ತರ ಸರಿಯಾಗಿದೆಯೇ? ಫಲಿತಾಂಶ: 90 %.
40 % ಅಂತರವು ಅಸಾಧ್ಯವಾಗಿ ಕಂಡಿತು. ರಿಟ್ರೈವರ್ ಹತ್ತು ಬಾರಿ ಪರೀಕ್ಷಿಸಿದಾಗ ನಾಲ್ಕು ಬಾರಿ ಸರಿಯಾದ ಪುಟವನ್ನು ತಪ್ಪಿಸಿಕೊಂಡರೆ, ಮಾಡೆಲ್ ಹತ್ತು ಬಾರಿ ಪರೀಕ್ಷಿಸಿದಾಗ ಒಂಬತ್ತು ಬಾರಿ ಸರಿಯಾಗಿ ಹೇಗೆ ಉತ್ತರಿಸಲು ಸಾಧ್ಯ?
ರಿಟ್ರೈವರ್ ಅನ್ನು "ಸರಿಪಡಿಸಲು" ಮಾಡಿದ ಮೊದಲ ಪ್ರಯತ್ನಗಳು
ಡೆವಲಪರ್ ಎರಡು ಸಾಮಾನ್ಯ ತಂತ್ರಗಳನ್ನು ಪ್ರಯತ್ನಿಸಿದರು:
- ಹೈಬ್ರಿಡ್ ಸರ್ಚ್ (Hybrid search) – ಲೆಕ್ಸಿಕಲ್ ಮತ್ತು ವೆಕ್ಟರ್ ಸಿಗ್ನಲ್ಗಳನ್ನು ಮಿಶ್ರಣ ಮಾಡುವುದು. ರಿಕಾಲ್ ಬದಲಾಗಲಿಲ್ಲ.
- ರೀರಾಂಕರ್ (Reranker) – ಪಡೆದ ಐದು ಪುಟಗಳನ್ನು ಮರುಕ್ರಮಗೊಳಿಸುವುದು. ರಿಕಾಲ್ 70 % ಗೆ ಏರಿತು ಆದರೆ 90 % ಉತ್ತರ ನಿಖರತೆಯ ಹಿಂದೆ ಉಳಿದುಕೊಂಡಿತು.
ಈ ಎರಡೂ ಪರಿಕರಗಳು ಈಗಾಗಲೇ ಪಡೆದ ಮಾಹಿತಿಯನ್ನು ಮರುಕ್ರಮಗೊಳಿಸುತ್ತವೆ ಅಷ್ಟೆ; ಅಭ್ಯರ್ಥಿ ಸೆಟ್ನಲ್ಲಿ (candidate set) ಎಂದಿಗೂ ಸೇರದ ಪುಟವನ್ನು ಅವು ಸೃಷ್ಟಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಸಮಸ್ಯೆ ಬೇರೆ ಕಡೆ ಇತ್ತು.
ಮಾಡೆಲ್ ಅಲ್ಲ, ಮೆಟ್ರಿಕ್ (ಮಾಪಕ) ತಪ್ಪಾಗಿತ್ತು
ಯಶಸ್ಸನ್ನು ಪುಟದ ಲೇಬಲ್ ಮೂಲಕ ನಿರ್ಧರಿಸುವ ಬದಲು, ಲೇಖಕರು ರಿಟ್ರೀವ್ ಮಾಡಿದ ಚಂಕ್ಗಳಲ್ಲಿನ (chunks) ವಾಸ್ತವಿಕ ಸತ್ಯಗಳನ್ನು ಪರಿಶೀಲಿಸಿದರು. ನಾಲ್ಕು "ತಪ್ಪುಗಳ" ಪೈಕಿ ಮೂರರಲ್ಲಿ, ಸರಿಯಾದ ಸತ್ಯವು ಇತ್ತು, ಆದರೆ ಅದು ಪರೀಕ್ಷಾ ಸ್ಕ್ರಿಪ್ಟ್ ನಿರೀಕ್ಷಿಸಿದ ಪುಟಕ್ಕಿಂತ ಬೇರೆ ಪುಟದಲ್ಲಿತ್ತು. ಅನಿರೀಕ್ಷಿತ ಪುಟದಲ್ಲಿ ಸರಿಯಾದ ಉತ್ತರವನ್ನು ಕಂಡಿದ್ದಕ್ಕಾಗಿ ಇವಲ್ಯೂಯೇಶನ್ (evaluation) ವ್ಯವಸ್ಥೆಯು ರಿಟ್ರೈವರ್ ಅನ್ನು ದಂಡಿಸಿತು.
ಮೆಟ್ರಿಕ್ ಅನ್ನು "ಯಾವುದೇ ರಿಟ್ರೀವ್ ಮಾಡಿದ ಚಂಕ್ ಅಗತ್ಯವಾದ ಸತ್ಯವನ್ನು ಒಳಗೊಂಡಿದೆಯೇ?" ಎಂದು ಬದಲಾಯಿಸಿದಾಗ, ರಿಕಾಲ್ 90 % ಗೆ ಏರಿತು ಮತ್ತು ಉತ್ತರ ನಿಖರತೆಗೆ ಸಮಾನವಾಯಿತು. ರಿಟ್ರೈವರ್ ಸರಿಯಾಗಿ ಕೆಲಸ ಮಾಡ了; ಇವಲ್ಯೂಯೇಶನ್ ಫ್ರೇಮ್ವರ್ಕ್ ಕೆಲಸ ಮಾಡಲಿಲ್ಲ.
ಸಾಂಪ್ರದಾಯಿಕ ರಿಕಾಲ್ ಏಕೆ ದಾರಿತಪ್ಪಿಸಬಹುದು
- ಪುಟ ಮಟ್ಟದ ಲೇಬಲಿಂಗ್ ಸುಳ್ಳು ವೈಫಲ್ಯಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಒಂದು ಸತ್ಯವು ಹಲವಾರು ಪುಟಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳಬಹುದು. ಕೇವಲ ಒಂದು ಪುಟವನ್ನು ಮಾತ್ರ 'ಗ್ರೌಂಡ್ ಟ್ರೂತ್' (ground truth) ಎಂದು ಟ್ಯಾಗ್ ಮಾಡುವುದು, ಉಳಿದ ಎಲ್ಲಾ ಸರಿಯಾದ ಫಲಿತಾಂಶಗಳನ್ನು ತಪ್ಪುಗಳೆಂದು ಪರಿಗಣಿಸುತ್ತದೆ.
- ಸಣ್ಣ ಕಾರ್ಪರಾಗಳು (corpora) ಪರಿಣಾಮವನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ. ಕಡಿಮೆ ದಾಖಲೆಗಳಿದ್ದಾಗ, ಒಂದು ತಪ್ಪಾಗಿ ಲೇಬಲ್ ಮಾಡಿದ ಪುಟವು ಉತ್ತರ ನಿಖರತೆಯು ಸ್ಥಿರವಾಗಿದ್ದರೂ ರಿಕಾಲ್ ಅನ್ನು ತೀವ್ರವಾಗಿ ಬದಲಾಯಿಸಬಹುದು.
- ಎಂಬೆಡ್ಡಿಂಗ್ ನಾಯ್ಸ್ (Embedding noise) ಸತ್ಯಗಳನ್ನು ಮರೆಮಾಚುತ್ತದೆ. ವೆಕ್ಟರ್ ಇಡೀ ಪುಟಗಳಿಗೆ ಸ್ಕೋರ್ ನೀಡುತ್ತದೆ; ಸುತ್ತಮುತ್ತಲಿನ ಕಾನೂನು ಅಥವಾ ತಾಂತ್ರಿಕ ಪಠ್ಯವು ಗುರಿ ವಾಕ್ಯದ ಪ್ರಸ್ತುತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಸತ್ಯವು ಇದ್ದರೂ ಸಹ ಆ ಪುಟವು ರ್ಯಾಂಕಿಂಗ್ನಲ್ಲಿ ಕೆಳಕ್ಕೆ ತಳ್ಳಲ್ಪಡುತ್ತದೆ.
RAG ವೃತ್ತಿಪರರಿಗೆ ಪ್ರಾಯೋಗಿಕ ಸಲಹೆಗಳು
- ರ್ಯಾಂಕಿಂಗ್ ಅನ್ನು ರಿಟ್ರೈವಲ್ ವೈಫಲ್ಯಗಳಿಂದ ಪ್ರತ್ಯೇಕಿಸಿ. ರೀರಾಂಕರ್ಗಳು ಮೊದಲನೆಯದನ್ನು ಮಾತ್ರ ಸರಿಪಡಿಸುತ್ತವೆ; ಸರಿಯಾದ ಚಂಕ್ ಅಭ್ಯರ್ಥಿ ಸೆಟ್ಗೆ ಬರದಿದ್ದರೆ, ಮರುಕ್ರಮಗೊಳಿಸುವುದು ಯಾವುದೇ ಪ್ರಯೋಜನ ನೀಡುವುದಿಲ್ಲ.
- ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ಸತ್ಯದ ಮಟ್ಟದಲ್ಲಿ (fact level) ಲೇಬಲ್ ಮಾಡಿ. ಪ್ರತಿ ಕ್ವೇರಿಯನ್ನು ಕೇವಲ ಒಂದು ದಾಖಲೆಯ ಗುರುತಿಗೆ (document identifier) ಜೋಡಿಸದೆ, ಅದಕ್ಕೆ ಅಗತ್ಯವಿರುವ ನಿರ್ದಿಷ್ಟ ಮಾಹಿತಿಯೊಂದಿಗೆ ಜೋಡಿಸಿ.
- ಸಣ್ಣ ಡೇಟಾ ಸೆಟ್ಗಳಿಗೆ ದೊಡ್ಡ ಪ್ರಮಾಣದ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳನ್ನು ನಂಬಬೇಡಿ. ಸಣ್ಣ, ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಕಾರ್ಪರಾಗಳು ವಿಭಿನ್ನವಾಗಿ ವರ್ತಿಸುತ್ತವೆ ಮತ್ತು ಸಾಮಾನ್ಯ ರಿಕಾಲ್ ಸ್ಕೋರ್ಗಳು ದಾರಿತಪ್ಪಿಸಬಹುದು.
- ಎಂಬೆಡ್ಡಿಂಗ್ ಗ್ರ್ಯಾನುಲಾರಿಟಿಯನ್ನು (granularity) ಗಮನಿಸಿ. ಪುಟದ ಗಾತ್ರದ ಚಂಕ್ನಲ್ಲಿ ಅನೇಕ ಪದಗಳಿರುತ್ತವೆ ಮತ್ತು ಸುತ್ತಮುತ್ತಲಿನ ಕಾನೂನು ಪಠ್ಯವು ನೀವು ಹುಡುಕುತ್ತಿರುವ ಸತ್ಯದ ರ್ಯಾಂಕ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು.
ಸಾರಾಂಶ: ಇವಲ್ಯೂಯೇಶನ್ ಕಾರ್ಯಕ್ಕೆ ಹೊಂದಿಕೆಯಾಗದಿದ್ದಾಗ, ಹೆಚ್ಚಿನ ಉತ್ತರ ನಿಖರತೆಯ ಸ್ಕೋರ್ ಮತ್ತು ಕಡಿಮೆ ಸಾಂಪ್ರದಾಯಿಕ ರಿಕಾಲ್ ಅಂಕಿಅಂಶಗಳು ಏಕಕಾಲದಲ್ಲಿ ಇರಬಹುದು. ಮಾಡೆಲ್ ಬದಲಿಗೆ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಸರಿಪಡಿಸುವುದು ಸಮಯವನ್ನು ಉಳಿಸುತ್ತದೆ, ಸುಳ್ಳು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹ RAG ನಿಯೋಜನೆಗಳನ್ನು ನೀಡುತ್ತದೆ.
