ಒಬ್ಬ ಡೆವಲಪರ್ನ RAG ಪ್ರೊಟೊಟೈಪ್ 0.50 ಕ್ಕಿಂತ ಕಡಿಮೆ ಇರುವ ಯಾವುದೇ ಕೋಸೈನ್ ಸಿಮಿಲಾರಿಟಿ (cosine similarity) ಹೊಂದಿರುವ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಲು ನಿರಾಕರಿಸಿತು. ಎಂಬೆಡ್ಡಿಂಗ್ ಮಾಡೆಲ್ ಅನ್ನು ಬದಲಾಯಿಸುವವರೆಗೆ ಅದು ಅಚ್ಚುಕಟ್ಟಾಗಿ ಕೆಲಸ ಮಾಡಿತು. ಆದರೆ ನಂತರದ ಗಾರ್ಡ್ ತಪ್ಪು ಉತ್ತರಗಳನ್ನು ಯಾವುದೇ ಎಚ್ಚರಿಕೆಯಿಲ್ಲದೆ ಬಿಟ್ಟುಬಿಟ್ಟಿತು. ಹಾರ್ಡ್-ಕೋಡೆಡ್ ಸಿಮಿಲಾರಿಟಿ ಥ್ರೆಶೋಲ್ಡ್ (similarity threshold) ಮಾಡೆಲ್ಗಳ ನಡುವೆ ಕುಸಿಯಬಹುದು ಎಂಬುದು ಈ ಘಟನೆಯಿಂದ ಸಾಬೀತಾಗಿದೆ; ಇದು ಸುರಕ್ಷತಾ ತಪಾಸಣೆಗಾಗಿ ಎಂಬೆಡ್ಡಿಂಗ್ ಸಿಮಿಲಾರಿಟಿಯನ್ನು ಅವಲಂಬಿಸಿರುವ ಯಾವುದೇ ಸಿಸ್ಟಮ್ಗೆ ಇರುವ ದೊಡ್ಡ ಅಪಾಯವಾಗಿದೆ.
ಥ್ರೆಶೋಲ್ಡ್ ಏಕೆ ಮುಖ್ಯವಾಗಿತ್ತು
Retrieval-augmented generation (RAG) ಪೈಪ್ಲೈನ್ಗಳು ಹೆಚ್ಚಾಗಿ ಸಿಮಿಲಾರಿಟಿ ಗಾರ್ಡ್ ಅನ್ನು ಬಳಸುತ್ತವೆ: ಒಂದು ಪ್ರಶ್ನೆ ಮತ್ತು ಅದರ ಹತ್ತಿರದ ಡಾಕ್ಯುಮೆಂಟ್ ನಡುವಿನ ಕೋಸೈನ್ ಸಿಮಿಲಾರಿಟಿ ನಿಗದಿತ ಸಂಖ್ಯೆಗಿಂತ ಕಡಿಮೆಯಿದ್ದರೆ, ಸಿಸ್ಟಮ್ ಉತ್ತರವನ್ನು ನೀಡುವುದನ್ನು ನಿಲ್ಲಿಸುತ್ತದೆ. ರಿಟ್ರೀವ್ ಮಾಡಲಾದ ಸಂದರ್ಭವು (context) ದುರ್ಬಲವಾಗಿದ್ದಾಗ, ಮಾಡೆಲ್ ತಪ್ಪು ಮಾಹಿತಿ (hallucinating) ನೀಡುವುದನ್ನು ಈ ಗಾರ್ಡ್ ತಡೆಯುತ್ತದೆ. ಮೂಲ ಸೆಟಪ್ನಲ್ಲಿ, 0.50 ಥ್ರೆಶೋಲ್ಡ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ನಿಖರವಾಗಿರಿಸಿತ್ತು—ಉತ್ತರ ನೀಡಲಾಗದ ಪ್ರಶ್ನೆಗಳು ಈ ಮಿತಿಗಿಂತ ಕೆಳಗೆ ಮತ್ತು ಉತ್ತರಿಸಬಹುದಾದ ಪ್ರಶ್ನೆಗಳು ಇದರ ಮೇಲಿರುತ್ತಿದ್ದವು.
ಎಂಬೆಡ್ಡಿಂಗ್ ಬ್ಯಾಕೆಂಡ್ ಬದಲಾದಾಗ, ಅದೇ 0.50 ಮಿತಿಯು ಈ ಎರಡು ಗುಂಪುಗಳನ್ನು ಪ್ರತ್ಯೇಕಿಸಲು ಸಾಧ್ಯವಾಗಲಿಲ್ಲ. ಯಾವುದೇ ಕ್ರ್ಯಾಶ್ ಅಥವಾ ಸ್ಪಷ್ಟ ಎರರ್ ಇಲ್ಲದೆಯೇ ಪೈಪ್ಲೈನ್ ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ಕೂಡಿದ, ಆದರೆ ತಪ್ಪು ಉತ್ತರಗಳನ್ನು ನೀಡಲು ಪ್ರಾರಂಭಿಸಿತು. ಈ ವೈಫಲ್ಯವು ಸಾಮಾನ್ಯ ರ್ಯಾಂಕಿಂಗ್ ಮೆಟ್ರಿಕ್ಸ್ಗಳಲ್ಲಿ ಪತ್ತೆಯಾಗಲಿಲ್ಲ ಮತ್ತು ಒಬ್ಬ ಮನುಷ್ಯ ಈ ವ್ಯತ್ಯಾಸವನ್ನು ಗಮನಿಸಿದಾಗ ಮಾತ್ರ ತಿಳಿಯಿತು.
ಜಿಯೋಮೆಟ್ರಿ ಸಾರ್ವತ್ರಿಕವಲ್ಲ
ಪ್ರತಿಯೊಂದು ಎಂಬೆಡ್ಡಿಂಗ್ ಮಾಡೆಲ್ ಭಾಷೆಯನ್ನು ತನ್ನದೇ ಆದ ಜಿಯೋಮೆಟ್ರಿಯೊಂದಿಗೆ ಹೈ-ಡಿಮೆಂಷನಲ್ ಸ್ಪೇಸ್ಗೆ ಮ್ಯಾಪ್ ಮಾಡುತ್ತದೆ. ಆದ್ದರಿಂದ ಕೋಸೈನ್ ಸಿಮಿಲಾರಿಟಿ ಮೌಲ್ಯಗಳು ಮಾಡೆಲ್ನಿಂದ ಮಾಡೆಲ್ಗೆ ಬೇರೆ ಬೇರೆಯಾಗಿರುತ್ತವೆ. 0.50 ಸ್ಕೋರ್ ಒಂದು ಮಾಡೆಲ್ಗೆ ಸ್ಪಷ್ಟ ಅಂತರದ ಅಂಚಿನಲ್ಲಿರಬಹುದು ಮತ್ತು ಇನ್ನೊಂದಕ್ಕೆ ಅತಿಕ್ರಮಣದ (overlap) ಮಧ್ಯಭಾಗದಲ್ಲಿರಬಹುದು.
- Voyage-3 – 0.50 ರ ಗೆರೆಯು ಕಡಿಮೆ ಸ್ಕೋರ್ ಹೊಂದಿರುವ ಉತ್ತರಿಸಲಾಗದ ಪ್ರಶ್ನೆಗಳು ಮತ್ತು ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಹೊಂದಿರುವ ಉತ್ತರಿಸಬಹುದಾದ ಪ್ರಶ್ನೆಗಳ ನಡುವೆ ಇರುತ್ತದೆ. ಗಾರ್ಡ್ ಉದ್ದೇಶಿತವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ.
- BGE-Small – ಅನೇಕ ಉತ್ತರಿಸಲಾಗದ ಪ್ರಶ್ನೆಗಳು 0.50 ಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಪಡೆಯುತ್ತವೆ, ಆದ್ದರಿಂದ ಗಾರ್ಡ್ ಎಂದಿಗೂ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದಿಲ್ಲ. ಮಿತಿಯನ್ನು 0.70 ಕ್ಕೆ ಏರಿಸುವುದರಿಂದ ಸುರಕ್ಷತಾ ಮಾರ್ಜನ್ ಮರುಸ್ಥಾಪನೆಯಾಗುತ್ತದೆ.
- Hashing-64 – ಉತ್ತರಿಸಬಹುದಾದ ಮತ್ತು ಉತ್ತರಿಸಲಾಗದ ಪ್ರಶ್ನೆಗಳ ಸ್ಕೋರ್ಗಳು ಎಷ್ಟು ನಿಕಟವಾಗಿ ಬೆರೆತಿವೆ ಎಂದರೆ ಯಾವುದೇ ಸಿಂಗಲ್ ಥ್ರೆಶೋಲ್ಡ್ ಅವುಗಳನ್ನು ಪ್ರತ್ಯೇಕಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ; ಈ ಮಾಡೆಲ್ ಸಿಮಿಲಾರಿಟಿ ಗಾರ್ಡ್ ಅನ್ನು ಬೆಂಬಲಿಸಲು ಅತಿ ದುರ್ಬಲವಾಗಿದೆ.
ಈ ಪ್ರಕರಣಗಳು ಒಂದು ವಿಶಾಲವಾದ ಸತ್ಯವನ್ನು ವಿವರಿಸುತ್ತವೆ: ಥ್ರೆಶೋಲ್ಡ್ ಎಂಬುದು ನಿರ್ದಿಷ್ಟ ಮಾಡೆಲ್-ಡೇಟಾ ಜೋಡಿಗೆ ಸೇರಿದ್ದೇ ಹೊರತು, ಅದು ಸಾರ್ವತ್ರಿಕ ನಿಯಮವಲ್ಲ.
ಕಾನ್ಸ್ಟಂಟ್ನ ಅಡಗಿರುವ ವೆಚ್ಚ
ಸಿಮಿಲಾರಿಟಿ ಥ್ರೆಶೋಲ್ಡ್ಗಳು ಅನೇಕ ಡೌನ್ಸ್ಟ್ರೀಮ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಕಂಡುಬರುತ್ತವೆ:
- semantic caching
- duplicate detection
- document relevance checks
- entity matching
ಒಂದು ಸ್ಥಿರ ಮೌಲ್ಯವನ್ನು (constant value) ಬಳಸುವುದು ಎಂದರೆ ಎಲ್ಲಾ ಎಂಬೆಡ್ಡಿಂಗ್ ಮಾಡೆಲ್ಗಳು ಒಂದೇ ರೀತಿಯ ಸ್ಕೋರ್ ಡಿಸ್ಟ್ರಿಬ್ಯೂಷನ್ ಅನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತವೆ ಎಂದು ಭಾವಿಸುವುದು—ಇದು ಅಪಾಯಕಾರಿ ಊಹೆ. ಈ ಊಹೆ ತಪ್ಪಾದಾಗ, ಸಿಸ್ಟಮ್ಗಳು ಸುಮ್ಮನೆ ತಪ್ಪು-ಆತ್ಮವಿಶ್ವಾಸದ ಔಟ್ಪುಟ್ ನೀಡುತ್ತವೆ, ಇದು ಬಳಕೆದಾರರ ನಂಬಿಕೆಯನ್ನು ಕುಸಿಯುವಂತೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಡೌನ್ಸ್ಟ್ರೀಮ್ ನಿರ್ಧಾರಗಳಿಗೆ ತಪ್ಪು ಡೇಟಾವನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಪ್ರತಿ ಮಾಡೆಲ್ಗೆ ಅನುಗುಣವಾಗಿ ಗಾರ್ಡ್ಗಳನ್ನು ಕ್ಯಾಲಿಬ್ರೇಟ್ ಮಾಡುವುದು
ಇದರ ಪರಿಹಾರ ಸರಳವಾಗಿದೆ: ಎಂದಿಗೂ ಹಾರ್ಡ್-ಕೋಡೆಡ್ ಕಾನ್ಸ್ಟಂಟ್ ಅನ್ನು ಬಳಸಬೇಡಿ. ಥ್ರೆಶೋಲ್ಡ್ ಅನ್ನು ಪ್ರತಿ ಹೊಸ ಎಂಬೆಡ್ಡಿಂಗ್ ಮಾಡೆಲ್ಗೆ ಟ್ಯೂನ್ ಮಾಡಬೇಕಾದ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್ (hyper-parameter) ಆಗಿ ಪರಿಗಣಿಸಿ.
- ಉತ್ತರಿಸಬಹುದಾದ ಮತ್ತು ಉತ್ತರಿಸಲಾಗದ ಎರಡೂ ರೀತಿಯ ಪ್ರಶ್ನೆಗಳನ್ನು ಒಳಗೊಂಡ ಸಣ್ಣ, ಲೇಬಲ್ ಮಾಡಲಾದ ವ್ಯಾಲಿಡೇಶನ್ ಸೆಟ್ ಅನ್ನು ಸಿದ್ಧಪಡಿಸಿ.
- ಟಾರ್ಗೆಟ್ ಮಾಡೆಲ್ ಬಳಸಿ ಪ್ರತಿ ಪ್ರಶ್ನೆ-ಡಾಕ್ಯುಮೆಂಟ್ ಜೋಡಿಯ ಕೋಸೈನ್ ಸಿಮಿಲಾರಿಟಿಗಳನ್ನು ಲೆಕ್ಕಹಾಕಿ.
- ಎರಡು ಡಿಸ್ಟ್ರಿಬ್ಯೂಷನ್ಗಳನ್ನು ಪ್ಲಾಟ್ ಮಾಡಿ ಅಥವಾ ಫಾಲ್ಸ್-ಕಾನ್ಫಿಡೆಂಟ್ ರೇಟ್ ಅನ್ನು ಲೆಕ್ಕಹಾಕಿ—ಅಂದರೆ ಅನ್ವಯವಾಗುವ ಥ್ರೆಶೋಲ್ಡ್ಗಿಂತ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ ಹೊಂದಿರುವ ಉತ್ತರಿಸಲಾಗದ ಪ್ರಶ್ನೆಗಳ ಪ್ರಮಾಣ.
- ಫಾಲ್ಸ್-ಕಾನ್ಫಿಡೆಂಟ್ ರೇಟ್ ಅನ್ನು ಸ್ವೀಕಾರಾರ್ಹ ಅಪಾಯದ ಮಟ್ಟಕ್ಕಿಂತ ಕಡಿಮೆ ಇರಿಸುವ ಅತ್ಯಂತ ಕಡಿಮೆ ಸಿಮಿಲಾರಿಟಿ ಮೌಲ್ಯವನ್ನು ಆರಿಸಿ.
ಗುರಿಯು ಅತಿಯಾದ ಆತ್ಮವಿಶ್ವಾಸವನ್ನು ತಡೆಯುವುದಾಗಿರುವುದರಿಂದ, ಮೀನ್ ರೆಸಿಪ್ರೋಕಲ್ ರ್ಯಾಂಕ್ (MRR) ನಂತಹ ಸಾಂಪ್ರದಾಯಿಕ ರ್ಯಾಂಕಿಂಗ್ ಮೆಟ್ರಿಕ್ಗಳು ಸಾಕಾಗುವುದಿಲ್ಲ. ಫಾಲ್ಸ್-ಕಾನ್ಫಿಡೆಂಟ್ ರೇಟ್ ಗಾರ್ಡ್ನ ವೈಫಲ್ಯದ ವಿಧಾನವನ್ನು ನೇರವಾಗಿ ಅಳೆಯುತ್ತದೆ.
ವಿರೋಧಾತ್ಮಕ ವಾದ: "ಕೆಲವು ಮಾಡೆಲ್ಗಳು ತಕ್ಷಣವೇ ಕೆಲಸ ಮಾಡುತ್ತವೆ"
ಉದಾಹರಣೆಯಲ್ಲಿರುವ Voyage-3 ನಂತಹ ಕೆಲವು ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಮಾಡೆಲ್ಗಳು 0.50 ಗಾರ್ಡ್ನೊಂದಿಗೆ ಹೊಂದಾಣಿಕೆಯಾಗುತ್ತವೆ ಎಂಬುದು ನಿಜ. ಆದರೆ ಅದು ಭವಿಷ್ಯದ ಸ್ಥಿರತೆಯನ್ನು ಖಚಿತಪಡಿಸುವುದಿಲ್ಲ. ಮಾಡೆಲ್ ಅಪ್ಡೇಟ್ಗಳು, ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಅಥವಾ ಮೂಲ ಕಾರ್ಪಸ್ನಲ್ಲಿನ ಬದಲಾವಣೆಗಳು ಸಿಮಿಲಾರಿಟಿ ಡಿಸ್ಟ್ರಿಬ್ಯೂಷನ್ ಅನ್ನು ಬದಲಾಯಿಸಬಹುದು, ಇದು ಗಾರ್ಡ್ ಅನ್ನು ಮತ್ತೆ ಮುರಿಯಬಹುದು. ಕೇವಲ ಒಂದು ಅದೃಷ್ಟದ ಹೊಂದಾಣಿಕೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುವುದು ನಿರ್ಲಕ್ಷ್ಯಕ್ಕೆ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತದೆ.
ಮುಂದೆ ಗಮನಿಸಬೇಕಾದವುಗಳು
-
-
-
ಮುಖ್ಯ ಅಂಶ
ಸಿಮಿಲಾರಿಟಿ ಥ್ರೆಶೋಲ್ಡ್ ಎಂಬುದು ಸಾರ್ವತ್ರಿಕ ಸುರಕ್ಷತಾ ಸ್ವಿಚ್ ಅಲ್ಲ; ಇದು ಮಾಡೆಲ್-ನಿರ್ದಿಷ್ಟ ಗಾರ್ಡ್ ಆಗಿದೆ, ಇದನ್ನು ನೀವು ಪ್ರತಿ ಬಾರಿ ಎಂಬೆಡ್ಡಿಂಗ್ ಬ್ಯಾಕೆಂಡ್ ಅಥವಾ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸಿದಾಗ ಕ್ಯಾಲಿಬ್ರೇಟ್ ಮಾಡಲೇಬೇಕು. ಈ ಸತ್ಯವನ್ನು ನಿರ್ಲಕ್ಷಿಸುವುದು RAG ಸಿಸ್ಟಮ್ಗಳು ಸುಮ್ಮನೆ ಹ್ಯಾಲ್ಯುಸಿನೇಶನ್ (hallucination) ಸ್ಥಿತಿಗೆ ತಲುಪಲು ಬಿಡುತ್ತದೆ, ಇದು ಗಾರ್ಡ್ನ ಮೂಲ ಉದ್ದೇಶವನ್ನೇ ಹಾಳುಮಾಡುತ್ತದೆ. ಮುನ್ನಡೆಯಲು ಏಕೈಕ ವಿಶ್ವಾಸಾರ್ಹ ಮಾರ್ಗವೆಂದರೆ ವ್ಯವಸ್ಥಿತವಾಗಿ ಪ್ರತಿ ಮಾಡೆಲ್ಗೆ ಕ್ಯಾಲಿಬ್ರೇಶನ್ ಮಾಡುವುದು ಮತ್ತು ಫಾಲ್ಸ್-ಕಾನ್ಫಿಡೆಂಟ್ ರೇಟ್ ಅನ್ನು ನಿರಂತರವಾಗಿ ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು.
