Fine-tuning ಮತ್ತು RAG ಬಗ್ಗೆ ಪ್ರತಿಯೊಬ್ಬರಿಗೂ ತಮ್ಮದೇ ಆದ ಅಭಿಪ್ರಾಯವಿದೆ. ಯಾವುದೇ AI ಫೋರಂ ಅನ್ನು ಸ್ಕ್ರೋಲ್ ಮಾಡಿ ನೋಡಿದರೆ, ಆರ್ಕಿಟೆಕ್ಚರ್ ಡಯಾಗ್ರಾಮ್‌ಗಳು ಮತ್ತು ಬೆಂಚ್‌ಮಾರ್ಕ್ ವಾದಗಳಿಂದ ತುಂಬಿದ ತೀವ್ರ ಚರ್ಚೆಗಳು ನಿಮಗೆ ಸಿಗುತ್ತವೆ. ಆ ಕಾಮೆಂಟ್‌ಗಳನ್ನು ಬರೆಯುವ ಹೆಚ್ಚಿನ ಜನರಿಗೆ ತಮ್ಮ ಸ್ವಂತ ಡೇಟಾದ ಮೇಲೆ ಮಾಡೆಲ್ ಅನ್ನು ತರಬೇತಿಗೊಳಿಸುವುದು ಅಥವಾ ಪ್ರೊಡಕ್ಷನ್‌ನಲ್ಲಿ RAG ಪೈಪ್‌ಲೈನ್ ಹೇಗೆ ಸುಮ್ಮನೆ ವಿಫಲವಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ನೋಡಿರುವುದು ಕೂಡ ಇರುವುದಿಲ್ಲ.

ನಾನು ತಿಂಗಳುಗಟ್ಟಲೆ ಪ್ರಯೋಗಗಳನ್ನು ನಡೆಸಿದೆ. ನಿಖರವಾಗಿ ಹೇಳಬೇಕೆಂದರೆ ಹನ್ನೆರಡು ಪ್ರಯೋಗಗಳು. ನಾನು LLMಗಳನ್ನು fine-tune ಮಾಡಿದೆ. embeddersಗಳನ್ನು fine-tune ಮಾಡಿದೆ. ನಾನು ಆರು ವಿಭಿನ್ನ RAG ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳನ್ನು ನಿರ್ಮಿಸಿದೆ. ವಿಷಯವು ಹಣಕಾಸಿನ ಮುನ್ಸೂಚನೆಯಾಗಿತ್ತು (financial prediction), ವಿಶೇಷವಾಗಿ ಅಸ್ತವ್ಯಸ್ತವಾದ ಐತಿಹಾಸಿಕ ಡೇಟಾದಿಂದ ಗೊಂದಲಮಯ ಮಾರುಕಟ್ಟೆ ಫಲಿತಾಂಶಗಳನ್ನು ಮುನ್ಸೂಚಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದೆ. ನಾನು ನೈಜ ಉತ್ತರಗಳನ್ನು ಬಯಸಿದ್ದರಿಂದ, ಬ್ಲಾಗ್ ಪೋಸ್ಟ್ ವಾದಗಳಿಗಾಗಿ ಅಲ್ಲದೆ, ಕಟ್ಟುನಿಟ್ಟಾದ ಸಾಂಖ್ಯಿಕ ಮಾನದಂಡಗಳನ್ನು (statistical standards) ಅನುಸರಿಸಿದೆ.

ಹೆಚ್ಚಿನ ಪ್ರಯೋಗಗಳು ವಿಫಲವಾದವು. ಆ ವೈಫಲ್ಯಗಳು ಯಾವುದೇ ಅದೃಷ್ಟದ ಯಶಸ್ಸಿಗಿಂತ ಹೆಚ್ಚು ಉಪಯುಕ್ತವೆಂದು ತಿಳಿದುಬಂದವು.

ಸಿಗ್ನಲ್ (Signal) ಬಗ್ಗೆ ಕಠಿಣ ಸತ್ಯ

ವಿಷಯದ ಆಳಕ್ಕೆ ಹೋಗುವ ಮೊದಲು, ಎಲ್ಲವನ್ನೂ ಒಂದುಗೂಡಿಸುವ ಪಾಠ ಇಲ್ಲಿದೆ. Fine-tuning ಮತ್ತು RAG ಎಂಬವು ಮಾಡೆಲ್ ಏನನ್ನು ತಿಳಿಯುತ್ತದೆ ಅಥವಾ ಏನನ್ನು ನೋಡುತ್ತದೆ ಎಂಬುದನ್ನು ಬದಲಾಯಿಸುವ ಸಾಧನಗಳಾಗಿವೆ. ಅವು ಶೂನ್ಯದಿಂದ ಸಿಗ್ನಲ್ ಅನ್ನು ಸೃಷ್ಟಿಸುವ ಮಾಂತ್ರಿಕ ದಂಡಗಳಲ್ಲ. ನಿಮ್ಮ ಮೂಲ ಡೇಟಾದಲ್ಲಿ ನೈಜವಾದ, ಬಳಸಬಹುದಾದ ಮಾದರಿ (pattern) ಇಲ್ಲದಿದ್ದರೆ, ಈ ತಂತ್ರಗಳು ಅದನ್ನು ಸೃಷ್ಟಿಸುವುದಿಲ್ಲ. ಅವು ಕೇವಲ ಯಾದೃಚ್ಛಿಕ ಶಬ್ದದ (random noise) ಸುತ್ತ ಹೆಚ್ಚು ನಂಬಲರ್ಹವಾದ ಕಥೆಯನ್ನು ಕಟ್ಟಲು ನಿಮಗೆ ಸಹಾಯ ಮಾಡುತ್ತವೆ ಅಷ್ಟೆ.

ಹಣಕಾಸಿನ ಮುನ್ಸೂಚನೆಯಲ್ಲಿ, ಈ ಬಲೆ ವಿಶೇಷವಾಗಿ ಅಪಾಯಕಾರಿಯಾಗಿದೆ. ಮಾರುಕಟ್ಟೆಗಳು ವಿನ್ಯಾಸದಂತೆಯೇ ಗೊಂದಲಮಯವಾಗಿರುತ್ತವೆ (noisy). ನೀವು ಒಂದು ಶಕ್ತಿಯುತವಾದ LLM ಅನ್ನು ಐತಿಹಾಸಿಕ ಬೆಲೆ ಡೇಟಾದೊಂದಿಗೆ ಜೋಡಿಸಿ, ಅದಕ್ಕೆ retrieval ಅಥವಾ fine-tuning ಅನ್ನು ಸೇರಿಸಿದಾಗ, ನಿಮಗೆ ತಾನಾಗಿಯೇ ಹೆಚ್ಚಿನ ಲಾಭ (edge) ಸಿಗುವುದಿಲ್ಲ. ಬದಲಾಗಿ, ನೀವು ಕಾಯಿನ್ ಫ್ಲಿಪ್‌ಗಳನ್ನು (coin flips) ಸಮರ್ಥಿಸಿಕೊಳ್ಳಲು ಹೆಚ್ಚು ಸ್ಪಷ್ಟವಾದ ಮಾರ್ಗವನ್ನು ಪಡೆಯುತ್ತೀರಿ ಅಷ್ಟೆ. ಸಿಗ್ನಲ್ ಇಲ್ಲದಿದ್ದರೆ, ಮಾಡೆಲ್ ನಿಮಗೆ ಸುಳ್ಳು ಹೇಳುವಲ್ಲಿ ತುಂಬಾ ಚತುರವಾಗುತ್ತದೆ. ನೀವು ಮೊದಲು ಅದನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗುತ್ತದೆ.

ದೊಡ್ಡ ಮಾಡೆಲ್‌ಗಳು ಕಲಿಯುವ ಬದಲು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವಾಗ

ಸ್ಕೇಲ್ (scale) ಎಲ್ಲವನ್ನೂ ಸರಿಪಡಿಸುತ್ತದೆ ಎಂದು ಭಾವಿಸುವುದು ನನ್ನ ಮೊದಲ ದೊಡ್ಡ ತಪ್ಪಾಗಿತ್ತು. ನಾನು ಸರಿಯಾಗಿ 777 ತರಬೇತಿ ಉದಾಹರಣೆಗಳ ಮೇಲೆ 14 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ಅನ್ನು 7 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ವಿರುದ್ಧ ಪರೀಕ್ಷಿಸಿದೆ. ದೊಡ್ಡ ಮಾಡೆಲ್ ಗಮನಾರ್ಹವಾಗಿ ಉತ್ತಮವಾದ eval_loss ಅನ್ನು ಸಾಧಿಸಿತು. ಅದರ perplexity ಕಡಿಮೆಯಾಯಿತು. ಕಾಗದದ ಮೇಲೆ ಅದು ಕಲಿಯುತ್ತಿತ್ತು.

ನಂತರ ನಾನು ವಿನ್ ರೇಟ್ (win rate) ಅನ್ನು ನೋಡಿದೆ, ಅಂದರೆ ಮಾಡೆಲ್ ಎಷ್ಟು ನಿಖರವಾಗಿ ಮುನ್ಸೂಚನೆ ನೀಡಿತು ಎಂಬುದು. 14B ಮಾಡೆಲ್ 7B ಮಾಡೆಲ್ ಗಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಕೆಟ್ಟ ಪ್ರದರ್ಶನ ನೀಡಿತು. ಅದು ತರಬೇತಿಯ ನಾಯ್ಸ್ ಅನ್ನು (training noise) ನೆನಪಿಟ್ಟುಕೊಂಡಿತ್ತು (memorized). 3,000 ಕ್ಕಿಂತ ಕಡಿಮೆ ಉದಾಹರಣೆಗಳೊಂದಿಗೆ, ದೊಡ್ಡ ಮಾಡೆಲ್ ಡೇಟಾದಲ್ಲಿನ ಕೃತಕ ಸಂಬಂಧಗಳು (spurious correlations) ಮತ್ತು ಯಾದೃಚ್ಛಿಕ ಏರಿಳಿತಗಳ ಮೇಲೆ overfit ಆಗಲು ಸಾಕಷ್ಟು ಸಾಮರ್ಥ್ಯವನ್ನು ಹೊಂದಿತ್ತು. ಅದು ಮೂಲತಃ ನಾಯ್ಸ್‌ನ ಒಂದು ಲುಕ್ಅಪ್ ಟೇಬಲ್ ಅನ್ನು ನಿರ್ಮಿಸಿತು.

ತನ್ನ ಸಣ್ಣ ಸಾಮರ್ಥ್ಯದಿಂದಾಗಿ, 7B ಮಾಡೆಲ್ ವಿಶಾಲವಾದ ಮಾದರಿಗಳನ್ನು ಕಲಿಯಲು ಒತ್ತಾಯಿಸಲ್ಪಟ್ಟಿತು. ಅದು ಪ್ರತಿಯೊಂದು ವಿಶಿಷ್ಟತೆಯನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳಲು ಸಾಧ್ಯವಾಗಲಿಲ್ಲ. ನೀವು ಸಣ್ಣ ಡೇಟಾ ಸೆಟ್‌ಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದರೆ, ಸಣ್ಣ ಮಾಡೆಲ್‌ಗಳಿಂದ ಪ್ರಾರಂಭಿಸಿ. ಡೇಟಾ ಕಡಿಮೆ ಇದ್ದಾಗ ಸ್ಕೇಲ್ ನಿಮ್ಮನ್ನು ಸಕ್ರಿಯವಾಗಿ ಹಾನಿಗೊಳಿಸಬಹುದು.

ಲಾಸ್ ಕರ್ವ್ (Loss Curve) ಅನ್ನು ನಂಬಬೇಡಿ

ಲಾಸ್ ಕರ್ವ್‌ಗಳನ್ನು ದಿಟ್ಟಿಸಿ ನೋಡುವುದನ್ನು ನಿಲ್ಲಿಸುವುದನ್ನು ನಾನು ಕಲಿತೆ. ಒಂದು ಮಾಡೆಲ್ ತನ್ನ ಟೋಕನ್-ಮಟ್ಟದ cross-entropy ಅನ್ನು ಸುಧಾರಿಸಿಕೊಳ್ಳಬಹುದು, ಆದರೆ ನೀವು ಕಾಳಜಿ ವಹಿಸುವ ನೈಜ ವ್ಯವಹಾರದ ನಿರ್ಧಾರದಲ್ಲಿ ಅದು ಕಳಪೆ ಪ್ರದರ್ಶನ ನೀಡಬಹುದು. ಇದು ಭಾಷಾ ಮಾದರಿ ಲಾಸ್ (language modeling loss) ಮುಂದಿನ ಟೋಕನ್ ಅನ್ನು ನಿಖರವಾಗಿ ಮುನ್ಸೂಚಿಸುವುದಕ್ಕೆ ಬಹುಮಾನ ನೀಡುತ್ತದೆ ಎಂಬ ಕಾರಣದಿಂದ ಹೀಗಾಗುತ್ತದೆ. ಅನೇಕ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ, ವಿಶೇಷವಾಗಿ ಹಣಕಾಸಿನಲ್ಲಿ, ಸರಿಯಾದ ನಿರ್ಧಾರ ಮತ್ತು ಅತ್ಯಂತ ಸಂಭವನೀಯ ಮುಂದಿನ ಟೋಕನ್ ಒಂದೇ ಆಗಿರುವುದಿಲ್ಲ.

ತರಬೇತಿಯ ಗದ್ಯವನ್ನು (prose) ಸುಂದರವಾಗಿ ಪುನರಾವರ್ತಿಸುವ ಆದರೆ ಪ್ರತಿ ಬಾರಿಯೂ ತಪ್ಪು ದಿಕ್ಕಿನ ಬೆಟ್ (directional bet) ಮಾಡುವ ಮಾಡೆಲ್‌ಗಳನ್ನು ನಾನು ನೋಡಿದ್ದೇನೆ. ಲಾಸ್ ಕಡಿಮೆಯಾಯಿತು. ಅದರೊಂದಿಗೆ ಬ್ಯಾಂಕ್‌ರೋಲ್ (bankroll) ಕೂಡ ಕಡಿಮೆಯಾಯಿತು. ನೈಜ ಪ್ರಪಂಚದ ಕಾರ್ಯದ ಆಧಾರದ ಮೇಲೆ ನಿಮ್ಮ ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವನ್ನು (evaluation metric) ಆರಿಸಿ. ನೀವು ದಾಖಲೆಗಳನ್ನು ಶ್ರೇಣೀಕರಿಸುತ್ತಿದ್ದರೆ (ranking documents), ಶ್ರೇಣೀಕರಣದ ಗುಣಮಟ್ಟವನ್ನು ಅಳೆಯಿರಿ. ನೀವು ಫಲಿತಾಂಶಗಳನ್ನು ಮುನ್ಸೂಚಿಸುತ್ತಿದ್ದರೆ, ನಿರ್ಧಾರದ ನಿಖರತೆಯನ್ನು ಅಳೆಯಿರಿ. eval_loss ಅನ್ನು ನಿಮ್ಮ ಮಾಡೆಲ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಎಂದಿಗೂ ಬಿಡಬೇಡಿ.

Fine-Tuning ಕೇವಲ ಅಪರಿಚಿತ ಶಬ್ದಕೋಶದ ಮೇಲೆ ಮಾತ್ರ ಮಿಂಚುತ್ತದೆ

ನಾನು ಎರಡು ವಿಭಿನ್ನ ಪಠ್ಯ ಪ್ರಕಾರಗಳ ಮೇಲೆ embedder fine-tuning ಪ್ರಯೋಗಗಳನ್ನು ನಡೆಸಿದೆ. ಮೊದಲನೆಯದು ಪ್ರಮಾಣಿತ ಹಣಕಾಸಿನ ಸುದ್ದಿ ಮತ್ತು ಸಾರ್ವಜನಿಕ ದಾಖಲೆಗಳನ್ನು ಬಳಸಿತು. fine-tuned embedder ಮತ್ತು ಆಫ್-ದಿ-ಶೆಲ್ಫ್ (off-the-shelf) ಆವೃತ್ತಿ ಎರಡೂ ಒಂದೇ ರೀತಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸಿದವು. ಮೂಲ ಮಾಡೆಲ್‌ಗೆ ಈಗಾಗಲೇ ಈ ಭಾಷೆ ತಿಳಿದಿತ್ತು. ನಾನು ಪರಿಚಿತ ನೆಲದಲ್ಲಿ fine-tuning ಮಾಡುತ್ತಿದ್ದೆ.

ಎರಡನೇ ಡೇಟಾ ಸೆಟ್ ಖಾಸಗಿ ಜಾರ್ಗನ್ (jargon), ಆಂತರಿಕ ಕೋಡ್‌ನೆಮ್‌ಗಳು ಮತ್ತು ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಸಂಕ್ಷಿಪ್ತ ರೂಪಗಳಿಂದ ತುಂಬಿತ್ತು, ಇವು ಎಂದಿಗೂ ಮುಕ್ತ ಇಂಟರ್ನೆಟ್‌ನಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುವುದಿಲ್ಲ. ಇಲ್ಲಿ, fine-tuning ರಿಟ್ರಿவல் ನಿಖರತೆಯನ್ನು (retrieval accuracy) ಶೇಕಡಾ 79 ರಷ್ಟು ಸುಧಾರಿಸಿತು. ಮೂಲ ಮಾಡೆಲ್‌ಗೆ ಈ ಪದಗಳ ಅರ್ಥವೇ ತಿಳಿದಿರಲಿಲ್ಲ. Fine-tuning ಅದಕ್ಕೆ ಸ್ಥಳೀಯ ಶಬ್ದಕೋಶವನ್ನು ಕಲಿಸಿತು.

ಇದು ಇಡೀ ಅಭ್ಯಾಸವನ್ನು ನನ್ನ ದೃಷ್ಟಿಕೋನದಲ್ಲಿ ಬದಲಾಯಿಸಿತು. Fine-tuning ಎಂದರೆ ಮಾಡೆಲ್ ಅನ್ನು ಸಾಮಾನ್ಯ ಅರ್ಥದಲ್ಲಿ ಹೆಚ್ಚು ಬುದ್ಧಿವಂತ ಮಾಡುವುದು ಎಂದಲ್ಲ. ಇದು ಅದಕ್ಕೆ ಹೊಸ ಶಬ್ದಕೋಶ, ಹೊಸ ಫಾರ್ಮ್ಯಾಟ್ ಅಥವಾ ಒಂದು ನಿರ್ದಿಷ್ಟ ಶೈಲಿಯನ್ನು ಕಲಿಸುವುದರ ಬಗ್ಗೆ ಆಗಿದೆ. ನಿಮ್ಮ ಡೇಟಾ ಇಂಟರ್ನೆಟ್‌ನಂತೆ ಕಂಡರೆ, fine-tune ಅನ್ನು ಬಿಟ್ಟುಬಿಡಿ. ನಿಮ್ಮ ಡೇಟಾ ಮೂಲ ಮಾಡೆಲ್ ಎಂದೂ ನೋಡಿರದ ಭಾಷೆಯಲ್ಲಿ ಮಾತನಾಡುತ್ತಿದ್ದರೆ, fine-tuning ಅತ್ಯಗತ್ಯವಾಗುತ್ತದೆ.

RAG ನಿಮಗೆ ಖಚಿತತೆಯನ್ನು ನೀಡುತ್ತದೆ, ಸತ್ಯವನ್ನಲ್ಲ

ನಾನು ಮುನ್ಸೂಚನಾ ಕಾರ್ಯಗಳಿಗಾಗಿ (prediction tasks) ಎಂಟು ಪ್ರತ್ಯೇಕ RAG ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳನ್ನು ಪರೀಕ್ಷಿಸಿದೆ. ಒಟ್ಟಾರೆಯಾಗಿ ಹೇಳುವುದಾದರೆ, ರಿಟ್ರಿವಲ್ (retrieval) ಅನ್ನು ಸೇರಿಸುವುದರಿಂದ ಮಾಡೆಲ್‌ನ ನಿರ್ಧಾರಗಳಲ್ಲಿ ಸುಮಾರು ಶೇಕಡಾ 30 ರಷ್ಟು ಬದಲಾವಣೆಗಳಾದವು. ಇದು ಪ್ರಭಾವಶಾಲಿಯಾದಂತೆ ಕೇಳಿಸುತ್ತದೆ. ಆದರೆ ಅದು ಅಷ್ಟಾಗಿ ಪ್ರಭಾವಶಾಲಿಯಾಗಿರಲಿಲ್ಲ. ಆ ಬದಲಾವಣೆಗಳು ಕೇವಲ ಗೊಂದಲ (noise) ಆಗಿದ್ದವು. ಒಟ್ಟಾರೆ ನಿಖರತೆ (accuracy) ಸುಧಾರಿಸಲಿಲ್ಲ. ಬದಲಾದದ್ದು ಮಾತ್ರ ಮಾಡೆಲ್‌ನ ಆತ್ಮವಿಶ್ವಾಸ (confidence). RAG ವ್ಯವಸ್ಥೆಯನ್ನು ಹೆಚ್ಚು ಖಚಿತವಾಗಿ ಮಾತನಾಡುವಂತೆ ಮಾಡಿತು, ಹೆಚ್ಚು ಮೂಲಗಳನ್ನು (sources) ಉಲ್ಲೇಖಿಸುವಂತೆ ಮಾಡಿತು ಮತ್ತು ದೀರ್ಘವಾದ ಸಮರ್ಥನೆಗಳನ್ನು ನೀಡುವಂತೆ ಮಾಡಿತು. ಆದರೆ ಅದು ಮೊದಲಿನಂತೆಯೇ ತಪ್ಪುಗಳನ್ನೇ ಮಾಡುತ್ತಿತ್ತು.

ಈ ಅತಿಯಾದ ಆತ್ಮವಿಶ್ವಾಸವು ಉತ್ಪನ್ನದ ಅಪಾಯವಾಗಿದೆ (product risk). ಬಳಕೆದಾರರು ಉಲ್ಲೇಖಗಳನ್ನು (citations) ನೋಡಿದಾಗ ಮಾಡೆಲ್ ತನ್ನ ಕೆಲಸವನ್ನು ಸರಿಯಾಗಿ ಮಾಡಿದೆ ಎಂದು ಭಾವಿಸುತ್ತಾರೆ. ವಾಸ್ತವದಲ್ಲಿ, ಅದು ಕೇವಲ ಸಂಕೀರ್ಣವಾಗಿ ಕಾಣುವ ಅಂದಾಜನ್ನು (guesswork) ಮಾಡುತ್ತಿತ್ತು.

ಅತ್ಯಂತ ಕಠಿಣವಾದ ಪಾಠವು ಒಂದು RAG ರೂಪಾಂತರದ (variant) ಬ್ಯಾಕ್‌ಟೆಸ್ಟಿಂಗ್‌ನಿಂದ ಬಂದಿತು. ಅದು ಶೇಕಡಾ 11 ರಷ್ಟು ವಾರ್ಷಿಕ ಲಾಭವನ್ನು ತೋರಿಸಿತು. ಮೇಲ್ನೋಟಕ್ಕೆ, ಇದು ಗೆಲ್ಲುವ ತಂತ್ರದಂತೆ ಕಾಣುತ್ತದೆ. ಆದರೆ ಅದರ AUC (area under the ROC curve ಮತ್ತು ವರ್ಗೀಕರಣ ಕೌಶಲ್ಯದ ಅಳತೆ), 0.486 ಆಗಿತ್ತು. ಇದು 0.500 ಇರುವ ನಾಣ್ಯದ ಎಸೆಯುವಿಕೆಯ (coin flip) ಫಲಿತಾಂಶಕ್ಕಿಂತಲೂ ಕೆಟ್ಟದಾಗಿದೆ. ಆ ಲಾಭವು ನಿರ್ದಿಷ್ಟ ಮಾರುಕಟ್ಟೆಯ ಅವಧಿಯ ಒಂದು ಕಾಕತಾಳೀಯತೆಯೇ ಹೊರತು, ಪುನರಾವರ್ತಿತ ಅನುಕೂಲವಲ್ಲ. ಕೇವಲ P&L ಅನ್ನು ಅಳತೆಗೋಲಾಗಿ (metric) ಬಳಸುವುದು ಅಪಾಯಕಾರಿ. ಮಾರುಕಟ್ಟೆಗಳು ಯಾವಾಗಲೂ ಅದೃಷ್ಟದ ಕ್ಷಣಗಳನ್ನು ನೀಡುತ್ತಿರುತ್ತವೆ. ಕಾಕತಾಳೀಯತೆ ಮತ್ತು ಸಾಮರ್ಥ್ಯವನ್ನು ಪ್ರತ್ಯೇಕಿಸಲು ನಿಮಗೆ ಸಾಂಖ್ಯಿಕ ಕೌಶಲ್ಯದ ಅಳತೆಗೋಲುಗಳು (statistical skill metrics) ಬೇಕಾಗುತ್ತವೆ.

ಪ್ರತಿಯೊಂದು ಸಾಧನವು ವಾಸ್ತವವಾಗಿ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿಯಿರಿ

ಹಾಗಾದರೆ ಇದು ನಮ್ಮನ್ನು ಎಲ್ಲಿಗೆ ತರುತ್ತದೆ? ಮಾಡೆಲ್ ಹೊಸ ಪದಗಳನ್ನು, ನಿರ್ದಿಷ್ಟ ಫಾರ್ಮ್ಯಾಟ್‌ಗಳನ್ನು ಅಥವಾ ವಿಶಿಷ್ಟ ಶೈಲಿಯನ್ನು ಕಲಿಯಬೇಕಾದಾಗ fine-tuning ಬಳಸಿ. ಮಾಡೆಲ್‌ಗೆ ಸತ್ಯಾಂಶಗಳು (facts), ಕೋಡ್ ರೆಪೊಸಿಟರಿಗಳು (code repositories) ಅಥವಾ ಅದರ ತೂಕಗಳಿಗಿಂತ (weights) ಹೊರಗಿರುವ ಸಾಂಸ್ಥಿಕ ನೆನಪುಗಳಿಗೆ (institutional memory) ಪ್ರವೇಶ ಬೇಕಾದಾಗ RAG ಬಳಸಿ. ಯಾವುದೇ ಸಂಕೇತವಿಲ್ಲದ (signal) ದತ್ತಾಂಶದಲ್ಲಿ ಸಂಕೇತವನ್ನು ಹುಡುಕಲು ಈ ಎರಡೂ ಸಾಧನಗಳನ್ನು ಬಳಸಬೇಡಿ. ಮೂಲಭೂತ ಮಾದರಿ (pattern) ಇಲ್ಲದಿದ್ದರೆ, ರಿಟ್ರಿವಲ್ ಮತ್ತು fine-tuning ಕೇವಲ ಗೊಂದಲವನ್ನು (noise) ಅಚ್ಚುಕಟ್ಟಾಗಿ ತೋರಿಸಲು ಮಾತ್ರ ಸಹಾಯ ಮಾಡುತ್ತವೆ.

ನಿಜವಾದ ಅಡಚಣೆ

fine-tuning ಮತ್ತು RAG ಗಾಗಿ ಮೂಲಸೌಕರ್ಯವನ್ನು (infrastructure) ಸ್ಥಾಪಿಸುವುದು ಹಿಂದೆಂದಿಗಿಂತಲೂ ಸುಲಭವಾಗಿದೆ. ನೀವು ಒಂದು ಮಧ್ಯಾಹ್ನದಲ್ಲಿ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಸಿದ್ಧಪಡಿಸಬಹುದು. ತಂತ್ರಜ್ಞಾನವು ಈಗ ಅಡಚಣೆಯಲ್ಲ. ಮೌಲ್ಯಮಾಪನವೇ (Evaluation) ಅಡಚಣೆಯಾಗಿದೆ. ಹೆಚ್ಚಿನ ತಂಡಗಳು ಕಠಿಣವಾದ ಸಾಂಖ್ಯಿಕ ಕೆಲಸವನ್ನು ಬಿಟ್ಟುಬಿಡುತ್ತವೆ ಮತ್ತು ಬದಲಾಗಿ ವ್ಯರ್ಥ ಅಳತೆಗೋಲುಗಳನ್ನು (vanity metrics) ಸಂಭ್ರಮಿಸುತ್ತವೆ. ಅವರು ಬುದ್ಧಿವಂತವಾಗಿ ಕೇಳಿಸುವ ಆದರೆ ಮೌನವಾಗಿ ವಿಫಲವಾಗುವ ವ್ಯವಸ್ಥೆಗಳನ್ನು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಾರೆ.

ಹಣ ಖರ್ಚು ಮಾಡುವ ಮೊದಲು ಪ್ರಾಮಾಣಿಕ ಪರೀಕ್ಷೆಗಳನ್ನು ನಡೆಸಿ. ನಿಮ್ಮ ಅಳತೆಗೋಲುಗಳನ್ನು ಪ್ರಶ್ನಿಸಿ. overfitting ಇದೆಯೇ ಎಂದು ಪರಿಶೀಲಿಸಿ. ಮಾಡೆಲ್ ನಿಜವಾಗಿಯೂ ಉತ್ತಮವಾಗಿದೆಯೇ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ,