ಸಂಶೋಧನಾ ತಂಡವು ಇನ್ಫರೆನ್ಸ್ ವೆಚ್ಚಗಳನ್ನು (inference costs) ಕಡಿಮೆ ಮಾಡುವ ನಿರೀಕ್ಷೆಯಲ್ಲಿ, ಒಂದು ಕೋಡಿಂಗ್ ವಿನಂತಿಯನ್ನು ಕಡಿಮೆ ವೆಚ್ಚದ ಭಾಷಾ ಮಾದರಿಯು (cheap language model) ನಿರ್ವಹಿಸಬಲ್ಲದೇ ಎಂದು ನಿರ್ಧರಿಸಲು ಒಂದು ರೂಟರ್ ಅನ್ನು ನಿರ್ಮಿಸಿತು, ಆದರೆ ಆ ರೂಟರ್ "ಎಂದಿಗೂ ಎಸ್ಕಲೇಟ್ ಮಾಡದಿರುವ" (never-escalate) ಬೇಸ್‌ಲೈನ್ ಅನ್ನು ಸೋಲಿಸಲು ಸಾಧ್ಯವಾಗಲಿಲ್ಲ. ಈ ವೈಫಲ್ಯವು ನಿಖರತೆ-ಕೇಂದ್ರಿತ ಮಾಪನಗಳು (accuracy-centric metrics) ಕೇಸ್ಕೇಡ್‌ಗಳನ್ನು ಹೇಗೆ ದಾರಿ ತಪ್ಪಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ಕಷ್ಟದ ಮಟ್ಟವನ್ನು ವಾಸ್ತವವಾಗಿ ಸೆರೆಹಿಡಿಯುವ ಸಂಕೇತಗಳನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.

ರೂಟರ್ ಏಕೆ ಮುಖ್ಯವಾಗಿತ್ತು

ಮಾಡೆಲ್ ಕೇಸ್ಕೇಡ್‌ಗಳು ಪ್ರತಿಯೊಂದು ವಿನಂತಿಯನ್ನು ಅದು ಸರಿಯಾಗಿ ಉತ್ತರಿಸಬಲ್ಲ ಅತ್ಯಂತ ಸಣ್ಣ ಮಾದರಿಗೆ ಕಳುಹಿಸುತ್ತವೆ. ಒಂದು ವೇಳೆ ರೂಟರ್ ಸರಳ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಗೆ ಕಳುಹಿಸಿದರೆ, ದೊಡ್ಡ ಮಾದರಿಗೆ ಬೇಕಾಗುವ ದುಬಾರಿ ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಸಿಸ್ಟಮ್ ತಪ್ಪಿಸಿಕೊಳ್ಳುತ್ತದೆ. ಸಂಶೋಧನಾ ತಂಡವು 539 ನೈಜ ಕೋಡಿಂಗ್ ಕಾರ್ಯಗಳ ಮೇಲೆ (428 ಸುಲಭ ಮತ್ತು 111 ಕಠಿಣ) ರೂಟರ್ ಅನ್ನು ತರಬೇತಿಗೊಳಿಸಿತು, ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯು ಯಾವಾಗ ಸಾಕಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಅದು ಕಲಿಯುತ್ತದೆ ಎಂಬ ನಿರೀಕ್ಷೆಯಿತ್ತು.

ತಲುಪದ ಅಂಕಿಅಂಶಗಳು

  • Held-out AUC (area under the ROC curve): 0.594
  • 5-fold cross-validation ವ್ಯಾಪ್ತಿ: 0.55 – 0.57
  • ಅತ್ಯುತ್ತಮ ಥ್ರೆಶೋಲ್ಡ್: "ಎಂದಿಗೂ ಎಸ್ಕಲೇಟ್ ಮಾಡದಿರುವ" ನೀತಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ

Held-out AUC 0.594 ಆಗಿತ್ತು ಮತ್ತು cross-validation ವ್ಯಾಪ್ತಿಯು 0.55 ರಿಂದ 0.57 ರಷ್ಟಿತ್ತು, ಅಂದರೆ ಈ ಕ್ಲಾಸಿಫೈಯರ್ ಸುಲಭ ಮತ್ತು ಕಠಿಣ ಪ್ರಕರಣಗಳನ್ನು ಕಷ್ಟದಿಂದ ಬೇರ್ಪಡಿಸಲು ಅಸಮರ್ಥವಾಗಿದೆ. ಅತ್ಯುತ್ತಮ ಥ್ರೆಶೋಲ್ಡ್ ಯಾವ ನೀತಿಯನ್ನು ಪುನರಾವರ್ತಿಸುತ್ತದೆಯೆಂದರೆ ಅದು ದುಬಾರಿ ಮಾದರಿಯನ್ನು ಎಂದಿಗೂ ಬಳಸುವುದಿಲ್ಲ, ಅಂತಹ ಸಂದರ್ಭದಲ್ಲಿ ರೂಟರ್ ಯಾವುದೇ ಮೌಲ್ಯವನ್ನು ಸೇರಿಸುವುದಿಲ್ಲ. ಇದು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವ ಸಾಧಕವಾಗಿರದೆ, ಒಂದು ಸ್ಥಿರ ಮುನ್ಸೂಚಕದಂತೆ (constant predictor) ವರ್ತಿಸುತ್ತದೆ.

ಪ್ರಯೋಗಗಳು ಏನನ್ನು ಪರೀಕ್ಷಿಸಿದವು

ಸಂಶೋಧಕರು ಮೂರು ವೈಶಿಷ್ಟ್ಯಗಳ ಸೆಟ್‌ಗಳನ್ನು (feature sets) ಹೋಲಿಕೆ ಮಾಡಿದರು:

ವೈಶಿಷ್ಟ್ಯಗಳ ಸೆಟ್ (Feature set) AUC
11 ಸರಳ ಮೇಲ್ಮೈ ವೈಶಿಷ್ಟ್ಯಗಳು (ಉದಾಹರಣೆಗೆ, token count, keyword presence) 0.610
1024-ಆಯಾಮದ ಪ್ರಾಂಪ್ಟ್ ಎಂಬೆಡ್ಡಿಂಗ್ (semantic vector) 0.552
ಎರಡನ್ನೂ ಸಂಯೋಜಿಸಿದಾಗ 0.609

ಆಶ್ಚರ್ಯಕರವಾಗಿ, ಹೈ-ಡಿಮೆಂಷನಲ್ ಸೆಮ್ಯಾಂಟಿಕ್ ಎಂಬೆಡ್ಡಿಂಗ್‌ಗಿಂತ ಲೈಟ್‌ವೇಟ್ ಮೇಲ್ಮೈ ವೈಶಿಷ್ಟ್ಯಗಳು ಉತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡಿದವು. ಎಂಬೆಡ್ಡಿಂಗ್ ಪ್ರಾಂಪ್ಟ್‌ನ ವಿಷಯವನ್ನು ಸೆರೆಹಿಡಿಯಿತು ಆದರೆ ಅದರ ಅಂತರ್ಗತ ಕಠಿಣತೆಯನ್ನು ಅಲ್ಲ. ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯ ಡ್ರಾಫ್ಟ್ ಅನ್ನು ರೂಟರ್‌ಗೆ ಒದಗಿಸುವುದರಿಂದ AUC 0.640 ಕ್ಕೆ ಏರಿತು, ಇದು ಜನರೇಷನ್ ಸಮಯದಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ ಸಂಕೇತಗಳು ಕೇವಲ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿರುವ ಸಂಕೇತಗಳಿಗಿಂತ ಹೆಚ್ಚು ಮಾಹಿತಿಪೂರ್ಣವಾಗಿವೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ.

ಎರಡು ಮೂಲಭೂತ ತಪ್ಪುಗಳು

1. ನಿಖರತೆಯು ತಪ್ಪಾದ ಅಳತೆಗೋಲು

ರೂಟರ್ ಕೇವಲ ನಿಖರತೆಯನ್ನು ಊಹಿಸುವುದಲ್ಲದೆ, ಒಂದು ಸಾಮಾನ್ಯ ನೀತಿಯೊಂದಿಗೆ ಹೋಲಿಸಿದರೆ ವೆಚ್ಚ-ನಿಖರತೆ ಸಮತೋಲನವನ್ನು (cost-accuracy trade-off) ಸುಧಾರಿಸಬೇಕು. ಅದು "ಎಂದಿಗೂ ಎಸ್ಕಲೇಟ್ ಮಾಡದಿರುವ" ನೀತಿಯನ್ನು ಮೀರಿಸದಿದ್ದರೆ, ಕಚ್ಚಾ ನಿಖರತೆ ಎಷ್ಟೇ ಇದ್ದರೂ ಅದು ಯಾವುದೇ ವೆಚ್ಚದ ಪ್ರಯೋಜನವನ್ನು ನೀಡುವುದಿಲ್ಲ. AUC ನಂತಹ ಸಾಂಪ್ರದಾಯಿಕ ಮಾಪನಗಳು ಕೇಸ್ಕೇಡ್‌ನ ಆರ್ಥಿಕ ಆಯಾಮವನ್ನು ನಿರ್ಲಕ್ಷಿಸುತ್ತವೆ.

2. "ಯಾವಾಗಲೂ ಎಸ್ಕಲೇಟ್ ಮಾಡಿ" ಎಂಬುದು ಮೇಲ್ಮಿತಿಯಲ್ಲ

ದುಬಾರಿ ಮಾದರಿಯು ತಪ್ಪು ಮಾಡುವುದಿಲ್ಲ ಎಂದು ಪ್ರಯೋಗವು ಭಾವಿಸಿತ್ತು, ಅಂದರೆ "ಯಾವಾಗಲೂ ದೊಡ್ಡ ಮಾದರಿಯನ್ನೇ ಬಳಸಿ" ಎಂಬುದನ್ನು ಮೇಲ್ಮಿತಿಯೆಂದು ಪರಿಗಣಿಸಿತ್ತು. ವಾಸ್ತವದಲ್ಲಿ, ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯು ಸರಿಯಾಗಿ ಉತ್ತರಿಸಿದ ಪ್ರಶ್ನೆಗಳಿಗೆ ದೊಡ್ಡ ಮಾದರಿಯು ಕೆಲವೊಮ್ಮೆ ತಪ್ಪಾದ ಉತ್ತರಗಳನ್ನು ನೀಡುತ್ತಿತ್ತು. ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯೊಂದಿಗೆ ಯಾವಾಗ ಇರಬೇಕು ಎಂದು ತಿಳಿಯುವ ಪರಿಪೂರ್ಣ ರೂಟರ್, ಆಯ್ದ ವೆಚ್ಚದ ಮಾಪಕದಲ್ಲಿ "ಯಾವಾಗಲೂ ಎಸ್ಕಲೇಟ್ ಮಾಡಿ" ಎಂಬ ಬೇಸ್‌ಲೈನ್ ಅನ್ನು ಸುಮಾರು 4.2 ಪಾಯಿಂಟ್‌ಗಳಷ್ಟು ಸೋಲಿಸಬಲ್ಲದು. ಈ ಅಂತರವು ದುಬಾರಿ ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೇಲ್ಮಿತಿ ನಾವು ಊಹಿಸಿದ್ದಕ್ಕಿಂತ ಕಡಿಮೆ ಇದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ.

ಉತ್ತಮ ರೂಟಿಂಗ್ ಸಿಗ್ನಲ್‌ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸುವುದು

ಈ ಸಂಶೋಧನೆಯು ಮೂರು ಪ್ರಾಯೋಗಿಕ ದಿಕ್ಕುಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ:

  • ಜನರೇಷನ್-ಸಮಯದ ಸೂಚನೆಗಳನ್ನು ಸೇರಿಸಿ. ಕಡಿಮೆ ವೆಚ್ಚದ ಮಾದರಿಯ ಮಧ್ಯಂತರ ಔಟ್‌ಪುಟ್ ಅನ್ನು (ಅದರ ಡ್ರಾಫ್ಟ್) ರೂಟರ್‌ಗೆ ಒದಗಿಸುವುದರಿಂದ, ಕೇವಲ ಪ್ರಾಂಪ್ಟ್ ಮೂಲಕ ತಿಳಿಯಲಾಗದ ಕಠಿಣತೆಯನ್ನು ಸೆರೆಹಿಡಿಯಬಹುದು.
  • ಕಾರ್ಯ-ನಿರ್ದಿಷ್ಟ ಮೇಲ್ಮೈ ವೈಶಿಷ್ಟ್ಯಗಳಿಗೆ ಆದ್ಯತೆ ನೀಡಿ. ಉದ್ದ, ಕೆಲವು ಆಪರೇಟರ್‌ಗಳ ಇರುವಿಕೆ ಅಥವಾ ಕೋಡ್-ಸ್ಟೈಲ್ ಮಾರ್ಕರ್‌ಗಳಂತಹ ಸರಳ ಮಾಪನಗಳು ಸಾಮಾನ್ಯ ಸೆಮ್ಯಾಂಟಿಕ್ ಎಂಬೆಡ್ಡಿಂಗ್‌ಗಳಿಗಿಂತ ಹೆಚ್ಚು ನಿಖರವಾದ ಮುನ್ಸೂಚನೆ ನೀಡಬಲ್ಲವು.
  • ವೆಚ್ಚ-ಅರಿವಿರುವ ಮಾಪನಗಳೊಂದಿಗೆ ಯಶಸ್ಸನ್ನು ಅಳೆಯಿರಿ. ಕೇವಲ ನಿಖರತೆ ಅಥವಾ AUC ಬದಲಿಗೆ, ಗುರಿ ಮಟ್ಟದ ಗುಣಮಟ್ಟವನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುವಾಗ ಎಷ್ಟು ದುಬಾರಿ ಕರೆಗಳನ್ನು (expensive calls) ತಪ್ಪಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ.

ಸಾರಾಂಶ: ಕೇವಲ ನಿಖರತೆಗಾಗಿ ಆಪ್ಟಿಮೈಸ್ ಮಾಡುವ ರೂಟರ್ ವೆಚ್ಚ ಉಳಿತಾಯವನ್ನು ಖಚಿತಪಡಿಸುವುದಿಲ್ಲ; ಪರಿಣಾಮಕಾರಿ ರೂಟಿಂಗ್ ಮಾಡಲು ಜನರೇಷನ್-ಸಮಯದ ಪುರಾವೆಗಳು ಮತ್ತು ವೆಚ್ಚ-ಅರಿವಿರುವ ಮೌಲ್ಯಮಾಪನ ಅಗತ್ಯವಿದೆ.