ಹೊಸ "Attention Sink Detector" ಎಂಬ ಸಾಧನವು, ಲಾರ್ಜ್-ಲ್ಯಾಂಗ್ವೇಜ್-ಮಾಡೆಲ್ (LLM) ಇನ್ಫರೆನ್ಸ್‌ನ ಪ್ರಿಫಿಲ್ (prefill) ಹಂತದಲ್ಲಿ ಹೆಚ್ಚಿನ ಅಟೆನ್ಷನ್ ಮಾಸ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುವ ಟೋಕನ್‌ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುತ್ತದೆ. ಕೀ-ವ್ಯಾಲ್ಯೂ (KV) ಕ್ಯಾಶ್‌ನಿಂದ ಈ ಸಿಂಕ್ ಟೋಕನ್‌ಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದರಿಂದ ಮಾಡೆಲ್‌ನ ಕಾರ್ಯಕ್ಷಮತೆ ಕುಸಿಯುತ್ತದೆ ಎಂದು ಈ ಸಾಧನವು ತೋರಿಸುತ್ತದೆ, ಇದು ಸ್ಥಿರವಾದ ಜನರೇಷನ್‌ಗಾಗಿ ಅವುಗಳನ್ನು ಅತ್ಯಗತ್ಯ ಆಂಕುರ್‌ಗಳನ್ನಾಗಿ (anchors) ಮಾಡುತ್ತದೆ.

ಪ್ರಿಫಿಲ್ ಹಂತ ಏಕೆ ಮುಖ್ಯ

ಹೆಚ್ಚಿನ LLM ಸಂಶೋಧನೆಗಳು ಟೋಕನ್-ಬೈ-ಟೋಕನ್ ಜನರೇಷನ್ ಲೂಪ್ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸುತ್ತವೆ, ಆದರೆ ಮೊದಲ ಟೋಕನ್‌ಗಿಂತ ಮೊದಲು ನಡೆಯುವ ಕೆಲಸ—ಅಂದರೆ ಪ್ರಿಫಿಲ್ (prefill)—ಮುಂದೆ ನಡೆಯುವ ಎಲ್ಲದಕ್ಕೂ ಅಡಿಪಾಯ ಹಾಕುತ್ತದೆ. ಪ್ರಿಫಿಲ್ ಸಮಯದಲ್ಲಿ ಮಾಡೆಲ್ ಇಡೀ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ, KV ಕ್ಯಾಶ್ ಅನ್ನು ನಿರ್ಮಿಸುತ್ತದೆ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಸ್ಥಾನದಲ್ಲಿ ಅಟೆನ್ಷನ್ ಅನ್ನು ಹರಡುತ್ತದೆ. ಅಟೆನ್ಷನ್ ತೂಕಗಳನ್ನು (weights) ಉತ್ಪಾದಿಸುವ ಸಾಫ್ಟ್‌ಮ್ಯಾಕ್ಸ್ (softmax) ಮೊತ್ತವು 1 ಆಗಿರಲೇಬೇಕು என்பதால், ಮಾಡೆಲ್ "ಏನೂ ಸಹ ಪ್ರಸ್ತುತವಿಲ್ಲ" ಎಂದು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ. ಅದು ಉಳಿದಿರುವ ಸಂಭವನೀಯತೆಯ ಮಾಸ್ ಅನ್ನು ಸುಲಭವಾಗಿ ನಿರ್ವಹಿಸಬಹುದಾದ ಒಂದು ಟೋಕನ್ ಮೇಲೆ ಹಾಕುತ್ತದೆ, ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಸರಣಿಯ ಮೊದಲ ಟೋಕನ್ ಆಗಿರುತ್ತದೆ. ಆ ಟೋಕನ್ ಅಟೆನ್ಷನ್ ಸಿಂಕ್ (attention sink) ಆಗಿ ಬದಲಾಗುತ್ತದೆ.

ಅಟೆನ್ಷನ್ ಸಿಂಕ್ ಎಂದರೇನು, ಸರಳವಾಗಿ ಹೇಳುವುದರೆ

ಒಂದು ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ನಲ್ಲಿ, ಪ್ರತಿ ಹೆಡ್ (head) ಪ್ರತಿಯೊಂದು ಟೋಕನ್ ಜೋಡಿಯಿಗಾಗಿ ಒಂದು ತೂಕವನ್ನು (weight) ಲೆಕ್ಕಾಚಾರ ಮಾಡುತ್ತದೆ. ವಿತರಣೆಯು (distribution) ಅತಿಯಾಗಿ ಏರುಪೇರಾದಾಗ, ಒಂದು ಟೋಕನ್ ಅತಿಯಾದ ಅಟೆನ್ಷನ್ ತೂಕವನ್ನು ಪಡೆಯಬಹುದು. ಈ ವಿದ್ಯಮಾನವು ಯಾವುದೇ ದೋಷವಲ್ಲ (bug); ಇದು ಸಾಫ್ಟ್‌ಮ್ಯಾಕ್ಸ್ ನಿರ್ಬಂಧದಿಂದ ಉಂಟಾಗುತ್ತದೆ. ಮೊದಲ ಟೋಕನ್ (ಅದು ಹೆಚ್ಚಾಗಿ ವಾಕ್ಯದ ಆರಂಭದ ಮಾರ್ಕರ್ ಆಗಿರುತ್ತದೆ) ಬೇರೆಲ್ಲಿಯೂ ನೀಡಲಾಗದ ಉಳಿದ ಸಂಭವನೀಯತೆಗಾಗಿ ಒಂದು "ರಿಲೀಸ್ ವಾಲ್ವ್" ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.

KV-ಕ್ಯಾಶ್ ನಿರ್ವಹಣೆಯಲ್ಲಿನ ಪರಿಣಾಮಗಳು

KV ಕ್ಯಾಶ್‌ಗಳು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲಾದ ಪ್ರತಿಯೊಂದು ಟೋಕನ್‌ಗಾಗಿ ಕೀ (key) ಮತ್ತು ವ್ಯಾಲ್ಯೂ (value) ವೆಕ್ಟರ್‌ಗಳನ್ನು ಸಂಗ್ರಹಿಸುತ್ತವೆ, ಇದು ಜನರೇಷನ್ ಸಮಯದಲ್ಲಿ ವೇಗವಾಗಿ ಹುಡುಕಲು (look-ups) ಸಹಾಯ ಮಾಡುತ್ತದೆ. ದೀರ್ಘ-ಸಂದರ್ಭದ (long-context) ಸನ್ನಿವೇಶಗಳಲ್ಲಿ, ಬಳಕೆದಾರರು GPU ಮೆಮೊರಿ ಮಿತಿಯೊಳಗೆ ಇರಲು ಕ್ಯಾಶ್ ಅನ್ನು ಪ್ರೂನ್ (prune) ಮಾಡುತ್ತಾರೆ. "ಅಮೂಲ್ಯವಲ್ಲದ" ಎಂದು ತೋರುವ ಟೋಕನ್‌ಗಳನ್ನು ಅಸಂಗತವಾಗಿ ಡಿಲೀಟ್ ಮಾಡುವುದು ಮಾಡೆಲ್ ಅವಲಂಬಿಸಿರುವ ಸಿಂಕ್‌ಗಳನ್ನೇ ಡಿಲೀಟ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಇದರಿಂದ ಕಾರ್ಯಕ್ಷಮತೆ ಕುಸಿಯುತ್ತದೆ ಎಂದು ಹೊಸ ಡಿಟೆಕ್ಟರ್ ತೋರಿಸುತ್ತದೆ. ಕ್ಯಾಶ್‌ನಲ್ಲಿ ಸಿಂಕ್ ಟೋಕನ್‌ಗಳನ್ನು ಸ್ಥಿರವಾಗಿರಿಸುವುದು ಮಾಡೆಲ್‌ನ ಆಂತರಿಕ ಸಮತೋಲನವನ್ನು ಕಾಪಾಡುತ್ತದೆ ಮತ್ತು ಜನರೇಷನ್ ಅನ್ನು ಸ್ಥಿರವಾಗಿಡುತ್ತದೆ.

ಡಿಟೆಕ್ಟರ್ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ

  • Eager attention: ಈ ಅನುಷ್ಠಾನವು ಪೂರ್ಣ ಅಟೆನ್ಷನ್ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಅನ್ನು ಕುಗ್ಗಿಸುವ FlashAttention ನಂತಹ ಫಾಸ್ಟ್ ಕರ್ನಲ್‌ಗಳನ್ನು ಬೈಪಾಸ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಬದಲಾಗಿ ಪ್ರತಿ ಹೆಡ್‌ಗಾಗಿ ರಾಗ (raw) ಅಟೆನ್ಷನ್ ಸ್ಕೋರ್‌ಗಳನ್ನು ದಾಖಲಿಸುತ್ತದೆ.
  • Layer-wide aggregation: ಪ್ರತಿ ಟೋಕನ್‌ಗೆ ಒಂದೇ ಅಟೆನ್ಷನ್-ಮಾಸ್ ಪ್ರೊಫೈಲ್ ಅನ್ನು ಉತ್ಪಾದಿಸಲು ಎಲ್ಲಾ ಲೇಯರ್‌ಗಳು ಮತ್ತು ಹೆಡ್‌ಗಳಾದ್ಯಂತ ಸ್ಕೋರ್‌ಗಳನ್ನು ಸರಾಸರಿ ಮಾಡಲಾಗುತ್ತದೆ.
  • Log-median absolute deviation (MAD): ಅಟೆನ್ಷನ್ ತೂಕಗಳು ವಿಪರೀತವಾಗಿ ಏರುಪೇರಾಗಿರುವುದರಿಂದ (right-skewed), ಸರಳ ಮಾ mean-standard-deviation ಪರೀಕ್ಷೆಯು ಸಾಮಾನ್ಯ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಔಟ್‌ಲೈಯರ್‌ಗಳೆಂದು ತಪ್ಪಾಗಿ ವರ್ಗೀಕರಿಸಬಹುದು. ತೂಕಗಳನ್ನು ಲಾಗ್-ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮ್ ಮಾಡುವುದು ವಿತರಣೆಯನ್ನು ನಾರ್ಮಲೈಸ್ ಮಾಡುತ್ತದೆ; ನಂತರ MAD ಅನ್ನು ಅನ್ವಯಿಸುವುದರಿಂದ ಅತಿಯಾದ ಅಟೆನ್ಷನ್ ಮಾಸ್ ಹೊಂದಿರುವ ಟೋಕನ್‌ಗಳನ್ನು ಗುರುತಿಸಬಹುದು.

ಪತ್ತೆಯಾದ ಎರಡು ರೀತಿಯ ಸಿಂಕ್‌ಗಳು

  1. True sinks – ಪ್ರಾಂಪ್ಟ್‌ನ ವಿಷಯ ಏನೇ ಇರಲಿ, ವಾಕ್ಯದ ಆರಂಭದ (BOS) ಟೋಕನ್ ಸತತವಾಗಿ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಅಟೆನ್ಷನ್ ಅನ್ನು ಹೀರಿಕೊಳ್ಳುತ್ತದೆ.
  2. Structural sinks – ChatML ನಲ್ಲಿ ಬಳಸುವ ಮಾರ್ಕರ್‌ಗಳಂತಹ (<im_start>, <im_end>) ಸಿಸ್ಟಮ್-ಮಟ್ಟದ ಪ್ರಾಂಪ್ಟ್‌ಗಳಿಗೆ ಸೇರಿದ ಟೋಕನ್‌ಗಳು ಸಣ್ಣ ಕ್ಲಸ್ಟರ್‌ಗಳನ್ನು ರೂಪಿಸುತ್ತವೆ ಮತ್ತು ಅವು ಕೂಡ ಅಟೆನ್ಷನ್ ಅನ್ನು ಆಕರ್ಷಿಸುತ್ತವೆ. ಅವು ತಾರ್ಕಿಕ ಗಡಿಗಳಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ, ಇದು ಮಾಡೆಲ್ ಬಳಕೆದಾರರ ಸಂದೇಶಗಳನ್ನು ಸಿಸ್ಟಮ್ ಸೂಚನೆಗಳಿಂದ ಪ್ರತ್ಯೇಕಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ನಮಗೆ ನಿಜವಾಗಿಯೂ ಕಚ್ಚಾ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಅಗತ್ಯವಿದೆಯೇ?

ಕಚ್ಚಾ ಅಂಕಿಅಂಶಗಳಿಲ್ಲದೆ ಸಿಂಕ್ ವಿದ್ಯಮಾನವು ಅಡಗಿದೆಯೇ ಇರುತ್ತದೆ ಮತ್ತು ಅಪೂರ್ಣ ಡೇಟಾ ಆಧಾರಿತ ಯಾವುದೇ ಕ್ಯಾಶ್-ಪ್ರೂನಿಂಗ್ ನೀತಿಯು ಮಾಡೆಲ್ ಅನ್ನು ಅಸ್ಥಿರಗೊಳಿಸುವ ಅಪಾಯವನ್ನು ಹೊಂದಿರುತ್ತದೆ ಎಂದು ಲೇಖಕರು ತಿಳಿಸಿದ್ದಾರೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

ಈ ಡಿಟೆಕ್ಟರ್‌ಯು ಜನರೇಷನ್ ಗುಣಮಟ್ಟಕ್ಕಾಗಿ ಎಂಟ್ರೋಪಿ ಟ್ರ್ಯಾಕರ್‌ನೊಂದಿಗೆ ಪ್ರಾರಂಭವಾದ ನಾಲ್ಕು ಭಾಗಗಳ ಸರಣಿಯ ಎರಡನೇ ಭಾಗವಾಗಿದೆ. ಮುಂಬರುವ ಭಾಗವು ಸಿಂಕ್ ಡಿಟೆಕ್ಷನ್ ಅನ್ನು entropy-guided speculative decoding ನೊಂದಿಗೆ ಸಂಯೋಜಿಸುತ್ತದೆ. ಅಂತಿಮ ಅಧ್ಯಯನವು ಒಂದು ಪ್ರಾಯೋಗಿಕ ಅಧ್ಯಯನವಾಗಿರುತ್ತದೆ.

ಸಾರಾಂಶ: ಅಟೆನ್ಷನ್ ಸಿಂಕ್‌ಗಳು ಕೇವಲ ಅಸ್ಪಷ್ಟ ವಿಚಿತ್ರತೆಗಳಲ್ಲ; ಅವು ಪ್ರಿಫಿಲ್ ಸಮಯದಲ್ಲಿ ಟ್ರಾನ್ಸ್‌ಫಾರ್ಮರ್‌ನ ಅಟೆನ್ಷನ್ ವಿತರಣೆಯನ್ನು ಸುಸ್ಥಿತಿಯಲ್ಲಿಡುವ ರಚನಾತ್ಮಕ ಸ್ತಂಭಗಳಾಗಿವೆ. ಅವುಗಳನ್ನು ನಿರ್ಲಕ್ಷಿಸುವ ಯಾವುದೇ KV-ಕ್ಯಾಶ್ ಪ್ರೂನಿಂಗ್ ತಂತ್ರವು ಮಾಡೆಲ್ ಸ್ಥಿರತೆಯನ್ನು ಅಪಾಯಕ್ಕೆ ತಳ್ಳುತ್ತದೆ. ಈ ಟೋಕನ್‌ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು ಮತ್ತು ಸಂರಕ್ಷಿಸುವುದು ಕಡಿಮೆ ವೆಚ್ಚದ ಸುರಕ್ಷತಾ ಕ್ರಮವಾಗಿದ್ದು, ಇದು ದೀರ್ಘ-ಸಂದರ್ಭದ ಇನ್ಫರೆನ್ಸ್ ಅನ್ನು ವಿಶ್ವಾಸಾರ್ಹ ಮತ್ತು ದಕ್ಷವಾಗಿಸುತ್ತದೆ.