Direct Preference Optimization (DPO) ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರು ಪ್ರತ್ಯೇಕ ರಿವಾರ್ಡ್ ಮಾಡೆಲ್ (reward model) ಅನ್ನು ತರಬೇತಿಗೊಳಿಸದೆ ಅಥವಾ ರಿಇನ್ಫೋರ್ಸ್ಮೆಂಟ್-ಲರ್ನಿಂಗ್ (RL) ಲೂಪ್ ಅನ್ನು ನಡೆಸದೆ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು (large language models) ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಇದು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚಗಳು ಮತ್ತು ಸಾಂಪ್ರದಾಯಿಕ RL-from-human-feedback ಪೈಪ್ಲೈನ್ಗಳಲ್ಲಿ ಕಂಡುಬರುವ ಅಸ್ಥಿರತೆಯನ್ನು (instability) ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
RL-from-Human-Feedback ಏಕೆ ಭಾರವೆನಿಸುತ್ತದೆ
ಪ್ರಮಾಣಿತ RL-from-human-feedback (RLHF) ವಿಧಾನವು ಮೂರು ಹಂತಗಳನ್ನು ಹೊಂದಿದೆ. ಮೊದಲನೆಯದಾಗಿ, ಒಂದು ಬೇಸ್ ಮಾಡೆಲ್ ಅನ್ನು (base model) ಒಂದು ವಿಶಿಷ್ಟ ಡೇಟಾಸೆಟ್ ಮೇಲೆ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲಾಗುತ್ತದೆ. ನಂತರ, ಒಂದು ರಿವಾರ್ಡ್ ಮಾಡೆಲ್ (reward model) ಔಟ್ಪುಟ್ಗಳ ಜೋಡಿಗಳ ನಡುವಿನ ಮಾನವ ಆದ್ಯತೆಯನ್ನು (human preference) ಊಹಿಸುವುದನ್ನು ಕಲಿಯುತ್ತದೆ. ಕೊನೆಯದಾಗಿ, ತಜ್ಞರು Proximal Policy Optimization (PPO) – ಇದು ಒಂದು ಕ್ಲಾಸಿಕ್ RL ಅಲ್ಗಾರಿದಮ್ – ಅನ್ನು ಚಲಾಯಿಸಿ, ಮೂಲ ಮಾಡೆಲ್ಗೆ ಹತ್ತಿರವಾಗಿಯೇ ಇರುವಂತೆ ನೋಡಿಕೊಳ್ಳುತ್ತಾ, ಹೆಚ್ಚಿನ ಅಂದಾಜಿತ ರಿವಾರ್ಡ್ಗಳತ್ತ ಪಾಲಿಸಿಯನ್ನು (policy) ತಳ್ಳುತ್ತಾರೆ.
ಆ ಮೂರು ಮಾಡೆಲ್ಗಳ ಸೆಟಪ್ ಏಕಕಾಲದಲ್ಲಿ ಮೆಮೊರಿಯಲ್ಲಿ ಇರುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಅಪ್ಡೇಟ್ನಲ್ಲಿ ಹೊಸ ಪಠ್ಯವನ್ನು ಸ್ಯಾಂಪಲ್ ಮಾಡುವ ದುಬಾರಿ RL ಲೂಪ್ ಅನ್ನು ಒತ್ತಾಯಿಸುತ್ತದೆ. ತಂಡಗಳು ಹೆಚ್ಚಾಗಿ ಪಾಲಿಸಿಯು ರಿವಾರ್ಡ್ ಅನ್ನು "ಗೇಮ್" (game) ಮಾಡುವುದನ್ನು ಕಲಿಯುವುದನ್ನು ನೋಡುತ್ತವೆ, ಅಂದರೆ ಅದು ಪ್ರೊಕ್ಸಿ (proxy) ಮೇಲೆ ಉತ್ತಮ ಸ್ಕೋರ್ ನೀಡುವ ಔಟ್ಪುಟ್ಗಳನ್ನು ನೀಡುತ್ತದೆ ಆದರೆ ಉದ್ದೇಶಿತ ಗುಣಮಟ್ಟವನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ಪೈಪ್ಲೈನ್ ದುಬಾರಿಯಾಗಿರುತ್ತದೆ, ಅಸ್ಥಿರವಾಗಿರುತ್ತದೆ ಮತ್ತು ಸ್ಕೇಲ್ ಮಾಡುವುದು ಕಷ್ಟವಾಗುತ್ತದೆ.
DPO ನ ಬೀಜಗಣಿತದ ಶಾರ್ಟ್ಕಟ್ (algebraic shortcut)
DPO ಸಂಪೂರ್ಣವಾಗಿ ರಿವಾರ್ಡ್ ಮಾಡೆಲ್ ಅನ್ನು ಬಿಟ್ಟುಬಿಡುತ್ತದೆ. RLHF ಉದ್ದೇಶವು – ಅಂದರೆ ರೆಫರೆನ್ಸ್ ಮಾಡೆಲ್ನಿಂದ ವಿಚಲನೆಯನ್ನು (divergence) ಶಿಕ್ಷಿಸುತ್ತಾ ನಿರೀಕ್ಷಿತ ರಿವಾರ್ಡ್ ಅನ್ನು ಗರಿಷ್ಠಗೊಳಿಸುವುದು – ಒಂದು ಕ್ಲೋಸ್ಡ್-ಫಾರ್ಮ್ ಎಕ್ಸ್ಪ್ರೆಶನ್ (closed-form expression) ಹೊಂದಿದೆ ಎಂಬುದು ಇಲ್ಲಿನ ಪ್ರಮುಖ ಅವಲೋಕನವಾಗಿದೆ. ಗಣಿತವನ್ನು ಮರುಹೊಂದಿಸುವ ಮೂಲಕ, ಯಾವುದೇ ಟೋಕನ್ಗಾಗಿ ರಿವಾರ್ಡ್ ಎಂಬುದು ಪಾಲಿಯಿಂದ ನೀಡಲಾದ ಲಾಗ್-ಪ್ರೊಬಬಿಲಿಟಿ (log-probability) ಮತ್ತು ರೆಫರೆನ್ಸ್ ಮಾಡೆಲ್ನಿಂದ ನೀಡಲಾದ ಲಾಗ್-ಪ್ರೊಬಬಿಲಿಟಿ ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗುತ್ತದೆ.
ಪ್ರಾಯೋಗಿಕವಾಗಿ ಇದರರ್ಥ "ರಿವಾರ್ಡ್" ಪಾಲಿಯ ಒಳಗೇ ಇರುತ್ತದೆ. ತರಬೇತಿಯು ಆದ್ಯತಾ ಜೋಡಿಗಳ (preference pairs) ಮೇಲೆ ಕೇವಲ ಒಂದು ಕ್ಲಾಸಿಫಿಕೇಶನ್ ಲಾಸ್ (classification loss) ಗೆ ಸೀಮಿತವಾಗುತ್ತದೆ: ಒಂದು ಆಯ್ಕೆ ಮಾಡಿದ ಪ್ರತಿಕ್ರಿಯೆ ಮತ್ತು ತಿರಸ್ಕರಿಸಿದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ನೀಡಿದಾಗ, ಮಾಡೆಲ್ ಆಯ್ಕೆ ಮಾಡಿದ ಪಠ್ಯಕ್ಕೆ ಹೆಚ್ಚಿನ ಸಂಭವನೀಯತೆಯನ್ನು (probability) ನೀಡುವಂತೆ ಪ್ರೇರೇಪಿಸಲಾಗುತ್ತದೆ. ಯಾವುದೇ ಸ್ಯಾಂಪಲಿಂಗ್ ಇಲ್ಲ, ಯಾವುದೇ PPO ಅಪ್ಡೇಟ್ಗಳಿಲ್ಲ, ಮತ್ತು ಸಂಗ್ರಹಿಸಲು ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಮಾಡೆಲ್ ಇಲ್ಲ.
ಹೊಸ ಲಾಸ್ (loss) ಹೇಗಿರುತ್ತದೆ
ಈ ಲಾಸ್ ಪ್ರಸ್ತುತ ಪಾಲಿಯ ಅಡಿಯಲ್ಲಿನ ಆದ್ಯತೆಯ ಉತ್ತರದ ಲಾಗ್-ಪ್ರೊಬಬಿಲಿಟಿಯನ್ನು ರೆಫರೆನ್ಸ್ ಮಾಡೆಲ್ನ ಅಡಿಯಲ್ಲಿನ ಲಾಗ್-ಪ್ರೊಬಬಿಲಿಟಿಯೊಂದಿಗೆ ಹೋಲಿಸುತ್ತದೆ, ಇದನ್ನು ಟೆಂಪರೇಚರ್ನಂತಹ ಹೈಪರ್ಪ್ಯಾರಾಮೀಟರ್ β ನಿಂದ ಸ್ಕೇಲ್ ಮಾಡಲಾಗುತ್ತದೆ. ಹೆಚ್ಚಿನ β ಪಾಲಿಯನ್ನು ರೆಫರೆನ್ಸ್ ಹತ್ತಿರವೇ ಇರಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ, ಇದರಿಂದ ದ್ರವ್ಯತೆ (fluency) ಮತ್ತು ಸುರಕ್ಷತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಬಹುದು. ಕಡಿಮೆ β ಪಾಲಿಯು ಹೆಚ್ಚು ವಿಚಲಿತವಾಗಲು ಬಿಡುತ್ತದೆ, ಇದು ಆಯ್ಕೆ ಮಾಡಿದ ಉತ್ತರಕ್ಕಾಗಿ ಅದರ ಆದ್ಯತೆಯನ್ನು ತೀಕ್ಷ್ಣಗೊಳಿಸುತ್ತದೆ.
ಅಭಿವೃದ್ಧಿಪಡಿಸುವವರಿಗೆ (developers) ಮುಖ್ಯವಾದ ಪ್ರಯೋಜನಗಳು
- ರಿವಾರ್ಡ್ ಮಾಡೆಲ್ ಇಲ್ಲ – ಪ್ರತ್ಯೇಕ ಪ್ರೆಡಿಕ್ಟರ್ಗಾಗಿ ಹೆಚ್ಚುವರಿ ಮಾನವ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸಂಗ್ರಹಿಸುವ ಅಗತ್ಯವನ್ನು ಇದು ತಪ್ಪಿಸುತ್ತದೆ.
- ತರಬೇತಿಯ ಸಮಯದಲ್ಲಿ ಸ್ಯಾಂಪಲಿಂಗ್ ಇಲ್ಲ – ಮಾಡೆಲ್ ಗ್ರೇಡಿಯಂಟ್ಗಳನ್ನು (gradients) ಲೆಕ್ಕಹಾಕಲು ಎಂದಿಗೂ ಹೊಸ ಪಠ್ಯವನ್ನು ಸೃಷ್ಟಿಸುವುದಿಲ್ಲ, ಇದು GPU ಸಮಯವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
- ಸ್ಥಿರತೆ (Stability) – ಅಸ್ಥಿರತೆಯನ್ನು ಉಂಟುಮಾಡುವ ಹೆಚ್ಚಿನ ವೇರಿಯನ್ಸ್ ಹೊಂದಿರುವ RL ಗ್ರೇಡಿಯಂಟ್ಗಳ ಬದಲಿಗೆ ಪ್ರಮಾಣಿತ ಬೈನರಿ-ಕ್ರಾಸ್-ಎಂಟ್ರೋಪಿ ಲಾಸ್ (binary-cross-entropy loss) ಬಳಕೆಯಾಗುತ್ತದೆ.
- ದಕ್ಷತೆ (Efficiency) – ಪ್ರತಿ ಆದ್ಯತಾ ಜೋಡಿಯ ಮೇಲೆ ಒಂದೇ ಗ್ರೇಡಿಯಂಟ್ ಸ್ಟೆಪ್ ಸಾಕಾಗುತ್ತದೆ; PPO ಗಿಂತ ಬಹಳ ಕಡಿಮೆ ಎಪೋಕ್ಗಳಲ್ಲಿ (epochs) ತರಬೇತಿಯು ಪೂರ್ಣಗೊಳ್ಳುತ್ತದೆ.
ಆರಂಭಿಕ ಪ್ರಯೋಗಗಳು, ಅಲ್ಪ ಕಂಪ್ಯೂಟ್ ಬಜೆಟ್ ಬಳಸುತ್ತಲೇ ಬೆಂಚ್ಮಾರ್ಕ್ ಆದ್ಯತಾ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ DPO, PPO ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಮಾನವಾಗಿ ಅಥವಾ ಅದಕ್ಕಿಂತ ಉತ್ತಮವಾಗಿ ತೋರಿಸುತ್ತವೆ ಎಂದು ತೋರಿಸುತ್ತವೆ. ಈ ವೆಚ್ಚದ ಅನುಕೂಲವೇ ಅನೇಕ ಓಪನ್-ಸೋರ್ಸ್ ಪ್ರಾಜೆಕ್ಟ್ಗಳು ಈಗಾಗಲೇ DPO ಅಥವಾ ಅದರ ಸಮಾನ ರೂಪವನ್ನು ತಮ್ಮ ಡಿಫಾಲ್ಟ್ ಅಲೈನ್ಮೆಂಟ್ ವಿಧಾನವಾಗಿ ಅಳವಡಿಸಿಕೊಂಡಿರುವುದಕ್ಕೆ ಕಾರಣವಾಗಿದೆ.
ವಹಿವಾಟುಗಳು (The trade-offs)
DPO ಒಂದು ನಿರ್ದಿಷ್ಟ ಆದ್ಯತಾ ಜೋಡಿಗಳ ಸೆಟ್ ಮೇಲೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ. ತರಬೇತಿಯ ಸಮಯದಲ್ಲಿ ಇದು ಎಂದಿಗೂ ಹೊಸ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆಗಳನ್ನು (completions) ಸ್ಯಾಂಪಲ್ ಮಾಡದ ಕಾರಣ, ಮೂಲ ಡೇಟಾದಲ್ಲಿ ಇಲ್ಲದ ಉತ್ತರಗಳ ವ್ಯಾಪ್ತಿಯನ್ನು ಇದು ಅನ್ವೇಷಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಆನ್ಲೈನ್ PPO ರನ್ ಮಾಡೆಲ್ ಅನ್ನು ನಿರಂತರವಾಗಿ ಪರೀಕ್ಷಿಸುವ ಮೂಲಕ ಹೊಸ ಮತ್ತು ಹೆಚ್ಚಿನ ರಿವಾರ್ಡ್ ನೀಡುವ ವರ್ತನೆಗಳನ್ನು ಕಂಡುಕೊಳ್ಳಬಹುದು.
β ಅನ್ನು ತುಂಬಾ ಕಡಿಮೆ ಹೊಂದಿಸಿದರೆ ಅಥವಾ ತರಬೇತಿಯು ತುಂಬಾ ಹಂತಗಳವರೆಗೆ ನಡೆದರೆ, ಪಾಲಿಯು ರೆಫರೆನ್ಸ್ ಮಾಡೆಲ್ನಿಂದ ವಿಚಲಿತವಾಗಿ ದ್ರವ್ಯತೆಯನ್ನು ಕಳೆದುಕೊಳ್ಳಬಹುದು ಅಥವಾ ಅवांಛನೀಯ ಅಂಶಗಳನ್ನು (artefacts) ಪರಿಚಯಿಸಬಹುದು.
ಸಾರಾಂಶ (Takeaway)
Direct Preference Optimization ಎಂಬುದು ಮೂರು ಮಾಡೆಲ್ಗಳಿರುವ, RL-ಭಾರಿತ RLHF ಸ್ಟ್ಯಾಕ್ ಅನ್ನು ಮಾನವ ಆದ್ಯತಾ ಜೋಡಿಗಳಿಂದ ನೇರವಾಗಿ ಕಲಿಯುವ ಏಕೈಕ, ಸ್ಥಿರವಾದ ಲಾಸ್ನೊಂದಿಗೆ ಬದಲಾಯಿಸುತ್ತದೆ. ತರಬೇತಿ ಡೇಟಾ ನಿಮಗೆ ಬೇಕಾದ ವರ್ತನೆಗಳನ್ನು ಒಳಗೊಂಡಿದ್ದರೆ ಮತ್ತು ನೀವು ಡ್ರಿಫ್ಟ್ ಪ್ಯಾರಾಮೀಟರ್ ಅನ್ನು ನಿಯಂತ್ರಣದಲ್ಲಿಟ್ಟರೆ, ಭಾಷಾ ಮಾದರಿಗಳನ್ನು ಅಲೈನ್ ಮಾಡಲು ಇದು ಅಗ್ಗದ ಮತ್ತು ಹೆಚ್ಚು ಊಹಿಸಬಹುದಾದ ಮಾರ್ಗವಾಗಿದೆ.
