ಸಂಶೋಧಕರು ತೋರಿಸಿದ್ದಾರೆಂದರೆ, ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ರೀಸನಿಂಗ್ ಟ್ರೇಸ್ಗಳು (reasoning traces)—ಒಂದು ಸಂಭಾಷಣೆಯು ವಿವಿಧ ಮಾಡೆಲ್ಗಳ ನಡುವೆ ವರ್ಗಾವಣೆಯಾಗಲು ಸೇವಾ ಪೂರೈಕೆದಾರರು ಬಳಕೆದಾರರ ಸಾಧನಕ್ಕೆ ಕಳುಹಿಸುವ ಸಣ್ಣ ಪ್ಯಾಕೆಟ್ಗಳು—ಒಂದೇ ಸೇವೆಯ ದುರ್ಬಲ ಮಾಡೆಲ್ನಿಂದ ಡಿಕ್ರಿಪ್ಟ್ ಮಾಡಲ್ಪಡಬಹುದು, ಇದರಿಂದ ನೂರಾರು ಕ್ರೆಡೆನ್ಶಿಯಲ್ಗಳು ಮತ್ತು ಖಾಸಗಿ ವಿವರಗಳು ಸೋರಿಕೆಯಾಗುತ್ತವೆ. Stealing Reasoning Traces from Proprietary LLM APIs ಎಂಬ ಪ್ರಬಂಧದಲ್ಲಿ ವಿವರಿಸಲಾದ ಈ ಸಂಶೋಧನೆಯು, AI ಚಾಟ್ಗಳನ್ನು ಸುಗಮವಾಗಿರಿಸಲು Anthropic, OpenAI ಮತ್ತು Google ಅವಲಂಬಿಸಿರುವ ಒಂದು ಸೌಲಭ್ಯದ ವೈಶಿಷ್ಟ್ಯಕ್ಕೆ ಬೆದರಿಕೆಯಾಗಿದೆ.
ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ಬ್ಲಾಕ್ಗಳು ಏಕೆ ಅಸ್ತಿತ್ವದಲ್ಲಿವೆ
ನೀವು ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ (LLM) ಜೊತೆ ಮಾತನಾಡಿದಾಗ, ಆ ಸೇವೆ ಒಂದು "ರೀಸನಿಂಗ್ ಟ್ರೇಸ್" ಅನ್ನು ನಿರ್ಮಿಸುತ್ತದೆ: ಅಂದರೆ ಉತ್ತರಕ್ಕೆ ಕಾರಣವಾದ ಆಂತರಿಕ ಪ್ರಾಂಪ್ಟ್ಗಳು, ಟೂಲ್ ಕರೆಗಳು ಮತ್ತು ಚೈನ್-ಆಫ್-ಥಾಟ್ ಹಂತಗಳ ಸರಣಿ. ಆ ಸರಣಿಯನ್ನು ಕಳೆದುಕೊಳ್ಳದೆ ನೀವು ದೊಡ್ಡ ಮಾಡೆಲ್ನಿಂದ ಅಗ್ಗದ ಮಾಡೆಲ್ಗೆ ಬದಲಾಯಿಸಲು ಅನುವು ಮಾಡಿಕೊಡಲು, ಪೂರೈಕೆದಾರರು ಆ ಟ್ರೇಸ್ ಅನ್ನು ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಿ, ಅದನ್ನು ನಿಮ್ಮ ಸಾಧನಕ್ಕೆ ಕಳುಹಿಸುತ್ತಾರೆ ಮತ್ತು ಮುಂದಿನ ವಿನಂತಿಯೊಂದಿಗೆ ಅದನ್ನು ಮರಳಿ ಕಳುಹಿಸಬೇಕೆಂದು ನಿರೀಕ್ಷಿಸುತ್ತಾರೆ. ಈ ಎನ್ಕ್ರಿಪ್ಶನ್ನ ಉದ್ದೇಶವು ಕ್ರಾಸ್-ಸೆಷನ್ ಮತ್ತು ಕ್ರಾಸ್-ಮಾಡಲ್ ನಿರಂತರತೆಯನ್ನು (continuity) ಸಾಧ್ಯವಾಗಿಸುವಾಗಲೂ ಟ್ರೇಸ್ ಅನ್ನು ಗೌಪ್ಯವಾಗಿಡುವುದು.
ದಾಳಿ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ
ಸಂಶೋಧಕರು ಮೂರು ಹಂತಗಳ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಅನ್ನು ಪ್ರದರ್ಶಿಸಿದ್ದಾರೆ, ಇದಕ್ಕೆ ಬಲಿಷ್ಠ ಮಾಡೆಲ್ ಅನ್ನು ಒಳಗಿನಿಂದ ಭೇದಿಸುವ ಅಗತ್ಯವಿಲ್ಲ:
- Capture: ಸಾಮಾನ್ಯ ಸಂಭಾಷಣೆಯ ಸಮಯದಲ್ಲಿ ಶಕ್ತಿಯುತ ಮಾಡೆಲ್ನಿಂದ ಸೃಷ್ಟಿಯಾದ ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ರೀಸನಿಂಗ್ ಬ್ಲಾಕ್ ಅನ್ನು ಸೆರೆಹಿಡಿಯುವುದು.
- Feed: ಅದೇ ಪೂರೈಕೆದಾರರ ದುರ್ಬಲ ಮಾಡೆಲ್ಗೆ ಆ ಬ್ಲಾಕ್ ಅನ್ನು ನೀಡಿ, ಅದನ್ನು "ಓದಲು" ಕೇಳುವುದು.
- ದುರ್ಬಲ ಮಾಡೆಲ್ ಒಂದೇ ಡಿಕ್ರಿಪ್ಶನ್ ಕೀಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳುವುದರಿಂದ, ಅದು ಡಿಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ವಿಷಯವನ್ನು ಪ್ಲೇನ್ ಟೆಕ್ಸ್ಟ್ ರೂಪದಲ್ಲಿ ಔಟ್ಪುಟ್ ಮಾಡುತ್ತದೆ.
ಇಲ್ಲಿ ದುರ್ಬಲ ಮಾಡೆಲ್ ಒಂದು ಡಿಕ್ರಿಪ್ಶನ್ ಒರಾಕಲ್ (decryption oracle) ರೀತಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ದಾಳಿಕೋರರು ಬಲಿಷ್ಠ ಮಾಡೆಲ್ನ ಆಂತರಿಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಎಂದಿಗೂ ಮುಟ್ಟಲಿಲ್ಲ; ಅವರು ಕೇವಲ ಪೂರೈಕೆದಾರರ ಸ್ವಂತ API ಅನ್ನು ಅವರ ವಿರುದ್ಧವೇ ಬಳಸಿದರು.
ಸಂಶೋಧಕರು ಏನನ್ನು ಮರುಪಡೆಯಲು ಸಾಧ್ಯವಾಯಿತು
- 182 ಕ್ರೆಡೆನ್ಶಿಯಲ್ಗಳು – ಟ್ರೇಸ್ನಲ್ಲಿ ಅಡಗಿರುವ API ಕೀಗಳು, ಟೋಕನ್ಗಳು ಮತ್ತು ಇತರ ರಹಸ್ಯಗಳು.
- 367 ಖಾಸಗಿ ಮಾಹಿತಿ ತುಣುಕುಗಳು – ಬಳಕೆದಾರರು ಚಾಟ್ ಸಮಯದಲ್ಲಿ ನೀಡಿದ ಹೆಸರುಗಳು, ಇಮೇಲ್ಗಳು, ವಿಳಾಸಗಳು.
- ಪ್ರಾಂಪ್ಟ್-ಇಂಜೆಕ್ಷನ್ ಪೇಲೋಡ್ಗಳು – ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ಬ್ಲಾಕ್ನಲ್ಲಿ ಅಡಗಿರುವ ದುಷ್ಟ ಸೂಚನೆಗಳು, ಇವುಗಳನ್ನು ಟ್ರೇಸ್ ಅನ್ನು ಮರುಪ್ರದರ್ಶಿಸಿದಾಗ (replay) ಕಾರ್ಯಗತಗೊಳಿಸಬಹುದು.
- Safety-filter ಬೈಪಾಸ್ಗಳು – ಡಿಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ಟ್ರೇಸ್ ಅಂತಹ ಹಂತಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಿತು, ಇವುಗಳನ್ನು ಪ್ಲೇನ್ ಟೆಕ್ಸ್ಟ್ನಲ್ಲಿ ಪರಿಶೀಲಿಸಿದ್ದರೆ ತಡೆಹಿಡಿಯಲಾಗುತ್ತಿತ್ತು, ಇದರಿಂದ ಅಪಾಯಕಾರಿ ವಿಷಯಗಳು ಸುಲಭವಾಗಿ ಒಳಬರಲು ಸಾಧ್ಯವಾಯಿತು.
ಈ ದೌರ್ಬಲ್ಯವು ಕ್ರಿಪ್ಟೋಗ್ರಾಫಿಕ್ ಅಲ್ಗಾರಿದಮ್ನ ದೋಷವಲ್ಲ ಎಂದು ಪ್ರಬಂಧವು ಒತ್ತಿಹೇಳುತ್ತದೆ; ಎನ್ಕ್ರಿಪ್ಶನ್ ತಾನೇ ಸರಿಯಾಗಿದೆ. ಬಳಕೆದಾರರ ಅನುಭವಕ್ಕಾಗಿ ಪೂರೈಕೆದಾರರ ಫ್ಲೀಟ್ನಲ್ಲಿರುವ ಯಾವುದೇ ಮಾಡೆಲ್ ಬ್ಲಾಕ್ ಅನ್ನು ಡಿಕ್ರಿಪ್ಟ್ ಮಾಡಲು ಅವಕಾಶ ನೀಡಿರುವ ವಿನ್ಯಾಸದ ಆಯ್ಕೆಯಿಂದ ಈ ಉಲ್ಲಂಘನೆಯಾಗಿದೆ.
ಸಮಸ್ಯೆಯ ಕೇಂದ್ರದಲ್ಲಿರುವ ವಹಿವಾಟು (Trade-off)
ಡೆವಲಪರ್ಗಳು ಮತ್ತು ಅಂತಿಮ ಬಳಕೆದಾರರು ನಿರಂತರತೆಯನ್ನು ಗೌರವಿಸುವುದರಿಂದ ಪೂರೈಕೆದಾರರು ತಮ್ಮ APIಗಳಲ್ಲಿ ಈ "ಮಾಡಲ್-ಸ್ವಿಚಿಂಗ್" ಸಾಮರ್ಥ್ಯವನ್ನು ನಿರ್ಮಿಸಿದ್ದಾರೆ. ಎನ್ಕ್ರಿಪ್ಶನ್ ಒಂದೇ ಮಾಡೆಲ್ ಇನ್ಸ್ಟೆನ್ಸ್ ಅಥವಾ ಸೆಷನ್ಗೆ ಸೀಮಿತವಾಗಿದ್ದರೆ, ಸುಗಮವಾದ ಹ್ಯಾಂಡ್-ಆಫ್ (hand-off) ತಪ್ಪಾಗುತ್ತಿತ್ತು ಮತ್ತು ಡೆವಲಪರ್ಗಳು ಸ್ಟೇಟ್ ಮ್ಯಾನೇಜ್ಮೆಂಟ್ ಅನ್ನು ತಾವೇ ನಿರ್ಮಿಸಬೇಕಾಗುತ್ತಿತ್ತು. ನಮ್ಯತೆಗಾಗಿ (flexibility) ಭದ್ರತೆಯನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಬಲಿ داده ඇත ಎಂದು ಪ್ರಬಂಧವು ವಾದಿಸುತ್ತದೆ.
ಡೆವಲಪರ್ಗಳು ಈಗ ಏನು ಮಾಡಬೇಕು
- ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ಟ್ರೇಸ್ಗಳನ್ನು ಕ್ಲಿಯರ್-ಟೆಕ್ಸ್ಟ್ ಎಂದು ಪರಿಗಣಿಸಿ. ಅವುಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಯಾವುದೇ ಲಾಗ್, ಕ್ಯಾಶ್ ಅಥವಾ ಮಾನಿಟರಿಂಗ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ದಾಳಿಕೋರರು ಓದಬಹುದು ಎಂದು ಭಾವಿಸಿ.
- ಪಬ್ಲಿಕ್ ರೆಪೊಸಿಟರಿಗಳಿಗೆ ಟ್ರೇಸ್ಗಳನ್ನು ಕಮಿಟ್ ಮಾಡುವುದನ್ನು ತಪ್ಪಿಸಿ. ಒಂದೇ ಒಂದು ಅತಿಕ್ರಮಿತ ಬ್ಲಾಕ್ವು ಡಜನ್ಗಟ್ಟಲೆ ರಹಸ್ಯಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಬಹುದು.
- ಕಟ್ಟುನಿಟ್ಟಾದ ನಿಯಂತ್ರಣಗಳಿಗಾಗಿ ಯೋಜಿಸಿ. ಪೂರೈಕೆದಾರರು ಭದ್ರತೆಯನ್ನು ಬಿಗಿಗೊಳಿಸಬಹುದು, ಇದು ಮಲ್ಟಿ-ಮಾಡಲ್ ಏಜೆಂಟ್ಗಳನ್ನು ನಿರ್ಮಿಸುವ ವಿಧಾನವನ್ನು ಬದಲಾಯಿಸಬಹುದು.
- ಸ್ಪಷ್ಟವಾದ ಸ್ಟೇಟ್ ಹ್ಯಾಂಡ್-ಆಫ್ಗಳಿಗೆ ಬದಲಾಗಿ. ಗುಪ್ತ ರೀಸನಿಂಗ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುವ ಬದಲು, ಎನ್ಕ್ರಿಪ್ಶನ್ ಇಲ್ಲದೆ ಮಾಡೆಲ್ಗಳ ನಡುವೆ ಸುರಕ್ಷಿತವಾಗಿ ವರ್ಗಾಯಿಸಬಹುದಾದ ರಚನಾತ್ಮಕ ಡೇಟಾವನ್ನು (JSON, XML, ಇತ್ಯಾದಿ) ಔಟ್ಪುಟ್ ಮಾಡಲು ಏಜೆಂಟ್ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ.
- ನಿಮ್ಮ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಆಡಿಟ್ ಮಾಡಿ. ರೀಸನಿಂಗ್ ಚೈನ್ನಲ್ಲಿ ಅಡಗಿರುವ ಯಾವುದೇ ಸೂಕ್ಷ್ಮ ಡೇಟಾವನ್ನು ಪತ್ತೆಹಚ್ಚಿ ಮತ್ತು ವಿನಂತಿಯನ್ನು ಕಳುಹಿಸುವ ಮೊದಲು ಅದನ್ನು ತೆಗೆದುಹಾಕಿ.
ದೊಡ್ಡ ಪೂರೈಕೆದಾರರಿಂದ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಈ ಪ್ರಬಂಧದ ಬಿಡುಗಡೆಯು Anthropic, OpenAI ಮತ್ತು Google ಕಂಪನಿಗಳನ್ನು ತಮ್ಮ APIಗಳಲ್ಲಿ ಅಳವಡಿಸಲಾದ ಡಿಕ್ರಿಪ್ಶನ್ ನೀತಿಯನ್ನು ಮರುಪರಿಶೀಲಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ.
ವಿಶಾಲವಾದ ಪರಿಣಾಮ
ಈ ಸಂಶೋಧನೆಯು ಒಂದು ಸಾಂಪ್ರದಾಯಿಕ ಭದ್ರತಾ ಸಂದಿಗ್ಧತೆಯನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ: ಸೌಲಭ್ಯವು ಹೆಚ್ಚಾಗಿ ಹಿಂಬಾಗಿಲುಗಳನ್ನು (backdoor) ತೆರೆಯುತ್ತದೆ. ಬಳಕೆದಾರರಿಗೆ ಸೇರಿದ ಬ್ಲಾಕ್ ಅನ್ನು ಯಾವುದೇ ಮಾಡೆಲ್ ಡಿಕ್ರಿಪ್ಟ್ ಮಾಡಲು ಅನುಮತಿಸುವ ಮೂಲಕ, ಪೂರೈಕೆದಾರರು ದಾಳಿಕೋರರಿಗೆ ಸೂಕ್ಷ್ಮ ಡೇಟಾವನ್ನು ಪಡೆಯಲು ಸುಲಭವಾದ ಹಾದಿಯನ್ನು ನೀಡಿದ್ದಾರೆ. ಇದರ ಪರಿಹಾರವು AI ಇಂಟಿಗ್ರೇಷನ್ಗಳನ್ನು ಸ್ವಲ್ಪ ಕಷ್ಟಕರವಾಗಿಸಬಹುದು, ಆದರೆ ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ಡೇಟಾ ಎನ್ಕ್ರಿಪ್ಟ್ ಆಗಿಯೇ ಇರುತ್ತದೆ ಎಂಬ ನಿರೀಕ್ಷೆಯನ್ನು ಇದು ಮರುಸ್ಥಾಪಿಸುತ್ತದೆ.
ಸಾರಾಂಶ (Takeaway): ಎನ್ಕ್ರಿಪ್ಟ್ ಮಾಡಲಾದ ರೀಸನಿಂಗ್ ಟ್ರೇಸ್ಗಳು ಭದ್ರತಾ ಗಡಿಗಳಲ್ಲ; ಅವು ನಿಮ್ಮ ವಿರುದ್ಧವೇ ತಿರುಗಿಸಬಹುದಾದ ಸೌಲಭ್ಯದ ಶಾರ್ಟ್ಕಟ್ಗಳು. ಅವುಗಳನ್ನು ಪ್ಲೇನ್ ಟೆಕ್ಸ್ಟ್ ಎಂದು ಪರಿಗಣಿಸಿ, ಲಾಗ್ಗಳಿಂದ ಅವುಗಳನ್ನು ತೆಗೆದುಹಾಕಿ ಮತ್ತು ಕೇವಲ ಮೂಲ ಮಾಡೆಲ್ ಮಾತ್ರ ತನ್ನ ಆಲೋಚನೆಗಳನ್ನು ಓದಬಲ್ಲ ಭವಿಷ್ಯಕ್ಕೆ ತಕ್ಕಂತೆ ನಿಮ್ಮ ಏಜೆಂಟ್ಗಳನ್ನು ಮರು ವಿನ್ಯಾಸಗೊಳಿಸಿ.
