ಬ್ರೌಸರ್ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್‌ಗಳಲ್ಲಿ Anthropic ನ Opus 5 ಶೂನ್ಯ ಶೇಕಡಾ ಯಶಸ್ಸಿನ ದರವನ್ನು ಸಾಧಿಸಿದೆ

Opus 5 ಬಿಡುಗಡೆಯೊಂದಿಗೆ Anthropic ಸಂಸ್ಥೆಯು AI ಸುರಕ್ಷತೆಯಲ್ಲಿ ಒಂದು ಮಹತ್ವದ ಮೈಲಿಗಲ್ಲನ್ನು ತಲುಪಿದೆ, ಇದು ಸ್ವಾಯತ್ತ ಏಜೆಂಟ್‌ಗಳಲ್ಲಿನ (autonomous agents) ಅತ್ಯಂತ ನಿರಂತರವಾದ ದೌರ್ಬಲ್ಯಗಳಲ್ಲಿ ಒಂದನ್ನು ಪರಿಹರಿಸುವ ಸಾಧ್ಯತೆಯನ್ನು ಹೊಂದಿದೆ. ದ್ವಿ-ಪದರ ರಕ್ಷಣಾ ವ್ಯವಸ್ಥೆಯನ್ನು (dual-layer defense system) ಅಳವಡಿಸಿಕೊಳ್ಳುವ ಮೂಲಕ, ಈ ಮಾಡೆಲ್ ಬ್ರೌಸರ್ ಆಧಾರಿತ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ದಾಳಿಗಳಿಗೆ ಸಂಪೂರ್ಣವಾಗಿ ಪ್ರತಿರೋಧಕವಾಗಿದೆಯೆಂದು ತೋರಿಸಿಕೊಟ್ಟಿದೆ.

AI ಏಜೆಂಟ್‌ಗಳಲ್ಲಿನ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಬಿಕ್ಕಟ್ಟು

ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಪ್ರಸ್ತುತ AI ಯುಗದ "ಅಚೀಲೆಸ್ ಹೀಲ್" (Achilles' heel - ಅತಿ ದೊಡ್ಡ ದೌರ್ಬಲ್ಯ) ಆಗಿ ಉಳಿದಿದೆ. ಒಬ್ಬ ದಾಳಿಗಾರ ವೆಬ್‌ಪೇಜ್‌ನೊಳಗೆ—ಅದೃಶ್ಯ ಪಠ್ಯದ ಮೂಲಕ—ದುರುದ್ದೇಶಪೂರಿತ ಸೂಚನೆಗಳನ್ನು ಅಡಗಿಸಿಟ್ಟಾಗ ಈ ದೌರ್ಬಲ್ಯ ಉಂಟಾಗುತ್ತದೆ, ಇದನ್ನು AI ಏಜೆಂಟ್ ಬ್ರೌಸಿಂಗ್ ಮಾಡುವಾಗ ಓದುತ್ತದೆ. ಒಮ್ಮೆ ಇವುಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಿದ ನಂತರ, ಈ ಸೂಚನೆಗಳು ಮಾಡೆಲ್ ಅನ್ನು ಹೈಜಾಕ್ ಮಾಡಬಹುದು, ಇದರಿಂದ ಅದು ಸುರಕ್ಷತಾ ಪ್ರೋಟೋಕಾಲ್‌ಗಳನ್ನು ಬೈಪಾಸ್ ಮಾಡಲು ಅಥವಾ ಅನಧಿಕೃತ ಕ್ರಮಗಳನ್ನು ಕೈಗೊಳ್ಳಲು ಒತ್ತಾಯಿಸಬಹುದು. OpenAI ನಂತಹ ಉದ್ಯಮದ ಮುಂಚೂಣಿಯಲ್ಲಿರುವ ಸಂಸ್ಥೆಗಳು ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಎಂಬುದು LLMಗಳ ಅನಿವಾರ್ಯ ದೋಷ ಎಂದು ಈ ಹಿಂದೆ ಸೂಚಿಸಿದ್ದವು, ಆದರೆ Anthropic ನ ಇತ್ತೀಚಿನ ದತ್ತಾಂಶವು ಆ ನಿರಾಶಾವಾದಿ ದೃಷ್ಟಿಕೋನಕ್ಕೆ ಸವಾಲು ಹಾಕಿದೆ.

ಶೂನ್ಯ ಶೇಕಡಾ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸಾಧನೆ

Anthropic ನ ಸಿಸ್ಟಮ್ ಕಾರ್ಡ್ ಪ್ರಕಾರ, ಬ್ರೌಸರ್ ಏಜೆಂಟ್‌ಗಳಿಗಾಗಿ ವಿಶೇಷವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ 129 ವಿಭಿನ್ನ ಪರೀಕ್ಷಾ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ Opus 5 ಅದ್ಭುತವಾದ 0% ದಾಳಿ ಯಶಸ್ಸಿನ ದರವನ್ನು ಸಾಧಿಸಿದೆ. ಇದು ಹಿಂದಿನ ಆವೃತ್ತಿಗಳಿಗಿಂತ ಗಮನಾರ್ಹ ಪ್ರಗತಿಯಾಗಿದೆ. ಭದ್ರತಾ ಸಂಸ್ಥೆಯಾದ Gray Swan ನಡೆಸಿದ ಸಾಮಾನ್ಯ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಪರೀಕ್ಷೆಯಲ್ಲಿ, Opus 5 ತನ್ನ ಹಿಂದಿನ ಮಾಡೆಲ್‌ಗಿಂತ ಗಮನಾರ್ಹ ಸುಧಾರಣೆಯನ್ನು ತೋರಿಸಿದೆ; 15 ಪ್ರಯತ್ನಗಳ ನಂತರ, ದಾಳಿಗಾರರ ಯಶಸ್ಸಿನ ದರವು 5.5% ರಿಂದ (Opus 4.8 ರಲ್ಲಿ ಕಂಡುಬಂದಿದ್ದು) ಕೇವಲ 2.0% ಕ್ಕೆ ಇಳಿಕೆಯಾಗಿದೆ.

ಈ ಕಾರ್ಯಕ್ಷಮತೆಯು Opus 5 ಅನ್ನು Gray Swan IPI ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ ಅಗ್ರಸ್ಥಾನದಲ್ಲಿರಿಸಿದೆ, ಇದು Mythos 5 (2.6%) ಮತ್ತು Fable 5 (2.8%) ನಂತಹ ಇತರ ಉನ್ನತ ಮಟ್ಟದ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಉತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡಿದೆ.

ರಹಸ್ಯ ಸೂತ್ರ: Auto Mode ಮತ್ತು ದ್ವಿ-ಪದರ ರಕ್ಷಣೆ

ಈ ಮೈಲಿಗಲ್ಲು ಕೇವಲ ಮಾಡೆಲ್‌ನ ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ಮಾತ್ರವಲ್ಲದೆ, ಅದರ ವಿಶೇಷ ಸಾಫ್ಟ್‌ವೇರ್‌ನೊಂದಿಗೆ ಮಾಡಿಕೊಂಡಿರುವ ಏಕೀಕರಣದಿಂದ ಕೂಡಿದೆ. ಈ "ಶೂನ್ಯ ಶೇಕಡಾ" ಯಶಸ್ಸಿನ ದರವು ವಿಶೇಷವಾಗಿ Claude Cowork ನಂತಹ ಉತ್ಪನ್ನಗಳಲ್ಲಿನ Auto Mode ಬಳಕೆಗೆ ಸಂಬಂಧಿಸಿದೆ. ಏಜೆಂಟ್ ಅನ್ನು ಸುರಕ್ಷಿತಗೊಳಿಸಲು Anthropic ಅತ್ಯಾಧುನಿಕ ದ್ವಿ-ಪದರ ರಕ್ಷಣಾ ವಾಸ್ತುಶಿಲ್ಪವನ್ನು (two-layer defense architecture) ಬಳಸುತ್ತದೆ:

  1. Pre-processing Scan: ಪ್ರಮುಖ LLM ಪಠ್ಯವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಮೊದಲೇ, ಎಲ್ಲಾ ಒಳಬರುವ ದತ್ತಾಂಶಗಳಲ್ಲಿ ಅಡಗಿರುವ ಅಥವಾ ಕುತಂತ್ರದ ಸೂಚನೆಗಳಿವೆಯೇ ಎಂದು ಒಂದು ಪ್ರತ್ಯೇಕ ಪದರವು ಪರಿಶೀಲಿಸುತ್ತದೆ.
  2. Execution Blocking: ಎರಡನೇ ಪದರವು ಏಜೆಂಟ್‌ನ ಉದ್ದೇಶಿತ ಕ್ರಮಗಳನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಯಾವುದೇ ಅಪಾಯಕಾರಿ ಕಮಾಂಡ್‌ಗಳನ್ನು ಬ್ರೌಸರ್ ಪರಿಸರದಲ್ಲಿ ಕಾರ್ಯಗತಗೊಳಿಸುವ ಮೊದಲು ತಡೆಯುತ್ತದೆ.

ಆಸಕ್ತಿದಾಯಕ ವಿಷಯವೆಂದರೆ, ಕೇವಲ ಮಾಡೆಲ್ ಮಾತ್ರ ಎಲ್ಲಾ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವ ಮದ್ದು (silver bullet) ಅಲ್ಲ ಎಂದು ದತ್ತಾಂಶವು ತೋರಿಸುತ್ತದೆ. ಈ ರಕ್ಷಣಾತ್ಮಕ ಸಾಫ್ಟ್‌ವೇರ್ ಪದರಗಳಿಲ್ಲದೆ, Opus 5 ನ ದೌರ್ಬಲ್ಯವು 3.7% ರಷ್ಟಿದೆ. ವಾಸ್ತವವಾಗಿ, ವಿಶೇಷವಾದ Sonnet 5 ಮಾಡೆಲ್ ಏಕಾಂಗಿಯಾಗಿ 0.93% ಯಶಸ್ಸಿನ ದರದೊಂದಿಗೆ ಸ್ವಲ್ಪ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಮೂಲ ಮಾಡೆಲ್ ಮತ್ತು ರಕ್ಷಣಾತ್ಮಕ ಸಾಫ್ಟ್‌ವೇರ್ ಸ್ಟ್ಯಾಕ್ ನಡುವಿನ ಸಮನ್ವಯವೇ ಸುರಕ್ಷತಾ ಮಟ್ಟವನ್ನು ಪರಿಪೂರ್ಣತೆಗೆ ಹತ್ತಿರ ತಲುಪಿಸಿದೆ.

AI ನ ಭವಿಷ್ಯಕ್ಕೆ ಇದು ಏಕೆ ಮುಖ್ಯ

ಸ್ವಾಯತ್ತ AI ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿರುವ ಡೆವಲಪರ್‌ಗಳು ಮತ್ತು ಸಂಸ್ಥಾಪಕರಿಗೆ, ಈ ಬೆಳವಣಿಗೆಯು ಒಂದು ದೊಡ್ಡ ಬದಲಾವಣೆಯಾಗಿದೆ (paradigm shift). ಕೇವಲ ಮಾಡೆಲ್ ತರಬೇತಿಯ ಮೂಲಕವಲ್ಲದೆ, ವಾಸ್ತುಶಿಲ್ಪದ ಪದರಗಳ ಮೂಲಕ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಅನ್ನು ತಟಸ್ಥಗೊಳಿಸಬಹುದಾದರೆ, AI ಇಮೇಲ್‌ಗಳು, ಬ್ರೌಸರ್‌ಗಳು ಮತ್ತು ಸೂಕ್ಷ್ಮ ದತ್ತಾಂಶಗಳನ್ನು ನಿರ್ವಹಿಸುವ ವಿಶ್ವಾಸಾರ್ಹ "ಏಜೆಂಟಿಕ್" (agentic) ಕಾರ್ಯಪ್ರವೃತ್ತಿಗಳತ್ತ ಸಾಗುವ ಹಾದಿಯು ಹೆಚ್ಚು ಸುರಕ್ಷಿತವಾಗುತ್ತದೆ. ಉದ್ಯಮವು "ಪರಿಹರಿಸಲಾಗದ" ಎಂಬ ಕಥನದಿಂದ ಹೊರಬಂದು, ಬಲಿಷ್ಠ ಮತ್ತು ಉತ್ಪಾದನಾ-ಸಿದ್ಧ AI ಸ್ವಾಯತ್ತತೆಯತ್ತ ಹೇಗೆ ಸಾಗಬಹುದು ಎಂಬುದಕ್ಕೆ Anthropic ಒಂದು ನೀಲನಕ್ಷೆಯನ್ನು ಒದಗಿಸಿದೆ.

ಪ್ರಮುಖ ಅಂಶಗಳು

  • ಉದ್ಯಮದ ಮುಂಚೂಣಿಯಲ್ಲಿರುವ ಸುರಕ್ಷತೆ: Auto Mode ಅನ್ನು ಬಳಸುವಾಗ, 129 ಬ್ರೌಸರ್ ಆಧಾರಿತ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಸನ್ನಿವೇಶಗಳಲ್ಲಿ Opus 5 ಶೂನ್ಯ ಶೇಕಡಾ ಯಶಸ್ಸಿನ ದರವನ್ನು ತಲುಪಿದೆ.
  • Defense-in-Depth: ಪ್ರಿ-ಪ್ರೊಸೆಸಿಂಗ್ ದತ್ತಾಂಶ ಸ್ಕ್ಯಾನ್ ಮತ್ತು ಮುನ್ನೆಚ್ಚರಿಕೆ ಕ್ರಮಗಳ ತಡೆಗಟ್ಟುವಿಕೆಯನ್ನು ಒಳಗೊಂಡ ದ್ವಿ-ಪದರ ವಿಧಾನದ ಮೂಲಕ ಈ ಸುರಕ್ಷತೆಯನ್ನು ಸಾಧಿಸಲಾಗಿದೆ.
  • ಬೆಂಚ್‌ಮಾರ್ಕ್ ಪ್ರಾಬಲ್ಯ: Opus 5 Gray Swan IPI ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನಲ್ಲಿ ಮುಂಚೂಣಿಯಲ್ಲಿದೆ ಮತ್ತು ಹಿಂದಿನ ಮಾಡೆಲ್ ಆವೃತ್ತಿಗಳಿಗಿಂತ ದಾಳಿಗಾರರ ಯಶಸ್ಸಿನ ದರವನ್ನು ಗಣನೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡಿದೆ.