OpenAI ಇಂದು GPT-Red ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಸ್ವಯಂಚಾಲಿತ ರೆಡ್-ಟೀಮ್ ಹ್ಯಾಕರ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಒಂದು ಲಾರ್ಜ್-ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ ಆಗಿದೆ. ಈ ವ್ಯವಸ್ಥೆಯು ಈಗಾಗಲೇ ಕಂಪನಿಯ ಇತ್ತೀಚಿನ GPT-5.6 ಮಾಡೆಲ್ ಅನ್ನು ಬಲಪಡಿಸುತ್ತಿದ್ದು, ಅನುಕರಿಸಿದ ದಾಳಿಗಳ ಯಶಸ್ಸಿನ ದರವನ್ನು ಶೇಕಡಾ 90 ಕ್ಕಿಂತ ಹೆಚ್ಚು ಇಂದ ಶೇಕಡಾ 23 ಕ್ಕಿಂತ ಕಡಿಮೆ ಮಾಡಿದೆ.
GPT-Red ಹೇಗೆ ರೆಡ್-ಟೀಮ್ ಕೆಲಸವನ್ನು ಸ್ವಯಂಚಾಲಿತಗೊಳಿಸುತ್ತದೆ
ರೆಡ್-ಟೀಮ್ ಟೆಸ್ಟಿಂಗ್—ಒಂದು ವ್ಯವಸ್ಥೆಯನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಮುರಿಯಲು ಅಥವಾ ಹೈಜಾಕ್ ಮಾಡಲು ಪ್ರಯತ್ನಿಸುವುದು—ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ ಭದ್ರತಾ ತಜ್ಞರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ. LLMಗಳು ವೆಬ್ ಅನ್ನು ಬ್ರೌಸ್ ಮಾಡುವುದು, ಕೋಡ್ ಚಲಾಯಿಸುವುದು ಮತ್ತು ಥರ್ಡ್-ಪಾರ್ಟಿ ಸೇವೆಗಳನ್ನು ಕರೆಯುವುದನ್ನು ಕಲಿಯುತ್ತಿದ್ದಂತೆ, ಅವುಗಳನ್ನು ದುರುಪಯೋಗಪಡಿಸಿಕೊಳ್ಳುವ ವಿಧಾನಗಳು ಮಾನವ ತಂಡವು ಅನ್ವೇಷಿಸುವುದಕ್ಕಿಂತ ವೇಗವಾಗಿ ಹೆಚ್ಚಾಗುತ್ತಿವೆ.
ಸಂಶೋಧಕರು 'ಡೋಜೋ' (dojo) ಎಂದು ಕರೆಯುವ ಅನುಕರಿಸಿದ ಪರಿಸರದಲ್ಲಿ ಒಂದು ಮಾಡೆಲ್ನ ಪ್ರತಿಯನ್ನು ಮತ್ತೊಂದಕ್ಕೆ ಎದುರಿಸುವ "ಸೆಲ್ಫ್-ಪ್ಲೇ ಲೂಪ್" (self-play loop) ಮೂಲಕ OpenAI ಇದಕ್ಕೆ ಉತ್ತರಿಸಿದೆ. ಈ ಸ್ಯಾಂಡ್ಬಾಕ್ಸ್ನಲ್ಲಿ, GPT-Red ದಾಳಿಕಾರನ ಪಾತ್ರವನ್ನು ವಹಿಸಿದರೆ, ಒಂದು ಅಥವಾ ಹೆಚ್ಚಿನ ಡಿಫೆಂಡರ್ ಮಾಡೆಲ್ಗಳು ಪ್ರತಿರೋಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತವೆ. ಈ ಎರಡು ಬದಿಗಳು ಅಸಂಖ್ಯಾತ ಸುತ್ತುಗಳನ್ನು ನಡೆಸುತ್ತವೆ; ಪ್ರತಿ ಇಟರೇಶನ್ ದಾಳಿಕಾರನನ್ನು ಸೂಕ್ಷ್ಮ ದೋಷಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ಡಿಫೆಂಡರ್ ಅನ್ನು ಹೊಸ ರಕ್ಷಣಾ ಕ್ರಮಗಳನ್ನು ಕಲಿಯಲು ಪ್ರೇರೇಪಿಸುತ್ತದೆ. OpenAI ಈ ಪ್ರಕ್ರಿಯೆಯನ್ನು GPT-5.6 ಅನ್ನು ತಯಾರಿಸಿದ ತರಬೇತಿ ಪೈಪ್ಲೈನ್ನಲ್ಲಿ ಅಳವಡಿಸಿದೆ, ಇದನ್ನು ಕಂಪನಿಯು ತನ್ನ ಅತ್ಯಂತ ಬಲಿಷ್ಠ ಬಿಡುಗಡೆ ಎಂದು ಬಣ್ಣಿಸಿದೆ.
ದಾಳಿಯ ಹೊಸ ವರ್ಗ: ಫೇಕ್ ಚೈನ್ ಆಫ್ ಥಾಟ್
ಸೆಲ್ಫ್-ಪ್ಲೇ ಪ್ರಕ್ರಿಯೆಯು ಗಮನಾರ್ಹವಾದ "ಫೇಕ್ ಚೈನ್ ಆಫ್ ಥಾಟ್" (fake chain of thought) ದಾಳಿಯನ್ನು ಬಹಿರಂಗಪಡಿಸಿದೆ. LLMಗಳು ಹೆಚ್ಚಾಗಿ ಹಂತ-ಹಂತದ ತರ್ಕವನ್ನು—ಅಂದರೆ "ಚೈನ್ ಆಫ್ ಥಾಟ್"—ನೀಡುತ್ತವೆ, ಇದು ಅಂತಿಮ ಉತ್ತರಕ್ಕೆ ಮಾರ್ಗದರ್ಶನ ನೀಡುತ್ತದೆ. GPT-Red ಆ ತರ್ಕದಲ್ಲಿ ಸುಳ್ಳು ಮಾಹಿತಿಯನ್ನು ಸೇರಿಸುವುದನ್ನು ಕಲಿತಿದೆ, ಇದರಿಂದ ಮಾಡೆಲ್ ತಾನು ಈಗಾಗಲೇ ತಪ್ಪು ಸತ್ಯಗಳನ್ನು ಪರಿಶೀಲಿಸಿದೆ ಎಂದು ಭಾವಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, "1 + 1 = 3" ಎಂದು ಪರಿಶೀಲಿಸಲಾಗಿದೆ ಎಂದು ದಾಳಿಕಾರ ಮಾಡೆಲ್ ಅನ್ನು ನಂಬಿಸಬಹುದು, ಇದು ಸಿಸ್ಟಮ್ ಅನ್ನು ಸೃಷ್ಟಿಕೃತ ಫಲಿತಾಂಶದ ಆಧಾರದ ಮೇಲೆ ಔಟ್ಪುಟ್ ನೀಡುವಂತೆ ಪ್ರೇರೇಪಿಸುತ್ತದೆ.
ಈ ದಾಳಿಯು ಕೇವಲ ಪಠ್ಯ ಜನರೇಟರ್ಗಳಿಗೆ ಸೀಮಿತವಾಗಿಲ್ಲ. ಬಾಹ್ಯ ಪ್ರಯೋಗಾಲಯವು ನಿರ್ಮಿಸಿದ "Vendy" ಎಂಬ ವೆಂಡಿಂಗ್-ಮಷೀನ್ ಶೈಲಿಯ ಏಜೆಂಟ್ಗೆ ವಿರುದ್ಧವಾಗಿ ನಡೆಸಿದ ಪರೀಕ್ಷೆಯಲ್ಲಿ, GPT-Red ಬೆಲೆಗಳನ್ನು ಬದಲಾಯಿಸಿತು ಮತ್ತು ಆರ್ಡರ್ಗಳನ್ನು ರದ್ದುಗೊಳಿಸಿತು, ಈ ತಂತ್ರವು ಬಳಕೆದಾರರ ಆದೇಶಗಳ ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ವಿಶೇಷ ಏಜೆಂಟ್ಗಳ ವಿರುದ್ಧವೂ ಕೆಲಸ ಮಾಡುತ್ತದೆ ಎಂದು ಇದು ಸಾಬೀತುಪಡಿಸಿದೆ.
ಅಳೆಯಬಹುದಾದ ಭದ್ರತಾ ಸುಧಾರಣೆ
GPT-Red ವಿರುದ್ಧ ತರಬೇತಿಯ ಪ್ರಭಾವವನ್ನು ತೋರಿಸುವ ಅಂಕಿಅಂಶಗಳನ್ನು OpenAI ಬಿಡುಗಡೆ ಮಾಡಿದೆ. ಹೊಸ ಮಾಡೆಲ್ನಿಂದ ಸೃಷ್ಟಿಸಲಾದ ಅತ್ಯಂತ ಬಲವಾದ ದಾಳಿಗಳನ್ನು ಆಗಸ್ಟ್ನಲ್ಲಿ ಬಿಡುಗಡೆಯಾದ GPT-5 ವಿರುದ್ಧ ನಡೆಸಿದಾಗ, ಶೇಕಡಾ 90 ಕ್ಕಿಂತ ಹೆಚ್ಚು ದಾಳಿಗಳು ಯಶಸ್ವಿಯಾದವು. ಅದೇ ದಾಳಿಗಳನ್ನು GPT-5.6 ವಿರುದ್ಧ ನಡೆಸಿದಾಗ ಶೇಕಡಾ 23 ಕ್ಕಿಂತ ಕಡಿಮೆ ಯಶಸ್ವಿಯಾದವು.
2025 ರ ಪ್ರಯೋಗದಲ್ಲಿ GPT-Red ಅನ್ನು ಮಾನವ ರೆಡ್-ಟೀಮರ್ಗಳ ವಿರುದ್ಧ ಎದುರಿಸಿಸಿದಾಗ, AI ಮಾನವರಿಗಿಂತ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ದಾಳಿಗಳ ವೈವಿಧ್ಯತೆಯನ್ನು ಪತ್ತೆಹಚ್ಚಿತು ಮತ್ತು ಸುಧಾರಿಸಿತು. ಇದು ಒಂದು ಅಡ್ವರ್ಸರಿಯಲ್ ಮಾಡೆಲ್ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಹೆಚ್ಚಿನ ದೌರ್ಬಲ್ಯಗಳ (vulnerability) ಪ್ರದೇಶಗಳನ್ನು ಅನ್ವೇಷಿಸಬಲ್ಲದು ಎಂದು ಸೂಚಿಸುತ್ತದೆ.
ಮಿತಿಗಳು ಮತ್ತು ಮಾನವ ಪರಿಣತಿಯ ನಿರಂತರ ಅಗತ್ಯತೆ
GPT-Red ಮಾನವ ಭದ್ರತಾ ವಿಶ್ಲೇಷಕರನ್ನು ಬದಲಿಸುವುದಿಲ್ಲ. ಇದು ಮಲ್ಟಿ-ಟರ್ನ್ ಸಂಭಾಷಣಾ ದಾಳಿಗಳು (ಎಲ್ಲಿ ದಾಳಿಕಾರವು ಹಲವಾರು ಸಂಭಾಷಣೆಗಳ ಮೂಲಕ ಕಥೆಯನ್ನು ನಿರ್ಮಿಸುತ್ತಾನೆ) ಮತ್ತು ಚಿತ್ರಗಳ ಒಳಗೆ ದುರುದ್ದೇಶಪೂರಿತ ಪಠ್ಯವನ್ನು ಅಡಗಿಸುವ ವಿವಿಶುವಲ್ ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ಗಳ ವಿಷಯದಲ್ಲಿ ಇನ್ನೂ ಎಡವುತ್ತದೆ. OpenAI ಈ ಮಾಡೆಲ್ ಅನ್ನು ಮೊದಲ ಹಂತದ ತನಿಖಾ ಸಾಧನವಾಗಿ ಬಳಸಲು ಯೋಜಿಸಿದೆ, ಇದು ಭದ್ರತಾ ತಜ್ಞರು ತನಿಖೆ ಮಾಡಲು ಮತ್ತು ವಿಸ್ತರಿಸಲು ಉಪಯುಕ್ತವಾದ ದಾಳಿಗಳ ಕಲ್ಪನೆಗಳನ್ನು ನೀಡುತ್ತದೆ.
ಈ ಸಾಧನವು ಮಾಲೀಕತ್ವದ (proprietary) ಆಗಿರುವುದರಿಂದ, ಬಾಹ್ಯ ಸಂಶೋಧಕರು ಇದರ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ನೇರವಾಗಿ ಪರೀಕ್ಷಿಸಲು ಅಥವಾ ವರದಿಯಾದ ಲಾಭಗಳನ್ನು ಪರಿಶೀಲಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.
