OpenAI hôm nay đã ra mắt GPT-Red, một mô hình ngôn ngữ lớn đóng vai trò như một hacker red-team tự động. Hệ thống này hiện đang giúp tăng cường bảo mật cho mô hình GPT-5.6 mới nhất của công ty, giúp giảm mạnh tỷ lệ thành công của các cuộc tấn công mô phỏng từ hơn 90% xuống còn dưới 23%.

Cách GPT-Red tự động hóa công việc red-team

Kiểm thử red-team—việc cố tình tìm cách phá vỡ hoặc chiếm quyền điều khiển một hệ thống—từ trước đến nay vốn dựa vào các chuyên gia bảo mật. Khi các LLM học cách duyệt web, chạy mã và gọi các dịch vụ bên thứ ba, các phương thức có thể bị lạm dụng sẽ tăng lên nhanh hơn mức mà một đội ngũ con người có thể khám phá.

OpenAI đã giải quyết vấn đề này bằng một "vòng lặp tự chơi" (self-play loop) cho phép một bản sao của mô hình đối đầu với một bản sao khác bên trong một môi trường mô phỏng mà các nhà nghiên cứu gọi là dojo. Trong môi trường sandbox này, GPT-Red đóng vai trò kẻ tấn công trong khi một hoặc nhiều mô hình phòng thủ cố gắng chống lại. Hai bên thực hiện vô số vòng đấu; mỗi lần lặp lại buộc kẻ tấn công phải phát hiện ra những lỗ hổng tinh vi hơn và bên phòng thủ phải học các phương thức phòng vệ mới. OpenAI đã tích hợp quy trình này vào quy trình huấn luyện tạo ra GPT-5.6, mô hình mà công ty quảng bá là bản phát hành mạnh mẽ nhất từ trước đến nay.

Một loại hình tấn công mới: chuỗi suy nghĩ giả (fake chain of thought)

Các lượt chạy tự chơi đã phát hiện ra một cuộc tấn công "chuỗi suy nghĩ giả" (fake chain of thought) đầy kinh ngạc. Các LLM thường đưa ra một vết truy vết lập luận từng bước—một "chuỗi suy nghĩ" (chain of thought)—để dẫn dắt đến câu trả lời cuối cùng. GPT-Red đã học được cách chèn các nội dung sai lệch vào vết truy vết đó, khiến mô hình nghĩ rằng nó đã xác minh các tiền đề sai. Ví dụ, kẻ tấn công có thể thuyết phục mô hình rằng “1 + 1 = 3” đã được kiểm tra, từ đó thúc đẩy hệ thống tạo ra các kết quả dựa trên kết quả giả mạo đó.

Cuộc tấn công này không chỉ giới hạn ở các trình tạo văn bản thuần túy. Trong một thử nghiệm chống lại “Vendy”, một tác nhân (agent) kiểu máy bán hàng tự động được xây dựng bởi một phòng thí nghiệm bên ngoài, GPT-Red đã thao túng các trường giá và hủy các đơn hàng, chứng minh rằng kỹ thuật này có hiệu quả đối với các tác nhân chuyên biệt hoạt động theo lệnh của người dùng.

Sự cải thiện bảo mật có thể đo lường được

OpenAI đã công bố các số liệu cho thấy tác động của việc huấn luyện chống lại GPT-Red. Khi các cuộc tấn công mạnh nhất do mô hình mới tạo ra được thực hiện nhắm vào GPT-5 (phiên bản phát hành vào tháng 8), hơn 90% đã thành công. Tuy nhiên, cùng các cuộc tấn công đó khi nhắm vào GPT-5.6 thì tỷ lệ thành công chưa đến 23%.

Trong một thí nghiệm năm 2025 đối đầu giữa GPT-Red và các chuyên gia red-team là con người, AI đã phát hiện và tinh chỉnh các biến thể tấn công hiệu quả hơn con người, cho thấy một mô hình đối kháng có thể khám phá một phạm vi lỗ hổng rộng hơn trong thời gian ngắn hơn.

Các giới hạn và nhu cầu tiếp tục về chuyên môn con người

GPT-Red không thay thế các nhà phân tích bảo mật là con người. Nó vẫn còn gặp khó khăn với các cuộc tấn công hội thoại đa lượt (multi-turn conversational attacks), nơi kẻ tấn công xây dựng một kịch bản qua nhiều lượt trao đổi, và với các cuộc tấn công chèn câu lệnh hình ảnh (visual prompt injections) nhằm ẩn văn bản độc hại bên trong hình ảnh. OpenAI có kế hoạch sử dụng mô hình này như một công cụ thăm dò hàng đầu, đưa ra các ý tưởng tấn công đầy triển vọng để các chuyên gia con người nghiên cứu và mở rộng.

Công cụ này vẫn là tài sản độc quyền, vì vậy các nhà nghiên cứu bên ngoài không thể trực tiếp kiểm tra khả năng của nó hoặc xác minh các kết quả đạt được như đã báo cáo.