AI 컨텍스트 압축이 당신의 지침을 조용히 무시하는 이유

대규모 언어 모델(LLM)과의 대화가 길어짐에 따라, 개발자들은 토큰 제한을 관리하고 성능 병목 현상을 방지하기 위해 "컨텍스트 압축(context compression)" 또는 압축(compaction) 기술에 점점 더 의존하고 있습니다. 하지만 새로운 연구에 따르면 이러한 최적화 방식에는 치명적인 결함이 있습니다. AI 시스템이 공간을 절약하기 위해 대화 기록을 요약할 때, 자신의 행동을 규정하도록 설계된 바로 그 규칙들을 빈번하게 폐기한다는 사실이 밝혀졌습니다.

세션 제약 조건의 취약성

AI 시스템이 압축 과정을 거칠 때, 주요 목표는 작업의 연속성(목표, 현재 상태, 필요한 다음 단계 유지)을 보존하는 것입니다. 이는 대화의 "무엇(what)"은 보존하지만, 종종 "어떻게(how)"를 희생시킵니다.

펜실베이니아 주립대학교(Penn State) 연구진은 "세션 제약 조건(session constraints)"이 이 과정에서 가장 먼저 희생되는 요소임을 확인했습니다. 이는 "답변할 때 내 이름을 절대 사용하지 마세요" 또는 *"변경 사항을 적용하기 전에 나에게 확인을 받으세요"*와 같이 사용자가 부여한 비영구적인 규칙을 의미합니다. 이러한 지침은 핵심 작업이나 영구적인 시스템 프롬프트의 일부가 아니기 때문에, 압축 알고리즘은 이를 부차적인 세부 사항으로 간주하고 더 관련성 높은 데이터를 위한 공간을 확보하기 위해 삭제해 버립니다.

COMPINT 연구 결과: 17%의 생존율

이러한 성능 저하를 수치화하기 위해 연구진은 COMPINT 평가 스위트를 개발했습니다. 결과는 충격적이었습니다. 평균적으로 주입된 세션 제약 조건 중 단 17%만이 압축 과정을 통과하여 살아남았습니다.

이 연구는 규칙 준수율의 급격한 하락을 강조했습니다. 에이전트가 압축되지 않은 전체 컨텍스트에 접근할 수 있을 때 준수율은 보통 59%에서 71% 사이를 유지합니다. 하지만 압축이 발생하면 준수율은 급락하며, 종종 제약 조건이 전혀 제공되지 않은 시나리오와 거의 구별할 수 없는 수준까지 떨어집니다.

이는 단순히 대화의 뉘앙스 문제가 아니라, 중대한 보안 및 신뢰성 리스크입니다. 에이전트 워크플로우(agentic workflows)에서 *"승인 없이 코드를 실행하지 마세요"*와 같은 제약 조건이 유실되면, 승인되지 않은 도구 호출, 데이터 유출, 또는 캘린더나 이메일 같은 외부 시스템에 대한 검증되지 않은 변경으로 이어질 수 있습니다.

Qwen3.5-9B를 통한 경량 솔루션

주요 AI 연구소들이 사용하는 복잡한 압축 로직을 전면 수정하는 대신, 연구진은 "플러그 앤 플레이(plug-and-play)" 방식의 아키텍처 수정을 제안합니다. 이들은 특화된 추출기(extractor) 역할을 하도록 설계된 Qwen3.5-9B 모델 기반의 작은 애드온 모듈을 개발했습니다.

이 모듈은 다음과 같이 작동합니다:

  1. 실시간으로 모든 사용자 입력을 스캔하여 세션 제약 조건을 감지하고 분리합니다.
  2. 이러한 규칙들을 위한 전용 독립 목록을 유지합니다.
  3. 메인 시스템이 압축을 수행할 때마다 이 정제된 목록을 요약본에 추가합니다.

이 접근 방식의 결과는 매우 효과적이었습니다. 이 추출기는 에이전트 궤적(agent trajectories)에 대해 95.6%, 멀티턴 대화(multi-turn chats)에 대해 90.3%의 성공률을 포함하여, 다양한 테스트 시나리오에서 90% 이상의 유지율을 달성했습니다. 이 방법은 기본 모델을 재학습시킬 필요가 없고 기존 압축 인프라를 변경할 필요도 없기 때문에, 더욱 신뢰할 수 있는 롱 컨텍스트(long-context) AI 상호작용을 향한 확장 가능한 경로를 제공합니다.

핵심 요약

  • 제약 조건 삭제: 컨텍스트 압축은 행동 규칙보다 작업 목표를 우선시하므로, 요약 과정에서 사용자가 설정한 대부분의 "세션 제약 조건"이 유실됩니다.
  • 보안 리스크: '인간 개입(human-in-the-loop)' 검증 요구 사항과 같은 지침의 유실은 승인되지 않은 에이전트 동작과 보안 침해로 이어질 수 있습니다.
  • 모듈형 해결책: Qwen3.5-9B와 같은 작고 특화된 모델을 사용하여 제약 조건을 별도로 추적하면 지침 유지율을 90% 이상으로 회복할 수 있습니다.