AWS는 Bedrock 서비스에 쿼리 인식 압축(query-aware compression) 기능을 추가하여, 개발자가 언어 모델에 도달하기 전에 관련 없는 문서 청크를 제거할 수 있도록 했습니다. 모델로 전송되는 토큰 수를 줄임으로써, 이 기능은 검색 증강 생성(RAG) 파이프라인의 컴퓨팅 비용을 낮출 수 있습니다.
RAG 파이프라인의 비용 부담이 큰 이유
RAG 시스템은 먼저 지식 베이스에서 텍스트 구절을 가져온 다음, 사용자의 질문에 답하기 위해 해당 구절을 생성형 모델에 전달합니다. 대부분의 구현 방식은 텍스트의 상당 부분이 질문과 관련이 없는 경우에도 검색된 모든 청크를 모델로 직접 전달합니다. 추가되는 단어 하나하나가 토큰이 되며, 모델이 처리하는 모든 토큰은 기반 API 비용을 증가시킵니다. 고객 지원 봇이나 내부 검색 도구를 운영하는 중소기업의 경우, 토큰 비용이 모델 호출 비용 자체를 빠르게 상회할 수 있습니다.
쿼리 인식 압축의 작동 방식
새로운 Bedrock 기능은 검색(retrieval)과 생성(generation) 단계 사이에 필터링 단계를 삽입합니다.
- 시스템은 여전히 쿼리에 대해 동일한 문서 세트를 가져옵니다.
- 모델이 텍스트를 확인하기 전에, 경량 프로세서가 각 구절을 특정 질문과 대조하여 평가합니다.
- 관련이 있다고 판단된 부분만 유지되며, 그 외의 모든 내용은 노이즈로 간주하여 폐기됩니다.
새로운 인덱스, 임베딩 모델 또는 미세 조정된 언어 모델이 필요하지 않습니다. 단순히 압축 레이어를 호출하도록 파이프라인을 재구성하기만 하면 됩니다.
비즈니스 영향
모델로 전송되는 텍스트 양에 따라 토큰 요금이 증가하므로, 관련 없는 스니펫을 제거하면 청구 금액을 항목별로 줄일 수 있습니다. 사용량이 늘어남에 따라 RAG 비용이 급증하는 것을 경험한 기업들이 가장 큰 이점을 얻을 것입니다.
향후 주목할 점
- 자체 데이터를 활용한 기능 파일럿 테스트: 표준 RAG 흐름과 쿼리 인식 압축을 포함한 흐름을 병행 테스트하십시오. 토큰 수, 지연 시간(latency), 답변의 관련성을 측정하십시오.
- 벤더 투명성: 타사 RAG 플랫폼을 평가할 때, 검색 파이프라인에서 압축이나 필터링을 사용하는지 문의하십시오. 가공되지 않은 청크를 그대로 전달하는 벤더는 월간 청구 금액이 더 높을 가능성이 큽니다.
결론
모델에 도달하기 전에 관련 없는 텍스트를 필터링하는 소규모 파이프라인 수정만으로도, 숨겨진 비용을 관리 가능한 항목으로 전환할 수 있습니다. 이미 Bedrock 기반의 RAG를 사용 중인 조직이라면 쿼리 인식 압축을 활성화하는 것은 적은 노력으로 할 수 있는 실험이지만, 실제 절감 효과는 사용 중인 특정 데이터에 따라 달라질 것입니다.
