에이전트 기반 검색(Agentic retrieval)은 기존의 검색 증강 생성(RAG) 파이프라인 이후의 다음 단계로 주목받고 있으며, 환각 현상을 멈추고 정보를 어떻게 가져올지 "생각"하기 시작하는 프로덕션 AI 시스템을 약속합니다. 지지자들은 이 접근 방식이 전체 코퍼스를 모델의 컨텍스트 창에 넣는 것과 비교했을 때, 대규모 문서 컬렉션에서 쿼리에 답변하는 비용을 최대 82배까지 절감할 수 있다고 말하며, 이는 생성형 AI를 확장하려는 모든 기업에 중요한 절감 요소입니다.
기존 RAG 파이프라인의 한계
전형적인 RAG 워크플로우는 고정된 시퀀스를 따릅니다. 문서를 청크(chunk)로 나누고, 각 청크를 밀집 벡터 공간(dense vector space)에 임베딩한 다음, 사용자 쿼리에 대해 점수가 가장 높은 벡터를 추출합니다. 데모에서는 이 방식이 깔끔해 보입니다. 모델은 몇 개의 "관련 있는" 구절을 전달받아 자신 있게 답변합니다. 하지만 실제 프로덕션 환경에서는 그 자신감이 잘못된 경우가 많습니다.
세 가지 시스템적 결함이 이 문제를 야기합니다:
- 벡터 유사도 ≠ 관련성. 두 구절이 수학적으로는 가까울 수 있지만 서로 반대되는 사실을 표현할 수 있으며, 이로 인해 모델이 잘못된 주장을 인용하게 됩니다.
- 파편화로 인한 사실 단절. 고정된 청킹(chunking) 방식은 종종 단일 문장을 반으로 나눕니다. 모델이 절반만 받게 되면 누락된 부분을 재구성할 수 없습니다.
- 정제되지 않은 쿼리. 실제 세계의 질문은 대부분의 임베딩 모델의 학습 데이터와 차이가 있어, 유사도 검색이 관련 없는 청크를 반환합니다.
파이프라인이 잘못된 컨텍스트를 반환하더라도 다운스트림 언어 모델은 여전히 높은 확신을 가지고 답변을 생성하며, 시스템은 오류를 발생시키지 않습니다. 그 결과, 라이브 서비스에서 감지하기 어려운 조용한 실패인 '조용한 환각(silent hallucination)'이 발생합니다.
하이브리드 검색: 점진적인 해결책
일반적인 대응책은 밀집 벡터 위에 키워드 검색을 계층화하여, 임베딩이 놓칠 수 있는 정확한 용어 일치를 잡아낼 수 있는 하이브리드 검색기를 만드는 것입니다. 학습된 관련성 점수를 기반으로 검색된 목록의 순서를 재조정하는 두 번째 모델인 리랭커(reranker)를 추가하면 정밀도를 더욱 높일 수 있습니다.
하지만 하이브리드 검색 역시 정적인 스크립트를 따릅니다. 난이도나 불확실성에 관계없이 모든 쿼리가 동일한 일련의 단계를 트리거합니다. 파이프라인은 더 많은 데이터가 필요한지, 복잡한 질문을 어떻게 하위 질문으로 나눌지, 또는 검색된 스니펫이 불충분한 시점이 언제인지를 스스로 결정할 수 없습니다.
에이전트 기반 검색: 검색을 의사 결정 과정으로 취급
에이전트 기반 검색은 이 문제를 인간 연구원을 모방하는 자율적인 "에이전트"가 내리는 일련의 결정으로 재정의합니다. 에이전트는 다음과 같은 작업을 수행할 수 있습니다:
- 쿼리 재작성. 검색 전 구어체나 모호한 표현을 정규화하여 검색 모델이 의도를 이해할 확률을 높입니다.
- 검색 필요 여부 판단. 간단한 쿼리의 경우 에이전트가 직접 답변하여 토큰을 절약하고 불필요한 노이즈를 방지합니다.
- 다단계 검색 계획. 복잡한 질문은 더 작은 하위 질문으로 분해되어 각각 독립적으로 검색된 후 다시 결합됩니다.
- 자기 수정. 초기 결과가 약해 보이면(예: 낮은 신뢰도 점수 또는 모순된 증거), 에이전트는 다른 방식으로 쿼리를 다시 발행하거나 검색 범위를 넓힙니다.
비용 논쟁: 롱 컨텍스트 vs. 검색
일부 논평가들은 점점 더 커지는 컨텍스트 창이 검색을 불필요하게 만든다고 주장합니다. 이에 대한 반론은 실용적입니다. 방대한 코퍼스를 모델의 컨텍스트에 넣는 비용은 집중된 검색보다 수십 배 더 많이 듭니다. 추정치에 따르면 대규모 데이터셋의 경우 검색이 8배에서 82배 더 저렴하면서도 정확한 답변에 필요한 컨텍스트 근거를 제공할 수 있습니다. 롱 컨텍스트(long context) 창은 작고 정제된 문서 세트에 대한 미묘한 추론에는 여전히 유용하지만, 확장 가능한 검색을 대체할 수는 없습니다.
투명성 및 검증
프로덕션급 AI 어시스턴트는 반드시 출처를 공개해야 합니다. 에이전트 기반 검색은 각 주장에 인용을 첨부할 수 있어, 사람이 팩트 체크 과정을 검증할 수 있게 해줍니다. 이러한 "과정 보여주기(show-your-work)" 방식은 신뢰를 구축하고, 에이전트가 향후 상호작용에서 피해야 할 약한 검색 경로를 드러냅니다.
향후 주목할 점
- 도구(Tooling).
- 평가 표준.
- 기업용 파일럿 프로젝트.
핵심 요약
에이전트 기반 검색은 많은 데모를 지배하고 있는 정적이고 오류가 발생하기 쉬운 RAG 파이프라인을 넘어섭니다. AI 시스템이 언제 어떻게 검색할지를 스스로 결정하게 함으로써, 토큰 사용량을 줄이고 비용을 획기적으로 절감하며, 무엇보다 모든 답변에 대해 검증 가능한 출처를 제공합니다.
