بازیابی عامل‌محور (Agentic retrieval) به عنوان گام بعدی پس از خط‌لوله‌های سنتی تولید مبتنی بر بازیابی (RAG) معرفی می‌شود؛ این روش وعده می‌دهد که سیستم‌های هوش مصنوعی تولیدی، از توهم دست کشیده و شروع به «فکر کردن» درباره نحوه بازیابی اطلاعات کنند. طرفداران این رویکرد می‌گویند که این روش می‌تواند هزینه پاسخگویی به یک پرس‌وجو در مجموعه‌ اسناد بزرگ را در مقایسه با تغذیه کل بدنه متن به پنجره بافت (context window) یک مدل، تا ۸۲ برابر کاهش دهد؛ صرفه‌جویی‌ای که برای هر کسب‌وکاری که در حال مقیاس‌بندی هوش مصنوعی مولد است، حیاتی است.

چرا خط‌لوله قدیمی RAG کارایی لازم را ندارد

جریان کاری کلاسیک RAG یک توالی ثابت است: تقسیم اسناد به تکه‌های کوچک (chunks)، جاسازی (embed) هر تکه در یک فضای برداری چگال، و سپس استخراج برداری‌های با بالاترین امتیاز برای یک پرس‌وجوی کاربر. در دموها، این روش مرتب به نظر می‌رسد—مدل چند قطعه «مرتبط» دریافت می‌کند و با اطمینان پاسخ می‌دهد. با این حال، در محیط عملیاتی، این اطمینان اغلب بی‌مورد است.

سه نقص سیستماتیک عامل این مشکل هستند:

  • شباهت برداری $\neq$ مرتبط بودن. دو قطعه می‌توانند از نظر ریاضی به هم نزدیک باشند در حالی که حقایق متضادی را بیان می‌کنند، که باعث می‌شود مدل ادعای اشتباهی را نقل کند.
  • تکه‌تکه شدن باعث از بین رفتن واقعیت‌ها می‌شود. تکه‌تکه کردن ثابت (fixed chunking) معمولاً یک گزاره واحد را از وسط می‌برد. اگر مدل فقط نیمی از آن را دریافت کند، نمی‌تواند بخش مفقود شده را بازسازی کند.
  • پرس‌وجوهای نامنظم. سوالات دنیای واقعی با داده‌های آموزشی اکثر مدل‌های جاسازی (embedding models) تفاوت دارند، بنابراین جستجوی شباهت، تکه‌های غیرمرتبط را برمی‌گرداند.

وقتی خط‌لوله بافت (context) اشتباهی را برمی‌گرداند، مدل زبانی پایین‌دستی همچنان پاسخی تولید می‌کند، که اغلب با قطعیت بالا همراه است و سیستم خطایی گزارش نمی‌کند. نتیجه این است: توهم خاموش (silent hallucination)—شکستی بی‌صدا که تشخیص آن در یک سرویس زنده دشوار است.

بازیابی ترکیبی: یک اصلاح تدریجی

یک پاسخ رایج، لایه‌بندی جستجوی کلمات کلیدی بر روی بردارهای چگال است که یک بازیابی‌کننده ترکیبی (hybrid retriever) ایجاد می‌کند تا بتواند تطبیق دقیق عباراتی را که توسط جاسازی‌ها نادیده گرفته شده‌اند، شناسایی کند. افزودن یک بازرتبه‌بند (reranker)—مدل دومی که لیست بازیابی‌شده را بر اساس امتیاز مرتبط بودنِ یادگرفته‌شده، دوباره مرتب می‌کند—دقت را بیش از پیش بهبود می‌بخشد.

بازیابی ترکیبی همچنان از یک دستورالعمل ایستا پیروی می‌کند: هر پرس‌وجو، صرف‌نظر از میزان دشواری یا عدم قطعیت، همان سلسله مراحل را اجرا می‌کند. این خط‌لوله نمی‌تواند تصمیم بگیرد که آیا به داده‌های بیشتری نیاز دارد، چگونه یک سوال پیچیده را به زیرسوال‌ها تقسیم کند، یا چه زمانی یک قطعه بازیابی‌شده ناکافی است.

بازیابی عامل‌محور، جستجو را به عنوان یک فرآیند تصمیم‌گیری در نظر می‌گیرد

بازیابی عامل‌محور، مسئله را به صورت مجموعه‌ای از تصمیمات گرفته شده توسط یک «عامل» (agent) خودگردان بازتعریف می‌کند که از یک پژوهشگر انسانی تقلید می‌کند. این عامل می‌تواند:

  • پرس‌وجو را بازنویسی کند. قبل از جستجو، عبارات عامیانه یا مبهم را استانداردسازی می‌کند تا احتمال درک قصد کاربر توسط مدل‌های بازیابی بهبود یابد.
  • بررسی کند که آیا به بازیابی نیاز است یا خیر. برای پرس‌وجوهای ساده، عامل مستقیماً پاسخ می‌دهد که باعث صرفه‌جویی در توکن‌ها و جلوگیری از نویز غیرضروری می‌شود.
  • برای یک جستجوی چندمرحله‌ای برنامه‌ریزی کند. سوالات پیچیده به زیرسوال‌های کوچک‌تر تجزیه می‌شوند، هر کدام به طور مستقل جستجو شده و سپس دوباره ترکیب می‌شوند.
  • خوداصلاحی کند. اگر نتیجه اولیه ضعیف به نظر برسد—مثلاً امتیازهای اطمینان پایین یا شواهد متناقض—عامل پرس‌وجو را با فرمول‌بندی متفاوتی مجدداً ارسال می‌کند یا دامنه جستجو را گسترش می‌دهد.

استدلال‌های هزینه‌ای: بافت طولانی در مقابل بازیابی

برخی تحلیلگران استدلال می‌کنند که بزرگ‌تر شدن مداوم پنجره‌های بافت (context windows)، بازیابی را منسوخ می‌کند. پاسخ متقابل، عمل‌گرایانه است: تغذیه یک بدنه عظیم از متن به بافت یک مدل، چندین مرتبه گران‌تر از یک بازیابی متمرکز است. تخمین‌ها نشان می‌دهد که بازیابی برای مجموعه‌داده‌های بزرگ، ۸ تا ۸۲ برابر ارزان‌تر است، در حالی که همچنان زمینه‌سازی بافتی مورد نیاز برای پاسخ‌های دقیق را فراهم می‌کند. پنجره‌های بافت طولانی برای استدلال‌های ظریف روی مجموعه‌ای کوچک و منتخب از اسناد همچنان مفید هستند، اما نمی‌توانند جایگزین جستجوی مقیاس‌پذیر شوند.

شفافیت و تأیید

یک دستیار هوش مصنوعی در سطح عملیاتی باید منابع خود را نمایش دهد. بازیابی عامل‌محور می‌تواند به هر ادعا یک ارجاع (citation) پیوست کند و به یک بازبین انسانی اجازه دهد تا مسیر تأیید واقعیت را بررسی کند. این رویکرد «نمایش نحوه انجام کار»، اعتماد ایجاد می‌کند و مسیرهای بازیابی ضعیفی را آشکار می‌سازد که عامل می‌تواند یاد بگیرد در تعاملات آینده از آن‌ها اجتناب کند.

آنچه در آینده باید زیر نظر داشت

  • ابزارسازی.
  • استانداردهای ارزیابی.
  • پروژه‌های آزمایشی سازمانی.

خلاصه کلام

بازیابی عامل‌محور از خط‌لوله‌های ایستا و مستعد خطای RAG که بر بسیاری از دموها حاکم هستند، فراتر می‌رود. با اجازه دادن به یک سیستم هوش مصنوعی برای تصمیم‌گیری درباره زمان و نحوه جستجو، مصرف توکن را کاهش می‌دهد، هزینه‌ها را به شدت پایین می‌آورد و—از همه مهم‌تر—منابع قابل تأیید را برای هر پاسخ ارائه می‌دهد.