بازیابی عاملمحور (Agentic retrieval) به عنوان گام بعدی پس از خطلولههای سنتی تولید مبتنی بر بازیابی (RAG) معرفی میشود؛ این روش وعده میدهد که سیستمهای هوش مصنوعی تولیدی، از توهم دست کشیده و شروع به «فکر کردن» درباره نحوه بازیابی اطلاعات کنند. طرفداران این رویکرد میگویند که این روش میتواند هزینه پاسخگویی به یک پرسوجو در مجموعه اسناد بزرگ را در مقایسه با تغذیه کل بدنه متن به پنجره بافت (context window) یک مدل، تا ۸۲ برابر کاهش دهد؛ صرفهجوییای که برای هر کسبوکاری که در حال مقیاسبندی هوش مصنوعی مولد است، حیاتی است.
چرا خطلوله قدیمی RAG کارایی لازم را ندارد
جریان کاری کلاسیک RAG یک توالی ثابت است: تقسیم اسناد به تکههای کوچک (chunks)، جاسازی (embed) هر تکه در یک فضای برداری چگال، و سپس استخراج برداریهای با بالاترین امتیاز برای یک پرسوجوی کاربر. در دموها، این روش مرتب به نظر میرسد—مدل چند قطعه «مرتبط» دریافت میکند و با اطمینان پاسخ میدهد. با این حال، در محیط عملیاتی، این اطمینان اغلب بیمورد است.
سه نقص سیستماتیک عامل این مشکل هستند:
- شباهت برداری $\neq$ مرتبط بودن. دو قطعه میتوانند از نظر ریاضی به هم نزدیک باشند در حالی که حقایق متضادی را بیان میکنند، که باعث میشود مدل ادعای اشتباهی را نقل کند.
- تکهتکه شدن باعث از بین رفتن واقعیتها میشود. تکهتکه کردن ثابت (fixed chunking) معمولاً یک گزاره واحد را از وسط میبرد. اگر مدل فقط نیمی از آن را دریافت کند، نمیتواند بخش مفقود شده را بازسازی کند.
- پرسوجوهای نامنظم. سوالات دنیای واقعی با دادههای آموزشی اکثر مدلهای جاسازی (embedding models) تفاوت دارند، بنابراین جستجوی شباهت، تکههای غیرمرتبط را برمیگرداند.
وقتی خطلوله بافت (context) اشتباهی را برمیگرداند، مدل زبانی پاییندستی همچنان پاسخی تولید میکند، که اغلب با قطعیت بالا همراه است و سیستم خطایی گزارش نمیکند. نتیجه این است: توهم خاموش (silent hallucination)—شکستی بیصدا که تشخیص آن در یک سرویس زنده دشوار است.
بازیابی ترکیبی: یک اصلاح تدریجی
یک پاسخ رایج، لایهبندی جستجوی کلمات کلیدی بر روی بردارهای چگال است که یک بازیابیکننده ترکیبی (hybrid retriever) ایجاد میکند تا بتواند تطبیق دقیق عباراتی را که توسط جاسازیها نادیده گرفته شدهاند، شناسایی کند. افزودن یک بازرتبهبند (reranker)—مدل دومی که لیست بازیابیشده را بر اساس امتیاز مرتبط بودنِ یادگرفتهشده، دوباره مرتب میکند—دقت را بیش از پیش بهبود میبخشد.
بازیابی ترکیبی همچنان از یک دستورالعمل ایستا پیروی میکند: هر پرسوجو، صرفنظر از میزان دشواری یا عدم قطعیت، همان سلسله مراحل را اجرا میکند. این خطلوله نمیتواند تصمیم بگیرد که آیا به دادههای بیشتری نیاز دارد، چگونه یک سوال پیچیده را به زیرسوالها تقسیم کند، یا چه زمانی یک قطعه بازیابیشده ناکافی است.
بازیابی عاملمحور، جستجو را به عنوان یک فرآیند تصمیمگیری در نظر میگیرد
بازیابی عاملمحور، مسئله را به صورت مجموعهای از تصمیمات گرفته شده توسط یک «عامل» (agent) خودگردان بازتعریف میکند که از یک پژوهشگر انسانی تقلید میکند. این عامل میتواند:
- پرسوجو را بازنویسی کند. قبل از جستجو، عبارات عامیانه یا مبهم را استانداردسازی میکند تا احتمال درک قصد کاربر توسط مدلهای بازیابی بهبود یابد.
- بررسی کند که آیا به بازیابی نیاز است یا خیر. برای پرسوجوهای ساده، عامل مستقیماً پاسخ میدهد که باعث صرفهجویی در توکنها و جلوگیری از نویز غیرضروری میشود.
- برای یک جستجوی چندمرحلهای برنامهریزی کند. سوالات پیچیده به زیرسوالهای کوچکتر تجزیه میشوند، هر کدام به طور مستقل جستجو شده و سپس دوباره ترکیب میشوند.
- خوداصلاحی کند. اگر نتیجه اولیه ضعیف به نظر برسد—مثلاً امتیازهای اطمینان پایین یا شواهد متناقض—عامل پرسوجو را با فرمولبندی متفاوتی مجدداً ارسال میکند یا دامنه جستجو را گسترش میدهد.
استدلالهای هزینهای: بافت طولانی در مقابل بازیابی
برخی تحلیلگران استدلال میکنند که بزرگتر شدن مداوم پنجرههای بافت (context windows)، بازیابی را منسوخ میکند. پاسخ متقابل، عملگرایانه است: تغذیه یک بدنه عظیم از متن به بافت یک مدل، چندین مرتبه گرانتر از یک بازیابی متمرکز است. تخمینها نشان میدهد که بازیابی برای مجموعهدادههای بزرگ، ۸ تا ۸۲ برابر ارزانتر است، در حالی که همچنان زمینهسازی بافتی مورد نیاز برای پاسخهای دقیق را فراهم میکند. پنجرههای بافت طولانی برای استدلالهای ظریف روی مجموعهای کوچک و منتخب از اسناد همچنان مفید هستند، اما نمیتوانند جایگزین جستجوی مقیاسپذیر شوند.
شفافیت و تأیید
یک دستیار هوش مصنوعی در سطح عملیاتی باید منابع خود را نمایش دهد. بازیابی عاملمحور میتواند به هر ادعا یک ارجاع (citation) پیوست کند و به یک بازبین انسانی اجازه دهد تا مسیر تأیید واقعیت را بررسی کند. این رویکرد «نمایش نحوه انجام کار»، اعتماد ایجاد میکند و مسیرهای بازیابی ضعیفی را آشکار میسازد که عامل میتواند یاد بگیرد در تعاملات آینده از آنها اجتناب کند.
آنچه در آینده باید زیر نظر داشت
- ابزارسازی.
- استانداردهای ارزیابی.
- پروژههای آزمایشی سازمانی.
خلاصه کلام
بازیابی عاملمحور از خطلولههای ایستا و مستعد خطای RAG که بر بسیاری از دموها حاکم هستند، فراتر میرود. با اجازه دادن به یک سیستم هوش مصنوعی برای تصمیمگیری درباره زمان و نحوه جستجو، مصرف توکن را کاهش میدهد، هزینهها را به شدت پایین میآورد و—از همه مهمتر—منابع قابل تأیید را برای هر پاسخ ارائه میدهد.
