AWS قابلیت فشرده‌سازی آگاه از پرس‌وجو (query-aware compression) را به سرویس Bedrock خود اضافه کرده است که به توسعه‌دهندگان اجازه می‌دهد بخش‌های نامرتبط اسناد را پیش از رسیدن به مدل زبانی حذف کنند. این ویژگی با کاهش تعداد توکن‌هایی که به مدل ارسال می‌شوند، می‌تواند هزینه‌های پردازشی خط لوله‌های تولید تقویت‌شده با بازیابی (RAG) را کاهش دهد.

چرا خط لوله‌های RAG هزینه‌بر هستند

سیستم‌های RAG ابتدا بخش‌هایی از متن را از یک پایگاه دانش استخراج می‌کنند و سپس آن بخش‌ها را برای پاسخ به سؤال کاربر به یک مدل مولد می‌فرستند. در اکثر پیاده‌سازی‌ها، تمام تکه‌های بازیابی‌شده مستقیماً به مدل ارسال می‌شوند، حتی زمانی که بخش‌های بزرگی از متن هیچ ارتباطی با پرس‌وجو نداشته باشند. هر کلمه اضافی به یک توکن تبدیل می‌شود و هر توکنی که مدل پردازش می‌کند، به هزینه API زیرساختی می‌افزاید. برای شرکت‌های کوچک و متوسط که بات‌های پشتیبانی یا ابزارهای جستجوی داخلی را اجرا می‌کنند، هزینه توکن‌ها می‌تواند به سرعت از هزینه خودِ فراخوانی‌های مدل فراتر رود.

فشرده‌سازی آگاه از پرس‌وجو چه کاری انجام می‌دهد

قابلیت جدید Bedrock یک مرحله فیلتر کردن را بین بازیابی (retrieval) و تولید (generation) قرار می‌دهد:

  • سیستم همچنان همان مجموعه اسناد را برای یک پرس‌وجو استخراج می‌کند.
  • پیش از آنکه متن توسط مدل دیده شود، یک پردازشگر سبک‌وزن هر بخش را نسبت به سؤال خاص ارزیابی می‌کند.
  • تنها بخش‌هایی که مرتبط تشخیص داده شوند حفظ می‌شوند؛ بقیه موارد به عنوان نویز حذف می‌گردند.

شما به ایندکس جدید، مدل embedding یا یک مدل زبانی fine-tuned نیاز ندارید. این تغییر صرفاً بازطراحی مجدد خط لوله برای فراخوانی لایه فشرده‌سازی است.

تأثیر تجاری

از آنجایی که هزینه‌های توکن با میزان متن ارسالی به مدل افزایش می‌یابد، حذف قطعات نامرتبط می‌تواند صورت‌حساب را خط‌به‌خط کاهش دهد. شرکت‌هایی که شاهد افزایش شدید هزینه‌های RAG خود با گسترش مقیاس استفاده بوده‌اند، بیشترین سود را از این قابلیت خواهند برد.

آنچه باید در ادامه زیر نظر داشت

  • قابلیت مذکور را روی داده‌های خود آزمایش کنید: یک تست مقایسه‌ای بین جریان استاندارد RAG و جریانی که شامل فشرده‌سازی آگاه از پرس‌وجو است، انجام دهید. تعداد توکن‌ها، تأخیر (latency) و میزان مرتبط بودن پاسخ را اندازه‌گیری کنید.
  • شفافیت فروشنده: هنگام ارزیابی پلتفرم‌های RAG شخص ثالث، بپرسید که آیا آن‌ها از فشرده‌سازی یا فیلتر کردن در خط لوله‌های بازیابی خود استفاده می‌کنند یا خیر. فروشنده‌ای که تکه‌های خام را ارسال می‌کند، احتمالاً صورت‌حساب‌های ماهانه بالاتری ایجاد خواهد کرد.

خلاصه کلام

یک تغییر کوچک در خط لوله — یعنی فیلتر کردن متن‌های نامرتبط پیش از رسیدن به مدل — می‌تواند یک هزینه پنهان را به یک مورد قابل کنترل در صورت‌حساب تبدیل کند. برای سازمان‌هایی که در حال حاضر هزینه RAG مبتنی بر Bedrock را پرداخت می‌کنند، فعال کردن فشرده‌سازی آگاه از پرس‌وجو یک آزمایش کم‌هزینه است، اما میزان صرفه‌جویی به داده‌های خاص شما بستگی خواهد داشت.