حافظه لاگ یک عامل LLM در محیط عملیاتی از یک فایل ۲ کیلوبایتی به ۲۹,۴۴۶ بایت افزایش یافت که باعث شد تعداد توکن‌هایی که عامل در هر اجرا می‌خواند از حدود ۵۰۰ به ۷,۳۶۰ برسد — هزینه‌ای پنهان که بدون هیچ هشداری در داشبورد نظارتی ظاهر شد. توسعه‌دهنده پشت این عامل می‌گوید افزایش بی‌صدای هزینه خواندن، نمونه‌ای ملموس از «انحراف هزینه عامل» (agent cost drift) است؛ مشکلی که می‌تواند حتی زمانی که سیستم به نظر عادی عمل می‌کند، بودجه‌ها را از بین ببرد.

انحراف هزینه عامل چیست؟

انحراف هزینه عامل توصیف‌کننده افزایش تدریجی هزینه محاسباتی عملیات روتین یک عامل هوش مصنوعی است که ناشی از رشد وضعیت (state) خودِ عامل است. در این مثال، عامل یک فایل لاگ کاری را نگه می‌دارد که ثبت می‌کند چرا موضوعات مقالات قبلی را رد کرده است. هر ورودی جدید یک پاراگراف استدلال اضافه می‌کند و فایل قبل از اینکه عامل محتوای جدید تولید کند، به طور کامل خوانده می‌شود. از آنجایی که لاگ به صورت درجه دوم (quadratic) گسترش می‌یابد — هر ورودی نه تنها طول خود را اضافه می‌کند بلکه به ورودی‌های قبلی نیز ارجاع می‌دهد — مقدار متنی که عامل باید جذب کند با گذشت زمان شتاب می‌گیرد.

این انحراف یک جهش ناگهانی یا شکست نیست؛ بلکه یک مالیات خطی است که به صورت مرکب افزایش می‌یابد. عامل همچنان روزانه دو مقاله تولید می‌کند و داشبورد هیچ خطایی نشان نمی‌دهد، با این حال هر اجرا اکنون ۷,۳۶۰ توکن مصرف می‌کند، در حالی که یک ماه پیش حدود ۵۰۰ توکن بود. از آنجایی که اکثر ارائه‌دهندگان LLM بر اساس هر توکن هزینه دریافت می‌کنند، افزایش توکن‌ها در هر اجرا مستقیماً به هزینه‌های عملیاتی بالاتر تبدیل می‌شود.

چرا این موضوع اهمیت دارد

  • تأثیر بر بودجه – قیمت‌گذاری مبتنی بر توکن به این معنی است که هر توکن اضافیِ خوانده شده، پولی است که خرج شده است. تعداد توکن‌ها از ۵۰۰ به ۷,۳۶۰ افزایش یافته است.

مکانیسم‌های پنهان

الگوی رشد فایل کلید ماجراست. یک لاگ خط‌به‌خط که صرفاً ورودی‌های جدید را اضافه می‌کند، به صورت خطی افزایش می‌یابد، اما چون هر ورودی دلیل رد شدن موارد قبلی را توضیح می‌دهد، طول متن به صورت مرکب افزایش می‌یابد. نتیجه یک منحنی رشد درجه دوم است: دو برابر شدن تعداد ورودی‌ها، اندازه فایل را بیش از دو برابر می‌کند و تعداد توکن‌های مورد نیاز برای پردازش آن حتی سریع‌تر رشد می‌کند.

توسعه‌دهندگان به ندرت متوجه افزایش هزینه می‌شوند زیرا هر ورودی «به تنهایی منطقی به نظر می‌رسد». خروجی عامل همچنان درست است و لاگ به هدف خود ادامه می‌دهد و این امر ناکارآمدی را پنهان می‌کند.

استراتژی کاهش اثر

توسعه‌دهنده یک بازسازی سه مرحله‌ای برای لاگ پیشنهاد می‌کند:

  • فایل ورودی‌های اخیر – نگهداری یک فایل کوچک که به طور فعال خوانده می‌شود و فقط شامل چند ورودی اخیر است که برای جلوگیری از تکرار فوری موارد لازم است.
  • شاخص فشرده – ذخیره یک خلاصه تک‌خطی برای ورودی‌های قدیمی‌تر. این شاخص را می‌توان به سرعت اسکن کرد تا بدون فراخوانی پاراگراف‌های کامل، تکراری بودن موضوع را بررسی کرد.
  • متن کامل آرشیو شده – انتقال تمام استدلال‌های تاریخی به یک فایل آرشیو جداگانه که عامل در طول عملیات عادی آن را نمی‌خواند.

این رویکرد توانایی عامل برای جلوگیری از تکرار موضوع را حفظ می‌کند و در عین حال بار توکن در هر اجرا را به شدت کاهش می‌دهد.

چگونه انحراف هزینه را در عامل‌های خود شناسایی کنید

  1. ثبت خواندن توکن‌ها – تعداد توکن‌هایی را که عامل هنگام بارگذاری فایل حافظه خود در هر بار اجرا مصرف می‌کند، ثبت کنید.
  2. پیگیری در طول زمان – تعداد توکن‌های امروز را با تعداد توکن‌های یک هفته یا یک ماه پیش مقایسه کنید. یک روند صعودی مداوم نشان‌دهنده انحراف است.

صرفاً تأیید اینکه فایل هنوز بدون خطا بارگذاری می‌شود کافی نیست؛ شما باید هزینه آن بارگذاری را اندازه‌گیری کنید.

موضوعات بعدی برای بررسی

انحراف هزینه عامل یک مالیات نامرئی است که می‌تواند به آرامی بودجه هوش مصنوعی شما را از بین ببرد. با برخورد با فایل حافظه عامل به عنوان یک مرکز هزینه — اندازه‌گیری خواندن توکن‌ها، نظارت بر منحنی‌های رشد و بازسازی لاگ‌ها — می‌توانید این مالیات را پایین نگه دارید و خروجی را دقیق و کارآمد حفظ کنید.

Source: https://dev.to/enjoy_kumawat/i-measured-what-my-agents-own-memory-file-costs-to-read-the-number-only-goes-up-46ob

Join the discussion: https://t.me/GyaanSetuAi