پروژههای هوش مصنوعی سازمانی الگوی خاصی دارند. یک تیم یک نمونه اولیه میسازد. دمو بسیار تأثیرگذار به نظر میرسد. سپس، سه ماه بعد، سیستم شروع به فروپاشی میکند. پاسخها دچار انحراف میشوند. هزینهها بالا میروند. یک افسر انطباق میپرسد که یک پاسخ خاص از کجا آمده است، و هیچکس در اتاق نمیتواند پاسخ دهد.
این فروپاشی بهندرت با کد بد شروع میشود. بلکه با یک انتخاب معماری واحد شروع میشود که مانند یک مسابقه محبوبیت با آن برخورد میشود: Retrieval-Augmented Generation (تولید تقویتشده با بازیابی) در مقابل fine-tuning (تنظیم دقیق).
RAG و fine-tuning دو نسخه از یک محصول نیستند. آنها ابزارهایی اساساً متفاوت هستند. یکی آنچه را که مدل میتواند ببیند کنترل میکند، و دیگری نحوه رفتار مدل را کنترل میکند. انتخاب گزینه اشتباه برای یک کار، در مرحله نمونه اولیه خود را نشان نمیدهد؛ بلکه بعداً، زمانی که کسبوکار بر پایه آن در حال فعالیت است، خود را نشان میدهد.
تلهی دمو
فشار برای عرضه یک قابلیت هوش مصنوعی مولد بسیار شدید است. تیمها اغلب روشی را انتخاب میکنند چون آن را در یک آموزش خوب نوشته شده دیدهاند یا چون اسلایدهای یک فروشنده آن را آسان جلوه داده است. این روش بسیار بدی برای تصمیمگیری در مورد زیرساخت است.
یک مدل fine-tuned میتواند در یک دمو کنترلشده، جادویی به نظر برسد. با لحن شرکت شما صحبت میکند و نام محصولات شما را تشخیص میدهد. یک pipeline در سیستم RAG نیز میتواند جادویی به نظر برسد؛ به سوالاتی درباره سندی پاسخ میدهد که هرگز روی آن آموزش ندیده است. اما دمو واقعیت عملیاتی را پنهان میکند. اگر دادههای قیمتگذاری شما هفتگی تغییر میکند و شما مدل را بر اساس اعداد فصل گذشته fine-tune کردهاید، مدل با اطمینان اعداد قدیمی را نقل میکند. اگر تیم پشتیبانی شما نیاز دارد که هر پاسخ به یک فایل PDF مشخص از سیاستها ارجاع داده شود، یک مدل fine-tuned هیچ پانویسی به شما نمیدهد؛ فقط متن تحویل میدهد.
RAG واقعاً به چه معناست
RAG مخفف Retrieval-Augmented Generation است، اما این نام باعث میشود پیچیدهتر از آنچه هست به نظر برسد. در هسته خود، RAG به یک سوال پاسخ میدهد: مدل در حال حاضر نیاز دارد چه چیزی را جستجو کند؟
یک کارشناس خدمات مشتری را تصور کنید که اجازه دارد قبل از پاسخ دادن به یک تیکت، در ویکی شرکت جستجو کند. RAG دقیقاً همین کار را انجام میدهد، اما به صورت خودکار. وقتی کاربر سوالی میپرسد، سیستم در یک vector database یا ذخیرهساز اسناد، به دنبال تکههای مرتبط متن میگردد. سپس آن تکهها را به همراه سوال اصلی، به عنوان context به مدل زبانی تحویل میدهد. مدل بر اساس شواهد بازیابیشده، پاسخی تولید میکند.
این رویکرد زمانی میدرخشد که پایگاه دانش شما خارج از مدل قرار دارد. مستندات محصول، پروندههای حقوقی، تحقیقات پزشکی و جداول موجودی کالا همگی تغییر میکنند. RAG مدل را بدون نیاز به بازآموزی حتی یک وزن (weight)، بهروز نگه میدارد. همچنین یک ردپای حسابرسی (audit trail) طبیعی ایجاد میکند. از آنجایی که میدانید کدام اسناد بازیابی شدهاند، میتوانید به یک حسابرس یا نهاد نظارتی دقیقاً نشان دهید که یک پاسخ از کجا آمده است.
Fine-Tuning واقعاً به چه معناست
Fine-tuning به سوال متفاوتی پاسخ میدهد: مدل چگونه باید رفتار کند؟
به جای دادن مطالب خواندنی خارجی به مدل، شما آن را از طریق مثال آموزش میدهید. صدها یا هزاران نمونه از خروجیهای مورد نظر خود را جمعآوری میکنید و آموزش مدل پایه را بر روی آن دادهها ادامه میدهید. این فرآیند در واقع پارامترهای داخلی مدل را تنظیم میکند و وزنها را تغییر میدهد.
نتیجه، مدلی است که الگوها را درونی کرده است.
