پروژه‌های هوش مصنوعی سازمانی الگوی خاصی دارند. یک تیم یک نمونه اولیه می‌سازد. دمو بسیار تأثیرگذار به نظر می‌رسد. سپس، سه ماه بعد، سیستم شروع به فروپاشی می‌کند. پاسخ‌ها دچار انحراف می‌شوند. هزینه‌ها بالا می‌روند. یک افسر انطباق می‌پرسد که یک پاسخ خاص از کجا آمده است، و هیچ‌کس در اتاق نمی‌تواند پاسخ دهد.

این فروپاشی به‌ندرت با کد بد شروع می‌شود. بلکه با یک انتخاب معماری واحد شروع می‌شود که مانند یک مسابقه محبوبیت با آن برخورد می‌شود: Retrieval-Augmented Generation (تولید تقویت‌شده با بازیابی) در مقابل fine-tuning (تنظیم دقیق).

RAG و fine-tuning دو نسخه از یک محصول نیستند. آن‌ها ابزارهایی اساساً متفاوت هستند. یکی آنچه را که مدل می‌تواند ببیند کنترل می‌کند، و دیگری نحوه رفتار مدل را کنترل می‌کند. انتخاب گزینه اشتباه برای یک کار، در مرحله نمونه اولیه خود را نشان نمی‌دهد؛ بلکه بعداً، زمانی که کسب‌وکار بر پایه آن در حال فعالیت است، خود را نشان می‌دهد.

تله‌ی دمو

فشار برای عرضه یک قابلیت هوش مصنوعی مولد بسیار شدید است. تیم‌ها اغلب روشی را انتخاب می‌کنند چون آن را در یک آموزش خوب نوشته شده دیده‌اند یا چون اسلایدهای یک فروشنده آن را آسان جلوه داده است. این روش بسیار بدی برای تصمیم‌گیری در مورد زیرساخت است.

یک مدل fine-tuned می‌تواند در یک دمو کنترل‌شده، جادویی به نظر برسد. با لحن شرکت شما صحبت می‌کند و نام محصولات شما را تشخیص می‌دهد. یک pipeline در سیستم RAG نیز می‌تواند جادویی به نظر برسد؛ به سوالاتی درباره سندی پاسخ می‌دهد که هرگز روی آن آموزش ندیده است. اما دمو واقعیت عملیاتی را پنهان می‌کند. اگر داده‌های قیمت‌گذاری شما هفتگی تغییر می‌کند و شما مدل را بر اساس اعداد فصل گذشته fine-tune کرده‌اید، مدل با اطمینان اعداد قدیمی را نقل می‌کند. اگر تیم پشتیبانی شما نیاز دارد که هر پاسخ به یک فایل PDF مشخص از سیاست‌ها ارجاع داده شود، یک مدل fine-tuned هیچ پانویسی به شما نمی‌دهد؛ فقط متن تحویل می‌دهد.

RAG واقعاً به چه معناست

RAG مخفف Retrieval-Augmented Generation است، اما این نام باعث می‌شود پیچیده‌تر از آنچه هست به نظر برسد. در هسته خود، RAG به یک سوال پاسخ می‌دهد: مدل در حال حاضر نیاز دارد چه چیزی را جستجو کند؟

یک کارشناس خدمات مشتری را تصور کنید که اجازه دارد قبل از پاسخ دادن به یک تیکت، در ویکی شرکت جستجو کند. RAG دقیقاً همین کار را انجام می‌دهد، اما به صورت خودکار. وقتی کاربر سوالی می‌پرسد، سیستم در یک vector database یا ذخیره‌ساز اسناد، به دنبال تکه‌های مرتبط متن می‌گردد. سپس آن تکه‌ها را به همراه سوال اصلی، به عنوان context به مدل زبانی تحویل می‌دهد. مدل بر اساس شواهد بازیابی‌شده، پاسخی تولید می‌کند.

این رویکرد زمانی می‌درخشد که پایگاه دانش شما خارج از مدل قرار دارد. مستندات محصول، پرونده‌های حقوقی، تحقیقات پزشکی و جداول موجودی کالا همگی تغییر می‌کنند. RAG مدل را بدون نیاز به بازآموزی حتی یک وزن (weight)، به‌روز نگه می‌دارد. همچنین یک ردپای حسابرسی (audit trail) طبیعی ایجاد می‌کند. از آنجایی که می‌دانید کدام اسناد بازیابی شده‌اند، می‌توانید به یک حسابرس یا نهاد نظارتی دقیقاً نشان دهید که یک پاسخ از کجا آمده است.

Fine-Tuning واقعاً به چه معناست

Fine-tuning به سوال متفاوتی پاسخ می‌دهد: مدل چگونه باید رفتار کند؟

به جای دادن مطالب خواندنی خارجی به مدل، شما آن را از طریق مثال آموزش می‌دهید. صدها یا هزاران نمونه از خروجی‌های مورد نظر خود را جمع‌آوری می‌کنید و آموزش مدل پایه را بر روی آن داده‌ها ادامه می‌دهید. این فرآیند در واقع پارامترهای داخلی مدل را تنظیم می‌کند و وزن‌ها را تغییر می‌دهد.

نتیجه، مدلی است که الگوها را درونی کرده است.