Проєкти корпоративного ШІ мають певну закономірність. Команда створює прототип. Демонстрація виглядає вражаюче. Потім, через три місяці, система починає руйнуватися. Відповіді дрейфують. Витрати зростають. Офіцер із комплаєнсу запитує, звідки взялася конкретна відповідь, і ніхто в кімнаті не може цього сказати.

Цей крах рідко починається з поганого коду. Він починається з одного архітектурного рішення, до якого ставляться як до конкурсу популярності: Retrieval-Augmented Generation проти fine-tuning.

RAG та fine-tuning — це не дві версії одного й того самого продукту. Це принципово різні інструменти. Один контролює те, що модель може бачити. Інший — те, як модель поводиться. Вибір неправильного інструмента не проявиться в прототипі. Він проявиться пізніше, коли на його основі вже працюватиме бізнес.

Пастка демонстрації

Тиск щодо швидкого впровадження функцій генеративного ШІ є величезним. Команди часто обирають метод лише тому, що бачили його в якісному туторіалі або тому, що презентація вендора представила це як щось просте. Це жахливий спосіб приймати інфраструктурні рішення.

Модель, що пройшла fine-tuning, може здаватися магічною під час контрольованої демонстрації. Вона говорить голосом вашої компанії та впізнає назви ваших продуктів. RAG-конвеєр також може здаватися магічним. Він відповідає на запитання щодо документа, на якому ніколи не навчався. Але демонстрація приховує операційну реальність. Якщо ваші дані про ціни змінюються щотижня, а ви робили fine-tuning на показниках за минулий квартал, модель впевнено цитуватиме застарілі цифри. Якщо вашій службі підтримки потрібно, щоб кожна відповідь мала посилання на конкретний PDF-файл із правилами, fine-tuned модель не надасть вам жодних приміток. Вона просто видасть текст.

Що насправді означає RAG

RAG розшифровується як Retrieval-Augmented Generation, але через таку назву він здається складнішим, ніж є насправді. По суті, RAG відповідає на одне запитання: що моделі потрібно знайти прямо зараз?

Уявіть агента служби підтримки, якому дозволено шукати інформацію у внутрішній базі знань (wiki) компанії перед тим, як відповісти на запит. RAG робить саме це, але автоматично. Коли користувач ставить запитання, система шукає релевантні фрагменти тексту у векторній базі даних або сховищі документів. Потім вона передає ці фрагменти мовній моделі як контекст разом із початковим запитанням. Модель генерує відповідь на основі знайдених доказів.

Цей підхід демонструє свої переваги, коли ваша база знань знаходиться поза межами моделі. Документація продукту, юридичні документи, медичні дослідження та таблиці інвентаризації — усе це постійно змінюється. RAG дозволяє моделі залишатися актуальною без перенавчання жодного вагу. Це також створює природний аудиторський слід. Оскільки ви знаєте, які саме документи були знайдені, ви можете показати аудитору або регулятору, звідки саме взялася відповідь.

Що насправді означає Fine-Tuning

Fine-tuning відповідає на інше запитання: як має поводитися модель?

Замість того, щоб надавати моделі зовнішні матеріали для читання, ви навчаєте її на прикладах. Ви збираєте сотні або тисячі прикладів бажаних результатів і продовжуєте навчання базової моделі на цих даних. Цей процес фактично коригує внутрішні параметри моделі. Він змінює ваги.

Результатом є модель, яка засвоїла певні закономірності.