Запуск LLM-агента у вашому браузері

Більшість ШІ-асистентів працюють у дата-центрах. Їм потрібен API-ключ, сервер, і вони стягують плату за кожен запит.

Я створив дещо інше.

Я виконав fine-tuning моделей LiquidAI LFM2.5 (230 млн та 350 млн параметрів), щоб вони працювали повністю у вашому браузері — без сервера та витрат на хмару.

Метою було зробити модель достатньо малою, щоб її можна було передавати разом із вебсторінкою.

Модель не зберігає факти про конкретні товари; вона вивчає закономірності. Одна крихітна модель може керувати кав'ярнею, продуктовим магазином або будь-яким іншим закладом без перенавчання.

Що робить модель

  • Обирає правильний інструмент для завдання
  • Правильно пов'язує аргументи та ID товарів
  • Розуміє посилання на кшталт «другий» або «дюжина»
  • Використовує отриманий текст для відповідей на запитання
  • Відмовляється виконувати дію, якщо бракує інформації
  • Повертає розмову в потрібне русло, якщо вона відхиляється від теми

Як я це створив

  • Зафіксував набір із восьми інструментів (search, add_to_cart, checkout тощо)
  • Розглядав RAG як інструмент, а не як окремий конвеєр (pipeline)
  • Застосував декодування з обмеженнями граматики для точності
  • Створив синтетичний набір даних на основі 18 сценаріїв взаємодії
  • Виконав fine-tuning на 30 млн токенів за допомогою однієї відеокарти на 16 ГБ

Фокус навчання Я навчав модель поведінці, а не спискам заборонених слів. Замість того, щоб блокувати слова, я навчив її ввічливо спрямовувати розмову.

Чому це важливо

  • Приватність: ваші дані ніколи не залишають пристрій
  • Офлайн-використання: вона працює без підключення до інтернету
  • Вартість: нульові витрати на інференс
  • Доступність: вона дозволяє керувати складними інтерфейсами за допомогою голосу

Модель маленька, але корисна. Досить припинити питати, чи можуть гігантські моделі виконувати завдання. Запитайте, наскільки малою може бути модель, залишаючись при цьому корисною на пристрої.

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz виконав fine-tuning мовної моделі з 350 мільйонами параметрів для роботи безпосередньо у веббраузері, перетворюючи статичну сторінку на автономного помічника для покупок, якому не потрібен API-ключ, сервер чи хмарні витрати на інференс. Результатом є ШІ, орієнтований на приватність і здатний працювати офлайн, який може керувати кав'ярнею, продуктовим магазином або будь-яким подібним каталогом без необхідності перенавчання для кожної нової сфери.

Чому варто запускати LLM у браузері

Більшість ШІ-асистентів працюють у дата-центрах. Кожен запит проходить через інтернет, звертається до API та стягує плату за кожен запит. Така архітектура призводить до витоку даних користувачів, потребує мережі та швидко накопичує витрати. Перенесення моделі на сторону клієнта усуває ці проблеми. Дані залишаються на локальній машині, асистент працює навіть при зникненні мережі, а витрати на інференс падають до нуля.

Як була побудована модель

  • Вибір моделі – Починали з LiquidAI LFM2.5, варіантів на 230 млн та 350 млн параметрів. Їхній розмір дозволяє завантажувати їх зі звичайною вебсторінкою.
  • Набір інструментів – У агент вбудовано вісім утиліт (search, add_to_cart, checkout тощо). Модель вивчає, який інструмент викликати та як передавати аргументи, наприклад, ID товарів.
  • RAG як інструмент – Retrieval-Augmented Generation розглядається як ще один інструмент, що можна викликати, що спрощує архітектуру.
  • Декодування з обмеженнями граматики – Декодер було обмежено валідним синтаксисом виклику інструментів, що значно зменшило кількість некоректних результатів.
  • Синтетичні дані – 18 сценаріїв взаємодії (наприклад, «додай дві дюжини пончиків») було перетворено на набір даних із 30 млн токенів, згенерований на одній відеокарті на 16 ГБ.
  • Навчання з фокусом на поведінку – Замість списків забо

За чим стежити далі

Кодова база (https://github.com/lajosbencz/frontend-agent) є відкритою, запрошуючи спільноту додавати інструменти, розширювати синтетичні рецепти або випробовувати гібридні підходи.

Головний висновок: Тонке налаштування (fine-tuning) LLM помірного розміру на автономного агента дає змогу вбудовувати функціональний ШІ, що зберігає конфіденційність, безпосередньо у вебсторінку — без серверів, безкоштовно та без передачі даних за межі пристрою користувача.