Чому ця обіцянка має значення

ШІ-агенти позиціонуються як наступний крок після чат-ботів: система, яка може переглядати вебсторінки, отримувати цифри, викликати API та приймати рішення без участі людини. Трейдери, аналітики, SaaS-платформи — усіх це приваблює. На практиці сьогоднішні агенти більше схожі на «розумну автоматизацію», яка все ще потребує розробників, щоб не збитися зі шляху.

Інженерний стек, що стоїть за «агентом»

Створення функціонального агента означає поєднання кількох компонентів:

  • Велика мовна модель (LLM) — ядро міркування, яке зчитує промпти та обирає наступний крок.
  • Рівень пам'яті — короткостроковий контекст для поточного завдання та довгострокова векторна база даних, що зберігає ембедінги для подальшого пошуку.
  • Планувальник — модуль на основі правил або навчений модуль, який обирає наступну дію на основі виводу LLM.
  • Інструменти — API, веб-скрапери, інтерпретатори коду або будь-який зовнішній сервіс, до якого має звертатися агент.
  • Цикл зворотного зв'язку — перевірка, яка оцінює результат кожного кроку та вказує планувальнику продовжувати або повернутися назад.

Кожен елемент працює, але точки інтеграції є вразливими. Під час експерименту розробник витрачав години на налагодження та постійне перепроектування промптів, щоб утримувати LLM у межах задачі.

Приховані виклики

Галюцинації

LLM можуть вигадувати факти, які виглядають правдоподібно.

Нескінченні цикли

Без чітких запобіжних заходів агент може нескінченно повторювати невдалий крок — наприклад, безперервно намагатися «повторно завантажити сторінку X». Розробник зупинив це, додавши обмеження на кількість спроб на основі правил, що призвело до появи ще одного кастомного компонента.

Контроль витрат

Виклики LLM тарифікуються за токени. Тривале завдання, яке постійно звертається до потужної моделі, може швидко вичерпати навіть скромний бюджет. В експерименті використовувався гібридний підхід: починати з дешевої моделі для рутинних кроків, а переходити на більш потужну (і дорогу) модель лише тоді, коли міркування стають складними. Це зменшує витрати, але додає архітектурної складності.

Ризики безпеки

Надання агенту API-ключів або прав на запис розширює поверхню атаки. Зкомпрометований агент може викрасти дані або здійснити несанкціоновані транзакції. Розробник застосував принцип «найменших привілеїв», обмежуючи доступ агента лише для читання, де це можливо, що також звужує перелік завдань, які він