Как я научил менеджера править ИИ-агента без единой строки кода

Как я научил менеджера править ИИ-агента без единой строки кода

Как всё начиналось

Пришёл клиент и говорит: «агент постоянно путает две услуги, доучи его». За этой просьбой стоял привычный опыт — мол, как с обычной моделью, соберём данные и дообучим. Только сейчас так уже не работает. Агент учится не как классификатор, а как новый сотрудник: через примеры и разбор ошибок. И этот разбор теперь делает менеджер продукта, а не я.

Первая попытка — и три стены

Сначала я пошёл по старой схеме: собрал пары «вопрос — ответ», подготовил датасет, прикинул стоимость дообучения на GigaChat. И сразу упёрся в проблемы.

  • Время. От «агент ошибся» до «модель в проде» проходили недели. За это время категории вопросов успевали поменяться.
  • Регрессы. Дообучили на новых примерах — сломали три старых сценария, которые раньше работали идеально.
  • Стоимость. Каждый эксперимент с формулировкой стоил приличных денег. Платил не за результат, а за право проверить одну идею.

К концу второй недели стало ясно: файнтюнинг здесь — как молоток для шурупа.

Как агент «вспоминает» вместо того, чтобы учиться

Посмотрел, как живой наставник разбирает ошибку: просто показывает похожий пример и говорит «запомни». То же самое сделал я. Теперь при каждом вопросе агент ищет в pgvector два-три самых близких эталонных диалога и подкладывает их в промпт. Модель видит живые пары и повторяет паттерн.

Получается, что «обучение» — это просто управление базой примеров. И эту базу может править менеджер сам.

Экран «Учитель агента»

Сделал простой интерфейс на Angular. Слева — лента реальных диалогов с дизлайками или пометками LLM-судьи. Справа — форма, где менеджер пишет правильный ответ. Жмёт «сохранить как эталон» — и через пару секунд пример уже в базе, агент его видит.

Сначала менеджер добавлял по десятку примеров в день. Через месяц — пару в неделю. Инженер больше не нужен: раньше правка поведения была задачей на разработку, теперь — на минуту работы продакт-менеджера.

Где схема ломается

Честно: подход не универсальный.

  • Если примеров станет сотни, начинает работать «эффект соседа» — похожие вопросы тянут разные эталоны. Приходится периодически чистить базу.
  • Для строго форматированных ответов few-shot помогает слабо — нужна ещё JSON Schema и валидация.
  • Для точного следования инструкциям лучше подробный системный промпт.

Что изменилось

Раньше исправление агента — это тикет, спринт, релиз. Теперь менеджер видит проблему, правит пример — и через минуту агент отвечает иначе. Разбор инцидента укладывается в одну чашку кофе.

Мой вывод простой: если проект стоит из-за «нужно доучить агента», скорее всего, нужен не файнтюнинг, а удобный экран для менеджера. Обучение ИИ-агентов в 2026 году всё чаще начинается не со сбора датасета, а с разговора о том, как правильно.

А у вас как устроен цикл «агент ошибся → агент исправился»?