Как всё начиналось
Пришёл клиент и говорит: «агент постоянно путает две услуги, доучи его». За этой просьбой стоял привычный опыт — мол, как с обычной моделью, соберём данные и дообучим. Только сейчас так уже не работает. Агент учится не как классификатор, а как новый сотрудник: через примеры и разбор ошибок. И этот разбор теперь делает менеджер продукта, а не я.
Первая попытка — и три стены
Сначала я пошёл по старой схеме: собрал пары «вопрос — ответ», подготовил датасет, прикинул стоимость дообучения на GigaChat. И сразу упёрся в проблемы.
- Время. От «агент ошибся» до «модель в проде» проходили недели. За это время категории вопросов успевали поменяться.
- Регрессы. Дообучили на новых примерах — сломали три старых сценария, которые раньше работали идеально.
- Стоимость. Каждый эксперимент с формулировкой стоил приличных денег. Платил не за результат, а за право проверить одну идею.
К концу второй недели стало ясно: файнтюнинг здесь — как молоток для шурупа.
Как агент «вспоминает» вместо того, чтобы учиться
Посмотрел, как живой наставник разбирает ошибку: просто показывает похожий пример и говорит «запомни». То же самое сделал я. Теперь при каждом вопросе агент ищет в pgvector два-три самых близких эталонных диалога и подкладывает их в промпт. Модель видит живые пары и повторяет паттерн.
Получается, что «обучение» — это просто управление базой примеров. И эту базу может править менеджер сам.
Экран «Учитель агента»
Сделал простой интерфейс на Angular. Слева — лента реальных диалогов с дизлайками или пометками LLM-судьи. Справа — форма, где менеджер пишет правильный ответ. Жмёт «сохранить как эталон» — и через пару секунд пример уже в базе, агент его видит.
Сначала менеджер добавлял по десятку примеров в день. Через месяц — пару в неделю. Инженер больше не нужен: раньше правка поведения была задачей на разработку, теперь — на минуту работы продакт-менеджера.
Где схема ломается
Честно: подход не универсальный.
- Если примеров станет сотни, начинает работать «эффект соседа» — похожие вопросы тянут разные эталоны. Приходится периодически чистить базу.
- Для строго форматированных ответов few-shot помогает слабо — нужна ещё JSON Schema и валидация.
- Для точного следования инструкциям лучше подробный системный промпт.
Что изменилось
Раньше исправление агента — это тикет, спринт, релиз. Теперь менеджер видит проблему, правит пример — и через минуту агент отвечает иначе. Разбор инцидента укладывается в одну чашку кофе.
Мой вывод простой: если проект стоит из-за «нужно доучить агента», скорее всего, нужен не файнтюнинг, а удобный экран для менеджера. Обучение ИИ-агентов в 2026 году всё чаще начинается не со сбора датасета, а с разговора о том, как правильно.
А у вас как устроен цикл «агент ошибся → агент исправился»?
