← блог Paramiko
AI automation / business / Paramiko

Как измерить качество AI-агента до запуска: точность, ошибки и эскалации

Демо всегда работает. Вы показываете агенту три вопроса, он бодро отвечает, все довольны, договариваетесь о запуске. А через неделю на живом трафике он уверенно называет клиенту неправильный срок доставки, обещает возврат, которого нет в регламенте, и путает два товара с похожими названиями.

Проблема не в том, что агент «плохой». Проблема в том, что его качество никто не измерил до того, как он получил доступ к реальным клиентам. «Вроде отвечает нормально» — это не метрика. Ниже — как проверить агента по-инженерному: тестовый набор, критерии приёмки, разметка ошибок и правила эскалации. Всё, что можно сделать до запуска, за пару дней, без магии.

Демо всегда работает. Вы показываете агенту три вопроса, он бодро отвечает, все довольны, договариваетесь о запуске. А через неделю на живом трафике он уверенно называет клиенту неправильный срок доставки, обещает возврат, которого нет в регламенте, и путает два товара с похожими названиями.

Проблема не в том, что агент «плохой». Проблема в том, что его качество никто не измерил до того, как он получил доступ к реальным клиентам. «Вроде отвечает нормально» — это не метрика. Ниже — как проверить агента по-инженерному: тестовый набор, критерии приёмки, разметка ошибок и правила эскалации. Всё, что можно сделать до запуска, за пару дней, без магии.

Коротко

  • Нельзя запускать AI-агента по ощущению «вроде отвечает нормально». Нужны цифры.
  • Соберите тестовый набор из 100–300 реальных вопросов, включая сложные и вредные, с эталонными ответами.
  • Задайте acceptance criteria заранее: какая точность, доля ошибок и доля эскалаций считаются приёмкой. Например: ≥90% корректных ответов, 0 опасных ошибок, «не знаю» вместо выдумки.
  • Разделяйте типы ошибок: безобидная неточность и опасная выдумка (галлюцинация про деньги, сроки, гарантии) — это разные веса.
  • Хороший агент умеет сказать «передаю оператору». Отсутствие эскалации — это баг, а не признак ума.
  • Human-in-the-loop и логи — не «на потом», а часть запуска. Первые недели человек проверяет, агент учится.

Проблема: почему демо врёт

Демо показывает лучший случай. Вы задаёте вопросы, ответы на которые заведомо есть в базе, формулируете их чисто, не пытаетесь запутать. Реальный клиент делает наоборот: пишет с опечатками, задаёт два вопроса в одном сообщении, спрашивает про пограничный случай из регламента, а иногда просто проверяет бота на прочность.

Есть три типа ошибок, которые демо не ловит, а прод ловит сразу.

Первая — галлюцинация. Агент не находит ответ, но не признаётся в этом, а придумывает правдоподобный. Особенно опасно, когда речь о деньгах, сроках, гарантиях, наличии товара. Клиент верит, потому что звучит уверенно.

Вторая — молчаливая эскалация, которой нет. Агент не понимает вопрос, но всё равно отвечает хоть что-то, вместо того чтобы передать человеку. Пользователь уходит с неверным ответом и без ощущения, что его услышали.

Третья — правильный ответ не на тот вопрос. Клиент спросил про возврат бракованного товара, агент рассказал про возврат по передумал. Формально текст верный, по сути — мимо.

Ни одну из этих проблем нельзя увидеть на трёх удобных вопросах. Их видно только на наборе, который специально собран, чтобы агенту было тяжело.

Workflow: как измерить качество за несколько дней

Шаг 1. Соберите тестовый набор

Тестовый набор — это список вопросов с эталонными ответами, на котором вы гоняете агента. Не выдумывайте вопросы из головы: возьмите реальные.

Где брать: переписки в CRM, диалоги операторов поддержки, вопросы из Telegram, комментарии и отзывы на WB/Ozon, письма. Выгрузите последние 200–500 обращений и отберите из них 100–300 показательных.

Набор должен покрывать четыре категории:

  1. Частые простые вопросы — то, ради чего агента и внедряют. «Где мой заказ», «какие способы оплаты», «есть ли этот товар в наличии».
  2. Пограничные случаи — частичный возврат, доставка в отдалённый регион, товар со скидкой и без гарантии одновременно.
  3. Каверзные и вредные — попытки выманить скидку, провокации, вопросы не по теме, просьбы «сделай исключение».
  4. Вопросы без ответа в базе — то, чего агент знать не может. Здесь правильный ответ — честное «уточню у коллеги» или эскалация, а не выдумка.

Для каждого вопроса запишите эталон: что считается правильным ответом. Не обязательно дословно — можно зафиксировать ключевые факты, которые ответ обязан содержать, и факты, которых в нём быть не должно.

Шаг 2. Задайте acceptance criteria до тестов, а не после

Критерии приёмки — это цифры, при которых вы согласны запускать агента. Их надо зафиксировать заранее, иначе после тестов возникнет соблазн подогнать планку под результат.

Рабочий пример критериев для агента поддержки:

  • корректных ответов на простые вопросы — не меньше 90%;
  • опасных ошибок (неверная информация про деньги, сроки, гарантии) — ноль, это блокирующий критерий;
  • на вопросы без ответа в базе агент эскалирует или честно говорит «уточню», а не выдумывает — не меньше 95% случаев;
  • корректная эскалация на каверзных вопросах — агент не поддаётся на провокацию и передаёт человеку.

Обратите внимание: у ошибок разный вес. Агент, который в 8% случаев отвечает «не уверен, передаю оператору», лучше агента, который в 8% случаев уверенно врёт. Первый теряет немного скорости, второй теряет доверие и создаёт разбор с клиентом.

Шаг 3. Прогоните набор и разметьте результаты

Прогоните все вопросы через агента и разметьте каждый ответ. Простая шкала работает лучше сложной:

  • OK — ответ верный и по делу;
  • Неточность — в целом верно, но неполно или не совсем то;
  • Ошибка — неверный ответ, но без последствий;
  • Опасная ошибка — неверный ответ про деньги/сроки/гарантии/наличие;
  • Пропущенная эскалация — надо было передать человеку, но агент ответил сам.

Разметку делает человек, который знает предмет: руководитель поддержки, старший менеджер, вы сами. Это несколько часов работы на 200 вопросов — и это самое ценное, что можно сделать перед запуском.

Считать удобно в обычной таблице: колонка вопрос, колонка ответ агента, колонка оценка, колонка комментарий. Внизу — сводка по категориям. Никаких специальных инструментов на старте не нужно.

Шаг 4. Проверьте эскалации отдельно

Эскалация — передача разговора человеку — это не признак слабого агента, а признак зрелого. Проверьте три вещи.

Во-первых, срабатывает ли эскалация там, где должна: на вопросах без ответа, на жалобах, на явном недовольстве, на нестандартных просьбах. Во-вторых, не срабатывает ли она слишком часто на простых вопросах — иначе смысла в агенте нет. В-третьих, что происходит после эскалации: попадает ли диалог оператору с сохранённым контекстом или клиент вынужден пересказывать всё заново.

Хорошая настройка: у агента есть явные триггеры на передачу человеку и запрет отвечать в темах, где ошибка стоит дорого. Например, «сумма возврата», «индивидуальная скидка», «претензия по браку» — только через оператора, даже если агент «думает», что знает ответ.

Шаг 5. Исправьте и прогоните повторно

После разметки у вас на руках список конкретных провалов. Дальше — обычная итерация: поправить базу знаний, уточнить инструкции агента, добавить триггеры эскалации, закрыть пробелы в данных. Затем прогнать тот же набор ещё раз и сравнить цифры.

Держите набор неизменным между прогонами — иначе вы не поймёте, стало лучше или просто вопросы сменились. Меняете агента, не тест.

ROI: что вы экономите на этом этапе

Час разметки перед запуском дешевле, чем разбор с клиентом после. Реальная математика простая.

Допустим, агент обрабатывает 1000 обращений в месяц. При «незамеренном» запуске доля опасных ошибок легко доходит до 5–7% — это 50–70 клиентов в месяц, получивших неверную информацию про деньги или сроки. Каждый такой случай — это возврат, спор, иногда потерянный клиент и почти всегда время оператора на исправление и извинения.

Тестовый набор и пара итераций до запуска — это 1–2 дня работы. Они убирают опасные ошибки почти в ноль ещё до того, как их увидел первый живой клиент. Вы не гадаете, готов агент или нет, — у вас есть цифра, на которую можно смотреть и принимать решение.

Второй эффект — скорость доработки после запуска. Когда есть тестовый набор, любую жалобу с прода вы добавляете в него как новый кейс и проверяете, что фикс не сломал остальное. Без набора каждая доработка — это ремонт вслепую: чините одно, ломаете другое, узнаёте об этом от клиентов.

Риски и что нельзя отдавать агенту без человека

Измерение качества снижает риск, но не отменяет контроль. Несколько правил, которые стоит зашить в запуск.

Опасные темы — только через человека. Возвраты денег, индивидуальные условия, юридические и медицинские вопросы, всё, где ошибка дорого стоит. Агент здесь собирает информацию и передаёт, но не решает.

Первые недели — human-in-the-loop. Человек просматривает ответы агента, отмечает ошибки, они идут обратно в тестовый набор и в базу. Это не «недоверие к технологии», это нормальный обкаточный период. По мере роста цифр контроль можно ослаблять — сначала выборочная проверка, потом только сложные случаи.

Логи всего. Каждый диалог, каждое действие, каждая эскалация должны быть в логах с возможностью посмотреть, почему агент ответил именно так. Без логов вы не разберёте инцидент и не докажете, что произошло.

Права доступа по минимуму. Агент должен иметь доступ только к тем данным и действиям, которые ему реально нужны. Если агент только отвечает на вопросы — у него не должно быть прав менять заказы или списывать деньги.

Об этом подробнее — в статье что такое AI-агент для бизнеса: там разобрано, чем production-агент отличается от демо-бота.

Implementation: с чего начать на этой неделе

Если вы готовите агента к запуску, план на ближайшие дни выглядит так.

Выгрузите 200–500 последних обращений из CRM, поддержки или маркетплейса. Отберите 100–300 в тестовый набор по четырём категориям — простые, пограничные, каверзные, без ответа. Запишите к каждому эталон: что ответ обязан содержать и чего в нём быть не должно.

Зафиксируйте acceptance criteria цифрами и согласуйте их с тем, кто отвечает за клиентов. Прогоните набор, разметьте ответы по пяти оценкам, посчитайте сводку. Отдельно проверьте эскалации. Поправьте базу и инструкции, прогоните повторно на том же наборе, сравните.

Решение о запуске принимайте по цифрам, а не по ощущению. Если опасных ошибок ноль и точность на простых вопросах выше порога — запускайте с human-in-the-loop на первые недели. Если нет — вы точно знаете, что чинить, и это уже полдела.

Понять, стоит ли вообще автоматизировать конкретный процесс, помогает статья как понять, что процесс пора автоматизировать.

FAQ

Сколько вопросов нужно в тестовом наборе? Для старта хватает 100–300. Меньше 100 — цифры неустойчивы, случайность влияет сильнее реального качества. Больше 300 на первом заходе тяжело разметить руками. Набор растёт со временем: каждую ошибку с прода добавляйте в него.

Можно ли автоматизировать разметку ответов? Частично — второй агент может грубо отсортировать явно верные и явно неверные ответы. Но опасные ошибки и пограничные случаи должен проверять человек, который знает предмет. Автоматическая разметка хороша как фильтр, а не как финальное решение.

Какая точность считается нормальной? Зависит от цены ошибки. Для справочных вопросов «где заказ» приемлемо 90%+. Для тем про деньги и гарантии планка одна — ноль опасных ошибок, а остальное уходит на эскалацию. Универсального числа нет, есть цена конкретной ошибки в вашем бизнесе.

Что важнее — точность или доля эскалаций? Смотрите на баланс. Агент, который эскалирует половину вопросов, бесполезен. Агент, который не эскалирует никогда, опасен. Хорошая настройка — уверенно отвечать на частое и известное, честно передавать человеку редкое и рискованное.

Нужно ли тестировать агента после запуска или достаточно одного раза? Тестирование не заканчивается на запуске. База знаний меняется, появляются новые вопросы, обновляется модель. Прогоняйте набор при каждом заметном изменении и добавляйте в него реальные провалы. Это дешёвая страховка от регрессий.

Как проверить агента для WB/Ozon, если вопросы приходят в отзывах и чатах? Так же: выгрузите реальные отзывы и вопросы из личного кабинета, отберите показательные, задайте эталоны. Отдельно проверьте, что агент не обещает того, чего нет в карточке и регламенте, — по срокам, гарантии, возвратам. Здесь цена выдумки особенно высокая.

Что делать, если после тестов агент не проходит критерии? Это нормальный результат первого прогона. У вас есть список конкретных провалов — по ним видно, чего не хватает в базе, где нужны триггеры эскалации, какие темы вообще нельзя отдавать агенту. Правите, прогоняете снова. Запуск откладывается на дни, а не проваливается на клиентах.

AI automation diagnostic

Хотите понять, что автоматизировать у себя?

Опишите Дмитрию процесс, где команда теряет время или ошибается. Разберём, где хватит простого бота, а где нужен AI-агент с данными, логами и контролем.

Написать @dmkosik