← блог Paramiko
AI automation / business / Paramiko

Как измерить эффект AI-автоматизации после запуска: KPI, baseline и контрольная группа

Автоматизацию чаще всего запускают на энтузиазме, а закрывают на разочаровании. Между этими двумя точками почти всегда одна и та же дыра: никто не замерил, как было до, поэтому спорить о том, стало ли лучше, приходится ощущениями. «Вроде бы отвечаем быстрее», «кажется, заявок стало больше» — этого хватает, чтобы запустить, и не хватает, чтобы защитить бюджет через три месяца.

Эта статья — про то, как поставить измерение так, чтобы через квартал у вас был честный ответ на вопрос «что нам это дало», а не набор красивых, но недоказуемых графиков.

Автоматизацию чаще всего запускают на энтузиазме, а закрывают на разочаровании. Между этими двумя точками почти всегда одна и та же дыра: никто не замерил, как было до, поэтому спорить о том, стало ли лучше, приходится ощущениями. «Вроде бы отвечаем быстрее», «кажется, заявок стало больше» — этого хватает, чтобы запустить, и не хватает, чтобы защитить бюджет через три месяца.

Эта статья — про то, как поставить измерение так, чтобы через квартал у вас был честный ответ на вопрос «что нам это дало», а не набор красивых, но недоказуемых графиков.

Коротко

Чтобы измерить эффект AI-автоматизации, нужно сделать четыре вещи до запуска, а не после:

  1. Снять baseline — зафиксировать текущие цифры процесса за 2–4 недели: время ответа, конверсию, количество ошибок, часы ручной работы. Без исходной точки любой результат недоказуем.
  2. Выбрать 2–4 KPI, а не двадцать. По одному на каждый уровень: скорость, качество, деньги, нагрузка на людей.
  3. Оставить контрольную группу — часть заявок/клиентов/SKU, которые идут по-старому. Иначе сезонность и реклама припишут себе ваш эффект.
  4. Считать ROI честно: экономию и прирост минус стоимость разработки, подписок и времени на контроль.

Дальше — как это сделать на практике, где обычно врут цифры и что проверить перед тем, как поверить в результат.

Проблема: «стало лучше» — это не измерение

Типичная история. Компания подключила AI-агента к поддержке в Telegram. Через месяц руководитель говорит: «Клиенты довольны, отвечаем моментально». Спрашиваю: на сколько сократилось время первого ответа? — «Ну, раньше долго, теперь сразу». А сколько было раньше в минутах? — тишина.

Проблема не в том, что автоматизация не работает. Проблема в том, что её эффект невозможно ни доказать, ни опровергнуть. А значит:

  • нельзя обосновать следующий бюджет — «дайте ещё денег на то, что мы не смогли посчитать»;
  • нельзя понять, окупилось ли вообще, или вы просто платите за подписку и любуетесь;
  • нельзя отличить эффект автоматизации от эффекта сезона, новой рекламы или того, что уволился медленный менеджер.

Последнее — самая частая ловушка. В ноябре у селлера на WB выросли продажи, и он уверен, что это AI-обработка отзывов. А на самом деле это Чёрная пятница, и точно так же выросло бы без всякого AI. Без точки отсчёта и контрольной группы вы будете приписывать автоматизации чужие заслуги — и однажды на этом обожжётесь.

Шаг 1. Снимите baseline до запуска

Baseline — это фотография процесса в его нынешнем виде. Снять её нужно до того, как вы что-либо включили, потому что задним числом честные цифры не восстанавливаются.

Что фиксировать, зависит от процесса, но принцип один: берите то, что реально болит, и то, что можно померить в числах.

Поддержка / заявки:

  • среднее время первого ответа (в минутах, по будням и выходным отдельно);
  • сколько обращений в день/неделю;
  • какая доля обращений закрывается без эскалации на человека;
  • сколько заявок теряется — упало в ночь, никто не ответил, клиент ушёл.

Продажи / CRM:

  • конверсия из заявки в квалифицированный лид и из лида в сделку;
  • скорость первого касания;
  • сколько сделок «зависает» без движения дольше N дней.

Маркетплейсы (WB/Ozon):

  • сколько отзывов остаётся без ответа и за какое время отвечаете;
  • сколько часов в неделю уходит на карточки, остатки, отчёты вручную;
  • доля возвратов и сколько времени тратится на разбор причин.

Отчёты и рутина:

  • сколько часов в неделю человек собирает отчёт руками;
  • сколько раз в месяц в отчёте находят ошибку.

Снимайте baseline не один день, а 2–4 недели. Один день — это шум: понедельник не похож на пятницу, а неделя перед зарплатой не похожа на неделю после. Вам нужно среднее и разброс, а не удачный или неудачный день.

Если данных нет вообще — это уже полезный вывод. Значит, первым делом автоматизация должна начать логировать, а не действовать. Неделя логов без единого автодействия часто вскрывает, что реальная проблема не там, где казалось.

Шаг 2. Выберите KPI, которые действительно про эффект

Ошибка новичка — выбрать двадцать метрик и утонуть. Ошибка посложнее — выбрать метрики, которые растут сами по себе и ничего не говорят о пользе. «AI обработал 5000 сообщений» — это не KPI, это счётчик нагрузки. Он вырастет и если бот отвечает мусором.

Держите по одному показателю на четырёх уровнях:

Скорость. Время первого ответа, время обработки заявки, время закрытия отчёта. Самое наглядное и самое честное — тут труднее всего обмануться.

Качество. Доля правильных ответов, доля обращений, где клиент не переспросил и не пожаловался, процент заявок, квалифицированных верно. Качество мерить дороже — обычно нужна ручная выборочная проверка, — но без него скорость превращается в скорость выдачи брака.

Деньги. Выручка с процесса, сэкономленные часы в рублях, снижение потерь (недоотвеченные заявки, просроченные отзывы, ошибки в закупке). Это то, что понимает собственник.

Нагрузка на людей. Сколько ручных действий осталось, сколько времени команда тратит на контроль автоматизации. Важный и часто забытый KPI: если AI «сэкономил» 10 часов, но добавил 8 часов на перепроверку его решений — эффект почти нулевой, и это надо увидеть цифрой, а не почувствовать по усталости.

Правило: если метрику нельзя связать с деньгами, временем или качеством клиентского опыта — она не KPI, а украшение дашборда.

Шаг 3. Оставьте контрольную группу

Это тот шаг, который отделяет «нам кажется» от «мы знаем». Идея простая: часть потока пусть идёт по-старому, и вы сравниваете две группы в одном и том же периоде. Тогда сезонность, реклама и настроение рынка бьют по обеим одинаково — и разница между ними и есть чистый эффект автоматизации.

Как делить на практике:

  • Поддержка: половина чатов идёт через AI, половина — как раньше. Делите по чётности ID клиента или по времени суток, но так, чтобы группы были сопоставимы.
  • Продажи: одна команда менеджеров работает с AI-квалификацией лидов, другая — вручную. Сравниваете конверсию.
  • Маркетплейсы: на 20 карточках включаете AI-ответы на отзывы, на 20 похожих оставляете ручной режим. Смотрите на скорость ответа и динамику рейтинга.

Если полноценную контрольную группу не собрать — процесс единый, разрезать нельзя, — используйте временное сравнение с оговоркой: месяц до / месяц после при похожих внешних условиях. Это слабее контрольной группы, потому что не защищает от сезона, но лучше, чем ничего. Тогда хотя бы держите рядом внешний ориентир: если у всех в нише в этот месяц продажи выросли на 30%, ваш прирост нужно считать от этой базы, а не от нуля.

Контрольная группа неудобна — хочется же поскорее всё перевести на автоматику. Но именно она через квартал даст вам фразу, которую нельзя оспорить: «в одинаковых условиях группа с AI показала конверсию X против Y без него».

ROI и сэкономленное время: считаем без самообмана

Когда есть baseline, KPI и контрольная группа, ROI перестаёт быть фантазией. Формула банальна, врут обычно в слагаемых.

Эффект = (прирост выручки + сэкономленные деньги) − (стоимость внедрения + подписки + время команды на контроль).

Где чаще всего завышают числитель:

  • Считают «сэкономленные часы» так, будто человека уволили. Но если менеджер просто занялся другим — это не деньги в кассе, а перераспределённое время. Оно ценно, но называйте вещи своими именами: released time, а не прямая экономия.
  • Приписывают автоматизации весь рост, хотя часть дала реклама. Тут вас и спасает контрольная группа.

Где занижают знаменатель:

  • Забывают про время на контроль. Human-in-the-loop — это реальные часы: кто-то читает логи, разбирает спорные ответы, правит промпты. В первые месяцы это может съедать заметную долю экономии, и это нормально — но это надо считать.
  • Забывают про стоимость ошибок. Один автоответ, который нахамил клиенту или пообещал несуществующую скидку, может стоить дороже месяца сэкономленных часов.

Практический ориентир: смотрите не на разовый ROI за первый месяц (он часто отрицательный из-за стоимости внедрения), а на точку окупаемости — когда накопленная экономия перекрывает вложения. Для типовой автоматизации заявок или отчётов в SMB это обычно 2–4 месяца. Если через полгода окупаемость не просматривается даже на горизонте — процесс выбран неверно, и честное измерение как раз позволяет это увидеть вовремя, а не через год.

Риски: где цифры начинают врать

Измерение — не панацея. Оно само по себе может обманывать, если не следить за несколькими вещами.

Оптимизация под метрику. Как только KPI — «время первого ответа», система научится отвечать мгновенно и бессмысленно: «Здравствуйте! Уточняю ваш вопрос». Формально ответ есть, по сути — нет. Поэтому скорость всегда держат в паре с качеством, иначе получаете быстрый брак с красивым дашбордом.

Выжившие данные. Если считать конверсию только по клиентам, которые дошли до конца, вы не увидите тех, кого AI отпугнул на входе. Считайте от полного входящего потока.

Слишком короткое окно. Две хорошие недели ничего не доказывают. Эффект автоматизации проявляется на объёме и во времени — дайте циклу пройти хотя бы месяц-полтора.

Нет логов — нет разбора. Если вы не пишете, что именно AI делал и на основании чего, то при первом же спорном случае не сможете понять, где ошибка. Логи, версии промптов и права доступа — это не бюрократия, а условие того, что измерению вообще можно верить. Про то, что нельзя отдавать AI без подтверждения человеком, стоит договориться до запуска, а не после инцидента.

Как внедрить измерение: пошагово

  1. Опишите процесс и выберите одну точку. Не «автоматизируем поддержку», а «сокращаем время первого ответа в Telegram-поддержке». Чем уже — тем измеримее.
  2. Соберите baseline за 2–4 недели. Если данных нет — сначала включите логирование без автодействий.
  3. Зафиксируйте 2–4 KPI — по одному на скорость, качество, деньги, нагрузку.
  4. Спроектируйте контрольную группу или, если нельзя, честное временное сравнение с внешним ориентиром.
  5. Запустите на части потока. Не переводите всё сразу — так и группу сохраните, и риск ограничите.
  6. Раз в неделю сверяйте две группы и читайте логи спорных случаев руками. Первый месяц контроль плотный, дальше — реже.
  7. Через 4–6 недель посчитайте ROI по накопленному эффекту и примите решение: масштабировать, докрутить или свернуть.

Если на любом из шагов выясняется, что процесс не приносит измеримой пользы, — это не провал, а сэкономленные деньги. Честное измерение ровно для этого и нужно: оно так же хорошо показывает, что автоматизировать не надо, как и то, что надо.

Понять, готов ли процесс к автоматизации в принципе, помогает отдельный разбор — как понять, что процесс пора автоматизировать. А если вы ещё выбираете между чат-ботом и полноценным агентом, посмотрите что такое AI-агент для бизнеса.

FAQ

Сколько времени снимать baseline? Минимум 2 недели, лучше 4. Нужно поймать разброс между будними и выходными, началом и концом месяца. Один день — это шум, по нему нельзя ничего сравнивать.

Что делать, если контрольную группу собрать невозможно? Использовать временное сравнение «до/после» при похожих внешних условиях и обязательно держать рядом внешний ориентир — как менялась ниша в целом. Это слабее контрольной группы, но защищает хотя бы от грубого самообмана.

Сколько KPI брать? От двух до четырёх. По одному на скорость, качество, деньги и нагрузку на людей. Двадцать метрик — это способ ничего не понять и в итоге смотреть только на самую льстивую.

Когда автоматизация должна окупиться? Для типовых процессов SMB — заявки, отчёты, поддержка — обычно 2–4 месяца до точки окупаемости. Первый месяц часто в минусе из-за стоимости внедрения, это нормально. Если через полгода окупаемость не просматривается — процесс выбран неверно.

Как не обмануться на росте продаж? Не приписывать автоматизации весь прирост. Ровно для этого нужна контрольная группа: она показывает, сколько бы выросло и без AI. Всё, что сверх контрольной группы, — ваш чистый эффект.

Считать ли время на контроль автоматизации в затраты? Обязательно. Human-in-the-loop — это реальные часы на чтение логов и разбор спорных ответов. Если их не учесть, ROI будет нарисованным. В первые месяцы контроль может съедать заметную часть экономии — и это надо видеть цифрой.

Что дальше

Если вы уже что-то запустили, но не понимаете, дало ли это эффект, — начните с малого: снимите baseline хотя бы задним числом по логам и выберите одну контрольную группу на будущее.

Если хочешь понять, что автоматизировать у себя и как правильно померить эффект, — напиши Дмитрию в Telegram @dmkosik или опиши свой процесс для диагностики Paramiko. Разберём, где у вас реально теряется время и деньги, и что стоит мерить в первую очередь.

AI automation diagnostic

Хотите понять, что автоматизировать у себя?

Опишите Дмитрию процесс, где команда теряет время или ошибается. Разберём, где хватит простого бота, а где нужен AI-агент с данными, логами и контролем.

Написать @dmkosik