← блог Paramiko
AI automation / business / Paramiko

AI-ассистент поддержки на базе знаний: как внедрить без галлюцинаций

Главный страх, из-за которого поддержку не отдают ИИ, звучит так: «А если он придумает ответ, которого нет в наших правилах, и клиент на него сошлётся?» Страх обоснованный. Обычная языковая модель, спрошенная про сроки возврата или условия гарантии, выдаст правдоподобный текст — и он вполне может не совпадать с вашим регламентом.

Решается это не «более умной моделью», а архитектурой. Ассистент должен отвечать не из головы, а из ваших документов: базы знаний, регламентов, карточек товаров, переписки. Этот подход называется RAG — retrieval-augmented generation, генерация с опорой на найденные источники. Ниже — как это работает на практике, где границы, и что реально экономит.

Главный страх, из-за которого поддержку не отдают ИИ, звучит так: «А если он придумает ответ, которого нет в наших правилах, и клиент на него сошлётся?» Страх обоснованный. Обычная языковая модель, спрошенная про сроки возврата или условия гарантии, выдаст правдоподобный текст — и он вполне может не совпадать с вашим регламентом.

Решается это не «более умной моделью», а архитектурой. Ассистент должен отвечать не из головы, а из ваших документов: базы знаний, регламентов, карточек товаров, переписки. Этот подход называется RAG — retrieval-augmented generation, генерация с опорой на найденные источники. Ниже — как это работает на практике, где границы, и что реально экономит.

Коротко

  • Галлюцинация — это когда модель уверенно отвечает то, чего нет в ваших данных. Убирается не запретами, а тем, что модель отвечает только по найденным фрагментам ваших документов (RAG).
  • RAG-ассистент сначала ищет релевантные куски в вашей базе знаний, потом формулирует ответ строго по ним, и показывает, откуда взял.
  • Если в источниках ответа нет — ассистент говорит «не знаю» и передаёт диалог человеку. Это fallback, и он обязателен.
  • Что экономит: 40–70% типовых обращений (сроки, статусы, «как сделать X», условия) закрываются без оператора. Люди остаются на сложном и на эмоциональном.
  • Что нельзя отдавать полностью: возвраты денег, изменение заказа, юридические формулировки, обещания скидок. Тут ассистент готовит ответ, а подтверждает человек.
  • Первый шаг — не выбор модели, а наведение порядка в самих текстах базы знаний. Мусор на входе = мусор на выходе.

Проблема: почему «просто подключить ChatGPT» ломается

Представьте магазин на WB и Ozon плюс свой сайт. В поддержку каждый день летит одно и то же: «где мой заказ», «подходит ли размер», «как оформить возврат», «работает ли товар с моделью N». Операторы отвечают по кругу, вечером устают, ночью не отвечают вообще.

Соблазн очевиден: взять языковую модель и посадить её на первую линию. Но голая модель не знает ваших условий. Она знает «как обычно бывает в интернете». На вопрос про возврат она уверенно расскажет про 14 дней по закону — а у вас на конкретную категорию свои правила, и часть товаров возврату не подлежит. Клиент получает ответ, скриншотит его и приходит с претензией. Хуже, чем если бы бота не было.

Вторая ловушка — «зашьём все правила в промпт». Пока правил десять, работает. Когда их триста, и они меняются каждую неделю (акции, новые товары, обновлённые сроки), промпт превращается в неуправляемую простыню. Никто не помнит, что там написано, обновления теряются, ответы расходятся с реальностью.

Корень проблемы один: знание живёт отдельно от модели и постоянно меняется. Значит, модель не должна это знание держать в себе. Она должна каждый раз доставать актуальный кусок и отвечать по нему.

Как это работает: RAG по шагам

RAG звучит академично, но механика простая. Разберём на одном обращении.

1. База знаний превращается в поисковый индекс. Ваши регламенты, FAQ, карточки, инструкции разбиваются на небольшие фрагменты (абзац-два). Каждый фрагмент прогоняется через модель-эмбеддер, которая переводит смысл текста в числовой вектор. Всё складывается в векторную базу. Это делается один раз и потом обновляется при изменениях.

2. Приходит вопрос клиента. «Можно вернуть открытую коробку с наушниками?» Вопрос тоже превращается в вектор, и система ищет в базе фрагменты, ближайшие по смыслу — не по совпадению слов, а по значению. Находит ваш регламент по возврату электроники и пункт про вскрытую упаковку.

3. Модель отвечает по найденному. В модель уходит не «ответь как знаешь», а конкретная инструкция: «Вот вопрос клиента. Вот три фрагмента из базы. Ответь только на их основе. Если в них нет ответа — так и скажи». Модель формулирует человеческий ответ, опираясь строго на эти абзацы.

4. Ответ отдаётся со ссылкой на источник. Внутри системы (а иногда и клиенту) видно, из какого документа взят ответ. Это и есть защита от галлюцинаций: если проверяющий сомневается, он за секунду смотрит первоисточник.

5. Если релевантных фрагментов нет — срабатывает fallback. Система не заставляет модель «что-нибудь придумать». Диалог уходит человеку, а вопрос попадает в лог как пробел в базе знаний.

Ключевая мысль: галлюцинации убираются не тем, что мы просим модель «не врать», а тем, что мы физически не даём ей отвечать без опоры на источник. Ответ без найденного фрагмента невозможен по конструкции.

Три уровня контроля, которые делают ответы надёжными

Одного RAG мало. На практике надёжность держится на трёх слоях.

Порог релевантности. У найденных фрагментов есть оценка близости к вопросу. Если лучший фрагмент слишком «далёкий» — значит, в базе ответа нет, и лучше передать человеку, чем натягивать. Этот порог настраивается: слишком строгий — ассистент часто пасует, слишком мягкий — начинает фантазировать. Подбирается на реальных диалогах.

Явное разрешение сказать «не знаю». Модель по умолчанию хочет быть полезной и всегда что-то отвечает. В инструкции прямо прописывается, что честное «я уточню у коллеги» — это правильный ответ, а не провал. Без этого разрешения модель будет тянуться заполнить пустоту.

Разделение «ответить» и «сделать». Рассказать про условия возврата — можно автоматически. Оформить возврат денег, поменять заказ, выдать промокод — только через подтверждение человека или через строго ограниченное действие с логом. Об этом отдельно ниже, в блоке про риски.

Что это даёт: где реально экономится время

Считать эффект надо не в «вау», а в часах и деньгах. Ориентиры из типовых внедрений в SMB.

Доля автоответов. В нормальной поддержке 40–70% обращений — повторяющиеся: статус заказа, сроки, наличие, «как сделать», условия, совместимость. Именно их RAG-ассистент закрывает без оператора. Оставшиеся 30–60% — сложные, спорные, эмоциональные — остаются людям, и это правильно.

Скорость первого ответа. Клиент на маркетплейсе или в Telegram получает ответ за секунды, а не через два часа. На WB/Ozon скорость ответа влияет на рейтинг магазина и на решение о покупке — здесь это не только про удобство, но и про деньги.

Ночь и пики. Ассистент отвечает 24/7. Ночные вопросы и всплески в распродажи не копятся в очередь до утра. Оператор утром разбирает не 200 сообщений, а 40 действительно сложных.

Разгрузка первой линии. Если считать грубо: поддержка из трёх человек, каждый тратит около половины дня на однотипные ответы — это примерно полторы ставки, уходящие в рутину. Сняв её, вы либо освобождаете людей под рост, либо перенаправляете на удержание и продажи.

Отдельно про то, чего RAG не делает. Он не «заменяет поддержку». Он снимает механическую часть и оставляет людям то, где нужны эмпатия, суждение и ответственность. Клиент с реальной проблемой должен быстро дойти до человека, а не застрять в боте — иначе экономия обернётся оттоком.

Если вы ещё не уверены, что процесс вообще созрел для автоматизации, стоит сначала свериться с этим: как понять, что процесс пора автоматизировать.

Риски и как их закрывать

Честный разговор о рисках важнее списка возможностей. Вот что реально ломается и что с этим делать.

Ответ по устаревшему документу. База знаний рассинхронизирована с реальностью: акция кончилась, а фрагмент про неё остался. Лечится процессом обновления — у каждого документа есть владелец и дата, изменения в регламентах сразу попадают в индекс. Ассистент не умнее ваших текстов.

Ложная уверенность на грани темы. Вопрос почти покрыт базой, но не совсем, и модель достраивает недостающее. Здесь работает порог релевантности и регулярный просмотр логов: раз в неделю смотрите, где ассистент ответил, а стоило передать человеку.

Действия с последствиями. Всё, что двигает деньги, меняет заказ или создаёт обязательство перед клиентом, — не на автопилоте. Схема: ассистент готовит черновик ответа или действия, человек одобряет. Либо действие разрешено, но узкое и залогированное — например, «показать статус заказа из CRM» безопасно, а «оформить возврат средств» — только через оператора.

Доступ к данным. Ассистент видит только то, что ему положено. Он не должен из клиентского чата дотягиваться до внутренней аналитики, чужих заказов или персональных данных не того человека. Права доступа настраиваются на уровне источников, а не «по доброте модели».

Отсутствие следов. Если что-то пошло не так, вы должны видеть: какой вопрос был, какие фрагменты нашлись, что ответил ассистент, передал ли человеку. Логи — это не бюрократия, а единственный способ отлаживать и доказывать корректность. Без них вы внедрили чёрный ящик.

Общий принцип — human-in-the-loop: человек не выключен из процесса, он поднят на уровень контроля и сложных случаев. Это и надёжнее, и спокойнее для команды, которая иначе будет саботировать «бота, который отвечает клиентам вместо меня».

Как внедрять: порядок шагов

Порядок важнее инструментов. Частая ошибка — начать с выбора модели и векторной базы. Начинать надо с содержания.

Шаг 1. Собрать реальные вопросы. Выгрузите переписку поддержки за пару месяцев. Сгруппируйте по темам, посчитайте частоту. Вы удивитесь, насколько всё сводится к 20–30 повторяющимся сюжетам. Это ваша карта — что автоматизировать в первую очередь.

Шаг 2. Навести порядок в базе знаний. На каждый частый вопрос должен быть один короткий, однозначный, актуальный фрагмент ответа. Не десять противоречивых документов, а один источник правды. Это самая скучная и самая важная часть — 80% качества будущего ассистента закладывается здесь.

Шаг 3. Собрать RAG-контур. Индекс, поиск по смыслу, генерация ответа по найденному, порог релевантности, fallback на человека. На этом этапе выбираются модель и хранилище — но это уже техника, а не суть.

Шаг 4. Прогнать на закрытой выборке. Возьмите 100–200 реальных вопросов и посмотрите ответы глазами. Где придумал — правьте базу или порог. Где спасовал зря — добавьте фрагмент. Это итерации, а не «настроили и забыли».

Шаг 5. Запустить в тени или на узком канале. Сначала ассистент подсказывает оператору («вот черновик ответа»), а не пишет клиенту напрямую. Оператор одобряет или правит. Так вы копите статистику и доверие без риска. Потом самые надёжные темы переводите в автоответ, спорные оставляете человеку.

Шаг 6. Смотреть логи и достраивать. Каждую неделю: где передал человеку, где ошибся, чего не хватило в базе. Ассистент поддержки — это не проект «сдал и ушёл», а система, которая улучшается по мере того, как вы затыкаете пробелы в знаниях.

Разница между демо-ботом и рабочим ассистентом — как раз в шагах 4–6. Показать красивый диалог легко. Держать точность на потоке реальных вопросов — это про источники, пороги, логи и обновление. Подробнее про эту грань — в статье что такое AI-агент для бизнеса.

Мини-чек-лист готовности к запуску

  • Собраны реальные обращения и сгруппированы по частоте.
  • На топ-30 вопросов есть единый актуальный источник ответа.
  • У документов есть владелец и дата обновления.
  • Настроен fallback: нет источника — передаём человеку.
  • Действия с деньгами/заказами идут через подтверждение.
  • Права доступа ограничены нужными источниками.
  • Логи пишутся: вопрос, найденные фрагменты, ответ, эскалация.
  • Есть тестовая выборка и человек, который смотрит ответы глазами.

FAQ

Чем RAG-ассистент отличается от обычного чат-бота на кнопках? Кнопочный бот ведёт по заранее прописанным сценариям и ломается на любом вопросе не по скрипту. RAG-ассистент понимает вопрос в свободной формулировке и отвечает по вашей базе знаний, а не по жёсткому дереву. И честно передаёт человеку то, чего в базе нет.

Можно ли вообще исключить галлюцинации? Свести к нулю на 100% — нельзя, это язык, а не калькулятор. Но можно сделать их редкими и безопасными: отвечать только по найденным источникам, ставить порог релевантности, разрешать «не знаю», показывать первоисточник и смотреть логи. На практике этого достаточно, чтобы доверять ассистенту первую линию.

Что будет, если ассистент не знает ответа? Он не выдумывает. Срабатывает fallback: диалог уходит оператору, а сам вопрос попадает в лог как пробел в базе знаний — потом вы его закрываете. Молчаливое «придумывание» — это как раз то, что архитектура запрещает.

Насколько сложно поддерживать базу знаний? Основная работа — разовая, на старте: собрать и вычистить топовые вопросы. Дальше это точечные обновления при изменении условий, акций, ассортимента. Правило простое: поменяли правило в жизни — обновили документ, изменение сразу попало в индекс.

Подойдёт ли это для WB/Ozon и Telegram? Да. Ассистент подключается к каналам, где вы уже общаетесь с клиентами: Telegram, чаты маркетплейсов, виджет на сайте. Логика одна — отвечать по базе, передавать сложное человеку. Отличается только интеграция канала.

Сколько времени занимает внедрение? Базовый рабочий контур на 20–30 частых тем реально собрать за пару-тройку недель, если тексты в порядке. Больше всего времени съедает не техника, а наведение порядка в самих ответах. Поэтому оценку всегда даём после того, как посмотрим на вашу базу и обращения.

Останутся ли операторы без работы? Нет. Уходит механическая часть — повторяющиеся вопросы. Люди остаются на сложном, спорном и эмоциональном, где нужны суждение и ответственность. Обычно команду не сокращают, а перенаправляют на удержание и продажи.

Что дальше

Если вы прочитали это и узнали свою поддержку — с очередью одинаковых вопросов и уставшими операторами — начните не с бота, а с выгрузки обращений. Посмотрите, какие 20–30 сюжетов повторяются. Это уже половина проекта.

Если хочешь понять, что автоматизировать у себя в первую очередь и стоит ли вообще, — напиши Дмитрию в Telegram @dmkosik или коротко опиши свой процесс поддержки для диагностики Paramiko. Разберём без обязательств: где RAG реально сэкономит, а где сначала надо навести порядок в базе. Без давления — просто честная оценка.

AI automation diagnostic

Хотите понять, что автоматизировать у себя?

Опишите Дмитрию процесс, где команда теряет время или ошибается. Разберём, где хватит простого бота, а где нужен AI-агент с данными, логами и контролем.

Написать @dmkosik