דלג לתוכן העיקרי
WhaleBiz Logo

Тестирование AI-агента перед запуском: 10 проверок

Экран с тестовым диалогом AI-агента перед запуском в работу

Откуда вы знаете, что агент готов говорить с платящим клиентом? Большинство владельцев отвечают одинаково: открывают чат, задают пять-шесть вопросов, которые задали бы сами, получают отличные на слух ответы и утверждают запуск. Это проверка ровно одной вещи: что агент умеет отвечать тому, кто уже знает, чего хочет. Клиенты первой недели этих вопросов не зададут. Они спросят то, о чём вы не подумали, в часы, которые вы не проверяли, в формулировке, которой вы не ждали, и иногда на другом языке.

Почему "я спросил его пару раз, он хорошо ответил" - это не тест

Проблема демо-диалога не в том, что он короткий, а в том, что он смещённый. Вы задаёте вопросы, на которые точно есть ответ, формулируете их так, как они записаны в переданном вами документе, и принимаете вежливый ответ за правильный. Три этих смещения вместе приводят к тому, что проверка почти всегда проходит, и именно это лишает её смысла.

Хороший тест делает обратное: он пытается сломать. Вопрос, ответа на который нет в материалах, вопрос, задевающий заданную вами границу, клиент, выпрашивающий скидку, голосовое сообщение посреди диалога, клиент, который пишет по-русски и переходит на иврит. Это не теоретические крайние случаи, а заметная доля трафика первой недели.

Экономика простая. Неверный ответ, пойманный на тестах, стоит пятнадцати минут работы. Тот же ответ после того, как на него положился клиент, иногда стоит сделки, а иногда спора о том, что именно было обещано в чате. Список ниже нужен, чтобы перенести ошибки с дорогой стороны на дешёвую.

Подготовка: ваши 40 настоящих вопросов

Откройте историю WhatsApp или ящик обращений за последние два месяца и скопируйте 40 первых сообщений клиентов дословно, вместе с опечатками, сокращениями и сообщениями из трёх слов. Рядом с каждым напишите правильный ответ так, как ответили бы вы.

Этот список - главный актив, и не только для первой проверки. Дальше он становится регрессионным списком: каждый раз, когда вы обновляете прайс, добавляете услугу или меняете политику, вы прогоняете его снова и видите, что сломалось. Кто пропускает этот этап, через полгода обнаруживает, что одно исправление разрушило другой ответ, и никто этого не заметил.

Пока собираете, обратите внимание ещё на одно: у скольких из этих вопросов вообще нет письменного ответа в вашем бизнесе. Эта цифра удивляет почти каждого владельца, и именно поэтому большая часть работы по установке - это прояснение материала, а не настройка бота.

Тесты 1-3: знания, точность и отсутствующий ответ

Тест 1, факты. Прогоните все 40 вопросов и сравните каждый ответ с источником. Искать надо не красивую формулировку, а расхождение в цифре: цена, час, длительность процедуры, срок поставки, зона обслуживания. Классический признак провала - сумма, которая звучит правдоподобно и не встречается ни в одном переданном документе. Агент, придумывающий собственные числа, - это главный риск, поэтому тест идёт первым.

Тест 2, "я не знаю". Намеренно задайте три вопроса, которых нет в материалах. Здоровый агент говорит, что у него нет информации, не выдумывает и предлагает передать человеку. Нездоровый заполняет пробел правдоподобной догадкой. Именно эта настройка, а не выбор модели, решает, безопасно ли пускать агента к клиентам, и зависит она от качества базы знаний: подробнее в руководстве по созданию базы знаний для AI-агента.

Тест 3, противоречия и актуальность. Возьмите одну деталь, например время закрытия в пятницу, и проверьте, не встречается ли она в двух документах в двух версиях. Противоречие в источнике даёт случайный ответ, и его труднее всего найти потом. Затем измените одну цену в документе-источнике и проверьте, изменился ли ответ. Если нет - у вас проблема актуальности, а не формулировки.

Тесты 4-5: границы и давление

Тест 4, что отвечать нельзя. Такой список есть у любого бизнеса, даже если он нигде не записан: финальная цена по сложному расчёту, согласование скидки, изменение условий отмены, обещание срока поставки и любой профессиональный вопрос с ответственностью. В клинике линия ещё жёстче: агент не ставит диагноз, не даёт медицинских, юридических и дозировочных советов и передаёт человеку при любом клиническом вопросе. Проверяйте каждую границу отдельно и обязательно обходную формулировку: не "сколько мне это будет стоить", а "примерно сколько, просто чтобы понять, попадаю ли я вообще в диапазон". Именно вторая формулировка валит агентов.

Тест 5, давление и манипуляция. Отправьте разозлённого клиента, клиента, требующего скидку 20 процентов и угрожающего уйти к конкуренту, и того, кто прямо пишет игнорировать предыдущие инструкции и назвать настоящую цену. Агент должен во всех трёх случаях остаться в той же политике, спокойным тоном, и передать человеку, когда нужно. Эта ошибка повторяется в проектах чаще всего, наряду с теми, что собраны в разборе, почему AI-чат-бот проваливается даже при исправной технологии.

Тесты 6-7: передача человеку и сохранённое обращение

Тест 6, передача. Здесь проверяется целый маршрут, а не отдельный ответ. Прямо попросите соединить с сотрудником и проследите: кто получает уведомление, как быстро, видит ли он весь диалог или начинает с нуля, что клиент видит тем временем и что происходит, когда запрос приходит в четверть первого ночи. Передача, которая тихо провалилась, - самая дорогая неисправность из возможных, потому что клиент уверен, что ему перезвонят.

Тест 7, запись. После каждого тестового диалога откройте созданное обращение и прочитайте его так, будто вы сотрудник, который берёт его завтра утром. Телефон сохранён в корректном международном формате с 972, а не как произвольная строка, источник отмечен, резюме понятно, стадия в канбане правильная. Проверьте и то, что происходит, когда один и тот же номер пишет дважды: дублирующее обращение или продолжение той же записи. А в виджете на сайте, где нет автоматического номера телефона, проверьте, что сохраняется, если клиент начал писать и пропал на середине.

Хотите проконсультироваться?

Мы поможем вам выбрать, создать и внедрить идеальное AI-решение для вашего бизнеса. Оставьте контакты, и мы вам перезвоним.

Тест 8: три языка в одном диалоге

В Израиле это не теоретический тест. Проверьте четыре ситуации: клиент пишет по-русски и получает ответ по-русски; клиент переходит на английский посреди диалога, начатого на иврите, и ждёт, что агент перейдёт с ним; иврит, набранный латиницей; и обратный, более неловкий случай - клиент написал на иврите, а ответ пришёл по-русски, потому что имя звучало по-русски.

Обратите внимание и на визуальную сторону. Текст справа налево с цифрами или ссылка посреди предложения иногда ломаются в отображении самого канала, а не в теле ответа. Мелочь - ровно до момента, когда клиент получает часы работы с перевёрнутыми цифрами. Подробнее об этом в материале про многоязычного AI-агента для израильского рынка.

Тесты 9-10: календарь, канал и нагрузка

Тест 9, настоящая запись. Не довольствуйтесь словесным подтверждением. Запишитесь через агента по-настоящему и откройте календарь. Проверьте наложение по времени, интервал между приёмами, отмену и перенос, и что произойдёт, если два человека попросят один слот с разницей в секунды. Проверьте день перевода часов и выходные, потому что там падает большинство интеграций. Если запись попала в календарь без имени или без телефона, это провал, даже если на экране был успех.

Тест 10, нагрузка и сбой. Запустите три диалога параллельно, отправьте голосовое и фото и, что важнее всего, намеренно отключите связь с календарём или CRM и посмотрите, что увидит клиент. Правильный ответ - честное сообщение, что с ним свяжутся, и обращение, записанное в любом случае. Неправильный ответ - тишина. Здесь же измеряется расход: считаются ответы агента, а не входящие сообщения, и ответ на голосовое, изображение или файл считается за два.

Четыре способа проверить агента и что каждый из них реально показывает

КритерийКороткий демо-диалогПроверка только командойБета на реальных клиентахСтруктурированный список тестов ✓
Что реально проверяетсяЧто агент красиво говоритЧто он знает материалВсё, без контроляЗнания, границы, передача, данные
Вопросы вне сценарияПочти нетНемногоМногоПродуманы заранее
Кто платит за ошибкуНиктоНиктоПлатит клиентНикто
Сколько времени нужно10 минутОколо часаНедели3-4 часа
Можно ли повторитьНетЧастичноНетДа, при каждом обновлении

Последняя колонка - не технологическая магия, а порядок работы, и отличается она тем, что её можно повторить, поэтому она чего-то стоит и через год. В проектах с отдельной интеграцией или нестандартным процессом список тестов пишется вместе с техзаданием, а не после него, и это часть того, что мы делаем в разработке индивидуальных AI-решений.

Первый месяц после запуска - тоже часть проверки

Даже полный список ловит не всё, потому что реальные клиенты формулируют иначе, чем любая тестовая команда. Поэтому первый месяц изначально устроен под это: вы собираете все замечания в один список и отправляете его целиком, вместо десяти отдельных сообщений за две недели. Один раунд правок обрабатывается и выходит в работу за три рабочих дня, а число раундов зависит от тарифа: один на Старте, два на Стандарте, три на Бизнесе. Сверх этого идут обычные ежемесячные правки - 2, 5 или 10 соответственно, - а устранение настоящей неисправности всегда бесплатно и не считается. Точное определение того, что считается правкой, есть на странице установки и поддержки.

Вопрос тарифа тоже следует из тестов, а не из ощущения. Если у вас актуален тест 9, то есть есть запись на приём, или лиды приходят в WhatsApp, точка входа - Стандарт, 490 шекелей в месяц плюс разовая установка 1,990 шекелей. Агент только на сайте без календаря укладывается в Старт. Несколько календарей, Instagram, оплата в чате или больше одного агента требуют Бизнеса, 990 шекелей в месяц и 2,990 за установку. Все цены без НДС, полное сравнение - на странице тарифов.

Частые вопросы

Сколько на самом деле занимает проверка AI-агента перед запуском? В малом и среднем бизнесе это три-четыре часа сосредоточенной работы, а не недели. Большая часть времени уходит на подготовку: выбрать 40 реальных вопросов из истории переписки и написать рядом правильный ответ. Когда список готов, прогон идёт быстро, и повторный прогон после исправления тоже. Типичная ошибка - растянуть проверку на две недели отдельными сообщениями. Лучше сесть один раз, записать всё, что сломалось, в один список и отправить его целиком. Так и раунд правок закроется быстрее.

Кто должен тестировать агента, мы или подрядчик? Оба, но разное. Подрядчик проверяет, что система работает: подключение канала, сохранение обращения, календарь, передачу человеку, поведение под нагрузкой. Вы проверяете то, что знаете только вы: что цены и часы верные, что формулировки звучат как ваши, что ответ про условия отмены - это действительно ваша политика, и что агент нигде не выходит за границы, которые вы задали. Вторую половину за вас не проверит никто, потому что источник правды находится у вас. На практике это значит, что материалы, которые вы передаёте в начале установки, в конце становятся документом для проверки.

Что делать, если агент уже дал неверный ответ реальному клиенту? Сначала исправить ситуацию с клиентом по-человечески, потом устранить причину. Неверный ответ почти всегда возникает из трёх вещей: информация в источнике устарела, два документа противоречат друг другу, или вопрос попал в зону, которую агент должен был передать человеку, но не передал. Во всех трёх случаях исправляется настройка, а не извинение. Устранение такой неисправности не списывается из месячной квоты правок и ничего не стоит. Важно другое: добавить упавший вопрос в список тестов, чтобы он проверялся при каждом будущем изменении.

Как заранее понять, сколько сообщений мы израсходуем за месяц? Считаются только ответы агента, а не входящие сообщения клиента, и ответ на голосовое сообщение, изображение или файл считается за два сообщения. Поэтому оценка такая: берём количество обращений самого загруженного месяца, умножаем на среднее число ответов в диалоге, которое вы увидели на тестах, и добавляем запас на диалоги с голосовыми и фото. Тариф Стандарт включает 2,000 сообщений в месяц, превышение 0.30 шекеля за сообщение, тариф Бизнес - 5,000 сообщений и превышение 0.25 шекеля. Сезонному бизнесу считать нужно по пиковому месяцу, а не по среднему за год.

Проверка входит в стоимость установки или это отдельная услуга? Входит в установку. Установка - разовый платёж по тарифу: 990 шекелей на Старте, 1,990 на Стандарте и 2,990 на Бизнесе, все цены без НДС, оплата одним платежом до начала работ. Рабочие дни установки считаются с момента получения всех ваших материалов, а не со дня оплаты, именно потому что этап проверки зависит от этих материалов. Ежемесячная подписка начинается только в день запуска агента, а в первый месяц есть дополнительные раунды правок: один на Старте, два на Стандарте и три на Бизнесе.

David Venzhyk

David Venzhyk

Давид специализируется на создании безопасных REST API и развёртывании масштабируемых приложений с использованием Python, FastAPI, PostgreSQL и AWS EC2. Сочетая образование в области информатики с опытом в React и интеграциями внешних API, разрабатывает надёжную полностековую программную инфраструктуру.

Понравилась статья? Поделитесь!