LAB / 03 · AI · SALES

AI определяет вопрос клиента в переписке

Задача звучит просто: понять, что клиент задал вопрос и ждёт ответа. На ней хорошо видно, как измерять качество классификации до внедрения.

WHY / BUSINESS

Зачем это бизнесу

Сделки теряются не из-за плохого предложения, а из-за молчания. Клиент спросил про сроки в пятницу вечером, менеджер увидел сообщение в понедельник — и к этому времени клиент уже написал конкурентам.

Руководитель не может читать все переписки. Но если система сама помечает сообщения, требующие ответа, и считает время до реакции, появляется управляемая величина: сколько диалогов висит без ответа дольше нормы.

PROBLEM / NUANCE

Почему задача сложнее, чем кажется

Вопросительный знак не помогает. «Подскажите стоимость» — вопрос без знака. «Понятно, спасибо?» — знак без вопроса. Клиент может задать вопрос в середине длинного сообщения или тремя сообщениями подряд, из которых ответа требует только первое.

Отдельная категория — вопросы, на которые отвечать не нужно: риторические, адресованные не менеджеру, уже отвеченные выше в переписке.

EXPERIMENT / FLOW

Ход эксперимента

01Берём выгрузку переписок и отбираем случайную выборку сообщений
02Размечаем её вручную: требует ответа или нет
03Формулируем задачу модели, отдельно описывая спорные случаи
04Прогоняем выборку и сравниваем с ручной разметкой
05Разбираем расхождения и уточняем формулировку
06Повторяем на новой выборке, которую модель не видела
METRICS / HOW

Что именно измерять

Общая доля правильных ответов почти бесполезна: если вопросов в переписке пятая часть, модель, которая всегда отвечает «не вопрос», будет права в восьмидесяти процентах случаев и при этом бесполезна.

Считать нужно две вещи по отдельности:

  • Сколько настоящих вопросов пропущено. Это прямые потери — ровно то, ради чего всё затевалось.
  • Сколько ложных срабатываний. Это стоимость внимания: если система дёргает менеджера впустую, он перестаёт реагировать на уведомления вообще.

Баланс между ними — управленческое решение, а не техническое. Для контроля пропущенных обращений допустимо ошибаться в сторону лишних срабатываний. Для автоматического ответа клиенту — наоборот.

Что выяснилось

Основная работа уходит не на модель, а на разметку и на договорённость о том, что считать вопросом. Пока два человека в команде размечают одну и ту же выборку по-разному, измерять качество бессмысленно — не с чем сравнивать.

Второе наблюдение: контекст решает. Одно сообщение в отрыве от переписки классифицируется заметно хуже, чем то же сообщение вместе с предыдущими репликами диалога.

Посмотрим, сколько обращений остаётся без ответа у вас.

Показать процесс