AI определяет вопрос клиента в переписке
Задача звучит просто: понять, что клиент задал вопрос и ждёт ответа. На ней хорошо видно, как измерять качество классификации до внедрения.
Зачем это бизнесу
Сделки теряются не из-за плохого предложения, а из-за молчания. Клиент спросил про сроки в пятницу вечером, менеджер увидел сообщение в понедельник — и к этому времени клиент уже написал конкурентам.
Руководитель не может читать все переписки. Но если система сама помечает сообщения, требующие ответа, и считает время до реакции, появляется управляемая величина: сколько диалогов висит без ответа дольше нормы.
Почему задача сложнее, чем кажется
Вопросительный знак не помогает. «Подскажите стоимость» — вопрос без знака. «Понятно, спасибо?» — знак без вопроса. Клиент может задать вопрос в середине длинного сообщения или тремя сообщениями подряд, из которых ответа требует только первое.
Отдельная категория — вопросы, на которые отвечать не нужно: риторические, адресованные не менеджеру, уже отвеченные выше в переписке.
Ход эксперимента
Что именно измерять
Общая доля правильных ответов почти бесполезна: если вопросов в переписке пятая часть, модель, которая всегда отвечает «не вопрос», будет права в восьмидесяти процентах случаев и при этом бесполезна.
Считать нужно две вещи по отдельности:
- Сколько настоящих вопросов пропущено. Это прямые потери — ровно то, ради чего всё затевалось.
- Сколько ложных срабатываний. Это стоимость внимания: если система дёргает менеджера впустую, он перестаёт реагировать на уведомления вообще.
Баланс между ними — управленческое решение, а не техническое. Для контроля пропущенных обращений допустимо ошибаться в сторону лишних срабатываний. Для автоматического ответа клиенту — наоборот.
Что выяснилось
Основная работа уходит не на модель, а на разметку и на договорённость о том, что считать вопросом. Пока два человека в команде размечают одну и ту же выборку по-разному, измерять качество бессмысленно — не с чем сравнивать.
Второе наблюдение: контекст решает. Одно сообщение в отрыве от переписки классифицируется заметно хуже, чем то же сообщение вместе с предыдущими репликами диалога.