Все материалы
Голосовые агенты4 мин чтения

Голосовой агент должен понимать, когда промолчать

Обнаружить речь недостаточно. Агенту нужно отличать обращение к нему от разговора в стороне, продолжения мысли и отмены прежнего намерения.

Read in English

Наличие речи не означает право отвечать

В комнате говорят два человека. Один обращается к голосовому помощнику, второй перебивает первого, затем оба обсуждают ответ между собой. Обычный определитель речевой активности сообщает только, что микрофон слышит голос. Он не знает, кому адресована фраза и закончена ли она.

Ошибка ответа здесь отличается от ошибки распознавания. Агент может идеально записать слова и все равно вмешаться в чужой разговор. Или принять короткую паузу за конец команды, начать говорить и перекрыть важное уточнение.

Cocktail-Talker формализует решение тремя действиями: ответить, продолжить слушать или проигнорировать. Только первое действие запускает генерацию голосового ответа. Модель обучается на искусственных многопользовательских разговорах с ролями участников, фоновой речью и шумом, сначала на примерах, затем с подкреплением.

Такое разделение полезнее единой вероятности "пользователь закончил". Продолжить слушать означает, что реплика относится к агенту, но мысль еще не завершена. Проигнорировать означает, что речь не требует реакции. У этих ошибок разная цена и разные способы исправления.

Работа пока ранняя. В публикации нет убедительной проверки в рабочем контактном центре и открытой готовой модели. Искусственные диалоги могут содержать слишком явные признаки адресата. Но набор действий хорошо переносится в архитектуру продукта без ожидания нового выпуска модели.

Тишина тоже является действием

Многие голосовые системы оценивают только содержание сгенерированной реплики. Тогда лишний ответ почти не штрафуется, если сам текст разумен. В реальном разговоре своевременное молчание часто лучше правильной фразы.

Для каждого момента система должна хранить состояние очередности: кто сейчас говорит, кому адресована реплика, был ли агент назван, идет ли перебивание и ожидается ли продолжение. Звуковые признаки соединяются с историей разговора и ролями участников. Один порог длительности паузы эту задачу не решает.

Действие "слушать" не должно длиться бесконечно. После разумного интервала агент может коротко уточнить, если команда оборвалась. Действие "игнорировать" тоже оставляет след: если поздняя реплика явно ссылается на пропущенную фразу, систему можно проверить и исправить.

Для телефонного обслуживания есть дополнительная граница. Голос клиента, речь оператора на фоне, запись автоответчика и телевизор могут иметь одинаковую акустику. Нужны признаки канала, собеседника и контекста, а не только уверенность распознавания.

Идентификация говорящего не обязана означать постоянное распознавание личности. Часто достаточно устойчивых ролей внутри одного сеанса: основной собеседник, другой человек рядом и звук из устройства. Эти временные метки уменьшают вмешательства и не требуют хранить голосовой отпечаток клиента после завершения разговора.

Намерение меняется после того, как было понято

Даже верно выбранная очередность не решает длинный диалог. Пользователь раскрывает условия постепенно, исправляет факты и иногда полностью меняет цель. Большой контекст сохраняет все реплики, но не сообщает, какая из них действует сейчас.

LLMs Get Lost in Evolving User Intent превращает статические задачи в многошаговые разговоры. Намерение постепенно раскрывается, пересматривается или перенаправляется в середине беседы. Исходный способ проверки задачи сохраняется, поэтому падение можно связать именно с динамикой диалога.

Сильные модели, хорошо решавшие полностью заданную задачу одним сообщением, заметно теряли качество при меняющемся намерении. Работа охватывает несколько семейств моделей и задач. Она не утверждает, что один новый формат памяти устранит проблему, но показывает слепое место статических испытаний.

Голосовой агент особенно уязвим: исправления звучат естественно и не оформлены как новая спецификация. Фраза "давайте все-таки завтра, и адрес другой" отменяет два ранее сохраненных поля. Простой пересказ разговора может оставить оба варианта рядом.

Нужна явная модель действующего намерения

Помимо расшифровки, система должна хранить структурированное состояние: текущую цель, действующие ограничения, отмененные значения, нерешенные вопросы и подтвержденные внешние действия. Каждое изменение связывается с конкретной репликой и временем.

Перед вызовом инструмента агент перечитывает не весь разговор, а действующее состояние и последние доказательства. Если новое значение конфликтует со старым, старое помечается отмененным, а не исчезает. Для необратимого действия требуется подтверждение именно текущей версии суммы, адреса или времени.

Такое состояние нельзя целиком поручать той же модели, которая ведет разговор. Простые поля и переходы проверяются программно. Неясное исправление остается нерешенным вопросом. После успешного вызова реальное состояние системы записывается отдельно от намерения: клиент мог передумать уже после созданного заказа.

Испытания должны содержать неудобные паузы

Набор для голосового агента должен проверять не только чистые пары вопрос-ответ. Нужны разговор двух людей рядом, обращение по имени, фоновое телевидение, перебивание самого агента, длинная пауза внутри числа и команда, которая отменяется в последнем слове.

Отдельные сценарии меняют цель после нескольких успешных шагов. Например, клиент выбирает время, подтверждает адрес, затем переносит встречу и меняет получателя. Проверяется не пересказ диалога, а конечная запись в системе и отсутствие действия по отмененной версии.

Метрики тоже разделяются. Считаются лишние ответы, пропущенные обращения, преждевременные начала речи, время до ответа и правильность конечного делового состояния. Средняя естественность голоса не компенсирует заказ, созданный по чужому разговору.

Голосовой агент становится участником беседы не тогда, когда научился быстро отвечать. Сначала он должен научиться не вступать в нее без основания.

Автор / руководитель исследованийДмитрий / R&D Club

Принесите задачу, у которой нет очевидного пути реализации.

hello@rnd.club ↗