Голос роботу мы не изобретаем: синтез речи покупается у стороннего поставщика, как ткань в ателье. Костюм при этом шьёт ателье. Разница между «включили синтез» и «робота слушают, не перебивая» — это дни работы с живыми записями разговоров.
Настройка речи под ваш канал связи и вашу отрасль — подбор голоса, интонация под сценарий, обработка под телефонную линию, правила произношения ваших адресов, цен и терминов. Входит в настройку робота, отдельной строки в счёте нет.
Одни и те же фразы нашего робота, синтезированные с разными настройками. Слева — как звучит без настройки, справа — как в работе. Записи чужих разговоров мы не публикуем: там голоса и данные клиентов.
Потому что настраивается не по документации, а по записям настоящих звонков. Пока не послушаешь, как робот разговаривает с вашими клиентами, не видно ни одной из этих мелочей.
Пример из нашей практики: приветствие робота длилось двенадцать секунд. Люди не дослушивали и клали трубку — это было видно только по длительности звонков в отчётах. Сократили до четырёх, и разговор стал начинаться, а не обрываться.
Люди кладут трубку, услышав синтез в первой же фразе. Поэтому начало разговора можно записать голосом настоящего сотрудника — и человек первые секунды говорит с человеком.
Так это работает у нашего заказчика в посуточной аренде. Живой голос здоровается, спрашивает даты и число гостей, а потом честно передаёт разговор:
Дальше говорит робот — и его слушают спокойно, потому что живой человек только что сказал, что с системой можно разговаривать обычным языком. Никакого обмана: о передаче сообщают вслух.
Это выглядит как мелочи, но именно из них складывается ощущение «с ним нормально разговаривать». Каждое число ниже — из разбора настоящих звонков.
У робота есть должностная инструкция, и он соблюдает её неукоснительно — в отличие от человека, который может забыть, устать или решить по-своему.
Эту инструкцию пишем мы — по вашему заданию. Что робот обязан спросить, что имеет право пообещать, чего не говорит никогда, когда зовёт человека, как ведёт себя с недовольным клиентом, что делает, если чего-то не знает.
Дальше — как с новым работником: первые недели слушаем записи и правим. Не «настроили и ушли». На реальных звонках вылезает то, чего не придумаешь заранее: люди говорят не теми словами, перебивают на середине, спрашивают о том, чего нет в сценарии.
Уникального голоса из ничего. Голоса синтеза — общие, их слышно и у других компаний. Мы подбираем наиболее подходящий и настраиваем, но не создаём новый.
Если нужен именно узнаваемый голос — ваш собственный, это отдельная строка сметы: запись диктора (или вашего сотрудника), клонирование голоса и наша настройка поверх. Так делают, когда голос — часть бренда: сеть салонов, клиника с известным врачом, компания с рекламой на радио.
Синтез тарифицируется по количеству произнесённых знаков. Робот, который отвечает абзацами, стоит вам дороже робота, который отвечает по делу.
И то же самое требуется для качества разговора: длинные монологи заставляют людей класть трубку.
Позвоните нашему роботу или поговорите с ним на сайте. Всё описанное здесь на нём и настроено — паузы, темп, длина реплик, ударения.