- Лингвисты СПбГУ обучили нейросеть синтезировать интонацию речи.
- Исследование направлено на улучшение интонационного оформления речи нейросетевых моделей.
- Работа выполнена в рамках магистерской диссертации студентки Анастасии Шербан.
- Цель исследования - использование готовой модели Tacotron 2 для синтеза речи.
- Ключевым элементом работы является корпус с экспертной интонационной аннотацией.
- Обучение модели на размеченном материале улучшило интонационное оформление синтезированной речи.
- Результаты исследования показывают, что большие данные не всегда обеспечивают тонкое интонационное оформление речи.
- Исследователи рассматривают проделанную работу как пробный шаг и планируют расширить эксперимент.
«Прелесть нашего корпуса заключается в том, что эта интонационная аннотация была сделана экспертами. То есть размечала не сеть, это была не автоматическая разметка, а экспертная разметка — это, в общем-то, попадание в десятку», — отметила Ульяна Евгеньевна Кочеткова.