Investigadores de la Universidad Estatal de San Petersburgo (SPbU) incorporaron un modelo de entonación a una red neuronal, logrando que la pronunciación generada por inteligencia artificial sea más natural y cercana al habla humana, según informó la propia universidad, socia de TV BRICS. El avance podría mejorar los sistemas de conversión de texto a voz utilizados en asistentes virtuales y robots antropomórficos.
El entrenamiento se basó en un sistema de clasificación desarrollado por la profesora Nina Volskaya y el profesor Pável Skrelin, del Departamento de Fonética de la SPbU, que tiene en cuenta el tipo de oración —interrogativa, enunciativa, imperativa, de petición o vocativa— y una amplia variedad de patrones entonativos. “Gracias a una adecuada estructuración de los datos y al uso de etiquetas para las distintas variantes de entonación, el modelo pudo transmitir diferentes matices, lo que permite obtener una voz sintetizada más natural y expresiva”, explicó Uliana Kochetkova, profesora asociada de la universidad.
Para evaluar el desarrollo, los investigadores pidieron a 42 hablantes nativos de ruso que escucharan grabaciones sintetizadas y respondieran preguntas al respecto: en promedio, las consideraron naturales. Los lingüistas remarcaron que, para seguir mejorando la calidad de la voz generada, será necesario incorporar además distintas variantes emocionales y estilísticas.


