<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>GAMES: Generacion automatica de metadato y contenido para medios y archivos en euskera</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Aitor Alvarez</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Ander Gonzalez-Docasal</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Aitor Garc a Pablos</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Elena Zotova</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Montse Cuadros</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Haritz Arzelus</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Alaitz Artolazabal</string-name>
          <xref ref-type="aff" rid="aff2">2</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Joxe Rojas</string-name>
          <email>jrojasg@tokikom.eus</email>
          <xref ref-type="aff" rid="aff2">2</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Josu Azpillaga</string-name>
          <email>jazpillaga@codesyntax.com</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Iban Arantzabal</string-name>
          <email>iarantzabal@goiena.eus</email>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Vicomtech Foundation</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Basque Research</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Technology Alliance (BRTA)</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Mikeletegi</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Donostia-San Sebastian (Espan~a)</string-name>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Codesyntax</institution>
          ,
          <addr-line>Azitaingo Industrialdea 3, 20600 Eibar, Espan~a</addr-line>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Goiena</institution>
          ,
          <addr-line>Otalora Lizentziaduna 31, 20500 Arrasate-Mondragon, Espan~a</addr-line>
        </aff>
        <aff id="aff2">
          <label>2</label>
          <institution>Tokikom</institution>
          ,
          <addr-line>Bilbao Lanekintza 10, 48004 Bilbao, Espan~a</addr-line>
        </aff>
        <aff id="aff3">
          <label>3</label>
          <institution>Universidad de Zaragoza</institution>
          ,
          <addr-line>Pedro Cerbuna 12, 50009 Zaragoza, Espan~a</addr-line>
        </aff>
      </contrib-group>
      <fpage>19</fpage>
      <lpage>22</lpage>
      <abstract>
        <p>The increasing volume of multimedia content is pushing the media to seek for e ective solutions for the automatic generation of metadata to facilitate the tagging, indexing and retrieval of contents. In this context, GAMES is presented as a platform focused to metadata and content generation in Basque. In addition to the main architecture, the technological modules and their evaluation are presented.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>Estado del arte y motivacion</title>
      <p>
        El crecimiento imparable de contenido
multimedia junto con los reciente avances en
tecnolog as IA estan impulsando a los archivos
y medios de comunicacion a la incorporacion
de soluciones que permitan una identi cacion
y descripcion e cientes de sus contenidos a
traves de metadatos. Sin embargo, el
euskera no esta habitualmente soportado en estas
soluciones y, de estar incluido, no alcanza la
calidad esperada sobre contenidos media.
Como solucion mas cercana cabe destacar
GEPSA
        <xref ref-type="bibr" rid="ref8">(San Vicente, Saralegi, y Zubia, 2021)</xref>
        ,
      </p>
      <sec id="sec-1-1">
        <title>5https://www.codesyntax.com/ 6https://vicomtech.org/</title>
        <p>Copyright © 2021 for this paper by its authors. Use permitted under Creative Commons License Attribution 4.0 International (CC BY 4.0).
una plataforma de seguimiento de medios
escritos en euskera y castellano que incorpora
tecnolog a IA de deteccion y clasi cacion de
entidades nombradas (NERC), extraccion de
palabras clave, clasi cacion de tematica y
retos de la sociedad.</p>
        <p>Con el animo de cubrir este hueco en el
mercado, nacio el proyecto GAMES, una
solucion para la generacion automatica de
metadatos sobre contenidos multimedia (video,
audio y texto) en euskera compuesta por 6
modulos tecnologicos IA.
3</p>
      </sec>
    </sec>
    <sec id="sec-2">
      <title>Arquitectura general</title>
      <p>La plataforma GAMES se ha disen~ado y
desarrollado para ser un servicio back-end
facilmente integrable en cualquier solucion de
terceros, permitiendo ofrecer un servicio de
metadatado en euskera no intrusivo en estas
soluciones. Esta fundamentada en arquitectura
REST7 y esta compuesta por una capa de
servicio basada en la solucion Trae k8, que
ofrece un proxy inverso y balanceador de
peticiones. Este componente se comunica con
las APIs de cada modulo tecnologico
mediante servicios web basados en protocolo HTTP.
Estos servicios permiten recuperar el estado
de cada proceso, obtener un resultado o
lanzar a procesar una tarea en cualquier modulo
IA. Los resultados son devueltos en objetos
JSON (JavaScript Object Notation),
disponiendo cada modulo tecnologico de su
formato espec co de resultado. Estos modulos IA
son facilmente combinables para la
generacion de pipelines tecnologicos y esta
orquestacion se realiza desde el cliente. En la Figura
1 se muestra la arquitectura de la solucion.
4</p>
    </sec>
    <sec id="sec-3">
      <title>Principales modulos IA</title>
      <p>Todos los modulos integrados en GAMES estan
basados en tecnicas de Deep Learning y estan
entrenados para procesar contenidos
multimedia (video, audio y texto) en euskera,
una lengua aglutinante con unas propiedades
lingu sticas singulares, una rica morfolog a y
un orden de palabras relativamente libre.
4.1</p>
      <sec id="sec-3-1">
        <title>Transcripcion habla-texto</title>
        <p>Este modulo permite convertir a texto los
contenidos de video y audio en euskera a
traves de tecnolog a neuronal de
transcripcion del habla. El motor de reconocimiento de</p>
        <sec id="sec-3-1-1">
          <title>7https://restfulapi.net/ 8https://traefik.io/</title>
          <p>
            Figura 1: Arquitectura de GAMES.
habla, construido sobre la herramienta
Kaldi
            <xref ref-type="bibr" rid="ref6">(Povey et al., 2011)</xref>
            , esta compuesto por un
modelo acustico h brido DNN-HMM basado
en redes neuronales retardadas factorizadas
con guradas como se describe en
            <xref ref-type="bibr" rid="ref4">(Alvarez et
al., 2021)</xref>
            para los sistemas en castellano. El
modelo acustico esta entrenado con 645
horas compuestas por 482 horas del corpus de
mintzai-ST
            <xref ref-type="bibr" rid="ref5">(Etchegoyhen et al., 2021)</xref>
            del
dominio del Parlamento Vasco y 163 horas de
contenidos televisivos transcritos a traves de
la plataforma Idazle9, una solucion de
Vicomtech para la subtitulacion automatica
integrada en los ujos de trabajo de la
television publica vasca EiTB. El modelo de
lenguaje corresponde a un 3-grama entrenado
con 27,7M de palabras compuestas
principalmente por las transcripciones y noticias web
extra das de diarios digitales.
          </p>
          <p>
            La salida cruda del reconocedor es
enriquecida con capitalizacion y signos de
puntuacion con un modelo Transformer
entrenado a partir del modelo BERTeus
            <xref ref-type="bibr" rid="ref2">(Agerri et
al., 2020)</xref>
            . Con las marcas de tiempo y
puntuaciones de con anza obtenidas por palabra,
este modulo permite generar cheros para
indexacion y busqueda (XML, JSON),
transcripcion (TXT) o subtitulacion (SRT, VTT).
4.2
          </p>
        </sec>
      </sec>
      <sec id="sec-3-2">
        <title>S ntesis texto-habla</title>
        <p>
          Este modulo convierte en habla cualquier
texto de entrada en euskera. En GAMES se
entreno un modelo de s ntesis neuronal
basado en la arquitectura Tacotron-2
          <xref ref-type="bibr" rid="ref10">(Wang et
al., 2017)</xref>
          para convertir el texto de
entrada en espectrogramas. Estos espectrogramas
son posteriormente transformados en onda
acustica a traves del vocoder de Nvidia
basado en el modelo neuronal generativo
Waveglow
          <xref ref-type="bibr" rid="ref7">(Prenger, Valle, y Catanzaro, 2019)</xref>
          .
El modelo Tacotron-2 fue entrenado con un
corpus de 20;37 horas de diferentes
locutores en euskera, posteriormente ajustado (
netuning ) con las 3;44 horas de una sola
locutora, utilizando como base un primer modelo
entrenado con 21;25 horas en castellano. La
s ntesis del habla tiene dos aplicaciones
principales en GAMES: la generacion automatica de
podcasts y video-noticias en euskera.
4.3
        </p>
      </sec>
      <sec id="sec-3-3">
        <title>NERC</title>
        <p>
          Este modulo realiza la deteccion y clasi
cacion de entidades nombradas sobre un texto
de entrada en euskera. Para ello se entreno
un modelo de etiquetado secuencial basado
en BERTeus
          <xref ref-type="bibr" rid="ref2">(Agerri et al., 2020)</xref>
          usando el
conjunto de datos de Egunkaria y las
particiones estandar de train y test presentado
en
          <xref ref-type="bibr" rid="ref3">(Alegria et al., 2004)</xref>
          . Este corpus
distingue las categor as de locativo (LOC),
organizacion (ORG), persona (PER) y otros (OTH). Los
resultados de micro-Precision (miP), Recall
(miR) y F1-score (miF) obtenidos en el
subconjunto de test se presentan en la Tabla 1.
Tabla 1: Etiquetas anotadas y resultados en
train y test del modulo NERC.
        </p>
        <p>Categ. Train Test miP miR miF1
LOC 1968 440 0.887 0.844 0.865
ORG 1937 394 0.816 0.816 0.816
PER 1497 382 0.903 0.949 0.925
OTH 294 53 0.367 0.367 0.367</p>
        <p>Como puede observarse en la Tabla 1, los
mejores resultados alcanzan un micro-F1 de
0.925 para la categor a PER, mientras que la
categor a OTH obtiene una mayor confusion,
probablemente, por su baja representacion en
las particiones y por ser una categor a
anotada con menor precision.
4.4</p>
      </sec>
      <sec id="sec-3-4">
        <title>Clasi cacion de noticias</title>
        <p>
          Este componente permite clasi car en
categor as del ambito period stico las noticias en
euskara. El modulo IA esta igualmente
basado en un modelo Transformer, usando
BERTeus
          <xref ref-type="bibr" rid="ref2">(Agerri et al., 2020)</xref>
          como base (Devlin
et al., 2018).
        </p>
        <p>El entrenamiento y evaluacion del
sistema se realizo sobre un corpus compilado en
el dominio de las noticias provistas por los</p>
        <p>Tabla 2: Instancias anotadas de train y test, y
resultados por categor a.</p>
        <p>Categor a Train Test miP miR miF1
Sociedad 2694 630 0.776 0.805 0.790
Deportes 1604 412 0.956 0.959 0.957
Cultura 1134 262 0.770 0.793 0.781
Pol tica 514 134 0.843 0.767 0.803
Opinion 456 124 0.868 0.918 0.892
Euskara 274 64 0.729 0.797 0.761
Econom a 203 48 0.706 0.393 0.505
Educacion 202 15 0.706 0.500 0.585
Entorno 107 15 0.429 0.400 0.414
medios del consorcio con la distribucion
presentada en la Tabla 2, en la que ademas se
muestran los resultados de micro-Precision,
Recall y F1-score por categor a. Destaca la
categor a de deportes, mientras se observa
mayor confusion entre categor as
semanticamente proximas (e.g. sociedad y cultura). Las
puntuaciones mas bajas las reciben las
categor as menos representadas en los datos de
entrenamiento.
4.5</p>
      </sec>
      <sec id="sec-3-5">
        <title>Resumen abstractivo de textos</title>
        <p>
          Este modulo permite sintetizar de manera
abreviada un texto de entrada; una l nea
tecnologica incipiente y que para el euskera
supone un reto mayor por la falta de datos
de entrenamiento o de recursos lingu sticos
espec cos. En GAMES se ha experimentado
con un modelo Encoder-Decoder
inicializado con tres modelos pre-entrenados:
IXAmBERT
          <xref ref-type="bibr" rid="ref2">(Agerri et al., 2020)</xref>
          , RoBasquERTa
          <xref ref-type="bibr" rid="ref9">(Suarez, Romary, y Sagot, 2020)</xref>
          y el
modelo multilingue mT5-small
          <xref ref-type="bibr" rid="ref11">(Xue et al., 2020)</xref>
          .
Los modelos se entrenaron con un corpus de
noticias en euskera de los medios del
consorcio que consta de 73.773 documentos,
seleccionando 2; 000 para validacion y otros 2; 000
para la evaluacion nal. Dada la inexistencia
de un resumen literal, se asumio como
resumen el titular y la entradilla de cada noticia.
        </p>
        <p>Los modelos han sido evaluados con la
metrica ROUGE, donde ROUGE-N mide la
superposicion de n-gramas entre la referencia
y la hipotesis, y ROUGE-L evalua las
subsecuencias comunes mas largas. Como se
observa en la Tabla 3 el modelo basado en
IXAmBERT muestra el mejor resultado,
probablemente por una representacion mas amplia del
euskera en el modelo preentrenado.
4.6</p>
      </sec>
      <sec id="sec-3-6">
        <title>Generacion de v deo-noticias</title>
        <p>Este componente es un ejemplo de pipeline
tecnologico en el que se integran diferentes
modulos de la solucion, y su funcion es la
generacion automatica de video-noticias
partiendo del t tulo, noticia y una foto
relacionada. La voz es generada con la s ntesis de
habla, la noticia puede ser sumarizada para
generacion de videos cortos y, ademas, se
incluyen subt tulos sincronizados con el audio
para sumar accesibilidad.
5</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Conclusiones</title>
      <p>En este trabajo se ha presentado el proyecto
GAMES, una plataforma back-end para la
generacion automatica de metadatos y
contenido audiovisual en euskara. Esta solucion esta
integrada en los ujos de trabajo de las
empresas del consorcio y tendra continuidad en
un nuevo proyecto en el que se incorporaran
nuevos modulos tecnologicos como la
traduccion automatica basada en el activo Itzuli10,
biometr a vocal y analisis de imagen.</p>
    </sec>
    <sec id="sec-5">
      <title>Agradecimientos</title>
      <p>Este trabajo conto con el apoyo del
Departamento de Desarrollo Economico,
Sostenibilidad y Medio Ambiente del Gobierno
Vasco en el marco del proyecto GAMES
(ZL2020/00074).</p>
    </sec>
    <sec id="sec-6">
      <title>Bibliograf a</title>
      <p>albayz n-rtve 2020 speech to text
transcription challenge. En Proceedings of
IberSPEECH2020.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          Tabla 3: Resultados de los modelos de resumen automatico sobre la particion de test.
          <source>Model Rouge-1 Rouge-2 Rouge-L IXAmBERT 27.33 11.92 22.64 RoBasquERTa 22.12 8.76 17.69 mT5-small 19.69 7.49 15.66</source>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Agerri</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>I. S.</given-names>
            <surname>Vicente</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. A.</given-names>
            <surname>Campos</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Barrena</surname>
          </string-name>
          ,
          <string-name>
            <given-names>X.</given-names>
            <surname>Saralegi</surname>
          </string-name>
          ,
          <string-name>
            <surname>A</surname>
          </string-name>
          . Soroa,
          <string-name>
            <given-names>y E.</given-names>
            <surname>Agirre</surname>
          </string-name>
          .
          <year>2020</year>
          .
          <article-title>Give your text representation models some love: the case for basque</article-title>
          . arXiv preprint arXiv:
          <year>2004</year>
          .00033.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Alegria</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>O.</given-names>
            <surname>Arregi</surname>
          </string-name>
          , I. Balza,
          <string-name>
            <given-names>N.</given-names>
            <surname>Ezeiza</surname>
          </string-name>
          , I. Fernandez, y
          <string-name>
            <given-names>R.</given-names>
            <surname>Urizar</surname>
          </string-name>
          .
          <year>2004</year>
          .
          <article-title>Design and development of a named entity recognizer for an agglutinative language</article-title>
          .
          <source>En First International Joint Conference on NLP (IJCNLP-04). Workshop on Named Entity Recognition.</source>
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Alvarez</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Arzelus</surname>
          </string-name>
          ,
          <string-name>
            <given-names>I. G</given-names>
            . Torre, y A.
            <surname>Gonzalez-Docasal</surname>
          </string-name>
          .
          <year>2021</year>
          .
          <article-title>The vicomtech speech transcription systems for the Devlin</article-title>
          , J.,
          <string-name>
            <given-names>M.-W.</given-names>
            <surname>Chang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lee</surname>
          </string-name>
          , y
          <string-name>
            <given-names>K.</given-names>
            <surname>Toutanova</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Bert: Pre-training of deep bidirectional transformers for language understanding</article-title>
          . arXiv preprint arXiv:
          <year>1810</year>
          .04805.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Etchegoyhen</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Arzelus</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H. Gete</given-names>
            <surname>Ugarte</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Alvarez</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Gonzalez-Docasal</surname>
          </string-name>
          ,
          <string-name>
            <given-names>y E. Benites</given-names>
            <surname>Fernandez</surname>
          </string-name>
          .
          <year>2021</year>
          .
          <article-title>mintzai-st: Corpus and baselines for basque-spanish speech translation</article-title>
          .
          <source>En Proceedings of IberSPEECH2020.</source>
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Povey</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Ghoshal</surname>
          </string-name>
          ,
          <string-name>
            <given-names>G.</given-names>
            <surname>Boulianne</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Burget</surname>
          </string-name>
          ,
          <string-name>
            <given-names>O.</given-names>
            <surname>Glembek</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Goel</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Hannemann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Motlicek</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Qian</surname>
          </string-name>
          , P. Schwarz, y others.
          <year>2011</year>
          .
          <article-title>The kaldi speech recognition toolkit</article-title>
          .
          <source>En</source>
          IEEE 2011 workshop
          <article-title>on automatic speech recognition and understanding, numero CONF</article-title>
          .
          <source>IEEE Signal Processing Society.</source>
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Prenger</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          , R. Valle, y
          <string-name>
            <given-names>B.</given-names>
            <surname>Catanzaro</surname>
          </string-name>
          .
          <year>2019</year>
          .
          <article-title>Waveglow: A ow-based generative network for speech synthesis</article-title>
          .
          <source>En ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)</source>
          , paginas
          <volume>3617</volume>
          {
          <fpage>3621</fpage>
          . IEEE.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <given-names>San</given-names>
            <surname>Vicente</surname>
          </string-name>
          , I., X. Saralegi,
          <string-name>
            <given-names>y N.</given-names>
            <surname>Zubia</surname>
          </string-name>
          .
          <year>2021</year>
          .
          <article-title>GEPSA, a tool for monitoring social challenges in digital press</article-title>
          .
          <source>En Proceedings of the First Workshop on Language Technology for Equality, Diversity and Inclusion</source>
          , paginas
          <volume>46</volume>
          {
          <fpage>50</fpage>
          ,
          <string-name>
            <surname>Kyiv</surname>
          </string-name>
          , Abril. Association for Computational Linguistics.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Suarez</surname>
            ,
            <given-names>P. O.</given-names>
          </string-name>
          , L. Romary, y
          <string-name>
            <given-names>B.</given-names>
            <surname>Sagot</surname>
          </string-name>
          .
          <year>2020</year>
          .
          <article-title>A monolingual approach to contextualized word embeddings for mid-resource languages</article-title>
          . arXiv preprint arXiv:
          <year>2006</year>
          .06202.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Skerry-Ryan</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Stanton</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Wu</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R. J.</given-names>
            <surname>Weiss</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Jaitly</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Z.</given-names>
            <surname>Yang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Xiao</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Z.</given-names>
            <surname>Chen</surname>
          </string-name>
          , S. Bengio, y others.
          <year>2017</year>
          .
          <article-title>Tacotron: Towards end-to-end speech synthesis</article-title>
          .
          <source>arXiv preprint arXiv:1703</source>
          .
          <fpage>10135</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Xue</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Constant</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Roberts</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Kale</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Al-Rfou</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Siddhant</surname>
          </string-name>
          ,
          <string-name>
            <surname>A</surname>
          </string-name>
          . Barua, y C.
          <article-title>Ra el</article-title>
          .
          <year>2020</year>
          .
          <article-title>mT5: A massively multilingual pre-trained text-to-text transformer</article-title>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>