<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>GUAITA: Monitorización y análisis de redes sociales para la ayuda a la toma de decisiones</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Ferran Pla</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Lluís-F. Hurtado</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>José-Á. González</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Vicent Ahuir</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Encarna Segarra</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Emilio Sanchis</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>María-José Castro</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Fernardo García</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>VRAIN: Valencian Research Institute for Artificial Intelligence, Universitat Politècnica de València</institution>
          ,
          <addr-line>Camino de Vera s/n, 46022 València</addr-line>
          ,
          <country country="ES">Spain</country>
        </aff>
      </contrib-group>
      <fpage>79</fpage>
      <lpage>82</lpage>
      <abstract>
        <p>El proyecto GUAITA tiene como objetivo extraer grandes cantidades de información proveniente de las redes sociales y proporcionar herramientas de análisis de dicha información que puedan ser útil para la toma de decisiones de las organizaciones. En ese sentido, instituciones y empresas de pueden beneficiar de los avances logrados. Fruto de este proyecto en la actualidad se dispone de un prototipo software que integra diferentes modelos basados en redes neuronales para la monitorización y análisis multilingüe de Twitter. Aunque ya existen en el mercado herramientas de recogida de datos y de análisis, un factor diferencial de GUAITA es el uso modelos de estado del arte en el análisis del lenguaje natural en redes sociales. Esto permite ampliar la funcionalidad básica de análisis de sentimiento, detectando, por ejemplo, el lenguaje inapropiado, el discurso del odio o el nivel de toxicidad presente en los mensajes. Además, GUAITA tiene en consideración idiomas habitualmente no considerados por este tipo de herramientas como es el caso del catalán. English translation. The GUAITA project aims to extract large amounts of information from social media and provide tools for the analysis of this information that may be useful for decision-making in organizations. In this sense, institutions and companies can benefit from the progress achieved. As a result of this project, there is currently a software prototype that integrates diferent models based on neural networks for multilingual monitoring and analysis of Twitter. Although there are already data collection and analysis tools on the market, a diferentiating factor of GUAITA is the use of state-of-the-art models in the analysis of natural language in social networks. This allows the analysis to be extended not only to sentiment analysis but also to go further and be able to detect, among others, inappropriate language, hate speech or the level of toxicity present in the messages. In addition, GUAITA takes into account languages that are not usually considered by this type of tool, such as Catalan.</p>
      </abstract>
      <kwd-group>
        <kwd>eol&gt;Social Media</kwd>
        <kwd>Natural Language Processing</kwd>
        <kwd>Neural Networks</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>1. Introducción
La tecnología actual ha permitido que la
información disponible para la toma de decisiones
sea cada vez más abundante y oportuna; esto, unido
a nuevos desarrollos en ciencia de datos, ha ayudado
a mejorar la velocidad de reacción y la calidad
de dichas decisiones por parte de las empresas
y organizaciones. Uno de los grandes apoyos en
esta nueva toma de decisiones es el desarrollo
de plataformas, servicios y modelos de analítica
avanzada y visualización de datos. Se hace necesario
desarrollar herramientas que presenten una interfaz
amigable para el usuario y que no impliquen un
alto coste de implantación, tanto económico como
temporal.</p>
      <p>Aunque ya existen en el mercado herramientas de
recogida de datos y de análisis, estas herramientas
están todavía en un nivel de desarrollo muy
inicial cuando la fuente de datos son las redes
sociales. El procesamiento automático del lenguaje
natural utilizado en este tipo de redes constituye
un problema abierto dentro de la comunidad
científica, por lo que la transferencia al mercado de
herramientas de las tecnologías del habla logradas
dentro del área de investigación del procesamiento
del lenguaje natural es de gran interés.</p>
      <p>En la actualidad existe una gran cantidad de
compañías que ofrecen herramientas destinadas a
dar soporte a los Community Manager (CM) en catalán entre los idiomas soportados; idioma que
su labor de gestionar la presencia corporativa en no suele estar considerado por otras herramientas
redes sociales. Típicamente permiten la agregación de esta índole.
en una única plataforma o aplicación de múltiples
cuentas de usuario en varias redes sociales.</p>
      <p>Además del soporte a la gestión del CM, 2. Descripcion del sistema
muchas de las herramientas permiten el análisis
de la actividad de usuarios en redes sociales, El sistema GUAITA está concebido como una
fundamentalmente en Twitter. Entre algunas herramienta software que permita el seguimiento
de estas herramientas que permiten monitorizar de acontecimientos, personas o cualquier tema de
la actividad de usuarios podemos destacar las interés para el usuario en la red social Twitter.
siguientes: Twitter Analytics, Followerwonk, Las principales funcionalidades del sistema son
Twitonomy, Rebold, Brandwatch Consumer las siguientes:
Research, Bufer, BuzzSumo, Klear, Union Metrics, • Seguimiento de redes sociales. Permite
Mentionmapp, Foller.me, PressClipping. realizar la monitorización de la red social</p>
      <p>De entre las principales características comunes a Twitter para la obtención y almacenamiento
estas herramientas podemos destacar las siguientes. de la información relacionada con el tema
Todas ellas sueles ser herramientas de pago y de interés. Para ello, nos permite definir
que se basan esencialmente en la web con gran tareas y programarlas en el tiempo. En cada
relevancia del componente gráfico. En algunos tarea se pueden definir capturas (búquedas
casos permiten exportar la información utilizando de Twitter) siguiendo los criterios que se
formatos estándar. consideren oportunos.</p>
      <p>La mayoría de las herramientas están diseñadas • Obtención de modelos específicos de análisis
para la monitorización de la red social Twitter de textos para diferentes lenguas. El sistema
aunque algunas contemplan otras redes sociales. también permite la recolección de textos que</p>
      <p>La información proporcionada por estas sean útiles para aprender modelos específicos
herramientas se basa principalmente en el análisis en una lengua en concreto o dominio. La
de los metadatos proporcionados por las redes. herramienta dispone de modelos para el
Esta información consiste en datos agregados español, inglés y catalán que permiten el
y la distribución temporal de estos: número de procesado y etiquetado de corpus en estas
seguidores, repercusión de un post a lo largo del lenguas.
tiempo (número de me gusta, número de retweets, • Visualización de resultados. El sistema
número de replicas). En algunos casos se incluye presenta gráficamente los resultados de los
la información geográfica de los tweets, basada en análisis desarrollados mediante una serie
la geolocalización de los usuarios o en su perfil. de interfaces web. También dispone de
En general, no se realiza un análisis profundo del un generador de informes, que de forma
contenido textual. automática, elabora un dossier de toda</p>
      <p>En este trabajo se presenta una demostración la información relacionada con una tarea
de los principales logros obtenidos en el proyecto definida por el usuario. Dichos informes
GUAITA: Monitorización y análisis de redes sociales pueden ser de gran utilidad para su análisis
para la ayuda a la toma de decisiones subvencionado con el fin de determinar la reputación de una
por la Agencia Valenciana de la Innovació (AVI) institución o compañía.
de la Generalitat Valenciana. Se describe el • API REST. Permite la comunicación de
sistema desarrollado incluyendo su arquitectura y nuestra aplicación con aplicaciones de
principales funcionalidades. terceros.</p>
      <p>El sistema integra diferentes modelos basados en
redes neuronales para la monitorización y análisis
multilingüe de la red social Twitter. Un factor 3. Arquitectura del sistema
diferencial de GUAITA es el uso modelos de estado
del arte en el análisis del lenguaje natural en redes En la Figura 1 se muestra la arquitectura general de
sociales. Esto permite ampliar el análisis no solo al la aplicación y las interconexiones entre los distintos
análisis de sentimientos sino ir más allá y ser capaz módulos que la componen. Como se puede observar,
de detectar, entre otros, el lenguaje inapropiado, el el sistema GUAITA está compuesto por cuatro
discurso del odio o el nivel de toxicidad presente módulos principales que se describirán de forma
en los mensajes. Asimismo, GUAITA incluye el sucinta en esta sección.</p>
    </sec>
    <sec id="sec-2">
      <title>3.2. Planificador</title>
      <p>Este módulo se encarga de enviar capturas
periódicas o futuras al Backend. En el contexto
de la monitorización de redes sociales es habitual
querer planificar tareas con antelación, por ejemplo
para seguir el impacto de una nueva campaña
publicitaria. También es habitual querer hacer
consultas recurrentes en el tiempo, por ejemplo,
para seguir un programa de televisión que se emite
siempre a la misma hora un día determinado de la
semana.</p>
    </sec>
    <sec id="sec-3">
      <title>3.3. Motor de Clasificación</title>
      <sec id="sec-3-1">
        <title>GUAITA permite obtener información del contenido</title>
        <p>textual de los tweets descargados mediante el uso de
modelos de clasificación basados en redes neuronales.
Todos estos modelos están aprendidos utilizando
arquitecturas neuronales del estado del arte y corpus
de múltiples competiciones internacionales. En
la Sección 4 se describen los modelos y corpus
utilizados.</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>3.4. Frontend</title>
      <sec id="sec-4-1">
        <title>El sistema GUAITA esta dotado de una interfaz</title>
        <p>de programación de aplicaciones (API REST) que
3.1. Backend le permite ser utilizado e integrado en software de
terceros. Sin embargo, también existe una versión
El Backend es el núcleo del sistema GUAITA. web que facilita el uso de la herramienta a usuarios
Este módulo es el responsable de gestionar humanos. El Frontend es el encargado de gestionar
el comportamiento de toda la aplicación. los formularios y demás páginas de la aplicación web
Fundamentalmente realiza la descarga de contenido y realizar las peticiones al Backend utilizando la API.
de redes sociales y las peticiones al motor de En la Figura 2 se muestra parte de la salida gráfica
clasificación y perfilado de usuario, genera las proporcionada por la aplicación para la consulta:
estadísticas y datos necesarios para la presentación #SagitarioA OR #SagittariusA OR #BlackHole.
gráfica de la información; información que será
accesible mediante la API REST del módulo.</p>
        <p>El Backend consta de una capa de persistencia
dividida en dos. Por un lado se utiliza una
instancia distribuida de una base de datos orientada
a documentos MongoDB donde se guarda toda
la información referente al análisis de cada
captura. Por otro lado, se utiliza MariaDB
para la persistencia relacionada con los procesos
de captura. Esta capa es la responsable del
almacenamiento en memoria secundaria de toda la
información necesaria para el funcionamiento global
de la aplicacióndesde el contenido descargado de
Twitter o la información generada por el motor de Figure 2: Salida del sistema, detección de emociones.
clasificación.
[2] J. Cañete, G. Chaperon, R. Fuentes, J.-H. Ho,</p>
        <p>
          H. Kang, J. Pérez, Spanish pre-trained bert
Para el motor de clasificación se han utilizado model and evaluation data, in: PML4DC at
tres encoders : TWILBERT[
          <xref ref-type="bibr" rid="ref1">1</xref>
          ], BETO[2] y XLM- ICLR 2020, 2020.
        </p>
        <p>T[3]. Se han utilizado corpus de múltiples [3] F. Barbieri, L. E. Anke, J. Camacho-Collados,
competiciones para aprender diversos modelos de Xlm-t: A multilingual language model toolkit
clasificación. GUAITA utiliza cada uno de los tres for twitter, 2021. URL: https://arxiv.org/abs/
encoders dependiendo de la tarea y en función del 2104.12250. doi:10.48550/ARXIV.2104.12250.
rendimiento. Los corpus utilizados han sido los que [4] e. a. Manuel Carlos Díaz-Galiano, Overview
se enumeran a continuación. TASS 2019[4] para of TASS 2019: One More Further for the
los modelos de polaridad, Irosva 2019[5] para los Global Spanish Sentiment Analysis Corpus,
modelos de detección de ironía, EmoEvalEs 2021[6] in: Proceedings of the Iberian Languages
para la detección de emociones y lenguaje ofensivo, Evaluation, IberLEF@SEPLN 2019, Bilbao,
HateEval 2019[7] para los modelos de detección Spain, volume 2421 of CEUR Workshop
de lenguaje del odio y agresividad, HaHa 2019[8] Proceedings, 2019, pp. 550–560.
para la detección de humor presente en los tweets [5] R. O. Bueno, F. M. R. Pardo, D. I. H. Farías,
y Detoxis 2021[9] para varios modelos: lenguaje P. Rosso, M. M. y Gómez, J. E. Medina-Pagola,
impropio, sarcasmo, toxicidad, etc. Overview of the task on irony detection in
spanish variants, in: IberLEF@SEPLN, 2019.
5. Conclusiones y trabajos futuros [6] F. M. Plaza-del Arco, S. M. Jiménez Zafra,
A. Montejo Ráez, M. D. Molina González, L. A.</p>
        <p>En este trabajo se ha presentado el sistema Ureña López, M. T. Martín Valdivia, Overview
desarrollado en el proyecto GUAITA: of the emoevales task on emotion detection for
Monitorización y análisis de redes sociales para spanish at iberlef 2021, 2021.
la ayuda a la toma de decisiones. Se ha descrito [7] V. Basile, C. Bosco, E. Fersini, D. Nozza,
su arquitectura y principales funcionalidades V. Patti, F. M. Rangel Pardo, P. Rosso,
actuales. No obstante GUAITA es una herramienta M. Sanguinetti, SemEval-2019 task 5:
en constante crecimiento y mejora. Entre las Multilingual detection of hate speech against
ampliaciones que se pretenden incorporar podemos immigrants and women in Twitter, in:
destacar la detección de aspectos y las alertas Proceedings of the 13th International Workshop
automáticas ante mensajes que fomenten el odio on Semantic Evaluation, 2019, pp. 54–63.
durante el seguimiento de algún evento. [8] L. Chiruzzo, S. Castro, A. Rosá, HAHA 2019
dataset: A corpus for humor analysis in Spanish,
in: Proceedings of the 12th Language Resources
Acknowledgments and Evaluation Conference, 2020, pp. 5106–
5112.</p>
        <p>Este trabajo ha sido parcialmente subvencionado [9] M. Taulé Delor, A. Ariza, M. Nofre,
por la Agencia Valenciana de la Innovació E. Amigó Cabrera, P. Rosso, Overview of
(AVI) de la Generalitat Valenciana, proyecto detoxis at iberlef 2021: Detection of toxicity
GUAITA (INNVA1/2020/61), el Vicerrectorado in comments in spanish, 2021-09.
de Investigación de la Universitat Politècnica de
València (PAID-11-21) y por el Ministerio de Ciencia
e Innovación y fondos de la Unión Europea con el
proyecto BEWORD PID2021-126061OB-C41.</p>
      </sec>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <given-names>J.-Á.</given-names>
            <surname>González</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.-F.</given-names>
            <surname>Hurtado</surname>
          </string-name>
          ,
          <string-name>
            <given-names>F.</given-names>
            <surname>Pla</surname>
          </string-name>
          , Twilbert:
          <article-title>Pre-trained deep bidirectional transformers for spanish twitter</article-title>
          ,
          <source>Neurocomputing</source>
          <volume>426</volume>
          (
          <year>2021</year>
          )
          <fpage>58</fpage>
          -
          <lpage>69</lpage>
          . URL: https://www.sciencedirect. com/science/article/pii/S0925231220316180. doi:https://doi.org/10.1016/j.neucom.
          <year>2020</year>
          .
          <volume>09</volume>
          .078.
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>