<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta>
      <issn pub-type="ppub">1613-0073</issn>
    </journal-meta>
    <article-meta>
      <title-group>
        <article-title>FastText como alternativa a la utilización de Deep Learning en corpus pequeños</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Rosa María Montañés Salas</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Rafael del-Hoyo Alonso</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jorge Vea-Murguía Merck</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Rocío Aznar Gimeno</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Zaragoza</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Spain</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>rmontanes</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>rdelhoyo</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>jveamurguia</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>raznar</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>fjlacueva}@itainnova.es</string-name>
        </contrib>
      </contrib-group>
      <fpage>65</fpage>
      <lpage>69</lpage>
      <abstract>
        <p>The use of deep learning in natural language processing is being a real revolution in this field. Although its quality is beyond doubt, there is a set of alternative techniques, with great validity when the size of the corpus is small, and where the use of deep learning techniques are not adequate enough due to the lack of big data sets or limited computation power availability. Fasttext, developed by Joulin et al. (2017), is an alternative solution to deep learning, with comparable results, based on BoW techniques.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>1.1</p>
    </sec>
    <sec id="sec-2">
      <title>Introducción</title>
      <sec id="sec-2-1">
        <title>Descripción del Problema</title>
        <p>
          La competición TASS
          <xref ref-type="bibr" rid="ref4">(Martínez-Cámara et al,
2015, 2017)</xref>
          cada año se convierte en el lugar
perfecto para la experimentación de nuevas
técnicas, y un foro donde compartir
experiencias sobre nuevas metodologías para el
análisis de algoritmos para la detección de
opinión. En esta edición de 2017 dentro de
nuestro grupo, hemos decidido afrontar una
problemática real que nos ocurre cuando se
genera un nuevo modelo de opinión para un
sector específico. El corpus de entrenamiento es
normalmente de un tamaño reducido, debido a
que es costoso generar un corpus de elevado
tamaño, pero también es necesario obtener
rápidamente resultados. Por una parte, las
técnicas de Deep Learning están barriendo en
modelos de análisis lingüístico, a través de
técnicas como las Convolutional Neural
Networks (CNN)
          <xref ref-type="bibr" rid="ref7">(Poria et al., 2016)</xref>
          , las redes
recurrentes Long short-term memory (LSTM)
          <xref ref-type="bibr" rid="ref2">(Liu et al., 2015)</xref>
          , Word2Vec
          <xref ref-type="bibr" rid="ref7">(Poria et al.,
2016)</xref>
          , la captura de los efectos del árbol
sintáctico en el modelo Recursive Neural
Tensor Network (RNTN),
          <xref ref-type="bibr" rid="ref9">(Socher et al., 2013)</xref>
          o un nuevo modelo como Deepmind
presentado en 2017
          <xref ref-type="bibr" rid="ref8">(Radford et al., 2017)</xref>
          . Éste
último fue probado para esta edición pero los
resultados obtenidos fueron muy pobres. La
mayoría de estos modelos están encontrando
grandes resultados con grandes corpus, lo que
hace que, por otro lado, los modelos de bolsas
de palabras (BoW), el ensamblado de
algoritmos (del Hoyo et al., 2015) y la
extracción de variables específicas tengan
todavía cabida como una de las soluciones
válidas en competiciones como el TASS y para
el desarrollo de proyectos con corpus
específicos y de menor tamaño.
        </p>
        <p>Copyright © 2017 by the paper's authors. Copying permitted for private and academic purposes.
En este artículo se presenta la arquitectura
utilizada, el algoritmo FastText y cómo se ha
combinado con el uso de herramientas propias
para resolver la primera tarea propuesta en el
TASS 2017: “Análisis de Sentimiento a nivel
de tweet”. A continuación se presentan los
resultados obtenidos y finalmente se generan
unas conclusiones generales.</p>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Arquitectura 2</title>
      <p>2.1</p>
      <p>
        Descripción del algoritmo FastText
FastText es una librería desarrollada sobre C++
para el aprendizaje eficiente de
representaciones de palabras y clasificación de
textos. Los experimentos realizados por parte
del grupo de Facebook AI Research
        <xref ref-type="bibr" rid="ref1">(Joulin et
al., 2017)</xref>
        demuestran que el clasificador
FastText ofrece resultados equiparables a los
obtenidos mediante clasificadores de deep
learning en términos de precisión, siendo éste
mucho más rápido sin necesidad de ser
ejecutado sobre GPU.
      </p>
      <p>
        La arquitectura de FastText se basa en el
modelo de bolsas de palabras (BoW) mejorado
a través del uso de clasificadores basados en
redes neuronales multicapa (MLNN), en lugar
de los tradicionales clasificadores lineales cuya
capacidad de generalización suele ser bastante
pobre. El uso de MLNN permite compartir
información entre las variables y las clases a
través de la capa oculta. La arquitectura
implementada se asemeja a la desarrollada por
        <xref ref-type="bibr" rid="ref5">(Mikolov et al., 2013)</xref>
        para la representación de
palabras en un espacio vectorial n-dimensional.
      </p>
      <p>En concreto, el modelo está basado en el
algoritmo CBoW (Continuous BoW), red
neuronal de una capa oculta, e incluye
información de Ngramas (Bag of n-gramas)
consiguiendo así capturar información respecto
al orden de las palabras. Para conseguir una
mayor eficiencia computacional se utiliza una
capa softmax jerárquica en la capa de salida.
Este algoritmo se ha utilizado en el caso de
estudio para entrenar un clasificador para
análisis de sentimiento sobre tweets en
castellano previamente procesados. Los
modelos generados han sido validados con el
conjunto de test proporcionado (corpus de
desarrollo de TASS) obteniendo la precisión y
el recall mediante las funcionalidades expuestas
por la librería. Finalmente, los mejores modelos
han sido evaluados con el corpus de test
provisto por el TASS este año (InterTASS).
2.2 Reducción de la dimensión del
problema
La generación de modelos de lenguaje requiere
de corpus de gran tamaño para el entrenamiento
de algoritmos y obtención de modelos precisos
capaces de capturar las sutilezas del lenguaje
hablado y escrito. En muchos casos, no se
dispone de dicha cantidad de información y es
necesario recurrir a conjuntos de datos más
reducidos y enfocados a campos específicos,
aún en esta situación la información textual de
los documentos puede ser redundante y
contener términos de baja utilidad en cuanto a
lo que al aprendizaje se refiere. Por ello se
plantea el uso de técnicas de procesado de texto
para realizar una limpieza de los datos y
disminuir la dimensionalidad del problema.</p>
      <p>
        Moriarty®
        <xref ref-type="bibr" rid="ref3">(Peña et al., 2016)</xref>
        es la
herramienta de diseño e implementación de
soluciones avanzadas de software de
Inteligencia Artificial, desarrollada por
ITAINNOVA. A través de su interfaz web se
pueden diseñar y poner en marcha flujos de
trabajo para el tratamiento de todo tipo de
datos.
      </p>
      <p>Figura 1: Pipeline generado con la herramienta
Moriarty, para el pre-procesado de textos.</p>
      <p>Mediante esta herramienta se ha
desarrollado un flujo de trabajo de
preprocesado de texto que consta de las siguientes
etapas (figura 1):
sin un coste computacional muy elevado,
gracias a la alta velocidad del algoritmo.




</p>
      <p>Limpieza de texto como por ejemplo URLs,
emails, menciones, etc.</p>
      <p>Conversión a minúsculas.</p>
      <p>Lematización.</p>
      <p>Stopwords.</p>
      <p>
        Sinónimos basados en diccionarios
emocionales.
2.3 Introducción de Sinónimos basados
en emociones
Esta aproximación se basa en la utilización de
varios diccionarios afectivos, Dictionary of
Affect in Language construido por Cynthia M.
        <xref ref-type="bibr" rid="ref11">Whissell et al. (1986)</xref>
        y el Affective Norms for
English Words (ANEW; Bradley et al., 1999)
en el que se incluyen un conjunto de palabras
del castellano con cierta connotación afectiva y
su polaridad asociada de la misma forma que
fue utilizada en Del-Hoyo-Alonso et al.
(2009,2015). En la última etapa del flujo de
trabajo descrito en la sección previa se
introducen los sinónimos de los diccionarios
afectivos en los textos procesados, lo que
además de reducir todavía más la dimensión del
corpus permitirá al algoritmo establecer
relaciones de más alto nivel.
3
      </p>
    </sec>
    <sec id="sec-4">
      <title>Resultados</title>
      <p>El algoritmo FastText acepta diferentes
parámetros de entrada para permitir el ajuste del
modelo:
 minCount: número mínimo de
ocurrencias de una palabra (0-4).
 wordNgrams: máxima longitud de
ngramas (2-4).
 minn: mínimo número de carácteres del
n-grama (2).
 learning rate: factor de aprendizaje
(0.10.001)
 dim: dimensión del vector de palabras
(50-200).
 ws: ventana de contexto (4-5).
 epochs: número de épocas
(100500000).
 loss: función de pérdidas (softmax).</p>
      <p>Para la optimización de las métricas del
modelo, hemos realizado una búsqueda de
parámetros del algoritmo, que ha sido factible</p>
      <p>En la tabla 1 se muestran algunos resultados
obtenidos variando los parámetros del
algoritmo según los valores mostrados en su
definición, de los cuales, se han seleccionado
los tres mejores para la competición.
Principalmente se han desarrollado dos tipos de
experimentos, el primero con un
preprocesamiento de diccionario afectivo y un
segundo únicamente con un lematizado de
palabras.</p>
      <p>Model
FT-lemma
FT-lemma
FT-affective</p>
      <p>Acc Desa.</p>
      <p>M-P</p>
      <p>M-R</p>
      <p>M-F1</p>
      <p>Accu.
0.575
0.565
0.585
Tabla 1: Resultados obtenidos con y sin
diccionarios afectivos sobre conjunto de
desarrollo.</p>
      <p>Como se puede observar, la utilización del
diccionario afectivo hace que tengamos mejores
resultados, aunque el algoritmo también obtiene
resultados bastante satisfactorios sin ellos. Se
han presentado las métricas generales del
modelo, pero cabe destacar que las clases
neutras son las más difíciles de clasificar y por
tanto las que aumentan el error cometido. Por
ejemplo, el tweet con identificador
771115324884262912 del conjunto de
desarrollo, cuyo contenido es: “@juankipua Es
que en el Ojeando el año pasado tampoco, tiene
muchas canciones ya jajajajaja” ha sido
categorizado con sentimiento positivo, siendo
su polaridad correcta NEUTRA. Asimismo, el
tweet con identificador 771118683414560768,
con contenido “Bueno, estoy en la batalla final
del Conquista y ya después me faltaría
Revelación”, también ha sido categorizado con
sentimiento positivo, siendo su polaridad
correcta “NONE”.
3.1</p>
      <sec id="sec-4-1">
        <title>Comparación de resultados</title>
        <p>El resultado final de nuestra implementación en
comparación con los mejores resultados de la
competición se muestra en la tabla 2.
Esperaremos a revisar los diferentes artículos
del resto de grupos participantes con mayor
profundidad para poder establecer
comparaciones y posibles mejoras de nuestra
implementación.</p>
        <p>Group
ELiRF-UPV
RETUYT
ELiRF-UPV
Tabla 2: posición final del algoritmo en la
competición (resultados sobre conjunto de test).
4</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>Conclusiones</title>
      <p>Se ha presentado el algoritmo de FastText como
herramienta para la mejora de la precisión del
análisis de sentimiento u otros problemas de
NLP donde el tamaño disponible del corpus de
entrenamiento es pequeño en comparación al
espacio de hipótesis. Por otra parte, se ha
presentado una alternativa al Deep Learning
con un resultado bastante satisfactorio. Su
velocidad de computación ha hecho posible
realizar la búsqueda de los parámetros del
algoritmo sin disponer de una capacidad de
cálculo muy elevada. A nivel general se deberá
profundizar en cómo mejorar el rendimiento en
las dos etiquetas neutras existentes.</p>
    </sec>
    <sec id="sec-6">
      <title>Bibliografía</title>
      <p>Bradley, M. M., &amp; P. J. Lang. 1999. Affective
norms for English words (ANEW):
Instruction manual and affective ratings (pp.
1-45). Technical Report C-1, The Center for
Research in Psychophysiology, University
of Florida.
del-Hoyo, R., I. Hupont, F. J. Lacueva &amp; D.</p>
      <p>Abadía. November 2009. Hybrid text affect
sensing system for emotional language
analysis. In Proceedings of the international
workshop on affective-aware virtual agents
and social robots (p. 3). ACM.
del-Hoyo-Alonso, R., M. V.
RodrigálvarezChamarro, J. Vea-Murguía, &amp; R.
MontañésSalas. 2015. Ensemble algorithm with
syntactical tree features to improve the
opinion analysis. Comité organizador TASS
2015, 53.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Joulin</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>E.</given-names>
            <surname>Grave</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Bojanowski</surname>
          </string-name>
          &amp;
          <string-name>
            <given-names>T.</given-names>
            <surname>Mikolov</surname>
          </string-name>
          .
          <year>2017</year>
          .
          <article-title>Bag of Tricks for Efficient Text Classification</article-title>
          .
          <source>EACL</source>
          <year>2017</year>
          ,
          <volume>427</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Liu</surname>
          </string-name>
          , P., S. Joty, &amp;
          <string-name>
            <surname>H. M. Men</surname>
          </string-name>
          .
          <year>September 2015</year>
          .
          <article-title>Fine-grained Opinion Mining with Recurrent Neural Networks and Word Embeddings</article-title>
          . In EMNLP (pp.
          <fpage>1433</fpage>
          -
          <lpage>1443</lpage>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Martínez-Cámara</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>M. A.</given-names>
            <surname>García-Cumbreras</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Villena-Román</surname>
          </string-name>
          , &amp; J.
          <string-name>
            <surname>García-Morera</surname>
          </string-name>
          .
          <year>2016</year>
          .
          <article-title>TASS 2015 - The Evolution of the Spanish Opinion Mining Systems</article-title>
          .
          <source>Procesamiento del Lenguaje Natural</source>
          ,
          <volume>56</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Martínez-Cámara</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>M. C.</given-names>
            <surname>Díaz-Galiano</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M. A.</given-names>
            <surname>García-Cumbreras</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>García-Vega</surname>
          </string-name>
          &amp; J.
          <string-name>
            <surname>Villena-Román</surname>
          </string-name>
          .
          <year>2017</year>
          .
          <article-title>Overview of TASS 2017</article-title>
          .
          <source>In Proceedings of TASS 2017: Workshop on Semantic Analysis at SEPLN (TASS</source>
          <year>2017</year>
          ).
          <article-title>CEUR-WS.org</article-title>
          , vol.
          <year>1896</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Mikolov</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Chen</surname>
          </string-name>
          , G. Corrado, &amp;
          <string-name>
            <surname>J. Dean2013</surname>
          </string-name>
          .
          <article-title>Efficient estimation of word representations in vector space</article-title>
          . In International Conference on Learning Representations
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Peña</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Del-Hoyo-Alonso</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Vea-Murgía</surname>
          </string-name>
          ,
          <string-name>
            <given-names>V.M.</given-names>
            <surname>Rodrigálvarez</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Calvo</surname>
          </string-name>
          , &amp; J.
          <string-name>
            <surname>Martín</surname>
          </string-name>
          .
          <year>2016</year>
          . Moriarty: Improving 'time To Market'In
          <source>Big Data And Artificial Intelligence Applications</source>
          .
          <source>International Journal of Design &amp; Nature and Ecodynamics</source>
          ,
          <volume>11</volume>
          (
          <issue>3</issue>
          ),
          <fpage>230</fpage>
          -
          <lpage>238</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Poria</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>E. Cambria,</given-names>
            &amp; A.
            <surname>Gelbukh</surname>
          </string-name>
          .
          <year>2016</year>
          .
          <article-title>Aspect extraction for opinion mining with a deep convolutional neural network</article-title>
          .
          <source>Knowledge-Based Systems</source>
          ,
          <volume>108</volume>
          ,
          <fpage>42</fpage>
          -
          <lpage>49</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Radford</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Jozefowicz</surname>
          </string-name>
          ,
          <string-name>
            <surname>&amp; I. Sutskever.</surname>
          </string-name>
          <year>2017</year>
          .
          <article-title>Learning to generate reviews and discovering sentiment</article-title>
          .
          <source>arXiv preprint arXiv:1704</source>
          .
          <fpage>01444</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Socher</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Perelygin</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. Y.</given-names>
            <surname>Wu</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Chuang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C. D.</given-names>
            <surname>Manning</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A. Y.</given-names>
            <surname>Ng</surname>
          </string-name>
          , &amp;
          <string-name>
            <surname>C. Potts. October</surname>
          </string-name>
          <year>2013</year>
          .
          <article-title>Recursive deep models for semantic compositionality over a sentiment treebank</article-title>
          .
          <source>In Proceedings of the conference on empirical methods in natural language processing. EMNLP</source>
          . Vol.
          <volume>1631</volume>
          , p.
          <fpage>1642</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          2015.
          <article-title>Overview of TASS 2015</article-title>
          .
          <source>In Proceedings of TASS 2015: Workshop on Sentiment Analysis at SEPLN. CEURWS.org</source>
          , vol.
          <volume>1397</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Whissell</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>M. Fournier</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          <string-name>
            <surname>Pelland</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          <string-name>
            <surname>Weir</surname>
            ,
            <given-names>&amp; K.</given-names>
          </string-name>
          <string-name>
            <surname>Makarec</surname>
          </string-name>
          .
          <year>1986</year>
          .
          <article-title>A dictionary of affect in language: IV. Reliability, validity, and applications</article-title>
          .
          <source>Perceptual and Motor Skills</source>
          ,
          <volume>62</volume>
          (
          <issue>3</issue>
          ),
          <fpage>875</fpage>
          -
          <lpage>888</lpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>