<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Sistema de extraccio´n de caracter´ısticas lingu¨´ısticas en espan˜ol para tareas de Procesamiento del Lengua je Natural</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Jos´e Antonio Garc´ıa-D´ıaz</string-name>
          <email>joseantonio.garcia8@um.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Universidad de Murcia. Facultad de Informa ́tica. Departamento de Inform ́atica y Sistemas</institution>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2019</year>
      </pub-date>
      <fpage>32</fpage>
      <lpage>37</lpage>
      <abstract>
        <p>Spanish is one of the most popular languages on the Internet with approximately 344 million users; this fact, in conjunction with the rising of the Web 2.0. and the leading role of the users in the creation of content, has leaded Natural Language Processing (NLP) to become one of the outstanding technologies, with applications in machine translation, conversational systems or spam filters. However, some of the available resources are still at an early stage compared to other languages. In addition, some of the tools available are translations of their equivalent in English, so they may lose characteristics of Spanish. Therefore, the objective of this doctoral thesis is the development of a system of extraction of linguistic characteristics of texts in Spanish, which has applications in different fields of the NLP, such as opinion mining, plagiarism detection, or readability analysis.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Cada d´ıa se generan grandes volu´menes de
contenido en Internet. Dentro de la variedad
dial´ectica que se existe en la red, el espan˜ol
tiene una posici´on relevante, siendo
actualmente el tercer idioma m´as utilizado en
Internet, s´olo por detr´as del ingl´es y del chino
1. Sin embargo, la mayor´ıa de recursos
dispo1https://www.internetworldstats.com/stats7.htm
nibles para poder procesar esa informaci´on
de manera eficiente est´an disen˜ados para el
ingl´es. Por este motivo, la comunidad
cient´ıfica est´a haciendo verdaderos esfuerzos
para crear herramientas de Procesamiento del
Lenguaje Natural, o PLN, para el lenguaje
espan˜ol.</p>
      <p>
        Para que un ordenador sea capaz de
manejar textos escritos en lenguaje natural hay
que codificarlo de manera adecuada. Una
estrategia consiste en representar un texto
mediante un vector formado por el
porcentaje de palabras psico-linguisticamente
relevantes, con el objetivo de clasificar palabras que
indiquen qu´e dice el texto, y c´omo lo dice.
Estos vectores han probado ser efectivos a la
hora de clasificar documentos. Por citar algunos
ejemplos, se ha aplicado a estudios de autor´ıa
        <xref ref-type="bibr" rid="ref7">(Gaston et al., 2018)</xref>
        o la predicci´on de
resultados electorales
        <xref ref-type="bibr" rid="ref16">(Tumasjan et al., 2010)</xref>
        .
      </p>
      <p>Aunque existen herramientas de
extracci´on de caracter´ısticas lingu¨´ısticas en espan˜ol,
estas no recogen todas las caracter´ısticas
relevantes del espan˜ol debido, principalmente,
a que son traducciones o adaptaciones de la
versi´on en ingl´es. Con el ´animo de suplir esta
carencia, se pretende el disen˜o y la
implantaci´on un sistema de extracci´on de
caracter´ısticas lingu¨´ısticas espec´ıfico para el idioma
espan˜ol con aplicaciones en (1) miner´ıa de
opiniones, (2) medici´on del nivel de vocabulario
de regiones concretas, (3) tests de legibilidad,
(4) estilometr´ıa y (5) detecci´on de plagios.</p>
      <p>El resto del documento est´a divido en
los siguientes apartados. La secci´on 2
describe LIWC, el est´andar de facto de an´alisis
sint´actico as´ı como se citan trabajos
relevantes dentro de la Miner´ıa de Opiniones
aplicando esta herramienta. La secci´on 3 detalla
la metodolog´ıa propuesta, haciendo especial
hincapi´e en los prototipos que se est´an
creando. En la secci´on 4 se listan tres estudios
sobre diferentes dominios en los que se est´a
evaluando el prototipo. Por u´ltimo, la secci´on 5
sugiere distintos temas de debate que se est´an
planteando durante la realizaci´on de esta
tesis doctoral.
2</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajo relacionado</title>
      <p>En la siguiente secci´on se describe LIWC,
un est´andar de facto para tareas de
an´alisis lingu¨´ıstico (Ver secci´on 2.1) as´ı como
investigaciones relacionadas con la Miner´ıa de
Opiniones (ver secci´on 2.2) .
2.1</p>
      <sec id="sec-2-1">
        <title>LIWC</title>
        <p>
          LIWC
          <xref ref-type="bibr" rid="ref15">(Tausczik y Pennebaker, 2010)</xref>
          es una
herramienta para la extracci´on de
caracter´ısticas lingu¨´ısticas capaz de analizar un
conjunto de textos y generar un vector con
los porcentajes de una serie de categor´ıas
preestablecidas. Aunque fue originalmente
disen˜ada para el ingl´es, LIWC cuenta con
una versi´on adaptada al espan˜ol. Este
proceso de traducci´on fue analizado en
(Ram´ırez
        </p>
        <p>Esparza et al., 2007), donde se identificaron
una serie de puntos a mejorar: (1) problemas
de traducci´on entre el ingl´es y el espan˜ol,
(2) el arbitrario disen˜o de las dimensiones,
(3) diferencias gramaticales no recogidas
entre el espan˜ol y el ingl´es, (4) conjugaciones
verbales insuficientes y, (5) la falta de
estudios con fuentes espan˜olas. Adem´as, es
importante destacar que LIWC es una
herramienta comercial, lo que termin´o de motivar
el desarrollo de una herramienta libre para la
comunidad de PLN en espan˜ol.
2.2</p>
      </sec>
      <sec id="sec-2-2">
        <title>Miner´ıa de Opiniones</title>
        <p>
          El objetivo de la Miner´ıa de Opiniones es
clasificar si la percepci´on subjetiva de los
usuarios hac´ıa un tema concreto es positiva,
negativa o neutra
          <xref ref-type="bibr" rid="ref3">(Esuli y Sebastiani, 2005)</xref>
          . En
funci´on del nivel de profundidad del an´alisis
deseado, podemos distinguir entre: (1)
an´alisis a nivel de documento, (2) an´alisis a nivel
de sentencia, o (3) an´alisis a nivel de aspecto.
En el an´alisis a nivel de documento, el
texto es clasificado como un todo, devolviendo
si la opini´on general es positiva, negativa o
neutra. En una clasificaci´on a nivel de
sentencia el texto se divide en frases y cada una
se clasifica de manera individual. Por u´ltimo,
en la clasificaci´on a nivel de aspecto, se
trata de clasificar cada aspecto o caracter´ıstica
detectada en el documento.
        </p>
        <p>
          La obtenci´on de la subjetividad se
puede realizar mediante (1) Orientaci´on
sem´antica y (2) Aprendizaje computacional. La
orientaci´on Sem´antica consiste en
comparar los textos con lexicones compuestos por
palabras que reflejan sentimientos, como
WordNet-Affect
          <xref ref-type="bibr" rid="ref14">(Strapparava, Valitutti, y
others, 2004)</xref>
          o SentiWordNet
          <xref ref-type="bibr" rid="ref15">(Baccianella,
Esuli, y Sebastiani, 2010)</xref>
          . Por otro lado, los
m´etodos de aprendizaje computacional se
basan en entrenar un modelo a partir de un
conjunto de instancias ya clasificadas. El modelo
resultante debe de ser capaz de replicar el
comportamiento humano.
        </p>
        <p>Dentro de las t´ecnicas de aprendizaje
computacional, se pueden extraer distintos
tipos de caracter´ısticas. La t´ecnica m´as b´asica
de los modelos de aprendizaje supervisado, es
decir, del aprendizaje a trav´es de ejemplos,
es conocida como Bolsa de Palabras (Bag of
Words) y consiste en relacionar la frecuencia
de ciertas expresiones con las opiniones del
conjunto de entrenamiento. Pese a su
simplicidad, el modelo de Bolsa de Palabras
funciona bastante bien; sin embargo, presenta
ciertas desventajas. En primer lugar, porque
puede sobre-entrenar el modelo, haci´endolo
demasiado espec´ıfico para el conjunto de
entrenamiento pero fallando con nuevas
instancias. En segundo lugar, porque considera las
palabras de manera aislada sin recoger la
relaci´on sem´antica entre el texto, perdiendo
informaci´on relevante para la clasificaci´on.</p>
        <p>
          Gran cantidad de estudios de miner´ıa de
opiniones est´an centrados exclusivamente en
documentos en ingl´es, quiz´as debido a la falta
de recursos en otros idiomas
          <xref ref-type="bibr" rid="ref10">(Mart´ın-Valdivia
et al., 2013)</xref>
          . Adem´as, un aspecto
importante sobre el cual la subjetividad y el an´alisis
de sentimientos requieren mayores esfuerzos
est´a relacionado con el an´alisis de textos
multil´ıngu¨es. La anotaci´on manual de recursos
es una tarea tediosa y costosa, por lo que
existen muy pocos corpus y diccionarios para
el an´alisis del sentimiento. Para superar este
problema, los investigadores han propuesto
m´etodos para adaptar los recursos existentes
y las herramientas para el an´alisis del
sentimiento desarrollado para el idioma ingl´es
para crear recursos en otros idiomas. En
este sentido, los lexicones y los corpus
anotados se han transformado a nuevos lenguajes
utilizando diccionarios bilingu¨es,
bootstrapping monolingu¨e y multilingu¨e o traducci´on
autom´atica (Balahur y Turchi, 2014). Sin
embargo, estos m´etodos dependen de la
disponibilidad y la precisi´on de los motores de
traducci´on autom´atica.
3
        </p>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Descripci´on de la metodolog´ıa propuesta</title>
      <p>En la siguiente secci´on se describe el sistema
de extraccio´n de caracter´ısticas lingu¨´ısticas
en espan˜ol (Ver secci´on 3.1) una herramienta
de clasificacio´n de corpus en Twitter, para la
obtenci´on de corpus de evaluaci´on de la
herramienta (Ver secci´on 3.2) y, por u´ltimo, la
interfaz gr´afica de la aplicaci´on (Ver secci´on
3.3).
3.1</p>
      <sec id="sec-3-1">
        <title>UMUTextStats</title>
        <p>
          UMUTextStats es un sistema de extracci´on
de caracter´ısticas lingu¨´ısticas disen˜ado para
el espan˜ol. Al igual que LIWC, este sistema
es capaz de extraer un vector formado por los
porcentajes de palabras y expresiones que
encajan en una serie de caracter´ısticas
lingu¨´ısticas. Sin embargo, se est´a tratando de resolver
las deficiencias que se encontraron en LIWC
          <xref ref-type="bibr" rid="ref11">(Ram´ırez-Esparza et al., 2007)</xref>
          .
        </p>
        <p>UMUTextStats es extensible y permite
definir dimensiones a partir de un conjunto de
dimensiones abstractas predefinidas, donde
destacamos:</p>
        <p>Dimensiones de diccionario. Permite en
encontrar expresiones regulares que
aparezcan en un determinado cat´alogo de
t´erminos. Esta dimensi´on tambi´en
permite indicar contraejemplos. Mediante
los contraejemplos es m´as f´acil disen˜ar
una expresi´on regular sencilla sobre un
t´ermino, y luego listar las excepciones,
como ocurre con el g´enero gramatical.
Dimensiones basadas en expresiones
regulares. Permite, por ejemplo,
especificar expresiones regulares para detectar
expresiones entrecomilladas, lo que es
indicativo del uso de citas textuales o
palabras que adquieren algu´n determinado
tono especial.</p>
        <p>Dimensiones basadas en en tipograf´ıa.
Permite detectar el porcentaje de
palabras escritas en mayu´sculas, lo cu´al
puede ser indicio de tono elevado de la voz,
caracter´ıstica interesante para la
detecci´on de violencia a trav´es de Internet.</p>
        <p>Adem´as de estas dimensiones gen´ericas,
se han implementado dimensiones espec´ıficas
como, por ejemplo, una dimensi´on para
capturar errores gramaticales a partir de la
librer´ıa PSPell2 o dimensiones para la
detecci´on de verbos, a partir del POSTagger de
Stanford3.</p>
        <p>Una ventaja de UMUTextStats frente a
otras aplicaciones es que permite operar
simult´aneamente con distingas versiones del
mismo texto. Por lo tanto, algunas
dimensiones pueden operar sobre una versi´on filtrada
que facilita la bu´squeda de t´erminos en el
diccionario, mientras que la versi´on original se
puede utilizar para medir caracter´ısticas
como el porcentaje de palabras en mayu´sculas.
3.2</p>
      </sec>
      <sec id="sec-3-2">
        <title>UMUCorpusClassifier</title>
        <p>Con objeto de facilitar el disen˜o de
experimentos para verificar UMUTextSTats, se ha
desarrollado tambi´en una herramienta de
extracci´on de tweets llamada
UMUCorpusClassifier. Esta herramienta permite recolectar
2https://www.php.net/manual/en/book.pspell.php
3https://nlp.stanford.edu/software/tagger.shtml
corpus de entrenamiento a partir de una
cadena de bu´squeda y, opcionalmente, una
localizaci´on geogr´afica.</p>
        <p>
          Los tweets obtenidos se pueden clasificar
de dos maneras. Por un lado, mediante
supervisi´on distante
          <xref ref-type="bibr" rid="ref8">(Go, Bhayani, y Huang,
2009)</xref>
          estableciendo algu´n tipo de regla
autom´atica. Por ejemplo, algunos estudios de
la bu´squeda de tweets sat´ıricos han
partido de la asumpci´on de que todos los tweets
con el hashtag #sarcasm son ir´onicos
          <xref ref-type="bibr" rid="ref9">(Liebrecht, Kunneman, y van Den Bosch, 2013)</xref>
          .
Por otro lado, mediante clasificaci´on manual,
donde la calidad de la clasificaci´on depende
del nu´mero de usuarios que clasifican el
mismo documento de manera independiente. De
esta manera, el sistema potencia cu´ales son
los documentos que tienen m´as consenso
entre los usuarios descartando los que generen
m´as controversia. Independiente del sistema
de clasificacio´n, cada corpus se permite el uso
de una escala diferente, aunque por defecto se
usa una configuraci´on de cinco niveles: muy
positiva, positiva, neutra, negativa, muy
negativa y fuera del dominio.
3.3
        </p>
      </sec>
      <sec id="sec-3-3">
        <title>Interfaz de usuario</title>
        <p>La interfaz gr´afica de UMUTextStats est´a
integrada con distintas fuentes de donde
recoger documentos. En primer lugar, se
pueden obtener documentos directamente desde
la API de Twitter. En segundo lugar, se
pueden subir documentos con los textos en
distintos formatos, como CSV, ficheros de texto
plano o ficheros comprimidos. En tercer
lugar, se pueden comprobar art´ıculos de la
Wikipedia a partir de especificar el t´ıtulo. Por
u´ltimo, se ha integrado una comunicaci´on
directa con UMUCorpusClassifier. Los vectores
de caracter´ısticas generados se pueden
exportar en diferentes formatos como JSON, CSV,
HTML y ficheros ARFF para la suite
WEKA4.</p>
        <p>Como elemento adicional, la interfaz
permite efectuar comparativas con otros
modelos. Actualmente, est´a disen˜ado para
compararse con un modelo de N-Gramas generado
a partir de secuencias de palabras o de
caracteres.
4</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Metodolog´ıa y experimentos propuestos</title>
      <p>En la siguiente secci´on se describen los
experimentos llevados a cabo para la validaci´on de</p>
      <p>UMUTextStats en diferentes dominios: (1) el
estudio de la s´atira, (2) infodemiolog´ıa y (3)
el an´alisis de opiniones sobre econom´ıa.
4.1</p>
      <sec id="sec-4-1">
        <title>S´atira</title>
        <p>Adem´as de divertida, la s´atira es una
herramienta constructiva que permite a la
sociedad detectar y sobreponerse a sus
debilidades. Sin embargo, aunque algunos autores
han comparado el periodismo sat´ırico con las
noticias falsas, estas difieren en la
intencionalidad. Mientras que la s´atira pretende crear
una versi´on de la realidad donde nadie espera
que sea real, las noticias falsas tienen la
intencionalidad de confundir, generar odio,
prejuicio o decepci´on. Debido a la gran capacidad
de difusi´on de las noticias hoy en d´ıa, hemos
verificado la eficacia de UMUTextStats
para entrenar modelos capaces de distinguir
entre noticias sat´ıricas y noticias reales ya que,
aunque la s´atira no es real, no deber´ıa de ser
considerada contenido pernicioso. Adem´as, la
clasificaci´on de la s´atira puede ayudar a otras
tareas del Procesamiento del Lenguaje
Natural, como la Miner´ıa de Opiniones, porque el
significado impl´ıcito de textos sat´ıricos
difiere del texto expl´ıcito. Consecuentemente, la
identificaci´on de contenido sat´ırico nos
ayudar´ıa a: (1) diferenciar entre contenido
objetivo y divertido, (2) filtrar noticias falsas sin
perjudicar el contenido divertido, y (3)
identificar contenido que utiliza lenguaje figurado.</p>
        <p>
          Siguiendo esta l´ınea de investigaci´on, se
han extra´ıdo caracter´ısticas lingu¨´ısticas a
partir de varios corpus encontrados en la
bibliograf´ıa, adem´as de la recolecci´on de un
nuevo corpus balanceado formado por 10.000
tweets, escritos tanto en castellano y en
espan˜ol de M´exico. Para la clasificaci´on de
los tweets se ha seguido una estrategia de
supervisi´on distante basando en la
presunci´on de que los tweets son sat´ıricos s´olo si
provienen de un medio sat´ırico, siguiendo
la misma idea que
          <xref ref-type="bibr" rid="ref2">(del Pilar Salas-Z´arate
et al., 2017)</xref>
          y
          <xref ref-type="bibr" rid="ref1">(Barbieri, Ronzano, y
Saggion, 2015)</xref>
          . Adem´as, hemos podido
comparar nuestro modelo con estos trabajos previos
y con un modelo base formado por una Bolsa
de Palabras.
        </p>
        <p>
          Adem´as de las dimensiones gen´ericas, en
este experimento se crearon dos tipos de
categor´ıas m´as. Una categor´ıa espec´ıfica para
extraer caracter´ısticas propias de Twitter, como
el uso de menciones, hashtags o emoticonos, y
otra categor´ıa espec´ıfica para capturar
t´ecnicas propias del lenguaje figurativo a partir
de la taxonom´ıa especificada en
          <xref ref-type="bibr" rid="ref13">(Roberts y
Kreuz, 1994)</xref>
          y que consta de (1) hip´erboles,
(2) idiotismos, (3) peticiones indirectas, (4)
iron´ıa verbal, (5) atenuaci´on, (6) met´aforas,
(7) preguntas ret´oricas y (8) s´ımiles.
        </p>
        <p>
          Los resultados obtenidos han sido
positivos mejorando UMUTextStats a los modelos
obtenidos en
          <xref ref-type="bibr" rid="ref2">(del Pilar Salas-Z´arate et al.,
2017)</xref>
          y
          <xref ref-type="bibr" rid="ref1">(Barbieri, Ronzano, y Saggion, 2015)</xref>
          .
Este trabajo ha sido enviado para su
publicaci´on y se encuentra ahora mismo en fase de
revisi´on.
4.2
        </p>
      </sec>
      <sec id="sec-4-2">
        <title>Infodemiolog´ıa</title>
        <p>
          La infodemiolog´ıa es la ciencia que investiga
el uso de informaci´on disponible en Internet
con el fin de mejorar los servicios sanitarios.
En este sentido, existen dos grandes tipos de
enfoque. Debido al impacto socio-econ´omico
causado por las enfermedades infecciosas
hemos realizado un conjunto de experimentos
con la colaboraci´on de la Universidad de
Guayaquil. En concreto, se recolect´o y se clasific´o
un corpus formado por tweets procedentes de
Ecuador a partir de palabras clave de virus
como el Zika o el Chikungunya. Para estos
corpus utilizamos la herramienta
UMUCorpusClassifier (Ver secci´on 3.2) , para
recolectar el corpus y para realizar una clasificaci´on
manual. Para ello, contamos con 20
estudiantes de la universidad de Guayaquil. que
realizaron un total de 51.127 clasificaciones
manuales. Como los alumnos clasificaron varias
veces los mismos tweets existe cierto consenso
en cuanto a las opiniones, y pudimos
descartar los tweets que generaban m´as pol´emica.
Se han llevado ya varios experimentos previos
que se han publicado en
          <xref ref-type="bibr" rid="ref4 ref5 ref6">(Garc´ıa-D´ıaz et al.,
2018a)</xref>
          y
          <xref ref-type="bibr" rid="ref4 ref5 ref6">(Garc´ıa-D´ıaz et al., 2018b)</xref>
          .
4.3
        </p>
      </sec>
      <sec id="sec-4-3">
        <title>Econom´ıa</title>
        <p>
          En tercer lugar, se ha aplicado este estudio al
dominio de la econom´ıa. El objetivo de esta
tarea era analizar mensajes de usuarios en
redes sociales para determinar qu´e combinaci´on
de caracter´ısticas lingu¨´ısticas podr´ıa predecir
opiniones positivas y negativas con respecto
de la econom´ıa. Este estudio se llevado por
dos v´ıas. En primer lugar, se realiz´o un
an´alisis preliminar con un corpus balanceado de
1.000 tweets positivos y 1.000 tweets
negativos. Estos tweets fueron clasificados
manualmente por personal del laboratorio. En este
sentido, el corpus, no tiene tanta aceptaci´on
como el otro corpus. Los resultados de este
experimento se pueden consultar en
          <xref ref-type="bibr" rid="ref4 ref5 ref6">(Garc´ıaD´ıaz et al., 2018c)</xref>
          .
5
        </p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>Temas espec´ıficos a discutir sobre la investigaci´on</title>
      <p>UMUTextStats, al igual que LIWC, tiene un
sistema arbitrario de dimensiones. Para
solucionar el problema, nos hemos puesto en
contacto con lingu¨´ısticas de la Universidad de
Murcia, para asesorarnos en establecer una
mejor taxonom´ıa.</p>
      <p>Adem´as, se est´a analizando cuando ciertas
expresiones, como ”Nueva York ”deben de ser
analizadas como una entidad u´nica o
cuando las palabras que lo conforman deben de
identificarse en otras categor´ıas. En este
sentido, la palabra ”Nueva”no deber´ıa de
contabilizar en otras categor´ıas como adjetivos.
Sin embargo, si que hay casos donde las
palabras si que deben de aparecer en distintas
categor´ıas. Para solucionarlo, se ha planteado
usar un sistema de reconocimiento de
entidades nombradas para tratar estos elementos de
manera aislada.</p>
      <p>
        Sobre la herramienta de
UMUCorpusClassifier se pretende mejorar el sistema de tweets
duplicados. Durante los experimentos se han
detectado casos de tweets muy parecidos
donde s´olo se ha variado alguna coma o s´ımbolo
de puntuaci´on. Para esto, se han buscado
diferentes herramientas como la propuesta en
        <xref ref-type="bibr" rid="ref12">(Rieck y Wressnegger, 2016)</xref>
        , pero no se han
implantado todav´ıa.
      </p>
    </sec>
    <sec id="sec-6">
      <title>Agradecimientos</title>
      <p>Este trabajo ha sido apoyado por la
Agencia Estatal de Investigaci´on (AEI) y el
Fondo Europeo de Desarrollo Regional (FEDER)
a trav´es del proyecto KBS4FIA
(TIN201676323-R)</p>
    </sec>
    <sec id="sec-7">
      <title>Bibliograf´ıa</title>
      <p>Baccianella, S., A. Esuli, y F. Sebastiani.
2010. Sentiwordnet 3.0: an enhanced
lexical resource for sentiment analysis and
opinion mining. En Lrec, volumen 10,
p´aginas 2200–2204.</p>
      <p>Balahur, A. y M. Turchi. 2014.
Comparative experiments using supervised learning
and machine translation for multilingual
sentiment analysis. Computer Speech &amp;
Language, 28(1):56–75.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Barbieri</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>F.</given-names>
            <surname>Ronzano</surname>
          </string-name>
          , y
          <string-name>
            <given-names>H.</given-names>
            <surname>Saggion</surname>
          </string-name>
          .
          <year>2015</year>
          .
          <article-title>Is this tweet satirical? a computational approach for satire detection in spanish</article-title>
          .
          <source>Procesamiento del Lenguaje Natural</source>
          ,
          <volume>55</volume>
          :
          <fpage>135</fpage>
          -
          <lpage>142</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>del Pilar</surname>
            Salas-Z´arate, M.,
            <given-names>M. A.</given-names>
          </string-name>
          <string-name>
            <surname>ParedesValverde</surname>
          </string-name>
          , M. A.
          <string-name>
            <surname>Rodriguez-Garcia</surname>
          </string-name>
          , R. Valencia-Garc´ıa, y G.
          <article-title>Alor-Hern´andez</article-title>
          .
          <year>2017</year>
          .
          <article-title>Automatic detection of satire in twitter: A psycholinguistic-based approach</article-title>
          .
          <source>Knowledge-Based Systems</source>
          ,
          <volume>128</volume>
          :
          <fpage>20</fpage>
          -
          <lpage>33</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Esuli</surname>
            , A. y
            <given-names>F.</given-names>
          </string-name>
          <string-name>
            <surname>Sebastiani</surname>
          </string-name>
          .
          <year>2005</year>
          .
          <article-title>Determining the semantic orientation of terms through gloss classification</article-title>
          .
          <source>En Proceedings of the 14th ACM international conference on Information and knowledge management</source>
          , p´aginas 617-
          <fpage>624</fpage>
          . ACM.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <article-title>Garc´ıa-D´ıaz</article-title>
          ,
          <string-name>
            <surname>J. A.</surname>
          </string-name>
          ,
          <string-name>
            <given-names>O</given-names>
            ´ .
            <surname>Apolinario-Arzube</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Medina-Moreira</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Luna-Aveiga</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lagos-Ortiz</surname>
          </string-name>
          , y R.
          <article-title>Valencia-Garc´ıa</article-title>
          . 2018a.
          <article-title>Sentiment analysis on tweets related to infectious diseases in south america</article-title>
          .
          <source>En Proceedings of the Euro American Conference on Telematics and Information Systems</source>
          , p´
          <fpage>agina</fpage>
          21. ACM.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <article-title>Garc´ıa-D´ıaz</article-title>
          ,
          <string-name>
            <surname>J. A.</surname>
          </string-name>
          ,
          <string-name>
            <given-names>O.</given-names>
            <surname>Apolinario-Arzube</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Medina-Moreira</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. O.</given-names>
            <surname>SalavarriaMelo</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lagos-Ortiz</surname>
          </string-name>
          , H. Luna-Aveiga, y R.
          <article-title>Valencia-Garc´ıa. 2018b. Opinion mining for measuring the social perception of infectious diseases. an infodemiology approach</article-title>
          .
          <source>En International Conference on Technologies and Innovation</source>
          , p´
          <source>aginas 229-239</source>
          . Springer.
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <article-title>Garc´ıa-D´ıaz</article-title>
          ,
          <string-name>
            <surname>J. A.</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M. P.</given-names>
            <surname>Salas-Z´arate</surname>
          </string-name>
          , M. L.
          <article-title>Hern´andez-</article-title>
          <string-name>
            <surname>Alcaraz</surname>
          </string-name>
          , R. Valencia-Garc´ıa, y J.
          <string-name>
            <surname>M. G</surname>
          </string-name>
          <article-title>´omez-Berb´ıs. 2018c. Machine learning based sentiment analysis on spanish financial tweets</article-title>
          .
          <source>En World Conference on Information Systems and Technologies</source>
          , p´
          <source>aginas 305-311</source>
          . Springer.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Gaston</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Narayanan</surname>
          </string-name>
          ,
          <string-name>
            <given-names>G.</given-names>
            <surname>Dozier</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D. L.</given-names>
            <surname>Cothran</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C.</given-names>
            <surname>Arms-Chavez</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Rossi</surname>
          </string-name>
          , M. C. King,
          <string-name>
            <given-names>y J.</given-names>
            <surname>Xu</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Authorship attribution vs. adversarial authorship from a liwc and sentiment analysis perspective</article-title>
          .
          <source>En 2018 IEEE Symposium Series on Computational Intelligence (SSCI)</source>
          , p´aginas 920-
          <fpage>927</fpage>
          . IEEE.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Go</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          , R. Bhayani, y
          <string-name>
            <given-names>L.</given-names>
            <surname>Huang</surname>
          </string-name>
          .
          <year>2009</year>
          .
          <article-title>Twitter sentiment classification using distant supervision</article-title>
          .
          <source>CS224N Project Report</source>
          , Stanford,
          <volume>1</volume>
          (
          <issue>12</issue>
          ):
          <year>2009</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Liebrecht</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>F.</given-names>
            <surname>Kunneman</surname>
          </string-name>
          , y
          <string-name>
            <given-names>A. van Den</given-names>
            <surname>Bosch</surname>
          </string-name>
          .
          <year>2013</year>
          .
          <article-title>The perfect solution for detecting sarcasm in tweets# not</article-title>
          .
          <source>En Proceedings of the 4th Workshop on Computational Approaches to Subjectivity</source>
          . New Brunswick, NJ: ACL.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <article-title>Mart´ın-</article-title>
          <string-name>
            <surname>Valdivia</surname>
          </string-name>
          , M.-
          <string-name>
            <surname>T.</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          <article-title>Mart´ınez-C´amara</article-title>
          , J.
          <string-name>
            <surname>-M.</surname>
            Perea-Ortega, y
            <given-names>L. A.</given-names>
          </string-name>
          <string-name>
            <surname>Uren</surname>
          </string-name>
          ˜AL´
          <fpage>opez</fpage>
          .
          <year>2013</year>
          .
          <article-title>Sentiment polarity detection in spanish reviews combining supervised and unsupervised approaches</article-title>
          .
          <source>Expert Systems with Applications</source>
          ,
          <volume>40</volume>
          (
          <issue>10</issue>
          ):
          <fpage>3934</fpage>
          -
          <lpage>3942</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <article-title>Ram´ırez-</article-title>
          <string-name>
            <surname>Esparza</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>J. W.</given-names>
            <surname>Pennebaker</surname>
          </string-name>
          ,
          <string-name>
            <given-names>F. A.</given-names>
            <surname>Garc</surname>
          </string-name>
          <article-title>´ıa</article-title>
          , R. Suri´a Mart´ınez, y others.
          <year>2007</year>
          .
          <article-title>La psicolog´ıa del uso de las palabras: Un programa de computadora que analiza textos en espan˜ol</article-title>
          . Revista mexicana de psicolog´ıa,
          <volume>24</volume>
          (
          <issue>1</issue>
          ):
          <fpage>85</fpage>
          -
          <lpage>99</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Rieck</surname>
            , K. y
            <given-names>C.</given-names>
          </string-name>
          <string-name>
            <surname>Wressnegger</surname>
          </string-name>
          .
          <year>2016</year>
          .
          <article-title>Harry: A tool for measuring string similarity</article-title>
          .
          <source>The Journal of Machine Learning Research</source>
          ,
          <volume>17</volume>
          (
          <issue>1</issue>
          ):
          <fpage>258</fpage>
          -
          <lpage>262</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Roberts</surname>
            , R. M. y
            <given-names>R. J.</given-names>
          </string-name>
          <string-name>
            <surname>Kreuz</surname>
          </string-name>
          .
          <year>1994</year>
          .
          <article-title>Why do people use figurative language? Psychological science</article-title>
          ,
          <volume>5</volume>
          (
          <issue>3</issue>
          ):
          <fpage>159</fpage>
          -
          <lpage>163</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Strapparava</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          , A. Valitutti, y others.
          <year>2004</year>
          .
          <article-title>Wordnet affect: an affective extension of wordnet</article-title>
          .
          <source>En Lrec, volumen 4</source>
          , p´aginas 1083-
          <fpage>1086</fpage>
          . Citeseer.
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Tausczik</surname>
            ,
            <given-names>Y. R. y J. W.</given-names>
          </string-name>
          <string-name>
            <surname>Pennebaker</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>The psychological meaning of words: Liwc and computerized text analysis methods</article-title>
          .
          <source>Journal of language and social psychology</source>
          ,
          <volume>29</volume>
          (
          <issue>1</issue>
          ):
          <fpage>24</fpage>
          -
          <lpage>54</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Tumasjan</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>T. O.</given-names>
            <surname>Sprenger</surname>
          </string-name>
          , P. G. Sandner,
          <string-name>
            <given-names>y I. M.</given-names>
            <surname>Welpe</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Predicting elections with twitter: What 140 characters reveal about political sentiment</article-title>
          .
          <source>En Fourth international AAAI conference on weblogs and social media.</source>
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>