=Paper= {{Paper |id=Vol-1397/sinai-emma |storemode=property |title=SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter |pdfUrl=https://ceur-ws.org/Vol-1397/sinai-emma.pdf |volume=Vol-1397 |dblpUrl=https://dblp.org/rec/conf/sepln/CamaraCML15 }} ==SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter== https://ceur-ws.org/Vol-1397/sinai-emma.pdf
TASS 2015, septiembre 2015, pp 41-46                                            recibido 20-07-15 revisado 24-07-15 aceptado 27-07-15




        SINAI-EMMA: Vectores de Palabras para el Análisis de
                     Opiniones en Twitter∗
      SINAI-EMMA: Vectors of words for Sentiment Analysis in Twitter
                 Eugenio Martı́nez Cámara, Miguel Á. Garcı́a Cumbreras,
                  M. Teresa Martı́n Valdivia y L. ALfonso Ureña López
                                Departamento de Informática
                         Universidad de Jaén, E-23071 - Jaén, España
                         {emcamara, magc, maite, laurena}@ujaen.es

        Resumen: Este artı́culo describe el sistema de clasificación de polaridad desarro-
        llado por el equipo SINAI-EMMA para la tarea 1 del workshop TASS 2015. Nuestro
        sistema construye vectores de palabras a partir de la información de opinión de 5
        recursos lingüı́sticos. Los resultados obtenidos nos animan a seguir estudiando el
        aporte de los vectores de palabras a la tarea de Análisis de Opiniones.
        Palabras clave: Análisis de Opiniones, Clasificación de la polaridad, recursos léxi-
        cos, Espacio Vectorial Semántico
        Abstract: In this work, a polarity classification system is developed for the task 1
        of workshop TASS 2015 by the SINAI-EMMA team. Our system takes advantage
        of 5 linguistic resources for building vectors of words. The results encourage us to
        continue studying the contribution of vectors of words to Sentiment Analysis.
        Keywords: Sentiment Analysis, Polarity Classification, linguistic resources, Vector
        Space Model of Semantics

1     Introducción                                                    la matriz de tweets y caracterı́sticas utiliza-
TASS (Taller de Análisis de Sentimientos en                           mos un sistema de entrenamiento para obte-
la SEPLN) es un workshop satélite del con-                            ner un modelo léxico, y dicho modelo es el
greso de la SEPLN (Sociedad Española pa-                              utilizado en la evaluación del subconjunto de
ra el Procesamiento del Lenguaje Natural),                             test a etiquetar.
que promueve desde 2012 la evaluación expe-                              El resto del artı́culo está organizado de la
rimental de sistemas de Análisis de Opiniones                         siguiente forma. La siguiente sección descri-
(AO) sobre tweets escritos en español.                                be los modelos de n-gramas y otros modelos
    Nuestra participación se ha limitado a la                         del lenguaje aplicados a la detección de po-
tarea 1, denominada sentiment analysis at                              laridad con tweets, ası́ como trabajos relacio-
global level, que tiene como objetivo la cla-                          nados. En la Sección 3 se describe el siste-
sificación de la polaridad de un conjunto de                          ma que hemos desarrollado y en la Sección 4
tweets. La descripción de la tarea se encuen-                         los experimentos realizados, resultados obte-
tra en el resumen de la edición del año 2015                         nidos y análisis de los mismos. Por último, en
de TASS (Villena-Román et al., 2015). El sis-                         la Sección 5 exponemos las conclusiones y el
tema de este año se centra en la subtarea de                          trabajo a realizar.
de clasificación en 6 niveles de polaridad (P+,
P, NEU, N, N+, NONE).
                                                                       2     Trabajos relacionados
    La solución que presentamos pasa por ex-                          El Modelo de Espacio Vectorial (MEV) ha
traer caracterı́sticas léxicas a partir de n-                         demostrado sobradamente su valı́a para me-
gramas de cada tweet, concretamente unigra-                            dir la similitud entre documentos, y una
mas y bigramas, siendo estas caracterı́sticas                          muestra es su exitosa aplicación en los sis-
la polaridad de los n-gramas en distintos re-                          temas de recuperación de información (Man-
cursos léxicos etiquetados. Una vez obtenida                          ning, Raghavan, y Schütze, 2008). Por consi-
∗
                                                                       guiente, cabe preguntarse si es posible apli-
  Este trabajo ha sido financiado parcialmente por el                  car el mismo esquema para medir la simi-
Fondo Europeo de Desarrollo Regional (FEDER), el
proyecto ATTOS del Gobierno de España (TIN2012-
                                                                       litud existente entre palabras. Esa pregun-
38536-C03-0) y el proyecto AORESCU de la Junta de                      ta la contestaron afirmativamente Deerwes-
Andalucı́a (P11-TIC-7684 MO).                                          ter et al. (1990) al proponer un MEV en el
Publicado en http://ceur-ws.org/Vol-1397/. CEUR-WS.org es una publicación en serie con ISSN reconocido               ISSN 1613-0073
           Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López



que cada palabra estaba caracterizada por un                      través de un MEV a nivel de n-grama, si-
vector, el cual representaba a la palabra en                      guiendo en este caso, un modelo de autocodi-
función a su coocurrencia con otras. Al igual                    ficadores recursivos (recursive autoencoders).
que el MEV sobre documentos, el MEV sobre                         Bespalov et al. (2012) tratan tener en cuenta
palabras también ha reportado buenos resul-                      en el MEV semántico que diseñan la posición
tados en desambiguación, reconocimiento de                       de cada n-grama en el documento, dado que
entidades, análisis morfológico (part of speech                 sostienen que la polaridad de un documento
tagging) y recuperación de información (Tur-                    depende de la posición en la que se encuen-
ney y Pantel, 2010; Collobert y Weston, 2008;                     tren los n-gramas. El trabajo (Tang et al.,
Turian, Ratinov, y Bengio, 2010).                                 2014) es otro ejemplo de representación de n-
    En la bibliografı́a relacionada con AO                        gramas por medio de vectores, tratando los
existen trabajos que postulan que las pala-                       autores de insertar información de opinión en
bras (unigramas) son más efectivos para re-                      dichos vectores mediante el uso de tres redes
presentar la información de opinión (Pang,                      neuronales. A diferencia de los trabajos an-
Lee, y Vaithyanathan, 2002; Martı́nez-Cáma-                      teriores, el de Tang et al. (2014) se centra en
ra et al., 2011), y otros en los que se pre-                      la clasificación de la polaridad de tweets.
fiere el uso de n-gramas (Dave, Lawrence, y
Pennock, 2003; Kouloumpis, Wilson, y Moo-                         3     Sistema
re, 2011). La orientación de la opinión de un                   El sistema que se ha desarrollado para la
documento es muy probable que no sea la su-                       cuarta edición de TASS trata de trasladar
ma de las polaridades de las palabras indivi-                     el concepto de MEV semántico a la clasi-
duales que lo componen, sino la combinación                      ficación de la polaridad de tweets en es-
de las expresiones que aparecen en el mis-                        pañol. En nuestro caso, no se ha preten-
mo. La palabra “bueno” tiene un significado                       dido representar a cada palabra en función
positivo, pero la expresión “no muy bueno”                       de su coocurrencia con otras, o teniendo en
transmite un significado negativo. Por tanto,                     cuenta su posición en el texto, sino por su
en el caso del AO puede que sea más reco-                        valor de polaridad en varios recursos léxi-
mendable utilizar n-gramas como unidad de                         cos de opinión: iSOL (Molina-González et
representación de información.                                  al., 2013), SentiWordNet (Baccianella, Esu-
    En el presente trabajo tratamos de incrus-                    li, y Sebastiani, 2010), Q-WordNet (Agerri
tar al MEV tradicional, una representación                       y Garcı́a-Serrano, 2010), SEL (Rangel, Sido-
vectorial de cada n-grama, dando lugar a un                       rov, y Suárez-Guerra, 2014) y ML-Senticon
MEV semántico (Turney y Pantel, 2010). Es-                       (Cruz et al., 2014). Con este esquema de re-
te tipo de modelo tiene una mayor capacidad                       presentación, lo que se está haciendo es in-
de representación de la información subya-                      crustar en el MEV los distintos puntos de
cente en la opinión, al combinar diferentes                      vista que tienen diferentes recursos léxicos de
grados de n-gramas, ası́ como de caracteri-                       opinión sobre una misma palabra, enrique-
zar cada n-grama por un conjunto de carac-                        ciendo de esta forma la representación de la
terı́sticas. Éste es el fundamento de los nue-                   información de opinión que contienen cada
vos métodos que se están desarrollando para                     una de las palabras.
la clasificación de la polaridad. Uno de los                         A continuación se van a describir some-
primeros trabajos de este nuevo enfoque es                        ramente los recursos lingüı́sticos que se han
(Maas et al., 2011), en el que se consigue que                    utilizado, ası́ como se detallará el proceso de
palabras con un significado similar estén re-                    generación de los vectores.
presentadas por vectores similares. El proceso
de generación de los vectores es no supervi-                     3.1      iSOL
sado, pero para una correcta clasificación de                    iSOL es una lista de palabras indicadoras de
la polaridad, el método que proponen los au-                     opinión en español. La lista está formada por
tores requiere de información de opinión, de                    8135 palabras, de las cuales 5626 son negati-
manera que tienen que utilizar un corpus con                      vas y 2509 son positivas.
etiquetas de opinión para conseguir que los                          Al tratarse de una lista de palabras de opi-
vectores asociados a las palabras representen                     nión, la única información que aporta es si un
la orientación semántica de la misma.                           término es positivo o negativo, por lo que pro-
    Socher et al. (2011) tratan de representar                    porciona dos caracterı́sticas binarias al vector
la opinión de un conjunto de documentos a                        de cada palabra.
                                                            42
                      SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter



3.2   SentiWordNet                                            racterı́sticas binarias de polaridad.
SentiWordNet es un lista de sentidos de opi-                  3.5      ML-SentiCon
nión que se construyó siguiendo un enfoque
basado en diccionario (Liu, 2012). El dic-                    ML-SentiCon es un recurso de opinión a ni-
cionario que se empleó en su desarrollo fue                  vel de lema. Los 26495 que conforman ML-
WordNet (Miller, 1995). Por tanto, Senti-                     SentiCon se encuentran estratificados en 8
WordNet asocia a cada sentido (synset) de                     capas. Cada una de las capas representa un
WordNet tres valores probabilidad de perte-                   nivel de exactitud de pertenencia a la cla-
nencia a tres niveles de polaridad: Positivo,                 se positivo o negativo, de manera que existe
Negativo y Neutro.                                            una mayor probabilidad, de que el significa-
    Cada palabra puede tener asociada varios                  do de opinión que transmiten los lemas de la
synsets, por lo que se necesita de una función               capa 0 coincida con la clase de opinión que se
de agregación para obtener un valor de pola-                 le ha asignado que los de la capa 7. Al estar
ridad único para cada uno de los tres niveles                los lemas catalogados como positivos o nega-
de opinión. Al igual que Denecke (2008), se                  tivos, este recurso también genera dos nuevas
empleó como función de agregación la me-                   caracterı́sticas, pero en lugar de ser binarias,
dia aritmética. Por tanto, se calculó la media              su valor se corresponde con la puntuación de
aritmética de cada nivel de polaridad, obte-                 polaridad que tiene cada lema en el recurso.
niéndose de esta manera 3 caracterı́sticas, ca-              En el caso de que el lema sea negativo, su
da una correspondiente a un nivel de polari-                  puntuación se multiplica por -1.
dad.
                                                              4      Clasificación
3.3   Q-WordNet                                               La preparación de la clasificación consistió en
Q-WordNet, al igual que SentiWordNet,                         el procesamiento adecuado de los tweets para
está basado en WordNet para construir un re-                 la generación del MEV semántico de unigra-
curso para la tarea de AO. Los autores de Q-                  mas y bigramas. La preparación comenzó con
WordNet, al contrario que los de SentiWord-                   la tokenización de los tweets; aplicación de un
Net, consideran la polaridad como una pro-                    proceso de normalización léxica que consis-
piedad cualitativa, de manera que una pala-                   tió principalmente en la corrección ortográfi-
bra sólo puede ser positiva o negativa. Por                  ca de los tokens; lematización y aplicación de
consiguiente, Q-WordNet es un recurso de                      un análisis morfológico.
opinión que asocia a cada synset de Word-                        A continuación se construyeron los vecto-
Net el valor Positivo o Negativo. El uso de                   res de caracterı́sticas asociados a cada uni-
Q-WordNet permite la adición de 2 nuevas                     grama. En función de la naturaleza de cada
caracterı́sticas al vector asociado a cada pa-                recurso, la búsqueda fue distinta. En el ca-
labra.                                                        so de iSOL se utilizó como consulta la forma
                                                              original de cada unigrama, a excepción de los
3.4   SEL                                                     unigramas que se corresponden con verbos,
SEL es una lista de 2036 palabras clasificadas                con los que se usó su lema, es decir, el infini-
en 6 estados de ánimo diferentes: alegrı́a, en-              tivo del verbo.
fado, miedo, tristeza, sorpresa y disgusto. Las                   Para SentiWordNet y Q-WordNet la con-
palabras tienen asociado un valor de proba-                   sulta no fue directa porque ambos son dos re-
bilidad, que los autores llaman PFA, de per-                  cursos para inglés. Por tanto, se precisó em-
tenencia a una de las 6 categorı́as.                          plear un recurso que permitiera a partir de
    Para su integración en el sistema, se han                palabras en español obtener el synset que le
transformado las 6 categorı́as emocionales en                 corresponde en WordNet. Ese recurso fue la
dos valores de polaridad, de forma que las                    versión en español de WordNet de Multilin-
categorı́as alegrı́a y sorpresa se han tomado                 gual Central Repository (MCR) (Atserias et
como positivas, y las clases enfado, miedo,                   al., 2004). Una vez que se tenı́an de MCR los
tristeza y disgusto como negativas. Además,                  synsets asociados, se consultaba SentiWord-
se aplicó un filtro a la lista de palabra con                Net y Q-WordNet para obtener sus corres-
el fin de sólo utilizar aquellas que tuvieran                pondientes valores de polaridad.
un valor de PFA superior a 0,2. Por tanto,                        SEL y ML-Senticon tuvieron un trata-
tras convertirse SEL a una lista binaria de                   miento similar, dado que la consulta se reali-
opinión, se pudieraon generar dos nuevas ca-                 zaba utilizando el lema de cada unigrama.
                                                         43
              Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López



    Antes de continuar con la descripción de                        prueba el léxico recogido en iSOL se puede
la generación de los bigramas, debe precisarse                      comprobar que en él se recogen vocablos, y
que únicamente se construyeron los vectores                         que uno de los puntales de su éxito es que
de los unigramas que al menos estaban reco-                          incluye las derivaciones de género y número
gidos en uno de los cinco recursos lingüı́sti-                      propias del español. En cambio, en lo que se
cos que se han considerado en la experimen-                          refiere a los verbos, no incluye las conjugacio-
tación. Tras la eliminación de los unigramas                       nes de los mismos, estando sólo presente el in-
que no transmiten opinión, el texto del tweet                       finitivo. Por tanto, en esta primera ejecución
se quedaba reducido a dichos unigramas. Con                          se estaba perdiendo la cobertura de las dis-
esos unigramas se desarrolló un proceso de                          tintas formas verbales, ya que sólo se podı́an
generación de bigramas, cuyos vectores se co-                       reconocer aquellas que en el tweet aparecie-
rresponden con la suma vectorial de los vec-                         ran en infinitivo.
tores de los unigramas que constituyen el bi-                            La segunda configuración (SINAI-
grama. La longitud de los vectores de carac-                         EMMA iSOLLema) tuvo en cuenta esa
terı́sticas de opinión de tanto los unigramas                       peculiaridad de iSOL, y en el caso de que
como de los bigramas es de 11 caracterı́sticas.                      el término a buscar fuera un verbo, se
    Una vez generado el MEV semántico, es                           empleó su lema, es decir su infinitivo. De
momento de generar el modelo de entrena-                             esta manera se consiguió que un mayor
miento. Para ello se eligió el algoritmo SVM                        número de vocablos fueran considerados
con kernel lineal, ya que en experimentacio-                         como portadores de opinión. En la Tabla 1
nes previas ha demostrado su valı́a para la                          se muestran los resultados alcanzados por
tarea de AO sobre tweets. La implementación                         estas dos configuraciones.
que se utilizó fue la de la librerı́a scikit-learn1                     No es difı́cil dar una explicación a la
de Python.                                                           ligera mejorı́a de la configuración SINAI-
                                                                     EMMA iSOLLema, dado que posibilita au-
5       Resultados                                                   mentar la cobertura del lenguaje por parte de
                                                                     iSOL. Por tanto, la configuración que se uti-
Primeramente, se desarrolló una evaluación
                                                                     lizó para la clasificación de los tweets del sub-
con el conjunto de entrenamiento, para eva-
                                                                     corpus de test es SINAI-EMMA iSOLLema.
luar si el esquema descrito anteriormente
                                                                     La Tabla 2 recoge los resultados oficiales ob-
podrı́a tener éxito.
                                                                     tenidos por el sistema, ası́ como el mejor re-
    La evaluación consistió en aplicar un mar-
                                                                     sultado y la media de los resultados del resto
co de trabajo basado en validación cruzada
                                                                     de sistemas presentados.
de 10 particiones (ten fold cross-validation).
Las medidas de evaluación que se utilizaron                             Los resultados evidencian que el sistema
fueron la comunes en tareas de clasificación                        se encuentra en la media de los presentados
de textos, es decir, Precisión, Recall, F1 y Ac-                    en la edición 2015 de TASS, lo cual por un
curacy. La tarea a la que se enfrenta el siste-                      lado es satisfactorio, ya que el estudio que se
ma es la de clasificación en seis niveles de de                     ha iniciado en el ámbito de los MEV semánti-
intensidad de opinión, de manera que el uso                         cos reporta, por ahora, unos resultados simi-
de la definición clásica de Precisión, Recall y                   lares al resto de enfoques que se han presen-
F1 no es correcto, debido principalmente a                           tado, pero por otro, pone de manifiesto que
que el resultado estarı́a sesgado por la cla-                        todavı́a quedan muchos elementos que ana-
se predominante del conjunto de datos que                            lizar para seguir avanzando en la resolución
se está utilizando. Por consiguiente, se deci-                      del problema de la clasificación de la polari-
dió usar sus correspondientes macromedidas                          dad de tweets en español.
(macro-averings).                                                        La organización del taller proporciona
    Se llevaron a cabo dos evaluaciones, que                         también una evaluación con un conjunto re-
se diferencian en la manera de aprovechar la                         ducido de 1000 tweets etiquetados a mano. La
información de opinión que aporta el recur-                        Tabla 3 recoge los resultados obtenidos sobre
so iSOL. En una primera ejecución (SINAI-                           ese conjunto de datos.
EMMA iSOLOriginal), solamente se busca-                                  Como se puede apreciar en la Tabla 3,
ban en iSOL las formas originales de las pa-                         las diferencias entre el sistema presentado y
labras convertidas en minúsculas. Si se com-                        el mejor se acortan, a su vez que el sistema
                                                                     consigue unos resultados superiores a la me-
    1
        http://scikit-learn.org/                                     dia según la Macro-Precisión, el Macro-Recall
                                                               44
                      SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter




             Configuración                    Macro-P        Macro-R        Macro-F1         Accuracy
             SINAI-EMMA iSOLOriginal            36,55 %        36,58 %        35,99 %          40,91 %
             SINAI-EMMA iSOLLema                36,83 %        36,74 %        36,02 %          41,31 %


       Tabla 1: Evaluación del sistema de clasificación con el conjunto de entrenamiento.

                   Configuración       Macro-P        Macro-R        Macro-F1         Accuracy
                   SINAI-EMMA            40,4 %         45,8 %         43,3 %           50,02 %
                   Mejor                 53,1 %         46,5 %         49,6 %            67,3 %
                   Media                 40,9 %         42,2 %         40,9 %            52,7 %


                            Tabla 2: Resultados de la evaluación oficial.

y el Macro-F1. Ésto indica que el sistema                    Bibliografı́a
SINAI-EMMA tiene un comportamiento más                       Agerri, Rodrigo y Ana Garcı́a-Serrano. 2010.
estable que el resto, porque su rendimiento no                  Q-Wordnet: Extracting polarity from
experimenta un variación muy acusada ante                      wordnet senses. En Proceedings of the Se-
la modificación del etiquetado del conjunto                    venth conference on International Langua-
de evaluación, lo cual es un punto positivo en                 ge Resources and Evaluation (LREC’10),
nuestra investigación.                                         Valletta, Malta; ELRA, may. European
                                                                Language Resources Association. 19-21.
6   Conclusiones y trabajo a
    realizar                                                  Atserias, J., L. Villarejo, G. Rigau, E. Agi-
                                                                rre, J. Carroll, B. Magnini, y P. Vossen.
La principal conclusión a la que se ha lle-                    2004. The meaning multilingual central
gado es la idoneidad de la representación                      repository. En GWC 2012 6th Interna-
de la información de opinión mediante un                      tional Global Wordnet Conference. Brno:
MEV semántico. Además, caracterı́sticas de                    Masaryk University.
los unigramas y bigramas se han construido
a partir de recursos lingüı́sticos de opinión.              Baccianella, S., A. Esuli, y F. Sebastia-
Esto es una primera tentativa a la aplicación                  ni. 2010. Sentiwordnet 3.0: An enhan-
de MEV semánticos a la tarea de AO, y los                      ced lexical resource for sentiment analy-
resultados obtenidos nos animan a seguir in-                    sis and opinion mining. En Proceedings
vestigando en esta lı́nea.                                      of the Seventh International Conference
                                                                on Language Resources and Evaluation
    El trabajo futuro va a estar dirigido a me-
                                                                (LREC’10), páginas 2200–2204, Valletta,
jorar el esquema de representación de infor-
                                                                Malta.
mación, ası́ como en aumentar la información
de opinión que representa a cada palabra. Pa-                Bespalov, Dmitriy, Yanjun Qi, Bing Bai, y Ali
ra ello, se va a realizar un estudio del nivel                  Shokoufandeh. 2012. Sentiment classifica-
de cobertura de vocabulario que tiene el es-                    tion with supervised sequence embedding.
quema de representación; se va a tratar de                     En Machine Learning and Knowledge Dis-
introducir información de la distribución de                  covery in Databases, volumen 7523 de Lec-
los unigramas y bigramas en el corpus por                       ture Notes in Computer Science. Springer
medio del uso de la frecuencia de los mismos                    Berlin Heidelberg, páginas 159–174.
en cada documento y en el corpus en general;
                                                              Collobert, Ronan y Jason Weston. 2008.
se va a estudiar la incorporación de un mayor
                                                                A unified architecture for natural langua-
número de recursos de opinión; se va a anali-
                                                                ge processing: Deep neural networks with
zar el aporte para el AO de la incrustación de
                                                                multitask learning. En Proceedings of the
información de coocurrencia de cada unigra-
                                                                25th International Conference on Machi-
ma y bigrama tomando como referencia un
                                                                ne Learning, ICML ’08, páginas 160–167,
corpus representativo del español; y por últi-
                                                                New York, NY, USA. ACM.
mo se va a estudiar la utilización de informa-
ción sintáctica mediante la consideración del              Cruz, F. L., J. A. Troyano, B. Pontes, y F. J.
efecto de la negación y de los intensificadores.               Ortega. 2014. Ml-senticon: Un lexicón
                                                         45
          Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López




                    Configuración         Macro-P        Macro-R        Macro-F1        Accuracy
                    SINAI-EMMA              36,6 %          38,0 %        37,3 %           41,1 %
                    Mejor                   44,1 %          45,9 %        45,0 %           51,6 %
                    Media                   36,3 %         37,28 %        36,68 %         41.35 %


                 Tabla 3: Resultados oficiales sobre el subcorpus de 1000 tweets.

  multilingüe de polaridades semánticas a                          polarity classification in spanish reviews.
  nivel de lemas. Procesamiento del Len-                             Expert Syst. Appl., 40(18):7250–7257.
  guaje Natural, 53(0):113–120.
                                                                 Pang, Bo, Lillian Lee, y Shivakumar Vaith-
Dave, K., S. Lawrence, y D. M. Pennock.                            yanathan. 2002. Thumbs up?: Sentiment
  2003. Mining the peanut gallery: opinion                         classification using machine learning te-
  extraction and semantic classification of                        chniques. En Proceedings of the ACL-02
  product reviews. En Proceedings of the                           Conference on Empirical Methods in Na-
  12th international conference on World                           tural Language Processing, volumen 10 de
  Wide Web, WWW ’03, páginas 519–528,                             EMNLP ’02, páginas 79–86. ACL.
  New York, NY, USA. ACM.
                                                                 Rangel, I. D., G. Sidorov, y S. Suárez-Guerra.
Deerwester, S., S. T. Dumais, G. W. Fur-                           2014. Creación y evaluación de un diccio-
  nas, T. K. Landauer, y R. Harshman.                              nario marcado con emociones y ponderado
  1990. Indexing by latent semantic analy-                         para el español. Onomázein, 1(29):31–46.
  sis. Journal of the American Society for
  Information Science, 41(6):391–407.                            Socher, R., J. Pennington, E. H. Huang, A. Y.
                                                                    Ng, y C. D. Manning. 2011. Semi-
Kouloumpis, Efthymios, Theresa Wilson, y                            supervised recursive autoencoders for pre-
  Johanna Moore. 2011. Twitter sentiment                            dicting sentiment distributions. En Pro-
  analysis: The good the bad and the omg!                           ceedings of the Conference on EMNLP,
Liu, B. 2012. Sentiment analysis and opi-                           EMNLP ’11, páginas 151–161. ACL.
   nion mining. Synthesis Lectures on Hu-                        Tang, Duyu, Furu Wei, Nan Yang, Ming
   man Language Technologies, 5(1):1–167.                          Zhou, Ting Liu, y Bing Qin. 2014. Lear-
Maas, A. L., R. E. Daly, P. T. Pham,                               ning sentiment-specific word embedding
  D. Huang, A. Y. Ng, y C. Potts.                                  for twitter sentiment classification. En
  2011. Learning word vectors for sentiment                        Proceedings of the 52nd Annual Meeting of
  analysis. En Proceedings of the 49th An-                         the ACL, volumen 1, páginas 1555–1565,
  nual Meeting of the ACL: Human Langua-                           Baltimore, Maryland, June. ACL.
  ge Technologies, volumen 1 de HLT ’11,
                                                                 Turian, Joseph, Lev Ratinov, y Yoshua Ben-
  páginas 142–150. ACL.
                                                                   gio. 2010. Word representations: A simple
Manning, Christopher D., Prabhakar Ragha-                          and general method for semi-supervised
  van, y Hinrich Schütze. 2008. Introduc-                         learning. En Proceedings of the 48th An-
  tion to Information Retrieval. Cambridge                         nual Meeting of the ACL, ACL ’10, pági-
  University Press, New York, NY, USA.                             nas 384–394. ACL.
Martı́nez-Cámara, Eugenio, M. Teresa                            Turney, Peter D. y Patrick Pantel. 2010.
  Martı́n-Valdivia, José M. Perea-Ortega, y                       From frequency to meaning: Vector space
  L. Alfonso Ureña-López. 2011. Técnicas                        models of semantics. J. Artif. Int. Res.,
  de clasificación de opiniones aplicadas a                       37(1):141–188, Enero.
  un corpus en español. Procesamiento del
  Lenguaje Natural, 47:163–170.                                  Villena-Román, Julio, Janine Garcı́a-Morera,
                                                                    Miguel A. Garcı́a-Cumbreras, Eugenio
Miller, George A. 1995. Wordnet: A lexi-                            Martı́nez-Cámara, M. Teresa Martı́n-
  cal database for english. Commun. ACM,                            Valdivia, y L. Alfonso Ureña López. 2015.
  38(11):39–41, Noviembre.                                          Overview of tass 2015. En TASS 2015:
Molina-González, M. D., E. Martı́nez-Cáma-                        Workshop on Sentiment Analysis at SE-
  ra, M. T. Martı́n-Valdivia, y J. M. Perea-                        PLN.
  Ortega. 2013. Semantic orientation for
                                                           46