=Paper=
{{Paper
|id=Vol-1397/sinai-emma
|storemode=property
|title=SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter
|pdfUrl=https://ceur-ws.org/Vol-1397/sinai-emma.pdf
|volume=Vol-1397
|dblpUrl=https://dblp.org/rec/conf/sepln/CamaraCML15
}}
==SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter==
TASS 2015, septiembre 2015, pp 41-46 recibido 20-07-15 revisado 24-07-15 aceptado 27-07-15
SINAI-EMMA: Vectores de Palabras para el Análisis de
Opiniones en Twitter∗
SINAI-EMMA: Vectors of words for Sentiment Analysis in Twitter
Eugenio Martı́nez Cámara, Miguel Á. Garcı́a Cumbreras,
M. Teresa Martı́n Valdivia y L. ALfonso Ureña López
Departamento de Informática
Universidad de Jaén, E-23071 - Jaén, España
{emcamara, magc, maite, laurena}@ujaen.es
Resumen: Este artı́culo describe el sistema de clasificación de polaridad desarro-
llado por el equipo SINAI-EMMA para la tarea 1 del workshop TASS 2015. Nuestro
sistema construye vectores de palabras a partir de la información de opinión de 5
recursos lingüı́sticos. Los resultados obtenidos nos animan a seguir estudiando el
aporte de los vectores de palabras a la tarea de Análisis de Opiniones.
Palabras clave: Análisis de Opiniones, Clasificación de la polaridad, recursos léxi-
cos, Espacio Vectorial Semántico
Abstract: In this work, a polarity classification system is developed for the task 1
of workshop TASS 2015 by the SINAI-EMMA team. Our system takes advantage
of 5 linguistic resources for building vectors of words. The results encourage us to
continue studying the contribution of vectors of words to Sentiment Analysis.
Keywords: Sentiment Analysis, Polarity Classification, linguistic resources, Vector
Space Model of Semantics
1 Introducción la matriz de tweets y caracterı́sticas utiliza-
TASS (Taller de Análisis de Sentimientos en mos un sistema de entrenamiento para obte-
la SEPLN) es un workshop satélite del con- ner un modelo léxico, y dicho modelo es el
greso de la SEPLN (Sociedad Española pa- utilizado en la evaluación del subconjunto de
ra el Procesamiento del Lenguaje Natural), test a etiquetar.
que promueve desde 2012 la evaluación expe- El resto del artı́culo está organizado de la
rimental de sistemas de Análisis de Opiniones siguiente forma. La siguiente sección descri-
(AO) sobre tweets escritos en español. be los modelos de n-gramas y otros modelos
Nuestra participación se ha limitado a la del lenguaje aplicados a la detección de po-
tarea 1, denominada sentiment analysis at laridad con tweets, ası́ como trabajos relacio-
global level, que tiene como objetivo la cla- nados. En la Sección 3 se describe el siste-
sificación de la polaridad de un conjunto de ma que hemos desarrollado y en la Sección 4
tweets. La descripción de la tarea se encuen- los experimentos realizados, resultados obte-
tra en el resumen de la edición del año 2015 nidos y análisis de los mismos. Por último, en
de TASS (Villena-Román et al., 2015). El sis- la Sección 5 exponemos las conclusiones y el
tema de este año se centra en la subtarea de trabajo a realizar.
de clasificación en 6 niveles de polaridad (P+,
P, NEU, N, N+, NONE).
2 Trabajos relacionados
La solución que presentamos pasa por ex- El Modelo de Espacio Vectorial (MEV) ha
traer caracterı́sticas léxicas a partir de n- demostrado sobradamente su valı́a para me-
gramas de cada tweet, concretamente unigra- dir la similitud entre documentos, y una
mas y bigramas, siendo estas caracterı́sticas muestra es su exitosa aplicación en los sis-
la polaridad de los n-gramas en distintos re- temas de recuperación de información (Man-
cursos léxicos etiquetados. Una vez obtenida ning, Raghavan, y Schütze, 2008). Por consi-
∗
guiente, cabe preguntarse si es posible apli-
Este trabajo ha sido financiado parcialmente por el car el mismo esquema para medir la simi-
Fondo Europeo de Desarrollo Regional (FEDER), el
proyecto ATTOS del Gobierno de España (TIN2012-
litud existente entre palabras. Esa pregun-
38536-C03-0) y el proyecto AORESCU de la Junta de ta la contestaron afirmativamente Deerwes-
Andalucı́a (P11-TIC-7684 MO). ter et al. (1990) al proponer un MEV en el
Publicado en http://ceur-ws.org/Vol-1397/. CEUR-WS.org es una publicación en serie con ISSN reconocido ISSN 1613-0073
Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López
que cada palabra estaba caracterizada por un través de un MEV a nivel de n-grama, si-
vector, el cual representaba a la palabra en guiendo en este caso, un modelo de autocodi-
función a su coocurrencia con otras. Al igual ficadores recursivos (recursive autoencoders).
que el MEV sobre documentos, el MEV sobre Bespalov et al. (2012) tratan tener en cuenta
palabras también ha reportado buenos resul- en el MEV semántico que diseñan la posición
tados en desambiguación, reconocimiento de de cada n-grama en el documento, dado que
entidades, análisis morfológico (part of speech sostienen que la polaridad de un documento
tagging) y recuperación de información (Tur- depende de la posición en la que se encuen-
ney y Pantel, 2010; Collobert y Weston, 2008; tren los n-gramas. El trabajo (Tang et al.,
Turian, Ratinov, y Bengio, 2010). 2014) es otro ejemplo de representación de n-
En la bibliografı́a relacionada con AO gramas por medio de vectores, tratando los
existen trabajos que postulan que las pala- autores de insertar información de opinión en
bras (unigramas) son más efectivos para re- dichos vectores mediante el uso de tres redes
presentar la información de opinión (Pang, neuronales. A diferencia de los trabajos an-
Lee, y Vaithyanathan, 2002; Martı́nez-Cáma- teriores, el de Tang et al. (2014) se centra en
ra et al., 2011), y otros en los que se pre- la clasificación de la polaridad de tweets.
fiere el uso de n-gramas (Dave, Lawrence, y
Pennock, 2003; Kouloumpis, Wilson, y Moo- 3 Sistema
re, 2011). La orientación de la opinión de un El sistema que se ha desarrollado para la
documento es muy probable que no sea la su- cuarta edición de TASS trata de trasladar
ma de las polaridades de las palabras indivi- el concepto de MEV semántico a la clasi-
duales que lo componen, sino la combinación ficación de la polaridad de tweets en es-
de las expresiones que aparecen en el mis- pañol. En nuestro caso, no se ha preten-
mo. La palabra “bueno” tiene un significado dido representar a cada palabra en función
positivo, pero la expresión “no muy bueno” de su coocurrencia con otras, o teniendo en
transmite un significado negativo. Por tanto, cuenta su posición en el texto, sino por su
en el caso del AO puede que sea más reco- valor de polaridad en varios recursos léxi-
mendable utilizar n-gramas como unidad de cos de opinión: iSOL (Molina-González et
representación de información. al., 2013), SentiWordNet (Baccianella, Esu-
En el presente trabajo tratamos de incrus- li, y Sebastiani, 2010), Q-WordNet (Agerri
tar al MEV tradicional, una representación y Garcı́a-Serrano, 2010), SEL (Rangel, Sido-
vectorial de cada n-grama, dando lugar a un rov, y Suárez-Guerra, 2014) y ML-Senticon
MEV semántico (Turney y Pantel, 2010). Es- (Cruz et al., 2014). Con este esquema de re-
te tipo de modelo tiene una mayor capacidad presentación, lo que se está haciendo es in-
de representación de la información subya- crustar en el MEV los distintos puntos de
cente en la opinión, al combinar diferentes vista que tienen diferentes recursos léxicos de
grados de n-gramas, ası́ como de caracteri- opinión sobre una misma palabra, enrique-
zar cada n-grama por un conjunto de carac- ciendo de esta forma la representación de la
terı́sticas. Éste es el fundamento de los nue- información de opinión que contienen cada
vos métodos que se están desarrollando para una de las palabras.
la clasificación de la polaridad. Uno de los A continuación se van a describir some-
primeros trabajos de este nuevo enfoque es ramente los recursos lingüı́sticos que se han
(Maas et al., 2011), en el que se consigue que utilizado, ası́ como se detallará el proceso de
palabras con un significado similar estén re- generación de los vectores.
presentadas por vectores similares. El proceso
de generación de los vectores es no supervi- 3.1 iSOL
sado, pero para una correcta clasificación de iSOL es una lista de palabras indicadoras de
la polaridad, el método que proponen los au- opinión en español. La lista está formada por
tores requiere de información de opinión, de 8135 palabras, de las cuales 5626 son negati-
manera que tienen que utilizar un corpus con vas y 2509 son positivas.
etiquetas de opinión para conseguir que los Al tratarse de una lista de palabras de opi-
vectores asociados a las palabras representen nión, la única información que aporta es si un
la orientación semántica de la misma. término es positivo o negativo, por lo que pro-
Socher et al. (2011) tratan de representar porciona dos caracterı́sticas binarias al vector
la opinión de un conjunto de documentos a de cada palabra.
42
SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter
3.2 SentiWordNet racterı́sticas binarias de polaridad.
SentiWordNet es un lista de sentidos de opi- 3.5 ML-SentiCon
nión que se construyó siguiendo un enfoque
basado en diccionario (Liu, 2012). El dic- ML-SentiCon es un recurso de opinión a ni-
cionario que se empleó en su desarrollo fue vel de lema. Los 26495 que conforman ML-
WordNet (Miller, 1995). Por tanto, Senti- SentiCon se encuentran estratificados en 8
WordNet asocia a cada sentido (synset) de capas. Cada una de las capas representa un
WordNet tres valores probabilidad de perte- nivel de exactitud de pertenencia a la cla-
nencia a tres niveles de polaridad: Positivo, se positivo o negativo, de manera que existe
Negativo y Neutro. una mayor probabilidad, de que el significa-
Cada palabra puede tener asociada varios do de opinión que transmiten los lemas de la
synsets, por lo que se necesita de una función capa 0 coincida con la clase de opinión que se
de agregación para obtener un valor de pola- le ha asignado que los de la capa 7. Al estar
ridad único para cada uno de los tres niveles los lemas catalogados como positivos o nega-
de opinión. Al igual que Denecke (2008), se tivos, este recurso también genera dos nuevas
empleó como función de agregación la me- caracterı́sticas, pero en lugar de ser binarias,
dia aritmética. Por tanto, se calculó la media su valor se corresponde con la puntuación de
aritmética de cada nivel de polaridad, obte- polaridad que tiene cada lema en el recurso.
niéndose de esta manera 3 caracterı́sticas, ca- En el caso de que el lema sea negativo, su
da una correspondiente a un nivel de polari- puntuación se multiplica por -1.
dad.
4 Clasificación
3.3 Q-WordNet La preparación de la clasificación consistió en
Q-WordNet, al igual que SentiWordNet, el procesamiento adecuado de los tweets para
está basado en WordNet para construir un re- la generación del MEV semántico de unigra-
curso para la tarea de AO. Los autores de Q- mas y bigramas. La preparación comenzó con
WordNet, al contrario que los de SentiWord- la tokenización de los tweets; aplicación de un
Net, consideran la polaridad como una pro- proceso de normalización léxica que consis-
piedad cualitativa, de manera que una pala- tió principalmente en la corrección ortográfi-
bra sólo puede ser positiva o negativa. Por ca de los tokens; lematización y aplicación de
consiguiente, Q-WordNet es un recurso de un análisis morfológico.
opinión que asocia a cada synset de Word- A continuación se construyeron los vecto-
Net el valor Positivo o Negativo. El uso de res de caracterı́sticas asociados a cada uni-
Q-WordNet permite la adición de 2 nuevas grama. En función de la naturaleza de cada
caracterı́sticas al vector asociado a cada pa- recurso, la búsqueda fue distinta. En el ca-
labra. so de iSOL se utilizó como consulta la forma
original de cada unigrama, a excepción de los
3.4 SEL unigramas que se corresponden con verbos,
SEL es una lista de 2036 palabras clasificadas con los que se usó su lema, es decir, el infini-
en 6 estados de ánimo diferentes: alegrı́a, en- tivo del verbo.
fado, miedo, tristeza, sorpresa y disgusto. Las Para SentiWordNet y Q-WordNet la con-
palabras tienen asociado un valor de proba- sulta no fue directa porque ambos son dos re-
bilidad, que los autores llaman PFA, de per- cursos para inglés. Por tanto, se precisó em-
tenencia a una de las 6 categorı́as. plear un recurso que permitiera a partir de
Para su integración en el sistema, se han palabras en español obtener el synset que le
transformado las 6 categorı́as emocionales en corresponde en WordNet. Ese recurso fue la
dos valores de polaridad, de forma que las versión en español de WordNet de Multilin-
categorı́as alegrı́a y sorpresa se han tomado gual Central Repository (MCR) (Atserias et
como positivas, y las clases enfado, miedo, al., 2004). Una vez que se tenı́an de MCR los
tristeza y disgusto como negativas. Además, synsets asociados, se consultaba SentiWord-
se aplicó un filtro a la lista de palabra con Net y Q-WordNet para obtener sus corres-
el fin de sólo utilizar aquellas que tuvieran pondientes valores de polaridad.
un valor de PFA superior a 0,2. Por tanto, SEL y ML-Senticon tuvieron un trata-
tras convertirse SEL a una lista binaria de miento similar, dado que la consulta se reali-
opinión, se pudieraon generar dos nuevas ca- zaba utilizando el lema de cada unigrama.
43
Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López
Antes de continuar con la descripción de prueba el léxico recogido en iSOL se puede
la generación de los bigramas, debe precisarse comprobar que en él se recogen vocablos, y
que únicamente se construyeron los vectores que uno de los puntales de su éxito es que
de los unigramas que al menos estaban reco- incluye las derivaciones de género y número
gidos en uno de los cinco recursos lingüı́sti- propias del español. En cambio, en lo que se
cos que se han considerado en la experimen- refiere a los verbos, no incluye las conjugacio-
tación. Tras la eliminación de los unigramas nes de los mismos, estando sólo presente el in-
que no transmiten opinión, el texto del tweet finitivo. Por tanto, en esta primera ejecución
se quedaba reducido a dichos unigramas. Con se estaba perdiendo la cobertura de las dis-
esos unigramas se desarrolló un proceso de tintas formas verbales, ya que sólo se podı́an
generación de bigramas, cuyos vectores se co- reconocer aquellas que en el tweet aparecie-
rresponden con la suma vectorial de los vec- ran en infinitivo.
tores de los unigramas que constituyen el bi- La segunda configuración (SINAI-
grama. La longitud de los vectores de carac- EMMA iSOLLema) tuvo en cuenta esa
terı́sticas de opinión de tanto los unigramas peculiaridad de iSOL, y en el caso de que
como de los bigramas es de 11 caracterı́sticas. el término a buscar fuera un verbo, se
Una vez generado el MEV semántico, es empleó su lema, es decir su infinitivo. De
momento de generar el modelo de entrena- esta manera se consiguió que un mayor
miento. Para ello se eligió el algoritmo SVM número de vocablos fueran considerados
con kernel lineal, ya que en experimentacio- como portadores de opinión. En la Tabla 1
nes previas ha demostrado su valı́a para la se muestran los resultados alcanzados por
tarea de AO sobre tweets. La implementación estas dos configuraciones.
que se utilizó fue la de la librerı́a scikit-learn1 No es difı́cil dar una explicación a la
de Python. ligera mejorı́a de la configuración SINAI-
EMMA iSOLLema, dado que posibilita au-
5 Resultados mentar la cobertura del lenguaje por parte de
iSOL. Por tanto, la configuración que se uti-
Primeramente, se desarrolló una evaluación
lizó para la clasificación de los tweets del sub-
con el conjunto de entrenamiento, para eva-
corpus de test es SINAI-EMMA iSOLLema.
luar si el esquema descrito anteriormente
La Tabla 2 recoge los resultados oficiales ob-
podrı́a tener éxito.
tenidos por el sistema, ası́ como el mejor re-
La evaluación consistió en aplicar un mar-
sultado y la media de los resultados del resto
co de trabajo basado en validación cruzada
de sistemas presentados.
de 10 particiones (ten fold cross-validation).
Las medidas de evaluación que se utilizaron Los resultados evidencian que el sistema
fueron la comunes en tareas de clasificación se encuentra en la media de los presentados
de textos, es decir, Precisión, Recall, F1 y Ac- en la edición 2015 de TASS, lo cual por un
curacy. La tarea a la que se enfrenta el siste- lado es satisfactorio, ya que el estudio que se
ma es la de clasificación en seis niveles de de ha iniciado en el ámbito de los MEV semánti-
intensidad de opinión, de manera que el uso cos reporta, por ahora, unos resultados simi-
de la definición clásica de Precisión, Recall y lares al resto de enfoques que se han presen-
F1 no es correcto, debido principalmente a tado, pero por otro, pone de manifiesto que
que el resultado estarı́a sesgado por la cla- todavı́a quedan muchos elementos que ana-
se predominante del conjunto de datos que lizar para seguir avanzando en la resolución
se está utilizando. Por consiguiente, se deci- del problema de la clasificación de la polari-
dió usar sus correspondientes macromedidas dad de tweets en español.
(macro-averings). La organización del taller proporciona
Se llevaron a cabo dos evaluaciones, que también una evaluación con un conjunto re-
se diferencian en la manera de aprovechar la ducido de 1000 tweets etiquetados a mano. La
información de opinión que aporta el recur- Tabla 3 recoge los resultados obtenidos sobre
so iSOL. En una primera ejecución (SINAI- ese conjunto de datos.
EMMA iSOLOriginal), solamente se busca- Como se puede apreciar en la Tabla 3,
ban en iSOL las formas originales de las pa- las diferencias entre el sistema presentado y
labras convertidas en minúsculas. Si se com- el mejor se acortan, a su vez que el sistema
consigue unos resultados superiores a la me-
1
http://scikit-learn.org/ dia según la Macro-Precisión, el Macro-Recall
44
SINAI-EMMA: Vectores de Palabras para el Análisis de Opiniones en Twitter
Configuración Macro-P Macro-R Macro-F1 Accuracy
SINAI-EMMA iSOLOriginal 36,55 % 36,58 % 35,99 % 40,91 %
SINAI-EMMA iSOLLema 36,83 % 36,74 % 36,02 % 41,31 %
Tabla 1: Evaluación del sistema de clasificación con el conjunto de entrenamiento.
Configuración Macro-P Macro-R Macro-F1 Accuracy
SINAI-EMMA 40,4 % 45,8 % 43,3 % 50,02 %
Mejor 53,1 % 46,5 % 49,6 % 67,3 %
Media 40,9 % 42,2 % 40,9 % 52,7 %
Tabla 2: Resultados de la evaluación oficial.
y el Macro-F1. Ésto indica que el sistema Bibliografı́a
SINAI-EMMA tiene un comportamiento más Agerri, Rodrigo y Ana Garcı́a-Serrano. 2010.
estable que el resto, porque su rendimiento no Q-Wordnet: Extracting polarity from
experimenta un variación muy acusada ante wordnet senses. En Proceedings of the Se-
la modificación del etiquetado del conjunto venth conference on International Langua-
de evaluación, lo cual es un punto positivo en ge Resources and Evaluation (LREC’10),
nuestra investigación. Valletta, Malta; ELRA, may. European
Language Resources Association. 19-21.
6 Conclusiones y trabajo a
realizar Atserias, J., L. Villarejo, G. Rigau, E. Agi-
rre, J. Carroll, B. Magnini, y P. Vossen.
La principal conclusión a la que se ha lle- 2004. The meaning multilingual central
gado es la idoneidad de la representación repository. En GWC 2012 6th Interna-
de la información de opinión mediante un tional Global Wordnet Conference. Brno:
MEV semántico. Además, caracterı́sticas de Masaryk University.
los unigramas y bigramas se han construido
a partir de recursos lingüı́sticos de opinión. Baccianella, S., A. Esuli, y F. Sebastia-
Esto es una primera tentativa a la aplicación ni. 2010. Sentiwordnet 3.0: An enhan-
de MEV semánticos a la tarea de AO, y los ced lexical resource for sentiment analy-
resultados obtenidos nos animan a seguir in- sis and opinion mining. En Proceedings
vestigando en esta lı́nea. of the Seventh International Conference
on Language Resources and Evaluation
El trabajo futuro va a estar dirigido a me-
(LREC’10), páginas 2200–2204, Valletta,
jorar el esquema de representación de infor-
Malta.
mación, ası́ como en aumentar la información
de opinión que representa a cada palabra. Pa- Bespalov, Dmitriy, Yanjun Qi, Bing Bai, y Ali
ra ello, se va a realizar un estudio del nivel Shokoufandeh. 2012. Sentiment classifica-
de cobertura de vocabulario que tiene el es- tion with supervised sequence embedding.
quema de representación; se va a tratar de En Machine Learning and Knowledge Dis-
introducir información de la distribución de covery in Databases, volumen 7523 de Lec-
los unigramas y bigramas en el corpus por ture Notes in Computer Science. Springer
medio del uso de la frecuencia de los mismos Berlin Heidelberg, páginas 159–174.
en cada documento y en el corpus en general;
Collobert, Ronan y Jason Weston. 2008.
se va a estudiar la incorporación de un mayor
A unified architecture for natural langua-
número de recursos de opinión; se va a anali-
ge processing: Deep neural networks with
zar el aporte para el AO de la incrustación de
multitask learning. En Proceedings of the
información de coocurrencia de cada unigra-
25th International Conference on Machi-
ma y bigrama tomando como referencia un
ne Learning, ICML ’08, páginas 160–167,
corpus representativo del español; y por últi-
New York, NY, USA. ACM.
mo se va a estudiar la utilización de informa-
ción sintáctica mediante la consideración del Cruz, F. L., J. A. Troyano, B. Pontes, y F. J.
efecto de la negación y de los intensificadores. Ortega. 2014. Ml-senticon: Un lexicón
45
Eugenio Martínez Cámara, Miguel Á. García Cumbreras, M. Teresa Martín Valdivia, L. Alfonso Ureña López
Configuración Macro-P Macro-R Macro-F1 Accuracy
SINAI-EMMA 36,6 % 38,0 % 37,3 % 41,1 %
Mejor 44,1 % 45,9 % 45,0 % 51,6 %
Media 36,3 % 37,28 % 36,68 % 41.35 %
Tabla 3: Resultados oficiales sobre el subcorpus de 1000 tweets.
multilingüe de polaridades semánticas a polarity classification in spanish reviews.
nivel de lemas. Procesamiento del Len- Expert Syst. Appl., 40(18):7250–7257.
guaje Natural, 53(0):113–120.
Pang, Bo, Lillian Lee, y Shivakumar Vaith-
Dave, K., S. Lawrence, y D. M. Pennock. yanathan. 2002. Thumbs up?: Sentiment
2003. Mining the peanut gallery: opinion classification using machine learning te-
extraction and semantic classification of chniques. En Proceedings of the ACL-02
product reviews. En Proceedings of the Conference on Empirical Methods in Na-
12th international conference on World tural Language Processing, volumen 10 de
Wide Web, WWW ’03, páginas 519–528, EMNLP ’02, páginas 79–86. ACL.
New York, NY, USA. ACM.
Rangel, I. D., G. Sidorov, y S. Suárez-Guerra.
Deerwester, S., S. T. Dumais, G. W. Fur- 2014. Creación y evaluación de un diccio-
nas, T. K. Landauer, y R. Harshman. nario marcado con emociones y ponderado
1990. Indexing by latent semantic analy- para el español. Onomázein, 1(29):31–46.
sis. Journal of the American Society for
Information Science, 41(6):391–407. Socher, R., J. Pennington, E. H. Huang, A. Y.
Ng, y C. D. Manning. 2011. Semi-
Kouloumpis, Efthymios, Theresa Wilson, y supervised recursive autoencoders for pre-
Johanna Moore. 2011. Twitter sentiment dicting sentiment distributions. En Pro-
analysis: The good the bad and the omg! ceedings of the Conference on EMNLP,
Liu, B. 2012. Sentiment analysis and opi- EMNLP ’11, páginas 151–161. ACL.
nion mining. Synthesis Lectures on Hu- Tang, Duyu, Furu Wei, Nan Yang, Ming
man Language Technologies, 5(1):1–167. Zhou, Ting Liu, y Bing Qin. 2014. Lear-
Maas, A. L., R. E. Daly, P. T. Pham, ning sentiment-specific word embedding
D. Huang, A. Y. Ng, y C. Potts. for twitter sentiment classification. En
2011. Learning word vectors for sentiment Proceedings of the 52nd Annual Meeting of
analysis. En Proceedings of the 49th An- the ACL, volumen 1, páginas 1555–1565,
nual Meeting of the ACL: Human Langua- Baltimore, Maryland, June. ACL.
ge Technologies, volumen 1 de HLT ’11,
Turian, Joseph, Lev Ratinov, y Yoshua Ben-
páginas 142–150. ACL.
gio. 2010. Word representations: A simple
Manning, Christopher D., Prabhakar Ragha- and general method for semi-supervised
van, y Hinrich Schütze. 2008. Introduc- learning. En Proceedings of the 48th An-
tion to Information Retrieval. Cambridge nual Meeting of the ACL, ACL ’10, pági-
University Press, New York, NY, USA. nas 384–394. ACL.
Martı́nez-Cámara, Eugenio, M. Teresa Turney, Peter D. y Patrick Pantel. 2010.
Martı́n-Valdivia, José M. Perea-Ortega, y From frequency to meaning: Vector space
L. Alfonso Ureña-López. 2011. Técnicas models of semantics. J. Artif. Int. Res.,
de clasificación de opiniones aplicadas a 37(1):141–188, Enero.
un corpus en español. Procesamiento del
Lenguaje Natural, 47:163–170. Villena-Román, Julio, Janine Garcı́a-Morera,
Miguel A. Garcı́a-Cumbreras, Eugenio
Miller, George A. 1995. Wordnet: A lexi- Martı́nez-Cámara, M. Teresa Martı́n-
cal database for english. Commun. ACM, Valdivia, y L. Alfonso Ureña López. 2015.
38(11):39–41, Noviembre. Overview of tass 2015. En TASS 2015:
Molina-González, M. D., E. Martı́nez-Cáma- Workshop on Sentiment Analysis at SE-
ra, M. T. Martı́n-Valdivia, y J. M. Perea- PLN.
Ortega. 2013. Semantic orientation for
46