<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Analisis de sentimientos multilingue en la Web 2.0</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Javi Fernandez</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jose M. Gomez</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Patricio Mart nez-Barco</string-name>
          <email>patriciog@dlsi.ua.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Universidad of Alicante</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Departamento de Lenguajes y Sistemas Informaticos</institution>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>In: L. Alfonso Uren~a Lopez, Jose Antonio Troyano Jimenez, Francisco Javier Ortega Rodr guez, Eugenio Mart nez Camara (eds.): Actas de las V Jornadas TIMM</institution>
          ,
          <addr-line>Cazalla de la Sierra, Espan~a, 12-JUN-2014, publicadas en</addr-line>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2009</year>
      </pub-date>
      <fpage>19</fpage>
      <lpage>21</lpage>
      <abstract>
        <p>La creacion de la Web 2.0 ha permitido que los usuarios tengan una participacion mucho mas activa en Internet, creando no solo nuevos contenidos, sino tambien a traves de sus comentarios y opiniones. Es por eso por lo que podemos encontrar una gran cantidad de informacion subjetiva sobre un extenso rango de temas. Esta informacion puede ser muy valiosa tanto para personas como para empresas y organizaciones publicas. Ya que esta informacion es textual, es muy complicado extraerla y explotarla de la manera adecuada, por lo que se hace necesaria la utilizacion de tecnicas de procesamiento del lenguaje natural (PLN). En el caso de la informacion subjetiva, la rama de analisis de sentimientos (AS) se encarga de detectar cuando un texto es positivo o negativo, basandose unicamente en las palabras de ese texto. La tarea del AS se complica cuando se aplica a la Web 2.0, ya que nos encontramos con nuevos problemas como la informalidad o la existencia de nuevos generos textuales (como los blogs, los foros, los microblogs y las redes sociales), lo que hace necesario actualizar las tecnicas de PLN existentes. El objetivo de esta tesis es el de disen~ar nuevas tecnicas de AS para mejorar los sistemas actuales. Entre las novedades de esta propuesta cabe destacar el tratamiento de la exibilidad y secuencialidad del lenguaje humano y la adaptacion a diferentes idiomas.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>Resumen</title>
      <p>Nuestra propuesta consiste en un sistema de analisis de sentimientos
h brido, que consiste una aproximacion h brida, ya que utiliza un lexico
de palabras etiquetadas segun su polaridad, ademas de aprendizaje
automatico. El lexico se genera de manera automatica a partir de un
corpus etiquetado, y se asigna a cada termino del texto una puntuacion
para cada polaridad. El aprendizaje automatico se encarga de combinar
las puntuaciones de cada termino del texto para decidir la polaridad
de ese texto. En nuestro trabajo nos centraremos en la eleccion de los
terminos, en la forma de puntuarlos, y en la forma de combinarlos para
determinar la polaridad de un texto.</p>
    </sec>
    <sec id="sec-2">
      <title>Introduccion</title>
      <p>Javi Fernández, José M. Gómez y Patricio Martínez-Barco
asigna una puntuacion para cada palabra y para cada polaridad, indicando como de estrecha es la relacion
entre esa palabra y esa polaridad. La manera mas comun de clasi car un texto utilizando estas puntuaciones
es acumular los pesos de cada palabra, sumando los valores positivos y restando los negativos. Si la puntuacion
nal es positiva, el texto se clasi ca como positivo, y si es negativa, se clasi ca como negativo. Los diccionarios
pueden crearse manualmente [SDS66] o automaticamente [Tur02]. Algunos ejemplos de lexicos son WordNet
A ect [SV04], SentiWordNet [ES06] o JRC Tonality [BSG+09]. Sin embargo, es dif cil recopilar y mantener
un lexico universal, ya que una misma palabra en diferentes dominios puede expresar diferentes opiniones.
[Tur02, QLBC09].</p>
      <p>La segunda aproximacion utiliza tecnicas de aprendizaje automatico. Estas tecnicas requieren la utilizacion
de un corpus que contenga textos clasi cados, para crear un clasi cador capaz de clasi car nuevos textos. La
mayor a de trabajos emplean Maquinas de soporte vectorial [MC04, PTS09, WHS+05] o Nave Bayes [PL04,
WWC05, TCWX09] porque suelen obtener los mejores resultados. En esta aproximacion, los textos se representan
como vectores de caracter sticas y, dependiendo de las caracter sticas utilizadas, los sistemas pueden obtener
mejores resultados (lo mas comun es utilizar bolsa de palabras o caracter sticas basadas lexemas [PL08]). Estos
clasi cadores funcionan muy bien en el dominio en el que han sido entrenados pero empeoran cuando se utilizan
en un dominio diferente [PL08, TCWX09].</p>
    </sec>
    <sec id="sec-3">
      <title>Propuesta</title>
      <p>Nuestra propuesta consiste en una aproximacion h brida, ya que utiliza un lexico y aprendizaje automatico.
El lexico se genera de manera automatica a partir de un corpus etiquetado, y se asigna a cada termino del texto
una puntuacion para cada polaridad. El aprendizaje automatico se encarga de combinar las puntuaciones de
cada termino del texto para decidir la polaridad de ese texto. En nuestro trabajo nos centraremos en la eleccion
de los terminos, en la forma de puntuarlos, y en la forma de combinarlos para diferenciar la polaridad del texto.</p>
      <p>Los terminos utilizados son palabras, n-gramas y skipgrams. La utilizacion de skipgrams es muy comun en el
campo del procesamiento del habla. Esta tecnica consiste en obtener n-gramas a partir de las palabras del texto,
pero permitir que algunos terminos puedan ser saltados. Mas especi camente, en un k-skip-n-gram, n determina
el numero de terminos, y k el maximo numero de terminos que se pueden saltar. De esta forma los skipgrams
son nuevos terminos que conservan parte de la secuencialidad de los terminos originales, pero de una forma mas
exible que los n-gramas. Cabe destacar que un n-grama se puede de nir como un skipgram donde k = 0.</p>
      <p>Las puntuaciones de los terminos (palabras, n-gramas y skipgrams) para cada polaridad se obtienen teniendo
en cuenta diferentes factores: (i) el numero de veces que aparece el termino en todos los textos del corpus; (ii) el
numero de veces que aparece el termino en los textos del corpus de cada polaridad; (iii ) en el caso de los n-gramas
y skipgrams, el numero de palabras que contiene el termino; y(iv) en el caso de los skipgrams, el numero de
saltos que se ha realizado.</p>
      <p>La combinacion de los pesos de los terminos para obtener la polaridad del texto se realiza mediante aprendizaje
automatico, donde cada polaridad se considera como una categor a y cada texto del corpus como un ejemplo de
aprendizaje. Hemos seguido dos estrategias diferentes para elegir las caracter sticas del algoritmo de aprendizaje
automatico. La primera esta basada en clasi cacion de textos, ya que son los propios terminos los que se utilizan
como caracter sticas del modelo de aprendizaje, cuyo peso se corresponde con la puntuacion del termino al que
representan. La segunda estrategia realiza la suma de los pesos de los terminos para cada polaridad, y cada una
de esas sumas seran las caracter sticas del modelo de aprendizaje automatico.
3.0.1.</p>
      <p>Agradecimientos</p>
      <p>Este trabajo de investigacion ha sido parcialmente nanciado por la Universidad de Alicante, la Generalitat
Valenciana, el Gobierno Espan~ol y la Comision Europea a traves de los proyectos ((Tratamiento inteligente
de la informacion para la ayuda a la toma de decisiones)) (GRE12-44), ATTOS (TIN2012- 38536-C03-03),
LEGOLANG (TIN2012-31224), SAM (FP7-611312), FIRST (FP7-287607) y ACOMP/2013/067
[AK08]</p>
      <p>Michelle Annett and Grzegorz Kondrak. A Comparison of Sentiment Analysis Techniques: Polarizing
Movie Blogs. In Proceedings of the 21st Canadian Conference on Arti cial Intelligence (CCAI 2008),
pages 25{35, 2008.</p>
      <p>Maral Dadvar, Claudia Hau , and FMG De Jong. Scope of negation detection in sentiment analysis.
In Proceedings of the Dutch-Belgian Information Retrieval Workshop (DIR 2011), pages 16{20, 2011.
Andrea Esuli and Fabrizio Sebastiani. Sentiwordnet: A publicly available lexical resource for opinion
mining. In Proceedings of LREC, volume 6, pages 417{422, 2006.</p>
      <p>Bing Liu. Sentiment Analysis and Subjectivity. In Handbook of Natural Language Processing, pages
1{38. 2010.</p>
      <p>
        Tony Mullen and Nigel Collier. Sentiment Analysis using Support Vector Machines with Diverse
Information Sources.
        <xref ref-type="bibr" rid="ref3">In Proceedings of the 2004</xref>
        Conference on Empirical Methods in Natural Language
Process
        <xref ref-type="bibr" rid="ref3">ing (EMNLP 2004</xref>
        ), pages 412{418, 2004.
      </p>
      <p>
        Bo Pang and Lillian Lee. A Sentimental Education: Sentiment Analysis Using Subjectivity
Summarization Based on Minimum Cuts. In Proceedings of the 42nd annual meeting on Association for
Computational L
        <xref ref-type="bibr" rid="ref3">inguistics (ACL 2004</xref>
        ), page 271, 2004.
      </p>
      <p>Bo Pang and Lillian Lee. Opinion Mining and Sentiment Analysis. Foundations and Trends in
Information Retrieval, 2(1{2):1{135, 2008.</p>
      <p>Rudy Prabowo, Mike Thelwall, and Wulfruna Street. Sentiment Analysis: A Combined Approach.</p>
      <p>Journal of Informetrics, 3:143{157, 2009.</p>
      <p>Peter D. Turney. Thumbs Up or Thumbs Down? Semantic Orientation Applied to Unsupervised
Classi cation of Reviews. In Proceedings of the 40th Annual Meeting of the Association for
Computational Linguistics (ACL 2002), pages 417{424, 2002.
[WWC05] Janyce Wiebe, Theresa Wilson, and Claire Cardie. Annotating expressions of opinions and emotions
in language. Language resources and evaluation, 39(2-3):165{210, 2005.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [QLBC09]
          <string-name>
            <given-names>Guang</given-names>
            <surname>Qiu</surname>
          </string-name>
          , Bing Liu, Jiajun Bu, and
          <string-name>
            <given-names>Chun</given-names>
            <surname>Chen</surname>
          </string-name>
          .
          <article-title>Expanding Domain Sentiment Lexicon through Double Propagation</article-title>
          .
          <source>In Proceedings of the 21st international Joint Conference on Arti cial Intelligence (IJCAI</source>
          <year>2009</year>
          ), pages
          <fpage>1199</fpage>
          {
          <fpage>1204</fpage>
          ,
          <year>2009</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Philip J. Stone</surname>
          </string-name>
          ,
          <string-name>
            <surname>Dexter C. Dunphy</surname>
          </string-name>
          , and
          <string-name>
            <surname>Marshall</surname>
            <given-names>S.</given-names>
          </string-name>
          <string-name>
            <surname>Smith. The General</surname>
          </string-name>
          <article-title>Inquirer: A Computer Approach to Content Analysis</article-title>
          .
          <year>1966</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>In</surname>
            <given-names>LREC</given-names>
          </string-name>
          , volume
          <volume>4</volume>
          , pages
          <fpage>1083</fpage>
          {
          <fpage>1086</fpage>
          ,
          <year>2004</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [TBT+11]
          <string-name>
            <surname>Maite</surname>
            <given-names>Taboada</given-names>
          </string-name>
          , Julian Brooke, Milan To loski, Kimberly Voll, and
          <string-name>
            <given-names>Manfred</given-names>
            <surname>Stede</surname>
          </string-name>
          .
          <article-title>Lexicon-based methods for sentiment analysis</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>37</volume>
          (
          <issue>2</issue>
          ):
          <volume>267</volume>
          {
          <fpage>307</fpage>
          ,
          <year>2011</year>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>