<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Introduccion a la tarea compartida Tweet-Norm 2013: Normalizacion lexica de tuits en espan~ol</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>In~aki Alegria</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Nora Aranberri</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>V ctor Fresno</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Pablo Gamallo</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Lluis Padro</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>In~aki San Vicente</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jordi Turmo</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Arkaitz Zubiaga</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>(1) IXA. UPV/EHU (2) UNED (3) USC (4) UPC (5) Elhuyar (6) City University of New York</institution>
          ,
          <country country="US">USA</country>
        </aff>
      </contrib-group>
      <fpage>2</fpage>
      <lpage>10</lpage>
      <abstract>
        <p>An overview of the shared task is presented: description, corpora, annotation, preprocess, participant systems and results.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        En la actualidad, la normalizacion
lingu stica de tuits
        <xref ref-type="bibr" rid="ref7">(Han y Baldwin, 2011)</xref>
        supone una tarea de gran interes en diversos
campos como, por ejemplo, la traduccion
automatica y el analisis de sentimiento,
dentro del procesamiento del lenguaje natural.
La normalizacion de SMS y tuits en ingles
ha generado gran interes recientemente; sin
embargo, la normalizacion de este tipo de
textos en espan~ol se ha estudiado poco.
      </p>
      <p>Partiendo de esta carencia como base,
varios grupos de investigacion participantes en
diversos proyectos hemos visto la necesidad
de fomentar la investigacion en este area, con
el n de facilitar y mejorar los resultados
obtenidos con tareas subsiguientes. As ,
organizamos un taller para llevar a cabo una tarea
compartida de Normalizacion lexica de tuits
en espan~ol, el cual es parte del programa de
la conferencia SEPLN 2013 en Madrid. A su
vez, este taller puede ser visto como
complemento del Taller de Analisis de Sentimientos
en la SEPLN (TASS)1 organizado en 2012 y
2013.</p>
      <p>Esta tarea ha conllevado un reto cient
co importante, y creemos que la competicion
entre los grupos de investigacion ha creado
un marco ideal para proporcionar un banco
de pruebas de referencia, con el que se ha
impulsado la aplicacion de tecnicas y
algoritmos propuestos recientemente, y estudiar su
mejora o adaptacion. As , los grupos
participantes han podido evaluar y comparar
metodos, algoritmos y recursos lingu sticos de los
que disponen. En este art culo vamos a hacer
un repaso de las caracter sticas de la tarea,
los corpus usados, el etiquetado del mismo
y la forma de evaluacion, as como un
resumen de los sistemas que se han presentado a
la evaluacion. Detalles adicionales pueden ser
consultados en la web o cial2 y en el resto de
art culos del workshop.
2.</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajos relacionados</title>
      <p>
        Una buena introduccion al tema de
normalizacion de tuits es el art culo
        <xref ref-type="bibr" rid="ref4">(Eisenstein,
2013)</xref>
        , donde se revisa el estado del arte en
NLP sobre variantes SMS y tuit, y como la
comunidad cienti ca ha respondido por dos
caminos: normalizacion y adaptacion de
herramientas.
      </p>
      <p>
        Como se ha dicho, el art culo
        <xref ref-type="bibr" rid="ref7">(Han y
Baldwin, 2011)</xref>
        es una referencia importante en
el campo de la normalizacion. Para el ingles
ellos estudian un corpus de 449 tuits en el
que identi can 254 tokens a ser
normalizados. Para detectar las palabras fuera de
diccionario (OOV) usan GNU aspell y, como
2http://komunitatea.elhuyar.org/tweet-norm/
en nuestro caso, las identi caciones de tuits
(@usuarios), los hashtags o etiquetas
(#etiqueta) y los URLs son excluidos. Estudian
la distribucion de las formas a normalizar y
proponen un sistema basado en 3 pasos: (1)
generacion del conjunto de confusion, donde
para una palabra OOV generan los posibles
candidatos; (2) identi cacion de las palabras
a normalizar usando un clasi cador,
distinguiendolas de las que deben permanecer
inalteradas; (3) seleccion de candidatos. Evaluan
los resultados comparandolos con los modelos
noisy-channel y SMT obteniendo una
precision de alrededor del 75 %.
      </p>
      <p>
        Sobre adaptacion de herramientas es
interesante el trabajo
        <xref ref-type="bibr" rid="ref10">(Liu et al., 2011)</xref>
        que
replantea el tema de reconocimiento de
entidades nombradas en corpus de tuits. Para el
espan~ol se ha prestado atencion al analisis de
sentimiento
        <xref ref-type="bibr" rid="ref21">(Villena Roman et al., 2013)</xref>
        en
el marco del citado taller TASS pero apenas
se ha publicado nada sobre normalizacion.
Existen otros trabajos relacionados con
normalizacion
        <xref ref-type="bibr" rid="ref11 ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref6 ref8 ref9">(Gomez-Hidalgo, Caurcel-D az, y
del Rio, 2013)</xref>
        <xref ref-type="bibr" rid="ref12 ref16">(Mosquera, Lloret, y Moreda,
2012)</xref>
        <xref ref-type="bibr" rid="ref15">(Oliva et al., 2011)</xref>
        principalmente
sobre mensajes SMS, pero que no abordan la
normalizacion de tuits en su conjunto.
3.
      </p>
    </sec>
    <sec id="sec-3">
      <title>Descripcion y caracter sticas de la tarea</title>
      <p>
        Hemos elegido el termino normalizacion
lexica porque la tarea se centra en
normalizar palabras detectadas como no conocidas
(abreviaturas, formas no normalizadas,
palabras con letras repetidas...); intentando, en
la medida de lo posible, aislar este problema
de otros fenomenos como variantes
sintacticas, de estilo etc. Por lo tanto, y en la misma
l nea que
        <xref ref-type="bibr" rid="ref7">(Han y Baldwin, 2011)</xref>
        , solo seran
tratadas las palabras que en el preproceso se
consideran OOV. Ademas, estas palabras se
evaluaran individualmente. Los sistemas
deben decidir si proponen normalizarlas o
mantenerlas como estan, ya que pueden ser
palabras que no se deben normalizar por ser
palabras correctas (nuevas entidades
nombradas, por ejemplo), escritas en otro idioma,
etc. Desde la organizacion del taller se
decidio anotar un conjunto de 600 tuits para
distribuirlo anotado entre los participantes
(para la adaptacion y ajuste de sus sistemas), y
otros 600, que se han mantenido en secreto,
para la evaluacion de los sistemas (ver seccion
5).
3.1.
      </p>
      <sec id="sec-3-1">
        <title>Coleccion de documentos</title>
        <p>Entre las multiples opciones que ofrece
la API de Twitter3, se opto por descargar
tuits geolocalizados, los cuales vienen
marcados con las coordenadas desde donde cada
tuit ha sido enviado. La API de Twitter, a
su vez, permite descargar tuits para la
zona geogra ca especi cada. Aprovechando
esta caracter stica, optamos por una zona
amplia dentro de la pen nsula iberica,
evitando incluir zonas con lenguas coo ciales, para
as aumentar la posibilidad de que un gran
numero de los tuits estuvieran escritos en
espan~ol. As , el area escogida abarca,
aproximadamente, el rectangulo comprendido
entre Guadalajara como extremo al noreste, y
Cadiz como extremo al sudoeste. Tras
almacenar los tuits geolocalizados enviados
desde esa zona durante los d as 1 y 2 de abril
de 2013, obtuvimos una coleccion de un total
de 227.855 tuits. A partir de esta gran
coleccion, generamos dos subconjuntos aleatorios
de 600 tuits, los cuales fueron distribuidos a
los participantes, el primero como conjunto
de entrenamiento, y el segundo como
conjunto de test para la evaluacion nal. Los tuits
restantes fueron distribuidos a los
participantes, sin anotaciones manuales, por si
consideraban conveniente hacer uso de el.
3.2.</p>
      </sec>
      <sec id="sec-3-2">
        <title>Preproceso</title>
        <p>
          Se decidio distinguir dentro de los tuits las
palabras fuera del diccionario (OOV) usando
el analizador morfologico de la librer a
FreeLing
          <xref ref-type="bibr" rid="ref12 ref16">(Padro y Stanilovsky, 2012)</xref>
          . Se analizan
los tweets con los modulos basicos
(diccionario, su jos, detector de numeros, fechas, etc.)
y si la palabra no es reconocida por ninguno
de ellos, se considera OOV.
        </p>
        <p>Para ello, se uso una version adaptada del
tokenizador, de forma que mantuviera como
un solo token las palabras del tipo @usuario
y #etiqueta, as como las direcciones de
email, URLs, y los smileys mas frecuentes.
Igualmente, se activo una instancia del
modulo usermap, que aplica una bater a de
expresiones regulares a cada token, y asigna un
analisis a los que cumplen alguna de ellas. De
este modo, se descartan como OOVs dichos
patrones, ya que obtienen un analisis.</p>
        <p>A continuacion, se aplico un analizador
morfologico basico, con los modulos por
defecto, excepto el reconocedor de
multipala3https://dev.twitter.com/docs/api
bras (para evitar aglutinacion de varias
palabras en un solo token), el reconocedor de
entidades con nombre (dado que queremos
mantenerlas como OOV), y el modulo de
probabilidades lexicas (dado que aplica un guesser
que asignar a al menos una etiqueta a todas
las palabras).</p>
        <p>Al nal de este preproceso, las palabras
que no han recibido ningun analisis de ningun
modulo del morfologico se consideran OOVs.
4.</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Proceso de anotacion</title>
      <p>Durante la fase de anotacion, se procedio a
la anotacion manual de las palabras identi
cadas por FreeLing como palabras OOV.
Cada OOV pod a ser etiquetada como correcta,
variante o NoES (otro idioma) y en el
segundo caso hab a que asignarle su forma
normalizada. En el corpus de desarrollo tres expertos
etiquetaron independientemente cada OOV y
posteriormente se consensuaron las
anotaciones de nitivas. Durante este proceso se fue
completando un manual. El corpus de test
fue etiquetado independientemente por dos
expertos que consensuaros posteriormente la
anotacion nal.</p>
      <p>Los criterios de anotacion por los cuales
se rigio el grupo de anotadores se recogieron
en el Manual de anotacion y se resumen de
la siguiente manera:
Palabra incluida en diccionario RAE</p>
      <p>En todo caso se anotara como correcta sin
modi cacion alguna, aunque por su contexto
se dedujera que dicha palabra no es la
adecuada.</p>
      <sec id="sec-4-1">
        <title>Palabra con categor a de nombre propio no incluida en diccionario RAE</title>
        <p>Si es un acronimo originalmente
compuesto, todo con mayuscula o con alguna
letra en minuscula, tanto la forma
originaria como su forma totalmente en mayusculas
seran etiquetadas como correctas sin ninguna
modi cacion (p.e., CoNLL, CONLL, IBM e
I.B.M.).</p>
        <p>Si no es un acronimo, esta formado por
las letras requeridas y su inicial esta en
mayusculas e incorpora los acentos
requeridos, sera etiquetada como correcta, ya sea
un nombre propio en diminutivo, un apodo
u otra forma alternativa de la entidad (p.e.,
Tony, Anita, Yoyas)</p>
        <p>Si se expresa con alguna falta de ortograf a
o con alguna alteracion no aceptada en los
puntos anteriores, se anotara como
variante y se especi cara su forma correcta, segun
se de ne con dichas reglas. (p.e., sanchez !
Sanchez, tamagochi ! Tamagotchi, abc !
ABC, a.B.c. ! A.B.C., CONL ! CONLL)
Palabra no incluida en el diccionario
RAE sin ser nombre propio</p>
        <p>Si es un neologismo o extranjerismo
compuesto correctamente segun reglas de
buena formacion se etiquetara como correcta sin
ninguna modi cacion. (p.e., mourin~istas,
retuitear, retweetear )</p>
        <p>Si es un diminutivo o superlativo
compuesto correctamente segun reglas de buena
formacion se etiquetara como correcta sin
ninguna modi cacion. (p.e., supergrande)</p>
        <p>Si se expresa con alguna falta ortogra
ca o alteracion (repeticion, eliminacion,
permutacion de letras, etc), se etiquetara como
variante y se especi cara su forma correcta.
(p.e., horrooorr ! horror, hacia ! hac a)</p>
        <p>Si es una abreviatura o un acortamiento
se etiquetara como variante, especi cando su
forma correcta. (p.e., admin !
administracion, sr ! sen~or )</p>
        <p>Si es una onomatopeya con alguna
alteracion (normalmente repeticion de letras), de
una o varias formas existente segun la RAE,
entonces se etiquetara como variante de
todas esas formas. Si no existe en el
diccionario RAE se anotara como correcta. (p.e.,
aaaahhh ! ah, jajajajas ! ja)</p>
        <p>Si es una concatenacion de palabras,
entonces se etiquetara como variante y se
especi cara la secuencia correcta de palabras.</p>
        <p>Si es una palabra (o cadena de palabras)
de otro idioma o un emoticon se
etiquetara como NoEs.</p>
        <p>El manual describe las l neas generales de
casos. Sin embargo, la casu stica encontrada
fue amplia e hicieron falta varias puestas en
comun para detallar las reglas y mantener la
continuidad y rigurosidad de la anotacion. El
l mite no siempre claro entre palabras
extranjeras y prestamos ya aceptados en la lengua
espan~ola, t tulos de pel culas y series, y
errores ortogra cos intencionados fueron, entre
otros, motivo de discrepancia antes de
unicar anotaciones.</p>
        <p>Por ejemplo:</p>
        <p>El hashtag #7a~nosSLQH ocupo el sabado 30,
la 3a posicion en el Top10 de los Trending
Topics de Malaga
que estafa de tablet
Me dispongo a ver Game of Thrones.</p>
        <p>Habril luisma con h...</p>
        <p>Una di cultad adicional de la anotacion,
la cual an~adio cierto grado de subjetividad a
la tarea, radico en la necesidad de interpretar
los acortamientos y/o abreviaturas utilizados
por los usuarios. Cuando el contexto no era
su ciente para descifrar la intencion del
usuario, algo nada sorprendente dada la limitacion
de caracteres impuesta en los tuits, los
anotadores se vieron en la tesitura de interpretar
dicha intencion y ofrecer la correccion acorde
a esta. Como podemos ver en este ejemplo
cariiii k no te seguia en twitter!!!mu
fuerte!!!..yasoy tu fan....muak....se te exa
d menos en el bk....sobreto en los cierres
jajajajas
la OOV bk es de libre interpretacion, ya
que podr a tratarse del acortamiento de
cualquier lugar de ocio. En este caso se opto por
Burger King, considerada la opcion mas
general y reusable. En ciertos casos se opto por
incluir mas de una posible correccion. La
correccion de onomatopeyas, cuya intencion no
siempre es clara, tambien ha sido discutida:
me da igual JUUUM!!</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>Corpus anotados y medidas de evaluacion</title>
      <p>5.1.</p>
      <sec id="sec-5-1">
        <title>Corpus de desarrollo y test</title>
        <p>A partir del corpus inicial descrito en la
seccion 3.1 se han generado dos subconjuntos:
uno compuesto por 500 tuits que constituye
el corpus de desarrollo y otro compuesto por
600 tuits que constituye el corpus de
evaluacion. En el corpus de desarrollo fueron
anotadas manualmente 653 palabras OOV,
mientras que en el de evaluacion se anotaron 724.
Cabe mencionar que, debido a las
restricciones de uso del API de Twitter4, esta
prohibido redistribuir corpus que contiene
informacion sobre usuarios. Por esta razon, ambos
corpus fueron distribuidos a los participantes
utilizando unicamente los identi cadores de
tuits. Cada participante pod a bajar el
contenido de dichos identi cadores a traves de
busquedas a la API de Twitter mediante el
script Twitid 5.</p>
        <p>4https://dev.twitter.com/terms/api-terms
5http://komunitatea.elhuyar.org/tweetnorm/iles/2013/06/download tweets.py</p>
        <p>Una vez nalizado el plazo de
participacion, comprobamos que los tuits que segu an
publicamente disponibles en ese momento
para generar el corpus de evaluacion era menor
al conjunto original. As el corpus de
evaluacion que nalmente ha sido considerado
consta de 562 tuits, un numero que var a
ligeramente con respecto al volumen inicial de 600
tuits.</p>
        <p>La distribucion de las tres categor as
(0variante, 1-correcta y 2-NoES) en los corpus
de desarrollo y de evaluacion se muestran en
la tabla 1. Como se puede comprobar, la
distribucion de las tres categor as sobre el
total de palabras OOV no var a signi
cativamente en los dos corpus, lo que ha
permitido a los participantes desarrollar sus sistemas
comprobando su e cacia sobre un conjunto
de datos comparable al que se ha ofrecido
posteriormente para evaluar la tarea.</p>
        <sec id="sec-5-1-1">
          <title>Corpus</title>
          <p>Desarrollo
Test
#OOV
653
662
Tabla 1: Datos de los corpus. Se reducen los
724 OOVs de test anotados a 662 debido al
problema de disponibilidad de los tuits.
5.2.</p>
        </sec>
      </sec>
      <sec id="sec-5-2">
        <title>Medidas de evaluacion</title>
        <p>La tarea consistio unicamente en la
correccion de errores, y no en la clasi cacion de las
distintas categor as de palabras OOV (0, 1 y
2). De esta manera se pretende evaluar
exclusivamente la capacidad de correccion de
los sistemas participantes, ya que una fase de
clasi cacion previa introducir a un factor de
acumulacion de errores, haciendo mas dif cil
evaluar el rendimiento de los sistemas. Por
tanto, la evaluacion solo tiene en cuenta si
la forma propuesta es correcta, en base a los
siguientes criterios:</p>
        <p>Correcta: si la forma original era correcta
(categor a 1) o NoES (categor a 2) y no se
ha realizado ninguna normalizacion, o si la
forma original era una variante (categor a 0)
y la normalizacion propuesta es correcta.</p>
        <p>Erronea: En cualquier otro caso.</p>
        <p>Como medida de evaluacion para calcular
los resultados o ciales se ha utilizado la
precision sobre el total de palabras OOV en el
corpus de evaluacion. La formula de la
precision mide el numero de decisiones
realizadas correctamente sobre el total de palabras
OOV a tratar en el corpus de evaluacion.</p>
      </sec>
    </sec>
    <sec id="sec-6">
      <title>Resultados y resumen de los sistemas</title>
      <p>Sobre 20 grupos inscritos inicialmente 13
participaron nalmente con sus respectivos
sistemas; y solo seis de ellos hicieron uso de
la posibilidad de evaluar dos sistemas.
6.1.</p>
      <sec id="sec-6-1">
        <title>Resultados</title>
        <p>La tabla 2 muestra los resultados de
precision de los trece grupos participantes.
Ademas de estos resultados se muestran otros
dos resultados a tener en cuenta como
referencia de la tarea. Por un lado se ha calculado
cual ser a el rendimiento m nimo de un
sistema (baseline), dando como correctas todas
las palabras OOV. Este sistema obtendr a
una precision por debajo del 20 %. Por otro
lado se ofrece el rendimiento maximo
(upperline) al que se podr a aspirar con los
sistemas presentados. El upper-line incluye todas
aquellas palabras OOV que han sido
correctamente corregidas por al menos uno de los
sistemas participantes.</p>
        <p>El anexo 1 muestra la lista de las palabras
OOV (7,25 %, 39) que ningun sistema ha
corregido. La lista incluye una casu stica muy
amplia: por ejemplo, loso a/Filosof a, que
requiere correccion ortogra ca y mayusculas;
yaa/alla, que esta muy lejos de su forma
correcta en cuanto a similitud de cadena, y ya
es a priori un candidato mucho mas probable
para esa forma.
6.2.</p>
      </sec>
      <sec id="sec-6-2">
        <title>Resumen de las tecnicas y recursos utilizados</title>
        <p>Destacan las buenas prestaciones del
sistema de la RAE, que supera claramente al
resto de los sistemas y supera el 78 % de
precision. La mayor a de los sistemas, sin
embargo, estan en un intervalo entre el 54 % y el
67 %. Se podr a explicar la diferencia del
mejor sistema por el tratamiento meticuloso de
cada uno de los fenomenos posibles, la
combinacion estad stica de los componentes y la
calidad y cobertura de los recursos utilizados.</p>
        <p>Los fenomenos a los que varios sistemas
hacen frente expl citamente son los
siguientes:</p>
        <p>Errores ortogra cos habituales (h ! 0).
Cambios fonologicos habituales (k ! c).
Omision de tildes (a ! a).</p>
        <p>Rank
Logogramas y pictogramas. (x ! por 2
! dos).</p>
        <p>Onomatopeyas (ahahahah ! ah).</p>
        <p>Respecto a los lexicos utilizados se usan
principalmente diferentes diccionarios de
espan~ol (o correctores ortogra cos o el propio
Freeling6 usado en el preproceso) para
buscar propuestas normalizadas. Algunos
sistemas utilizan diccionarios de ingles para
detectar OOVs que no deben modi carse,
Wikipedia 7 para an~adir o detectar entidades
nombradas, pequen~os diccionarios de variantes y
slang (en ingles existen mas extensos) o listas
de frecuencias a partir de corpus para
detectar y normalizar cambios habituales propios
de Internet/Twitter.</p>
        <p>6http://nlp.lsi.upc.edu/freeling/
7es.wikipedia.org</p>
        <p>Tambien diversos corpus de espan~ol son
usados para construir modelos de lenguaje.
Son usados tantos corpus de proposito
general como corpus de tuits. Tambien un sistema
ha utilizado la API de un buscador para
ltrar terminos multipalabra.</p>
        <p>Respecto a herramientas podemos
destacar los ya nombrados correctores ortogra
cos (aspell8, hunspell9, Jazzy10), que se usan
tambien para obtener propuestas de
normalizacion. Junto a ellos varios sistemas
usan foma11 para escribir, compilar en
transductores. y aplicar reglas de
transformacion de grafemas/fonemas. En algun caso se
han aprendido reglas de transformacion
basadas en modelos de lenguaje (compuestos
grafemas/fonemas) (p.e. usando
Phonetisaurus12). Para seleccionar entre las propuestas
(ademas de frecuencias basadas en corpus)
varios sistemas usan modelos de lenguaje de
bigramas o trigramas de palabras (usando p.
ej. OpenGrm13 o SRILM14)
6.3.</p>
      </sec>
      <sec id="sec-6-3">
        <title>Breve descripcion de los sistemas</title>
        <p>
          RAE
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Porta y Sancho, 2013)</xref>
          : Se basa
en transductores de estados nitos con pesos
que son combinados estad sticamente
usando la composicion en tres pasos (variantes,
posibles variantes, modelo de lenguaje) . A
partir de reglas generan transductores para
practicamente todos los fenomenos
comentados ademas de un modelo de lenguaje (LM)
basado en trigramas de palabras. Los
recursos lexicos mas resen~ables son el diccionario
DRAE, las 100.000 palabras inglesas mas
frecuentes del BNC, y un corpus de paginas web
(Wacky).
        </p>
        <p>
          Citius-Imaxin
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Gamallo, Garcia, y
Pichel, 2013)</xref>
          : A partir de diversos recursos
lexicos, generan dos tipos de candidatos,
primarios y secundarios; los cuales son
ordenados de diferentes maneras en el proceso
de seleccion del mejor candidato. Escriben
reglas para tres tipos de errores:
mayuscula/minuscula, caracteres repetidos y errores
ortogra cos comunes. Utilizan una lista de
normalizacion (principalmente obtenida del
8http://aspell.net/
9http://hunspell.sourceforge.net/
10http://jazzy.sourceforge.net/
11https://code.google.com/p/foma/
12http://code.google.com/p/phonetisaurus/
13http://www.opengrm.org/
14http://www.speech.sri.com/projects/srilm/
corpus de desarrollo), el DRAE y un
diccionario de nombres propios obtenido de la
Wikipedia. Tambien utilizan un LM basado en
un corpus de RSS period sticos.
        </p>
        <p>
          UPC
          <xref ref-type="bibr" rid="ref1">(Ageno et al., 2013)</xref>
          : Usan una
bater a de modulos (divididos en tres
grupos; palabras sueltas, terminos multipalabra
y expresiones regulares) para generar
diferentes propuestas de correccion para cada
palabra desconocida. Usan foma para realizar
busquedas aproximadas de terminos simples
o multipalabra similares. La correccion de
nitiva se elige por votacion ponderada segun
la precision de cada modulo. Los recursos
mencionados son: lista de acronimos, lista de
emoticones multicaracter y lista de
onomatopeyas, diccionarios de espan~ol (con variantes)
y de ingles y listas de nombres propios.
        </p>
        <p>
          Elhuyar
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Saralegi y San-Vicente, 2013)</xref>
          :
Usan una estrategia compuesta por dos
pasos: generacion de posibles candidatos de
correccion y seleccion del candidato utilizando
un modelo de lenguaje. Para la generacion de
candidatos ademas de la habitual distancia
de edicion tratan abreviaturas comunes,
coloquialismos, caracteres repetidos e
interjecciones. Tambien restauracion de mayusculas
y nombres propios. Usan SRILM para el LM
de bigramas de palabras, entrenandolo con la
Wikipedia (tambien para la lista de nombres
propios) y un corpus de EFE.
        </p>
        <p>
          IXA-EHU
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Alegria, Etxeberria, y
Labaka, 2013)</xref>
          : Usa tambien foma para reglas que
se aplican incrementalmente, para la mayor a
de los fenomenos nombrados, pero a
diferencia del sistema RAE no usa pesos, salvo
para los cambios ortogra cos que aprende
automaticamente del corpus de desarrollo.
Para este aprendizaje usa un modelo de
lenguaje basado en grafemas aprendido del corpus
de desarrollo (utilizando Phonetisaurus ). El
LM de palabras es de unigramas (frecuencia
de las palabras) basado en corpus de tuits
base vueltos a recuperar y ltrados con
Freeling (tambien se usa para obtener los nombres
propios mas frecuentes). Un buscador de
Internet es usado para ltrar los terminos
multipalabra propuestos.
        </p>
        <p>
          Vicomtech
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Ruiz, Cuadros, y
Etchegoyhen, 2013)</xref>
          : Usan reglas de preproceso, un
modelo de distancias de edicion adecuado al
dominio y tres LM de 5-gramas de palabras,
usando KenLM, para seleccionar candidatos
de correccion segun el contexto. Ademas de
la distancia de edicion adaptada con pesos
usan aspell y hunspell como diccionario,
listas de nombres propios (JRC Names y
SAVAS), un corpus de tuits recolectado por ellos
y un corpus extra do de Europarl. Hacen un
interesante estudio de los casos de variantes.
        </p>
        <p>
          UniArizona
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Hulden y Francom, 2013)</xref>
          :
Estudian dos sistemas alternativos de reglas
escritas por un experto o induccion de las
mismas. Los resultados son algo mejores
para el primer sistema. Para el primer metodo
escriben reglas para ser compiladas en
transductores sin pesos usando foma. Las reglas
afrontan varios de los fenomenos
mencionados (restauracion de tildes, repeticiones de
caracteres, errores ortogra cos habituales y
abreviaturas). Para el segundo metodo
inducen pesos para los cambios. Las propuestas
se ordenan usando un LM de unigramas
(frecuencia de palabras). Para manipulacion de
pesos en los transductores usan Kleen.
        </p>
        <p>
          UPF-Havas
          <xref ref-type="bibr" rid="ref13 ref14 ref17 ref18 ref19 ref2 ref20 ref5 ref6 ref8 ref9">(Mun~oz-Garc a, Suarez, y
Bel, 2013)</xref>
          : Hacen uso de datos abiertos
extra dos de recursos publicados en la Web
desarrollados de manera colectiva, entre los
que se encuentran la Wikipedia y un
diccionario de SMS. No afronta espec camente la
mayor a de los problemas enumerados, salvo
las tildes y las mayusculas. Realiza
busquedas en el diccionario de SMS y si no tiene
exito usa la primera propuesta del corrector
Jazzy.
        </p>
        <p>
          DLSIAlicante
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Mosquera-Lopez y
Moreda, 2013)</xref>
          : empleando la herramienta de
normalizacion multilingue TENOR, siguiendo
una estrategia similar a la usada en SMS en
ingles empleando tecnicas de reconocimiento
del habla, pero adaptada al espan~ol. Usan
aspell ampliado con nombre de pa ses como
diccionario, y representan el lexico
foneticamente usando el algoritmo del metafono
adaptado al espan~ol. Para distancia entre palabras
usan el algoritmo Gestalt y para ordenar las
propuests un LM (basado en el corpus
CESSESP).
        </p>
        <p>
          UniMelbourne
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Han, Cook, y Baldwin,
2013)</xref>
          : Basandose en su experiencia para el
ingles, construyen un lexico de
normalizacion a partir de un corpus (compuesto de
millones de tuits en espan~ol) utilizando
similitud distribucional basada en distancia de
edicion/fonologica, y este lexico se combina
con un diccionario slang de jerga de Internet
en espan~ol (obtenido de dos sitios web).
        </p>
        <p>
          UniSevilla
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref3 ref5 ref8 ref9">(Cotelo-Moya, Cruz, y
Troyano, 2013)</xref>
          : Aparte de caracterizar la fuente
de error/variacion usan reglas de
transformacion (implementacion propia) y distancia de
edicion para proponer normalizacion y
deteccion de palabras en otros idiomas (basado en
trigramas de caracteres). Usan el diccionario
de espan~ol Libreo ce y dos pequen~os
diccionarios de emoticones y variantes en tuits
(generados por ellos).
        </p>
        <p>
          UJaen-Sinai
          <xref ref-type="bibr" rid="ref11">(Montejo-Raez et al.,
2013)</xref>
          : Para proponer formas normalizadas
hacen una serie de conversiones a partir de
lexicones de reemplazamiento (abreviaturas
y onomatopeyas) y un corrector ortogra co
(aspell enriquecido con nombres de ciudades,
interjecciones, neologismos de Internet y
otras entidades nombradas).
        </p>
        <p>
          UniCorun~a
          <xref ref-type="bibr" rid="ref13 ref17 ref18 ref19 ref2 ref20 ref5 ref8 ref9">(Vilares, Alonso, y Vilares,
2013)</xref>
          : Es un sistema conceptualmente
sencillo y exible que emplea pocos recursos
(diccionario SMS, tratamiento de onomatopeyas,
repeticiones, diacr ticos y errores ortogra
cos) y que aborda el problema desde un punto
de vista lexico.
7.
        </p>
      </sec>
    </sec>
    <sec id="sec-7">
      <title>Conclusiones</title>
      <p>El taller Tweet-Norm-2013 ha sido un
primer paso academico conjunto para estudiar
y mejorar el problema de normalizacion de
tuits en espan~ol. La participacion de 13
sistemas demuestra el interes en el tema. Es de
resaltar la diversidad de procedencia de los
participantes y la variedad de recursos
utilizados.</p>
      <p>A la espera de un analisis todavia mas
detallado de los resultados creemos que los
corpus desarrollados y las publicaciones
realizadas ayudaran a la mejora de los resultados en
el futuro.</p>
      <p>Desde los participantes se han recibido
propuestas de mejora sobre ciertos aspectos
del preproceso que pueden ser mejorados
(entidades comunes que se han marcado como
OOV) y algunos casos de anotacion que
pueden ser discutibles.</p>
      <p>Los corpus anotados se pondran en
breve plazo a libre disposicion de toda la
comunidad cient ca (consultar el sitio o cial:
komunitatea.elhuyar.org/tweet-norm/).</p>
      <p>Creemos que en el futuro una tarea
similar puede ser planteada, aunque creemos
necesario algun tipo de evaluacion combinada
con otras tareas (traduccion, analisis de
sentimiento...). Ademas ser a interesante dar un
paso mas alla de la normalizacion lexica, y
afrontar tambien la normalizacion sintactica.</p>
    </sec>
    <sec id="sec-8">
      <title>Bibliograf a</title>
    </sec>
    <sec id="sec-9">
      <title>Anexo I: Listado de palabras no corregidas</title>
      <p>JIIIIIIIIOLE Ole
Fotazo fotaza
gor gorda|gordo
coner con el
shh s |se
primera+ primera mas
salobreja Salobreja</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Ageno</surname>
          </string-name>
          , Alicia, Pere R. Comas, Llu s Padro, y Jordi Turmo.
          <year>2013</year>
          .
          <article-title>The talp-upc approach to tweet-norm 2013</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Alegria</surname>
          </string-name>
          , In~aki, Izaskun Etxeberria, y Gorka Labaka.
          <year>2013</year>
          .
          <article-title>Una cascada de transductores simples para normalizar tweets</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Cotelo-Moya</surname>
            ,
            <given-names>Juan M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ferm</surname>
          </string-name>
          n L. Cruz, y Jose A. Troyano.
          <year>2013</year>
          .
          <article-title>Resource-based lexical approach to tweet-norm task</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Eisenstein</surname>
          </string-name>
          , Jacob.
          <year>2013</year>
          .
          <article-title>What to do about bad language on the internet</article-title>
          .
          <source>En Proceedings of NAACL-HLT, paginas</source>
          <volume>359</volume>
          {
          <fpage>369</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Gamallo</surname>
          </string-name>
          , Pablo, Marcos Garcia, y Jose Ramom Pichel.
          <year>2013</year>
          .
          <article-title>A method to lexical normalisation of tweets</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Gomez-Hidalgo</surname>
          </string-name>
          , Jose M.,
          <string-name>
            <surname>Andres</surname>
            <given-names>A</given-names>
          </string-name>
          . CaurcelD az,
          <source>y Yovan In~iguez del Rio</source>
          .
          <year>2013</year>
          .
          <article-title>Un metodo de analisis de lenguaje tipo sms para el castellano</article-title>
          .
          <source>Linguamatica</source>
          ,
          <volume>5</volume>
          (
          <issue>1</issue>
          ):
          <volume>31</volume>
          {
          <fpage>39</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Han</surname>
          </string-name>
          , Bo y Timothy Baldwin.
          <year>2011</year>
          .
          <article-title>Lexical normalisation of short text messages: Makn sens a# twitter</article-title>
          .
          <source>En ACL</source>
          , paginas
          <volume>368</volume>
          {
          <fpage>378</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Han</surname>
            ,
            <given-names>Bo</given-names>
          </string-name>
          , Paul Cook, y Timothy Baldwin.
          <year>2013</year>
          .
          <article-title>unimelb: Spanish text normalisation</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Hulden</surname>
          </string-name>
          , Mans y Jerid Francom.
          <year>2013</year>
          .
          <article-title>Weighted and unweighted transducers for tweet normalization</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Liu</surname>
          </string-name>
          , Xiaohua, Shaodian Zhang, Furu Wei, y Ming Zhou.
          <year>2011</year>
          .
          <article-title>Recognizing named entities in tweets</article-title>
          .
          <source>En ACL</source>
          , paginas
          <volume>359</volume>
          {
          <fpage>367</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Montejo-Raez</surname>
            , Arturo,
            <given-names>Manuel</given-names>
          </string-name>
          <article-title>D az-</article-title>
          <string-name>
            <surname>Galiano</surname>
          </string-name>
          ,
          <article-title>Eugenio Mart nez-Camara, Teresa Mart n-Valdivia, Miguel A</article-title>
          . Garc aCumbreras,
          <source>y Alfonso Uren~a-Lopez</source>
          .
          <year>2013</year>
          . Sinai at twitter-normalization
          <year>2013</year>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Mosquera</surname>
          </string-name>
          , Alejandro, Elena Lloret, y Paloma Moreda.
          <year>2012</year>
          .
          <article-title>Towards facilitating the accessibility of web 2.0 texts through text normalisation</article-title>
          .
          <source>En Proceedings of the LREC Workshop: Natural Language Processing for Improving Textual Accessibility (NLP4ITA)</source>
          , Istanbul, Turkey, paginas
          <volume>9</volume>
          {
          <fpage>14</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Mosquera-Lopez</surname>
          </string-name>
          , Alejandro y Paloma Moreda.
          <year>2013</year>
          .
          <article-title>Dlsi en tweet-norm 2013: Normalizacion de tweets en espan~ol</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <article-title>Mun~oz-Garc a</article-title>
          , Oscar, Silvia Vazquez Suarez, y Nuria Bel.
          <year>2013</year>
          .
          <article-title>Exploiting web-based collective knowledge for micropost normalisation</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Oliva</surname>
            , Jesus, Jose I. Serrano, Mar a
            <given-names>D.</given-names>
          </string-name>
          <string-name>
            <surname>Del Castillo</surname>
          </string-name>
          , y Angel Iglesias.
          <year>2011</year>
          .
          <article-title>Sms normalization: combining phonetics, morphology and semantics</article-title>
          .
          <source>En Advances in Arti cial Intelligence</source>
          . Springer, paginas
          <volume>273</volume>
          {
          <fpage>282</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Padro</surname>
          </string-name>
          , Llu s y Evgeny Stanilovsky.
          <year>2012</year>
          .
          <article-title>Freeling 3.0: Towards wider multilinguality</article-title>
          .
          <source>En Proceedings of the Language Resources and Evaluation Conference (LREC</source>
          <year>2012</year>
          ). Istanbul.
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <surname>Porta</surname>
          </string-name>
          , Jordi y Jose Luis Sancho.
          <year>2013</year>
          .
          <article-title>Word normalization in twitter using nite-state transducers</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <surname>Ruiz</surname>
          </string-name>
          , Pablo, Montse Cuadros, y Thierry Etchegoyhen.
          <year>2013</year>
          .
          <article-title>Lexical normalization of spanish tweets with preprocessing rules, domain-speci c edit distances, and language models</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Saralegi</surname>
          </string-name>
          , Xabier y In~aki San-Vicente.
          <year>2013</year>
          . Elhuyar at tweet-norm
          <year>2013</year>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          .
          <article-title>IV Congreso Espan</article-title>
          ~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <string-name>
            <surname>Vilares</surname>
          </string-name>
          , Jesus, Miguel A. Alonso, y David Vilares.
          <year>2013</year>
          . Prototipado rapido de un sistema de normalizacion de tuits:
          <article-title>Una aproximacion lexica</article-title>
          .
          <source>En Proc. of the Tweet Normalization Workshop at SEPLN</source>
          <year>2013</year>
          . IV. Congreso Espan~ol de Informatica.
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          <string-name>
            <given-names>Villena</given-names>
            <surname>Roman</surname>
          </string-name>
          , Julio, Sara Lana Serrano, Eugenio Mart nez Camara, y Jose Carlos Gonzalez Cristobal.
          <year>2013</year>
          .
          <article-title>Tass-workshop on sentiment analysis at sepln. A continuacion se detallan las variantes del corpus de test que ningun sistema ha propuesto corregido correctamente, junto la normalizacion anotada. FYQ F sica y qu mica sisiii s s yaa alla picolos picoletos nainonainonahh nainonainona gordys gorditas JUUUM hum Tuitutil TuitUtil crst Cristo mencantaba me encantaba diitaas di tas soo eso queeee que Teinfiniteamo Te amo infinitamente aber a ver Hum Humedad L. l. Muchomuchacho Mucho Muchacho Hojo Jo jonaticas jonaticas gafis gafitas her hermano|hermana MIAMOR mi amor guapii guapita WAPAHHH guapa EAEA ea ea Acho Macho tirantitas tirantitos HMYV MHYV filosofia Filosof a nah nada FAV favorito</article-title>
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>