<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Translation. International Journal of
Tranlation</journal-title>
      </journal-title-group>
    </journal-meta>
    <article-meta>
      <title-group>
        <article-title>Extraccion automatica de lexico bilingue: experimentos en espan~ol y catalan</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Catalan</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Raphael Rubino</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Iria da Cunha</string-name>
          <email>iria.dacunha@upf.edu</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Georges Linares</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Laboratoire Informatique d'Avignon</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>chemin des Meinajaries</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Avignon Cedex</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Institut Universitari de Lingu stica Aplicada Roc Boronat 138 08018 Barcelona</institution>
          ,
          <addr-line>Espan~a</addr-line>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2011</year>
      </pub-date>
      <volume>19</volume>
      <issue>29</issue>
      <fpage>35</fpage>
      <lpage>42</lpage>
      <abstract>
        <p>In this paper, we propose an automatic bilingual lexicon extraction system for Catalan and Spanish languages. Parallel corpora are not employed and Wikipedia is used as Catalan-Spanish comparable corpora. A contextual similarity approach is used to translate lexical units that are not translated by an edition distance. The obtained results are positive and con rm that this method could be applied to Iberian languages.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>En la Pen nsula Iberica coexisten cinco
lenguas o ciales: espan~ol, catalan,
gallego, euskera y portugues. Para establecer
v nculos entre estas lenguas y favorecer
el multilinguismo, es necesario desarrollar
recursos para todas ellas. Ademas, es
indispensable crear recursos que permitan
relacionarlas. Actualmente, hay una
carencia de recursos de Procesamiento del
Lenguaje Natural (NLP) para algunas de
ellas, especialmente el gallego, el catalan y
el euskera. Uno de los recursos necesarios
para interrelacionar estas lenguas y disen~ar
herramientas de PLN (como sistemas de
traduccion automatica) son los lexicos</p>
      <p>
        Esta investigacion ha sido parcialmente nanciada
por la Agence Nationale de la Recherche (ANR,
Francia), proyecto AVISON (ANR-007-014); y los
proyectos RICOTERM
        <xref ref-type="bibr" rid="ref19">(FFI2010-21365-C03-01)</xref>
        y APLE
(FFI2009-12188-C05-01) en Espan~a.
multilingues. Sin embargo, su desarrollo
y actualizacion es costoso y lento, ya
que normalmente supone la intervencion
humana.
      </p>
      <p>
        El disen~o de herramientas automaticas
que ayuden en la construccion de lexicos
bilingues (o multilingues) supone un reto en el
ambito del PLN. Existen trabajos que
tratan este tema empleando diferentes
estrategias. La mayor parte utilizan corpus
paralelos
        <xref ref-type="bibr" rid="ref1 ref13 ref22">(Brown et al., 1990; Wu y Xia, 1994;
Koehn, 2005)</xref>
        . No obstante, la creacion de
este tipo de corpus es costosa, lo cual
encarece la investigacion y no permite trabajar
sobre todas las combinaciones de lenguas. Otra
l nea de investigacion se basa en la
utilizacion de un recurso mas accesible, los corpus
bilingues comparables, es decir, conjuntos de
textos no paralelos con tematicas comunes
pero escritos en cada lengua de manera
independiente. Diversos autores han estudiado la
posibilidad de extraer unidades lexicas a
partir de estos corpus, basandose en la
hipotesis de que una unidad lexica y su traduccion
comparten similitudes en cuanto a su
contexto
        <xref ref-type="bibr" rid="ref16 ref7">(Fung, 1995; Rapp, 1995)</xref>
        . Ademas de
corpus comparables, esta aproximacion emplea
un lexico bilingue preliminar de las lenguas
analizadas.
      </p>
      <p>
        La mayor a de las investigaciones sobre
este tema se han realizado para relacionar
el ingles con otras lenguas. Para las lenguas
ibericas, encontramos algunos trabajos, que
utilizan principalmente metodos basados en
corpus paralelos: para ingles-gallego
        <xref ref-type="bibr" rid="ref11">(Guinovart y Fontenla, 2004)</xref>
        , para portugues,
espan~ol e ingles
        <xref ref-type="bibr" rid="ref4 ref9">(Caseli y Nunes, 2007)</xref>
        , y para
ingles-gallego e ingles-portugues
        <xref ref-type="bibr" rid="ref12 ref3">(Guinovart
y Simoes, 2009)</xref>
        .
      </p>
      <p>
        Como se a rma en
        <xref ref-type="bibr" rid="ref4 ref9">(Gamallo Otero y
Pichel Campos, 2007)</xref>
        , \desgraciadamente, no
hay todav a una gran cantidad de texto
paralelo, especialmente en lo que se re ere a
lenguas minorizadas". Por esto, trabajar con
lenguas como el gallego, catalan o euskera se
hace mas complicado. En
        <xref ref-type="bibr" rid="ref4 ref9">(Gamallo Otero y
Pichel Campos, 2007)</xref>
        se propone un
metodo basado en corpus comparables de la Web,
usando la idea de la similitud contextual. Lo
aplican al espan~ol y el gallego, y, aunque sus
resultados no superan los obtenidos usando
corpus paralelos, son elevados. Esto
refuerza la idea de que la gran cantidad de datos
incluidos en la Web es una fuente de
informacion importante y explotable para la
construccion automatica de lexicos bilingues. En
esta l nea, en
        <xref ref-type="bibr" rid="ref21 ref8">(Gamallo y Gonzalez, 2010)</xref>
        se
propone un metodo automatico para
construir corpus comparables empleando la
Wikipedia. En
        <xref ref-type="bibr" rid="ref20">(Tomas et al., 2008)</xref>
        se construye
un corpus que incluye dos tipos de art clos
de la Wikipedia (paralelos y comparables) en
espan~ol y catalan. En
        <xref ref-type="bibr" rid="ref21 ref8">(Vivaldi y Rodr guez,
2010)</xref>
        se presenta un metodo de extraccion
de terminolog a bilingue que emplea las
categor as y estructura de la Wikipedia. La
extraccion de frases paralelas de la Wikipedia
es tambien una tarea interesante que ha
sido explorada por
        <xref ref-type="bibr" rid="ref19 ref21 ref8">(Smith, Quirk, y
Toutanova, 2010)</xref>
        , por ejemplo, realizando diferentes
experimentos a partir de la estructura de la
Wikipedia.
      </p>
      <p>
        El objetivo de este trabajo es desarrollar
un sistema de extraccion automatica de
lexico bilingue para las lenguas de la Pen nsula
Iberica. Concretamente, trabajamos el par de
lenguas espan~ol-catalan. Para ello, evitamos
el empleo de corpus paralelos y aplicamos la
idea de la similitud contextual entre una
unidad lexica y su traduccion
        <xref ref-type="bibr" rid="ref16 ref7">(Fung, 1995; Rapp,
1995)</xref>
        , empleando textos de la Wikipedia
como corpus comparable. La metodolog a
descrita en este trabajo esta basada en el empleo
de recursos y heur sticas existentes, pero
aplicadas concretamente a la extraccion de lexico
bilingue en estas dos lenguas.
2.
      </p>
    </sec>
    <sec id="sec-2">
      <title>Metodolog a</title>
      <p>La metodolog a de nuestro trabajo
incluye dos fases principales: Preprocesamiento y
creacion de recursos lexicos (FASE 0) y
Aplicacion del algoritmo (FASE 1).
2.1.</p>
      <p>FASE 0: Preprocesamiento y
creacion de recursos lexicos</p>
      <p>Ya que nuestro trabajo se basa en un
corpus comparable y un lexico bilingue, en esta
fase se construyen estos recursos.
Concretamente, necesitamos dos lexicos bilingues: I)
un lexico con candidatos a la traduccion (con
sus correspondientes traducciones) y II) un
lexico \pivote" utilizado como elemento de
relacion entre las dos lenguas.
2.1.1. Preprocesamiento del corpus</p>
      <p>comparable</p>
      <p>El preprocesamiento del corpus
comparable incluye:</p>
      <p>Descarga de un chero con todos los
art culos de la Wikipedia (Wikipedia
Dump) en las dos lenguas de trabajo
(espan~ol y catalan).</p>
      <p>Eliminacion de \paginas redirigidas" en
Wikipedia, es decir, art culos que tienen
un t tulo pero no contienen texto en su
interior. Por ejemplo, en la Wikipedia
en espan~ol, la unidad \Proyeccion
Azimutal" esta vac a y redirigida a
\Proyeccion azimutal" (simplemente cambia
una \a" en mayuscula o minuscula); el
an~o \4450" esta redirigido al art culo
sobre el \V milenio", etc.</p>
      <p>Eliminacion de las stopwords en las dos
lenguas. La lista de stopwords en catalan
se ha obtenido del area de Ingenier a
Lingu stica del Institut Universitari de
Lingu stica Aplicada (IULA) de la
Universitat Pompeu Fabra (UPF)1. La lista
1http://latel.upf.edu/morgana/altres/pub/
ca_stop.htm
de stopwords en espan~ol se ha obtenido
del Laboratoire Informatique d'Avignon
(LIA-UAPV)2.</p>
      <p>Formateo de este chero en Trec-text3.</p>
      <p>En el siguiente ejemplo se muestra un
ejemplo de este tipo de formato, en
donde la etiqueta &lt;DOCNO&gt; indica el
numero de documento, &lt;TITLE&gt; el t tulo y
&lt;TEXT&gt; el contenido:
&lt;DOC&gt;
&lt;DOCNO&gt; 22 &lt;/DOCNO&gt;
&lt;TITLE&gt; Astronom a galactica &lt;/TITLE&gt;
&lt;TEXT&gt;
se denomina 'astronom a galactica' a
la investigacion astronomica de nuestra
galaxia, la v a lactea [...] seguros
posee un agujero negro, etc.
&lt;/TEXT&gt;
&lt;/DOC&gt;</p>
      <p>Indexacion de los art culos con Lemur
Indexation Toolkit4. Usamos esta
herramienta para facilitar el calculo de
coocurrencias entre la unidad lexica que se
quiere traducir y su contexto (es decir,
las palabras del lexico II).</p>
      <p>Actualmente, la Wikipedia en espan~ol
contiene 761.727 art culos y en catalan
341.142. Depues de este preprocesamiento,
nuestro corpus incluye 701.423 art culos en
espan~ol y 296.465 en catalan. Esta reduccion
se debe a la eliminacion de art culos
redirigidos. No se realizo una seleccion tematica
de los art culos incluidos en el corpus, sino
que se emplearon todos los temas de la
Wikipedia. Tampoco se uso la estructura de la
Wikipedia.
2.1.2. Recopilacion del lexico I</p>
      <p>En esta fase, creamos nuestro propio
lexico bilingue, que contiene los candidatos a la
traduccion en la lengua de partida (catalan),
acompan~ados de su traduccion en la lengua
de llegada (espan~ol). Construimos estos
recursos dada la carencia de lexicos bilingues
extensos y actualizados gratuitos disponibles
para el par de lenguas empleadas. As ,
nuestro lexico podra contener neologismos de
re</p>
      <p>2http://lia.univ-avignon.fr/fileadmin/
documents/Users/Intranet/chercheurs/torres/
logiciels/fonctionnels_esp.txt
3http://trec.nist.gov
4http://www.lemurproject.org
ciente creacion (como, por ejemplo,
\mileurista")5. Esta fase incluye dos subfases:
1. Extraccion de relaciones de
correspondencia entre los t tulos de los art
culos de la Wikipedia en espan~ol y
catalan, para obtener una lista
preliminar de lexico bilingue. Las relaciones
entre los art culos en estas dos lenguas
se establecen mediante enlaces
interlengua (en el menu \En otros idiomas" de
la Wikipedia en espan~ol). Establecemos
las correspondencias en los dos sentidos
(espan~ol-catalan y catalan-espan~ol)
porque, en ocasiones, la estructura de la
Wikipedia no correlaciona de la misma
forma las entradas en los dos sentidos.</p>
      <p>
        Por ejemplo, en la Wikipedia en catalan
encontramos la entrada \Prestige", que
esta correlacionada en la Wikipedia en
espan~ol con \Desastre del Prestige". Sin
embargo, la Wikipedia en espan~ol
tambien ofrece la entrada \Prestige" (que
se re ere al mismo petrolero), que solo
muestra su correspondencia al ingles y al
ruso, pero no al catalan. Vemos as que
la estructura de la Wikipedia en espan~ol
es mas compleja que la de otras lenguas
con menos entradas.
2. Filtrado de la lista preliminar de los dos
lexicos bilingues mediante la eliminacion
automatica de:
- Pares de unidades lexicas que no
mantienen la misma correlacion en la
estructura de la Wikipedia en los dos sentidos.
- Pares de unidades lexicas que coinciden
en las dos lenguas. Este criterio se aplica
por dos motivos. Primero, porque
consideramos que no es interesante evaluar los
pares de unidades que son identicas.
Segundo, porque una gran cantidad de las
unidades de este lexico bilingue extra do
de la Wikipedia seran entidades
nombradas iguales en ambas lenguas, como por
ejemplo \Harry Potter".
- Pares de elementos numericos, ya que
no nos interesa traducir cifras, an~os,
fechas, etc., aunque somos conscientes de
que estas entidades podr an servir para
poder paralelizar de forma e ciente
frases en corpus comparables.
- Pares de elementos en que solo uno
tiene un signo de puntuacion: generalmente
5Para mas informacion
vease
        <xref ref-type="bibr" rid="ref12 ref3">(Cabre y Estopa, 2009)</xref>
        sobre
neolog a
indican un error en la traduccion
(excepto el punto de la geminada del catalan).
- Pares de elementos que pueden
traducirse por la distancia de edicion
        <xref ref-type="bibr" rid="ref14">(Levenshtein, 1966)</xref>
        . Por ejemplo, las
siguientes unidades lexicas del catalan (a
la izquierda) fueron traducidas
correctamente al espan~ol por la distancia de
edicion (a la derecha), ya que las similitudes
ortogra cas son evidentes:
catalan
palau de
westminster
lateralitat
fagocitosi
prov ncia de bilecik
espan~ol
palacio de
westminster
lateralidad
fagocitosis
provincia de bilecik
En cambio, las siguientes unidades del
catalan no se tradujeron
adecuadamente:
catalan
surquillo
      </p>
      <p>oquet neu
tupaia
eratostenia
espan~ol
bordillo
alquino
tucana
r o eno
Comenzamos con un lexico de 140.137
unidades. Despues del ltrado, antes de aplicar la
distancia de edicion, obtenemos 57.859
unidades y, despues de la distancia de edicion,
8.045 unidades, con las que trabajamos
nalmente. Este lexico nal contiene las unidades
lexicas mas dif ciles de traducir, porque no
pueden ser traducidas por una distancia de
edicion tradicional. Por este motivo,
consideramos que la traduccion automatica de estas
8.045 unidades es el principal reto. Partimos
de la idea de que el lexico bilingue creado
en esta fase es correcto. Sin embargo, no
hemos realizado una revision manual, dada su
gran extension. Esta revision ser a optima
para eliminar errores, pero intentamos evitar al
maximo la intervencion humana.
2.1.3. Recopilacion del lexico II</p>
      <p>Como ya hemos comentado, este lexico
\pivote" se utiliza como elemento de
relacion entre las dos lenguas del trabajo. Por
este motivo, este lexico debe ser correcto
necesariamente, ya que gracias a el se realizan
las corrrespondencias entre lenguas. Por
esto, hemos decidido utilizar un lexico bilingue
espan~ol-catalan existente en la coleccion
AULEX6, que contiene vocabularios breves en
l nea de lenguas con recursos limitados,
dirigida por Manuel Rodr guez Villegas,
especialista compilador de diccionarios en l nea.
2.2. FASE 1: Aplicacion del</p>
      <p>algoritmo</p>
      <p>
        El proceso de identi cacion de
traducciones puede ser visto como un
alineamiento palabra por palabra. Esta tarea se
aborda normalmente mediante algoritmos
basados en corpus paralelos, como el modelo
IBM
        <xref ref-type="bibr" rid="ref10 ref2">(Brown et al., 1993; Gonzalez-Rubio et
al., 2008)</xref>
        . Sin embargo, como nosotros
basamos nuestro proceso de extraccion en
corpus comparables (no paralelos), necesitamos
otro metodo. Esta es la razon por la que nos
centramos en la informacion contextual de la
palabra que se quiere traducir y candidatos
a traducciones. Nuestra aproximacion se
basa en las palabras adyacentes, asumiendo que
podemos traducir parte del contexto del
vocabulario. De hecho, como no se pueden
traducir todas las unidades lexicas existentes
alrededor de los candidatos en la lengua fuente
y la lengua de llegada, necesitamos capturar
la informacion mas importante en las
coocurrencias detectadas. Usamos medidas de
normalizacion para resaltar las particularidades
de las coocurrencias entre una palabra
(lexico I) y las palabras del lexico \pivote" (lexico
II).
      </p>
      <p>En resumen, el metodo para identi car
traducciones basado en la informacion
contextual incluye cuatro pasos:
calculo de las coocurrencias entre una
palabra (lexico I) y las palabras del
lexico \pivote" (lexico II),
normalizacion de las coocurrencias con
una medida de asociacion,
construccion de un vector de contexto,
comparacion de los vectores de la lengua
de partida y la lengua de llegada con una
medida de similitud.</p>
      <p>La Figura 1 resume el proceso general de
extraccion de traduccion que presentamos en
este trabajo.</p>
      <p>El primer paso esta basado en la premisa
de que una palabra y su traduccion
comparten similitudes contextuales en corpus
comparables. Las palabras del lexico \pivote"
6http://aulex.org/aulex.php</p>
      <p>Figura 1: Esquema general del proceso de extraccion de traducciones.
(lexico II) son los elementos de relacion en
ambas lenguas para modelizar el espacio
contextual de donde vamos a extraer las
traducciones. Las coocurrencias entre una palabra
(lexico I) y las palabras del lexico \pivote"
(lexico II) se contabilizan dentro de una
ventana deslizante de un taman~o jo (de 10 a 30
palabras en cada ejemplo) o dinamico
(oraciones, parrafos, etc.).</p>
      <p>
        El segundo paso ha sido ya
ampliamente estudiado en la literatura. Se han probado
diversas medidas de asociacion, basadas en
tablas de contingencia 2*2 como la
mostrada en el Cuadro 1, y se observa que las mas
efectivas son informacion mutua
        <xref ref-type="bibr" rid="ref4">(Church y
Hanks, 1990)</xref>
        , log-likelihood
        <xref ref-type="bibr" rid="ref5">(Dunning, 1993)</xref>
        y odds-ratio
        <xref ref-type="bibr" rid="ref6">(Evert, 2004)</xref>
        . En la Seccion 3
presentamos los resultados obtenidos con las
medidas de informacion mutua y odds-ratio,
cuyas formulas ofrecemos en la Ecuacion 1
y 2, respectivamente.
      </p>
      <p>mi(w; s) = log</p>
      <p>a
(a + b)(a + c)
(1)
odds(w; s) = log
(a + 21 )(d + 12 )
(b + 12 )(c + 12 )</p>
      <p>(2)
s</p>
      <p>s
w
w
a = occ( w ; s )</p>
      <p>b = occ( w ; s )
c = occ( w ; s )</p>
      <p>d = occ( w ; s )
Cuadro 1: Tabla de contingencias entre dos
palabras</p>
      <p>El Cuadro 1 contiene las coocurrencias
comunes en una ventana de una palabra del
lexico I (re ejada como w) y las palabras del
lexico \pivote" o II (re ejadas como s), pero
tambien los casos en los que w aparece sin s,
s aparece sin w, y nalmente en los que no
aparecen juntas. Este paso de normalizacion
es particularmente util para tratar
diferencias entre lenguas en corpus comparables. Por
ejemplo, el corpus extra do de la Wikipedia</p>
      <sec id="sec-2-1">
        <title>Candidatos Lexico \pivote" Wikipedia CA Wikipedia ES</title>
        <p>Documentos
en espan~ol contiene una mayor cantidad de
unidades lexicas, por eso el numero de
ocurrencias de palabras es mayor que el numero
de ocurrencias de su traduccion en una
lengua con menos recursos (como el catalan).</p>
        <p>El tercer paso se re ere basicamente a la
modelizacion de una palabra (lexico I) en un
espacio contextual. Para cada palabra (lexico
I) en la lengua de partida y de llegada, el
contexto se modeliza como un vector de
contexto. Cada componente de este vector contiene
un calculo de coocurrencias normalizado. Los
componentes tienen que ser jos porque
queremos que las dimensiones sean comparables
entre los vectores de la lengua de partida y
de llegada.</p>
        <p>
          El cuarto paso se basa en medidas de
vectores de similitud para comparar los vectores
de contexto en la lengua de partida y de
llegada. El objetivo es detectar similitudes entre
las asociaciones contextuales de las palabras.
Los vectores mas similares son traducciones
posibles. Estas medidas son otro parametro
bien estudiado en la literatura, y las mas
populares son el coseno, la distancia euclidiana
y la metrica City Block
          <xref ref-type="bibr" rid="ref15">(Morin et al., 2007)</xref>
          .
La formula de la distancia del coseno entre
los vectores de la lengua de partida y de
llegada, con la medida de asociacion odds-ratio,
se detalla en la Ecuacion 3 (donde V es un
vector, s es la lengua de partida, t es la
lengua de llegada, y n es una unidad del lexico
\pivote").
cosineVVts =
        </p>
        <p>Pn oddssnoddstn
p(Pn oddssn)2p(Pn oddstn)2 (3)</p>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Experimentos y resultados</title>
      <p>Para evaluar nuestro metodo, hemos
empleado los recursos incluidos en el Cuadro 2.
Hemos extra do aleatoriamente 300
candidatos a traducir del lexico I.</p>
      <p>Hemos realizado diversos experimentos
empleando las medidas de asociacion y las
medidas de similitud vectorial, presentadas
en 2.2. Observamos que los mejores
resultados se obtienen con la utilizacion de la
medida de asociacion odds-ratio y la similitud
de cosenos. Los resultados se presentan en el
Cuadro 3 (P = Precision, C = Cobertura, F
= F-measure). Consideramos que es
interesante presentar tambien los resultados
obtenidos con las otras medidas de asociacion,
como las coocurrencias y la informacion mutua.</p>
      <p>A continuacion mostramos algunos
ejemplos de traducciones correctas:
catalan
formatge blau</p>
      <p>oridura
momi cacio
senglar calido
vaga
espan~ol
queso azul
moho
embalsamamiento
jabal calidon
huelga</p>
      <p>Y tambien ejemplos de traducciones
incorrectas:
catalan
creu nordica
castella mexic
bombeta electrica
asturies
bitxo
espan~ol
idioma islandes
alfabetizacion
cuenco
labor
salsa pescado</p>
      <p>Los resultados obtenidos muestran la e
cacia en cuanto a la precision en el rango 1 de
la medida odds ratio combinada con la
similitud de cosenos. El aumento de la
cobertura segun el numero de candidatos tenidos en
cuenta (un rango entre 5 y 10) implica un
descenso signi cativo de la precision. El calculo
de la precision tiene en cuenta el numero de
unidades lexicas de la lengua de llegada
consideradas como una buena traduccion. Para
el rango 10, por ejemplo, una sola traduccion
es valida segun la referencia (lexico I), pero
el sistema ofrece 10. En este rango, la
informacion mutua y odds ratio son equivalentes
en cuanto a precision y cobertura.</p>
      <p>
        Estos resultados son dif cilmente
comprables con los de otros trabajos. Sin embargo,
observamos que, para el dominio period stico,
los experimentos de
        <xref ref-type="bibr" rid="ref17">(Rapp, 1999)</xref>
        muestran
una precision del rango 1 del 72 % sobre 100
candidatos evaluados. El autor utiliza un
corpus en aleman que contiene 135 millones de
palabras y un corpus en ingles que incluye 163
millones. Ademas, el lexico \pivote" que
emplea en sus experimentos contiene 16.380
entradas, es decir, que es muy superior al lexico
\pivote" que nosotros empleamos en este
tra
      </p>
      <sec id="sec-3-1">
        <title>Coocurrencias Informacion mutua Odds ratio</title>
        <p>Cuadro 3: Resultados obtenidos a tres rangos (mejores 1, 5 y 10 traducciones) por similitud de
cosenos entre los vectores de contexto
bajo. De hecho, creemos que la precision del
rango 1 del 58 %, que hemos obtenido, podr a
mejorarse con un lexico con un mayor
numero de entradas. Este aspecto esta relacionado
con la cantidad de recursos disponibles para
el catalan, menos dotado que otras lenguas.</p>
        <p>La evaluacion de los candidatos ubicados en
el primer rango es el modo mas apropiado de
observar si el lexico bilingue extra do podr a
ser incluido en un sistema de traduccion
automatica. Sin embargo, es necesario mejorar
la precision de los resultados con el objetivo
de aportar recursos robustos.</p>
        <p>
          En nuestro trabajo no abordamos la
construccion de modelos estad sticos de
traduccion, sino que nos centramos en la tarea de
la extraccion de lexico bilingue. Sin embargo,
existen diversos trabajos que se estan
realizando actualmente por otros autores en
relacion con el entrenamiento de sistemas de
traduccion automatica con datos no paralelos,
obteniendo resultados prometedores
          <xref ref-type="bibr" rid="ref18">(Ravi y
Knight, 2011)</xref>
          .
        </p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Conclusiones y trabajo futuro</title>
      <p>En este trabajo presentamos un sistema de
extraccion automatica de lexico bilingue, que
aplicamos a un par de lenguas de la Pen
nsula Iberica: espan~ol-catalan. Para los
experimentos no empleamos corpus paralelos, sino
corpus comparables usando como recurso la
informacion ofrecida por la Wikipedia,
aplicando la idea de las similitudes contextuales
entre una unidad lexica y su traduccion. Los
resultados obtenidos son positivos, dado que
se logro traducir correctamente mas de la
mitad de los candidatos. Ademas, consideramos
que la precision del rango 1 podra mejorarse
mediante un lexico \pivote" que incluya mas
unidades lexicas, lo cual planeamos hacer
como trabajo futuro.</p>
      <p>Creemos que este trabajo es relevante,
dado que proponemos un sistema que casi no
requiere esfuerzo humano, es rapido y,
sobre todo, permite la actualizacion
constante del lexico bilingue, ya que la Wikipedia se
ampl a cada d a con nuevas entradas.
Tomando la Wikipedia como un corpus abierto y en
constante evolucion, podremos emplear este
metodo para aumentar el lexico de cualquier
lengua de la Pen nsula Iberica de una manera
dinamica y, as , favorecer el multilinguismo,
las relaciones entre lenguas y el desarrollo de
herramientas de PLN, como los sistemas de
traduccion automatica. La principal ventaja
de la metodolog a empleada en este trabajo
es que es independiente de lengua. Para
emplearla en diferentes lenguas solo se necesita
un corpus comparable y un lexico \pivote"
entre las dos lenguas que se quieren tratar.</p>
      <p>Como trabajo futuro, nos gustar a aplicar
el sistema sobre otros pares de lenguas.
Especialmente, estamos interesados en el
espan~oleuskera, dada la gran diferencia ortogra ca
entre las unidades lexicas de estas dos
lenguas. Ademas, nos gustar a incorporar
nuestro sistema de extraccion a un sistema de
traduccion automatica, para:
1. realizar una evaluacion extr nseca de
nuestro sistema,
2. aumentar la cobertura de vocabulario de
un traductor automatico.</p>
    </sec>
    <sec id="sec-5">
      <title>Bibliograf a</title>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Brown</surname>
            , P.F.,
            <given-names>S.A.</given-names>
          </string-name>
          <string-name>
            <surname>Della Pietra</surname>
            ,
            <given-names>V.J. Della</given-names>
          </string-name>
          <string-name>
            <surname>Pietra</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          <string-name>
            <surname>Jelinek</surname>
            ,
            <given-names>J.D. La erty</given-names>
          </string-name>
          , R.L. Mercer,
          <string-name>
            <given-names>y P.S.</given-names>
            <surname>Roossin</surname>
          </string-name>
          .
          <year>1990</year>
          .
          <article-title>A Statistical Approach to Machine Translation</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>16</volume>
          (
          <issue>2</issue>
          ):
          <volume>79</volume>
          {
          <fpage>85</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Brown</surname>
            , P.F.,
            <given-names>S.D.</given-names>
          </string-name>
          <string-name>
            <surname>Pietra</surname>
            ,
            <given-names>V.J.D.</given-names>
          </string-name>
          <string-name>
            <surname>Pietra</surname>
            , y
            <given-names>R.L.</given-names>
          </string-name>
          <string-name>
            <surname>Mercer</surname>
          </string-name>
          .
          <year>1993</year>
          .
          <article-title>The Mathematic of Statistical Machine Translation: Parameter Estimation</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>19</volume>
          (
          <issue>2</issue>
          ):
          <volume>263</volume>
          {
          <fpage>311</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Cabre</surname>
            , M.T. y
            <given-names>R.</given-names>
          </string-name>
          <string-name>
            <surname>Estopa</surname>
          </string-name>
          .
          <year>2009</year>
          .
          <article-title>Les paraules noves criteris per detectar i mesurar els neologismes</article-title>
          .
          <source>Eumo editorial.</source>
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Caseli</surname>
          </string-name>
          , HM y MGV Nunes.
          <year>2007</year>
          .
          <article-title>Automatic Induction of Bilingual Lexicons for MachiChurch,</article-title>
          K.W. y
          <string-name>
            <given-names>P.</given-names>
            <surname>Hanks</surname>
          </string-name>
          .
          <year>1990</year>
          . Word Association Norms, Mutual Information, and
          <string-name>
            <surname>Lexicography</surname>
          </string-name>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>16</volume>
          (
          <issue>1</issue>
          ):
          <volume>22</volume>
          {
          <fpage>29</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Dunning</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          <year>1993</year>
          .
          <article-title>Accurate Methods for the Statistics of Surprise and Coincidence</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>19</volume>
          (
          <issue>1</issue>
          ):
          <volume>61</volume>
          {
          <fpage>74</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Evert</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          <year>2004</year>
          . The Statistics of Word Cooccurrences:
          <article-title>Word Pairs and Collocations</article-title>
          .
          <source>Ph.D. tesis, Universitat Stuttgart</source>
          .
          <volume>353</volume>
          paginas.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Fung</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          <year>1995</year>
          .
          <article-title>Compiling Bilingual Lexicon Entries from a Non-parallel EnglishChinese Corpus</article-title>
          . En Workshop on Very Large Corpora, paginas
          <volume>173</volume>
          {
          <fpage>183</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Gamallo</surname>
            ,
            <given-names>P. y I.</given-names>
          </string-name>
          <string-name>
            <surname>Gonzalez</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Wikipedia as a Multilingual Source of Comparable Corpora</article-title>
          .
          <source>En LREC Workshop on Building and Using Comparable Corpora</source>
          , paginas
          <volume>19</volume>
          {
          <fpage>26</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <given-names>Gamallo</given-names>
            <surname>Otero</surname>
          </string-name>
          , P. y
          <string-name>
            <given-names>J.R. Pichel</given-names>
            <surname>Campos</surname>
          </string-name>
          .
          <year>2007</year>
          . Un metodo de extraccion de equivalentes de
          <article-title>traduccion a partir de un corpus comparable castellano-gallego</article-title>
          .
          <source>Lenguaje Natural</source>
          , paginas
          <volume>241</volume>
          {
          <fpage>248</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Gonzalez-Rubio</surname>
            , J.,
            <given-names>G.</given-names>
          </string-name>
          <string-name>
            <surname>Sanchis-Trilles</surname>
            ,
            <given-names>A</given-names>
          </string-name>
          . Juan, y
          <string-name>
            <given-names>F.</given-names>
            <surname>Casacuberta</surname>
          </string-name>
          .
          <year>2008</year>
          .
          <article-title>A Novel Alignment Model Inspired on IBM Model 1</article-title>
          .
          <string-name>
            <surname>En</surname>
            <given-names>EAMT</given-names>
          </string-name>
          , paginas
          <volume>47</volume>
          {
          <fpage>56</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Guinovart</surname>
            ,
            <given-names>X.G. y E.S.</given-names>
          </string-name>
          <string-name>
            <surname>Fontenla</surname>
          </string-name>
          .
          <year>2004</year>
          . Metodos de optimizacion de la extraccion de lexico bilingu
          <article-title>e a partir de corpus paralelos</article-title>
          .
          <source>Lenguaje Natural</source>
          ,
          <volume>33</volume>
          :
          <fpage>133</fpage>
          {
          <fpage>140</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Guinovart</surname>
            ,
            <given-names>X.G. y A.</given-names>
          </string-name>
          <string-name>
            <surname>Simoes</surname>
          </string-name>
          .
          <year>2009</year>
          .
          <article-title>Parallel Corpus-Based Bilingual Terminology Extraction</article-title>
          .
          <source>En International Conference on Terminology and Arti cial Intelligence.</source>
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Koehn</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          <year>2005</year>
          .
          <article-title>Europarl: A Parallel Corpus for Statistical Machine Translation</article-title>
          .
          <source>En MT Summit X, paginas</source>
          <volume>79</volume>
          {
          <fpage>86</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Levenshtein</surname>
            ,
            <given-names>V.I.</given-names>
          </string-name>
          <year>1966</year>
          .
          <article-title>Binary Codes Capable of Correcting Deletions, Insertions, and Reversals</article-title>
          .
          <source>En Soviet Physics Doklady</source>
          , paginas
          <volume>707</volume>
          {
          <fpage>710</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Morin</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            <surname>Daille</surname>
          </string-name>
          , K. Takeuchi, y
          <string-name>
            <given-names>K.</given-names>
            <surname>Kageura</surname>
          </string-name>
          .
          <year>2007</year>
          .
          <article-title>Bilingual Terminology Mining-Using Brain, not Brawn Comparable Corpora</article-title>
          .
          <source>En ACL</source>
          , paginas
          <volume>664</volume>
          {
          <fpage>671</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Rapp</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          <year>1995</year>
          .
          <article-title>Identifying Word Translations in Non-parallel Texts</article-title>
          .
          <source>En ACL</source>
          , paginas
          <volume>320</volume>
          {
          <fpage>322</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <surname>Rapp</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          <year>1999</year>
          .
          <article-title>Automatic Identi cation of Word Translations from Unrelated English and German Corpora</article-title>
          .
          <source>En ACL</source>
          , paginas
          <volume>519</volume>
          {
          <fpage>526</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <surname>Ravi</surname>
            , S. y
            <given-names>K.</given-names>
          </string-name>
          <string-name>
            <surname>Knight</surname>
          </string-name>
          .
          <year>2011</year>
          .
          <article-title>Deciphering Foreign Language</article-title>
          . En ACL, paginas
          <volume>12</volume>
          {
          <fpage>21</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Smith</surname>
            ,
            <given-names>J.R.</given-names>
          </string-name>
          , C. Quirk, y
          <string-name>
            <given-names>K.</given-names>
            <surname>Toutanova</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Extracting parallel sentences from comparable corpora using document level alignment</article-title>
          .
          <source>En NAACL/HLT</source>
          , paginas
          <volume>403</volume>
          {
          <fpage>411</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <string-name>
            <surname>Tomas</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Bataller</surname>
          </string-name>
          ,
          <string-name>
            <given-names>F.</given-names>
            <surname>Casacuberta</surname>
          </string-name>
          ,
          <string-name>
            <given-names>y J.</given-names>
            <surname>Lloret</surname>
          </string-name>
          .
          <year>2008</year>
          .
          <article-title>Mining wikipedia as a parallel and comparable corpus</article-title>
          .
          <source>En Language Forum.</source>
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          <string-name>
            <surname>Vivaldi</surname>
          </string-name>
          , J. y H. Rodr guez.
          <year>2010</year>
          .
          <article-title>Finding domain terms using wikipedia</article-title>
          .
          <source>En LREC</source>
          , paginas
          <volume>386</volume>
          {
          <fpage>393</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          <string-name>
            <surname>Wu</surname>
            , D. y
            <given-names>X.</given-names>
          </string-name>
          <string-name>
            <surname>Xia</surname>
          </string-name>
          .
          <year>1994</year>
          .
          <article-title>Learning an EnglishChinese lexicon from a Parallel Corpus</article-title>
          .
          <source>En AMTA</source>
          , paginas
          <volume>206</volume>
          {
          <fpage>213</fpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>