<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Recursos y metodos de sustitucion lexica en las variantes dialectales en euskera</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Larraitz Uria IKER (UMR</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
          <xref ref-type="aff" rid="aff2">2</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>) IKERBASQUE larraitz.uria@ehu.es</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
          <xref ref-type="aff" rid="aff2">2</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>In~aki Alegria IXA taldea UPV-EHU</institution>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Izaskun Etxeberria IXA taldea UPV-EHU</institution>
        </aff>
        <aff id="aff2">
          <label>2</label>
          <institution>Mans Hulden University of Helsinki Language Technology</institution>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2011</year>
      </pub-date>
      <fpage>70</fpage>
      <lpage>76</lpage>
      <abstract>
        <p>The coexistence of ve languages with o cial status in the Iberian Peninsula (Basque, Catalan, Galician, Portuguese, and Spanish), has prompted collaborative e orts to share and cross-develop resources and materials for these languages of the region. However, it is not the case that comprehension boundaries only exist between each of these ve languages; dialectal variation is also present, and in the case of Basque, for example, many written resources are only available in dialectal (or pre-standardization) form. At the same time, all the computational tools developed for Basque are based on the standard language (\Batua"), and will not work correctly with other dialects, of which there are many. In this work we attempt to semiautomatically deduce relationships between the standard Basque and dialectal variants. Such an e ort provides an opportunity to apply existing tools to texts issued before a uni ed standard Basque was developed, and so take advantage of a rich source of linguistic information.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        En el area de la morfolog a
computacional existe una l nea de investigacion
abierta en relacion a la forma de combinar las
aproximaciones lingu sticas y las basadas en
aprendizaje automatico. Los metodos
basados en aprendizaje automatico
        <xref ref-type="bibr" rid="ref1">(Goldsmith,
2001)</xref>
        pueden ser interesantes cuando se
requiere un desarrollo rapido y se cuenta con
pocos recursos o no se dispone de expertos
en el idioma a tratar. Pero si se quiere un
analizador que compagine cobertura y
precision, la mejor opcion es una descripcion
basada en un lexico y un conjunto de paradigmas
y reglas fonologicas especi cados por
expertos. Las descripciones basadas en tecnolog as
de estados nitos son las mas populares para
este n (Beesley y Karttunen, 2002).
      </p>
      <p>El desarrollo de las bibliotecas digitales
y de la lingu stica basada en corpus
implica a menudo el tratamiento de las variantes
dialectales y/o diacronicas del idioma, pero
no resulta viable tener que realizar una
nueva especi cacion por cada variante a tratar.
As pues, el objetivo de nuestras
investigaciones es inferir la morfolog a de las
variantes, o la equivalencia entre variantes y formas
estandar del euskera a partir de un pequen~o
corpus paralelo variante/estandar, un corpus
de la variante y un analizador o reconocedor
del estandar.</p>
      <p>En el trabajo que presentamos tratamos
de inferir metodos de sustitucion lexica
entre variantes y formas estandar del euskera
basandonos en la morfolog a.
Concretamente, nuestros primeros experimentos se centran
en el dialecto labortano y el objetivo es la
sustitucion lexica de las formas propias del
dialecto por las correspondientes del
euskera estandar. La tarea clave, en una primera
fase al menos, es la inferencia de las reglas
fonologicas a partir de pares variante-estandar.
En este art culo describimos los recursos
basicos con los que contamos en nuestra
investigacion, as como los metodos que estamos
experimentando para inferir las reglas.</p>
      <p>Aunque los resultados obtenidos en los
primeros experimentos son alentadores,
todav a deben ser ampliados y mejorados antes
de poder integrarlos en herramientas
computacionales efectivas.</p>
      <p>Las tecnicas que describimos son, en su
mayor parte, independientes del idioma y
ademas, es de suponer que con cierta
adaptacion pueden ser aplicadas a otras variantes
o registros del idioma (por ejemplo, idioma
mas informal: email, SMS. . . ).</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajos relacionados</title>
      <p>El problema general de aprendizaje
supervisado de las variantes dialectales ha sido
discutido en la literatura en varias areas:
fonolog a computacional, morfolog a, aprendizaje
automatico. . .</p>
      <p>
        Por ejemplo,
        <xref ref-type="bibr" rid="ref5">(Kestemont, Daelemans, y
Pauw, 2010)</xref>
        presentan un sistema
independiente del idioma que puede \aprender"
variaciones intra-lema. El sistema se utiliza
para producir una lematizacion coherente de
textos en holandes antiguo sobre un corpus de
literatura medieval (Corpus-Gysseling), que
contiene manuscritos de fecha anterior al an~o
1300.
      </p>
      <p>
        <xref ref-type="bibr" rid="ref6">(Koskenniemi, 1991)</xref>
        , por su parte, ofrece
un esbozo de un procedimiento de inferencia
de reglas fonologicas de dos niveles pero sin
llegar a automatizarlo.
      </p>
      <p>
        En un trabajo anterior,
        <xref ref-type="bibr" rid="ref4">(Johnson, 1984)</xref>
        presenta un \procedimiento de inferencia"
para el aprendizaje de reglas fonologicas a
partir de datos, lo que puede ser considerado
un trabajo precursor del algoritmo ILP
(Inductive Logic Programming ) que proponemos
entre nuestros metodos.
3.
      </p>
    </sec>
    <sec id="sec-3">
      <title>Recursos lingu sticos</title>
      <p>Para el aprendizaje o inferencia y para
la evaluacion se necesitan recursos que
deben ser almacenados, testeados y, en su caso,
etiquetados. La idea de este trabajo es usar
metodos no supervisados o con un m nimo de
supervision, ya que ese es el escenario realista
para generar aplicaciones en el area.</p>
      <p>De momento vamos a probar distintas
tecnicas en el contexto de las variaciones
dialectales en euskera, pero intentando que los
metodos sean, en la medida de lo posible,
independientes del idioma.</p>
      <p>Para llevar a cabo nuestros experimentos
en esta investigacion, contamos con tres
corpus de origen y caracter sticas diferentes:
Corpus de transcripciones en labortano
Corpus de la Biblia en euskera estandar
y labortano
Corpus de transcripciones en diversos
dialectos
3.1.</p>
      <sec id="sec-3-1">
        <title>Corpus de transcripciones en labortano</title>
        <p>Por una parte, contamos con un corpus
paralelo construido en el centro de
investigacion IKER (UMR5478) de Bayona
(Francia) dentro del proyecto TSABL1. El objetivo
de este proyecto es el estudio de la variacion
sintactica de los dialectos del Pa s Vasco al
norte de los Pirineos (Iparralde ). Para ello,
se ha creado la aplicacion BASYQUE2, en la
que se recogen datos y ejemplos de variantes
dialectales que provienen de tres fuentes de
informacion: cuestionarios espec cos, v deos
de testimonios grabados en otros proyectos y
textos literarios.</p>
        <p>Una de las principales razones que nos
ha llevado a utilizar los datos recogidos en
1Towards a Syntactic Atlas of the Basque
Language:
http://www.iker.cnrs.fr/-tsabl-towards-asyntactic-atlas-of-.html?lang=fr
2http://ixa2.si.ehu.es/atlas2/index.php?lang=eu
BASYQUE es la posibilidad que nos ofrece
de crear corpus paralelos. Los cuestionarios
y testimonios grabados se transcriben y
junto a cada ejemplo o frase dialectal tambien
se especi ca la forma estandar que le
corresponde. En el caso de los textos literarios
escritos en dialecto, tambien se indica la forma
estandar que corresponde a cada frase. Estos
corpus paralelos labortano-estandar son los
que vamos a utilizar en los experimentos de
sustitucion lexica.</p>
        <p>La aplicacion BASYQUE pretende
abarcar todos los dialectos y subdialectos de
Iparralde y para ello la recopilacion de los datos
se extiende a todo el territorio. Para los
experimentos, en cambio, en esta primera fase nos
centramos en el dialecto labortano, por lo que
hemos empleado los ejemplos y los textos que
provienen de las zonas donde se habla dicho
dialecto. Y de momento hemos utilizado los
ejemplos recogidos mediante los cuestionarios
y los textos literarios, ya que las grabaciones
de video no estan transcritas todav a. Cabe
resen~ar que dichos corpus estan siendo
actualizados y ampliados dentro del mencionado
proyecto, de modo que los datos presentados
en la Tabla 1 corresponden al corpus de
transcripciones labortano-estandar disponible en
el momento de realizar los experimentos.</p>
        <sec id="sec-3-1-1">
          <title>Nofrases</title>
          <p>Nopalabras
Palabras dif.</p>
          <p>Pares ltrados
Pares identicos
Pares diferentes</p>
          <p>Corpus
Tabla 1: Datos correspondientes al corpus
labortano-estandar utilizado en los
experimentos realizados hasta el momento. La
primera columna corresponde al corpus
completo. El 80 % ha sido utilizado en la fase de
aprendizaje y el 20 % restante en la fase de
test.</p>
          <p>En la Tabla 2 se presentan varios ejemplos
de frases con el n de que se vea el tipo de
diferencias que se pueden encontrar entre el
dialecto y el estandar, as como la
correspondencia palabra a palabra con que se cuenta
en dicho corpus.</p>
          <p>Este es el corpus en el que hemos centrado
nuestros primeros experimentos y con el que
hemos obtenido los resultados que
presentamos en el apartado 5.</p>
          <p>Dialecto labortano vs Euskera estandar
Leihoa estea erreusitu du.</p>
          <p>Leihoa ixtea erreusitu du.</p>
          <p>Eni galdegin daut 100 euro.</p>
          <p>Eni galdegin dit 100 euro.</p>
          <p>Ez gero uste izan nexkatxa guziek tu egiten dautatela.</p>
          <p>Ez gero uste izan neskatxa guztiek tu egiten didatela.
Tabla 2: Varios ejemplos de frases en el
corpus paralelo labortano-estandar.</p>
        </sec>
      </sec>
      <sec id="sec-3-2">
        <title>3.2. Corpus de la Biblia</title>
        <p>Otra fuente de informacion basica para
nuestro trabajo es la Biblia, que esta
publicada en euskera estandar y tambien en
dialecto labortano, lo que nos
proporciona un corpus paralelo bastante mayor que
el anterior. La version de la Biblia en
euskera estandar ha sido editada dos
veces, en 1994 y en 2004 respectivamente,
y existe una version electronica en la web
(http://www.biblija.net). En cuanto a la
version en dialecto labortano, se trata de una
adaptacion de la version estandar realizada
por Marcel Etcehandy y publicada en 2007,
y dispone tambien de una version
electronica (http://amarauna.org/biblia/). Debido a
problemas de formato, de momento solo
hemos alineado 9 libros (elegidos al azar) con
las caracter sticas que se re ejan en la Tabla
3.</p>
        <sec id="sec-3-2-1">
          <title>Node libros total</title>
          <p>Node libros disponible
Palabras totales en euskera estandar
Palabras diferentes
Libros alineados
Palabras totales en libros alineados
Palabras diferentes en libros alineados
76
66
545.700
38.069</p>
          <p>9
104.967
15.007
Tabla 3: Datos correspondientes al corpus de
la Biblia y a los libros alineados hasta la
fecha.</p>
          <p>Este corpus, al ser de mayor taman~o, nos
va a permitir realizar experimentos con
distintos taman~os de corpus paralelo, y as
conseguir estimar correlaciones entre taman~os de
corpus paralelo y calidad de la inferencia,
pero todav a no tenemos resultados que mostrar
sobre este aspecto ya que estamos en la fase
de preparacion y obtencion de informacion
de este corpus. Por otro lado, a diferencia del
corpus descrito en 3.1, en el corpus de la
Biblia no hay transcripcion palabra a palabra
tal y como se puede observar en el pequen~o
ejemplo3 que se presenta a continuacion, por
lo que la obtencion del diccionario de
palabras equivalentes se preve mas complicada.</p>
          <p>Dialecto labortano:
Euskera estandar:
\Errana dauzut: ukan
indar eta kuraia. Ez ikara, ez
izi, ni, Jauna, zure Jainkoa,
zurekin izanen bainaiz joanen
ziren toki guzietan".</p>
          <p>\Kementsu eta adoretsu
izateko esan dizut. Ez
ikaratu, ez kikildu, ni, Jauna,
zure Jainkoa, zurekin izango
bainaiz zure ibilera
guztietan".
3.3.</p>
        </sec>
      </sec>
      <sec id="sec-3-3">
        <title>Corpus de transcripciones en diversos dialectos</title>
        <p>Existen varios proyectos en el Pa s Vasco
(Ahotsak.com4 o EKE.org5, por ejemplo) que
tienen como objetivo recoger el habla
tradicional de cada zona, es decir, recopilar y
difundir testimonios orales de vasco-parlantes.
En ambos proyectos se graban y se recogen
conversaciones y/o testimonios de personas
que se expresan en su propio dialecto.</p>
        <p>Nosotros hemos creado una red de
colaboracion con Ahotsak.com para poder
recopilar y ayudar a transcribir corpus paralelos
de variantes dialectales relacionadas con la
forma estandar, ya que el objetivo de
Ahotsak.com es ir transcribiendo gran parte de los
testimonios grabados. Hasta ahora, cuentan
con 5.204 pasajes (1.462.555 palabras)
transcritos en las formas dialectales. Sin
embargo, para facilitar la busqueda se quiere
relacionar cada forma dialectal con su
correspondiente estandar, y para hacerlo de forma
(semi)automatica nos queremos valer de las
3El ejemplo corresponde al vers culo 9 del cap tulo
1 del libro de Josue.</p>
        <p>4http://www.ahotsak.com/
5http://www.eke.org/
tecnicas que estamos desarrollando y que
describimos posteriormente.</p>
        <p>Las caracter sticas de este corpus son en
parte equiparables a las del primer corpus
descrito, pero con dos diferencias resen~ables:
recoge gran variedad de dialectos, ya
que ciertas formas van cambiando casi
de pueblo a pueblo (vease el mapa en
http://ahotsak.com/herriak/mapa/)
de momento solo disponemos de la
transcripcion de las formas dialectales y
queremos obtener de forma
(semi)automatica las correspondientes formas estandar.
Una parte de la investigacion que
hacemos es determinar el m nimo de
trabajo manual (para relacionar las formas
estandar con las dialectales) necesario
para obtener unos buenos resultados
despues en la posterior sustitucion lexica.
4.</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Metodos</title>
      <p>Nuestra primera aproximacion se va a
basar en obtener pares de palabras
variante/estandar a partir de un corpus paralelo
(que quisieramos minimizar). Para ello
reutilizamos lo que hemos llamado metodos
basicos. Posteriormente inferiremos reglas
fonologicas mediantes dos metodos.
4.1.</p>
      <sec id="sec-4-1">
        <title>Metodos basicos</title>
        <p>De cara a obtener pares de palabras
equivalentes a partir de corpus paralelos vamos a
utilizar dos programas: lexdi y Giza++.</p>
        <p>
          El primero, lexdi , ha sido disen~ado y
utilizado para la migracion automatica de
textos entre diferentes ortograf as del portugues
          <xref ref-type="bibr" rid="ref5">(Almeida, Santos, y Simoes, 2010)</xref>
          , debido
al cambio de norma que se produjo en ese
idioma. Este programa trata de identi car la
equivalencia de palabras a partir de frases
paralelas. Funciona muy bien cuando los textos
son equivalentes palabra por palabra, y es por
ello que lo hemos utilizado en los
experimentos realizados hasta ahora con el corpus de
transcripciones labortano-estandar.
        </p>
        <p>Adicionalmente, lexdi tambien calcula
los cambios de ngramas y sus frecuencias,
obteniendo resultados de este tipo: 76 ait
-&gt;at; 39 dautz -&gt;diz; lo que indica que el
ngrama ait ha cambiado a at 76 veces en el
corpus y que dautz ha cambiado 39 veces a
diz.</p>
        <p>Estos resultados pueden expresar cambios
(morfo)fonologicos regulares entre los textos,
y han sido explotados en el primero de los
metodos de inferencia que presentamos a
continuacion.</p>
        <p>Giza++6 es una conocida herramienta
para inferir diccionarios, con probabilidades de
traduccion, a partir de corpus paralelos. Lo
queremos comparar con lexdi dado que el
corpus de la Biblia con el que contamos es
un corpus paralelo divergente y de mayor
taman~o, pero todav a no podemos presentar
resultados sobre dicha comparacion.
4.2.</p>
      </sec>
      <sec id="sec-4-2">
        <title>Metodos de inferencia</title>
        <p>Estamos experimentando con dos metodos
de inferencia:
1. Inferencia de reglas fonologicas basada
en substrings
2. Inferencia usando programacion logica
inductiva sobre pares de palabras
equivalentes</p>
        <p>
          El metodo baseline consiste en aprender
las equivalencias de pares diferentes en el
corpus de aprendizaje (corpus paralelo) y
sustituirlas en el de test, suponiendo que si no
se ha aprendido la forma estandar
correspondiente a la variante es la propia variante. Este
metodo tiene como resultado buena precision
y baja cobertura. Los dos metodos que
proponemos parten de una lista de equivalencia de
palabras o de substrings obtenida por las
herramientas basicas y tratan de inferir reglas
fonologicas de reemplazamiento que puedan
ser compiladas por xfst de Xerox (Beesley
y Karttunen, 2002) o foma (software libre,
          <xref ref-type="bibr" rid="ref3">(Hulden, 2009)</xref>
          ).
4.2.1. Inferencia de reglas fonologicas
basada en substrings.
        </p>
        <p>En principio se basa en los cambios de
ngramas que obtiene lexdi . Hay varias
formas de transformar esa salida de lexdi en
reglas de reemplazamiento que se compilan
a transductores nitos. Estamos teniendo en
cuenta los siguientes factores:</p>
        <p>Limitar los cambios a tener en
cuenta a aquellos que tienen un m nimo de
frecuencia (por ejemplo, dos o tres). Si
aumentamos el m nimo mejoraremos la
precision, pero perderemos cobertura.
Limitar el numero de reglas que
pueden ser aplicadas a la misma palabra.</p>
        <p>Por ejemplo, la correspondencia
agerkuntza/agerpena puede expresarse
mediante dos reglas: rkun -&gt;rpen y ntza
-&gt;na, pero permitir varios cambios
puede producir ruido innecesario y bajar la
precision.</p>
        <p>La forma de aplicar las reglas:
secuencialmente o paralelamente.</p>
        <p>Hacer que los cambios sean de longitud
m nima y condicionados por el contexto.
4.2.2. Inferencia usando</p>
        <p>programacion logica inductiva.</p>
        <p>El segundo metodo consiste en los
siguientes pasos:
1. Alinear los pares de palabras letra por
letra usando la m nima distancia de
edicion.
2. Extraer un conjunto de reglas
fonologicas.
3. Por cada regla, buscar contraejemplos.
4. Buscar la restriccion de contexto m nima
que resuelva los contraejemplos.</p>
        <p>Por ejemplo, si tenemos los pares
emaiten/ematen e igorri/igorri, en el primer paso
se detecta el cambio i/0, que en el paso dos se
convierte en la regla i -&gt;0. Pero ese cambio
no se puede aplicar con igorri, por lo que la
regla se transforma para evitar que sea
aplicada. Este metodo tiene la ventaja de
explotar las formas que son identicas en el dialecto
y en el estandar.
5.</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>Resultados y trabajos futuros</title>
      <p>Hemos centrado los experimentos en el
corpus descrito en el apartado 3.1 con el n
de testear y evaluar los metodos descritos en
el apartado 4. Los primeros resultados nos
muestran una mejora respecto al metodo
baseline, pero todav a deben ser mejorados para
utilizarlos en herramientas computacionales
efectivas.</p>
      <p>La Tabla 4 muestra los resultados
obtenidos. Dichos resultados corresponden tanto al
metodo baseline, como a los mejores
resultados obtenidos con cada una de las propuestas
de inferencia de reglas descritas y se expresan
en terminos de precision (precision ),
cobertura (recall ) y la medida-F (F-score), que es la
combinacion de ambas. En los tres casos, el
proceso de aprendizaje se ha llevado a cabo
con el 80 % del corpus, y el test, cuyos
resultados son los que see muestran en la Tabla 4,
se ha realizado sobre el 20 % restante.</p>
      <p>Aunque no se presentan mas que los
mejores resultados obtenidos con cada metodo, el
numero de experimentos realizados con
ambos metodos ha sido numeroso, sobre todo
con el metodo de inferencia de reglas basada
en substrings, debido a los diferentes factores
que se pueden tener en cuenta para inferir las
reglas fonologicas. Dichos experimentos nos
muestran que:</p>
      <p>Disminuir la m nima frecuencia exigida
a un cambio para obtener una regla
fonologica a partir de el, aumenta
notablemente la cobertura, pero tambien hace
que disminuya la precision, con lo que el
resultado en terminos de F-score apenas
mejora.</p>
      <p>La aplicacion de mas de una regla en una
palabra no parece aportar incrementos
importantes en la mejora de los
resultados.</p>
      <p>El modo de aplicacion, secuencial o
paralelo, de las reglas (cuando se aplica mas
de una regla en la misma palabra)
presenta resultados muy similares, aunque
algo mejores si la aplicacion es paralela.
Por ultimo, minimizar la longitud de los
cambios y hacer que sean condicionados
por el contexto, obtiene claramente
mejores resultados.</p>
      <p>En los primeros experimentos con este
metodo de inferencia, ya pudimos comprobar que
la aplicacion exclusivamente de las reglas
fonologicas no mejoraba los resultados del
metodo baseline, debido a que la precision era
excesivamente baja (para cada termino a
sustituir, el numero de candidatos era a
menudo elevado). Ello nos llevo a aplicar un
postltro al proceso, basado en la frecuencia de
los candidatos en euskera estandar7. El ltro
aplicado es muy simple: si hay mas de un
candidato se elige el mas frecuente, pero a pesar
de su simplicidad se mejoran los resultados y
se consigue superar el baseline tal y como se
puede ver en los resultados presentados en la
Tabla 4.</p>
      <p>7La frecuencia de cada termino la hemos
obtenido de un corpus de un diario de noticias editado en
euskera.</p>
      <p>Precision</p>
      <p>Recall</p>
      <p>F-score
Baseline
Metodo 1
Metodo 2
Tabla 4: Mejores resultados (en terminos
de F-score) obtenidos con ambos metodos
de inferencia en los experimentos realizados
con el corpus de transcripciones
labortanoestandar.</p>
      <p>Con respecto al segundo metodo de
inferencia, basado en programacion logica
inductiva, los resultados obtenidos han sido
mejores, y ademas, con este metodo no es
necesaria la aplicacion del ltro posterior. El motivo
fundamental es que este metodo no solo
utiliza la informacion de los pares diferentes, sino
tambien la de los pares iguales en el dialecto
y en el estandar.</p>
      <p>
        Se puede consultar informacion mas
detallada tanto de los metodos propuestos como
de la evaluacion realizada en
        <xref ref-type="bibr" rid="ref2">(Hulden et al.,
2011)</xref>
        .
      </p>
      <p>Todav a nos queda mucho trabajo por
realizar en el campo de esta investigacion. La
aplicacion de los metodos descritos al corpus
de la Biblia nos va a permitir precisar hasta
que punto es determinante que la
transcripcion entre dialecto y estandar sea palabra a
palabra, y que taman~o de corpus es necesario
para obtener resultados que indiquen que es
posible conseguir herramientas automaticas
de sustitucion lexica.</p>
      <p>Ademas, creemos que los metodos
utilizados deben ser combinados con otros que
ineran relaciones entre lemas y morfemas
(variantes y formas estandar), variantes de
paradigmas y que contrasten esas inferencias con
corpus de variantes (sin que sean corpus
paralelos) mas amplios.</p>
    </sec>
    <sec id="sec-6">
      <title>Bibliograf a</title>
      <p>Almeida, J. J, A. Santos, y A. Simoes. 2010.</p>
      <p>Bigorna{a toolkit for orthography
migration challenges. En Seventh International
Conference on Language Resources and
Evaluation (LREC2010), Valletta, Malta.
Beesley, K. R y L. Karttunen. 2002.
Finitestate morphology: Xerox tools and
techniques. Studies in Natural Language
Processing. Cambridge University Press.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Goldsmith</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          <year>2001</year>
          .
          <article-title>Unsupervised learning of the morphology of a natural language</article-title>
          .
          <source>Computational linguistics</source>
          ,
          <volume>27</volume>
          (
          <issue>2</issue>
          ):
          <volume>153</volume>
          {
          <fpage>198</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Hulden</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>I. Alegria</surname>
          </string-name>
          , I. Etxeberria, y
          <string-name>
            <given-names>M.</given-names>
            <surname>Maritxalar</surname>
          </string-name>
          .
          <year>2011</year>
          .
          <article-title>An unsupervised method for learning morphology of variants from the standard morphology and a little parallel corpus</article-title>
          .
          <source>En (EMNLP workshop)</source>
          Dialects-2011 | First Workshop on Algorithms and
          <article-title>Resources for Modelling of Dialects and Language Varieties</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Hulden</surname>
          </string-name>
          , Mans.
          <year>2009</year>
          .
          <article-title>Foma: a nite-state compiler and library</article-title>
          .
          <source>En Proceedings of the 12th Conference of the European Chapter of the Association for Computational Linguistics: Demonstrations Session, paginas</source>
          <volume>29</volume>
          {
          <fpage>32</fpage>
          , Athens, Greece. Association for Computational Linguistics.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Johnson</surname>
          </string-name>
          , Mark.
          <year>1984</year>
          .
          <article-title>A discovery procedure for certain phonological rules</article-title>
          .
          <source>En Proceedings of the 10th international conference on Computational linguistics, COLING '84, paginas</source>
          <volume>344</volume>
          {
          <fpage>347</fpage>
          .
          <article-title>Association for Computational Linguistics</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Kestemont</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          , W. Daelemans, y G. De Pauw.
          <year>2010</year>
          .
          <article-title>Weigh your words| memory-based lemmatization for Middle Dutch</article-title>
          .
          <source>Literary and Linguistic Computing</source>
          ,
          <volume>25</volume>
          (
          <issue>3</issue>
          ):
          <volume>287</volume>
          {
          <fpage>301</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Koskenniemi</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          <year>1991</year>
          .
          <article-title>A discovery procedure for two-level phonology</article-title>
          .
          <source>Computational Lexicology</source>
          and Lexicography: A Special Issue Dedicated to Bernard Quemada, paginas
          <volume>451</volume>
          {
          <fpage>446</fpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>