<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Significado, distribución y frecuencia en la categoría preposicional. Una aproximación computacional</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Francesc Reina González</string-name>
          <email>frareina@hotmail.com</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Doctorando de Ciencia Cognitiva y Lenguaje. Departamento de Lingüística de la Universidad de Barcelona</institution>
        </aff>
      </contrib-group>
      <abstract>
        <p>Since the first definitions of the linguistic theory of the preposition has been considered a controversial linguistic category. The origin of this discussion comes from the difficulty to explain, simultaneously, its supposed syntactic nuclearity and its lexical-semantic value. The mathematical tools that come from the processing of natural language, corpus linguistics, as well as the algorithms of machine learning are allowing us to approach the prepositional meaning with very revealing results, displacing the categorical debate. My research suggests that prepositional meaning can be gradual so that its distribution in the syntactic sequences will be decisive in its characterization.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>La preposición ha sido,
tradicionalmente, una categoría
lingüística controvertida desde su
conducta sintáctica hasta su valor
léxicosemántico. Estos conflictos descriptivos
han estimulado aproximaciones teóricas
muy apriorísticas en la explicación de su
comportamiento dentro del español y en
lenguas de otras familias tipológicas
(con presencia de caso morfológico y
preposiciones, o con posposiciones).
Ambas circunstancias, cierta imposición
empírico-teórica y las dificultades
descriptivas propician, según creo, el
desplazamiento del debate categorial y la
búsqueda desde otras perspectivas más
esclarecedoras en sus predicciones
empíricas y teóricas.</p>
    </sec>
    <sec id="sec-2">
      <title>2. De la teoría lingüística a las aproximaciones computacionales</title>
      <p>
        Hace ya más de medio siglo que desde
diferentes perspectivas de la teoría
lingüística, la gramática generativista o la
gramática cognitiva, la preposición ha
supuesto muchos retos de distinta
condición empírica y estilo analítico. Los
trabajos categoriales pioneros de
        <xref ref-type="bibr" rid="ref6 ref7">(Chomsky 1970, 1981)</xref>
        ,
        <xref ref-type="bibr" rid="ref12">(Jackendoff 1977)</xref>
        o
        <xref ref-type="bibr" rid="ref18">(Van Riemsdijk 1978)</xref>
        incluyen la
preposición entre las categorías léxicas
mayores con los rasgos [-N -V]. Además,
la distinción empírico-conceptual, entre
categorías léxicas y funcionales de finales
de la década de los años 80 del siglo XX,
permitió abrir una línea de investigación en
la cartografía sintáctica y los grados de
interpretación en piezas lingüísticas como
la preposición, ya que sabemos que
comparte rasgos de ambas.
      </p>
      <p>
        Sendas caracterizaciones binarias de la
preposición [-N –V] o [± F ± L] han estado
sometida, igualmente, a discusiones de
diversa consideración. Y, de hecho, todavía
sigue viva. Quizás una de las propuestas
más radicales, al negarle su lugar entre las
categorías léxicas, fue la de
        <xref ref-type="bibr" rid="ref1">(Mark C. Baker
2003)</xref>
        .
      </p>
      <p>
        Mientras tanto, el progreso en los
procedimientos y las heurísticas
computacionales (estadísticos o
algorítmicos) han permitido investigar el
papel de esta clase de partículas con otros
propósitos y con otras consecuencias
explicativas. Se pueden leer una multitud de
monografías sobre la conformación de esos
recursos, desde
        <xref ref-type="bibr" rid="ref10">(Grishman 1986)</xref>
        hasta
        <xref ref-type="bibr" rid="ref8">(Clark, Fox y Lappin 2013)</xref>
        , pasando por los
clásicos de (Charnik 1993) y el didáctico
compendio de (Manning y Schütze (1999).
Además se han desarrollado proyectos
aplicados globales en el tratamiento
computacional de esta categoría. Una de la
más exhaustivas para el inglés fue The
preposition Project de Litowski
(http://www.clres.com/prepositions.html),
cuyo objetivo fue la desambiguación de la
semántica preposicional (un problema
esencial en la traducción automática, por
ejemplo).
      </p>
      <p>
        Asimismo, desde los años noventa del
siglo XX, se han acumulado evidencias
descriptivas nuevas, no solo en la teoría
lingüística más formalista, sino en otras que
se asientan en cuestiones y hechos
semánticos. Sería el caso de
(
        <xref ref-type="bibr" rid="ref21">ZelinskyWibblet 1993</xref>
        ),
        <xref ref-type="bibr" rid="ref20">(Saint-Dizier 2006)</xref>
        , o las
compilaciones de
        <xref ref-type="bibr" rid="ref14">(Kurzon &amp; Adler 2008)</xref>
        y
(
        <xref ref-type="bibr" rid="ref11">Hagège 2010</xref>
        ) para cualquier tipo de
adposición (pre- o post- posicional). Una de
las mejores síntesis del estado del arte en el
ámbito computacional fue el monográfico
de
        <xref ref-type="bibr" rid="ref2">(Baldwin, Timothy; Kordoni; Valia y
Villavicencio, Aline 2009)</xref>
        recogido en la
influyente revista Computational
Linguistics. Allí se despliega un abanico de
cuestiones sobre cómo procesa esta clase de
partículas, sobre el especial significado que
aporta, sobre el valor de su frecuencia en los
corpus y sobre la diversidad de aplicaciones
que se ven afectadas por la comprensión de
esta clase de palabras.
      </p>
      <p>
        Por último, con la progresiva
construcción de corpus lingüísticos en
diferentes lenguas, incluso antes del actual
desarrollo de la minería de datos o Big Data,
se han venido multiplicando las
generalizaciones sobre la distribución
sintáctica preposicional así como de los
valores semánticos de las preposiciones en
multitud de lenguas. En ese sentido, tanto la
nueva semántica formal y distribucional,
véase (Boleda, G. and A. Herbelot 2016),
como las herramientas de aprendizaje
automático (conocidas como Machine
Learning), véase
        <xref ref-type="bibr" rid="ref17">(Mikolov 2014)</xref>
        , están
favoreciendo un acercamiento más afinado
a la multitud de datos heterogéneos que
suelen conformar la preposición.
      </p>
    </sec>
    <sec id="sec-3">
      <title>3. Frecuencia, distribución y significado de las preposiciones.</title>
    </sec>
    <sec id="sec-4">
      <title>La hipótesis de la gradualidad semántica</title>
      <p>La perspectiva metodológica se enmarca en
una visión empírica y computacional
respecto de los recursos de observación,
predicción, medición y generalización de
los hechos lingüísticos. Así, y a partir de
tres conceptos recurrentes en el
procesamiento del lenguaje natural, como la
frecuencia de piezas léxicas, su distribución
y el significado propongo una hipótesis
general para la semántica que subyace a las
preposiciones en español.</p>
      <p>El enunciado hipotético es el siguiente:
los valores semánticos de las preposiciones
del español pueden ordenarse de manera
gradual que alcanza desde la funcionalidad
completa hasta la lexicidad. En esta
secuencia, y según la diversidad de
construcciones, sintagmas y contextos,
podemos identificar y medir ese valor a
partir de la distribución ontosemántica de
los SSNN u otras clases de sintagmas que
coocurran.</p>
      <p>La gradualidad oscila entre los valores y
los usos más funcionales o vacíos como las
preposiciones que conforman las locuciones
prepositivas, la a del CD/CI o el por del
complemento agente en las oraciones en
voz pasiva, y los valores y los usos locativos
de a, de, en, por, hacia, sobre o hasta, los
temporales de a, entre, bajo, desde, durante
o tras, o los nocionales de mediante, por y
para, considerados léxicos o plenos.</p>
      <p>El desarrollo de esta hipótesis se articula
en torno a seis objetivos que se relacionan a
continuación.</p>
      <p>a). Presentar los elementos
historiográficos, descriptivos y teóricos de
la categoría gramatical a lo largo de los
hitos más valiosos de la tradición y de los
modelos de investigación lingüística más
recientes.</p>
      <p>b). Caracterizar las limitaciones de las
propuestas que se han ido aportando en el
análisis de casos concretos para la
preposición en español y en otras lenguas.</p>
      <p>c). Medir la frecuencia de similitudes
semánticas de las piezas preposicionales, en
algunas estructuras sintáctico-argumentales
con el uso de herramientas de algoritmos
probabilísticos del campo del aprendizaje
automático para el procesamiento del
lenguaje natural en corpus lingüísticos (al
estilo de redes neurales, como Word2vec o
Gcluto). (Experimentos 1 y 3).</p>
      <p>
        d). Observar, identificar y analizar
posibles correlaciones semánticas a partir
de valores como la entropía en corpus del
español y a través de clasificaciones
ontosemánticas estandarizadas procedentes
de la red ontosemántica de Wordnet
(experimento 2). Para su funcionamiento y
organización se puede leer
        <xref ref-type="bibr" rid="ref9">(Fellbaum
2006)</xref>
        .
      </p>
      <p>e). Proponer, a la luz de los resultados
anteriores, un eje-espacio gradual de
valores-piezas preposicionales desde la
funcionalidad absoluta (marcadoras de
caso, por ejemplo) hasta el significado más
cuantificable (valores locativo-espaciales,
temporales o nocionales). Ese eje tendría
tres zonas continuas de significado:
funcional, semifuncional y léxico.</p>
      <p>f). Explorar las posibilidades
interlingüísticas de la propuesta (con
lenguas que admitan caso, preposiciones o
posposiciones) y comprobar su capacidad
generalizadora.</p>
    </sec>
    <sec id="sec-5">
      <title>4. Trabajo metodológico y experimentos</title>
      <p>Se están realizando tres experimentos
diferentes con objeto de verificar
empíricamente las diferentes fases y/o
grados semánticos de las preposiciones, tal
y como se estipula en la hipótesis.</p>
      <p>
        El primero de ellos ha analizado la
gradualidad en el caso de tres
preposiciones: a, hacia y hasta en los
contextos sintácticos para 90 verbos de
movimiento del español. A través de la
herramienta CLUTO (agrupación por Word
Embedding), véase
        <xref ref-type="bibr" rid="ref13">(Karypis 2003)</xref>
        para su
funcionamiento, hemos procedido a
realizar agrupaciones (clustering) de 71.000
sintagmas preposicionales (SSPP)
disponibles en los corpus WikiCorpus,
Ancora y Semsem, en 3, 4 y 5 grupos. Estos
recursos de “agrupación” se fundan en el
“Word embedding”. El objetivo de este
procedimiento es cuantificar y categorizar
propiedades semánticas entre elementos
lingüísticos a partir de los contextos donde
coocurren y que se representarán en
vectores. Estos modelos de espacio
vectorial representan (“embed”, incrustan)
palabras en un espacio vectorial continuo en
el que palabras semánticamente similares se
asignan a puntos cercanos.
      </p>
      <p>Los resultados han sido muy
satisfactorios en la medida en que
porcentualmente se verifican y se
confirman las agrupaciones realizadas por
dos anotadores humanos. El aprendizaje
automático acredita la predicción humana
en la asignación de significados. Nos
encontramos con un 51,65 % para la
preposición a, un 55,17 para la preposición
hacia y un 64,6 para la preposición hasta.</p>
    </sec>
    <sec id="sec-6">
      <title>Gráfico 1</title>
      <p>Porcentajes de
coincidencia de agrupación
para las tres preposiciones
80
60
40
20
0</p>
      <p>A, HACIA y HASTA</p>
      <p>
        En el segundo experimento hemos
utilizado el concepto de entropía (H) de
        <xref ref-type="bibr" rid="ref19">(Claude E. Shannon 1948)</xref>
        , procedente de la
teoría de la información, para medir la clase
de significado que contienen los SSPP en
los verbos de régimen en comparación con
otras clases de verbos. Hemos seleccionado
un total de 140 verbos, de los cuales 48
poseen SSPP considerados de régimen
verbal (obligatorios argumentalmente con
una determinada preposición). Hemos
realizado una búsqueda de SSPP en el
Corpes anotado de la RAE que se ha
cruzado con el Wikicorpus, es decir, se ha
comprobado la coincidencia entre ambos
repertorios. Y por último, los hemos
clasificado en tres tipos: (i) los funcionales,
cuya preposición es la a (ii) los
semifuncionales, complementos de régimen
verbal con de, en o con, y (iii) los léxicos,
complementos adjuntos o circunstanciales,
con preposiciones como de, en, con, sin, a.
      </p>
      <p>Una vez obtenidos los ficheros con los
SSPP coincidentes para cada verbo se
procede a su asignación semántica según las
siguientes clases: humano, entidad
abstracta, locativo, temporal, evento o
actividad, objeto o artefacto, y modalidad
(elegidas, por su importancia
representativa, de la red ontosemántica de
Wordnet). Los datos obtenidos se
introducen en una tabla con la función
logarítmica de la entropía que se aplica a los
tres grupos, funcionales (F),
semifuncionales (SF) y léxicos (L).</p>
      <p>Las cifras indican que la entropía, es
decir, el grado de azar o desorden de esos
subgrupos es el más bajo en los funcionales
(1,568), el más alto en los léxicos (2,512), e
intermedio en los semifuncionales (2,321),
donde se encuentran los verbos de régimen.
La predicción coincide con la descripción
gramatical: cuánta más restricción
argumental tiene el verbo más previsible es
el significado del SN seleccionado. La
preposición, por tanto, sigue la gradación
semántica y la medida entrópica está
justificada como recurso explicativo.</p>
      <p>TIPOS DE
SSPP
Humanos
Abstractos
Locativos
Temporales
Eventos
Objetos
Modales
TOTAL
Entropía
(H)</p>
    </sec>
    <sec id="sec-7">
      <title>Tabla 1</title>
      <p>El tercer experimento está en curso y en
fase explorativa. El propósito es intentar
que parte del reconocimiento entrópico del
segundo experimento se pueda producir de
manera automática gracias a un parset, es
decir, que los tres grupos de SSPP emerjan
sin la necesidad de la intervención humana,
o con un grado de reconocimiento
representativo.</p>
      <p>Al final de la investigación,
procederemos a elegir algunas lenguas con
caso y preposición (alemán, ruso o polaco),
posposiciones (vasco, chino, húngaro o
hindi), o con muy pocas preposiciones
(igbo, hablada en Nigeria) y someterlas al
contraste experimental que hemos realizado
con el español.</p>
    </sec>
    <sec id="sec-8">
      <title>Agradecimientos</title>
      <p>A mis directores de tesis la Dra. Irene
Castellón y el Dr. Lluís Padró por sus ideas,
sugerencias y orientaciones; y al Dr.
Horacio Rodríguez por sus comentarios y su
generosidad durante el Simposio.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Baker</surname>
            ,
            <given-names>Mark C.</given-names>
          </string-name>
          <year>2003</year>
          .
          <string-name>
            <given-names>Lexical</given-names>
            <surname>Categories</surname>
          </string-name>
          . Verbs, nouns and adjectives, Cambridge University Press, Cambridge.
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Baldwin</surname>
          </string-name>
          , Timothy; Kordoni, Valia y Villavicencio,
          <year>Aline 2009</year>
          .
          <article-title>Prepositions in Applications: A Survey and Introduction to the Special Issue</article-title>
          , Computational Linguistics,
          <volume>35</volume>
          (
          <issue>2</issue>
          ), páginas
          <fpage>119</fpage>
          -
          <lpage>149</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Boleda</surname>
          </string-name>
          , Gemma y Herbelot,
          <year>Aurélie 2017</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <given-names>Formal</given-names>
            <surname>Distributional Semantics</surname>
          </string-name>
          : Introduction to Special Issue, Computational Linguistics,
          <volume>42</volume>
          (
          <issue>4</issue>
          ), páginas
          <fpage>619</fpage>
          -
          <lpage>635</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Charniak</surname>
            ,
            <given-names>Eugene</given-names>
          </string-name>
          <year>1993</year>
          .
          <article-title>Statistical Language Learning</article-title>
          , The MIT Press, Cambridge.
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Chomsky</surname>
          </string-name>
          , Noam.
          <year>1970</year>
          .
          <article-title>Remarks on Nominalization. En Jacobs, Roderick A. and</article-title>
          <string-name>
            <surname>Rosenbaum</surname>
          </string-name>
          , Peter S. (eds.), Readings in English Transformational Grammar,
          <fpage>páginas184</fpage>
          -
          <lpage>221</lpage>
          . Ginn, Boston.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Chomsky</surname>
            ,
            <given-names>Noam</given-names>
          </string-name>
          <year>1981</year>
          . Lectures on Government and Binding, Foris, Dordrecht.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Clark</surname>
          </string-name>
          , Alexander; Fox, Chris y Lappin,
          <year>Shalom 2013</year>
          .
          <article-title>The Handbook of Computational Linguistics and Natural Language Processing</article-title>
          , Wiley-Blackwell, Oxford.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Fellbaum</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          <year>2006</year>
          .
          <article-title>WordNet(s</article-title>
          . En Keith Brown, (Ed.)
          <source>Encyclopedia of Language &amp; Linguistics, 2da. edición</source>
          , Vol.
          <volume>13</volume>
          , páginas 665- 670, Elsevier, Oxford.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Grishman</surname>
            ,
            <given-names>Ralhp 1986. Computational</given-names>
          </string-name>
          <string-name>
            <surname>Linguistics</surname>
          </string-name>
          . An introduction, Cambridge University Press, Cambridge.
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Hagège</surname>
            ,
            <given-names>Claude</given-names>
          </string-name>
          <year>2010</year>
          . Adpositions, Oxford University Press, Oxford.
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Jackendoff</surname>
            ,
            <given-names>Ray</given-names>
          </string-name>
          <year>1977</year>
          .
          <article-title>X' Syntax: A Study of Phrase Structure</article-title>
          , The MIT Press, Cambridge.
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Karypis</surname>
            ,
            <given-names>George</given-names>
          </string-name>
          <year>2003</year>
          .
          <article-title>CLUTO. A clustering toolkit</article-title>
          , University of Minnesota,
          <source>Technical Report</source>
          ,
          <fpage>02</fpage>
          -
          <lpage>017</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Kurzon</surname>
            ,
            <given-names>Dennis</given-names>
          </string-name>
          &amp; Adler,
          <string-name>
            <surname>Silvia</surname>
          </string-name>
          <year>2008</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Litkowski</surname>
            , Ken y
            <given-names>O.</given-names>
          </string-name>
          <string-name>
            <surname>Hargraves</surname>
            ,
            <given-names>O.</given-names>
          </string-name>
          <year>2005</year>
          .
          <article-title>The Preposition Project</article-title>
          .
          <source>En ACL-SIGSEM Workshop on the Linguistic Dimensions of Prepositions and their Use in Computational Linguistics Formalisms and Applications</source>
          , páginas
          <volume>171</volume>
          -179, Colchester.
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Mannig</surname>
          </string-name>
          , Christopher D. y Schütze,
          <year>Hinrich 1999</year>
          .
          <article-title>Foundations on statistical natural languages processing</article-title>
          , The MIT Press, Londres.
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <surname>Mikolov</surname>
            , Tomas; Le,
            <given-names>Quoc</given-names>
          </string-name>
          <year>2014</year>
          .
          <article-title>Distributed Representations of Sentences and Documents</article-title>
          ,
          <source>Proceedings of the 31th Internacional Conference on Machine Learning</source>
          , vol.
          <volume>32</volume>
          (
          <issue>2</issue>
          ), pàgines
          <fpage>1118</fpage>
          -
          <lpage>1196</lpage>
          , Beijing.
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <surname>Riemsdijk</surname>
          </string-name>
          , Van, Henk
          <year>1978</year>
          .
          <article-title>A Case Study in Syntactic Markedness: the Binding Nature of Prepositional Phrases</article-title>
          , Foris, Dordrecht.
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Shannon</surname>
            ,
            <given-names>Claude E.</given-names>
          </string-name>
          <year>1948</year>
          .
          <source>A Mathematical Theory of Communication</source>
          ,
          <source>The Bell System Technical Journal</source>
          , Vol.
          <volume>27</volume>
          , páginas 379-423,
          <fpage>623</fpage>
          -
          <lpage>656</lpage>
          , julio y octubre.
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <string-name>
            <surname>Saint-Dizier</surname>
          </string-name>
          ,
          <year>Patrick 2006</year>
          . Syntax and Semantics of prepositions, Springer, Dordrecht.
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          <string-name>
            <surname>Zelinsky-Wibblet</surname>
          </string-name>
          , Cornelia (ed.)
          <year>1993</year>
          .
          <article-title>The semantics of Prepositions</article-title>
          , Mouton de Gruyter, Berlín.
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>