<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Extraccion de Datos Enlazados desde Informacion No Estructurada Aplicando Tecnicas de PLN y Ontolog as</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Aram s Rodr guez-Blanco</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Alfredo Simon-Cuevas</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Wenny Hojas-Mazo</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jose M. Perea-Ortega</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Universidad Tecnologica de La Habana Jose Antonio Echeverr a</institution>
          ,
          <addr-line>Cujae, La Habana</addr-line>
          ,
          <country country="CU">Cuba</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Universidad de Extremadura</institution>
          ,
          <addr-line>Badajoz, Espan~a</addr-line>
        </aff>
      </contrib-group>
      <fpage>80</fpage>
      <lpage>91</lpage>
      <abstract>
        <p>In this work a method for the automatic extraction of linked data from unstructured textual information in Spanish and English language is presented. The method is based on the extraction of a conceptualization from the text in form of concept map, which is transformed later in a RDF data model. In the conceptualization extraction several NLP techniques are applied and the possibility to use an ontology is o ered, for increasing the capacities of information extraction from the text. Several tests using three collections of texts in Spanish and English were carried out for evaluating the proposal, with promising results in the concepts and relationships extraction and showing the bene ts of the use of ontologies as external knowledge resource.</p>
      </abstract>
      <kwd-group>
        <kwd>linked data extraction</kwd>
        <kwd>NLP</kwd>
        <kwd>concept map</kwd>
        <kwd>and ontologies</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>Introduccion</title>
      <p>
        El surgimiento de aplicaciones inteligentes, tales como la busqueda semantica,
y la popularidad de las tecnolog as de la Web Semantica estan requiriendo cada
vez mas que el contenido en la Web sea reorganizado a traves de datos semanticos
[
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. El paradigma de los Datos Enlazados (DE) (linked data en ingles) ha
evolucionado como un poderoso facilitador en la transicion de la actual Web (orientada
a documentos) a una Web de datos interconectados [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. En este sentido, los DE
se han convertido en un activo de gran valor para la busqueda, el analisis, la
ingenier a del conocimiento, la integracion y la recuperacion de informacion. La
extraccion de informacion en fuentes no estructuradas, semi-estructuradas o
estructuradas y su descripcion en un modelo de datos RDF son tareas claves en
el ciclo de vida de los DE [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. Los DE son generalmente construidos a partir del
minado de fuentes de informacion semi-estructuradas, como Wikipedia donde
DBpedia [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ] es el referente principal, estructuradas como las bases de datos [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ],
y en menor medida a partir de contenido textual no estructurado. La extraccion
de DE a partir de fuentes textuales se ha abordado en [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], pero estas
soluciones son aplicables a contenido en ingles y presentan algunas limitaciones en
cuanto a la cantidad de informacion que puede ser extra da, as como en los
mecanismos disen~ados para ello. La ausencia de propuestas para extraer DE desde
textos en espan~ol, no posibilita aprovechar el volumen de informacion
actualmente disponible en ese idioma, siendo esta situacion una de las motivaciones de
este trabajo. Un ejemplo de esta necesidad y tambien motivacion, lo constituye
DBpedia-LatAm1, como iniciativa que se une al esfuerzo colaborativo impulsado
desde DBpedia para extraer DE desde art culos de Wikipedia2, pero con enfasis
en los documentos escritos en espan~ol.
      </p>
      <p>
        En este trabajo se presenta un metodo para extraer DE a partir de
contenido textual no estructurado escrito en espan~ol e ingles, basado en la extraccion
automatica de una conceptualizacion del texto, representada en forma de
Mapa Conceptual (MC) [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ], la cual es posteriormente transformada en un modelo
de datos RDF. Los MC son un tipo de grafo de conocimiento no formalizado
semanticamente, donde el conocimiento se representa en lenguaje natural y se
estructura a traves de nodos que representan conceptos y relaciones entre ellos
formando proposiciones. Los conceptos pueden representar entidades, eventos,
objetos o regularidad percibida de ellos, y las proposiciones son declaraciones
(unidades semanticas) constituidas por dos o mas conceptos interconectados
mediante una relacion dirigida y etiquetada por una frase-enlace que de ne el tipo
de relacion [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ]. Estos elementos indican la existencia de similitudes estructurales
entre el MC y el grafo subyacente al modelo de datos RDF, ya que este
ultimo se basa en tripletas (sujeto, predicado, objeto) y los MC en proposiciones
(concepto, frase-enlace, concepto), lo que sirve de fundamento para disen~ar una
propuesta de extraccion de DE bajo la perspectiva de los MC. El metodo consta
de tres fases: pre-procesamiento, extraccion de la conceptualizacion y
genera1 http://es-la.dbpedia.org/home/
2 http://es.wikipedia.org/wiki/Wikipedia
cion del modelo RDF. En las dos primeras se aplican un conjunto de tecnicas
de Procesamiento de Lenguaje Natural (PLN), tales como: analisis sintactico
super cial y de dependencias, reconocimiento de entidades, patrones ling sticos,
entre otras, algunas de ellas incluidas en propuestas similares [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ],
pero no integradas en una misma solucion. Tambien brinda la posibilidad de
procesar textos en idioma ingles y espan~ol, a diferencia de las propuestas
reportadas en [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], dirigidas solo a textos en ingles, y de usar una
ontolog a OWL como recurso de conocimiento externo para apoyar la
extraccion de conceptos y relaciones del texto, siendo esta otra de las contribuciones
de la propuesta. Este metodo no solo posibilita extraer datos que representen
entidades, como principalmente se realiza en [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], sino que tambien permite
extraer otros conceptos que pueden ser utiles para ampliar la informacion
asociada a las entidades y facilitar la identi cacion de v nculos entre ellas. Por otra
parte, tambien incluye mecanismos para identi car relaciones semanticas, ya
sean taxonomicas y no taxonomicas, signi cando una ventaja respecto a
trabajos similares [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ][
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ]. El metodo fue evaluado mediante pruebas
realizadas con tres colecciones formadas por resumenes en espan~ol e ingles, y
textos mas extensos en ingles sobre temas de Inteligencia Arti cial (IA). Los
resultados obtenidos se muestran alentadores, alcanzandose en la mayor a de las
colecciones valores de precision superiores al 90 % en la extraccion de conceptos
y al 50 % en la extraccion de proposiciones. En las pruebas realizadas tambien
se constataron los bene cios del uso de una ontolog a en cuanto al aumento de
la cantidad de informacion extra da y a la calidad de su obtencion.
      </p>
      <p>El resto del trabajo se organiza segun se describe a continuacion. En la
Seccion 2 se describen y analizan trabajos relacionados con la propuesta. En la
Seccion 3 se describe la solucion propuesta y las fases que la componen. En la
Seccion 4 se presentan y analizan los resultados de las pruebas realizadas. Las
conclusiones se exponen en la Seccion 5.
2.</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajos Relacionados</title>
      <p>
        La extraccion automatica de DE a partir de contenido textual no
estructurados ha sido un tema abordado con anterioridad en [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], pero estas soluciones
son aplicables mayoritariamente a textos en idioma ingles, no identi candose
propuestas para textos en espan~ol. En [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ] se reporta una solucion para extraer
DE a partir de textos del dominio de la ciberseguridad, en la cual la extraccion de
terminos y conceptos se realiza aplicando un reconocedor de entidades adaptado
para reconocer clases de entidades asociadas a ese dominio. Los v nculos entre las
entidades se identi can mediante relaciones existentes entre las clases
representadas en una ontolog a, estableciendo un proceso de mapeado entre dichas clases
y las entidades identi cadas en el texto, y no a partir del analisis sintactico del
contenido. En este sentido, las relaciones posibles a extraer estan limitadas a los
tipos de relaciones representadas en la ontolog a, las cuales se enmarcan en el
ambito de la ciberseguridad. En [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ] se presenta una arquitectura para extraer
DE con independencia del dominio, en la que se combina un reconocedor de
entidades nombradas, con una estructura de representacion del discurso que modela
el signi cado de los textos para extraer los datos y sus v nculos. En esta
arquitectura se representan otras entidades relevantes del texto, identi cadas a partir
de frases sustantivas o eventos, y sus relaciones, as como informacion sintactica
y gramatical. Las relaciones binarias entre esas entidades se establecen a traves
de proposiciones y roles verbales, siendo este ultimo aspecto su limitacion
fundamental. En [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] se realiza un procesamiento del texto aplicando diferentes tecnicas
de PLN que concluye con un arbol de dependencias de las sentencias del texto,
sobre el cual se realiza la extraccion de entidades y relaciones entre ellas. En esta
propuesta se utiliza una Base de Datos de Entidades, construida manualmente,
donde se almacenan las posibles entidades a extraer. Las relaciones son
identicadas a partir de consultas almacenadas en una Base de Datos de Consultas,
igualmente construida de forma manual y analizando los v nculos entre las
entidades identi cadas en el arbol de dependencia. Estos elementos sugieren que
con esta propuesta se pueden alcanzar altos ndices de precision en la extraccion
de la informacion, pero una baja cobertura del texto, ya que la informacion a
extraer esta limitada a lo que se pueda identi car de lo almacenado en las bases
de datos que son utilizadas.
      </p>
      <p>
        La construccion de MC a partir de textos ha sido tratado en [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ],
aunque igualmente todas estas propuestas estan concebidas para textos en ingles.
Entre las tecnicas de PLN empleadas en el pre-procesamiento del texto se
encuentran: etiquetado POS [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ], el analisis sintactico super cial [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ] y de
dependencia [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], el reconocimiento de entidades [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ] y la desambiguacion del sentido
de las palabras [
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ]. Los conceptos han sido identi cados
fundamentalmente a partir de frases sustantivas [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], en algunos casos empleando
patrones lexico-sintacticos prede nidos [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref10">10</xref>
        ], y tambien a partir de entidades
reconocidas [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ]. En la mayor parte de los trabajos las relaciones entre
conceptos (proposiciones) se identi can a partir de relaciones verbales [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref11">11</xref>
        ][
        <xref ref-type="bibr" rid="ref12">12</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ],
en muy pocas propuestas se aprovechan los bene cios que ofrece el analisis de
dependencias [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ][
        <xref ref-type="bibr" rid="ref13">13</xref>
        ] para la identi cacion de relaciones entre conceptos, y solo
son identi cadas relaciones taxonomicas en [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ].
      </p>
      <p>
        A partir de este analisis, se decidio disen~ar una nueva propuesta para
extraer DE aplicable principalmente a textos en espan~ol, aspecto no considerado
en [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], y tambien en ingles, independiente del dominio, a diferencia de [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ], y
que posibilite extraer una mayor cantidad de conceptos (datos) y relaciones,
respecto a trabajos similares [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ][
        <xref ref-type="bibr" rid="ref6">6</xref>
        ][
        <xref ref-type="bibr" rid="ref7">7</xref>
        ]. Asociado a este ultimo objetivo, se proponen
algunas contribuciones: (1) el uso de patrones ling sticos, en combinacion con
una ontolog a de referencia, para extraer conceptos; y (2) la identi cacion de
relaciones semanticas (taxonomicas y no taxonomicas) entre los conceptos, usando
para ello tambien patrones ling sticos y la ontolog a; (3) uso intensivo del arbol
de dependencia para identi car relaciones entre los conceptos, principalmente
relaciones no taxonomicas.
      </p>
    </sec>
    <sec id="sec-3">
      <title>Metodo de Extraccion de Datos Enlazados</title>
      <p>El metodo propuesto fue disen~ado en varias fases, como se muestra en la
Fig. 1. En la obtencion de la conceptualizacion se combinan varias tecnicas de
PLN, y el uso de una ontolog a OWL de referencia, para facilitar y ampliar
la cobertura del texto en la identi cacion de conceptos y relaciones entre ellos.
Una de las ventajas del disen~o del metodo propuesto es su exibilidad, ya que
permite utilizar cualquier ontolog a, aunque es recomendable que el conocimiento
que represente sea del mismo dominio (o cercano) al del contenido de los textos,
para lograr un mayor aprovechamiento de ese recurso de conocimiento.</p>
      <p>Figura 1. Fases y componentes del metodo propuesto para la extraccion de DE.
3.1.</p>
      <sec id="sec-3-1">
        <title>Pre-procesamiento</title>
        <p>
          En esta fase, el contenido del chero de entrada es segmentado y
caracterizado sintacticamente, partiendo de la extraccion del texto plano usando una
biblioteca de clases de Java desarrolladas para este proposito, que brinda soporte
para cheros html, htm, pdf, docx, doc, rtf y txt. Luego, se identi ca si el texto
ha sido escrito en espan~ol o ingles aplicando la solucion reportada en [
          <xref ref-type="bibr" rid="ref14">14</xref>
          ]. La
identi cacion del idioma constituye una tarea importante en este metodo, pues
a partir del resultado de esta tarea es que se decide que patrones utilizar para la
extraccion de conceptos y relaciones, dado que los mismos estan de nidos para
textos en espan~ol o ingles. La segmentacion se realiza en oraciones (unidad de
analisis), considerando principalmente el punto nal como elemento que delimita
los segmentos. En este proceso se ignoran los puntos presentes en numeros, en
siglas y abreviaturas, y los puntos suspensivos. Sobre cada una de las oraciones,
se identi can los tokens (ej. palabras, numeros, signos de puntuacion, etc.), y
se ejecuta el analisis morfosintactico, el cual incluye el analisis sintactico
supercial y de dependencias. Este analisis del texto se realiza usando el analizador
sintactico Freeling [
          <xref ref-type="bibr" rid="ref15">15</xref>
          ], teniendo en cuenta que es uno de los pocos analizadores
que brinda soporte para textos en espan~ol, ademas de ingles. Como resultado del
analisis morfologico cada uno de los tokens se etiqueta con su ra z morfologica,
categor a gramatical y otros datos.
        </p>
        <p>El analisis sintactico super cial esta dirigido principalmente a la identi
cacion de conceptos, y consiste en agrupar los tokens de la oracion en chunks
o constituyentes que representan estructuras gramaticales categorizadas como:
sintagmas nominales, adjetivales, preposicionales, grupos verbales, entre otros,
a partir de los cuales se obtiene un arbol sintactico. A traves del analisis de
dependencias se establecen las relaciones de dependencias existentes entre las
estructuras gramaticales, las cuales son representadas en un arbol de
dependencias. Los resultados de este analisis no solo son muy utiles para identi car
v nculos entre los conceptos presentes en las diferentes estructuras
gramaticales, sino tambien para identi car o construir las frases-enlace a utilizar en el
etiquetado de esas relaciones.
3.2.</p>
      </sec>
      <sec id="sec-3-2">
        <title>Extraccion de la Conceptualizacion</title>
        <p>En esta fase, se construye automaticamente un MC del texto, como
representacion de la conceptualizacion, a partir de la identi cacion de conceptos y
relaciones entre ellos (proposiciones). La extraccion de conceptos se basa en la
identi cacion de terminos (constituidos por una o varias palabras) dentro de los
sintagmas nominales o adjetivales, cuya composicion se corresponda con alguno
de los patrones ling sticos de nidos para este proposito, as como en la identi
cacion de conceptos representados en la ontolog a que esten presentes en el texto.
La extraccion de relaciones entre conceptos se basa tambien en el uso de
patrones ling sticos, en la identi cacion de v nculos entre conceptos representados en
la ontolog a, y en el analisis de las dependencias existentes entre las estructuras
gramaticales del texto.</p>
        <p>La extraccion de conceptos se inicia con la identi cacion en el texto de
terminos representados como clases o instancias en la ontolog a, los cuales son tratados
como entidades. En este proceso de mapeado se evalua la similitud sintactica
existente entre los terminos del texto y los conceptos de la ontolog a usando
la metrica de Levenshtein. Seguidamente, se analiza el arbol sintactico de cada
oracion para identi car otros terminos que cumplan con alguno de los
patrones ling sticos de nidos, los cuales se extraen tambien como conceptos. Estos
patrones han sido formalizados sobre la base del etiquetado gramatical que
realiza Freeling y constituyen los patrones mas frecuentes a partir de los cuales
estan formados los conceptos representados en la ontolog a del proyecto
DBpedia. Mediante estos patrones no solo se identi can como conceptos las entidades
nombradas (ej. NP) sino tambien sustantivos, adjetivos y frases que expresan
combinaciones de ambos. En la Tabla 1 se muestra una seleccion de los patrones
de nidos para textos en espan~ol, los cuales son equivalentes a los identi cados en
analisis de los conceptos de la ontolog a, y que se utilizan para textos en ingles.</p>
        <p>El metodo propuesto brinda la posibilidad de extraer relaciones expl citas e
impl citas entre los conceptos, siendo las primeras las identi cadas en la oracion</p>
        <p>Cuadro 1. Patrones ling sticos para identi car de conceptos en textos en espan~ol.</p>
        <p>Patrones Ejemplos Patrones Ejemplos</p>
        <p>NC procesos Z NC cinco archivos</p>
        <p>NP San Cristobal AQ NC gran personalidad
NC AQ sistema informatico NC AQ AQ procesador logico operativo
NC NP director Juan AQ lejos
Leyenda: NC: sustantivo comun; NP: sustantivo propio; Z: numero o numeral;</p>
        <p>
          AQ: adjetivo
y las segundas las identi cadas a traves de la ontolog a, las cuales permiten
relacionar conceptos presentes en diferentes partes del texto a partir de v nculos
semanticos. En este proceso intervienen dos tareas: identi cacion del v nculo
entre los conceptos y la obtencion de la frase-enlace. Entre los tipos de relaciones
a identi car se encuentran las relaciones semanticas del tipo taxonomicas y no
taxonomicas (ej. verbales). Las primeras se identi can mediante los patrones
ling sticos que se muestra en Tabla 2, de nidos sobre la base de lo reportado en
[
          <xref ref-type="bibr" rid="ref16">16</xref>
          ][
          <xref ref-type="bibr" rid="ref17">17</xref>
          ][
          <xref ref-type="bibr" rid="ref18">18</xref>
          ], y a partir de la ontolog a, la cual es consultada mediante SPARQL
y utilizando Jena.
        </p>
        <p>Cuadro 2. Patrones para identi car relaciones taxonomicas en textos en espan~ol.</p>
        <p>A traves de la ontolog a, se identi car a una relacion taxonomica entre dos
conceptos C0 y C1 si ambos constituyen clases en la ontolog a y estan vinculados
mediante una relacion de sub-clase, siendo especi cada la frase-enlace como
`subClaseDe' (o `subClassOf ' en ingles). Se identi can otras relaciones semanticas si:
C0 y C1 son clases en la ontolog a que estan vinculadas a traves de una relacion
de Propiedad de Objeto, siendo especi cada la frase-enlace por el identi cador
de ese tipo de relacion en la ontolog a; o C0 constituye una clase y C1 una de sus
instancias, o viceversa, siendo especi cada la frase-enlace como `instanciaDe' (o
`instanceOf ' en ingles).</p>
        <p>En un segundo paso, se identi can otros tipos de relaciones a partir del
analisis el arbol de dependencia generado de cada oracion. Este proceso se basa en
el analisis de las estructuras asociadas a diferentes tipos de nodos representados
en ese arbol, tales como: preposicionales, conceptuales, verbales, subordinantes
y de coordinacion, a partir de los cuales se establecen los v nculos de
dependencia entre las estructuras gramaticales de la oracion. Por ejemplo, las relaciones
verbales se pueden extraer identi cando conexiones existentes entre un concepto
identi cado en el sujeto de la oracion (sintagma nominal) y otros identi cados
en los complementos que pertenecen a su ambito de dependencia, a traves de un
nodo verbal. En este caso, la proposicion se construye vinculando el concepto
incluido en el sujeto con cada uno de los conceptos identi cados en los
complementos y la frase-enlace se construye a partir del nodo verbal y sus modi cadores.
Las frases-enlace que etiquetan las relaciones identi cadas en este analisis son
identi cadas (o construidas) a partir de los siguientes patrones ling sticos: VM,
VM+SP, VM+CS+VM, VM+CS, PR+VM, CS+VM+SP, VM+VM, y AQ+SP,
siendo CS: conjuncion subordinada; SP: preposicion; AQ: adjetivo; VM: verbo
principal; PR: pronombre relativo.</p>
        <p>El proceso de normalizacion-re nado se realiza luego de haber extra dos los
conceptos y proposiciones del texto, y tiene como objetivo reducir redundancias
o incoherencia. Se lleva a cabo a partir de la eliminacion de las proposiciones
repetidas (enlazan conceptos iguales), as como la uni cacion de conceptos y
frases-enlace sintacticamente similares, usando para ello tambien la metrica de
Levenshtein.
3.3.</p>
      </sec>
      <sec id="sec-3-3">
        <title>Generacion del Modelo RDF</title>
        <p>En este proceso, la conceptualizacion extra da automaticamente del texto es
transformada en un modelo de datos RDF, donde cada una de las proposiciones
se codi ca como una tripleta RDF. En esta transformacion se sigue como
convencion que: (1) el concepto origen de la proposicion se codi ca como el sujeto;
(2) el concepto destino se codi ca como el objeto; y (3) la frase-enlace se
codica como el predicado. Las URIs que identi can los elementos de las tripletas
RDF se construyen a partir de las direcciones URL obtenidas del chero HTML
procesado, espec camente, la asociada al propio chero y las correspondientes
a los hiperv nculos asociados a terminos representados como conceptos, y las
etiquetas de los conceptos. Si un concepto no posee un hiperv nculo, la direccion
URL de referencia ser a la del propio chero origen, y en otro caso ser a la del
hiperv nculo.
4.</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Resultados y Discusion</title>
      <p>La obtencion de forma automatica de la conceptualizacion del texto
constituye el elemento que mayor in uencia tiene en la calidad de los resultados a
obtener por el metodo propuesto, por lo que las pruebas realizadas se centraron
en evaluar este aspecto. Hasta el momento, no se han identi cado marcos de
evaluacion de referencia, ni corpus de textos reconocidos para probar este tipo
de soluciones, por lo que su evaluacion se hace bastante compleja. No obstante,
se decidio realizar las pruebas sobre textos en espan~ol e ingles usando tres
colecciones: DBpedia ES, DBpedia EN e IA. Las dos primeras fueron construidas
con resumenes en espan~ol e ingles, respectivamente, tomados de un dataset de
resumenes cortos disponible en DBpedia3, y la segunda con textos en ingles sobre
temas de IA4. En la construccion de las colecciones se tuvo en cuenta que los
textos deb an estar incluidos en corpus disponibles en Internet, tuvieran
diferentes taman~os, y que existiera alguna ontolog a que tuviera algun v nculo con
el contenido de los mismos. La caracterizacion de las colecciones utilizadas se
muestra en la Tabla 3.</p>
      <p>Cuadro 3. Caracterizacion de las colecciones de prueba.</p>
      <p>Caracter sticas DBpedia ES
Idioma Espan~ol
Documentos 50
Prom. de palabras 75.9
Prom. de oraciones 3.0</p>
      <p>DBpedia EN IA
Ingles Ingles
50 6
75.2 1111.83
3.4 46.83</p>
      <p>Inicialmente se ejecuto el metodo sobre cada una de las colecciones sin usar
la ontolog a y luego usando la ontolog a. Esta ultima ejecucion se realizo solo
sobre las colecciones DBpedia EN e IA, ya que eran de las se dispon a de una
ontolog a de referencia. En las pruebas realizadas con la coleccion DBpedia EN
se utilizo la ontolog a de DBpedia y en las realizadas con la coleccion IA se
utilizo una ontolog a del dominio de IA, tomada de la misma fuente de los textos
seleccionados. En los experimentos se evaluaron aspectos tales como: cantidad
de informacion extra da (conceptos y relaciones), nivel de contribucion de la
ontolog a, y precision en la extraccion de conceptos y proposiciones. Considerando
que no se ten a informacion sobre los resultados correctos a obtener para cada
texto, se decidio evaluar la calidad de la extraccion de conceptos y
proposiciones a traves de evaluadores humanos (3 profesores de la carrera de Ingenier a
Informatica). Los evaluadores deb an clasi car cada uno de los conceptos y
proporciones extra das en correctos o incorrectos, sobre la base del contenido de los
textos y considerando lo siguiente:
- concepto correcto: sustantivos o adjetivos que tuvieran un signi cado
importante en el texto, nombres de entidades, o frases que tuvieran sentido;
- proposicion correcta: si puede ser interpretada con un sentido propio (ej.</p>
      <p>cuando ambos conceptos son correctos y la frase-enlace esta bien de nida).
3 http://wiki.dbpedia.org/Datasets
4 Corpus de textos y ontolog a
http://azouaq.athabascua.ca/goldstandards.htm
asociada
disponibles
en</p>
      <p>A partir de la informacion emitida por los evaluadores se calculo la precision
como la razon entre los elementos extra dos (conceptos o proposiciones)
correctamente y el total, cuyos valores se muestran en la Tabla 4. La precision se
calculo a partir de los resultados coincidentes de los evaluadores, con un ndice
de acuerdo de 92 %.</p>
      <p>Segun se aprecia, la mayor precision se obtuvo en la extraccion de conceptos,
sin una diferencia signi cativa respecto al idioma cuando no se usaron ontolog as,
demostrandose la calidad y utilidad de los patrones ling sticos de nidos para
este proposito. Sin embargo, se observa una menor precision en la extraccion de
proposiciones. Este resultado esta dado en buena medida por la alta complejidad
que tiene la identi cacion de forma automatica de relaciones entre conceptos en
un texto, as como por algunos resultados no favorables del analisis sintactico
realizado con Freeling. Esto ultimo tambien incide en la identi cacion de
conceptos, pero repercute mas en la extraccion de las proposiciones porque en su
evaluacion no solo se mide si los conceptos vinculados son correctos o no, sino
que tambien que la frase-enlace este bien formada. La identi cacion del v nculo
entre los conceptos, as como la obtencion de la frase-enlace dependen en gran
medida del analisis que se realiza sobre el arbol de dependencias, y por tanto las
de ciencias que posea repercuten en los resultados.</p>
      <p>Cuadro 4. Resultados experimentales en la extraccion de la conceptualizacion.</p>
      <p>DBpedia EN IA
Aspectos DBpedia ES NoOnt SiOnt NoOnt SiOnt
CC 7,88 10,06 10,2 112,4 120,2
CE 2,2 4,86 5,08 29,2 36,2
CR 6,10 8,38 8,48 103 114,8
CCOnt. - - 3,72 - 37,2
CROnt. - - 0 - 8,6
PC 93,66 89,21 92,58 96,81 98,57
PR 53,92 51,26 53,97 66,67 83,10
Leyenda: CC: Prom. cant. conceptos; CE: Prom. cant. de entidades;
CR: Prom. cant. relaciones; CCOnt.: Prom. cant. conceptos obtenidos
de la ontolog a; CROnt.: Prom. cant. relaciones obtenidasde la ontolog a;
PC: Precision en la identi cacion de conceptos; PR: Precision en la
identi cacion de relaciones; NoOnt: sin usar ontolog a; SiOnt: usando ontolog a.</p>
      <p>Un resultado importante es el incremento de la precision (aunque discreto)
cuando se utiliza la ontolog a, as como el incremento de la cantidad de
informacion extra da, apreciado en mayor medida en la coleccion IA. Esto demuestra
los bene cios que se pueden obtener cuando es usada una ontolog a de
referencia en la extraccion automatica de conceptos y relaciones desde textos no
estructurados.</p>
    </sec>
    <sec id="sec-5">
      <title>Conclusiones</title>
      <p>En el trabajo se ha presentado un nuevo metodo para extraccion de los DE a
partir de textos no estructurados, aplicable a textos escritos en el idioma espan~ol
e ingles y no dependiente del dominio. En esta nueva propuesta se combinan un
conjunto de tecnicas de PLN, tanto para el pre-procesamiento de los textos como
para la identi cacion de conceptos y relaciones, que permiten aumentar las
capacidades para extraer una mayor cantidad de informacion desde los textos. El uso
de patrones ling sticos para identi car conceptos y relaciones semanticas entre
ellos, la posibilidad de utilizar de manera exible una ontolog a de referencia,
as como el analisis de las dependencias entre los conceptos en el texto,
constituyen elementos que han propiciado alcanzar una mayor cobertura del texto a
la hora de extraer la informacion. La extraccion de conceptos, que no
necesariamente representen entidades, as como la identi cacion de v nculos semanticos
entre ellos, propicia que se obtenga una mayor riqueza en los DE que se obtienen
con el metodo propuesto. Las pruebas realizadas mostraron resultados
prometedores, alcanzandose valores de precision en la mayor a de los casos superiores
al 90 % en la extraccion de conceptos y al 50 % en la extraccion de relaciones.
Tambien se constataron los bene cios de usar una ontolog a, referentes al
incremento de la cantidad de informacion extra da de los textos, y al aumento de la
precision en la extraccion de conceptos y relaciones.</p>
      <p>Agradecimientos. Este trabajo ha sido parcialmente nanciado por el
Ministerio de Econom a y Competitividad del Gobierno de Espan~a, en el marco del
proyecto REDES (TIN2015-65136-C2-1-R).</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          1.
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          , y Zhang,
          <string-name>
            <given-names>X.</given-names>
            : Finding, Extracting, and Building Academic
            <surname>Li</surname>
            nked Data. In Li
          </string-name>
          , J. et al. (Eds):
          <source>Semantic Web and Web Science</source>
          , Springer &amp; Business Media,
          <volume>25</volume>
          {
          <fpage>39</fpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <surname>Auer</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lehmann</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ngonga</surname>
            <given-names>A. C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>y Zaveri</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>Introduction to Linked Data and its Lifecycle on the Web</article-title>
          .
          <source>Proc. of Reasoning Web</source>
          <year>2013</year>
          ,
          <string-name>
            <surname>LNCS</surname>
          </string-name>
          , Vol.
          <volume>8067</volume>
          ,
          <issue>1</issue>
          {
          <fpage>90</fpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          3.
          <string-name>
            <surname>Lehmann</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Isele</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Jakob</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Jentzsch</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kontokostas</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mendes</surname>
            ,
            <given-names>P. N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hellmann</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Morsey</surname>
            , M., van Kleef,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Auer</surname>
            , S., y Bizer,
            <given-names>C.</given-names>
          </string-name>
          :
          <article-title>DBpedia A Largescale, Multilingual Knowledge Base Extracted from Wikipedia</article-title>
          .
          <source>Semantic Web</source>
          ,
          <volume>1</volume>
          ,
          <issue>1</issue>
          {
          <fpage>27</fpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          4.
          <string-name>
            <surname>Dimitrios-Emmanuel</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Stavrou</surname>
          </string-name>
          , P., y Mitrou, N.:
          <article-title>Bringing relational databases into the semantic web: A survey</article-title>
          .
          <source>Semantic Web</source>
          ,
          <volume>3</volume>
          (
          <issue>2</issue>
          ),
          <volume>169</volume>
          {
          <fpage>209</fpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          5.
          <string-name>
            <surname>Augenstein</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pado</surname>
            , S., y Rudolph,
            <given-names>S.:</given-names>
          </string-name>
          <article-title>LODi er: Generating Linked Data from Unstructured Text</article-title>
          .
          <source>In Proc. of ESWC</source>
          <year>2012</year>
          ,
          <article-title>LNSC</article-title>
          , Vol.
          <volume>7295</volume>
          ,
          <issue>210</issue>
          {
          <fpage>224</fpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          6.
          <string-name>
            <surname>Joshi</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lal</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Finin</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          , y Joshi,
          <string-name>
            <surname>A.</surname>
          </string-name>
          :
          <article-title>Extracting Cybersecurity Related Linked Data from Text</article-title>
          ,
          <source>IEEE 7th Int. Conf. on Semantic Computing (ICSC)</source>
          ,
          <volume>252</volume>
          {
          <fpage>259</fpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          7.
          <string-name>
            <surname>Kr</surname>
            , V., y Hladka,
            <given-names>B.</given-names>
          </string-name>
          :
          <article-title>RExtractor: a Robust Information Extractor</article-title>
          .
          <source>Proc. of the 2015 Conf. of the North American Chapter of the Association for Computational Linguistics: Demonstrations</source>
          ,
          <volume>21</volume>
          {
          <fpage>25</fpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          8.
          <string-name>
            <surname>Novak</surname>
            , J. D., y Can~as,
            <given-names>A. J.:</given-names>
          </string-name>
          <article-title>The Theory Underlying Concept Maps</article-title>
          and How to Construct Them,
          <source>Technical Report IHMC CmapTools</source>
          , USA (
          <year>2006</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          9.
          <string-name>
            <surname>Kowata</surname>
            ,
            <given-names>J. H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cury</surname>
            , D., y Silva,
            <given-names>M. C.</given-names>
          </string-name>
          :
          <article-title>Concept maps core elements candidates recognition from text</article-title>
          .
          <source>In Proc. of CMC</source>
          <year>2010</year>
          ,
          <volume>120</volume>
          {
          <fpage>127</fpage>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          10.
          <string-name>
            <surname>Raymond</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Song</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yuefeng</surname>
            ,
            <given-names>L. I.</given-names>
          </string-name>
          , Terence, Ch., I., y Hao,
          <string-name>
            <surname>J.-X.</surname>
          </string-name>
          :
          <article-title>Towards A Fuzzy Domain Ontology Extraction Method for Adaptive e-Learning</article-title>
          .
          <source>Knowledge and Data Engineering</source>
          ,
          <volume>21</volume>
          (
          <issue>6</issue>
          ),
          <volume>800</volume>
          {
          <fpage>813</fpage>
          (
          <year>2009</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          11.
          <string-name>
            <surname>Valerio</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Leake</surname>
          </string-name>
          , D.,y Can~as, A. J.:
          <article-title>Using Automatically Generated Concept Maps for Document Understanding: A Human Subject Experiment</article-title>
          .
          <source>In Proc. of CMC</source>
          <year>2012</year>
          ,
          <volume>438</volume>
          {
          <fpage>445</fpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          12.
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>W. M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cheung</surname>
            ,
            <given-names>C. F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lee</surname>
            , W. B. y Kwok,
            <given-names>S. K.</given-names>
          </string-name>
          :
          <article-title>Mining knowledge from natural language texts using fuzzy associated concept mapping</article-title>
          .
          <source>Information Processing and Management</source>
          ,
          <volume>44</volume>
          (
          <issue>5</issue>
          ),
          <volume>1707</volume>
          {
          <fpage>1719</fpage>
          (
          <year>2008</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          13.
          <string-name>
            <surname>Attia</surname>
            <given-names>S. S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Arafa</surname>
          </string-name>
          , W. M. y
          <string-name>
            <surname>Eldin</surname>
            ,
            <given-names>A. S.:</given-names>
          </string-name>
          <article-title>A Framework of Proposed Intelligent Tool for Constructing Concept Map</article-title>
          ,
          <source>In Proc. of ICL</source>
          <year>2010</year>
          ,
          <volume>524</volume>
          {
          <fpage>533</fpage>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          14.
          <string-name>
            <surname>Amine</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Elberrichi</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          , y Simonet,
          <string-name>
            <surname>M.</surname>
          </string-name>
          :
          <article-title>Automatic language identi cation: An alternative unsupervised approach using a new hybrid algorithm</article-title>
          .
          <source>Int. J. on Computational Science &amp; Applications</source>
          ,
          <volume>7</volume>
          (
          <issue>1</issue>
          ),
          <volume>94</volume>
          {
          <fpage>107</fpage>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          15.
          <string-name>
            <surname>Padro</surname>
          </string-name>
          , L. y
          <string-name>
            <surname>Stanilovsky</surname>
          </string-name>
          ,
          <source>E.: FreeLing 3</source>
          .0:
          <string-name>
            <given-names>Towards</given-names>
            <surname>Wider Multilinguality</surname>
          </string-name>
          .
          <source>International Conference on Language Resources and Evaluation</source>
          ,
          <source>In Proc. of LREC</source>
          <year>2012</year>
          ,
          <volume>2473</volume>
          {
          <fpage>2479</fpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          16.
          <string-name>
            <surname>Hearst</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          <article-title>Automatic acquisition of hyponyms from large text corpora</article-title>
          .
          <source>In Proc. of the 14th Int. Conf. on Computational Linguistics</source>
          ,
          <volume>539</volume>
          {
          <fpage>545</fpage>
          (
          <year>1992</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          17.
          <string-name>
            <surname>Cimiano P. y Vlker</surname>
          </string-name>
          ,
          <source>J.: Text2Onto</source>
          ,
          <source>In Proc. of the 10th Int. Conf. on Applications of Natural Language to Information Systems</source>
          ,
          <volume>227</volume>
          {
          <fpage>238</fpage>
          (
          <year>2005</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          18.
          <string-name>
            <surname>Jiang</surname>
            ,
            <given-names>X.</given-names>
          </string-name>
          , y Tan,
          <string-name>
            <surname>A. H.</surname>
          </string-name>
          :
          <article-title>CRCTOL: A semanticbased domain ontology learning system</article-title>
          .
          <source>J. of the American Society for Information Science and Technology</source>
          ,
          <volume>61</volume>
          (
          <issue>1</issue>
          ),
          <volume>150</volume>
          {
          <fpage>168</fpage>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>