<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Reconocimiento de Entidades en Informes Medicos en Espan~ol</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Pilar Lopez Ubeda Sinai Group</string-name>
          <email>plubeda@ujaen.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Universidad de Jaen Campus Las Lagunillas</institution>
          <addr-line>s/n. E-23071</addr-line>
        </aff>
      </contrib-group>
      <abstract>
        <p>During the last years, Spanish health services are storing electronic information about their patients. These documents contain relevant information on diseases, allergies, medication, etc. The main goals of this work is to automatically recognize entities related to medicine in a medical report written in Spanish. In the rst phase, we will use Natural Language Processing (NLP) techniques for the treatment of text, and later we will extract the terms of the medical domain. We will study dictionaries and ontologies such as SNOMED-CT, which contribute to solve the problems of both semantic interoperability and knowledge reuse in clinical information systems.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>Justi cacion de la investigacion propuesta</title>
      <p>Con el paso de los an~os, la necesidad
de tener un buen sistema informatico de
gestion de informes medicos esta teniendo
gran importancia, pues los datos contenidos
en dichos informes son relevantes. Se hace
necesario el disen~o y desarrollo de nuevas y
potentes herramientas de procesamiento de la
informacion que aprovechen los avances de las
tecnolog as relacionadas con la informacion
para poder acceder y analizar estos datos,
todos ellos relacionados con los registros
electronicos de la salud de un paciente.</p>
      <p>Por lo tanto, es comun hoy d a para un
especialista registrar los datos del paciente de
manera electronica. Esto incluye informacion
del paciente, medicacion, resultados de
analisis, diagnosticos, dosis, etc. Manteniendo
esa informacion digitalizada vemos tres
grandes ventajas: se reduce el tiempo de
trabajo del personal de salud, se mejora
la calidad de la atencion y se utiliza la
informacion a traves de sistemas automaticos
como por ejemplo la miner a de textos
(Ananiadou and McNaught, 2006).</p>
      <p>Llamamos miner a de textos al proceso de
descubrir, a partir de grandes cantidades de
texto, el conocimiento para encontrar
informacion no trivial, desconocida
y potencialmente util en textos no
estructurados.</p>
      <p>La miner a de textos es un area
multidisciplinar donde convergen diferentes
paradigmas de computacion como son la
construccion de arboles de decision, la
induccion de reglas, las redes neuronales,
el descubrimiento basado en instancias,
programacion logica, algoritmos estad sticos,
etc. Las principales tareas y metodos de
miner a de textos, entre otras, son: extraccion
de la informacion, generacion automatica
de resumenes de textos, categorizacion,
agrupamiento, vinculacion entre conceptos,
visualizacion de la informacion y la respuesta
automatica de preguntas.</p>
      <p>El presente trabajo se centra en el
reconocimiento de entidades con nombre,
Named Entity Recognition (NER), uno de
los problemas basicos de la miner a de
texto (Cohen and Hersh, 2005). Por tanto,
se desarrollaran tecnicas de extraccion de
informacion y de procesamiento del lenguaje
natural (PLN) para poder gestionar la
informacion contenida en un expediente
medico (Hahn, Romacker, and Schulz, 1999).
Como producto nal, tendremos informacion
que carece de valor por s sola, pero
podemos llegar a intercambiarla y utilizarla de
manera e ciente para obtener conocimiento
de ella. A dicha habilidad se la conoce como
interoperabilidad semantica. Entendemos por
interoperabilidad semantica la capacidad que
tienen diferentes sistemas informaticos de
compartir informacion y entenderse.</p>
      <p>La importancia de intercambiar
informacion en el dominio cl nico, proviene
en buena medida de nuevos requisitos que los
servicios de atencion sanitaria deben afrontar
en su organizacion y funcionalidad para
poder seguir prestando su servicio de forma
efectiva, e ciente y sostenible, como por
ejemplo, los cambios demogra cos, movilidad
de ciudadanos y la equidad en el acceso.</p>
      <p>Para garantizar la interoperabilidad
semantica entre sistemas, se hace necesario
el uso de estandares que permitan el
intercambio de datos, as como la utilizacion
de catalogos estandarizados, los cuales
uni can los datos empleados en distintas
instituciones derivando en el intercambio
correcto de informacion.</p>
      <p>A continuacion se mencionan diccionarios
y ontolog as que contribuyen a resolver los
problemas antes mencionados:</p>
      <p>CIE-10: Es la Clasi cacion Internacional
de Enfermedades, decima version
correspondiente a la version en espan~ol
de la ICD, por sus siglas en ingles:
International Statistical Classi cation of
Diseases and Related Health Problems.
Se ha convertido en una clasi cacion
diagnostica estandar internacional para
todos los propositos epidemiologicos
generales y es adecuada para clasi car
enfermedades y otros tipos de problemas
de salud.</p>
      <p>MeSH: Medical Subjects Headings
es el vocabulario controlado que
emplea Medline y otras bases de datos
biomedicas para procesar la informacion
que se introduce en cada una de ellas.
Contiene encabezamientos de materias,
cali cadores, de niciones, referencias
cruzadas, sinonimos y listas de terminos
estrechamente relacionados.</p>
      <p>SNOMED-CT: Systematized
Nomenclature of Medicine { Clinical
Terms es la terminolog a cl nica
integral, multilingue y codi cada
de mayor amplitud, precision e
importancia desarrollada en el mundo.
Es un vocabulario normalizado
que permitira la representacion
del contenido de los documentos
cl nicos para su interpretacion
automatica e inequ voca entre sistemas
distintos de forma precisa y en
diferentes idiomas. Incluye de niciones,
terminos, relaciones y sinonimos sobre
enfermedades, procedimientos cl nicos,
micro-organismos, s ntomas, sustancias
y otros conceptos.</p>
      <p>UMLS: Uni ed Medical Language
System. Es un conjunto de archivos y
software que reune muchos vocabularios
biomedicos y normas para permitir la
interoperabilidad entre los sistemas
informaticos. Ha sido desarrollado por la
National Library of Medicine (NLM).
2</p>
    </sec>
    <sec id="sec-2">
      <title>Origen y trabajo relacionado</title>
      <p>El enfoque en el procesamiento de notas
cl nicas en la tecnolog a de informacion
medica podr a traer importantes avances en
tratamientos medicos y farmacologicos. Por
ello, varias disciplinas como la Informatica, la
Lingu stica y la Biomedicina deben unirse
para desarrollar aplicaciones de gestion y
busqueda de recursos medicos.</p>
      <p>
        Muchos sistemas se basan en los textos
biomedicos en lengua inglesa. Por ejemplo,
Uni ed Modeling Language MetaMap Transfer
(UMLS MMTx) (Osborne et al., 2007) es
una herramienta con gurable comunmente
utilizada por los desarrolladores de sistemas
en biomedicina. Creado por investigadores
de la National Library of Medicine (NLM),
MMTx es capaz de identi car los conceptos
biomedicos de textos no estructurados y
los mapea en los conceptos de UMLS
Metathesaurus
        <xref ref-type="bibr" rid="ref5">(Wright et al., 1999)</xref>
        . En la
Universidad Carlos III, el grupo LABDA
ha realizado varias investigaciones centradas
en el reconocimiento de entidades medicas,
fundamentalmente en la interaccion entre
medicamentos y centrados principalmente
en ingles
        <xref ref-type="bibr" rid="ref3">(Segura-Bedmar, Mart nez, and
Zazo, 2013; Herrero-Zazo, Segura-Bedmar,
and Mart nez, 2016)</xref>
        aunque tambien tienen
algunos trabajos en espan~ol (Gomez, Bedmar,
and Fernandez, 2016).
      </p>
      <p>
        Para el procesamiento de textos biomedicos
en espan~ol, el Ministerio de Sanidad promueve
el uso y aplicacion de la ontolog a SNOMED
CT como terminolog a cl nica de referencia
para la Historia Cl nica Digital Del Sistema
Nacional De Salud (HCDSNS). SNOMED-CT
se considera la terminolog a multilingue mas
completa del cuidado de la salud en el mundo.
En referencia a la ontolog a SNOMED-CT y el
idioma ingles, tenemos varias investigaciones
relacionadas
        <xref ref-type="bibr" rid="ref2">(Allones, Mart nez, and Taboada,
2014; Sanchez, Batet, and Valls, 2010; Garla
and Brandt, 2012)</xref>
        .
      </p>
      <p>Como se menciono anteriormente, las
notas cl nicas son textos no estructurados,
generalmente escritos por especialistas y
que presentan caracter sticas especiales
(por ejemplo, a menudo se escriben a
mano, contienen errores ortogra cos,
presentan siglas con multiples signi cados
y utilizan terminolog a que viola las
convenciones de nomenclatura), por lo
que son particularmente dif ciles de tratar.
Para ello, necesitamos de un procesamiento
de textos para la obtencion de terminos
(Barron-Ceden~o et al., 2009; Gelbukh et al.,
2010; Bosma and Vossen, 2010).</p>
      <p>
        <xref ref-type="bibr" rid="ref4">Vivaldi and Rodr guez (2010</xref>
        ) toman como
base de informacion semantica la Wikipedia
para crear un sistema de extraccion de
terminos. La metodolog a consiste en tomar
un documento y su correspondiente conjunto
de candidatos a terminos para comparar los
resultados que se obtienen. El sistema se probo
en un corpus medico en espan~ol y concluyeron
que la Wikipedia es un recurso valido para
utilizar en esta tarea.
      </p>
      <p>En lo que atan~e a trabajos en espan~ol
aplicando y utlizando la ontolog a
SNOMED-CT, cabe destacar los trabajos
de Calleja Iban~ez (2015) y Barahona et
al. (2012) donde reconocen de manera
automatica terminos medicos de diferentes
documentos. El trabajo de Castro et al.
(2010) presenta una anotacion semantica
de las notas cl nicas en espan~ol y la
aplicacion MOSTAS que es una herramienta
automatizada para identi car conceptos
biomedicos. En la Universidad del Pa s
Vasco, Oronoz et al. (2013) desarrollan una
herramienta basada en FreeLing para anotar
entidades como medicamentos, enfermedades
y sustancias de manera automatica en
textos medicos. Dicha herramienta se conoce
como FreeLingMed y aun esta en desarrollo.
Podemos mencionar tambien el proyecto de
Lopez Rodr guez, Ben tez, and Sanchez (2006)
Oncoterm, enfocado a un sistema bilingue de
informacion y recursos oncologicos.
3</p>
    </sec>
    <sec id="sec-3">
      <title>Descripcion de la investigacion propuesta</title>
      <p>El objetivo principal de este trabajo consiste
en desarrollar herramientas y recursos para el
analisis de informes medicos y la extraccion
de informacion en documentos cl nicos. En
principio, nos guiaremos por la descripcion
detallada que presentan Krauthammer and
Nenadic (2004), los cuales elaboran una gu a
con los pasos a seguir en la extraccion de
terminos en el terreno de la biomedicina:
1. Reconocimiento de terminos: denota
un conjunto de procedimientos que se
usan para reconocer sistematicamente
terminos pertinentes en la literatura, es
decir, resaltar unidades lexicas que estan
relacionadas con conceptos de dominio
relevantes. Existen varios enfoques para
el reconocimiento de terminos automatico
(ATR - Automatic Term Recognition):</p>
      <sec id="sec-3-1">
        <title>Enfoques basados en diccionario:</title>
        <p>los metodos basados en diccionario
para el ATR utilizan recursos
terminologicos existentes para
localizar ocurrencias de termino
dentro del texto.</p>
        <p>Enfoques basados en reglas:
consiste en (normalmente de
forma manual) desarrollar reglas
que describen estructuras de
nomenclatura comunes para ciertas
clases de termino, buscando
indicios ortogra cos o lexicos, o
caracter sticas mas complejas como
las morfo-sintacticas.</p>
        <p>Aprendizaje automatico: estos
sistemas son aquellos que aprenden
y clasi can de forma automatica,
mejorando con el paso del tiempo.
El principal inconveniente de este
sistema es preparar un conjunto
de entrenamiento inicial para el
aprendizaje.</p>
        <p>Enfoques h bridos: combinan
diferentes metodos (t picamente los
basados en reglas y el aprendizaje
automatico) y varios recursos (listas
de terminos espec cos, palabras,
etc.) para la tarea de reconocimiento
de terminos.</p>
        <p>
          Reconocimiento de acronimos: los
terminos biomedicos a menudo
aparecen de forma acortada
o abreviada. Por lo tanto, la
capacidad de entender las siglas es
obviamente cr tica para un sistema
de PLN. Encontramos repositorios
de acronimos existentes en el campo
biomedico
          <xref ref-type="bibr" rid="ref1">(Chang, Schutze, and
Altman, 2002; Rimer and O'Connell,
1998)</xref>
          .
2. Clasi cacion de terminos: la tarea de
clasi cacion consiste en desambiguar
entre los posibles sentidos de los terminos
(si hay mas de uno) lo que se conoce como
desambiguacion del sentido del termino.
3. Tecnicas de mapeo: el objetivo es asignar
una ocurrencia de termino a una entrada
en una fuente de datos de referencia,
anotando el termino con un ID.
        </p>
      </sec>
      <sec id="sec-3-2">
        <title>Manejo de variabilidad de terminos:</title>
        <p>implica que existan diferentes formas
de presentar el mismo concepto, la
utilizacion de abreviaciones, su jos
y pre jos hacen dif cil esta tarea.
Manejo de ambiguedad de terminos:
es otro problema importante en la
tarea de mapeo de terminos; esta
relacionado con la diversidad de
sentidos que se le puede dar a un
termino con respecto a la fuente de
datos utilizada.
4</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>Metodolog a y experimentos propuestos</title>
      <p>La metodolog a que se propone para la
consecucion de este trabajo se presenta a
continuacion:
1. Estudio y revision del estado del arte. Se
comenzara con el estudio y analisis de la
bibliograf a existente sobre las tecnicas de
reconocimiento de entidades nombradas
y de las tecnicas de mapeo. Se estudiaran
las diversas ontolog as existentes en el
dominio medico tanto en espan~ol como
en otros idiomas.
2. Adaptacion de recursos existentes para
poder realizar un analisis de los metodos
propuestos.
3. Desarrollo de los recursos y herramientas
propios para el analisis y la extraccion
de informacion en informes medicos.
4. Implementacion de los sistemas que
permitan el reconocimiento de entidades
medicas en informes medicos en espan~ol.
5. Experimentacion y evaluacion. Se
utilizaran los recursos generados para
llevar a cabo la experimentacion y
posteriormente se procedera a la
evaluacion de los sistemas desarrollados,
llevando a cabo una comparacion de
los resultados obtenidos con los ya
existentes. Los resultados obtenidos se
pondran a disposicion de la comunidad
cient ca.
5</p>
    </sec>
    <sec id="sec-5">
      <title>Conclusion</title>
      <p>El objetivo principal del trabajo sera
la automatizacion de reconocimiento de
entidades en el contenido de informes medicos.
Para ello, se aplicaran diversas tecnicas
de PLN a documentos cl nicos escritos en
castellano. Esto supone un reto dado que la
mayor a de los trabajos realizados en este
campo se ha realizado para lengua inglesa
y los recursos para el espan~ol son bastante
limitados.</p>
      <p>Cuando se habla de tecnicas de PLN
nos estamos re riendo a correccion
ortogra ca, sistemas de deteccion de
acronimos, desambiguacion, tratamiento de
la negacion, identi cacion de conceptos, entre
otros. Todas estas tareas se integraran
en sistemas que permitan procesar
automaticamente los conceptos encontrados
y anotarlos semanticamente con el estandar
SNOMED-CT en lengua espan~ola.</p>
    </sec>
    <sec id="sec-6">
      <title>Agradecimientos</title>
      <p>Este trabajo esta parcialmente
subvencionado por el proyecto REDES
(TIN2015-65136-C2-1-R) del MICINN del
Gobierno de Espan~a.</p>
    </sec>
    <sec id="sec-7">
      <title>Bibliograf a</title>
      <p>Allones, J. L., D. Mart nez, y M. Taboada.
2014. Automated mapping of clinical
terms into snomed-ct. an application to
codify procedures in pathology. J. Medical
Systems, 38(10):134.</p>
      <p>Ananiadou, S. y J. McNaught. 2006. Text
mining for biology and biomedicine. Artech
House London.</p>
      <p>Barahona, E. B., I. S. Ramos, A. U.</p>
      <p>Herradon, A. D. Esteban, y L. P. Morales.
2012. Procesador automatico de informes
medicos.</p>
      <p>Barron-Ceden~o, A., G. Sierra, P. Drouin,
y S. Ananiadou. 2009. An improved
automatic term recognition method for
spanish. In CICLing, volume 9, pages
125{136. Springer.</p>
      <p>Bosma, W. y P. Vossen. 2010. Bootstrapping
language neutral term extraction. In
LREC.</p>
      <sec id="sec-7-1">
        <title>Calleja Iban~ez, P. 2015.</title>
        <p>de enfermedades en
de medicamentos y
con SNOMED-CT.</p>
        <p>ETSI Informatica.</p>
        <p>Reconocimiento
chas tecnicas
su anotacion
Ph.D. thesis,
Castro, E., A. Iglesias, P. Mart nez,
y L. Castano. 2010. Automatic
identi cation of biomedical concepts
in spanish-language unstructured
clinical texts. In Proceedings of the
1st ACM International Health Informatics
Symposium, pages 751{757. ACM.</p>
        <p>Chang, J. T., H. Schutze, y R. B. Altman.
2002. Creating an online dictionary of
abbreviations from medline. Journal of the
American Medical Informatics Association,
9(6):612{620.</p>
        <p>Cohen, A. M. y W. R. Hersh. 2005. A survey
of current work in biomedical text mining.</p>
        <p>Brie ngs in bioinformatics, 6(1):57{71.
Garla, V. N. y C. Brandt. 2012. Semantic
similarity in the biomedical domain: an
evaluation across knowledge sources. BMC
bioinformatics, 13(1):261.</p>
        <p>Gelbukh, A., G. Sidorov, E. Lavin-Villa, y
L. Chanona-Hernandez. 2010. Automatic
term extraction using log-likelihood
based comparison with general reference
corpus. Natural Language Processing and
Information Systems, pages 248{255.
Gomez, L. N., I. S. Bedmar, y P. M.</p>
        <p>Fernandez. 2016. Easylecto: Un sistema
de simpli cacion lexica de efectos adversos
presentes en prospectos de farmacos en
espanol. Procesamiento del Lenguaje
Natural, 57:177{180.</p>
        <p>Hahn, U., M. Romacker, y S. Schulz.
1999. How knowledge drives
understanding|matching medical
ontologies with the needs of medical
language processing. Arti cial Intelligence
in Medicine, 15(1):25{51.</p>
        <p>Herrero-Zazo, M., I. Segura-Bedmar, y
P. Mart nez. 2016. Conceptual models
of drug-drug interactions: a summary of
recent e orts. Knowledge-Based Systems,
114:99{107.</p>
        <p>Krauthammer, M. y G. Nenadic. 2004. Term
identi cation in the biomedical literature.
Journal of biomedical informatics,
37(6):512{526.</p>
        <p>Lopez Rodr guez, C. I., P. Ben tez, y
M. Sanchez. 2006. Terminolog a basada
en el conocimiento para la traduccion y la
divulgacion medicas: el caso de oncoterm.</p>
        <p>Panace, 7(24):228{240.</p>
        <p>Oronoz, M., A. Casillas, K. Gojenola, y
A. Perez. 2013. Automatic annotation
of medical records in spanish with disease,
drug and substance names. In CIARP (2),
pages 536{543.</p>
        <p>Osborne, J. D., S. Lin, L. J. Zhu, y W. A.</p>
        <p>Kibbe. 2007. Mining biomedical data
using metamap transfer (mmtx) and the
uni ed medical language system (umls).</p>
        <p>Gene Function Analysis, pages 153{169.</p>
      </sec>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Rimer</surname>
          </string-name>
          ,
          <string-name>
            <surname>M. y M. O'Connell</surname>
          </string-name>
          .
          <year>1998</year>
          .
          <article-title>Bioabacus: a database of abbreviations and acronyms in biotechnology and computer science</article-title>
          .
          <source>Bioinformatics</source>
          (Oxford, England),
          <volume>14</volume>
          (
          <issue>10</issue>
          ):
          <volume>888</volume>
          {
          <fpage>889</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Sanchez</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          , M. Batet, y
          <string-name>
            <given-names>A.</given-names>
            <surname>Valls</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Web-based semantic similarity: an evaluation in the biomedical domain</article-title>
          .
          <source>International journal of software and informatics</source>
          ,
          <volume>4</volume>
          (
          <issue>1</issue>
          ):
          <volume>39</volume>
          {
          <fpage>52</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Segura-Bedmar</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          , P. Mart nez, y
          <string-name>
            <given-names>M. H.</given-names>
            <surname>Zazo</surname>
          </string-name>
          .
          <year>2013</year>
          .
          <article-title>Semeval-2013 task 9: Extraction of drug-drug interactions from biomedical texts</article-title>
          (ddiextraction
          <year>2013</year>
          ).
          <article-title>Association for Computational Linguistics</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Vivaldi</surname>
          </string-name>
          , J. y H. Rodr guez.
          <year>2010</year>
          .
          <article-title>Using wikipedia for term extraction in the biomedical domain: rst experiences</article-title>
          .
          <source>Procesamiento del Lenguaje Natural</source>
          ,
          <volume>45</volume>
          :
          <fpage>251</fpage>
          {
          <fpage>254</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Wright</surname>
            ,
            <given-names>L. W.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>H. K. G. Nardini</surname>
            ,
            <given-names>A. R.</given-names>
          </string-name>
          <string-name>
            <surname>Aronson</surname>
          </string-name>
          , y T. C. Rind esch.
          <year>1999</year>
          .
          <article-title>Hierarchical concept indexing of full-text documents in the uni ed medical language system information sources map</article-title>
          .
          <source>Journal of the Association for Information Science and Technology</source>
          ,
          <volume>50</volume>
          (
          <issue>6</issue>
          ):
          <fpage>514</fpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>