<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Reconocimiento de Entidades Nombradas en espan˜ol aplicado al dominio biom´edico</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Pilar L´opez-U´ beda Sinai Group</string-name>
          <email>plubeda@ujaen.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Universidad de Ja ́en Campus Las Lagunillas</institution>
          <addr-line>s/n. E-23071</addr-line>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2019</year>
      </pub-date>
      <fpage>20</fpage>
      <lpage>25</lpage>
      <abstract>
        <p>Biomedicine is undergoing huge transformation thanks to the large amount of information stored digitally. Natural Language Processing has the potential to process, analyze and understand text. Our main objective is to use the recognition of medical entities to apply it in different areas of the PLN, in this way we will be able to achieve more powerful and accurate systems to make predictions. Currently, the existing resources and tools in Spanish are not sufficient, so we will study new methods to achieve this important challenge.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>En el dominio biom´edico, la inteligencia
artificial permite generar conocimiento y mejorar
los servicios sanitarios a partir del
tratamiento de informaci´on no estructurada que
supone una parte importante de los datos que se
recogen d´ıa a d´ıa en la pr´actica cl´ınica. La
inteligencia artificial nos permite aprovechar
mejor la informaci´on de salud y dar respuesta
a los nuevos retos de registro, estructuraci´on
y exploraci´on de la informaci´on.</p>
      <p>Se han hecho esfuerzos considerables para
aplicar las tecnolog´ıas de miner´ıa de texto a
la literatura biom´edica y los registros cl´ınicos
escritos en ingl´es, pero es cierto que tenemos
carencias en cuanto a otros idiomas como el
caso del espan˜ol. Por este motivo, el principal
inconveniente que nos encontramos al querer
abordar esta tarea es la carencia de corpus
disponibles en idiomas distintos al ingl´es.</p>
      <p>
        Esta tesis est´a enmarcada dentro del
a´rea del Procesamiento del Lenguaje
Natural (PLN) en lengua espan˜ola,
concretamente, aborda el estudio de una tarea muy
importante dentro de los Sistemas de
Recuperaci´on de Informaci´on (SRI), como es el
Reconocimiento de Entidades Nombradas (NER)
        <xref ref-type="bibr" rid="ref4">(Doan et al., 2012)</xref>
        .
      </p>
      <p>El principal objetivo de NER consiste en
localizar y clasificar en categor´ıas
predefinidas las entidades encontradas en el texto.
Estas categor´ıas pueden variar dependiendo
del dominio en el que se aplique. En el
caso del dominio biom´edico podemos identificar
secciones en texto referidas a enfermedades,
medicamentos, s´ıntomas, patolog´ıas o
incluso datos relacionados con pacientes como el
nombre, fecha de nacimiento y localizaci´on.</p>
      <p>
        El presente trabajo se centra en la
identificaci´on de conceptos m´edicos aplicados en
distintas ´areas del PLN como son la
clasificaci´on de documentos y la recuperaci´on de
informaci´on (IR por sus siglas en ingl´es). La
clasificacio´n autom´atica de texto consiste en
un conjunto de algoritmos, t´ecnicas y
sistemas capaces de asignar un documento a una
o varias categor´ıas o grupos de documentos
        <xref ref-type="bibr" rid="ref2">(Cohen y Hersh, 2005)</xref>
        , por otro lado, la
recuperaci´on de informaci´on trata de encontrar
documentos de una naturaleza no
estructurada que satisfacen una necesidad de
informaci´on
        <xref ref-type="bibr" rid="ref10">(Manning, Raghavan, y Schu¨tze, 2010)</xref>
        .
Aplicar NER en estas ´areas se puede
considerar una buena pr´actica para enriquecer
algoritmos y que as´ı estos aprendan de manera
m´as precisa y adecuada para la consecuci´on
de los problemas definidos.
      </p>
      <p>En cuanto a los problemas encontrados
con el idioma, en los u´ltimos an˜os se han ido
creando diferentes competiciones en
congresos nacionales que facilitan la obtenci´on de
datos para realizar estudios. El Plan de
Impulso de las Tecnolog´ıas del Lenguaje (Plan
TL)1 tiene como objetivo fomentar el
desarrollo del PLN en lengua espan˜ola y lenguas
cooficiales, por otro lado, la Secretar´ıa de
Estado para el Avance Digital (SEAD) junto
con el Consorcio Barcelona Supercomputing
Center - Centro Nacional de
Supercomputaci´on (BSC-CNS) trabajan concretamente
para el ´area de biomedicina.
2</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajos relacionado</title>
      <p>Para dar una visi´on general, en esta secci´on
se proporcionar´a una breve descripci´on de
los trabajos relacionados que existen hasta el
momento.</p>
      <p>En cuanto al reconocimiento de
entidades nombradas se han disen˜ado distintas
herramientas autom´aticas especializadas en el
campo de la medicina haciendo uso del PLN,
algunas de las m´as importantes se muestran
a continuaci´on:</p>
      <sec id="sec-2-1">
        <title>LSP-MLP es la primera herramienta</title>
        <p>desarrollada por la Universidad de
Nueva York enfocada en extraer s´ıntomas,
medicamentos y efectos secundarios de
documentos cl´ınicos.</p>
        <p>
          MedLEE (Medical Language Extraction
and Encoding System)
          <xref ref-type="bibr" rid="ref5">(Friedman et al.,
1995)</xref>
          utiliza PLN en informes cl´ınicos
para ayudar a la toma de decisiones.
        </p>
      </sec>
      <sec id="sec-2-2">
        <title>MetaMap (Aronson, 2001) fue desarro</title>
        <p>
          llada por la NLM (National Library of
Medicine) y mapea en UMLS (Unified
Medical Language System)2 los t´erminos
m´edicos encontrados en el texto.
cTakes
          <xref ref-type="bibr" rid="ref16">(Savova et al., 2010)</xref>
          utiliza un
enfoque de aprendizaje autom´atico con
m´etodos basados en reglas.
        </p>
      </sec>
      <sec id="sec-2-3">
        <title>MedEx (Xu et al., 2010) se centr´o prin</title>
        <p>cipalmente en la identificaci´on de
entidades de medicamento.</p>
        <p>
          Los sistemas con el uso de
caracter´ısticas aprovechan el conocimiento del dominio
biom´edico para mejorar la clasificaci´on de
textos cl´ınicos, Garla
          <xref ref-type="bibr" rid="ref6">(Garla y Brandt, 2012)</xref>
          propone el uso de UMLS para enriquecer
el rendimiento de los clasificadores basados
en el aprendizaje autom´atico. Por otro lado,
Zuccon
          <xref ref-type="bibr" rid="ref19">(Zuccon et al., 2013)</xref>
          tambi´en
aprovecha la terminolog´ıa Snomed-CT3 utilizando
conceptos relacionadas con anormalidades y
trastornos morfol´ogicos para clasificar
informes radiol´ogicos.
        </p>
        <p>
          En cuanto a los sistemas de recuperaci´on
de informaci´on (SRI) los enfoques
interactivos necesitan la intervenci´on del usuario para
refinar y afinar el comportamiento del
sistema a fin de obtener una mejor respuesta,
mejorando as´ı la relevancia de los elementos
recuperados. El sistema propuesto por Mourao
          <xref ref-type="bibr" rid="ref11">(Mour˜ao, Martins, y Magalh˜aes, 2015)</xref>
          permite al usuario an˜adir nuevas palabras
clave tomadas del tesauro MeSH antes de
realizar la expansi´on de la consulta, aunque en
este estudio las palabras clave se proponen
autom´aticamente. Esta idea de permitir al
usuario refinar la consulta no es nueva, ya
que expansi´on interactiva de la consulta fue
propuesta hace m´as de treinta an˜os
          <xref ref-type="bibr" rid="ref8">(Harman,
1988)</xref>
          .
        </p>
        <p>2https://www.nlm.nih.gov/research/umls/
3http://www.snomed.org/</p>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Descripci´on de la investigaci´on propuesta</title>
      <p>La presente tesis se encuentra en proceso de
adaptaci´on y generaci´on de recursos para la
consecuci´on de las tareas propuestas. El
presente an˜o ha estado marcado por diferentes
hitos y tareas propuestas por talleres y
competiciones existentes en congresos tanto
nacionales como internacionales en este ´area.</p>
      <p>El congreso nacional m´as importante en
el ´area del PLN es la Sociedad Espan˜ola
para el Procesamiento del Lenguaje Natural
(SEPLN), este congreso cuenta con un
nuevo workshop llamado MEDDOCAN. Por otro
lado, contamos con congresos internacionales
que abordan la clasificaci´on y reconocimiento
de entidades como son BioNLP, CLEF, ACL
o TREC.</p>
      <p>Todos estos congresos ayudan a seguir
unas pautas para desarrollar sistemas, y
posteriormente compararte con investigadores
que trabajan en mismo campo de estudio.
Desde otra perspectiva, estos talleres
tambi´en aportan nuevas colecciones de texto
relacionados con la biomedicina que servir´an de
prueba para los sistemas. Es por este motivo,
que decidimos participar en ellos y as´ı
continuar avanzando.</p>
      <p>En cuanto a la extracci´on de
informaci´on participamos en el congreso Text
REtrieval Conference (TREC). El objetivo de
esta tarea era obtener documentos
relevantes en ingl´es para diferentes consultas que los
organizadores te proporcionaban. Las
consultas estaban divididas en varios campos
relacionados con c´anceres y genes. Nuestro
objetivo fue obtener los primeros documentos
con la consulta original y posteriormente
rerankear esos documentos reconociendo
entidades m´edicas en ellos (Lo´pez-Ubeda et al.,
). Para la identificaci´on de conceptos m´edicos
utilizamos la herramienta autom´atica
descrita anteriormente llamada MetaMap.</p>
      <p>Hemos abordado varias tareas para la
clasificaci´on de documentos relacionados con la
medicina. La primera fue en Conference and
Labs of the Evaluation Forum (CLEF)
concretamente la tarea eRisk: Early Detection of
Signs of Anorexia; esta trataba de detectar
de forma temprana signos de anorexia en
textos extra´ıdos de la plataforma social llamada
Reddit4, para llevar a cabo esta tarea
modificamos la matriz de pesos Tf-Idf aportando
informaci´on obtenida del reconocedor de
entidades m´edicas MetaMap y de la
representaci´on de palabras usando word embeddings.
De este workshop naci´o la idea de generar un
nuevo recurso en espan˜ol que estuviera a la
disposici´on de la comunidad cient´ıfica para
realizar experimentos y pruebas acerca de
esta enfermedad. Se gener´o un nuevo corpus
extra´ıdo de la red social Twitter para detectar
problemas de anorexia en textos. Este
corpus ha sido generado y presentado para el
congreso internacional RANLP 2019 y est´a
compuesto por 5707 tweets clasificados como
anorexia y no-anorexia.</p>
      <p>Otro workshop aplicando clasificaci´on de
texto fue el Social Media Mining for Health
Applications (SMM4H) en la tarea 1:
Automatic classifications of adverse effects
mentions in tweets, el objetivo fue una
clasificaci´on binaria sobre textos en ingl´es. El
sistema disen˜ado para ello era capaz de distinguir
entre los tweets que informan de un Efecto
Adverso (EA) y los que no. Para ello
aplicamos diferentes estrategias de machine
learning y deep learning utilizando redes
neuronales convolucionales.</p>
      <p>
        Para la tarea de NER hemos
participado en varios workshop. El primero de ellos
fue tambi´en en SMM4H y la tarea 2:
Extraction of Adverse Effect mentions, esta incluye
la identificaci´on de reacciones adversas a los
medicamentos (ADR) reportadas en el
texto escrito en ingl´es. Se utiliz´o machine
learning con Conditional Random Fields
        <xref ref-type="bibr" rid="ref13">(Okazaki, 2007)</xref>
        (CRF) con diferentes caracter´ısticas
obtenidas de word embeddings y clustering
de palabras (Brown et al., 1992).
      </p>
      <p>En el congreso SEPLN, MEDDOCAN
(Medical Document Anonymization) es la
primera tarea dedicada espec´ıficamente a la
anonimizaci´on de documentos m´edicos en
espan˜ol. Dentro de esta tarea tambi´en hemos
participado en varias sub-tareas, en la
primera de ellas el objetivo era identificar
entidades Protected Health Information (PHI)
y asignarle una categor´ıa a cada entidad. La
otra sub-tarea consist´ıa en identificar y ser
capaz de enmascarar datos sensibles
independientemente del tipo de entidad. Para ambas
sub-tareas aplicamos el mismo m´etodo que
consist´ıa en un enfoque h´ıbrido entre CRF y
sistemas basados en reglas. Los resultados
obtenidos han sido esperanzadores, alcanzando
m´as del 90 % en ambas tareas.</p>
      <p>Para finalizar, en el congreso
internacional BioNLP, hemos participado en un
nuevo workshop llamado PharmaCoNER
(Pharmacological Substances, Compounds and
proteins and Named Entity Recognition). Este
workshop est´a dedicado al reconocimiento de
qu´ımicos y medicamentos en textos m´edicos
en espan˜ol y est´a compuesto por varias
subtareas. Por un lado, aborda un problema de
NER donde debemos encontrar la entidad
nombrada junto con una etiqueta asociada;
por otro lado, conlleva asignarle un c´odigo
Snomed-CT a las entidades nombradas
identificadas anteriormente. El resultado
obtenido fue el esperado, en la primera sub-tarea
se desarrollaron enfoques de machine
learning y deep learning y le an˜adimos
informaci´on adicional con la ayuda de la
terminolog´ıa Snomed-CT, esto contribuy´o a los
resultados ya que conseguimos detectar y
anotar el 78 % de los conceptos. Para la segunda
sub-tarea, se gener´o una arquitectura basada
en diccionarios para encontrar el identificador
de Snomed-CT m´as apropiado.
4</p>
    </sec>
    <sec id="sec-4">
      <title>Metodolog´ıa propuesta</title>
      <p>La metodolog´ıa de este trabajo se basa en
el estudio del estado del arte de las
distintas ´areas en las que estamos trabajando como
son: la recuperaci´on de informaci´on, el
reconocimiento de entidades nombradas y la
clasificaci´on dentro del dominio biom´edico. Este
estudio consistir´a en una revisi´on
bibliogr´afica de ya lo existente, centr´andonos
principalmente en el uso de las entidades nombradas
m´edicas para enriquecer sistemas de
clasificaci´on y de recuperaci´on de informaci´on.</p>
      <p>Para la consecuci´on de la tarea de
identificaci´on de conceptos m´edicos se crear´an
nuevos sistemas basados en diccionarios, en
reglas, en aprendizaje autom´atico o h´ıbridos.</p>
      <p>En los sistemas basados en diccionarios es
necesario partir de un vocabulario
controlado, en el campo de la medicina contamos con
ontolog´ıas, terminolog´ıas, diccionarios y
lexicones. Algunos de los vocabularios m´as
populares hasta el momento son UMLS,
SnomedCT, ICD-10 (International Statistical
Classification of Diseases) o MeSH (Medical
Subject Headings)5. Con estos recursos
conseguimos ir un paso m´as all´a, pudiendo mapear el
concepto identificado en un c´odigo
estandarizado.</p>
      <p>
        Los m´etodos basados en diccionario
utilizan recursos terminol´ogicos existentes para
localizar ocurrencias de t´ermino dentro del
texto. Los sistemas basados en reglas
desarrollan patrones en el texto que describen
estructuras de nomenclatura comunes para
ciertos t´erminos, buscando indicios ortogr´aficos o
l´exicos, o caracter´ısticas m´as complejas como
las morfo-sint´acticas
        <xref ref-type="bibr" rid="ref1 ref12">(Chen et al., 2019;
Nguyen et al., 2010)</xref>
        . Los enfoques h´ıbridos
combinan diferentes m´etodos (t´ıpicamente los
basados en reglas y el aprendizaje autom´atico)
y varios recursos (listas de t´erminos
espec´ıficos, palabras, etc.) para la tarea de
reconocimiento de t´erminos.
      </p>
      <p>
        Por otro lado, se estudiar´an los diferentes
m´etodos de aprendizaje autom´atico
        <xref ref-type="bibr" rid="ref18">(Zhou et
al., 2004)</xref>
        y aprendizaje profundo
        <xref ref-type="bibr" rid="ref7">(GuoDong
y Jian, 2004)</xref>
        existentes tanto para el ´area de
NER como para la clasificaci´on de
documentos.
      </p>
      <p>
        Otra tarea a abordar ser´a el uso de
t´ecnicas novedosas con Modelos de Lenguaje. Los
modelos de lenguaje son el principal
problema para algunas tareas del Procesamiento
de Lenguaje Natural tales como los
sistemas conversacionales, generaci´on de textos
o resu´menes de textos. Pero tambi´en ha
sido aplicado a otros ´ambitos como la
identificaci´on de t´erminos. Un modelo de
lenguaje entrenado aprende la probabilidad de que
ocurra una palabra bas´andose en la secuencia
anterior de palabras usadas en el texto. Los
modelos de lenguaje pueden ser operados a
nivel de caracteres, a nivel de n-gramas, a
nivel de frases o incluso a nivel de p´arrafos. Un
ejemplo es el de Rizwan
        <xref ref-type="bibr" rid="ref14">(Parvez et al., 2018)</xref>
        ,
el modelo que gener´o aprende la distribuci´on
de probabilidad sobre todas las palabras
candidatas aprovechando la informaci´on del tipo
de entidad.
      </p>
      <p>
        Existen numerosos modelos de
lenguaje pre-entrenados actualmente como por
ejemplo: Embeddings from Language Models
(ELMo)
        <xref ref-type="bibr" rid="ref15">(Peters et al., 2018)</xref>
        , Bidirectional
Encoder Representations from Transformers
(BERT)
        <xref ref-type="bibr" rid="ref3">(Devlin et al., 2018)</xref>
        , Universal
Language Model Fine-tuning (ULMFiT)
        <xref ref-type="bibr" rid="ref9">(Howard y Ruder, 2018)</xref>
        o BioBERT que es un
modelo de representaci´on del lenguaje para el
dominio biom´edico, especialmente disen˜ado
para tareas de miner´ıa de textos biom´edicos,
como el reconocimiento biom´edico de
entidades nombradas.
      </p>
      <p>Finalmente, se realizar´a una
experimentaci´on y evaluaci´on. Se probar´an los sistemas
desarrollados para ver su efectividad, de esta
manera, podremos comparar nuestros
resultados. Los resultados logrados ser´a
compartidos y se pondr´an a disposici´on de la
comunidad cient´ıfica.
5</p>
    </sec>
    <sec id="sec-5">
      <title>Elementos de investigaci´on para discusi´on</title>
      <p>La clasificacio´n, recuperaci´on de informaci´on,
anotaci´on e identificaci´on de entidades es un
tema de inter´es en el PLN, nuestra intenci´on
en este trabajo es discutir las siguientes
aspectos para seguir profundizando en el
estudio:
¿Es necesario la creaci´on de recursos
para el NER m´edicas en espan˜ol?
¿Qu´e sistemas son los principalmente
usados en el NER en el dominio
biom´edico?
¿Basta utilizar los vocabularios
controlados anteriormente mencionados para
mejorar la clasificacio´n o la recuperaci´on
de informaci´on?
¿Qu´e t´ecnicas se utilizan para enriquecer
con los vocabularios m´edicos existes?
¿Qu´e otros recursos contribuyen a la
consecuci´on del NER dentro del campo
de la medicina?
¿Cu´anta informaci´on extra aporta el
reconocimiento de entidades en el ´area de
la clasificacio´n? ¿Y para la recuperaci´on
de informaci´on?</p>
    </sec>
    <sec id="sec-6">
      <title>Agradecimientos</title>
      <p>Este trabajo est´a parcialmente
subvencionado por el Fondo Europeo de Desarrollo
Regional (FEDER), el proyecto LIVING-LANG
(RTI2018-094653-B-C21) y el proyecto
REDES (TIN2015-65136-C2-1-R) del Gobierno
de Espan˜a.</p>
    </sec>
    <sec id="sec-7">
      <title>Bibliograf´ıa</title>
      <p>Aronson, A. R. 2001. Effective mapping
of biomedical text to the umls
metathesaurus: the metamap program. En
Proceedings of the AMIA Symposium,
p´agina 17. American Medical Informatics
Association.</p>
      <p>Brown, P. F., P. V. Desouza, R. L. Mercer,
V. J. D. Pietra, y J. C. Lai. 1992.
Classbased n-gram models of natural language.
Computational linguistics, 18(4):467–479.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Chen</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Song</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Shao</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Li</surname>
          </string-name>
          ,
          <string-name>
            <given-names>y K.</given-names>
            <surname>Ding</surname>
          </string-name>
          .
          <year>2019</year>
          .
          <article-title>Using natural language processing to extract clinically useful information from chinese electronic medical records</article-title>
          .
          <source>International journal of medical informatics</source>
          ,
          <volume>124</volume>
          :
          <fpage>6</fpage>
          -
          <lpage>12</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Cohen</surname>
            , A. M. y
            <given-names>W. R.</given-names>
          </string-name>
          <string-name>
            <surname>Hersh</surname>
          </string-name>
          .
          <year>2005</year>
          .
          <article-title>A survey of current work in biomedical text mining</article-title>
          . Briefings in bioinformatics,
          <volume>6</volume>
          (
          <issue>1</issue>
          ):
          <fpage>57</fpage>
          -
          <lpage>71</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Devlin</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>M.-W.</given-names>
            <surname>Chang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lee</surname>
          </string-name>
          , y
          <string-name>
            <given-names>K.</given-names>
            <surname>Toutanova</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Bert: Pre-training of deep bidirectional transformers for language understanding</article-title>
          . arXiv preprint arXiv:
          <year>1810</year>
          .04805.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Doan</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Collier</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Xu</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P. H.</given-names>
            <surname>Duy</surname>
          </string-name>
          , y
          <string-name>
            <given-names>T. M.</given-names>
            <surname>Phuong</surname>
          </string-name>
          .
          <year>2012</year>
          .
          <article-title>Recognition of medication information from discharge summaries using ensembles of classifiers. BMC medical informatics and decision making</article-title>
          ,
          <volume>12</volume>
          (
          <issue>1</issue>
          ):
          <fpage>36</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Friedman</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>S. B.</given-names>
            <surname>Johnson</surname>
          </string-name>
          , B. Forman,
          <string-name>
            <given-names>y J.</given-names>
            <surname>Starren</surname>
          </string-name>
          .
          <year>1995</year>
          .
          <article-title>Architectural requirements for a multipurpose natural language processor in the clinical environment</article-title>
          .
          <source>En Proceedings of the Annual Symposium on Computer Application in Medical Care</source>
          , p´
          <fpage>agina</fpage>
          347. American Medical Informatics Association.
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Garla</surname>
            ,
            <given-names>V. N. y C.</given-names>
          </string-name>
          <string-name>
            <surname>Brandt</surname>
          </string-name>
          .
          <year>2012</year>
          .
          <article-title>Ontologyguided feature engineering for clinical text classification</article-title>
          .
          <source>Journal of biomedical informatics</source>
          ,
          <volume>45</volume>
          (
          <issue>5</issue>
          ):
          <fpage>992</fpage>
          -
          <lpage>998</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>GuoDong</surname>
            ,
            <given-names>Z. y S.</given-names>
          </string-name>
          <string-name>
            <surname>Jian</surname>
          </string-name>
          .
          <year>2004</year>
          .
          <article-title>Exploring deep knowledge resources in biomedical name recognition</article-title>
          .
          <source>En Proceedings of the International Joint Workshop on Natural Language Processing in Biomedicine and its Applications</source>
          , p´aginas 96-
          <fpage>99</fpage>
          . Association for Computational Linguistics.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Harman</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          <year>1988</year>
          .
          <article-title>Towards interactive query expansion</article-title>
          .
          <source>p´aginas 321-331. cited By</source>
          <volume>110</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Howard</surname>
            , J. y
            <given-names>S.</given-names>
          </string-name>
          <string-name>
            <surname>Ruder</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Universal language model fine-tuning for text classification</article-title>
          . arXiv preprint arXiv:
          <year>1801</year>
          .06146.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Manning</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          , P. Raghavan, y H. Schu¨tze.
          <year>2010</year>
          .
          <article-title>Introduction to information retrieval</article-title>
          .
          <source>Natural Language Engineering</source>
          ,
          <volume>16</volume>
          (
          <issue>1</issue>
          ):
          <fpage>100</fpage>
          -
          <lpage>103</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <article-title>Mour˜ao, A</article-title>
          .,
          <string-name>
            <given-names>F.</given-names>
            <surname>Martins</surname>
          </string-name>
          , y J. Magalh˜aes.
          <year>2015</year>
          .
          <article-title>Multimodal medical information retrieval with unsupervised rank fusion</article-title>
          .
          <source>Computerized Medical Imaging and Graphics</source>
          ,
          <volume>39</volume>
          :
          <fpage>35</fpage>
          -
          <lpage>45</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Nguyen</surname>
            ,
            <given-names>A. N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>M. J. Lawley</surname>
            ,
            <given-names>D. P.</given-names>
          </string-name>
          <string-name>
            <surname>Hansen</surname>
            ,
            <given-names>R. V.</given-names>
          </string-name>
          <string-name>
            <surname>Bowman</surname>
            ,
            <given-names>B. E.</given-names>
          </string-name>
          <string-name>
            <surname>Clarke</surname>
            , E. E. Duhig, y
            <given-names>S.</given-names>
          </string-name>
          <string-name>
            <surname>Colquist</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Symbolic rule-based classification of lung cancer stages from free-text pathology reports</article-title>
          .
          <source>Journal of the American Medical Informatics Association</source>
          ,
          <volume>17</volume>
          (
          <issue>4</issue>
          ):
          <fpage>440</fpage>
          -
          <lpage>445</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Okazaki</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          <year>2007</year>
          .
          <article-title>Crfsuite: a fast implementation of conditional random fields (crfs).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Parvez</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          R.,
          <string-name>
            <given-names>S.</given-names>
            <surname>Chakraborty</surname>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            <surname>Ray</surname>
          </string-name>
          , y
          <string-name>
            <given-names>K.- W.</given-names>
            <surname>Chang</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Building language models for text with named entities</article-title>
          . arXiv preprint arXiv:
          <year>1805</year>
          .04836.
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Peters</surname>
            ,
            <given-names>M. E.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Neumann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Iyyer</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Gardner</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C.</given-names>
            <surname>Clark</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lee</surname>
          </string-name>
          , y
          <string-name>
            <given-names>L.</given-names>
            <surname>Zettlemoyer</surname>
          </string-name>
          .
          <year>2018</year>
          .
          <article-title>Deep contextualized word representations</article-title>
          .
          <source>arXiv preprint arXiv:1802</source>
          .05365.
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Savova</surname>
            ,
            <given-names>G. K.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>J. J.</given-names>
            <surname>Masanz</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P. V.</given-names>
            <surname>Ogren</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Zheng</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Sohn</surname>
          </string-name>
          ,
          <string-name>
            <surname>K. C.</surname>
            Kipper-Schuler, y
            <given-names>C. G.</given-names>
          </string-name>
          <string-name>
            <surname>Chute</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Mayo clinical text analysis and knowledge extraction system (ctakes): architecture, component evaluation and applications</article-title>
          .
          <source>Journal of the American Medical Informatics Association</source>
          ,
          <volume>17</volume>
          (
          <issue>5</issue>
          ):
          <fpage>507</fpage>
          -
          <lpage>513</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <surname>Xu</surname>
            , H.,
            <given-names>S. P.</given-names>
          </string-name>
          <string-name>
            <surname>Stenner</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          <string-name>
            <surname>Doan</surname>
          </string-name>
          ,
          <string-name>
            <surname>K. B. Johnson</surname>
            ,
            <given-names>L. R.</given-names>
          </string-name>
          <string-name>
            <surname>Waitman</surname>
            ,
            <given-names>y J. C.</given-names>
          </string-name>
          <string-name>
            <surname>Denny</surname>
          </string-name>
          .
          <year>2010</year>
          .
          <article-title>Medex: a medication information extraction system for clinical narratives</article-title>
          .
          <source>Journal of the American Medical Informatics Association</source>
          ,
          <volume>17</volume>
          (
          <issue>1</issue>
          ):
          <fpage>19</fpage>
          -
          <lpage>24</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <surname>Zhou</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Zhang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Su</surname>
          </string-name>
          , D. Shen, y
          <string-name>
            <given-names>C.</given-names>
            <surname>Tan</surname>
          </string-name>
          .
          <year>2004</year>
          .
          <article-title>Recognizing names in biomedical texts: a machine learning approach</article-title>
          .
          <source>Bioinformatics</source>
          ,
          <volume>20</volume>
          (
          <issue>7</issue>
          ):
          <fpage>1178</fpage>
          -
          <lpage>1190</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Zuccon</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>A. S.</given-names>
            <surname>Wagholikar</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A. N.</given-names>
            <surname>Nguyen</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Butt</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Chu</surname>
          </string-name>
          , S. Martin,
          <string-name>
            <given-names>y J.</given-names>
            <surname>Greenslade</surname>
          </string-name>
          .
          <year>2013</year>
          .
          <article-title>Automatic classification of free-text radiology reports to identify limb fractures using machine learning and the snomed ct ontology</article-title>
          .
          <source>AMIA Summits on Translational Science Proceedings</source>
          ,
          <year>2013</year>
          :
          <fpage>300</fpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>