<?xml version="1.0" encoding="UTF-8"?>
<TEI xml:space="preserve" xmlns="http://www.tei-c.org/ns/1.0" 
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 
xsi:schemaLocation="http://www.tei-c.org/ns/1.0 https://raw.githubusercontent.com/kermitt2/grobid/master/grobid-home/schemas/xsd/Grobid.xsd"
 xmlns:xlink="http://www.w3.org/1999/xlink">
	<teiHeader xml:lang="es">
		<fileDesc>
			<titleStmt>
				<title level="a" type="main">SINAI en TASS 2018 Task 3. Clasificando acciones y conceptos con UMLS en MedLine. SINAI in TASS 2018 Task 3. Classifying actions and concepts with UMLS on MedLine</title>
			</titleStmt>
			<publicationStmt>
				<publisher/>
				<availability status="unknown"><licence/></availability>
			</publicationStmt>
			<sourceDesc>
				<biblStruct>
					<analytic>
						<author>
							<persName><forename type="first">Pilar</forename><surname>López-Úbeda</surname></persName>
							<affiliation key="aff0">
								<orgName type="department" key="dep1">Departamento de informática</orgName>
								<orgName type="department" key="dep2">Centro de Estudios Avanzados en TIC (CEATIC</orgName>
								<orgName type="institution">Universidad de Jaén</orgName>
								<address>
									<addrLine>Campus Las Lagunillas</addrLine>
									<postCode>23071</postCode>
									<settlement>Jaén</settlement>
									<country key="ES">España</country>
								</address>
							</affiliation>
						</author>
						<author>
							<persName><roleName>María</roleName><forename type="first">Manuel</forename><forename type="middle">C</forename><surname>Díaz-Galiano</surname></persName>
							<affiliation key="aff0">
								<orgName type="department" key="dep1">Departamento de informática</orgName>
								<orgName type="department" key="dep2">Centro de Estudios Avanzados en TIC (CEATIC</orgName>
								<orgName type="institution">Universidad de Jaén</orgName>
								<address>
									<addrLine>Campus Las Lagunillas</addrLine>
									<postCode>23071</postCode>
									<settlement>Jaén</settlement>
									<country key="ES">España</country>
								</address>
							</affiliation>
						</author>
						<author>
							<persName><forename type="first">Teresa</forename><surname>Martín-Valdivia</surname></persName>
							<affiliation key="aff0">
								<orgName type="department" key="dep1">Departamento de informática</orgName>
								<orgName type="department" key="dep2">Centro de Estudios Avanzados en TIC (CEATIC</orgName>
								<orgName type="institution">Universidad de Jaén</orgName>
								<address>
									<addrLine>Campus Las Lagunillas</addrLine>
									<postCode>23071</postCode>
									<settlement>Jaén</settlement>
									<country key="ES">España</country>
								</address>
							</affiliation>
						</author>
						<author>
							<persName><forename type="first">L</forename><surname>Alfonso Ureña-López</surname></persName>
							<affiliation key="aff0">
								<orgName type="department" key="dep1">Departamento de informática</orgName>
								<orgName type="department" key="dep2">Centro de Estudios Avanzados en TIC (CEATIC</orgName>
								<orgName type="institution">Universidad de Jaén</orgName>
								<address>
									<addrLine>Campus Las Lagunillas</addrLine>
									<postCode>23071</postCode>
									<settlement>Jaén</settlement>
									<country key="ES">España</country>
								</address>
							</affiliation>
						</author>
						<title level="a" type="main">SINAI en TASS 2018 Task 3. Clasificando acciones y conceptos con UMLS en MedLine. SINAI in TASS 2018 Task 3. Classifying actions and concepts with UMLS on MedLine</title>
					</analytic>
					<monogr>
						<idno type="ISSN">1613-0073</idno>
					</monogr>
					<idno type="MD5">494E11217E781060F161B47D1CB9CFA7</idno>
				</biblStruct>
			</sourceDesc>
		</fileDesc>
		<encodingDesc>
			<appInfo>
				<application version="0.7.2" ident="GROBID" when="2023-03-25T01:29+0000">
					<desc>GROBID - A machine learning software for extracting information from scholarly documents</desc>
					<ref target="https://github.com/kermitt2/grobid"/>
				</application>
			</appInfo>
		</encodingDesc>
		<profileDesc>
			<textClass>
				<keywords>
					<term>UMLS</term>
					<term>Reconocedor de Entidades</term>
					<term>Clasificación</term>
					<term>Análisis Morfológico UMLS</term>
					<term>Entity Recognition</term>
					<term>Classification</term>
					<term>Morphological Analysis</term>
				</keywords>
			</textClass>
			<abstract>
<div xmlns="http://www.tei-c.org/ns/1.0"><p>Resumen: Este artículo describe la primera participación del grupo SINAI en Task 3. eHealth Knowledge Discovery del Taller de Análisis Semántico en la SEPLN. Nuestro objetivo ha sido desarrollar un sistema de detección de entidades médicas en español utilizando técnicas de Procesamiento del Lenguaje Natural para finalmente clasificar términos en acciones o conceptos. Para ello, hemos utilizando la ontología biomédica UMLS además de diversos filtros para conseguir un sistema más eficaz. Los resultados obtenidos han sido satisfactorios aunque se debe mejorar la exhaustividad en cuanto a la clasificación.</p></div>
			</abstract>
		</profileDesc>
	</teiHeader>
	<text xml:lang="es">
		<body>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="1">Introducción</head><p>Hoy día, la necesidad de tener un buen sistema informático para la extracción de información en informes médicos está teniendo gran importancia, pues los datos contenidos en dichos documentos son relevantes. Aunque existen diversas herramientas y estudios que realizan detección de conceptos biomédicos <ref type="bibr">(Aronson, 2001;</ref><ref type="bibr">Krauthammer y Nenadic, 2004;</ref><ref type="bibr">Osborne et al., 2007;</ref><ref type="bibr">Wright et al., 1999;</ref><ref type="bibr">Allones, Martínez, y Taboada, 2014)</ref>, la mayoría son para documentos en inglés, por lo que se hace necesario el diseño y desarrollo de nuevas y potentes herramientas de procesamiento de la información en español que aprovechen los avances de las tecnologías relacionadas con la información para poder acceder y analizar estos datos.</p><p>La clasificación de entidades es una técnica englobada dentro del Procesamiento del Lenguaje Natural (PLN) que sirve para asignar un tópico o categoría de forma automática a cualquier entidad detectada en un texto.</p><p>La nueva tarea llamada Task 3: eHealth Knowledge Discovery que nos propone el Taller de Análisis Semántico de la Sociedad Española para el Procesamiento del Lenguaje Natural (TASS) no ha sido incluida en años anteriores <ref type="bibr">(Martínez-Cámara et al., 2017)</ref>, por lo que es un nuevo reto a seguir. Está inspirada en tareas como Semeval-2017 Task 10: ScienceIE (Gonzalez-Hernandez et al., 2017) y líneas de investigación como Teleologies (Giunchiglia y Fumagalli, 2017), ambas no centradas específicamente en el área de la salud. eHealth-KD propone modelar el lenguaje humano en un escenario en el que los documentos electrónicos de salud españoles puedan ser legibles por máquina desde un punto de vista semántico.</p><p>Los documentos usados para esta tarea se han obtenido de MedlinePlus 1 y han sido tratados manualmente para esta tarea, tal y como se describe en el artículo resumen del TASS <ref type="bibr">(Martínez-Cámara et al., 2018)</ref>.</p><p>Este artículo explica nuestra participación en la tarea en las siguientes tres secciones: en la Sección 2 se describe el funcionamiento del sistema, a continuación, en la Sección 3 se muestra los resultados obtenidos y para finalizar, exponemos las conclusiones y trabajos futuros en la Sección 4.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2">Descripción del sistema</head><p>Para nuestra primera participación en esta tarea, hemos diseñado un sistema sencillo que realiza un análisis morfológico para detectar ((acciones)) y ((conceptos)), tal y como se muestra en la Figura 1. Posteriormente, utiliza una base de conocimiento biomédica para reconocer entidades médicas y finalmente aplica varios filtros para eliminar falsos positivos.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Documentos Análisis morfológico</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Filtro Filtro</head><p>Reconocedor de entidades UMLS</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Resultados</head><p>«acciones» «conceptos» Figura 1: Arquitectura del sistema.</p><p>En las siguientes subsecciones se describen con mas detalle cada parte del sistema.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.1">Análisis morfológico</head><p>Para el desarrollo del sistema utilizamos el analizador sintáctico incluido en la herramienta CoreNLP desarrollada por la 1 https://medlineplus.gov/ Universidad de Stanford para el español <ref type="bibr">(Manning et al., 2014)</ref>.</p><p>Con esta herramienta realizamos una separación entre verbos y no verbos. Siendo los verbos etiquetados como posible ((acción)) y todo lo demás será analizado posteriormente para encontrar posibles ((conceptos)). Esta separación nos permite realizar un análisis distinto para cada tipo de entidad que queremos detectar. Detección de acciones Al realizar un estudio exhaustivo de los datos de test ofrecidos por la organización, se ha comprobado que las acciones compuestas por perífrasis verbales, sólo tienen marcado el verbo de la acción principal, obviándose el verbo auxiliar. Entre ellos, vemos diferentes conjugaciones de los verbos "poder", "haber", "soler", etc. Observamos que la mayoría son perífrasis de infinitivo, como por ejemplo: "pueden sufrir" o "debe hablar".</p><p>Tras ello y para llegar a realizar un sistema más eficaz, hemos obviado los siguientes verbos y sus respectivas conjugaciones: estar, deber, poder, soler.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.2">Reconocedor de conceptos con UMLS</head><p>En esta sección, presentamos la herramienta creada para conseguir detectar ((conceptos)) en el texto. Esta herramienta reconoce términos biomédicos basado en Unified Medical Languaje System (UMLS) <ref type="bibr">(Bodenreider, 2004)</ref>. UMLS es un proyecto de la National Library of Medicine (NLM) que agrupa actualmente más de 3,46 millones de conceptos sobre dominio médico, de los cuales hemos obtenido un total de 846.044 conceptos en español.</p><p>El sistema utiliza PLN tanto en el texto de entrada como en texto de los conceptos del diccionario UMLS y busca los conceptos con mayor porcentaje de términos contenidos en el texto de entrada. El sistema realiza los pasos siguientes: El identificador de entidades médicas automático devuelve 10 resultados, cada uno de ellos compuesto por: el concepto detectado en la frase, el código UMLS asociado y el porcentaje de concordancia con el texto. Dicho porcentaje de concordancia se calcula en función del número de palabras del concepto UMLS que se pueden encontrar en la frase. En la Figura 2 podemos ver un ejemplo de los conceptos detectados para la frase "síntomas de las mujeres". Tanto concepto "síntoma" como el concepto "Mujeres" se encuentran completos dentro de la frase, por lo que el sistema devuelve el 100 % de acuerdo para ambos. Sin embargo, para el resultado 3 ("Salud de las Mujeres") que está compuesto por 4 palabras, sólo 3 de ellas se encuentran en la frase de búsqueda por lo que el sistema devuelve una coincidencia del 75 %. 2 https://www.nltk.org/ 3 https://snowballstem.org/</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.3">Términos multipalabra</head><p>Posteriormente, intentamos localizar conceptos multipalabra utilizando la lista de etiquetado gramatical obtenida en la Sección 2.1 y el reconocedor de la Sección 2.2. Para ello buscamos sentencias que comiencen y acaben en sustantivo o adjetivo sin que esa frase contenga un verbo en su interior. De esta manera, intentaremos identificar conceptos en frases como: "personas con enfermedad" o "adultos de mayor edad", pero no buscaremos frases como las siguientes: "niños tienen enfermedades" o "paciente no toma aspirina".</p><p>Tras analizar las frases convenientes en nuestro sistema, calculamos una nueva métrica basada en número de palabras y número de stop-word contenidas tanto en la frase de entrada como en el concepto devuelto por el sistema basado en UMLS.</p><formula xml:id="formula_0">M = (T R − SW R)/(T I − SW I)<label>(1) donde:</label></formula><p>T R es el número de términos reconocidos por el sistema de detección.</p><p>SW R es el número de stop-words recocidas por el sistema de detección.</p><p>T I es el número de términos introducidos para buscar dentro del sistema.</p><p>SW I es el número de stop-words introducidas para buscar dentro del sistema.</p><p>Finalmente, se comprueba: (1) que el concepto detectado contiene más de una palabra y (2) que la métrica M (definida en la fórmula 1) sea menor estricta que el porcentaje de acierto que devuelve el sistema, si es así, la frase introducida será válida para etiquetarla como concepto.</p><p>En la Figura 3 se muestran algunos ejemplos del calculo de la métrica M para finalmente concluir si es un concepto válido o no lo es. Por ejemplo, para la frase "vías urinarias" el primer resultado no es satisfactorio puesto que el concepto devuelto contiene un único término, en cambio, el resultado 2, si es un concepto válido puesto que es multipalabra y además satisface que el valor de coincidencia 1 y es igual a (2-0)/(2-0) de la fórmula 1. Por otro lado, el último ejemplo, el concepto "sin dolor genitourinario" cumple la condición de ser multipalabra pero no satisface que 0.66 sea mayor o igual que (3-1)/(3-1). En la Figura 4 mostramos el resultado en las distintas subtareas después de haber utilizando el reconocedor multipalabra.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Frase buscada: vías urinarias</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3">Resultados</head><p>La tarea 3 del TASS está compuesta por varias subtareas 4 : 1. Subtarea A: Identificación de frases clave.</p><p>2. Subtarea B: Clasificación de frases clave.</p><p>3. Subtarea C: Determinación de relaciones semánticas.</p><p>4 http://www.sepln.org/workshops/tass/2018/task-3/ La organización proponía poder participar en los siguientes escenario por subtareas: A-B-C, B-C y C. Nuestro grupo SINAI ha participado en dos de los escenarios propuestos: A-B-C y B-C. Para ambos escenarios se implementaron todas las demás funcionalidades explicadas en la Sección 2 además de utilizar el baseline desarrollado por la organización<ref type="foot" target="#foot_1">5</ref> .</p><p>Los resultados obtenidos se muestran en la Tabla 1.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Round Precision Recall Micro F1</head><p>score A-B-C 0,84 0,62 0,71 B-C 0,90 0,54 0,67</p><p>Tabla 1: Resultados obtenidos para cada escenario.</p><p>La medidas de evaluación propuestas por la organización son: precisión, cobertura y F1. Con la precisión, podemos observar que alcanzamos clasificando en torno al 85 % y 90 %, aunque decaemos en la exhaustividad por lo que en la medida Micro F1 nos penaliza estos errores.</p><p>La media del F1 final ha sido de 0,461 ya que no hemos participado en el escenario C y con ello, no hemos podido ponderar esa parte obteniendo finalmente este bajo resultado.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="4">Conclusiones y trabajos futuros</head><p>En este trabajo, el grupo SINAI presenta su primera participación a la tarea 3 del TASS. En nuestra aproximación hemos realizado un sencillo análisis del texto proporcionado, adaptando los resultados de diversas herramientas a los resultados esperados. Como novedad, hemos creado una métrica que ayuda a nuestro sistema a seleccionar aquellos conceptos de UMLS más importantes en el texto. Dicha métrica es sencilla de implementar y rápida en su ejecución, por lo que permite tener un detector de entidades biomédicas con una eficiencia moderada y un gran rendimiento.</p><p>En el ranking final expuesto por los organizadores, nuestro grupo ha quedado en segunda posición aunque no hemos llegado a participar en el escenario C y por ello se obtuvieron resultados no muy altos.</p><p>Para próximas ediciones pretendemos finalizar un nuevo sistema, el cual nos Figura 4: Ejemplo frase anotada para el escenario A-B-C permita participar en el escenario C utilizando las relaciones entre conceptos existentes en UMLS. Sin embargo, nuestro principal objetivo consiste en mejorar el reconocedor automático de entidades biomédicas en español, incluyendo nuevas métricas que nos permitan mejorar la precisión en la detección de multipalabras. Pretendemos entrenar un sistemas de aprendizaje automático para que nos permita combinar dichas métricas de la mejor forma posible.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Agradecimientos</head><p>Este trabajo está parcialmente subvencionado por el Fondo Europeo de Desarrollo Regional (FEDER) y el proyecto REDES (TIN2015-65136-C2-1-R) del Gobierno de España. </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Bibliografía</head></div><figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_0"><head>Figura 2 :</head><label>2</label><figDesc>Figura 2: Ejemplo de resultados obtenidos con el reconocedor automático.</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_1"><head>Figura 3 :</head><label>3</label><figDesc>Figura 3: Ejemplos de valores obtenidos en la detección de multipalabras.</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0"><head></head><label></label><figDesc></figDesc><graphic coords="5,72.00,83.96,453.55,171.30" type="bitmap" /></figure>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" xml:id="foot_0">Pilar López-Úbeda, Manuel Carlos Díaz Galiano, María Teresa Martín-Valdivia y L. Alfonso Ureña-López</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="5" xml:id="foot_1">https://github.com/TASS18-Task3/data Pilar López-Úbeda, Manuel Carlos Díaz Galiano, María Teresa Martín-Valdivia y L. Alfonso Ureña-López</note>
		</body>
		<back>
			<div type="annex">
<div xmlns="http://www.tei-c.org/ns/1.0" />			</div>
			<div type="references">

				<listBibl/>
			</div>
		</back>
	</text>
</TEI>
