<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>ISMR - Sistema basado en Deep Learning para la transcripcion y extraccion de conocimiento en entrevistas medico-paciente</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Pedro Jose Vivancos-Vicente</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jose Antonio Garc a-D az</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Fernando Molina</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Juan Salvador Castejon-Garrido</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Rafael Valencia-Garc a</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>VOCALI Sistemas Inteligentes S.L.</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Parque Cient co de Murcia</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Carretera de Madrid km</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>. Complejo de Espinardo</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Murcia</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Espan~a</string-name>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Facultad de Informatica, Universidad de Murcia, Campus de Espinardo</institution>
          ,
          <addr-line>30100 Murcia, Espan~a</addr-line>
        </aff>
      </contrib-group>
      <abstract>
        <p>Doctor-patient interviews are a key activity in medicine, in which doctors and patients exchange clinical information that must be recorded in the electronic medical record (EHR). However, the excessive administrative work required to ll out the EHRs takes away valuable time that doctors could spend examining patients. This project, nanced by the CDTI with FEDER funds, consists of the creation of a platform that assists doctors and patients during doctor-patient interviews. The aim is to allow doctors to focus on the patient and o er a more personal and comprehensive treatment while the interview is being recorded. Then, the transcription of the interview is processed by extracting medical knowledge that will facilitate the insertion of active episodes in the patient, the prescription of drugs and the generation of yers for diagnostic tests.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>En Espan~a, la demora causada por las
abultadas listas de espera y la masi cacion de
algunos servicios se considera un problema
relevante, causado por reducciones en el
gasto sanitario, el incremento y envejecimiento
de la poblacion y ultimamente por la crisis
del COVID-19. Segun el Sistema de
Informacion de Listas de Espera de 2020, un total de
691.508 pacientes se encuentran en un estado
de espera estructural con un tiempo medio
de espera de 170 d as1 (datos que son
superiores al estudio realizado en 2019). Ademas,
desde la implantacion de la historia cl nica
electronica (HCE), los medicos se quejan de
un exceso de trabajo administrativo, que
conlleva a una disminucion de la productividad.</p>
      <p>1https://www.mscbs.gob.es/estadEstudios/
estadisticas/inforRecopilaciones/listaEspera.
htm
Copyright © 2021 for this paper by its authors. Use permitted under Creative Commons License Attribution 4.0 International (CC BY 4.0).
El medico es quien tiene que realizar todo
el proceso interactuando con varios sistemas
informaticos diferentes. Un problema
an~adido es la gran cantidad de protocolos en cada
especialidad que lleva a que las interfaces de
usuario de este tipo de sistemas sean
complejas.</p>
      <p>El objetivo principal de este proyecto es
la creacion una plataforma de transcripcion
y extraccion de conocimiento en entrevistas
medico-paciente que asista al medico
durante todo el proceso. Gracias a este sistema,
el medico podra entablar conversacion con
el paciente y/o sus acompan~antes
despreocupandose en buena medida de la recogida
manual de datos. El sistema sera capaz de
identi car a cada hablante y registrar el
audio con marcas de tiempo de cada uno por
separado gracias a un dispositivo con un array
de microfonos. Conforme se realiza la
transcripcion, se utilizaran tecnolog as de
extraccion de conocimiento y de anotacion
semantica en tiempo real para estructurar el texto
escrito en lenguaje natural. As , este sistema
detectara s ntomas, medicamentos,
enfermedades, episodios anteriores y otros
elementos interesantes a ser detectados y
registrados durante la consulta. Gracias a esta
deteccion se incorporaran funciones basadas en
estandares de interoperabilidad de
informacion cl nica como HL7 (Health Level Seven
International) que permitan comunicarse con
los sistemas de informacion medicos para
poder registrar episodios activos del paciente,
generar una receta o un volante para una
prueba y as facilitar el trabajo del medico.
2</p>
    </sec>
    <sec id="sec-2">
      <title>Arquitectura del sistema</title>
      <p>La arquitectura del sistema propuesto se
puede observar en la gura 1. Este sistema esta
dividido en dos grandes componentes. En
primer lugar, esta el dispositivo de captacion de
conversaciones, y por otro lado, el servidor,
el cual se subdivide a su vez en tres modulos:
el (1) Sistema de transcripcion automatica de
entrevistas medico paciente, el (2) sistema de
extraccion de conocimiento medico y, el (3)
cuadro de mandos (o interfaz de usuario).</p>
      <p>A continuacion, se detalla brevemente
cada uno de estos componentes.
2.1</p>
      <sec id="sec-2-1">
        <title>Dispositivo de captacion de entrevistas medico paciente</title>
        <p>Este modulo se basa en un dispositivo de
captacion de conversaciones de entrevistas
medico paciente. La arquitectura de este
dispositivo esta formada por una capa hardware y
una capa software. En primer lugar, la
capa hardware esta formada por un microfono
de array y por un mini-computador que se
encargan de la captacion de audio de alta
calidad. Por un lado, el microfono de array esta
dotado de distintos microfonos para la
captura de la sen~al en tiempo real con calidad
y para poder realizar una diarizacion
precisa en entornos con multiples hablantes. Este
dispositivo cuenta con algoritmos espec cos
para limpiar el audio y para atenuar la
reverberacion de la sala. Por otro lado, el
minicomputador se encarga de ejecutar las capas
software, de almacenar los cheros de audio
y de poder comunicarse con servicios
externos a traves de Internet. En segundo lugar, la
capa software dispone de una interfaz por la
cual se puede manejar el dispositivo as
como los modulos y modelos de transcripcion
de audio y otros servicios necesarios.
2.2</p>
      </sec>
      <sec id="sec-2-2">
        <title>Servidor</title>
        <p>La parte del servidor se encarga de
centralizar los procesos necesarios para capturar,
transcribir y anotar el audio recogido por el
dispositivo de captacion. Es importante
destacar que, aunque el dispositivo estara
dotado del hardware y software su ciente para
poder capturar y transcribir la conversacion
para dar retroalimentacion en tiempo real,
en el servidor se despliegan recursos mas e
caces que requieren un mayor procesamiento
computacional. Entre estos servicios se
pueden destacar la correccion de la
transcripcion, la extraccion del conocimiento medico
y proporcionar una interfaz donde pacientes
y medicos puedan acceder y revisar el
contenido de las entrevistas.</p>
        <p>El servidor esta dividido en tres modulos
principales: (1) el sistema de transcripcion de
entrevistas medico-paciente, (2) el sistema de
extraccion de conocimiento medico, y (3) el
cuadro de mandos. Estos modulos se detallan
a continuacion en las siguientes subsecciones.</p>
        <sec id="sec-2-2-1">
          <title>2.2.1 Sistema de transcripcion</title>
          <p>El sistema de transcripcion parte de trabajos
anteriores de la empresa (Vivancos-Vicente
et al., 2020) y es capaz de aplicar un proceso
de transcripcion automatica a documentos de
audio con distintos hablantes y sin la
necesidad de entrenamiento espec co. Estas
tecnicas estan basadas en tecnolog as de deep
learning. Este modulo devuelve un chero en
forFigura 1: Arquitectura del sistema
mato WebVTT (Web Video Text Tracks
Format), que es un formato estandar de subt
tulos de v deos en la web. Como novedad
importante, este modulo incluye tecnolog as de
deep learning para la recuperacion de
puntuacion en las transcripciones obtenidas
pudiendo introducir signos de puntuacion como
comas, puntos e interrogaciones. Este modulo
esta basado en trabajos anteriores del grupo
de investigacion (Bravo-Candel et al., 2021).
2.2.2</p>
        </sec>
        <sec id="sec-2-2-2">
          <title>Sistema de extraccion de conocimiento</title>
          <p>Este sistema es capaz de extraer y anotar
texto escrito en lenguaje natural con
conceptos medicos a partir del uso de ontolog as
y tecnolog as de reconocimiento de
entidades y anotacion semantica. De las entidades
se extraen conceptos y acciones, ademas de
predicados y referencias para unir los
conceptos anteriores. Este sistema es capaz de
identi car relaciones basicas como subtipos,
de igualdad, de implicacion, de pertenencia
as como otras relaciones para delimitar el
marco contextual y temporal. Para ello, se
estan evaluando modelos basados en redes
neuronales recurrentes bidireccionales del
tipo Gated Recurrent Units (BiGRU) a
partir de conjuntos de vectores entrenados con
la version espan~ola de BERT (Can~ete et al.,
2020). El resultado es un sistema de
anotaciones en formato BRAT. Este modulo se
basa en trabajos anteriores del grupo de
investigacion (Rodr guez-Garc a et al., 2014),
(Garc a-D az, Canovas-Garc a, y
ValenciaGarc a, 2020).</p>
          <p>La informacion extra da se puede exportar
a formatos estandar para facilitar la
interoperabilidad con sistemas externos basados en
HIS/HCE. Cabe destacar que no es lo
mismo extraer conocimiento medico de un
informe tecnico que de una conversacion
medicopaciente, aunque esta sea de caracter formal.
En primer lugar, porque el signi cado
puede variar segun hable el medico o el
paciente y, en segundo lugar, aunque aparezca un
determinado termino en la conversacion,
como podr a ser un s ntoma o una enfermedad,
este no quiere decir que el paciente lo sufra.
Estos aspectos hacen necesario que este
sistema de extraccion de conocimiento medico sea
capaz de entender conceptos temporales
como eventos pasados, presentes o futuros, de
forma que pueda registrar, de manera mas
o menos precisa, la temporalizacion de s
ntomas, enfermedades o causas, entre otros. Para
ello, se han empleado reconocedores de
entidades, corpus anotados como los analizados
en (Jimenez-Zafra et al., 2020) y el uso
lexicones.</p>
        </sec>
        <sec id="sec-2-2-3">
          <title>2.2.3 Cuadro de mandos</title>
          <p>Este modulo consiste en una plataforma
software que permite la gestion del
conocimiento generado por el sistema por parte de los
medicos y pacientes. Los medicos como los
pacientes disponen de un dashboard, que
permite hacer uso del conocimiento adquirido
automaticamente. El medico puede realizar
consultas para localizar partes de la
conversacion a partir de la transcripcion de la
conversacion, buscando coincidencias
fonologicamente similares. Una vez accede a una
transcripcion, el medico puede consultar la
conversacion y realizar anotaciones sobre los
conceptos identi cados. Estos conceptos son
accionables y permiten, segun la naturaleza del
concepto, generar documentos en HL7 para la
integracion con sistemas externos. Esto
permitira, por ejemplo, obtener informacion
para registrar episodios activos del paciente en
el momento de la consulta, generar la
informacion de recetas a partir de la prescripcion
medica o generar la informacion para emitir
volantes para pruebas diagnosticas.
3</p>
        </sec>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Trabajo futuro</title>
      <p>El proyecto se encuentra en la ultima
anualidad del proyecto. Hasta el momento se ha
desarrollado el dispositivo de captacion de
entrevistas y el sistema de transcripcion. Las
tecnolog as que han dado buenos
resultados para la transcripcion se basan en
modelos DNN-HMM (modelos ocultos de Markov
con redes neuronales profundas) (Ravanelli y
Omologo, 2017).</p>
      <p>El sistema de extraccion de conocimiento
esta todav a en desarrollo y se estan
generando distintos recursos y herramientas que
permitan la identi cacion y extraccion del
conocimiento dentro de la transcripcion de la
entrevista. Por otro lado, se esta
estudiando distintos estandares para
interoperabilidad cl nica basados en HL7 para, entre otras
cosas, la insercion de informacion dentro de
la historia cl nica del paciente, la generacion
semi-automatica de recetas y de volantes de
pruebas medicas. Por ultimo, se realizara el
dashboard nal as como la integracion de los
modulos en un prototipo nal de la
plataforma global. En este sentido, se plani caran
distintas pruebas de campo para comprobar
la calidad del sistema completo, y as como se
estudiara la integracion del sistema con
sistemas de informacion externos.</p>
    </sec>
    <sec id="sec-4">
      <title>Agradecimientos</title>
      <p>Este proyecto ha sido nanciado por el CDTI
con fondos FEDER dentro del proyecto con
referencia IDI-20200407</p>
    </sec>
    <sec id="sec-5">
      <title>Bibliograf a</title>
      <p>Bravo-Candel, D., J. Lopez-Hernandez,
J. A. Garc a-D az, F. Molina-Molina, y
F. Garc a-Sanchez. 2021. Automatic
correction of real-word errors in spanish
clinical texts. Sensors, 21(9).</p>
      <p>Can~ete, J., G. Chaperon, R. Fuentes, J.-H.</p>
      <p>Ho, H. Kang, y J. Perez. 2020. Spanish
pre-trained bert model and evaluation
data. En PML4DC at ICLR 2020.</p>
      <p>Garc a-D az, J. A., M. Canovas-Garc a, y
R. Valencia-Garc a. 2020.
Ontologydriven aspect-based sentiment analysis
classi cation: An infodemiological case
study regarding infectious diseases in
latin america. Future Gener. Comput. Syst.,
112:641{657.</p>
      <p>Jimenez-Zafra, S. M., R. Morante, M.
Teresa Mart n-Valdivia, y L. A. Uren~a-Lopez.
2020. Corpora annotated with negation:
An overview. Computational Linguistics,
46(1):1{52.</p>
      <p>Ravanelli, M. y M. Omologo. 2017.
Contaminated speech training methods for robust
dnn-hmm distant speech recognition.
arXiv preprint arXiv:1710.03538.</p>
      <p>Rodr guez-Garc a, M. A., R.
ValenciaGarc a, F. Garc a-Sanchez, y J. J. S.
Zapater. 2014. Ontology-based annotation and
retrieval of services in the cloud. Knowl.</p>
      <p>Based Syst., 56:15{25.</p>
      <p>Vivancos-Vicente, P. J., J. A. Garc a-D az,
A. Almela, F. Molina, J. S.
CastejonGarrido, y R. Valencia-Garc a. 2020.
Transcripcion, indexacion y analisis
automatico de declaraciones judiciales a
partir de representaciones foneticas y tecnicas
de lingu stica forense. Proces. del Leng.
Natural, 65:109{112.</p>
    </sec>
  </body>
  <back>
    <ref-list />
  </back>
</article>