<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Transcripción de periódicos históricos: aproximación CLARA-HD</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Antonio Menta</string-name>
          <email>amenta@invi.uned.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Eva Sánchez-Salido y Ana García-Serrano</string-name>
          <email>evasan@lsi.uned.es</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>ETSI Informática, C/ Juan del Rosal 16, UNED</institution>
          ,
          <addr-line>28040 Madrid</addr-line>
          ,
          <country country="ES">Spain</country>
        </aff>
      </contrib-group>
      <fpage>70</fpage>
      <lpage>74</lpage>
      <abstract>
        <p>Resumen Analizar periódicos de los siglos XVIII, XIX y principios del XX exige cierta calidad de las fuentes digitalizadas y la utilización de recursos específicos de dominio o de la lengua. Cualquier aproximación utilizando las tecnologías actuales, se encuentra con que la mayoría de los modelos PLN disponibles para la transcripción o el reconocimiento de entidades están entrenados con textos en “lenguajes actuales”. Si además el reto consiste en extraer información de periódicos históricos en español, la complejidad aumenta, ya que la normalización del español es relativamente “moderna” y hay que intentar refinar los modelos de PLN o generar nuevos recursos. En esta presentación del corpus construido desde los textos disponibles en la Hemeroteca Digital de la BNE, Diario de Madrid (1788-1825), se mostrarán los pasos seguidos para su transcripción automática generando un modelo (99% de rendimiento) en el marco del proyecto CLARA-HD. Finalmente se incluyen unas conclusiones iniciales. English translation. The analysis of historical newspapers from the 18th, 19th, and early 20th centuries requires a certain quality of digitized sources and the use of specific domain or language resources. Any approach using current technologies finds that most of the NLP models available for transcription or entity recognition are trained with texts in "current languages". If, in addition, the challenge consists of extracting information from historical newspapers in Spanish, the complexity increases since the normalization of Spanish is relatively “modern” and it is necessary to try to refine the NLP models or generate new resources. In this demonstration for the corpus built from the BNE Digital Hemeroteca, Diario de Madrid (17881825) the steps followed will be shown for its automatic transcription using a defined model (99% performance), within the framework of the CLARA-HD project. Finally, some initial conclusions are included.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>1. Introducción</title>
      <p>
        La utilización de técnicas de Procesamiento de
Lenguaje Natural (PLN) en el tratamiento de
documentos textuales, en concreto en el ámbito de
las Humanidades Digitales (HD), se ha convertido
en una práctica referente en muchos de los
proyectos actuales [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ]. En los últimos veinte
años se han realizado multitud de procesos de
digitalización para la conservación de colecciones
culturales tanto a nivel local como nacional y
europeo. Estos proyectos han generado millones
de imágenes que necesitan ser tratadas para la
transcripción del texto que contienen, ya sea de
forma manual o mediante la aplicación de
procesos de reconocimiento óptico de caracteres,
conocido como OCR (del inglés Optical
Character Recognition).
      </p>
      <p>
        La elaboración de corpus históricos está sujeta
a múltiples factores, entre ellos su finalidad [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ].
Por ejemplo, para el estudio de una lengua actual
en general se pretende que el corpus sea
proporcional, es decir, que la cantidad de palabras
o de textos de cada muestra esté en proporción
respecto a su distribución en el total de la
población. Sin embargo, este requisito es difícil de
conseguir en corpus históricos, ya que a menudo
no se conservan suficientes documentos
representativos de cada tipo, o incluso se
desconocen las proporciones en que deberían
aparecer. Por otra parte, la creación del corpus
también depende del tipo de consulta que se desee
realizar sobre los resultados que proporcione su
análisis. En función de las posibilidades de
consulta, los corpus son etiquetados mediante
marcas declarativas que describen los elementos
formales del texto (cursiva, tamaño de la fuente),
elementos estructurales (capítulos, páginas) y
elementos lingüísticos (entidades, cambios de
registro).
      </p>
      <p>
        La comunidad científica concienciada de la
dificultad de tratar documentos históricos, en los
últimos años está realizando un esfuerzo en
mejorar las herramientas disponibles para su
gestión, acceso y consulta [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]. Aquí es donde
entran en juego las técnicas de PLN. Estas son
capaces de extraer, procesar y relacionar la
información que contienen los documentos para
su posterior utilización y que sirvan de ayuda a los
humanistas en sus reflexiones y análisis [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ]. Si
además es necesario trabajar con imágenes y
textos [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] los sistemas de soporte a la
investigación o de apoyo al trabajo del profesional
se fundamentan en interfaces de interacción con la
información mas complejos [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ].
      </p>
      <p>En esta presentación del corpus construido
desde los textos disponibles en la Hemeroteca
Digital de la BNE, Diario de Madrid
(17881825)¡Error! Marcador no definido., se
justifica, en el apartado segundo, la necesidad de
construir corpus de suficiente calidad para el
análisis PLN previo al estudio de historiadores o
público en general, se muestran los pasos seguidos
para su transcripción en el apartado tercero y
finalmente se incluyen algunos comentarios sobre
este trabajo.</p>
    </sec>
    <sec id="sec-2">
      <title>2. Necesidad de corpus de textos históricos de calidad</title>
      <p>Las facilidades que ofrece la informática
propician la confección de corpus que presentan
el mismo texto en diversas modalidades de
edición: facsímil (reproducción fotográfica del
original), paleográfica (transcripción sin
correcciones ni interpretaciones), normalizada
(transcripción siguiendo la normativa ortográfica,
léxica y sintáctica vigente), crítica (transcripción
que pretende reconstruir el texto original) o
interpretativa (transcripción que sigue los
postulados de la edición paleográfica pero permite
corregir ciertos errores para poder explicar el
sentido del texto). Ejemplos son el corpus
burckhardtsource.org y el proyecto CHARTA2.</p>
      <p>
        En el estudio del impacto de la tarea de
reconocimiento de entidades nombradas (NER,
por sus siglas en inglés) en el ámbito de las HD,
en [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ] se reflexiona sobre las posibilidades de
utilizar NER y otros métodos de extracción de
información en textos no estructurados y
proponen ampliar el debate sobre la forma de
utilizar las tecnologías del PLN a la comunidad
humanística.
      </p>
      <p>Dentro de las HD, el estudio de las ediciones
de periódicos históricos entre el siglo XVIII y
principios del siglo XX es un campo idóneo para
aplicar estas técnicas debido a la presencia de todo
tipo de entidades en ellos y a su evolución
temporal a lo largo de los años para recuperar,
almacenar y consultar la herencia cultural
transmitida. Aun así, su uso directo presenta
varios inconvenientes al utilizarlos en textos
históricos. La mayoría de los modelos actuales
son modelos estadísticos que necesitan un
conjunto de datos etiquetados para ser entrenados
en el contexto que se quieren utilizar, y estos
conjuntos escasean o no son públicos en las HD.
Esto repercute en otra dificultad añadida, que es la
representación que deben tener los textos para ser
utilizados por las técnicas del PLN.</p>
      <p>
        Desde hace años se ha impuesto la utilización
de modelos vectoriales de baja dimensión para
representar los textos, conocidos como word
embeddings. Para obtener estos modelos, en la
mayoría de las ocasiones es necesario realizar un
entrenamiento en una gran cantidad de textos del
contexto en el que se quieren utilizar para
aprender las relaciones entre las palabras y
conceptos. Para obtener una mejor representación
final se suele realizar un pre-procesamiento de los
textos para eliminar información irrelevante
(como código HTML y algunos metadatos). Una
vez limpio el texto, se utiliza como entrada para
generar los word embeddings, ya sean estáticos o
contextuales como los modelos basados en
Transformers [
        <xref ref-type="bibr" rid="ref12">12</xref>
        ].
      </p>
      <p>
        Últimamente, las redes neuronales basadas en
modelos de lenguaje mejoran la detección de
entidades, especialmente desde la publicación del
modelo BERT [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ] en 2018, o los modelos de
lenguajes basados en Transformers. En [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] se
realiza un estudio del impacto de la salida del
OCR en el rendimiento de los modelos basados en
BERT en un problema de clasificación de
extractos de libros que van desde finales del siglo
XVIII a finales del siglo XX. En sus conclusiones
mencionan una degradación de los resultados y
recomiendan realizar un ajuste fino de los
modelos en esta tipología de documentos con
anterioridad a realizar la clasificación para
hacerlos más robustos a los errores ortográficos.
Además, el vocabulario utilizado en siglos
pasados dista enormemente del usado hoy en día
y es un reto y una motivación para hacer hincapié
en la utilización de los modelos de lenguaje
basados en redes neuronales.
      </p>
      <p>En definitiva, los intentos de análisis de
documentos históricos mediante tecnologías de
PLN actuales se encuentran con el problema de
que la mayoría de los modelos disponibles están
entrenados con textos en “lenguas modernas”, y
aumenta la complejidad al intentar extraer
información de documentos históricos en español,
ya que la normalización del español es
relativamente “moderna” y hay que refinar los
modelos de PLN o generar nuevos recursos.</p>
    </sec>
    <sec id="sec-3">
      <title>3. Construcción</title>
      <p>transcripción
del
modelo
de</p>
      <p>La dificultad para aplicar la tecnología actual
de PLN en las HD es el origen de los datos, porque
la mayoría de las fuentes están almacenadas en
imágenes de mala calidad con tipografías antiguas
que necesitan de un OCR específico.</p>
      <p>Transkribus3 es una plataforma para la
digitalización, el reconocimiento de texto, la
transcripción y la búsqueda en documentos
históricos. Es resultado de un proyecto europeo y
de pago a partir de un cierto límite de uso. Con el
3 https://readcoop.eu/transkribus/
4 https://readcoop.eu/transkribus/howto/
use-transkribus-in-10-steps/
registro se obtienen 500 créditos (unas 500
páginas). La herramienta está bien documentada4
y cuenta con funcionalidades de acceso libre
desde el navegador5 o la aplicación.</p>
      <p>Para la transcripción dispone de modelos
basados en redes neuronales públicos y
entrenados en distintos idiomas y grafías6, lo que
facilita encontrar uno que se aproxime al de los
documentos a transcribir. De no ser así, la
herramienta permite entrenar uno propio y
automatizar la transcripción de nuestros
documentos. De hecho, ya disponemos de un
modelo entrenado a partir de transcripciones
manuales en el proyecto CLARA-HD.</p>
      <p>Para ello, se comienza creando una colección
y cargando los ficheros que contienen los textos
en ella (Figura 1).</p>
      <sec id="sec-3-1">
        <title>Figura 1. Carga de ficheros.</title>
        <p>Para poder transcribir los documentos hay que
realizar manualmente el reconocimiento de su
estructura (o layout), diferenciando las regiones
en las que se encuentra el texto (Figura 2). El
reconocimiento en general no es perfecto, por lo
que en ocasiones habrá que corregir errores o
modificar manualmente.
5 https://transkribus.eu/lite/
6 https://readcoop.eu/transkribus/public-models/</p>
      </sec>
      <sec id="sec-3-2">
        <title>Figura2. Reconocimiento de la estructura.</title>
        <p>Una reconocidas las regiones se transcribe el
texto, línea a línea manualmente o con la ayuda de
un modelo público seleccionado. Es posible que
haya que editar la transcripción para corregir
errores (Figura 3).</p>
      </sec>
      <sec id="sec-3-3">
        <title>Figura 3. Transcripción manual.</title>
        <p>Para automatizar este proceso se ha creado un
modelo propio de transcripción a partir de un
conjunto de entrenamiento junto con una guía de
estilo, realizando los pasos mostrados
anteriormente: (1) subida de documentos a la
herramienta, (2) reconocimiento manual de la
estructura de todas las páginas de los documentos,
(3) transcripción de un cierto número de páginas
manualmente o con la ayuda de un modelo
público y (4) revisión manual final de las mismas,
para entrenar nuestro modelo de transcripción.
7 www.clara-nlp.uned.es</p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>4. Comentarios finales</title>
      <p>Se ha presentado cómo construir un corpus con
la herramienta Transkribus, entrenando un nuevo
modelo de transcripción capaz de reconocer
caracteres no vistos por el modelo base,
alcanzando una precisión en el reconocimiento de
caracteres nuevos del 99%.</p>
      <p>En este momento estamos trabajando con
historiadores de la UNED interesados en el
contenido del Diario de Madrid, para identificar
tanto la terminología como los temas de interés
para su investigación y evaluar cuánto es
soportada por la tecnología PLN utilizada. Una
vez identificados los tipos de entidades útiles para
los historiadores, se seguirá con la extracción de
las menciones de cada tipo, como las
localizaciones, las profesiones o palabras
complejas de entender.</p>
    </sec>
    <sec id="sec-5">
      <title>5. Agradecimientos</title>
      <p>
        Este trabajo parcialmente financiado por el
proyecto coordinado CLARA-NLP7 consta de
tres subproyectos para dominios especializados en
historia8, biomedicina [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ] y economía [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ].
      </p>
      <p>Finalmente, un agradecimiento especial para la
participación en este subproyecto de los
estudiantes en prácticas V. Sánchez-Sánchez, R.
Garcia-Sánchez y A. Rodriguez-Francés.
8 (PID2020-116001RB-C31),
(PID2020-116001RA-C33)
(PID2020-116001RB-C32),</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <given-names>J.</given-names>
            <surname>Benavent</surname>
          </string-name>
          ,
          <string-name>
            <given-names>X.</given-names>
            <surname>Benavent</surname>
          </string-name>
          , E. de Ves,
          <string-name>
            <given-names>R.</given-names>
            <surname>Granados</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>García-Serrano</surname>
          </string-name>
          ,
          <article-title>Experiences at ImageCLEF 2010 using CBIR</article-title>
          and
          <string-name>
            <surname>TBIR Mixing Information Approaches</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          <string-name>
            <surname>Braschler</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          <string-name>
            <surname>Harman</surname>
            , E. Pianta (Eds.) CLEF, CEUR Proc.,
            <given-names>V</given-names>
          </string-name>
          <year>1176</year>
          .
          <year>2010</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <given-names>J.</given-names>
            <surname>Calle-Gómez</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>García-Serrano</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Martínez</surname>
          </string-name>
          ,
          <article-title>Intentional processing as a key for rational behaviour through Natural Interaction, Interacting with Computers V 18 N 6</article-title>
          , pp:
          <fpage>1419</fpage>
          -
          <lpage>1446</lpage>
          ,
          <year>2006</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>L.</given-names>
            <surname>Campillos-Llanos</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Terroba</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Zakhir</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Valverde</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Capllonch</surname>
          </string-name>
          ,
          <article-title>Building a comparable corpus and a benchmark for Spanish medical text simplification</article-title>
          ,
          <source>Procesamien. del Lenguaje Natural</source>
          <volume>69</volume>
          ,
          <year>2022</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>J.</given-names>
            <surname>Devlin</surname>
          </string-name>
          , M.-
          <string-name>
            <given-names>W.</given-names>
            <surname>Chang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lee</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Toutanova</surname>
          </string-name>
          , BERT:
          <article-title>Pre-training of Deep Bidirectional Transformers for Language Unders</article-title>
          ., arXiv preprint
          <year>1810</year>
          .
          <volume>04805</volume>
          ,
          <year>2018</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <given-names>M.</given-names>
            <surname>Ehrmann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Romanello</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Flückiger</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Clematide</surname>
          </string-name>
          ,
          <source>Extended Overview of CLEF HIPE 2020: Named Entity Processing on Historical Newspapers</source>
          ,
          <source>CLEF proc</source>
          .
          <year>2020</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <given-names>A.</given-names>
            <surname>Garcia-Serrano</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Menta-Garuz</surname>
          </string-name>
          ,
          <article-title>La inteligencia artificial en las Humanidades Digitales: dos experiencias con corpus digitales</article-title>
          , Revista de Humanidades Digitales, v.7, pp:
          <fpage>19</fpage>
          -
          <lpage>39</lpage>
          ,
          <year>2022</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <given-names>M.</given-names>
            <surname>Jiang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Hu</surname>
          </string-name>
          , G. Worthey,
          <string-name>
            <given-names>R. C.</given-names>
            <surname>Dubnicek</surname>
          </string-name>
          , T. Underwood,
          <article-title>Impact of OCR Quality on BERT Embeddings in the Domain Classification of Book Excerpts</article-title>
          ,
          <string-name>
            <surname>CHR</surname>
          </string-name>
          <year>2021</year>
          : Computational Humanities Research Conference, pp.
          <fpage>266</fpage>
          -
          <lpage>279</lpage>
          ,
          <year>2021</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <given-names>A.</given-names>
            <surname>Moreno-Sandoval</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Gisbert</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Montoro</surname>
          </string-name>
          ,
          <article-title>Fint-esp: a corpus of financial reports in Spanish, Multiperspectives in Analysis and Corpus Design</article-title>
          , Editorial Comares, pp.
          <fpage>89</fpage>
          -
          <lpage>102</lpage>
          ,
          <year>2020</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <given-names>J.</given-names>
            <surname>Torruella</surname>
          </string-name>
          <string-name>
            <surname>Casañas</surname>
          </string-name>
          , Lingüística de corpus:
          <article-title>Génesis y bases metodológicas de los corpus (históricos) para la investigación en lingüística</article-title>
          , Peter Lang Ed.,
          <year>2017</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <string-name>
            <given-names>M.</given-names>
            <surname>Toscano</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Rabadán</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Ros</surname>
          </string-name>
          ,
          <string-name>
            <given-names>E.</given-names>
            <surname>González-Blanco</surname>
          </string-name>
          ,
          <article-title>Digital humanities in Spain: Historical perspective and current scenario</article-title>
          .
          <source>Profesional de la Información</source>
          ,
          <volume>29</volume>
          (
          <issue>6</issue>
          ),
          <year>2020</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <given-names>S. van Hooland</given-names>
            ,
            <surname>M. de Wilde</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Verborgh</surname>
          </string-name>
          ,
          <string-name>
            <given-names>T.</given-names>
            <surname>Steiner</surname>
          </string-name>
          , R. Van de Walle,
          <article-title>Exploring entity recognition and disambiguation for cultural heritage collections</article-title>
          ,
          <source>Digital Scholarship Humanities, V30, N2</source>
          ,
          <year>2015</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [12]
          <string-name>
            <given-names>A.</given-names>
            <surname>Vaswani</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Shazeer</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Parmar</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Uszkoreit</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Jones</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A. N.</given-names>
            <surname>Gomez</surname>
          </string-name>
          , Ł. Kaiser,
          <string-name>
            <surname>I. Polosukhin</surname>
          </string-name>
          ,
          <article-title>Attention is all you need</article-title>
          ,
          <source>Advances in neural information Processing Systems</source>
          <volume>30</volume>
          ,
          <year>2017</year>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>