<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Автоматизированная система сервисов обработки больших коллекций научных документов</article-title>
      </title-group>
      <fpage>58</fpage>
      <lpage>64</lpage>
      <abstract>
        <p>Представлена система сервисов автоматической обработки коллекций научных документов. Эти сервисы обеспечивают проверку соответствия документов принятым правилам формирования коллекций и их преобразование в установленные форматы; структурный анализ документов и извлечение метаданных, а также их интеграцию в научное информационное пространство. Система позволяет автоматически выполнять набор операций, который не реализуем за практически приемлемое время при традиционной «ручной» обработке электронного контента, и предназначена для больших коллекций научных документов.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Сегодня одной из актуальных проблем, стоящих
перед человечеством, стала проблема накопления и
последующей обработки огромных массивов
данных. Под данными традиционно подразумевают
различные необработанные информационные
материалы, в том числе, данные различных
наблюдений и научных экспериментов,
персональные данные, а также различную
статистическую информацию. По сведениям,
приведенным в [1], уже в 2011 году каждый день
создавалось около 15 PB новых данных, а за три года
до этого момента времени человечество произвело
информации больше, чем за всю историю своего
существования до 2008 года, причем прирост данных
происходил экспоненциально: это были и научные
данные, и сведения о проведенных
операцияхтранзакциях, отчеты в социальных сетях и многое
другое. Сегодня мировой объем данных
увеличивается более чем в два раза каждые два года,
а большие объемы данных (которые с 2008 года
стали обозначать термином «большие данные» (Big
Data)) открывают новые возможности и существенно
влияют на развитие
информационнокоммуникационных технологий (ИКТ).
Труды XVIII Международной конференции
DAMDID/RCDL’2016 «Аналитика и управление
данными в областях с интенсивным
использованием данных», Ершово, 11-14 октября
2016 </p>
      <p>
        Не менее актуальна проблема учета
значительного роста объёмов данных, получаемых,
хранимых и обрабатываемых в ходе научной
деятельности. В настоящее время благодаря
внедрению ИКТ в научно-исследовательскую
деятельность стало возможным при проведении
новых исследований использовать весь корпус
накопленных научных знаний. Это предполагает
создание комплекса технологий, обеспечивающих
оптимальное управление имеющимися знаниями,
организацию эффективного доступа к ним, а также
совместное и многократное использование новых
видов структур знаний. В результате формируются
разнообразные электронные научные коллекции и
библиотеки, такие, например, как архивы научных
журналов и отчетов, сборники научных трудов,
диссертации и др. Они являются составной частью
электронных научных библиотек и представляют
собой наборы документов, имеющих различную
структуру и разные форматы представления
текстовых и графических материалов,
библиографических списков, математической
нотации. Эти различия затрудняют организацию
информационных сервисов, опирающихся на
машиноориентированную обработку информации
(см., например, [
        <xref ref-type="bibr" rid="ref1">4, 5</xref>
        ]). Кроме того, в настоящее время
значительно увеличивается объем данных,
включаемых в коллекции, что в свою очередь создает
дополнительные трудности при обработке научных
Big Data. При управлении электронными научными
коллекциями больших данных в полной мере
Рисунок 1 Архитектура системы
остаются актуальными, а также появляются новые
задачи, в их числе: семантическая разметка,
организация поиска, выделение метаданных,
формирование тематических кластеров документов,
сбор наукометрической информации, подготовка
сборников материалов и др. (см., например, [
        <xref ref-type="bibr" rid="ref2 ref3">6, 7</xref>
        ]).
Насущными становятся проблемы анализа и
управления данными в различных областях с
интенсивным использованием данных. Ниже
представлена система сервисов автоматической
обработки коллекций научных документов. С ее
использованием проведена обработка материалов ХI
Всероссийского съезда по фундаментальным
проблемам теоретической и прикладной механике
(далее – Съезд), проведенного в Казани 20 – 24
августа 2015 г.: сформированы программа съезда,
сборники аннотаций и трудов съезда (объемом более
1500 статей), а также соответствующая электронная
коллекция.
2 Архитектура системы сервисов
      </p>
      <p>На рис. 1 представлена архитектура созданной
автоматизированной системы сервисов обработки
больших коллекций научных документов. Она
состоит из модулей, выполняющих следующие
функции:

извлечение метаданных из документов
коллекции на основе анализа их структуры и
форматов представления информации;
автоматический выбор документов согласно
установленному порядку, например,
лексикографическому, по спискам авторов;
извлечение блоков аннотаций из документов
коллекции, подготовка алфавитного
указателя и формирование сборника
аннотаций;
автоматическое формирование
библиографического описания статьи
коллекции с записью этой информации в
блок колонтитулов документа;
конвертация документов в pdf-формат в
соответствии с установленными
параметрами;
формирование оригинал-макетов
планируемых изданий с автоматической
выборкой статей, расстановкой страниц,
подготовкой алфавитного указателя и
содержания;
подготовка метаданных для экспорта в базы
данных Российского индекса научного
цитирования (РИНЦ).
Машиноориентированная обработка
электронных коллекций предполагает наличие
семантической разметки их документов. Такая
разметка частично присутствует в документах,
использующих TEX-нотацию, при условии, что
используются соответствующие макрокоманды
(например, \title, \author, \abstract, \keywords) и
стилевое окружение, характерное для каждой
коллекции. В электронных научных коллекциях,
представленных в офисных форматах (.doc, .docx и
др.), а также .pdf, семантическая разметка
отсутствует. Тем не менее, выполнить такую
разметку можно в автоматическом режиме на основе
информации о структурном строении каждого
документа и особенностях его форматирования.</p>
      <p>Прежде всего, коллекция разбивается на классы
сходных по структуре документов, для каждого
класса производится преобразование документов к
семантическому представлению. С помощью набора
паттернов регулярных выражений, специфичных для
каждого класса документов, производится
выделение информационных блоков (названия
статьи, списка авторов, блока литературы и т. д.). В
свою очередь, это дает возможность не только
использовать семантические инструменты работы с
электронным контентом, но и формировать в
автоматическом режиме новые виды документов.</p>
      <p>В хранилище организована навигация по
названию, авторам и т. д. Реализация этих сервисов
основана на структурном анализе документов в
коллекции (см. раздел 5).
4 Сервис валидации и стилевого
приведения</p>
      <p>Под валидацией документов коллекции
понимается процесс проверки наличия и
расположения ключевых блоков (название статьи,
список авторов, аффилиация, ключевые слова и т. д.),
указанных в регламентируемых документах.</p>
      <p>Сервис стилевого приведения реализует
следующие шаги:



единообразное представление названий
статей; списка авторов (например, вместо
Хайдаров Ш.М. записывается Ш.М.
Хайдаров);
единообразное представление аффилиации
авторов, например, записи «КФУ»,
«К(П)ФУ», «Казанский университет»,
«Казанский (Приволжский) федеральный
университет» и «Казанский федеральный
университет» приводятся к единому виду
«Казанский (Приволжский) федеральный
университет»; для этого создается словарь
синонимов;
единообразное шрифтовое оформление
разделов текста статей; происходит учет
регистра при записи ключевых блоков,




например, название статьи записывается
прописными буквами;
осуществляется выбор форматов рисунков,
схем, диаграмм;
производится набор математических формул
и системы ссылок на них;
списки литературы приводятся к
выбранному формату библиографического
описания.
оформляются ссылки на поддержку
исследований грантами, благодарности.
5 Формирование семантического
представления коллекции на основе
структурного анализа</p>
      <p>
        Для извлечения метаданных статьи по
характерным признакам (см. таблицу 1)
определяются правила выделения блоков статьи. К
таким признакам относятся стилевое оформление
статей (шрифт, размер шрифта, выделение и т. д.).
Кроме того, такие дополнительные признаки, как
шаблонность текста (например, слово «Аннотация»
перед блоком аннотаций или шаблонный вид
электронной почты) и положение блока в тексте
(например, документ начинается с названия статьи),
позволяют повысить качество извлечения. В
качестве таких признаков могут использоваться
положение блока в документе, а также шрифт
используемый в данном блоке (см., например, [
        <xref ref-type="bibr" rid="ref4 ref5 ref6">8–
11</xref>
        ]). При структурном анализе коллекции научных
документов Съезда использовался набор признаков,
указанный в таблице 1.
      </p>
      <p>
        Модуль реализован в виде PHP-скрипта, и его
работа состоит из следующих шагов. Из файла
статьи, хранящегося в формате docx, извлекается
файл document.xml (см., например, [
        <xref ref-type="bibr" rid="ref7">12</xref>
        ]). Далее с
использованием описания класса DOMDocument
производится разбор этого файла. Для выделения
блоков применяется метод
getElementsByTagNameNS с параметром «w:p» (тег
разметки абзаца в OpenXML). В результате
получается список всех абзацев документа как
объекта DOMNodeList. Полученный список
последовательно проверяется на соответствие
заданным правилам. В итоге для каждого документа
(см. пример рис. 2) формируется его семантическое
представление (рис. 3).
      </p>
      <p>Для выделения семантических элементов
разработан набор регулярных выражений, например,
для выделения списка авторов используется
выражение
/([А-ЯA-Z]\.(?:[А-ЯA-Z]\.)?\s[А-ЯA-Z][a-zа-я]+)
(,\s)?(?1)?(,\s)?(?1)?/</p>
      <p>Кроме того, проверяются наличие ключевых
конструкций и их соответствие заданному формату.
Результатом работы описываемого модуля является
XML-документ, содержащий метаданные статей
размечаемой коллекции.
Таблица 1 Характерные признаки для извлечения
метаданных
Блок статьи
Название статьи
Список авторов
Аффилиация
Электронная почта
Аннотация
Признаки блока
Шрифт: Times New Roman, 12 пт,
полужирный, выравнивание по
центру.
Положение: в начале документа
Шрифт: Times New Roman, 12 пт,
выравнивание по центру
Положение: после названия
Шаблон имеют вид: И.О. Фамилия
или И. Фамилия, перечисляются через
запятую
Шрифт: Times New Roman, 12 пт,
курсив, выравнивание по центру.
Положение: после списка авторов.
Шрифт: Times New Roman, 9 пт,
выравнивание по центру
Положение: после аффилиации
Шаблон содержат символ @ и имеют
заданный вид
Шрифт: Times New Roman, 9 пт,
выравнивание по ширине
Положение: после адреса
электронной почты
Шаблон начинается со слова
«Аннотация».
Рисунок 2 Пример статьи, где 1 – название, 2 – блок
списка авторов, 3 – блок аффилиации, 4 – блок
электронной почты и 5 – блок аннотации. Стилевое
оформлении соответствует таблице 1
&lt;?xml version="1.0" encoding="UTF-8"?&gt;
&lt;articles&gt;
&lt;article&gt;
&lt;eachauthors&gt;
&lt;author&gt;S.N. Antontsev&lt;/author&gt;
&lt;author&gt;H.B. Oliveira&lt;/author&gt;
&lt;workplace&gt;University of Lisbon; University of
Algarve, Portugal&lt;/workplace&gt;
&lt;mails&gt;antontsevsn@mail.ru&lt;/mails&gt;
&lt;/eachauthors&gt;
&lt;artTitles&gt;
&lt;artTitle&gt;GENERALIZED ANISOTROPIC
NAVIER-STOKES EQUATIONS&lt;/artTitle&gt;
&lt;/artTitles&gt;
&lt;abstracts&gt;
&lt;abstract&gt;&amp;lt;p style=&amp;quot;text-indent:
20px;&amp;quot;&amp;gt;In this talk, we consider
the evolution problem for the Navier–
Stokes equations of non-Newtonian type
and with an anisotropic diffusion.
...
&amp;lt;/p&amp;gt;&lt;/abstract&gt;
&lt;/abstracts&gt;
&lt;files&gt;
&lt;furl&gt;F:\Desktop\doc/00001.pdf&lt;/furl&gt;
&lt;/files&gt;
&lt;/article&gt;
…
&lt;/articles&gt;
Рисунок 3 Фрагмент сгенерированного XML-файла
6 Модуль формирования
оригиналмакета научного издания</p>
      <p>Этот модуль позволяет в автоматическом режиме
подготовить из файлов электронной коллекции
оригинал-макет научного издания (сборник
материалов, труды и т. д.). Порядок размещения
статей определяется семантическим представлением
коллекции, хранящемся в XML-файле (см. раздел 5).
Алгоритм реализован в виде макроса VBA и
включает следующие шаги: сначала для задания
диапазона страниц статей определяются счетчики
начальной и конечной страниц и задаются их
начальные значения (см. рис. 4–6). Далее
последовательно открываются документы коллекции
в соответствии с порядком, заданным в XML-файле
в соответствии с правилами извлечения.
Вычисляются начальные и конечные страницы,
после чего формируется библиографическое
описание статьи, которое записывается в колонтитул
данного документа. Полученный документ
конвертируется в PDF-формат. Также
библиографическое описание сохраняется в
XMLфайле. На рис. 6 приведен фрагмент кода,
выполняющий описанные операции.
Рисунок 4 Фрагмент документа до обработки
модулем
Рисунок 5 Фрагмент документа после обработки
модулем (создан колонтитул с выходными
данными)</p>
      <p>Sub Макрос1()
'
' Макрос1 Макрос
'
'
Рисунок 7 Пример автоматически
сгенерированного содержания сборника трудов
Съезда</p>
      <p>После обработки всех документов коллекции
формируются содержание издания и авторский
указатель. При этом используются данные,
сохраненные в XML-файле на этапе формирования
колонтитулов. На рисунках 7 и 8 приведены
автоматически сформированные содержание
издания и авторский указатель.</p>
      <p>1. из
извлечены
публикации;
Рисунок 8 Пример автоматически
сгенерированного авторского указателя сборника
трудов Cъезда
7 Сервис извлечения
библиографических метаданных и
загрузки в РИНЦ</p>
      <p>Алгоритм извлечения библиографических
метаданных и загрузки их в РИНЦ состоит из
следующих шагов (проиллюстрированных на
примере материалов Съезда):</p>
      <p>оригинал-макета сборника трудов
библиографические описания каждой
2. соответствующий скрипт находит в
документе блок библиографических описаний и с
помощью регулярных выражений разделяет их по
видам изданий (например, отличительным
признаком библиографического описания статьи
является наличие знака //);</p>
      <p>3. проводится разбор основных метаданных –
выделяются список авторов, названия статей,
изданий и т. д.;</p>
      <p>4. с помощью разработанного
вебприложения генерируется XML-файл в соответствии
с правилами РИНЦ, содержащий набор метаданных
публикации.
Заключение</p>
      <p>Предложен метод автоматической обработки
больших коллекций физико-математических
документов, включающий их валидацию и
семантический анализ, извлечение метаданных,
подготовку различных видов оригинал-макетов
научных изданий. Метод позволяет выполнять
автоматическую обработку больших коллекций
электронных документов с набором операций,
который не реализуем при традиционной «ручной»
работе с электронным контентом.</p>
      <p>Приведен пример успешной его реализации при
организации ХI Всероссийского съезда по
фундаментальным проблемам теоретической и
прикладной механики (Казань, 20–24 августа
2015 г.).
Благодарности</p>
      <p>Работа выполнена при финансовой поддержке
РФФИ (проекты №№ 15-07-08522, 15-47-02472).
Литература
[1] IBM’s Top Storage Predictions for 2011, January
2011, StorageNewsletter.com.
[2] MIKE2.0. The open source standard for information
management. Big Data definition.
http://mike2.openmethodology.org/wiki/Big_Data_
Definition
[3] А Manyika J., M. Chui, B. Brown, J. Bughin,
R. Dobbs, C. Roxburgh, A. H. Byers. Big data: The
next frontier for innovation, competition, and
productivity: McKinsey Global Institute Report,
2011. http://www.mckinsey.com/insights/mgi/
research/technology_and_innovation/big_data_the_
next_frontier_for_innovation
Automated system of services for processing of
large collections of scientific documents</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>P. J.</given-names>
            <surname>Olver</surname>
          </string-name>
          . Journals in flux.
          <source>Notices Amer. Math. Soc.</source>
          , V.
          <volume>58</volume>
          (
          <issue>8</issue>
          ),
          <year>2011</year>
          , p.
          <fpage>1124</fpage>
          -
          <lpage>1126</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [6]
          <string-name>
            <given-names>А.</given-names>
            <surname>М</surname>
          </string-name>
          . Елизаров, Н. Г. Жильцов, А. В. Кириллович, Е. К. Липачёв.
          <article-title>Семантическое аннотирование в системе управления физико-математическим контентом. Науч. сервис в сети Интернет: труды XVII Всерос. науч</article-title>
          . конф. (
          <volume>21</volume>
          -
          <fpage>26</fpage>
          сентября
          <year>2015</year>
          г.,
          <source>г. Новороссийск)</source>
          , М.:
          <article-title>ИПМ им</article-title>
          .
          <source>М.В</source>
          . Келдыша, c.
          <fpage>98</fpage>
          -
          <lpage>103</lpage>
          ,
          <year>2015</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [7]
          <string-name>
            <given-names>А.</given-names>
            <surname>М</surname>
          </string-name>
          . Елизаров, Н. Г. Жильцов, А. В. Кириллович, Е. К. Липачёв.
          <article-title>Терминологическое аннотирование и рекомендательный сервис в системе управления физико-математическим контентом. Труды XVII Межд. конф</article-title>
          . DAMDID / RCDL'2015 «
          <article-title>Аналитика и управление данными в областях с интенсивным использованием данных»</article-title>
          .
          <source>Обнинск: ИАТЭ НИЯУ МИФИ, с. 347-350</source>
          ,
          <year>2015</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [8]
          <string-name>
            <given-names>Xiaonan</given-names>
            <surname>Lu</surname>
          </string-name>
          , Brewster Kahle, James
          <string-name>
            <given-names>Z.</given-names>
            <surname>Wang</surname>
          </string-name>
          and
          <string-name>
            <given-names>C. Lee</given-names>
            <surname>Giles</surname>
          </string-name>
          .
          <article-title>A metadata generation system for scanned scientific volumes</article-title>
          .
          <source>Joint Conference on Digital Libraries, June</source>
          <volume>16</volume>
          -20,
          <year>2008</year>
          , Pittsburgh, Pennsylvania, p.
          <fpage>167</fpage>
          -
          <lpage>176</lpage>
          ,
          <year>2008</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [9]
          <string-name>
            <given-names>J.</given-names>
            <surname>Chen</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Chen</surname>
          </string-name>
          .
          <article-title>A structured information extraction algorithm for scientific papers based on feature rules learning</article-title>
          .
          <source>Journal of Software</source>
          , Vol.
          <volume>8</volume>
          (
          <issue>1</issue>
          ), p.
          <fpage>55</fpage>
          -
          <lpage>62</lpage>
          ,
          <year>2013</year>
          . http://www.jsoftware.us/vol8/ jsw0801-
          <fpage>08</fpage>
          .pdf
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [10]
          <string-name>
            <given-names>D.</given-names>
            <surname>Tkaczyk</surname>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            <surname>Tarnawski</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Bolikowski</surname>
          </string-name>
          .
          <article-title>Structured affiliations extraction from scientific literature</article-title>
          .
          <string-name>
            <surname>D-Lib Magazine</surname>
          </string-name>
          , V.
          <volume>21</volume>
          (
          <issue>11</issue>
          /12),
          <year>2015</year>
          . http://www.dlib.org/dlib/november15/tkaczyk/11tk aczyk.html
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Standard</surname>
            <given-names>ECMA</given-names>
          </string-name>
          -
          <volume>376</volume>
          :
          <article-title>Office Open XML File Formats</article-title>
          . http://www.ecma-international.org/ publications/standards/Ecma-376.htm
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>