<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Сервисы структурирования математического контента и интеграция электронных математических коллекций в научное информационное пространство</article-title>
      </title-group>
      <contrib-group>
        <aff id="aff0">
          <label>0</label>
          <institution>Alexander Elizarov</institution>
          ,
          <addr-line>Denis Zuev, Eugene Lipachev, Michael Malakhaltsev</addr-line>
        </aff>
      </contrib-group>
      <fpage>309</fpage>
      <lpage>312</lpage>
      <abstract>
        <p>Казанского (Приволжского) федерального университета Процесс структурирования (разделения на смысловые элементы) электронных версий печатных изданий является необходимым этапом для последующего семантического структурирования и включения электронных коллекций в информационное пространство. Электронные версии печатных научных журналов представляют собой документы, имеющие структуру, которая отражает логику разделение документа на части. Эта структура сформирована шрифтовым выделением, абзацами, вертикальными и горизонтальными отступами. Автоматическая обработка таких документов с целью отбора структурных компонент (например, выделения авторов статьи или библиографических данных) затруднительна. Как следствие, большинство операций с электронным контентом, в частности, создание связей между объектами электронного хранилища, необходимо выполнять вручную. В докладе обсуждается подход к автоматизации процесса обработки научных электронных документов и их преобразования в структурированные документы. Акцент сделан на особенностях обработки математических текстов. С помощью сервисов, созданных по предложенной методике, выполнено структурирование достаточно большого по объему электронного хранилища, содержащего выпуски периодического журнала по математике и многотомных трудов конференций.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Труды 14-й Всероссийской научной конференции
«Электронные библиотеки: перспективные методы и
технологии, электронные коллекции» — RCDL-2012,
Переславль-Залесский, Россия, 15-18 октября 2012 г.
1 Введение</p>
      <p>Многочисленные научные электронные
коллекции, созданные на основе действующих
периодических научных журналов, состоят из электронных
версий статей, изданных типографским способом.
Как следствие, электронные документы в таких
коллекциях хранятся в виде отдельных файлов с
минимальной метаинформацией и не имеют структуры,
позволяющей выполнить автоматизацию по
выделению данных.</p>
      <p>Как правило, электронные документы не имеют
связей внутри коллекции. Аналитическая обработка
документов такой коллекции (например, сбор
наукометрических данных) представляется крайне
затруднительной.</p>
      <p>Электронные журналы, публикующие материалы
исключительно в электронном виде, в большинстве
случаев являются коллекцией электронных
документов, созданных теми же программными
средствами, ориентированными только на «финишную»
печать и, следовательно, имеющими только
структуру оформления.</p>
      <p>
        Примерами современных электронных
хранилищ с развитыми сервисами являются научная
электронная библиотека eLibrary.ru (http://elibrary.ru)
и общероссийский математический портал
MathNet.Ru (http://www.mathnet.ru/). Отметим также
коллекцию электронного математического журнала
Lobachevskii Journal of Mathematics, содержащую
сервисы управления электронным контентом,
сформированные на основе семантического Веба (см.,
напр., [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ], [2]). Этот журнал, издаваемый с 1998
года, является одним из первых российских
электронных научных журналов и включен в базы данных
Science Direct (Elsevier) и eLibrary.ru.
      </p>
      <p>
        На современном этапе развития электронных
научных библиотек важное место занимает
интеграция созданных научных ресурсов в научное
информационное пространство, в котором между
объектами электронных коллекций присутствуют
семантические связи (см., напр., [
        <xref ref-type="bibr" rid="ref2">3</xref>
        ], [
        <xref ref-type="bibr" rid="ref3">4</xref>
        ]). Необходимым
условием такой интеграции являются семантическое
структурирование контента научных электронных
библиотек и создание семантических связей между
информационными объектами. Технологии
семантического Веба, разрабатываемые консорциумом
W3C (www.w3.org), являются технологической
платформой, на которой осуществляется интеграция
электронных ресурсов в информационное
пространство (см., напр., [
        <xref ref-type="bibr" rid="ref4">5</xref>
        ], [6]).
2 Проблемы обработки
математических ресурсов
электронных
Как уже было отмечено, у большинства
имеющихся электронных документов, являющихся
электронными версиями печатных публикаций, можно
обнаружить только структуру, отражающую
форматирование (шрифт, выделение). Выполнить
преобразование таких документов в
структурированный документ можно на основе особенностей
форматирования. Процесс такого преобразования
можно разделить на несколько последовательных
этапов, с которыми связано решение
соответствующих задач.
      </p>
      <p>Первая задача – это разделение текстов на
категории по общей для них системе форматирования и
программным средствам, используемым для
научной разметки. Можно считать, что такое разделение
уже сделано – журналы, сборники трудов и т. д., как
правило, подчинены единообразному для каждого
издания стилю оформления. Затруднение может
вызвать только система научной нотации – в ряде
изданий можно обнаружить, что разные авторы
используют отличающиеся технологии разметки.
Например, в одном и том же сборнике наряду со
статьями, выполненными в TeX-разметке, присутствуют
статьи, выполненные в MS Word + MathType.</p>
      <p>Следующая задача – создание системы
признаков для каждой категории электронных документов,
на основании которых из текста выделяются
структурные элементы.</p>
      <p>Сложной задачей является обработка
электронного документа и его трансформация в
структурированный документ на основе системы признаков.</p>
      <p>Отдельная задача заключается в генерации
метаданных и выделении из текста ключевых слов.</p>
      <p>Завершающим этапом является создание
электронного документа, структурированного по
правилам семантического Веба.
3 Технологии
электронных ресурсов
структурирования
Один из подходов к структурированию макетов
печатных изданий в составе электронной коллекции
предложен в проекте «Научная электронная
библиотека eLibrary.ru». Алгоритм структурирования
основан на выделении элементов текста и присвоении
им специализированных меток.</p>
      <p>Подготовка библиографических материалов,
включаемых в индексы научного цитирования,
выполняется автоматически с помощью сервиса,
производящего структурирование списков литературы и
сносок с учетом требований ГОСТ 7.1-84
«Библиографическое описание документа».</p>
      <p>
        Для структурирования макетов печатных
изданий в рамках проекта «Научная электронная
библиотека eLibrary.ru» была разработана программа, в
основу которой положен принцип выделения
элементов текста и присвоения им меток полей
собственного XML-формата, названного Sarcticle (см.
[
        <xref ref-type="bibr" rid="ref5">7</xref>
        ]).
      </p>
      <p>Отличительными особенностями этого формата
являются: вложенность полей, возможности
описания любого количества информации одним файлом,
проверки правильности составления файлов
описаний на стороне издательств, использования файлов
описаний для наполнения собственных сайтов
издательств и совместимости с другими форматами
обмена метаданными, основанными на XML.
Основные блоки формата – информация о журнале, о
выпуске, о статье (основная информация файла).
Большинство полей может дублироваться на
нескольких языках с целью более удобного
представления для разных пользователей конечной
информации в электронной библиотеке.</p>
      <p>Основные разделы формата:
 раздел описания журнала в целом, куда
входят сведения о названии журнала, издателе,
ISSN, обобщенной структуре издания (том – номер
– часть – спецвыпуск), а также поля, позволяющие
описать отдельный выпуск журнала;</p>
      <p> сведения о статье из выпуска журнала, куда
входят описание индивидуальных и/или
коллективных авторов статьи с подробной информацией о
них, название статьи, ключевые слова, реферат
(аннотация), полный текст статьи без списка
литературы, наиболее распространенные коды
классификаторов (УДК, ББК, ГРНТИ, DOI для электронных
изданий и др.), а также подраздел, описывающий
пристатейные списки литературы; при этом каждая
позиция в списке литературы (или сноске) разбита
на отдельные поля и подполя – например, автор(ы)
работы, название, источник, год издания и т. д.;
 раздел тематических рубрик журнала, куда
входит описание подразделов выпуска журнала.</p>
      <p>Формат исполнен в двух видах – в DTD и в MS
Schema. Набор тегов формата не зависит от выбора
видов описания XML. Порядок следования тегов
важен. Все теги имеют закрывающий тег. Регистр
тегов должен соблюдаться: используются как
строчные, так и прописные буквы в названиях
тегов. Все спецсимволы при использовании формата
требуется заменить на предопределенные сущности.</p>
      <p>Технически возможно в одном файле описать
любое количество журналов, но с точки зрения
удобства хранения и заполнения предпочтительна
ситуация «один файл XML – один выпуск
журнала».</p>
      <p>Возможные способы создания документов XML
в формате Sarcticle могут включать использование:
 специализированных программных средств
создания документов XML, конформных формату
Sarcticle;
 любого XML-ориентированного текстового
редактора, например, MS XML Notepad;
 любого текстового редактора.</p>
      <p>Имеются дополнительные описания элементов
формата (или «справочники»):</p>
      <p> «arcticle types» – список кодов типов статей
для атрибута arttype;</p>
      <p> «language codes» – список кодов языков для
атрибута fieldlang;</p>
      <p> «country codes» – список кодов стран для
атрибута jcountry;</p>
      <p> «symbols.html» (в HTML) – список всех
сущностей, заменяющих специальные символы;
 «dateUni format.txt» – описание формата
поля dateUni.</p>
      <p>В случае электронной коллекции однотипных
документов (научные статьи журнала, материалы
конференции) возможна автоматизация процесса
извлечения метаданных. Алгоритм такой
экстракции основан на анализе синтаксического уровня
представления информации.</p>
      <p>Научные статьи размечены в соответствии со
стилевыми правилами, принятыми в научных
журналах, и поэтому имеют относительно регулярную
структуру для определенного блока электронных
документов.</p>
      <p>Математические статьи в большинстве случаев
создаются с помощью систем, основанных на
TeXнотации. Но, несмотря на продвинутые
возможности структурирования документа, заложенные в
TeX-системы, в научных журналах, за редким
исключением, используются упрощенные (с
семантической точки зрения) средства структурирования.
Наиболее сложными в этом плане являются архивы
научных статей прошлых десятилетий, когда
электронная форма документа являлась промежуточной
и использовалась только для редактирования и
подготовки перед печатью. Структура такого документа
определяется на основе анализа шрифтового
выделения и порядка следования текстовых единиц
(название, автор, аннотация). Этого недостаточно для
выделения ключевых слов.</p>
      <p>Основой алгоритма структурирования
журнальных статей по математике являлась обработка
информации из стилевых файлов, используемых при
предпечатной подготовке журнала. Название статьи,
ее авторы, выходные данные, УДК определялись
автоматически выделением тега, характерного для
данного элемента. Создание программной среды,
реализующей указанный алгоритм, позволило
автоматизировать процесс структурирования
электронной коллекции математического журнала.
4 Сервисы электронных математических
коллекций</p>
      <p>Как известно, сегодня поиск является самым
распространенным инструментом доступа к
информации в сети. По многим оценкам, поиск занимает
до 50% времени работы на компьютере, а самая
сложная проблема – отделение значимой
информации от информационного мусора. Семантический
Веб, будучи частью глобальной концепции развития
интернета, имеет целью реализацию возможности
машинной обработки информации и позволит
рассматривать интернет в целом как глобальную базу
данных. Один из акцентов этой концепции – работа
с метаданными, однозначно характеризующими
свойства и содержание сетевых ресурсов, вместо
текстового анализа документов. Поэтому экстракция
метаданных является необходимой составной
частью процесса автоматизации управления
электронной научной коллекцией. Вместе с тем, метаданных
недостаточно для интеграции электронных
коллекций в информационное пространство, в котором
поиск и обработка информации программируются
как машиноориентированные. В настоящее время
имеется широкий набор программных средств для
семантической разметки электронных документов и
записи их в XML-формате, в частности,
преобразования документов из ТeХ-нотации в MathML.
Однако исходные файлы документов электронный
коллекций, как правило, не удовлетворяют требованиям
имеющихся пакетов и сервисов семантического
преобразования из-за многообразия стилевых
конструкций и отсутствия разделения на структурные
элементы. Поэтому необходимым этапом
становится предварительная трансформация электронных
документов, обеспечивающая им структуру, общую
для данной коллекции, и возможность дальнейшей
автоматизированной обработки. Разработанный
алгоритм трансформации электронных документов
основан на синтаксическом анализе документов (см.
раздел 3).</p>
      <p>Практическая реализация описанного подхода,
выполненная авторами для нескольких электронных
математических коллекций, выявила
дополнительные сложности, связанные с наличием авторских
конструкций в электронных документах, входящих в
эти коллекции. Большинство этих сложностей
удается преодолеть за счет использования
специализированных сервисов на всех этапах формирования
электронной коллекции, в частности, электронного
научного журнала (машинное взаимодействие
авторов и редакции, анализ соответствия
представляемых материалов заданной структуре и т. д.).</p>
      <p>
        Одна из систем таких сервисов создана при
автоматизации работы электронного журнала
Lobachevskii Journal of Mathematics. Кратко
перечислим функциональные возможности
разработанной системы: вывод списка ссылок на статьи,
входящие в коллекцию; вывод списка авторов статей,
входящих в коллекцию; поиск по авторам,
заглавиям, ключевым словам, рефератам, тексту статей.
Отдельно выделим поиск по математическим
формулам. Этот сервис основан на использовании
технологии MathML (см., напр., [
        <xref ref-type="bibr" rid="ref6">8</xref>
        ], [
        <xref ref-type="bibr" rid="ref7">9</xref>
        ]).
Заключение
      </p>
      <p>Использование технологий семантического Веба
является основой интеграции электронных научных
коллекций в информационное научное
пространство. Автоматизация процесса структурирования
имеющихся электронных математических ресурсов
создает возможность быстрого включения
электронных версий математических публикаций в
информационное научное пространство.
Литература</p>
      <p>Services structuring mathematical content
and integration of digital mathematical
collections at scientific information space</p>
      <p>The approach to automate the processing of
scientific digital documents and convert them into structured
documents is discussed. Main emphasis is placed on the
features of processing of mathematical texts. Using
special services which were created by the proposed
method of structuring texts the large enough digital
repository with periodical journal issues in mathematics and
multivolume conference proceedings was performed.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Елизаров</surname>
            <given-names>А. М.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Липачев</surname>
            <given-names>Е</given-names>
          </string-name>
          . К., Малахаль- цев М. А.
          <article-title>Технологии Semantic Web в практике работы электронного журнала по математике // Тр. 8-й Всерос. науч</article-title>
          . конф. «
          <article-title>Электронные биб- лиотеки: перспективные методы и технологии</article-title>
          , электронные коллекции» - RCDL'
          <year>2006</year>
          , Суз- даль, Россия,
          <year>2006</year>
          . -
          <fpage>С</fpage>
          .
          <fpage>215</fpage>
          -
          <lpage>218</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Когаловский</surname>
            <given-names>М. Р.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Паринов</surname>
            <given-names>С</given-names>
          </string-name>
          . И.
          <article-title>Семантиче- ское структурирование контента научных элек- тронных библиотек на основе онтологий // В сб</article-title>
          . «
          <article-title>Современные технологии интеграции инфор- мационных ресурсов: сборник научных трудов</article-title>
          »,
          <year>2011</year>
          . - Вып. 2. -
          <fpage>www</fpage>
          .cemi.rssi.ru/mei/articles/ kogalov11-
          <fpage>04</fpage>
          .pdf.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Паринов</surname>
            <given-names>С. И.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Когаловский</surname>
            <given-names>М</given-names>
          </string-name>
          . Р.
          <article-title>Техноло- гия семантического структурирования контента научных электронных библиотек</article-title>
          // Тр. 13-й Всерос. науч. конф. «
          <article-title>Электронные библиотеки: перспективные методы и технологии</article-title>
          , электрон- ные
          <string-name>
            <surname>коллекции</surname>
          </string-name>
          » - RCDL'
          <year>2011</year>
          , Воронеж,
          <year>2011</year>
          . -
          <fpage>С</fpage>
          .
          <fpage>94</fpage>
          -
          <lpage>103</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Когаловский</surname>
            <given-names>М. Р.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Хохлов</surname>
            <given-names>Ю</given-names>
          </string-name>
          . Е.
          <article-title>Стандарты XML для электронного правительства</article-title>
          .
          <source>- М.: Институт развития информационного общества</source>
          ,
          <year>2008</year>
          . -
          <fpage>416</fpage>
          с.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Глухов</surname>
            <given-names>В. А.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Елизаров</surname>
            <given-names>А</given-names>
          </string-name>
          . М. Проект «
          <article-title>Научная электронная библиотека eLibrary.ru» и россий- ские электронные журналы: новый этап разви</article-title>
          - тия //Тр. 8-й Всерос. науч. конф. «
          <article-title>Электронные библиотеки: перспективные методы и техноло- гии</article-title>
          , электронные коллекции» - RCDL'
          <year>2006</year>
          , Суздаль, Россия,
          <year>2006</year>
          . -
          <fpage>С</fpage>
          .
          <fpage>203</fpage>
          -
          <lpage>207</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Елизаров</surname>
            <given-names>А. М.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Липачев</surname>
            <given-names>Е</given-names>
          </string-name>
          . К.,
          <string-name>
            <surname>Малахальцев</surname>
            <given-names>М</given-names>
          </string-name>
          .А.
          <article-title>Веб-технологии для математика: Основы MathML</article-title>
          . Практическое руководство.
          <source>- М.: Физматлит</source>
          ,
          <year>2010</year>
          . -
          <fpage>216</fpage>
          с.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Елизаров</surname>
            <given-names>А.М.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Липачёв</surname>
            <given-names>Е</given-names>
          </string-name>
          . К., Малахаль- цев М.А.
          <article-title>Языки разметки семантического веба</article-title>
          .
          <source>Практические аспекты</source>
          . - http://www.ksu.ru/ fpk/docs/lip_mal.pdf.
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>