<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Принципы создания многоязычной электронной библиотеки для крупного информационного центра</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>© V.N. Zakharov</string-name>
          <email>vzakharov@ipiran.ru</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>© Yu.V. Nikitin</string-name>
          <email>yuri.v.nikitin@gmail.com</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>© Al-dr A. Khoroshilov</string-name>
          <email>khoroshilov@mail.ru</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Federal Research Center Computer Science and Control of the Russian Academy of Sciences</institution>
          ,
          <addr-line>Moscow</addr-line>
          ,
          <country country="RU">Russia</country>
        </aff>
      </contrib-group>
      <fpage>311</fpage>
      <lpage>316</lpage>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>В нашей стране в настоящее время
функционирует множество организаций, каждый
день имеющих дело с огромным объемом
документов. Многие из этих организаций из-за
специфики своей деятельности получают и
обрабатывают документы на нескольких языках. К
таким организациям можно отнести, например,
предприятия авиационно-косми-ческой отрасли, для
которых стоит важнейшая задача соответствия
международным стандартам; всевозможные научные
организации, для которых жизненно необходимо
быть в курсе последних исследований и разработок;
организации, обеспечивающие безопасность
государства, для получения актуальной
Труды XIX Международной конференции
«Аналитика и управление данными в областях с
интенсивным использованием данных»
(DAMDID/ RCDL’2017), Москва, Россия, 10–13
октября 2017 года
политической и технической информации и т. д.
Соответственно, для решения различных задач
дальнейшего эффективного использования
получаемых постоянно документов необходима их
предварительная автоматическая обработка,
позволяющая свести к минимуму трудозатраты
обслуживающего персонала. В настоящее время
множество информационных систем имеет
достаточно полный функционал работы с
русскоязычными текстами, но, к сожалению, все эти
системы имеют довольно скромные возможности
при работе с разноязычными массивами документов,
а задача сравнения текстов, выявления
документовдубликатов и заимствований в отечественных
информационных системах в настоящий момент
решена только для документов, написанных на
одном языке. В то же время потребность в таких
системах достаточно велика, и задача требует
скорейшего решения.
2 Существующие подходы к организации
электронных библиотек</p>
      <p>Задача хранения и организации доступа к
большим коллекциям документов стоит уже
достаточно давно. За это время было разработано
множество решений, которые в разной степени
удовлетворяют требованиям, предъявляемым
современными пользователями. Далее приведем
некоторые данные о развитии такого программного
обеспечения в настоящее время.</p>
      <p>В работе [1] авторы провели серьезное сравнение
свободно распространяемых технологий для
организации электронных библиотек,
существующих в настоящее время. Были
протестированы системы OJS, ePubTK, DPubS,
GAPWorks, Ambra, e-Journal. Сделан вывод, что
практически все решения поддерживают
общепринятые стандарты в области интеграции и
обмена данными и имеют широкие возможности по
генерации различных метаданных в зависимости от
потребностей пользователя. Но, к сожалению,
большинство из рассматриваемых продуктов более
не развивается. Понятно, что такие системы
позволяют решать стандартный набор задач и
используются для небольших электронных
библиотек.</p>
      <p>При росте объемов документов становится важно
решить задачу повышения эффективности поиска.
Для этого многие ученые разрабатывают новые
механизмы, одним из которых стал семантический
поиск. В работе [2] авторы предлагают новый метод
поиска, основанный на использовании модели S-тег.
Особенностью данного метода является то, что
индексируется не весь текст, а только его значимые
части в зависимости от задачи, при этом за счет
изменения размера значимой части можно
контролировать точность и полноту.</p>
      <p>Другим подходом к семантическому поиску, о
котором сейчас пишет все большее число авторов,
является использование онтологических моделей [3].
Основной идеей данного подхода является
использование онтологий предметных областей для
аннотирования содержания электронных ресурсов.
Авторы работы [4] дополнили онтологический
подход добавлением новых операций над
онтологиями – проекции и масштабирования – и
описали модель их применения для задач
информационного поиска.</p>
      <p>Еще одним направлением развития поиска в
электронных библиотеках является многоязычный
поиск. К сожалению, в настоящее время работ по
этой тематике не так много. Одно из таких решений
было описано в работе [5]. В ней представлено
решение задачи двуязычного поиска с помощью
тезауруса для двух языков (русского и английского).
Похожего мнения придерживаются и многие
иностранные исследователи, в том числе, например,
в работе [6]. Несколько иной подход предложен в [7]:
для решения задачи многоязычного поиска
использован инструментарий систем
автоматического перевода текстов.
•
•
•
•
•
•
•
•
•
•
•
3 Организация многоязычной
электронной библиотеки для крупного
информационного центра
3.1 Архитектура многоязычной электронной
библиотеки</p>
      <p>Проанализировав подходы и решения,
имеющиеся на сегодня в области разработки
современных электронных библиотек, авторами был
составлен список требований, которым должна
удовлетворять система, функционирующая в
крупном информационном центре:
• обеспечение модульной архитектуры с
возможностью быстрого включения в систему
новых модулей;
использование средств СУБД, позволяющих
максимально эффективно организовать процесс
доступа к данным;
обеспечение возможности оперативного
пополнения декларативных средств системы;
обеспечение максимальной
добавления новых языков в систему;
простоты
обеспечение распределенной
массовопараллельной лингвистической и
статистической обработки загружаемых данных;
обеспечение масштабируемости на множество
узлов обработки без деградации
инфраструктуры обработки данных;
обеспечение всех этапов лингвистической
обработки, включающей этапы
графематического, морфологического,
семантико-синтаксического, концептуального и
дистрибутивно-статистического анализа [12];
обеспечение
поиска;
эффективного</p>
      <p>многоязычного
обеспечение эффективного сравнения
смыслового содержания документов, в том числе
поиска заимствований и документов-дубликатов
[13-15];
обеспечение поддержки общепринятых
стандартов в области интеграции и обмена
данными;
создание наиболее полной и удобной структуры
метаданных для хранимых в базе документов;
обеспечение удобного пользовательского
интерфейса, максимально упрощающего доступ
пользователя ко всему функционалу
электронной библиотеки.</p>
      <p>На Рис. 1 представлена предлагаемая авторами
архитектурная схема многоязычной электронной
библиотеки для крупного информационного центра.
Подсистема управления
и визуализации</p>
      <p>Подсистема
администрирования
Подсистема
формирования
результатов и
аналитических отчетов</p>
      <p>Подсистема
лингвистического</p>
      <p>обеспечения
БД словарных средств
Подсистема поиска
Подсистема сбора
информации
Подсистема
обработки
информации
Хранилище данных
Рисунок 1 Архитектурная схема многоязычной
электронной библиотеки для крупного
информационного центра
3.2 Процесс формализации документов
многоязычной электронной библиотеке
в
Основной задачей при выполнении
формализации документа является представление
смысловой структуры текста в структурированном
виде. По мнению авторов, формализованное
представление текстового содержания документа
должно включать:
• библиографические реквизиты (например,
информационный источник, рубрика, автор,
наименование и дата публикации и т. п.);
• аннотацию или реферат документа;
• список ключевых выражений;
• список значимых объектов (персоны,
организации, территории, наименования
товаров, географические объекты, бренды, и
т. д.);
При этом для создания многоязычной системы
данная информация должна содержаться на всех
поддерживаемых языках. Также каждому документу
должна соответствовать следующая информация:
• содержащиеся в документе формулы, параметры
с их числовыми значениями и т. д.;
классификация документа по смысловому
содержанию – отнесение его к той или иной
рубрике и кластеризация [11] (группировка)
текстов публикаций по темам;
ссылки на связанные документы (цитаты,
заимствования, документы-дубликаты, близкие
по смыслу документы) [8–10].
•
•
3.3 Организация многоязычного поиска
В ходе исследования авторами была разработана
двухступенчатая процедура поиска, которая может
быть использована для поиска в многоязычном
массиве информации. На первом этапе запрос был
преобразован в его унифицированное семантическое
представление, на втором этапе производился поиск
в базе данных стандартными средствами.
Рассмотрим каждый из этапов подробнее.
3.3.1 Метод трансформации поискового запроса в
его унифицированное семантическое
представление</p>
      <p>Разработанный авторами метод трансформации
поискового запроса в его унифицированное
семантическое представление основан на
использовании многоязычного словаря
унифицированных формализованных представлений
наименований понятий [16]. В данном исследовании
словарь был сформирован для трех языков (русского,
английского и немецкого), но в этот словарь могут
быть добавлены эквиваленты на других языках при
наличии переводных словарей схожих объемов.
Также для работы метода необходимы процедуры
морфологического, семантико-синтаксического и
концептуального анализа для каждого языка,
который содержится в словаре унифицированных
формализованных представлений наименований
понятий. При выполнении этих условий
трансформация поискового запроса сводится к
следующему алгоритму (Алгоритм 1):</p>
      <p>Шаг 1. Определяется язык обрабатываемого
запроса.</p>
      <p>Шаг 2. С помощью процедуры концептуального
анализа (для выявленного языка) определяется
совокупность значимых наименований понятий с
указанием местоположений этих понятий в тексте
запроса.</p>
      <p>Шаг 3. Каждое наименование понятия запроса
приводится к нормальной форме с помощью
процедуры автоматической пословной
нормализации.</p>
      <p>Шаг 4. Каждое нормализованное наименование
понятия ищется в многоязычном словаре
унифицированных формализованных представлений
наименований понятий, после чего ему
присваивается номер из этого словаря. Пример
словаря приведен в Таблице 1.
Таблица 1 Фрагмент многоязычного словаря
унифицированных формализованных представлений
наименований понятий
№
n/n
Схема работы данного алгоритма отображена на
Рис. 2.
взят массив текстов по тематике «Информационные
технологии» (182641 текст).
Запрос на естественном</p>
      <p>языке
Процедура определения языка
Семантико-синтаксический
анализ текста запроса
Концептуальный анализ</p>
      <p>текста запроса
Нормализация списка
наименований понятий
Поиск наименований понятий
в многоязычном словаре
унифицированных
формализованных
представлений наименований</p>
      <p>понятий
Запись списка наименований
понятий с соответствующими
им номерами
Грамматические
таблицы
Эталонный
концептуальный</p>
      <p>словарь
Многоязычный</p>
      <p>словарь
унифицированных
формализованных</p>
      <p>представлений
наименований понятий
Рисунок 2 Схема работы алгоритма трансформации
поискового запроса в его унифицированное
семантическое представление
3.3.2 Процесс поиска в многоязычных массивах,
основанный на использовании метода
трансформации поискового запроса</p>
      <p>Далее рассмотрим алгоритм поиска документов в
многоязычных массивах с использованием
стандартных средств СУБД (Алгоритм 2):</p>
      <p>Шаг 1. На вход поступает поисковый запрос,
после чего он обрабатывается с помощью
алгоритма 1.</p>
      <p>Шаг 2. Средствами СУБД производится поиск
наименований понятий запросов в многоязычном
массиве (при поиске сравниваются не сами
наименования понятий, а их номера в многоязычном
словаре унифицированных формализованных
представлений наименований понятий).</p>
      <p>Шаг 3. Запускается процедура ранжирования
результатов поиска, полученных с помощью
стандартных средств СУБД. Процедура
ранжирования зависит от типа поиска.</p>
      <p>Шаг 4. Выдача результатов поиска пользователю.</p>
      <p>На Рис. 3 представлена общая схема работы
программного модуля, в котором реализованы
описанные алгоритмы.</p>
      <p>Целью эксперимента являлась проверка
работоспособности предложенных методов поиска
информации в многоязычном массиве, установление
их эффективности [8], а также возможности их
использования в промышленных информационных
системах. Эксперимент проводился на основе
разработанного авторами программного комплекса.
В качестве исходных данных для эксперимента был
Модуль
обработки
запросов
Модуль
вывода
результатов
Программно- лингвистическая платформа Метафраз
Процедура семантико-синтаксического анализа</p>
      <p>Процедура концептуального анализа
Процедура создания формализованного</p>
      <p>представления
Многоязычный</p>
      <p>словарь
унифицированных
формализованных
представлений
наименований
понятий
Грамматические</p>
      <p>таблицы и
дополнительные</p>
      <p>словари
Многоязычный массив</p>
      <p>текстов
Рисунок 3 Общая схема работы программного
модуля поиска текстовой информации в
многоязычных массивах
3.3.3 Эксперимент по проверке разработанного
метода поиска в многоязычном массиве
Эксперимент проводился в несколько этапов:
1. На первом этапе тексты документов,
приготовленные для эксперимента, были загружены
в систему и обработаны при помощи алгоритма 1,
изложенного в разделе 3.3.1. Все результаты
обработки были занесены в базу данных
программного комплекса.</p>
      <p>2. На втором этапе из загруженных текстов было
выбрано 35000 предложений и 90000 случайных
наименований понятий. При этом был создан
контрольный массив, где содержались все адреса
предложений и наименований понятий в текстах
документов коллекции.</p>
      <p>3. На третьем этапе выбранные предложения и
наименования понятий были переведены на
английский и немецкий язык с помощью системы
перевода Google Переводчик
(https://translate.google.ru/).</p>
      <p>4. На четвёртом этапе был произведен поиск
каждого из переведенных на третьем этапе
предложений и наименований понятий в
русскоязычном массиве документов. Для этого
использовался алгоритм 2, изложенный в разделе
3.3.2. После этого информация об адресах найденных
соответствий сопоставлялась с информацией,
полученной в п. 2.
Полнот
а
0.88
0.79
0.84
0.96
0.99
0.98
0.92
0.89
0.91
Поиск
наименований
понятий
Поиск
предложений
Среднее
значение
4 Заключение
семантический
документов.
•
•</p>
      <p>Идеи, описанные выше, были реализованы в виде
программного продукта MF Text Analyst на базе
программно-лингвистической платформы MetaFraz
R10. Данный программный комплекс предназначен
для выполнения следующих простых операций:
• ведение электронной библиотеки
научнотехнических документов;
автоматическое формирование формализован
ного представления документов;</p>
      <p>поиск, отбор и сравнение</p>
      <p>MF Text Analyst позволяет загружать в БД
документы в наиболее распространенных форматах
(PDF, DOC, DOCX, TXT и др.), а затем извлекать
текстовое содержимое и производить все этапы
Рисунок 4 Скриншот интерфейса электронной библиотеки MF Text Analyst
5. На пятом этапе с помощью данных,
полученных в п. 4, были получены значения
полноты, точности и F1-меры. Результаты приведены
в таблице 2.
Таблица 2 Значения показателей эффективности
метода
Точность
лингвистической обработки. Скриншот интерфейса
электронной библиотеки MF Text Analyst
представлен на рис. 4.</p>
      <p>
        Также в данном программном продукте в
тестовом режиме реализован многоязычный поиск.
Его эффективность была проверена на коллекции
размером в 182641 документ и показала неплохие для
данного этапа исследований результаты.
Предложенный авторами метод показал
соответствующую аналогам скорость поиска при
использовании СУБД RavenDB. Далее для
улучшения показателей эффективности необходимо
продолжать работу по доработке программного
обеспечения, а также пополнять словари новой
лексикой. Указанные мероприятия позволят
значительно улучшить качество работы
разработанных алгоритмов на текстах, относящихся
к широкому спектру предметных областей.
Литература
[1] Елизаров, А.М., Зуев, Д.С, Липачёв, Е.К.:
Свободно распространяемые системы
управления электронными научными
журналами и технологии электронных
библиотек. Труды XV Всерос. науч. конф.
«Электронные библиотеки: перспективные
методы и технологии, электронные коллекции»
–
        <xref ref-type="bibr" rid="ref8">RCDL’2013</xref>
        , г. Ярославль, 14–17 октября 2013
года, сс. 227-236 (2013)
[2] Малахов, Д.А., Сидоренко, Ю. А., Атаева, O.М.,
Серебряков, В.А.: Семантический поиск как
средство взаимодействия с электронной
библиотекой. Труды XVIII Межд. конф.
      </p>
      <p>
        <xref ref-type="bibr" rid="ref9">DAMDID / RCDL’2016</xref>
        «Аналитика и
управление данными в областях с интенсивным
      </p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>электронные коллекции</surname>
          </string-name>
          » - RCDL'
          <year>2013</year>
          , г.
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <source>четвертой Всерос. науч. конф. RCDL'2002</source>
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          (
          <year>2002</year>
          ) [6]
          <string-name>
            <surname>Oard</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          : Alternative Approaches for Cross-
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <source>1997 Symposium on Cross-Language Text and</source>
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <given-names>Speech</given-names>
            <surname>Retrieval</surname>
          </string-name>
          (
          <year>1997</year>
          ) [7]
          <string-name>
            <surname>Cardeñosa</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gallardo</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Toni</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          : Multilingual
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <given-names>and Information</given-names>
            <surname>Technologies</surname>
          </string-name>
          ,
          <volume>28</volume>
          <fpage>September</fpage>
          -
          <lpage>2</lpage>
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>October</surname>
          </string-name>
          ,
          <year>2009</year>
          , Yerevan, Armenia (
          <year>2009</year>
          )
          <article-title>[8] Хорошилов, А</article-title>
          .А.: Методы автоматического
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <article-title>RCDL'2013, г</article-title>
          .
          <source>Ярославль</source>
          ,
          <volume>14</volume>
          -
          <fpage>17</fpage>
          октября 2013
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>DAMDID</surname>
          </string-name>
          / RCDL'2016 «Аналитика и
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <article-title>Информатизация и связь, (1), сс</article-title>
          .
          <fpage>49</fpage>
          -
          <lpage>55</lpage>
          (
          <year>2017</year>
          ) [13]
          <string-name>
            <surname>Zakharov</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Khoroshilov</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          : Automatic
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <source>Proceedings. Proc. of the 14th All-Russian</source>
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Pereslavl-Zalessky</surname>
          </string-name>
          , Russia,
          <source>October 15-18</source>
          ,
          <fpage>934</fpage>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          pp.
          <fpage>143</fpage>
          -
          <lpage>149</lpage>
          (
          <year>2012</year>
          ) [14]
          <string-name>
            <surname>Zakharov</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Khoroshilov</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          : Semantic Methods
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <article-title>Selected Papers of the 15th All-Russian Scientific</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Russia</surname>
          </string-name>
          ,
          <source>October 14-17</source>
          ,
          <issue>1108</issue>
          , pp.
          <fpage>165</fpage>
          -
          <lpage>172</lpage>
          (
          <year>2013</year>
          ) [15]
          <string-name>
            <surname>Khoroshilov</surname>
            ,
            <given-names>A.A.</given-names>
          </string-name>
          :
          <article-title>Method for Detecting Implicit</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <year>2015</year>
          ), Obninsk, Russia,
          <source>October 13-16</source>
          ,
          <year>2015</year>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          1536, pp.
          <fpage>266</fpage>
          -
          <lpage>372</lpage>
          (
          <year>2015</year>
          ) [16]
          <string-name>
            <surname>Zakharov</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Khoroshilov</surname>
          </string-name>
          , Alexandr, Khoroshilov,
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <source>(DAMDID/RCDL 2016)</source>
          ,
          <volume>1752</volume>
          , pp.
          <fpage>181</fpage>
          -
          <lpage>186</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>