<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Навигация по тезаурусам и поиск в распределенных гетерогенных информационных системах</article-title>
      </title-group>
      <fpage>78</fpage>
      <lpage>84</lpage>
      <abstract>
        <p>Обсуждаются вопросы, связанные с построением пользовательских интерфейсов для навигации по статьям тезаурусов и рубрикаторов в гетерогенных информационных системах. Приводятся некоторые алгоритмы формирования этих интерфейсов с учетом привязки внешних информационных ресурсов к выбранным статьям тезаурусов и рубрикаторов. Основной акцент сделан на динамическую привязку внешних ресурсов на основе текстового поиска по наборам характеристических терминов. Описываются стенд для проведения исследований и результаты исследований на тестовых экспертных наборах данных.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Работа выполнена при поддержке гранта ведущих
научных школ НШ-7214.2016.9.
1 Навигация по рубрикаторам и поиск
в гетерогенных информационных
системах</p>
      <p>С развитием технологий построения
гетерогенных распределенных информационных
систем, включающих в себя множество различных
баз данных с различной структурой и содержанием,
актуальным становится вопрос поиска информации в
базах данных с использованием онтологий,
тезаурусов и классификационных схем,
представленных в виде отдельных баз данных
(БДОТК - базы данных онтологий, тезаурусов и
классификаторов).</p>
      <p>
        Существует множество различных способов
построения БДОТК, организации доступа к их
содержимому и реализации явных и неявных связей
между БДОТК и другими гетерогенными
информационными ресурсами. Многие из этих
способов основаны на строгих онтологических
моделях [
        <xref ref-type="bibr" rid="ref1 ref2">1,2</xref>
        ] и для практической реализации
Труды XVIII Международной конференции
DAMDID/RCDL’2016 «Аналитика и управление
данными в областях с интенсивным
использованием данных», Ершово, 11-14 октября
2016 
предъявляют очень жесткие требования к
организации информационных систем и баз данных
вплоть до полной перегрузки информации в
промежуточные хранилища, функциональные
свойства которых позволяют обеспечить выявление
всех семантических связей между
информационными объектами на основе заданных
онтологических моделей. Такой подход имеет право
на существование, однако остается открытым вопрос
о том, как включить поиск семантически связанной
информации в существующих распределенных
гетерогенных информационных ресурсах, причем в
случае, когда они не могут быть перегружены в
специализированные хранилища.
      </p>
      <p>
        Настоящая работа посвящена описанию способов
поиска семантически связанной информации в
распределенных гетерогенных информационных
системах (базах данных) без использования
специализированных технологий семантического
поиска, основанных на моделях Semantic WEB [
        <xref ref-type="bibr" rid="ref3 ref4 ref5 ref6">3-6</xref>
        ].
Описание способов будет иллюстрироваться их
реализацией в существующих программных
продуктах, в частности, на примере программной
платформы ZooSPACE [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], предназначенной для
интеграции разнородных распределенных
информационных систем, успешно
функционирующей в ИВТ СО РАН на базе
распределенных узлов в городах Новосибирск,
Томск, Красноярск и Иркутск и объединяющей
сегодня более 70 различных баз данных с общим
количеством записей более 60 миллионов.
      </p>
      <p>
        Несмотря на привлекательность перспектив
использования технологий Semantic Web для поиска
информации [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ], реальность сталкивается с фактом,
что подавляющее большинство информационных
ресурсов, организованных в виде различных баз
данных (реляционных, иерархических, сетевых и
пр.), поддерживают прежде всего ту или иную
булеву модель атрибутивного поиска
информации [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ], т.е. поиска, основанного на
использовании метаданных и предопределенных
индексов (точек доступа).
      </p>
      <p>Нашу задачу можно сформулировать и так:
требуется найти все записи в некотором множестве
гетерогенных баз данных, которые бы
соответствовали определенной онтологической
Рисунок 1 Формирование структуры записи статьи тезауруса с динамическими связями с внешними
базами данных
сущности (статье тезауруса, рубрике, коду
рубрикатора и пр.). Для определенности ниже эту
онтологическую сущность мы будем ниже называть
статьей тезауруса, понимая, что на ее месте может
быть и другое. В качестве решения можно
рассматривать алгоритм получения результата,
реализованный в виде функционирующего
серверного программного модуля для некоторой
информационной системы. Эта задача практически
полностью эквивалентна задачи навигации по
статьям тезауруса, когда для текущей статьи
тезауруса отображается информация о связанных с
этой статьей записях из выбранного множества в
общем случае гетерогенных баз данных. При этом
«привязка» связанных записей баз данных к статье
тезауруса должна быть динамической, т.е.
формироваться в процессе формирования
представления собственно статьи тезауруса.</p>
      <p>
        Итак, клиент, используя WEB-браузер может
просматривать тезаурус, перемещаясь по связанным
статьям. Каждая выбранная статья тезауруса должна
быть представлена клиенту в виде некоторой
универсальной структуры, которая может быть
однозначно интерпретирована, т.е. эта структура
должна соответствовать какой-нибудь стандартной
схеме данных, используемой для описания статей
тезауруса. Ниже везде мы будем использовать схему
данных ZThes [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ] в формате XML [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ]. Также мы
будем подразумевать, что все необходимые
обращения к серверам баз данных будут
соответствовать спецификациям SRU [
        <xref ref-type="bibr" rid="ref12">12</xref>
        ] с языком
запросов RPN [
        <xref ref-type="bibr" rid="ref13">13</xref>
        ] в синтаксисе PQF [
        <xref ref-type="bibr" rid="ref14">14</xref>
        ]. Этот язык
запросов отличается от стандартного для SRU языка
запросов CQL, но на наш взгляд он более удобен для
формирования запросов и, что немаловажно, более
нагляден.
      </p>
      <p>На Рисунке 1 схематично представлен алгоритм
работы клиента и сервера при просмотре статьи
тезауруса.</p>
      <p>Выбор клиентом статьи тезауруса порождает
обращение к WEB-серверу, который в свою очередь
формирует запрос к серверу баз данных, хранящему
информацию о текущем тезаурусе (БД тезауруса).
Этот запрос соответствует запросу на поиск записи
(статьи) по ее однозначному идентификатору, в
результате его выполнения должна быть получена
запись БД, соответствующая требуемой статье
тезауруса и содержащей полную информацию о ней.</p>
      <p>
        Если клиентом был сформулирован список баз
данных, записи которых следует соотнести с
текущей статьей тезауруса, должен быть включен
механизм формирования запросов к каждой базе
данных из выбранного списка, выполнения этих
запросов на соответствующих серверах БД,
получение ответов и формирование специальных
элементов (postings) в записи статьи тезауруса,
содержащих информацию об именах баз данных и
количестве найденных записей [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ]. Заметим, что
выполнение запросов к внешним базам данных
может происходить параллельно с асинхронным
завершением.
      </p>
      <p>&lt;term&gt;
. . .
&lt;relation&gt;</p>
      <p>&lt;termID&gt;31.27.20&lt;/termID&gt;
Запрос к серверу внешней БД
Точки доступа к 
БД известны?
Да
Нет
Запрос Explain к </p>
      <p>серверу БД
Получение ответа
Анализ точек доступа </p>
      <p>для БД
Формирование запроса </p>
      <p>на количество 
релевантных записей
Запрос на поиск к </p>
      <p>серверу БД
Получение ответа</p>
      <p>SRU
SRU
SRU
SRU
Сервер БД (SRW/SRU)
Сервер БД (SRW/SRU)
Рисунок 2 Формирование и исполнение запроса к внешней базе данных
&lt;relationType&gt;RT&lt;/relationType&gt;
&lt;termQualifier&gt;31.27.20&lt;/termQualifier&gt;
&lt;termName&gt;Биохимия вирусов&lt;/termName&gt;
&lt;termLanguage&gt;rus&lt;/termLanguage&gt;
&lt;/relation&gt;
&lt;postings&gt;
&lt;SourceDB&gt;AB&lt;/SourceDB&gt;
&lt;hitCount&gt;1022&lt;/hitCount&gt;
&lt;/postings&gt;
&lt;/term&gt;
Несомненно, самым критичным блоком этого
алгоритма является блок формирования запросов к
серверам внешних БД (на Рисунке 1 это блок обведен
пунктиром). Именно от работы этого блока зависит
качество динамической привязки записей внешних
БД к текущей статье тезауруса. Работа этого блока
представлена на Рисунке 2.</p>
      <p>Прежде, чем сформировать запрос к серверу
внешней БД, необходимо выяснить возможности
этой БД в смысле поиска информации, т.е. в
терминах SRU (или Z39.50) определить
поддерживаемые поисковые атрибуты и варианты их
комбинаций. Если отбросить тривиальные и
маловероятные конфигурации с фиксированными
точками доступа, существует только один
регулярный способ – предварительно выполнить
запрос explain (SRU, SRW, Z39.50) и
проанализировать полученную структуру на предмет
выявления поддержки требуемых поисковых
атрибутов.</p>
      <p>Например, из записи Explain можно сделать
вывод, что внешняя база данных поддерживает
поисковые атрибуты USE (type 1) 14 (УДК) и 21
(ключевые слова), операция сравнения - «равно»
(type 2 = 3), поисковые термы интерпретируются как
строки или слова (type 4=1,2,108), поиск возможен
как по точному совпадению (type 5=100), так и по
усечению справа (type 5=1). Поэтому к этой БД мы
можем обращаться с поиском «по ключевым словам»
и кодам рубрикатора УДК, т.е. если текущая статья
нашего тезауруса (рубрикатора) является описанием
рубрики УДК, то запрос к внешней БД должен
выглядеть следующим образом (RPN в синтаксисе
PQF):</p>
      <p>@attr 1=14 @attr 5=1 {term}
где вместо «term» должен фигурировать код текущей
рубрики. Следует заметить, что здесь запрос
сформулирован с усечением справа, т.е. будут
найдены все записи, коды УДК которых начинаются
с символов «term». Для иерархических рубрикаторов
это означает, что к текущей рубрике будут
привязаны записи БД, содержащие коды УДК не
только текущей, но и всех дочерних рубрик.</p>
      <p>В случае тезауруса каждая статья
идентифицируется ее заголовком, поэтому поиск во
внешних БД следует выполнять по ключевым
словам, причем по полному их совпадению:</p>
      <p>@attr 1=21 {term}
где вместо «term» должен фигурировать заголовок
текущей статьи тезауруса.</p>
      <p>Строго говоря, такие запросы к внешним БД
возможны только тогда, когда
1. Для рубрикаторов:
a. для всех внешних БД возможен поиск по</p>
      <p>кодам текущего рубрикатора
2. Для тезаурусов:
ключевым словам
сгенерированы</p>
      <p>из
текущего тезауруса.
a. для всех внешних БД возможен поиск по
b. ключевые слова для всех внешних БД
заголовков</p>
      <p>статей
Последнее условие (2b) практически никогда не
выполняется, поскольку разработчики той или иной
внешней
отличающиеся
БД
могут
от
использовать</p>
      <p>тезаурусы,
нашего
текущего,
или
не
использовать вообще никакие, выбирая ключевые
слова для записей БД в соответствии со своими
правилами.</p>
      <p>Возникает вопрос - как можно соотносить записи
внешних
БД
с текущей статьей</p>
      <p>тезауруса при
нарушении приведенных выше условий.</p>
      <p>Для рубрикаторов при нарушении условия 1a
возможны два варианта:
1. поиск
по
связанным
кодам</p>
      <p>других
2. поиск по текстовым характеристикам статьи
рубрикаторов
рубрикатора
1.1 Поиск по связанным кодам других
рубрикаторов</p>
      <p>Поиск по связанным кодам других рубрикаторов
может
быть
полезен,
когда
внешняя</p>
      <p>база
проиндексирована по этим кодам. Действительно,
если внешняя БД не проиндексирована по кодам
текущего
рубрикатора,
например,
ГРНТИ,
но
проиндексирована по кодам УДК, наличие связи
между статьей рубрикатора ГРНТИ и статьями УДК
позволяет
выполнить
динамическую</p>
      <p>привязку
записей из внешней БД не по кодам ГРНТИ, а по
кодам УДК.
&lt;Zthes&gt;
&lt;/relation&gt;
&lt;/term&gt;
&lt;/Zthes&gt;
выше.</p>
      <p>Технически динамическая привязка записей из
внешней БД осуществляется также, как описано
1.2 Поиск по текстовым характеристикам статьи
рубрикатора</p>
      <p>Если внешняя БД не проиндексирована по кодам
текущего и связанных рубрикаторов, динамическая
привязка ее записей к статьям текущего рубрикатора
становится задачей нетривиальной.</p>
      <p>Действительно, для
того
чтобы</p>
      <p>записи из
внешних БД могли быть динамически привязаны к
текущей
рубрике, необходимо
иметь</p>
      <p>поисковый
образ документов, соответствующих этой рубрике.
При этом почти очевидно, что для такого поискового
образа
практически
бесполезна</p>
      <p>текстовая
информация,
которая
обычно
присутствует
в
описании статьи рубрикатора (название, описание,
названия связанных рубрик и т.п.). Тем не менее,
можно придумать схему динамической привязки,
основываясь, например, на векторной модели поиска
и дополнительной</p>
      <p>информации, которой должна
быть дополнена каждая статья рубрикатора.</p>
      <p>В
векторной
модели
поиска
в</p>
      <p>качестве
поискового образа выступает некоторый уникальный
для
каждой
статьи
рубрикатора</p>
      <p>вектор,
определенный
в
многомерном</p>
      <p>пространстве
декартовой системе координат, каждая ось которой
соответствуют
своему
уникальному</p>
      <p>термину
фиксированного списка терминов, характеризующих
данную
рубрику
(Q1,</p>
      <p>Q2,
...,</p>
      <p>
        Qn)
[
        <xref ref-type="bibr" rid="ref15">15</xref>
        ].
      </p>
      <p>Если
рассматривать
каждую
запись
внешней</p>
      <p>БД как
аналогичный вектор в пространстве встречающихся
в ней терминов (X1, X2, ..., Xm), то можно говорить о
в
из
скалярном
больше это
произведении
векторов</p>
      <p>Q
и</p>
      <p>X. Чем
скалярное произведение, тем</p>
      <p>выше
релевантность записи</p>
      <p>X запросу</p>
      <p>Q. Критерием
отбора записей может быть выполнение условия
1</p>
      <p>( ∙  ) ≥  ,  ≤ 1
Таким образом, для реализации динамической
связи записей из внешних БД со статьей текущего
рубрикатора, необходимо:
Наличие
для
каждой
статьи</p>
      <p>рубрикатора
уникального
характеристического
вектора.</p>
      <p>Этот
вектор может быть построен только в результате
обработки большого количества документов, уже
имеющих в результате экспертной оценки коды
рубрик текущего рубрикатора. При этом для каждой
рубрики
должно
количество</p>
      <p>обработанных
быть
достаточно
большим.</p>
      <p>документов
Вопрос о
достаточной размерности вектора, т.е. о количестве
необходимых характеристических терминов зависит
от структуры рубрикатора и может быть решен в
результате тестов.</p>
      <p>Определение параметра s, характеризующего
минимально
допустимое
значение
скалярного
произведения векторов при поиске может быть
произведено в результате тестов.</p>
      <p>
        Наличие возможности серверами БД
обрабатывать поисковые запросы, соответствующие
векторной модели поиска. Это требование как
правило выполняется для поисковых систем,
ориентированных на неструктурированную и
слабоструктурированную информацию. Серверы БД
ориентированы на булеву модель [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ] поиска, что
затрудняет использование обсуждаемой технологии
привязки записей. Тем не менее в простейшем
варианте без использования частот встречаемости
терминов в документе и в наборе документов,
поисковый запрос, соответствующий векторной
модели, может быть представлен в булевом виде.
      </p>
      <p>В качестве примера рассмотрим
характеристический вектор длиной n=4 с терминами
a, b, c, d: Q = (a, b, c, d)/4.</p>
      <p>Таблица 1
Булевый запрос
(&amp; - AND, | - OR)
s
1
0,5
0,25</p>
      <p>K
0
1
2
3
1
4
a&amp;b&amp;c&amp;d
a | b | c | d
2 (a&amp;b&amp;c) | (a&amp;b&amp;d) | (a&amp;c&amp;d) | 0,75</p>
      <p>(b&amp;c&amp;d)
3 (a&amp;b) | (a&amp;c) | (a&amp;d) | (b&amp;c) | (b&amp;d)</p>
      <p>| (d&amp;c)
при этом количество групп, объединенных
операторами OR, равно количеству сочетаний из n
элементов по k:  !/( −  )!, причем s = (n − k)/n.</p>
      <p>Из приведенного примера видно, что
1. При заданной длине n вектора запроса Q
параметр критерия отбора a принимает
дискретные значения в интервале (0&lt;s≤1) с
шагом 1/n, причем s = (n − k)/n.
2. Каждый булевый запрос для фиксированного
s (или k) перекрывает все запросы с
большими s (меньшими k).
3. При фиксированном параметре s для поиска
необходимо исполнить только один запрос,
который содержит  !/ ! ( −  )! групп по
(n-k) термов. При этом количество
участвующих в запросе термов равно  !/
 ! ( −  − 1)! .
4. Группы объединяются оператором OR
(ИЛИ), термы внутри группы объединяются
оператором AND (И).</p>
      <p>Наконец, можно сделать некоторое
предположение для иерархических рубрикаторов.
Если нас интересует запрос для рубрики N.M.L, для
которой определен характеристический вектор qNML и
соответствующий частный запрос qNML, то
действующим запросом для рубрики N.M.L, будет
запрос вида</p>
      <p>QLMN = QNM &amp; qNML = qN &amp; qNM &amp; qNML
где частные запросы qN и qNM соответствуют
характеристическим векторам qN и qNM для рубрик N
и N.M соответственно.</p>
      <p>Таким образом, поиск по текстовым
характеристикам статьи рубрикатора возможен и
может быть реализован в соответствии с упрощенной
векторной моделью поиска конвертированием
векторных запросов в булеву форму.
2 Экспериментальный стенд и
результаты тестирования</p>
      <p>Для проверки качества работы описанного выше
механизма поиска во внешних ресурсах по
текстовым характеристикам статей рубрикаторов
были использованы:
1. База данных «Рубрикатор ГРНТИ», доступ к
которой предоставлялся по протоколам
Z39.50 и SRU в соответствии со
спецификациями Zthes на платформе</p>
      <p>ZooSPACE.
2. Специализированная база данных (СБД),
содержащая записи РЖ ВИНИТИ
(Информатика, Автоматика,
Вычислительные науки) с проставленными
экспертами ВИНИТИ кодами ГРНТИ для
групп кодов:
a. 20.*.* - Информатика
b. 28.*.* - Кибернетика
c. 50.*.* - Автоматика и телемеханика.</p>
      <p>Вычислительная техника.
по 200 записей для каждого кода. Для
упрощения обработки эта БД была загружена
в СУБД PostgreSQL с активизацией функций
полнотекстового поиска в полях Title, Subject,</p>
      <p>
        Abstract.
3. Для числовых характеристик, описывающих
качество поиска, использовались метрики
[
        <xref ref-type="bibr" rid="ref16">16</xref>
        ]:
Таблица 2
      </p>
      <p>Найдено
Не найдено
Полнота:
Точность:
Ошибка:
Релевантный</p>
      <p>Не релевантный
a
c
b
d
 =  ⁄( +  )
p=  ⁄( +  )
e = ( +  )/( +  +  +  )
F-мера:  = 2  /( +  )
Для каждой рубрики ГРНТИ в указанных выше
группах на основании частоты встречаемости
терминов в различных записях СБД и выполнения
запроса к СБД по этому термину был определен
ранжированный по убыванию F список слов из
заголовков, ключевых слов и аннотаций для
соответствующих записей СБД.</p>
      <p>На основе этого списка для каждой рубрики
ГРНТИ может быть построен наиболее эффективный
0,4
0,3
а
р
0,2
е
м
‐
 
F
0,1</p>
      <p>0
0,7
0,6
0,5
0,4
а
р
е
м
0 ‐,3
F
0,2
0,1</p>
      <p>0
0,6
0,5
0,4
а
р
0,3
е
м
‐
 
F
0,2
0,1
0</p>
      <p>F, n=6
F, n=5
F, n=4
F, n=3
F, n=6
F, n=5
F, n=4
F, n=3
F, n=5
F, n=4</p>
      <p>F, n=3
по вышеуказанным метрикам характеристический
вектор. Мы использовали критерий максимального
значения F при варьировании параметров n и s.
оптимальных значений n и s в таблице 4 приведены
значения метрик.
Таблица 3
ГРНТИ
20.23.19
Процессы
информационного
поиска
28.23.27
Интеллектуальные
робототехнические
системы
50.11.33
Оптические
запоминающие</p>
      <p>устройства
Таблица 4</p>
      <p>Термины
поисковый, запрос, поиск,</p>
      <p>документ,
информационный,
пользователь, обработка,</p>
      <p>база, …
робот, мобильный,
движение, алгоритм,</p>
      <p>управление,
предлагаться, …
оптический, дисковод,
воспроизведение, носитель,
диск, запись, память, …
0
0,2
0,4
0,6
0,8</p>
      <p>1
20.23.19</p>
      <p>Параметр s
0
0,2
0,4
0,6
0,8</p>
      <p>1
28.23.27</p>
      <p>Параметр s
0
0,2
0,4
0,6
0,8</p>
      <p>1
50.11.33</p>
      <p>Параметр s
Рисунок 3 Характерная зависимость F от длины
характеристического вектора (n) и параметра s для
записей с разными кодами ГРНТИ.</p>
      <p>В качестве примера приведем ранжированный
список терминов для некоторых кодов ГРНТИ.
Зависимость F-меры от длины характеристического
вектора и параметра s представлена на рисунке 3 для
трех кодов ГРНТИ. При этом для наиболее
20.23.19
5
0,8
1
0.360
0,350
0,009
0,355
28.23.27</p>
      <p>3
0,667</p>
      <p>1
0,508
0,707
0,009
0,591
50.11.33</p>
      <p>3
0,667</p>
      <p>1
0,430
0,629
0,005
0,511
Таким образом, при наличии СБД можно
определить для каждой рубрики:
1. Ранжированный список терминов
2. Длину и содержание характеристического</p>
      <p>вектора
3. Оптимальное значение параметра s (или k)
На основании этой информации можно построить
булевый поисковый запрос по текстовым атрибутам,
который наиболее полно будет соответствовать
запросу по соответствующему коду рубрикатора.
При этом вероятность нахождения нужных записей в
найденном таким образом множестве записей
предварительно известна и равна значению p.</p>
      <p>Например, вместо запроса по коду ГРНТИ
28.23.27 можно выполнять запрос вида
(робот &amp; мобильный)
| (робот &amp; движение)
| (мобильный &amp; движение)
Результат выполнения этого запроса будет
содержать нужные данные с вероятностью 0,7.</p>
      <p>Следует заметить:
1. Описанный механизм привязки внешних
ресурсов к кодам рубрикаторов хорошо
работает для «грубых» рубрикаторов.</p>
      <p>Для иерархических рубрикаторов и
рубрикаторов с «родственными» рубриками
качество поиска является
удовлетворительным. При этом поисковые
метрики сильно зависят от длины
характеристических векторов и значения
критерия отбора. Обе этих характеристики
могут быть получены на основе анализа
экспертных данных.</p>
      <p>В заключение следует заметить, что на основе
изложенных выше методов и алгоритмов в
настоящее время разрабатываются программные
модули для системы ZooSPACE, реализующие
графические пользовательские интерфейсы для
навигации по тезаурусам и рубрикаторам с
привязкой информации из разнородных источников.</p>
      <p>Thesaurus navigation and search in the
distributed heterogeneous information systems</p>
      <p>Oleg L. Zhizhimov, Saya A. Santeeva</p>
      <p>The issues related to creation of the user interfaces for
navigation through the articles of thesauruses and
rubricators in heterogeneous information systems are
discussed. The algorithms of formation of these
interfaces taking into account a binding of external
information resources to the chosen articles of
thesauruses and rubricators are given. The main
emphasis is placed on a dynamic binding of external
resources based on text search in the sets of characteristic
terms. The workbench for studies as well as the research
results obtained on the testing expert data sets are
described.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <given-names>Web</given-names>
            <surname>Ontology Language</surname>
          </string-name>
          (OWL), http://www.w3.org/2004/OWL/
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Онтология (информатика) - Материал из</surname>
          </string-name>
          Википедии - свободной энциклопедии - http://ru.wikipedia.org/wiki/Онтология_(информа тика)
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>Semantic</given-names>
            <surname>Web</surname>
          </string-name>
          , http://www.w3.org/2001/sw/
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>Tim</given-names>
            <surname>Berners-Lee</surname>
          </string-name>
          ,
          <article-title>James Hendler and Ora Lassila, The Semantic Web</article-title>
          , http://sciam.com/article.cfm?articleID=
          <fpage>00048144</fpage>
          -
          <lpage>10D2</lpage>
          -
          <fpage>1C70</fpage>
          -84A9809EC588EF21
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <given-names>Metadata</given-names>
            <surname>Architecture</surname>
          </string-name>
          , http://www.w3.org/DesignIssues/Metadata
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <article-title>[6] W3C standards</article-title>
          , http://w3.org/sw/
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Жижимов</surname>
            <given-names>О.Л.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Федотов</surname>
            <given-names>А</given-names>
          </string-name>
          .М.,
          <string-name>
            <surname>Шокин</surname>
            <given-names>Ю</given-names>
          </string-name>
          .И.
          <article-title>Технологическая платформа массовой интеграции гетерогенных данных // Вестник Новосибирского государственного университета</article-title>
          .
          <source>Серия: Информационные технологии. - 2013</source>
          . -
          <fpage>Т</fpage>
          .
          <year>11</year>
          . -
          <fpage>№</fpage>
          1. -
          <fpage>С</fpage>
          .
          <fpage>24</fpage>
          -
          <lpage>41</lpage>
          . - ISSN 1818-
          <volume>7900</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Guha</surname>
            <given-names>R</given-names>
          </string-name>
          . Semantic search / R. Guha,
          <string-name>
            <given-names>R.</given-names>
            <surname>McCool</surname>
          </string-name>
          , E. Miller //
          <source>Proceedings of the 12th international conference on World Wide Web</source>
          . - N.Y. ACM Press,
          <year>2003</year>
          . - P.
          <fpage>700</fpage>
          -
          <lpage>709</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Шарапов</surname>
            <given-names>Р.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Шарапова</surname>
            <given-names>Е</given-names>
          </string-name>
          .В.,
          <string-name>
            <surname>Саратсвцева</surname>
            <given-names>О</given-names>
          </string-name>
          .А.
          <article-title>Модели информационного поиска</article-title>
          . http://vuz.exponenta.ru/PDF/FOTO/kaz/Articles/sh arapov1.pdf
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <article-title>The Zthes specifications for thesaurus representation, access</article-title>
          and navigation - http://zthes.z3950.org/
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <given-names>Extensible</given-names>
            <surname>Markup</surname>
          </string-name>
          <article-title>Language (XML)</article-title>
          , http://www.w3.org/XML/
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>[12] SRU - Search/Retrieve via URL// The Library of Congress. - USA - http://www.loc.gov/standards/sru/</mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>[13] RPN - https://www.loc.gov/z3950/agency/markup/09.html</mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [14]
          <string-name>
            <given-names>Mike</given-names>
            <surname>Taylor.</surname>
          </string-name>
          PQF - http://search.cpan.org/dist/NetZ3950-PQF/lib/Net/Z3950/PQF.pm
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Э</surname>
          </string-name>
          . Мбайкоджи, А.А. Драль, И.В. Соченков.
          <article-title>Метод автоматической классификации коротких текстовых сообщений</article-title>
          . http://elib.ict.nsc.ru/jspui/bitstream/ICT/1396/1/93_ 102.pdf
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [16]
          <string-name>
            <surname>М</surname>
          </string-name>
          . Агеев, И. Кураленок, И.Некрестьянов.
          <source>Официальные метрики РОМИП</source>
          <year>2006</year>
          http://romip.ru/romip2006/appendix_a_metrics.pdf
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>