<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Опыт идентификации персон для CRIS-систем</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Томск aknjazeva@ict.nsc.ru tur@hcei.tsc.ru</string-name>
        </contrib>
      </contrib-group>
      <fpage>132</fpage>
      <lpage>138</lpage>
      <abstract>
        <p>В данной работе приводится описание системы идентификации персон, которая создавалась в процессе разработки Единого репозитория результатов научнотехнической деятельности (РНТД) в ИВТ СО РАН. Кратко описываются принципы и методы, используемые при создании системы, а также ее структура. Описан алгоритм создания авторитетной базы данных с описаниями персон в автоматическом режиме, без участия пользователя. Для выявления нечетких дубликатов в упоминаниях персон использовались индексирование по биграммам и расстояние редактирования.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        Разработка информационных систем (ИС),
предназначенных для сбора и хранения информации
о результатах научной деятельности, в настоящее
время крайне актуальна [1]. К таким системам
относятся научные сети (например, Scopus [
        <xref ref-type="bibr" rid="ref1">2</xref>
        ], Web
of Science [
        <xref ref-type="bibr" rid="ref2">3</xref>
        ], ResearchGate [
        <xref ref-type="bibr" rid="ref3">4</xref>
        ], SciVerse [
        <xref ref-type="bibr" rid="ref4">5</xref>
        ],
CrossRef [
        <xref ref-type="bibr" rid="ref5">6</xref>
        ]), и целый класс информационных систем
CRIS (Current Research Information Systems) [
        <xref ref-type="bibr" rid="ref6">7</xref>
        ].
Предметом рассмотрения в данной работе будут
CRIS-системы.
      </p>
      <p>С 2000 года существует организация EuroCRIS,
объединяющая разработчиков и исследователей ИС
текущих исследований в странах Европейского
Союза. EuroCRIS занимается созданием и
поддержкой стандартов и методологий создания
CRIS-систем.</p>
      <p>В настоящее время распространение
CRISсистем не ограничивается географическими
Труды 16-й Всероссийской научной конференции
«Электронные библиотеки: перспективные методы и
технологии, электронные коллекции» — RCDL-2014,
Дубна, Россия, 13–16 октября 2014 г.</p>
      <p>Исходя из широкого диапазона пользователей
возникает необходимость учета самой
разнообразной научно-исследовательской
информации, а также и большой набор требований к
CRIS-системам.</p>
      <p>
        В данной статье описывается система
идентификации персон, которая разрабатывалась в
рамках создания системы агрегирования данных по
научным проектам в Институте вычислительных
технологий СО РАН1. Задача идентификации
персон в данных CRIS-систем, объединенных в
единый репозиторий, близка к задачам
идентификации сущностей (entity identification) [
        <xref ref-type="bibr" rid="ref10">12</xref>
        ],
установления связей (record linkage) [
        <xref ref-type="bibr" rid="ref11">13</xref>
        ], выявления
дубликатов (duplicate detection) [
        <xref ref-type="bibr" rid="ref12 ref13 ref14">14–16</xref>
        ].
1 Работа выполнена при финансовой поддержке
Министерства образования и науки Российской
Федерации (Государственный контракт № 14.521.11.0004
от 14.08.2013 «Разработка системы агрегирования данных
по научным проектам из различных источников для
обеспечения мониторинга реализации мероприятий и
программ», шифр 2013-2.1-14-521-0017-002).
Перечисленные задачи актуальны для широкого
диапазона ресурсов, распределенных и локальных.
В самых разнообразных данных часто встречаются
упоминания одних и тех же объектов реального
мира, которые необходимо связывать между собой
для обеспечения более качественной работы с
информацией. В частности, в нашей работе
используются методы нечеткого сопоставления
строк и общие принципы связывания документов.
2 Обзор работ в области идентификации
объектов
      </p>
      <p>Для идентификации объектов в CRIS-системах в
настоящее время используется подход, основанный
на принципах LOD2. Он позволяет использовать
собственные идентификаторы, которые при этом
становятся внешними. Созданные идентификаторы
могут однозначно разрешаться и сторонними
системами благодаря использованию механизма
URI. Такой подход разрабатывается в рамках
проекта CERIF-Linked-Data3. В дальнейшем связать
данные CRIS-систем, преобразованные в
соответствии с принципами LOD, можно связать с
другими источниками LOD (например,
библиографическими) с помощью инструмента
автоматического установления RDF-ссылок Silk4.</p>
      <p>
        Использование семантических связей при
создании и отображении CERIF-документов
рассматривается также в работах С.И. Паринова
[
        <xref ref-type="bibr" rid="ref15">17</xref>
        ].
      </p>
      <p>
        Вопросы интеграции информационных ресурсов,
формирования наборов метаданных и онтологий для
научных информационных ресурсов
рассматриваются в работах А.Н. Бездушного,
М.В. Кулагина, В.А. Серебрякова и др. [
        <xref ref-type="bibr" rid="ref16 ref17">18, 19</xref>
        ].
      </p>
      <p>Задача создания собственной CRIS-системы, в
которой производится идентификация персон,
рассматривается также в работах А.С. Умарова и др.
[1].</p>
      <p>
        Различные системы учета публикаций, например,
Scopus, Web of Science, SCIENCE INDEX (на базе
РИНЦ) используют различные идентификационные
коды авторов5. Обзор различных систем
идентификаторов и их сравнительный анализ
приводится в работах [
        <xref ref-type="bibr" rid="ref18 ref19">20, 21</xref>
        ].
3 Постановка задачи
3.1 Источники данных
      </p>
      <p>В процессе работы использовались данные
Единого репозитория результатов
научнотехнической деятельности (РНТД),
разрабатываемого в ИВТ СО РАН. РНТД
2 Linked Open Data.
3 http://code.google.com/p/cerif-linked-data/
4  Silk Link Discovery Framework –
http://www4.wiwiss.fuberlin.de/bizer/silk/
5 ORCID, ResearcherID, SPIN-код соответственно.
объединяет данные по научным проектам
нескольких организаций: ФГБНУ
«Научноисследовательский институт – Республиканский
исследовательский научно-консультационный центр
экспертизы», Российский фонд фундаментальных
исследований (РФФИ), Российский гуманитарный
научный фонд (РГНФ), ФГБНУ «Дирекция
научнотехнических программ», Национальный фонд
подготовки кадров, ООО «Инконсалт», ФГАНУ
«Центр информационных технологий и систем
органов исполнительной власти».
3.2 Описание задачи идентификации</p>
      <p>Имеется несколько независимых источников,
содержащие данные о научно-исследовательской
деятельности. Данные из источников агрегируются
в выделенную базу данных (репозиторий).
Агрегированные данные могут содержать дублетное
описание базовых сущностей, т.е. описывать один
объект реального мира в различных вариантах. Это
отражается на качестве поиска, так как результаты
поиска документов, относящихся к отдельной
сущности, не будут достаточно полными.
Необходимо решить задачу идентификации
объектов реального мира в данных.
3.3 Варианты идентификации объектов</p>
      <p>Идентификацию объектов реального мира можно
организовать различными способами, в зависимости
от наличия авторитетных данных:</p>
      <p>1. Существует авторитетная база данных (своя
или сторонняя), в ней описываются объекты,
которые необходимо идентифицировать. Задача
сводится к установлению связи с авторитетным
документом путем указания его идентификатора.</p>
      <p>2. Нет такой базы, необходимо создавать ее в
процессе идентификации.</p>
      <p>Первый вариант идентификации актуален для
организаций, в которых существуют развитые
авторитетные базы данных (библиотек, архивов) и
не всегда подходит для научно-исследовательских
институтов, в которых такие базы, зачастую, не
сформированы на этапе разработки CRIS-систем.</p>
      <p>Использование сторонних баз данных для
идентификации сущностей может быть особенно
полезным в тех случаях, когда в самих документах
приводится мало информации об объекте. Тогда
можно идентифицировать объект (например,
персону) не столько по его описанию, сколько по
его связям с другими объектами (персонами,
организациями и т.п.). С этой точки зрения могут
быть полезны социальные сети, которые активно
развиваются в настоящее время, например, LinkedIn,
Facebook, ВКонтакте и др. Поскольку основное
внимание в них уделяется именно связям между
объектами. Можно использовать профили
пользователей для их идентификации при условии,
что существует API. Этот подход представляется
перспективным и будет развиваться в нашей
дальнейшей работе.
данных с описаниями персон Persons и сводную
базу данных документов CERIF, для которых
установлены связи с соответствующими персонами.</p>
      <p>Источники данных
1</p>
      <p>2
Единый репозиторий результатов
научно-технической деятельности
(РНТД)
В данной статье рассматривается второй вариант
идентификации, при котором создаются
авторитетные базы данных. Он может быть полезен
в том случае, если нет готовых авторитетных баз
данных и при этом нет уверенности, что
пользователи уже зарегистрированы в социальных
сетях или в системах учета публикаций. Для
реализации данного подхода необходимо решать
следующие задачи:
1. Формальный контроль входных данных.
2. Автоматическое формирование авторитетных
баз данных, которые содержат документы,
описывающие идентифицируемые объекты.</p>
      <p>контроль входных данных
3. Авторитетный
(установление связи).</p>
      <p>Предлагается технология связывания
документов, которую можно использовать для
связывания с уже существующими системами
идентификаторов, при условии, что в данных
системах существуют профили идентифицируемых
объектов.</p>
      <p>При этом не идет речь о создании собственной
системы универсальных идентификаторов. Для
технических нужд в процессе работы используются
исключительно внутренние идентификаторы
документов и объектов.
3.4 Формат данных</p>
      <p>
        Данные, используемые в работе, поступают в
виде документов в формате CERIF6. Данный формат
является официальной рекомендацией для членов
Европейской комиссии (European Commission). Он
определяет набор обязательных и дополнительных
полей, которые должны использоваться для
описания научных проектов, в том числе название
проекта, краткое описание, описание участников,
наименование финансирующей организации и т.п. В
качестве дополнительной информации могут быть
указаны ссылки на другие проекты и на публикации
в рамках данного проекта [
        <xref ref-type="bibr" rid="ref20">22</xref>
        ].
4 Идентификация персон для РНТД
4.1 Входные требования к документам
      </p>
      <p>К входным документам
следующие требования:</p>
      <p>• документы должны
требованиям формата CERIF;
предъявляются
соответствовать
• в упоминании персоны должны быть как
минимум указаны фамилия и первый инициал на
одном из двух языков (русском или английском).
4.2 Краткое описание алгоритма работы
Место системы идентификации персон в РНТД
представлено на рисунке 1. Система работает с
данными РНТД, формирует авторитетную базу
6 CERIF – формат обмена научно-исследовательскими
данными, разработанный EuroCRIS
..</p>
      <p>n</p>
      <p>}
Рис. 1. Взаимодействие системы идентификации
персон и РНТД
Основные принципы,
придерживались при
идентификации сущностей:
которых
разработке</p>
      <p>мы
модели
• Сохранение исходных данных обеспечивает
возможность возвращения входных документов к
предыдущему состоянию, до того, как они были
связаны. Если будет сделана ошибка при
установлении связи, ее легко можно будет
исправить. На практике это требование означает,
что вместо того чтобы изменять документы в
исходной базе данных, создается новая база данных
с установленными связями.</p>
      <p>• Использование меток содержимого, т.е.
лексем, которые несут смысловую нагрузку и
описывают данные. Этот принцип позволяет
получать данные из системы без изменений (в их
первоначальном виде) и, в то же время, при
необходимости осуществлять более сложную
навигацию по ним. Таким образом, мы дополняем
данные и решаем проблему идентификации
сущностей.</p>
      <p>В процессе обработки входных документов
создается ресурс авторитетной базы, который
содержит документы с описанием персон.
Авторитетные документы наполняются только той
информацией, которая есть во входных данных, без
привлечения сторонних источников.</p>
      <p>
        В общем виде алгоритм работы программного
комплекса выглядит следующим образом. Входной
документ подвергается формальному контролю. На
этом этапе необходимо проверить его корректность
с точки зрения соответствия схеме данных CERIF
[
        <xref ref-type="bibr" rid="ref21">23</xref>
        ]. Также возможна и проверка отдельных полей с
помощью словарей допустимых значений.
      </p>
      <p>Далее из входного документа извлекаем
определения базовых сущностей CERIF (в данной
работе рассматривается сущность типа «Персона»).
Извлечение означает, что создается временный
авторитетный документ, в который помещается вся
информация о сущности, содержащаяся во входном
документе CERIF. При этом, как правило, во
входном документе упоминается более одной
персоны (в проекте участвует сразу несколько
исполнителей), временные документы создаются
для каждой из них.</p>
      <p>Каждый временный авторитетный документ
затем сравнивается с теми, что уже находятся в
авторитетной базе данных. Если такого документа
(или похожего на него) в базе нет, то он загружается
в нее и перестает быть «временным». Если для
временного документа был найден нечеткий
дубликат, то возможны два варианта:</p>
      <p>• Во временном документе нет новой
информации – авторитетная база данных остается
без изменения.</p>
      <p>• Временный документ не противоречит
найденному в базе данных, но при этом содержит
часть неучтенной информации – документ из базы
данных дополняется этой новой информацией.
4.3 Поиск подобных документов в авторитетной
базе данных</p>
      <p>
        Сравнение временного авторитетного документа
с каждым из документов, уже содержащихся в базе
данных, может оказаться неоправданно трудоемким.
В частности, при работе «на лету» может
потребоваться сократить количество авторитетных
документов, которые будут сопоставляться с
временным документом. Существует множество
способов ограничить круг документов для
сопоставления. Приведем некоторые из них:
1. Метод стандартных блоков выделяет
документы в один блок в том случае, если они
содержат идентичный блочный ключ [
        <xref ref-type="bibr" rid="ref22">24</xref>
        ]. Блочные
ключи формируются на основе атрибутов
документов, например, первые 4 символа фамилии.
Кроме того, блочный ключ может быть и
составным, например, атрибут «фамилия» может
сочетаться с атрибутом «год рождения». Ключи
должны быть выбраны таким образом, чтобы блоки
не были ни слишком большими, ни слишком
мелкими.
      </p>
      <p>
        2. Метод ближайших соседей [
        <xref ref-type="bibr" rid="ref23">25</xref>
        ] сортирует
документы на основе сортирующего ключа и затем
двигает окно фиксированного размера
последовательно по всем документам. Документы
внутри окна составляют пары друг с другом и
включаются в список пар-кандидатов. Метод может
некорректно работать в том случае, если количество
документов с одним значением ключа превышает
размер окна, поскольку в такой ситуации будут
сравниваться не все нужные документы.
      </p>
      <p>
        3. Метод Bigram-индексирования [
        <xref ref-type="bibr" rid="ref24">26</xref>
        ]
предназначен для нечеткого разбиения на блоки.
Основная идея заключается в том, что значения
блочных ключей конвертируются в лист биграм
(подстрок, состоящих из двух символов) и затем из
этих биграм формируются списки на основе
заданного порога (например, выбираются все
документы, в которых встречается 80% биграм).
      </p>
      <p>В рамках данной работы использовался метод
Bigram-индексирования на основе фамилии персоны
на русском языке. Использование этого метода
позволяет найти документы с опечатками в
фамилии, что позволяет повысить качество
идентификации.</p>
      <p>Результаты поиска выдаются в порядке
релевантности, то есть в начале списка результатов
помещаются документы с точным соответствием
(если они есть), а затем все менее и менее похожие
(в смысле совпадения по фамилии). Таким образом,
ограничение круга документов задается путем
установления порога, после которого документы
признаются слишком отличающимися и не
передаются для более подробного анализа.</p>
      <p>В нашей работе такой порог был установлен с
помощью расстояния редактирования Левенштейна
[27]. Документы с различием в фамилии больше чем
в 2 символа считались непохожими исключались из
дальнейшего рассмотрения. Оставшиеся документы,
являющиеся потенциальными дубликатами
рассматриваемого документа, формируют
множество документов для сравнения.
4.4 Описание процедуры сравнения документов
Рассмотрим более подробно процедуру
сравнения временного авторитетного документа с
документами из множества для сравнения.</p>
      <p>Прежде всего производится вычисление строгого
соответствия для всех полей документа. В
зависимости от результатов сравнения возможны
следующие варианты:</p>
      <p>1. Если все поля точно равны, делается вывод,
что текущий документ является точным дубликатом
найденного. Из найденного документа извлекается
его идентификатор и возвращается для
установления связи. Временный документ не
помещается в авторитетную базу данных.</p>
      <p>2. Если точного равенства нет, то следует
нечеткое сравнение (см. таблицу 1). Допускается
расхождение в одном из перечисленных полей
(кроме поля с указанием пола):</p>
      <p>(a) Если расхождение в одном поле, и не
превышает границы, то делается вывод о нечетком
дубликате. В найденный авторитетный документ
вносится информация о вариантном наименовании,
возвращается код найденного документа.
Временный авторитетный документ не помещается
в базу данных;</p>
      <p>(b) Если не было обнаружено ни точного, ни
нечеткого сравнения, переходим к анализу
следующего найденного документа.</p>
      <p>Таблица 1. Способы сравнения
Признак
Фамилия
(рус. яз.)
Фамилия
(англ. яз.)
Имя
(рус. яз.)
Имя
(англ. яз.)
Пол
Место
работы
(организация)
Поле
док-та
200$a
400$a
200$g
400$g
120$a
601$a</p>
      <p>Способ
сравнения
Порог.</p>
      <p>значение
Расстояние
редактирования
Строгое
равенство
Относительное</p>
      <p>расстояние
редактирования
2
0
30%
Если временный авторитетный документ прошел
процедуру сравнения с каждым документом из
множества для сравнения, но при этом не было
найдено ни одного строгого или нестрогого
дубликата, то он помещается в авторитетную базу
данных.</p>
      <p>Относительное
определяется как
редактирования к
сравниваемых строк.</p>
      <p>расстояние</p>
      <p>
        отношение
длине первой
редактирования
расстояния
из двух
Пороговые значения были установлены
эмпирически. В дальнейшем планируется провести
более подробное исследование для выбора
пороговых значений.
5 Оценка качества идентификации
Оценивать качество идентификации персон в
рамках данной работы предлагается с помощью
широко распространенных показателей: полноты и
точности [
        <xref ref-type="bibr" rid="ref25">28</xref>
        ].
      </p>
      <p>Показатель полноты можно
помощью следующей формулы:
рассчитать с</p>
    </sec>
    <sec id="sec-2">
      <title>Recall </title>
    </sec>
    <sec id="sec-3">
      <title>TruePostive</title>
    </sec>
    <sec id="sec-4">
      <title>TruePostive  FalseNegative</title>
      <p>где TruePositive – количество верно установленных
связей с созданными авторитетными документами,
FalseNegative – количество упущенных связей.
Точность оценивается по формуле</p>
    </sec>
    <sec id="sec-5">
      <title>Precision </title>
    </sec>
    <sec id="sec-6">
      <title>TruePostive</title>
      <p>TruePostive  FalsePostive
,
где FalsePositive
установленных связей.</p>
      <p>Для расчета описанных показателей необходима
тестовая выборка, на основе которой можно было
–
количество
неверно
бы рассчитать количество ошибок и верно
установленных связей между документами.</p>
      <p>При этом можно оценивать полноту и точность в
двух вариантах. Если рассматривать все возможные
комбинации документов как потенциальные связи,
то в результате получим оценку метода в целом. А
если среди связей рассматривать только те, которые
были отобраны как потенциальные с помощью
процедуры поиска подобных документов, то
получим оценку работы механизма сопоставления
документов. Второй вариант подходит в том случае,
если на этапе сужения круга документов для
сравнения не происходит потери нужных связей.
6 Описание программного комплекса
6.1 Функциональное описание программного
комплекса cflib</p>
      <p>В качестве системы идентификации персон
(рис. 1) в данной работе выступает программный
комплекс cflib, состоящий из следующих модулей:
• cfchk – проверка и коррекция входных
документов, внедрение временных меток
содержимого;</p>
      <p>• cfwrk – сравнение временного и найденного
документов;
• cfsearch – поиск в авторитетной базе данных;
• cfupdate – дополнение
авторитетной базы данных.</p>
      <p>Основные модули программного комплекса cflib
представлены на рисунке 2.
документа
из</p>
      <sec id="sec-6-1">
        <title>Inbox</title>
        <p>cfsearch</p>
      </sec>
      <sec id="sec-6-2">
        <title>Persons</title>
        <p>cfchk
cfwrk</p>
        <p>cfupdate</p>
        <p>Outbox
Рис. 2. Основные модули программного комплекса
Модуль cfchk кроме проверки входного
документа на корректность также осуществляет
внедрение меток содержимого, используемых для
работы. К таким меткам относятся временные
идентификаторы для отдельных персон, наборы
биграмм и другая информация, которая понадобится
при дальнейшей работе.</p>
        <p>При помещении документа в базу данных
Persons он индексируется в соответствии с
подготовленным профилем индексирования. В этот
профиль включено индексирование по биграммам,
что позволяет модулю cfsearch извлекать подобные
для поиска среди
них
нечетких
Литература
документы
дубликатов.</p>
        <p>В работе модуля cfwrk предусмотрены несколько
этапов сравнения для выявление нечетких
дубликатов. При этом можно изменить функции
сравнения и использовать другие методы сравнения,
не нарушая логики работы программного
комплекса.</p>
        <p>Модуль cfupdate предназначен для дополнения
авторитетного документа отсутствующей
информацией или вариантными значениями
отдельных полей.</p>
        <p>Программный комплекс cflib является
платформо-независимым и может работать под
управлением различных операционных систем или
сред, включая Cygwin для MS Windows. Комплекс
cflib написан на нескольких языках
программирования: C, Perl и XSLT
7 Заключение</p>
        <p>В данной работе приводится описание системы
идентификации персон, которая создавалась в
процессе разработки Единого репозитория
результатов научно-технической деятельности
(РНТД) в ИВТ СО РАН.</p>
        <p>Особенностью данной системы является то, что в
процессе ее работы создается авторитетная база
данных с описаниями персон в автоматическом
режиме, без участия пользователя. Первое
встреченное упоминание ложится в основу
авторитетного документа, а последующие могут при
необходимости дополнять этот документ. Такой
подход был выбран из-за того, что при создании
системы в нашем распоряжении не было готовой
авторитетной базы данных. Однако допускается и
возможность подключения готовой базы данных,
если она доступна.</p>
        <p>
          В качестве формата авторитетных данных был
выбран формат RUSMARC/Authorities [
          <xref ref-type="bibr" rid="ref26">29</xref>
          ], широко
распространенный в библиотечном сообществе.
Такой выбор позволяет в дальнейшем осуществлять
простую интеграцию с библиотечными данными.
        </p>
        <p>Для выявления нечетких дубликатов в
упоминаниях персон использовались
индексирование по биграммам и расстояние
редактирования. Сравнение состоит из нескольких
этапов. При необходимости можно предусмотреть и
больше вариантов сравнения документов, а также
изменить используемые для сравнения методы –
логика работы системы от этого не пострадает.</p>
        <p>В дальнейшей работе планируется рассмотреть
различные методы сравнения документов,
исследовать возможность построения обучающих
выборок из документов в формате CERIF, а также
использовать различные сторонние системы для
идентификации персон (в частности, систему Silk).</p>
        <p>The system of persons identification which was
created in the process of development of a unified
repository of scientific and technical activities (RSTA)
in ICT SB RAS is described in this paper. The
principles and methods used to create the system as well
as its structure are briefly described. An algorithm for
establishing an authoritative database with descriptions
of persons automatically, without user intervention, is
given. Indexing with bigrams and editing distance were
used for detecting near-duplicate references to persons.</p>
      </sec>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Scopus</surname>
          </string-name>
          . http://www.scopus.com
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>Thomson</given-names>
            <surname>Reuters</surname>
          </string-name>
          <article-title>Web of Science</article-title>
          . http://thomsonreuters.com/products_services/ science/science_products/a-z/ web_of_science/
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>[4] ResearchGate. http://researchgate.net</mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>[5] SciVerse. http://www.info.sciverse.com</mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>[6] CrossRef. http://crossref.org</mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <article-title>[7] CRIS concept and CRIS benefits</article-title>
          . http://www.eurocris.org/ Index.php?page=concepts_
          <source>benefits&amp;t=1</source>
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <article-title>[8] Астраханский государственный университет. Результаты научной деятельности</article-title>
          . http://science.aspu.ru
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Guskov</surname>
            <given-names>A.E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zhizhimov</surname>
            <given-names>O.L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kikhtenko</surname>
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Skachkov</surname>
            <given-names>D.M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kosyakov</surname>
            <given-names>D.</given-names>
          </string-name>
          <article-title>RuCRIS: A Pilot CERIF based System to Aggregate Heterogeneous Data</article-title>
          of Russian Research Projects // Procedia Computer Science. -
          <year>2014</year>
          . - Vol.
          <volume>33</volume>
          . - P.
          <fpage>163</fpage>
          -
          <lpage>167</lpage>
          . - ISSN 1877-
          <volume>0509</volume>
          . - http://www.sciencedirect.com/science/article/ pii/S1877050914008175/pdf?md5= d74bdd8e7724f217d214b6aaff40c1eapid=
          <fpage>1</fpage>
          -
          <lpage>s2</lpage>
          .
          <fpage>0</fpage>
          -
          <lpage>S1877050914008175</lpage>
          -main.pdf
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Паринов</surname>
            <given-names>С.И.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Когаловский</surname>
            <given-names>М</given-names>
          </string-name>
          .Р.
          <article-title>Технология семантического структурирования контента научных электронных библиотек // Труды XIII Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии</article-title>
          ,
          <source>электронные коллекции» - RCDL-2011</source>
          , Воронеж,
          <fpage>19</fpage>
          -
          <lpage>22</lpage>
          окт.
          <year>2011</year>
          г. - Воронеж: Воронежский государственный ун-т,
          <year>2011</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Talburt</surname>
            <given-names>J.</given-names>
          </string-name>
          <article-title>Entity resolution</article-title>
          and information quality / John R. Talburt. - San Francisco : Morgan Kaufmann/Elsevier,
          <year>2011</year>
          . - 256 p.
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Winkler</surname>
            <given-names>W.E.</given-names>
          </string-name>
          <article-title>Overview of record linkage and current research directions [Electronic resource] : tech</article-title>
          . report / W.E. Winkler ; U.S. Census Bureau,
          <source>Stat. res. div</source>
          . - Washington : [s. n.],
          <year>2006</year>
          . - 44 p. - http://www.census.gov/ srd/papers/pdf/ rrs2006-
          <fpage>02</fpage>
          .pdf
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Elmagarmid</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ipeirotis</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Verykios</surname>
            <given-names>V.</given-names>
          </string-name>
          (
          <year>2007</year>
          ).
          <article-title>Duplicate Record Detection: A survey</article-title>
          .
          <source>IEEE Transactions on Knowledge and Data Engineering</source>
          <volume>19</volume>
          (
          <issue>1</issue>
          ):
          <fpage>1</fpage>
          -
          <lpage>16</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Bilenko</surname>
            <given-names>M.</given-names>
          </string-name>
          <article-title>Learning to Combine Trained Distance Metrics for Duplicate Detection</article-title>
          in Databases / M. Bilenko,
          <string-name>
            <given-names>R.</given-names>
            <surname>Mooney</surname>
          </string-name>
          .
          <source>Technical Report AI-02-296, Artificial Intelligence Lab</source>
          , University of Texas at Austin,
          <year>2002</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [16]
          <string-name>
            <surname>Sarawagi</surname>
            <given-names>S.</given-names>
          </string-name>
          <article-title>Interactive deduplication using active learning / S. Sarawagi, A. Bhamidipat // Proceedings of the eighth ACM SIGKDD international conference on Knowledge discovery and data mining</article-title>
          . - P.
          <fpage>269</fpage>
          -
          <lpage>278</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [17]
          <string-name>
            <surname>Parinov</surname>
            <given-names>S. Open</given-names>
          </string-name>
          <article-title>Repository of Semantic Linkages</article-title>
          .
          <source>In: Proceedings of 11th International Conference on Current Research Information Systems e-Infrastructure for Research and Innovations (CRIS</source>
          <year>2012</year>
          ),
          <year>Prague 2012</year>
          , http://socionet.ru/ publication.xml?h=repec:rus:mqijxk:
          <fpage>29</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [18]
          <string-name>
            <surname>Бездушный</surname>
            <given-names>А.Н.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Кулагин</surname>
            <given-names>М</given-names>
          </string-name>
          .В.,
          <string-name>
            <surname>Серебряков</surname>
            <given-names>В</given-names>
          </string-name>
          .
          <article-title>А. и др. Предложения по наборам метаданных для научных информационных ресурсов // Вычислительные технологии</article-title>
          .
          <source>- 2005</source>
          . - T.
          <volume>10</volume>
          . - С.
          <fpage>29</fpage>
          -
          <lpage>48</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          [19]
          <string-name>
            <surname>Кулагин</surname>
            <given-names>М.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Лопатенко</surname>
            <given-names>А</given-names>
          </string-name>
          .С.
          <article-title>Научные информационные системы и электронные библиотеки. Потребность в интеграции // Сборник трудов Третьей Всероссийской конференции по электронным библиотекам</article-title>
          - RCDL'
          <year>2001</year>
          , Петрозаводск,
          <fpage>11</fpage>
          -
          <lpage>13</lpage>
          сент.
          <year>2001</year>
          г. -
          <source>С</source>
          .
          <fpage>14</fpage>
          -
          <lpage>19</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          [20]
          <string-name>
            <surname>Мазов</surname>
            <given-names>Н.А.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Гуреев</surname>
            <given-names>В</given-names>
          </string-name>
          .Н.
          <article-title>Проблемы идентификации метаданных в наукометрических базах данных Web of Knowledge, Scopus и РИНЦ на примере профилей авторов // Библиотеки и информационные ресурсы в современном мире науки, культуры, образования и бизнеса: 19-я междунар</article-title>
          .
          <source>конф. «Крым</source>
          <year>2012</year>
          » (
          <issue>Судак</issue>
          ,
          <fpage>2</fpage>
          -
          <lpage>10</lpage>
          июня
          <year>2012</year>
          г.):
          <article-title>Труды конф</article-title>
          .
          <source>- М.: Изд-во ГПНТБ России</source>
          ,
          <year>2012</year>
          . -
          <fpage>С</fpage>
          . 1-
          <fpage>4</fpage>
          . - http://www.gpntb.ru/win/inter-events/ crimea2012/disk/124.pdf
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          [21]
          <string-name>
            <surname>Гуреев</surname>
            <given-names>В.Н.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Мазов</surname>
            <given-names>Н</given-names>
          </string-name>
          .А.
          <article-title>Идентификация в информационных библиографических системах: проблемы и решения // Библиотеки и информационные ресурсы в современном мире науки, культуры, образования и бизнеса: 21-я междунар</article-title>
          .
          <source>конф. «Крым</source>
          <year>2014</year>
          » (
          <issue>Судак</issue>
          ,
          <fpage>7</fpage>
          -
          <lpage>15</lpage>
          июня
          <year>2014</year>
          г.):
          <article-title>Труды конф</article-title>
          .
          <source>- М.: Изд-во ГПНТБ России</source>
          ,
          <year>2014</year>
          . -
          <fpage>С</fpage>
          . 1-
          <fpage>7</fpage>
          . - http://www.gpntb.ru/win/interevents/crimea2014/disk/066.pdf
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          [22] CERIF. http://www.eurocris.org/ Index.php?page=CERIFreleases&amp;t=
          <fpage>1</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>[23] CERIF in Brief. http://cerifsupport.org/ cerif-in-brief/</mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          [24]
          <string-name>
            <surname>Jaro</surname>
            <given-names>M. A.</given-names>
          </string-name>
          <article-title>Advances in Record Linkage Methodology as Applied to Matching the 1985 Census of Tampa, Florida</article-title>
          .
          <source>Journal of the American Statistical Society</source>
          ,
          <volume>84</volume>
          (
          <issue>406</issue>
          ):
          <fpage>414</fpage>
          -
          <lpage>420</lpage>
          ,
          <year>1989</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref23">
        <mixed-citation>
          [25]
          <string-name>
            <surname>Hernandez</surname>
            <given-names>M. A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Stolfo</surname>
            <given-names>S. J.</given-names>
          </string-name>
          <article-title>Real-world data is dirty: data cleansing and the merge/purge problem</article-title>
          .
          <source>Journal of Data Mining and Knowledge Discovery</source>
          ,
          <volume>1</volume>
          (
          <issue>2</issue>
          ),
          <year>1998</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref24">
        <mixed-citation>
          [26]
          <string-name>
            <surname>Christen</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Churches</surname>
            <given-names>T</given-names>
          </string-name>
          . Febrl:
          <article-title>Freely extensible biomedical record linkage Manual, release 0.2.2 edition</article-title>
          , November
          <year>2003</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref25">
        <mixed-citation>
          [28]
          <string-name>
            <surname>Manning</surname>
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Raghavan</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Schütze</surname>
            <given-names>H</given-names>
          </string-name>
          . Introduction to Information Retrieval. - Cambridge University Press,
          <year>2008</year>
          . - ISBN 0-521-86571-9.
        </mixed-citation>
      </ref>
      <ref id="ref26">
        <mixed-citation>
          [29]
          <article-title>Российский коммуникативный формат (RUSMARC) [Электронный ресурс] : [сайт] / Мин-во культуры Рос</article-title>
          . Федерации, Рос. библ. ассоц.,
          <source>Нац. служба развития системы форматов RUSMARC</source>
          . http://www.rusmarc.ru/index.html
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>