=Paper= {{Paper |id=Vol-1297/132-138_paper-20 |storemode=property |title=Опыт идентификации персон для CRIS-систем (Experience of Person Identification for CRIS-Systems) |pdfUrl=https://ceur-ws.org/Vol-1297/132-138_paper-20.pdf |volume=Vol-1297 |dblpUrl=https://dblp.org/rec/conf/rcdl/KnyazevaTKZ14 }} ==Опыт идентификации персон для CRIS-систем (Experience of Person Identification for CRIS-Systems) == https://ceur-ws.org/Vol-1297/132-138_paper-20.pdf
            Опыт идентификации персон для CRIS-систем

                © А.А. Князева                         © И.Ю. Турчановский
                    Институт вычислительных технологий СО РАН, Томск
              aknjazeva@ict.nsc.ru                         tur@hcei.tsc.ru

              © О.С. Колобов                                                  О.Л. Жижимов
    Институт сильноточной электроники                              Институт вычислительных технологий
              СО РАН, Томск                                               СО РАН, Новосибирск
           okolobov@hcei.tsc.ru                                              zhizhim@mail.ru



                                                               рамками. В EuroCRIS более 300 делегатов из
                   Аннотация                                   43 стран. Членами данной организации являются
                                                               пять российских организаций: Центральный
    В данной работе приводится описание
    системы идентификации персон, которая                      экономико-математический          институт       РАН,
                                                               Институт вычислительных технологий СО РАН,
    создавалась в процессе разработки Единого
    репозитория        результатов     научно-                 Институт нефтегазовой геологии и геофизики
    технической деятельности (РНТД) в ИВТ                      им. А.А. Трофимука      СО       РАН,      Уральский
                                                               федеральный университет и Научная библиотека
    СО РАН. Кратко описываются принципы и
    методы, используемые при создании                          «КиберЛенинка».       Разработкой         CRIS-систем
    системы, а также ее структура. Описан                      занимаются также Астраханский государственный
                                                               университет [8], Институт математики и механики
    алгоритм создания авторитетной базы
    данных     с     описаниями    персон    в                 им. Н.Н. Красовского     УрО       РАН,     Институт
    автоматическом режиме, без участия                         вычислительных технологий СО РАН [9] и другие.
                                                               Существуют также системы, взаимодействующие с
    пользователя. Для выявления нечетких
    дубликатов     в     упоминаниях    персон                 локальными CRIS-системами и расширяющие их
    использовались       индексирование     по                 функциональность. В качестве примера можно
                                                               привести систему, разрабатываемую в среде
    биграммам и расстояние редактирования.
                                                               крупного отечественного онлайнового научно-
1 Введение                                                     образовательного пространства, поддерживаемого
                                                               системой Соционет [10, 11].
   Разработка информационных систем (ИС),                         Исходя из широкого диапазона пользователей
предназначенных для сбора и хранения информации                возникает     необходимость          учета      самой
о результатах научной деятельности, в настоящее                разнообразной             научно-исследовательской
время крайне актуальна [1]. К таким системам                   информации, а также и большой набор требований к
относятся научные сети (например, Scopus [2], Web              CRIS-системам.
of Science [3], ResearchGate [4], SciVerse [5], Cross-
                                                                  В    данной    статье    описывается       система
Ref [6]), и целый класс информационных систем
                                                               идентификации персон, которая разрабатывалась в
CRIS (Current Research Information Systems) [7].
                                                               рамках создания системы агрегирования данных по
Предметом рассмотрения в данной работе будут
                                                               научным проектам в Институте вычислительных
CRIS-системы.
                                                               технологий СО РАН 1 . Задача идентификации
   С 2000 года существует организация EuroCRIS,                персон в данных CRIS-систем, объединенных в
объединяющая разработчиков и исследователей ИС                 единый     репозиторий,     близка       к    задачам
текущих исследований в странах Европейского                    идентификации сущностей (entity identification) [12],
Союза. EuroCRIS занимается созданием и                         установления связей (record linkage) [13], выявления
поддержкой стандартов и методологий создания                   дубликатов     (duplicate      detection)     [14–16].
CRIS-систем.
   В настоящее время распространение CRIS-
                                                               1
систем    не     ограничивается     географическими             Работа выполнена при финансовой поддержке
                                                               Министерства образования и науки Российской
Труды 16-й Всероссийской научной конференции                   Федерации (Государственный контракт № 14.521.11.0004
«Электронные библиотеки: перспективные методы и                от 14.08.2013 «Разработка системы агрегирования данных
технологии, электронные коллекции» — RCDL-2014,                по научным проектам из различных источников для
Дубна, Россия, 13–16 октября 2014 г.                           обеспечения мониторинга реализации мероприятий и
                                                               программ», шифр 2013-2.1-14-521-0017-002).



                                                         132
Перечисленные задачи актуальны для широкого                      объединяет данные по научным проектам
диапазона ресурсов, распределенных и локальных.                  нескольких    организаций:   ФГБНУ     «Научно-
В самых разнообразных данных часто встречаются                   исследовательский институт – Республиканский
упоминания одних и тех же объектов реального                     исследовательский научно-консультационный центр
мира, которые необходимо связывать между собой                   экспертизы», Российский фонд фундаментальных
для обеспечения более качественной работы с                      исследований (РФФИ), Российский гуманитарный
информацией. В частности, в нашей работе                         научный фонд (РГНФ), ФГБНУ «Дирекция научно-
используются методы нечеткого сопоставления                      технических программ», Национальный фонд
строк и общие принципы связывания документов.                    подготовки кадров, ООО «Инконсалт», ФГАНУ
                                                                 «Центр информационных технологий и систем
2 Обзор работ в области идентификации                            органов исполнительной власти».
объектов                                                         3.2 Описание задачи идентификации
    Для идентификации объектов в CRIS-системах в                    Имеется несколько независимых источников,
настоящее время используется подход, основанный                  содержащие данные о научно-исследовательской
на принципах LOD 2 . Он позволяет использовать                   деятельности. Данные из источников агрегируются
собственные идентификаторы, которые при этом                     в выделенную базу данных (репозиторий).
становятся внешними. Созданные идентификаторы                    Агрегированные данные могут содержать дублетное
могут однозначно разрешаться и сторонними                        описание базовых сущностей, т.е. описывать один
системами благодаря использованию механизма                      объект реального мира в различных вариантах. Это
URI. Такой подход разрабатывается в рамках                       отражается на качестве поиска, так как результаты
проекта CERIF-Linked-Data 3 . В дальнейшем связать               поиска документов, относящихся к отдельной
данные       CRIS-систем,     преобразованные     в              сущности, не будут достаточно полными.
соответствии с принципами LOD, можно связать с                   Необходимо     решить     задачу   идентификации
другими       источниками       LOD      (например,              объектов реального мира в данных.
библиографическими) с помощью инструмента
автоматического установления RDF-ссылок Silk 4 .                 3.3 Варианты идентификации объектов
    Использование семантических связей при
                                                                    Идентификацию объектов реального мира можно
создании и отображении CERIF-документов
                                                                 организовать различными способами, в зависимости
рассматривается также в работах С.И. Паринова
                                                                 от наличия авторитетных данных:
[17].
                                                                    1. Существует авторитетная база данных (своя
    Вопросы интеграции информационных ресурсов,
                                                                 или сторонняя), в ней описываются объекты,
формирования наборов метаданных и онтологий для
                                                                 которые необходимо идентифицировать. Задача
научных            информационных          ресурсов
                                                                 сводится к установлению связи с авторитетным
рассматриваются в работах А.Н. Бездушного,
                                                                 документом путем указания его идентификатора.
М.В. Кулагина, В.А. Серебрякова и др. [18, 19].
                                                                    2. Нет такой базы, необходимо создавать ее в
    Задача создания собственной CRIS-системы, в
                                                                 процессе идентификации.
которой производится идентификация персон,
рассматривается также в работах А.С. Умарова и др.                  Первый вариант идентификации актуален для
[1].                                                             организаций, в которых существуют развитые
                                                                 авторитетные базы данных (библиотек, архивов) и
     Различные системы учета публикаций, например,
                                                                 не всегда подходит для научно-исследовательских
Scopus, Web of Science, SCIENCE INDEX (на базе
                                                                 институтов, в которых такие базы, зачастую, не
РИНЦ) используют различные идентификационные
                                                                 сформированы на этапе разработки CRIS-систем.
коды      авторов 5 . Обзор    различных     систем
идентификаторов и их сравнительный анализ                           Использование сторонних баз данных для
приводится в работах [20, 21].                                   идентификации сущностей может быть особенно
                                                                 полезным в тех случаях, когда в самих документах
3 Постановка задачи                                              приводится мало информации об объекте. Тогда
                                                                 можно идентифицировать объект (например,
3.1 Источники данных                                             персону) не столько по его описанию, сколько по
                                                                 его связям с другими объектами (персонами,
   В процессе работы использовались данные                       организациями и т.п.). С этой точки зрения могут
Единого    репозитория    результатов научно-                    быть полезны социальные сети, которые активно
технической        деятельности       (РНТД),                    развиваются в настоящее время, например, LinkedIn,
разрабатываемого в ИВТ СО РАН. РНТД                              Facebook, ВКонтакте и др. Поскольку основное
                                                                 внимание в них уделяется именно связям между
2                                                                объектами.     Можно     использовать    профили
  Linked Open Data.
3                                                                пользователей для их идентификации при условии,
  http://code.google.com/p/cerif-linked-data/
4                                                                что существует API. Этот подход представляется
  Silk Link Discovery Framework – http://www4.wiwiss.fu-
                                                                 перспективным и будет развиваться в нашей
berlin.de/bizer/silk/
5                                                                дальнейшей работе.
  ORCID, ResearcherID, SPIN-код соответственно.



                                                           133
   В данной статье рассматривается второй вариант          данных с описаниями персон Persons и сводную
идентификации,      при    котором      создаются          базу данных документов CERIF, для которых
авторитетные базы данных. Он может быть полезен            установлены связи с соответствующими персонами.
в том случае, если нет готовых авторитетных баз
данных и при этом нет уверенности, что
пользователи уже зарегистрированы в социальных                           Источники данных




                                                                    }
сетях или в системах учета публикаций. Для
реализации данного подхода необходимо решать
следующие задачи:
   1. Формальный контроль входных данных.                            1            2         .. n
   2. Автоматическое формирование авторитетных
баз данных, которые содержат документы,
описывающие идентифицируемые объекты.
                                                                   Единый репозиторий результатов
   3. Авторитетный контроль входных данных                         научно-технической деятельности
(установление связи).                                                          (РНТД)
   Предлагается       технология       связывания
документов, которую можно использовать для
связывания с уже существующими системами
идентификаторов, при условии, что в данных                                   Система
системах существуют профили идентифицируемых                              идентификации        Persons
объектов.                                                                      персон
   При этом не идет речь о создании собственной
системы универсальных идентификаторов. Для
технических нужд в процессе работы используются
исключительно      внутренние    идентификаторы                              Сводная БД
документов и объектов.
                                                                               (CERIF)
3.4 Формат данных
                                                            Рис. 1. Взаимодействие системы идентификации
   Данные, используемые в работе, поступают в
                                                                            персон и РНТД
виде документов в формате CERIF 6 . Данный формат
является официальной рекомендацией для членов
Европейской комиссии (European Commission). Он                 Основные     принципы,       которых       мы
                                                           придерживались     при      разработке     модели
определяет набор обязательных и дополнительных
полей, которые должны использоваться для                   идентификации сущностей:
описания научных проектов, в том числе название                • Сохранение исходных данных обеспечивает
проекта, краткое описание, описание участников,            возможность возвращения входных документов к
наименование финансирующей организации и т.п. В            предыдущему состоянию, до того, как они были
качестве дополнительной информации могут быть              связаны. Если будет сделана ошибка при
указаны ссылки на другие проекты и на публикации           установлении связи, ее легко можно будет
в рамках данного проекта [22].                             исправить. На практике это требование означает,
                                                           что вместо того чтобы изменять документы в
4 Идентификация персон для РНТД                            исходной базе данных, создается новая база данных
                                                           с установленными связями.
4.1 Входные требования к документам                            • Использование меток содержимого, т.е.
                                                           лексем, которые несут смысловую нагрузку и
   К    входным     документам      предъявляются
                                                           описывают данные. Этот принцип позволяет
следующие требования:
                                                           получать данные из системы без изменений (в их
   • документы        должны       соответствовать         первоначальном виде) и, в то же время, при
требованиям формата CERIF;                                 необходимости осуществлять более сложную
   • в упоминании персоны должны быть как                  навигацию по ним. Таким образом, мы дополняем
минимум указаны фамилия и первый инициал на                данные и решаем проблему идентификации
одном из двух языков (русском или английском).             сущностей.
                                                               В процессе обработки входных документов
4.2 Краткое описание алгоритма работы
                                                           создается ресурс авторитетной базы, который
   Место системы идентификации персон в РНТД               содержит документы с описанием персон.
представлено на рисунке 1. Система работает с              Авторитетные документы наполняются только той
данными РНТД, формирует авторитетную базу                  информацией, которая есть во входных данных, без
                                                           привлечения сторонних источников.
6
 CERIF – формат обмена научно-исследовательскими               В общем виде алгоритм работы программного
данными, разработанный EuroCRIS                            комплекса выглядит следующим образом. Входной



                                                     134
документ подвергается формальному контролю. На               документов с одним значением ключа превышает
этом этапе необходимо проверить его корректность             размер окна, поскольку в такой ситуации будут
с точки зрения соответствия схеме данных CERIF               сравниваться не все нужные документы.
[23]. Также возможна и проверка отдельных полей с                3. Метод       Bigram-индексирования       [26]
помощью словарей допустимых значений.                        предназначен для нечеткого разбиения на блоки.
   Далее из входного документа извлекаем                     Основная идея заключается в том, что значения
определения базовых сущностей CERIF (в данной                блочных ключей конвертируются в лист биграм
работе рассматривается сущность типа «Персона»).             (подстрок, состоящих из двух символов) и затем из
Извлечение означает, что создается временный                 этих биграм формируются списки на основе
авторитетный документ, в который помещается вся              заданного порога (например, выбираются все
информация о сущности, содержащаяся во входном               документы, в которых встречается 80% биграм).
документе CERIF. При этом, как правило, во                       В рамках данной работы использовался метод
входном документе упоминается более одной                    Bigram-индексирования на основе фамилии персоны
персоны (в проекте участвует сразу несколько                 на русском языке. Использование этого метода
исполнителей), временные документы создаются                 позволяет найти документы с опечатками в
для каждой из них.                                           фамилии, что позволяет повысить качество
   Каждый временный авторитетный документ                    идентификации.
затем сравнивается с теми, что уже находятся в                   Результаты поиска выдаются в порядке
авторитетной базе данных. Если такого документа              релевантности, то есть в начале списка результатов
(или похожего на него) в базе нет, то он загружается         помещаются документы с точным соответствием
в нее и перестает быть «временным». Если для                 (если они есть), а затем все менее и менее похожие
временного документа был найден нечеткий                     (в смысле совпадения по фамилии). Таким образом,
дубликат, то возможны два варианта:                          ограничение круга документов задается путем
   • Во временном документе нет новой                        установления порога, после которого документы
информации – авторитетная база данных остается               признаются слишком отличающимися и не
без изменения.                                               передаются для более подробного анализа.
   • Временный документ не противоречит                          В нашей работе такой порог был установлен с
найденному в базе данных, но при этом содержит               помощью расстояния редактирования Левенштейна
часть неучтенной информации – документ из базы               [27]. Документы с различием в фамилии больше чем
данных дополняется этой новой информацией.                   в 2 символа считались непохожими исключались из
                                                             дальнейшего рассмотрения. Оставшиеся документы,
4.3 Поиск подобных документов в авторитетной                 являющиеся        потенциальными       дубликатами
базе данных                                                  рассматриваемого        документа,      формируют
                                                             множество документов для сравнения.
   Сравнение временного авторитетного документа
с каждым из документов, уже содержащихся в базе              4.4 Описание процедуры сравнения документов
данных, может оказаться неоправданно трудоемким.
В частности, при работе «на лету» может                          Рассмотрим     более    подробно    процедуру
потребоваться сократить количество авторитетных              сравнения временного авторитетного документа с
документов, которые будут сопоставляться с                   документами из множества для сравнения.
временным документом. Существует множество                       Прежде всего производится вычисление строгого
способов ограничить круг документов для                      соответствия для всех полей документа. В
сопоставления. Приведем некоторые из них:                    зависимости от результатов сравнения возможны
   1. Метод    стандартных     блоков     выделяет           следующие варианты:
документы в один блок в том случае, если они                     1. Если все поля точно равны, делается вывод,
содержат идентичный блочный ключ [24]. Блочные               что текущий документ является точным дубликатом
ключи формируются на основе атрибутов                        найденного. Из найденного документа извлекается
документов, например, первые 4 символа фамилии.              его      идентификатор    и    возвращается   для
Кроме того, блочный ключ может быть и                        установления связи. Временный документ не
составным, например, атрибут «фамилия» может                 помещается в авторитетную базу данных.
сочетаться с атрибутом «год рождения». Ключи                     2. Если точного равенства нет, то следует
должны быть выбраны таким образом, чтобы блоки               нечеткое сравнение (см. таблицу 1). Допускается
не были ни слишком большими, ни слишком                      расхождение в одном из перечисленных полей
мелкими.                                                     (кроме поля с указанием пола):
   2. Метод ближайших соседей [25] сортирует                     (a) Если расхождение в одном поле, и не
документы на основе сортирующего ключа и затем               превышает границы, то делается вывод о нечетком
двигает     окно      фиксированного       размера           дубликате. В найденный авторитетный документ
последовательно по всем документам. Документы                вносится информация о вариантном наименовании,
внутри окна составляют пары друг с другом и                  возвращается      код    найденного     документа.
включаются в список пар-кандидатов. Метод может
некорректно работать в том случае, если количество



                                                       135
Временный авторитетный документ не помещается                       бы рассчитать количество ошибок и верно
в базу данных;                                                      установленных связей между документами.
   (b) Если не было обнаружено ни точного, ни                          При этом можно оценивать полноту и точность в
нечеткого сравнения, переходим к анализу                            двух вариантах. Если рассматривать все возможные
следующего найденного документа.                                    комбинации документов как потенциальные связи,
                                                                    то в результате получим оценку метода в целом. А
           Таблица 1. Способы сравнения
                                                                    если среди связей рассматривать только те, которые
                 Поле          Способ          Порог.               были отобраны как потенциальные с помощью
   Признак                                                          процедуры поиска подобных документов, то
                док-та        сравнения       значение
 Фамилия                                                            получим оценку работы механизма сопоставления
                200$a                                               документов. Второй вариант подходит в том случае,
 (рус. яз.)
 Фамилия                                                            если на этапе сужения круга документов для
                400$a                                               сравнения не происходит потери нужных связей.
 (англ. яз.)                Расстояние
                                                    2
 Имя                      редактирования
                200$g                                               6 Описание программного комплекса
 (рус. яз.)
 Имя
                400$g                                               6.1 Функциональное описание программного
 (англ. яз.)
                              Строгое                               комплекса cflib
 Пол            120$a                               0
                             равенство
                                                                       В качестве системы идентификации персон
 Место                    Относительное                             (рис. 1) в данной работе выступает программный
 работы        601$a        расстояние          30%                 комплекс cflib, состоящий из следующих модулей:
 (организация)            редактирования                               • cfchk – проверка и коррекция входных
                                                                    документов,      внедрение     временных     меток
   Если временный авторитетный документ прошел
                                                                    содержимого;
процедуру сравнения с каждым документом из
множества для сравнения, но при этом не было                           • cfwrk – сравнение временного и найденного
найдено ни одного строгого или нестрогого                           документов;
дубликата, то он помещается в авторитетную базу                        • cfsearch – поиск в авторитетной базе данных;
данных.                                                                • cfupdate – дополнение документа из
   Относительное     расстояние    редактирования                   авторитетной базы данных.
определяется     как     отношение      расстояния                     Основные модули программного комплекса cflib
редактирования к длине первой из двух                               представлены на рисунке 2.
сравниваемых строк.
   Пороговые     значения    были     установлены
эмпирически. В дальнейшем планируется провести                             Inbox        cfsearch      Persons
более подробное исследование для выбора
пороговых значений.

5 Оценка качества идентификации
                                                                           cfchk         cfwrk        cfupdate
   Оценивать качество идентификации персон в
рамках данной работы предлагается с помощью
широко распространенных показателей: полноты и
точности [28].
   Показатель полноты можно рассчитать с                                                Outbox
помощью следующей формулы:
                        TruePostive                                  Рис. 2. Основные модули программного комплекса
         Recall                             , (1)
                 TruePostive  FalseNegative
где TruePositive – количество верно установленных                      Модуль cfchk кроме проверки входного
связей с созданными авторитетными документами,                      документа на корректность также осуществляет
FalseNegative – количество упущенных связей.                        внедрение меток содержимого, используемых для
   Точность оценивается по формуле                                  работы. К таким меткам относятся временные
                                                                    идентификаторы для отдельных персон, наборы
                           TruePostive                              биграмм и другая информация, которая понадобится
       Precision                               ,       (2)
                     TruePostive  FalsePostive                     при дальнейшей работе.
где    FalsePositive   –   количество    неверно                       При помещении документа в базу данных
установленных связей.                                               Persons он индексируется в соответствии с
    Для расчета описанных показателей необходима                    подготовленным профилем индексирования. В этот
тестовая выборка, на основе которой можно было                      профиль включено индексирование по биграммам,
                                                                    что позволяет модулю cfsearch извлекать подобные



                                                              136
документы для поиска среди них нечетких                     Литература
дубликатов.
                                                             [1] Умаров А.С., Попова Н.В., Зелепухина В.А.
    В работе модуля cfwrk предусмотрены несколько
                                                                 Некоторые аспекты создания информационных
этапов сравнения для выявление нечетких
                                                                 систем для сбора и хранения научной и
дубликатов. При этом можно изменить функции
                                                                 наукометрической информации //
сравнения и использовать другие методы сравнения,
                                                                 Прикаспийский журнал: управление и высокие
не нарушая логики работы программного
                                                                 технологии. – 2013. – № 3 (23). – С. 111–118.
комплекса.
                                                             [2] Scopus. http://www.scopus.com
    Модуль cfupdate предназначен для дополнения
авторитетного       документа       отсутствующей            [3] Thomson Reuters Web of Science.
информацией     или     вариантными значениями                   http://thomsonreuters.com/products_services/
отдельных полей.                                                 science/science_products/a-z/ web_of_science/
                                                             [4] ResearchGate. http://researchgate.net
    Программный      комплекс     cflib    является
платформо-независимым и может работать под                   [5] SciVerse. http://www.info.sciverse.com
управлением различных операционных систем или                [6] CrossRef. http://crossref.org
сред, включая Cygwin для MS Windows. Комплекс                [7] CRIS concept and CRIS benefits.
cflib    написан      на     нескольких      языках              http://www.eurocris.org/
программирования: C, Perl и XSLT                                 Index.php?page=concepts_benefits&t=1
                                                             [8] Астраханский государственный университет.
7 Заключение                                                     Результаты научной деятельности.
   В данной работе приводится описание системы                   http://science.aspu.ru
идентификации персон, которая создавалась в                  [9] Guskov A.E., Zhizhimov O.L., Kikhtenko V.,
процессе    разработки     Единого     репозитория               Skachkov D.M., Kosyakov D. RuCRIS: A Pilot
результатов    научно-технической     деятельности               CERIF based System to Aggregate Heterogeneous
(РНТД) в ИВТ СО РАН.                                             Data of Russian Research Projects // Procedia
                                                                 Computer Science. – 2014. – Vol. 33. – P. 163–
   Особенностью данной системы является то, что в
процессе ее работы создается авторитетная база                   167. – ISSN 1877-0509. –
данных с описаниями персон в автоматическом                      http://www.sciencedirect.com/science/article/
                                                                 pii/S1877050914008175/pdf?md5=
режиме, без участия пользователя. Первое
                                                                 d74bdd8e7724f217d214b6aaff40c1eapid=
встреченное упоминание ложится в основу
                                                                 1-s2.0-S1877050914008175-main.pdf
авторитетного документа, а последующие могут при
необходимости дополнять этот документ. Такой                [10] Паринов С.И., Когаловский М.Р. Технология
подход был выбран из-за того, что при создании                   семантического структурирования контента
системы в нашем распоряжении не было готовой                     научных электронных библиотек // Труды XIII
авторитетной базы данных. Однако допускается и                   Всероссийской научной конференции
возможность подключения готовой базы данных,                     «Электронные библиотеки: перспективные
если она доступна.                                               методы и технологии, электронные коллекции»
                                                                 – RCDL-2011, Воронеж, 19–22 окт. 2011 г. –
   В качестве формата авторитетных данных был
                                                                 Воронеж: Воронежский государственный ун-т,
выбран формат RUSMARC/Authorities [29], широко
                                                                 2011.
распространенный в библиотечном сообществе.
Такой выбор позволяет в дальнейшем осуществлять             [11] Когаловский М.Р., Паринов С.И.
простую интеграцию с библиотечными данными.                      Классификация и использование
                                                                 семантических связей между
   Для выявления нечетких дубликатов в                           информационными объектами в научных
упоминаниях         персон         использовались                электронных библиотеках // Информатика и ее
индексирование по биграммам и расстояние                         применения, 2012. Т. 6, вып. 3. С. 31–41.
редактирования. Сравнение состоит из нескольких
                                                            [12] Talburt J. Entity resolution and information
этапов. При необходимости можно предусмотреть и
                                                                 quality / John R. Talburt. – San Francisco :
больше вариантов сравнения документов, а также
                                                                 Morgan Kaufmann/Elsevier, 2011. – 256 p.
изменить используемые для сравнения методы –
логика работы системы от этого не пострадает.               [13] Winkler W.E. Overview of record linkage and
                                                                 current research directions [Electronic resource] :
   В дальнейшей работе планируется рассмотреть                   tech. report / W.E. Winkler ; U.S. Census Bureau,
различные     методы     сравнения     документов,               Stat. res. div. – Washington : [s. n.], 2006. – 44 p.
исследовать возможность построения обучающих                     – http://www.census.gov/ srd/papers/pdf/
выборок из документов в формате CERIF, а также                   rrs2006-02.pdf
использовать различные сторонние системы для
                                                            [14] Elmagarmid A., Ipeirotis P., Verykios V. (2007).
идентификации персон (в частности, систему Silk).
                                                                 Duplicate Record Detection: A survey. IEEE
                                                                 Transactions on Knowledge and Data Engineering
                                                                 19(1): 1–16.




                                                      137
[15] Bilenko M. Learning to Combine Trained                          http://www.gpntb.ru/win/inter-
     Distance Metrics for Duplicate Detection in                     events/crimea2014/disk/066.pdf
     Databases / M. Bilenko, R. Mooney. Technical               [22] CERIF. http://www.eurocris.org/
     Report AI-02-296, Artificial Intelligence Lab,                  Index.php?page=CERIFreleases&t=1
     University of Texas at Austin, 2002.                       [23] CERIF in Brief. http://cerifsupport.org/
[16] Sarawagi S. Interactive deduplication using active              cerif-in-brief/
     learning / S. Sarawagi, A. Bhamidipat //                   [24] Jaro M. A. Advances in Record Linkage
     Proceedings of the eighth ACM SIGKDD                            Methodology as Applied to Matching the 1985
     international conference on Knowledge discovery                 Census of Tampa, Florida. Journal of the
     and data mining. – P. 269–278.                                  American Statistical Society, 84(406): 414–420,
[17] Parinov S. Open Repository of Semantic                          1989.
     Linkages. In: Proceedings of 11th International            [25] Hernandez M. A., Stolfo S. J. Real-world data is
     Conference on Current Research Information                      dirty: data cleansing and the merge/purge problem.
     Systems e-Infrastructure for Research and                       Journal of Data Mining and Knowledge
     Innovations (CRIS 2012), Prague 2012,                           Discovery, 1(2), 1998.
     http://socionet.ru/
                                                                [26] Christen P., Churches T. Febrl: Freely extensible
     publication.xml?h=repec:rus:mqijxk:29.
                                                                     biomedical record linkage Manual, release 0.2.2
[18] Бездушный А.Н., Кулагин М.В., Серебряков                        edition, November 2003.
     В.А. и др. Предложения по наборам
                                                                [27] Левенштейн В.И. Двоичные коды с
     метаданных для научных информационных
                                                                     исправлением выпадений, вставок и
     ресурсов // Вычислительные технологии. –
                                                                     замещений символов // Докл. Акад. наук
     2005. – T. 10. – С. 29–48.
                                                                     СССР. – 1965. – Т. 163, № 4. – С. 845–848.
[19] Кулагин М.В., Лопатенко А.С. Научные
                                                                [28] Manning C., Raghavan P., Schütze H. Introduction
     информационные системы и электронные
                                                                     to Information Retrieval. – Cambridge University
     библиотеки. Потребность в интеграции //
                                                                     Press, 2008. – ISBN 0-521-86571-9.
     Сборник трудов Третьей Всероссийской
     конференции по электронным библиотекам –                   [29] Российский коммуникативный формат
     RCDL’2001, Петрозаводск, 11–13 сент. 2001 г.                    (RUSMARC) [Электронный ресурс] : [сайт] /
     – С. 14–19.                                                     Мин-во культуры Рос. Федерации, Рос. библ.
                                                                     ассоц., Нац. служба развития системы
[20] Мазов Н.А., Гуреев В.Н. Проблемы
                                                                     форматов RUSMARC.
     идентификации метаданных в
                                                                     http://www.rusmarc.ru/index.html
     наукометрических базах данных Web of
     Knowledge, Scopus и РИНЦ на примере
     профилей авторов // Библиотеки и
                                                                     Experience of Person Identification
     информационные ресурсы в современном мире                               for CRIS-Systems
     науки, культуры, образования и бизнеса: 19-я                      Anna A. Knyazeva, Igor Y. Turchanovsky,
     междунар. конф. «Крым 2012» (Судак, 2–10                             Oleg S. Kolobov, Oleg L. Zhizhimov
     июня 2012 г.): Труды конф. – М.: Изд-во                        The system of persons identification which was
     ГПНТБ России, 2012. – С. 1–4. –                            created in the process of development of a unified
     http://www.gpntb.ru/win/inter-events/                      repository of scientific and technical activities (RSTA)
     crimea2012/disk/124.pdf                                    in ICT SB RAS is described in this paper. The
[21] Гуреев В.Н., Мазов Н.А. Идентификация в                    principles and methods used to create the system as well
     информационных библиографических                           as its structure are briefly described. An algorithm for
     системах: проблемы и решения // Библиотеки и               establishing an authoritative database with descriptions
     информационные ресурсы в современном мире                  of persons automatically, without user intervention, is
     науки, культуры, образования и бизнеса: 21-я               given. Indexing with bigrams and editing distance were
     междунар. конф. «Крым 2014» (Судак, 7–15                   used for detecting near-duplicate references to persons.
     июня 2014 г.): Труды конф. – М.: Изд-во
     ГПНТБ России, 2014. – С. 1–7. –




                                                          138