<?xml version="1.0" encoding="UTF-8"?>
<TEI xml:space="preserve" xmlns="http://www.tei-c.org/ns/1.0" 
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 
xsi:schemaLocation="http://www.tei-c.org/ns/1.0 https://raw.githubusercontent.com/kermitt2/grobid/master/grobid-home/schemas/xsd/Grobid.xsd"
 xmlns:xlink="http://www.w3.org/1999/xlink">
	<teiHeader xml:lang="ru">
		<fileDesc>
			<titleStmt>
				<title level="a" type="main">Опыт идентификации персон для CRIS-систем</title>
			</titleStmt>
			<publicationStmt>
				<publisher/>
				<availability status="unknown"><licence/></availability>
			</publicationStmt>
			<sourceDesc>
				<biblStruct>
					<analytic>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">А А</forename><surname>Князева</surname></persName>
							<affiliation key="aff0">
								<orgName type="institution">Институт вычислительных технологий СО РАН</orgName>
								<address>
									<settlement>Томск</settlement>
								</address>
							</affiliation>
						</author>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">И Ю</forename><surname>Турчановский</surname></persName>
							<affiliation key="aff0">
								<orgName type="institution">Институт вычислительных технологий СО РАН</orgName>
								<address>
									<settlement>Томск</settlement>
								</address>
							</affiliation>
						</author>
						<title level="a" type="main">Опыт идентификации персон для CRIS-систем</title>
					</analytic>
					<monogr>
						<imprint>
							<date/>
						</imprint>
					</monogr>
					<idno type="MD5">9C42A23E7875DE7B65577CE218C669DA</idno>
				</biblStruct>
			</sourceDesc>
		</fileDesc>
		<encodingDesc>
			<appInfo>
				<application version="0.7.2" ident="GROBID" when="2023-03-25T05:41+0000">
					<desc>GROBID - A machine learning software for extracting information from scholarly documents</desc>
					<ref target="https://github.com/kermitt2/grobid"/>
				</application>
			</appInfo>
		</encodingDesc>
		<profileDesc>
			<abstract/>
		</profileDesc>
	</teiHeader>
	<text xml:lang="ru">
		<body>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Аннотация</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="1">Введение</head><p>Разработка информационных систем (ИС), предназначенных для сбора и хранения информации о результатах научной деятельности, в настоящее время крайне актуальна <ref type="bibr" target="#b0">[1]</ref>. К таким системам относятся научные сети (например, Scopus [2], Web of Science [3], ResearchGate <ref type="bibr" target="#b1">[4]</ref>, SciVerse [5], Cross-Ref <ref type="bibr">[6]</ref>), и целый класс информационных систем CRIS (Current Research Information Systems) <ref type="bibr" target="#b2">[7]</ref>. Предметом рассмотрения в данной работе будут CRIS-системы.</p><p>С Использование семантических связей при создании и отображении CERIF-документов рассматривается также в работах С.И. Паринова <ref type="bibr" target="#b12">[17]</ref>.</p><p>Вопросы интеграции информационных ресурсов, формирования наборов метаданных и онтологий для научных информационных ресурсов рассматриваются в работах А.Н. Бездушного, М.В. Кулагина, В.А. Серебрякова и др. <ref type="bibr" target="#b13">[18,</ref><ref type="bibr" target="#b14">19]</ref>.</p><p>Задача создания собственной CRIS-системы, в которой производится идентификация персон, рассматривается также в работах А.С. Умарова и др. <ref type="bibr" target="#b0">[1]</ref>.</p><p>Различные </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.2">Описание задачи идентификации</head><p>Имеется несколько независимых источников, содержащие данные о научно-исследовательской деятельности. Данные из источников агрегируются в выделенную базу данных (репозиторий). Агрегированные данные могут содержать дублетное описание базовых сущностей, т.е. описывать один объект реального мира в различных вариантах. Это отражается на качестве поиска, так как результаты поиска документов, относящихся к отдельной сущности, не будут достаточно полными. Необходимо решить задачу идентификации объектов реального мира в данных.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.3">Варианты идентификации объектов</head><p>Идентификацию объектов реального мира можно организовать различными способами, в зависимости от наличия авторитетных данных:</p><p>1. Существует авторитетная база данных (своя или сторонняя), в ней описываются объекты, которые необходимо идентифицировать. Задача сводится к установлению связи с авторитетным документом путем указания его идентификатора.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.">Нет такой базы, необходимо создавать ее в процессе идентификации.</head><p>Первый вариант идентификации актуален для организаций, в которых существуют развитые авторитетные базы данных (библиотек, архивов) и не всегда подходит для научно-исследовательских институтов, в которых такие базы, зачастую, не сформированы на этапе разработки CRIS-систем.</p><p>Использование сторонних баз данных для идентификации сущностей может быть особенно полезным в тех случаях, когда в самих документах приводится мало информации об объекте. Тогда можно идентифицировать объект (например, персону) не столько по его описанию, сколько по его связям с другими объектами (персонами, организациями и т.п. Каждый временный авторитетный документ затем сравнивается с теми, что уже находятся в авторитетной базе данных. Если такого документа (или похожего на него) в базе нет, то он загружается в нее и перестает быть «временным». Если для временного документа был найден нечеткий дубликат, то возможны два варианта:</p><p>• Во временном документе нет новой информацииавторитетная база данных остается без изменения.</p><p>• Временный документ не противоречит найденному в базе данных, но при этом содержит часть неучтенной информациидокумент из базы данных дополняется этой новой информацией.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="4.3">Поиск подобных документов в авторитетной базе данных</head><p>Сравнение временного авторитетного документа с каждым из документов, уже содержащихся в базе данных, может оказаться неоправданно трудоемким. В частности, при работе «на лету» может потребоваться сократить количество авторитетных документов, которые будут сопоставляться с временным документом. Существует множество способов ограничить круг документов для сопоставления. Приведем некоторые из них:</p><p>1. Метод стандартных блоков выделяет документы в один блок в том случае, если они содержат идентичный блочный ключ <ref type="bibr" target="#b18">[24]</ref>. Блочные ключи формируются на основе атрибутов документов, например, первые 4 символа фамилии. Кроме того, блочный ключ может быть и составным, например, атрибут «фамилия» может сочетаться с атрибутом «год рождения». Ключи должны быть выбраны таким образом, чтобы блоки не были ни слишком большими, ни слишком мелкими. <ref type="bibr" target="#b19">[25]</ref> сортирует документы на основе сортирующего ключа и затем двигает окно фиксированного размера последовательно по всем документам. Документы внутри окна составляют пары друг с другом и включаются в список пар-кандидатов. Метод может некорректно работать в том случае, если количество документов с одним значением ключа превышает размер окна, поскольку в такой ситуации будут сравниваться не все нужные документы.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.">Метод ближайших соседей</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.">Метод</head><p>Bigram-индексирования <ref type="bibr" target="#b20">[26]</ref> предназначен для нечеткого разбиения на блоки. Основная идея заключается в том, что значения блочных ключей конвертируются в лист биграм (подстрок, состоящих из двух символов) и затем из этих биграм формируются списки на основе заданного порога (например, выбираются все документы, в которых встречается 80% биграм).</p><p>В рамках данной работы использовался метод Bigram-индексирования на основе фамилии персоны на русском языке. Использование этого метода позволяет найти документы с опечатками в фамилии, что позволяет повысить качество идентификации.</p><p>Результаты поиска выдаются в порядке релевантности, то есть в начале списка результатов помещаются документы с точным соответствием (если они есть), а затем все менее и менее похожие (в смысле совпадения по фамилии). Таким образом, ограничение круга документов задается путем установления порога, после которого документы признаются слишком отличающимися и не передаются для более подробного анализа.</p><p>В нашей работе такой порог был установлен с помощью расстояния редактирования Левенштейна <ref type="bibr" target="#b21">[27]</ref>. Документы с различием в фамилии больше чем в 2 символа считались непохожими исключались из дальнейшего рассмотрения. Оставшиеся документы, являющиеся потенциальными дубликатами рассматриваемого документа, формируют множество документов для сравнения.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="4.4">Описание процедуры сравнения документов</head><p>Рассмотрим более подробно процедуру сравнения временного авторитетного документа с документами из множества для сравнения.</p><p>Прежде всего производится вычисление строгого соответствия для всех полей документа. В зависимости от результатов сравнения возможны следующие варианты: </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5">Оценка качества идентификации</head><p>Оценивать качество идентификации персон в рамках данной работы предлагается с помощью широко распространенных показателей: полноты и точности <ref type="bibr" target="#b22">[28]</ref>.</p><p>Показатель </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Литература</head></div><figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_1"><head>Обзор работ в области идентификации объектов</head><label></label><figDesc></figDesc><table><row><cell cols="4">Перечисленные адачи актуальны для широкого з</cell><cell></cell></row><row><cell cols="4">диапазона ресурс , распределенных локальных. ов и</cell><cell></cell></row><row><cell cols="4">В самых разноо азных данных час встречаются бр то</cell><cell></cell></row><row><cell cols="4">упоминания одних и тех же объектов реального</cell><cell></cell></row><row><cell cols="4">мира, которые необходимо связывать между собой</cell><cell></cell></row><row><cell cols="4">для обеспечения более качественной работы с</cell><cell></cell></row><row><cell cols="4">информацией. В частности, в нашей работе</cell><cell></cell></row><row><cell cols="4">используются методы нечеткого сопоставления</cell><cell></cell></row><row><cell cols="4">строк и общие принципы связывания документов.</cell><cell></cell></row><row><cell cols="4">2 Для идентификации объектов в CRIS-системах в</cell><cell></cell></row><row><cell cols="4">настоящее время используется подход, основанный</cell><cell></cell></row><row><cell cols="4">на принципах LOD 2 . Он позволяет использовать</cell><cell></cell></row><row><cell cols="4">собственные идентификаторы, которые при этом</cell><cell></cell></row><row><cell cols="4">становятся внешними. Созданные идентификаторы</cell><cell></cell></row><row><cell cols="4">могут однозначно разрешаться и сторонними системами благодаря использованию механизма URI. Такой подход разрабатывается в рамках проекта CERIF-Linked-Data 3 . В дальнейшем связать данные CRIS-систем, преобразованные в соответствии с принципами LOD, можно связать с другими источниками LOD (например, библиографическими) с помощью инструмента автоматического установления RDF-ссылок Silk 4 .</cell><cell cols="2">рамками. В EuroCRIS более 300 делегатов из 43 стран. Членами данной организации являются пять российских организаций: Центральный экономико-математический институт РАН, Институт вычислительных технологий СО РАН, Институт нефтегазовой геологии и геофизики им. А.А. Трофимука СО РАН, Уральский федеральный университет и Научная библиотека «КиберЛенинка». Разработкой CRIS-систем</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">занимаются также Астраханский государственный</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">университет [8], Институт математики и механики</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">им. Н.Н. Красовского</cell><cell>УрО</cell><cell>РАН,</cell><cell>Институт</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">вычислительных технологий СО РАН [9] и другие.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Существуют также системы, взаимодействующие с</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">локальными CRIS-системами и расширяющие их</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">функциональность. В качестве примера можно</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">привести систему, разрабатываемую в среде</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">крупного отечественного онлайнового научно-</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">образовательного пространства, поддерживаемого</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">системой Соционет [10, 11].</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Исходя из широкого диапазона пользователей</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">возникает</cell><cell>необходимость</cell><cell>учета</cell><cell>самой</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">разнообразной</cell><cell>научно-исследовательской</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">информации, а также и большой набор требований к</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">CRIS-системам.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>В</cell><cell>данной</cell><cell>статье</cell><cell>описывается</cell><cell>система</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">идентификации персон, которая разрабатывалась в</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">рамках создания системы агрегирования данных по</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">научным проектам в Институте вычислительных</cell></row><row><cell cols="4">2000 года существует организация EuroCRIS, объединяющая разработчиков и исследователей ИС текущих исследований в странах Европейского Союза. EuroCRIS занимается созданием и поддержкой стандартов и методологий создания CRIS-систем.</cell><cell cols="2">технологий СО РАН 1 . Задача идентификации персон в данных CRIS-систем, объединенных в единый репозитори , близка к задачам идентификации сущностей (entity identification) [12], установления связей (record linkage) [13], выявления дубликатов (duplicate detection) [14-16].</cell></row><row><cell cols="4">В настоящее время распространение CRIS-</cell><cell></cell></row><row><cell>систем</cell><cell>не</cell><cell>ограничивается</cell><cell>географическими</cell><cell></cell></row></table><note>й 1 Работа выполнена при финансовой поддержке Министерства образования и науки Российской Федерации (Государственный контракт № 14.521.11.0004 от 14.08.2013 «Разработка системы агрегирования данных по научным проектам из различных источников для обеспечения мониторинга реализации мероприятий и программ», шифр 2013-2.1-14-521-0017-002). Труды 16-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» -RCDL-2014, Дубна, Россия, 13-16 октября 2014 г.</note></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_2"><head>3 Постановка задачи 3.1 Источники данных</head><label></label><figDesc>Российский гуманитарный научный фонд (РГНФ), ФГБНУ «Дирекция научнотехнических программ», Национальный фонд подготовки кадров, ООО «Инконсалт», ФГАНУ «Центр информационных технологий и систем органов исполнительной власти».</figDesc><table><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">объединяет данные по научным проектам</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>нескольких</cell><cell>организаций:</cell><cell>ФГБНУ</cell><cell>«Научно-</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">исследовательский институт -Республиканский</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">исследовательский научно-консультационный центр</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">экспертизы», Российский фонд фундаментальных</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">исследований (РФФИ),</cell></row><row><cell></cell><cell cols="4">системы учета публикаций, например,</cell></row><row><cell cols="5">Scopus, Web of Science, SCIENCE INDEX (на базе</cell></row><row><cell cols="5">РИНЦ) используют различные идентификационные</cell></row><row><cell>коды</cell><cell>авторов 5 .</cell><cell>Обзор</cell><cell>различных</cell><cell>систем</cell></row><row><cell cols="5">идентификаторов и их сравнительный анализ</cell></row><row><cell cols="4">приводится в работах [20, 21].</cell><cell></cell></row><row><cell cols="5">В процессе работы использовались данные</cell></row><row><cell>Единого</cell><cell cols="2">репозитория</cell><cell>результатов</cell><cell>научно-</cell></row><row><cell cols="2">технической</cell><cell cols="2">деятельности</cell><cell>( РНТД),</cell></row><row><cell cols="5">разрабатываемого в ИВТ СО РАН. РНТД</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_3"><head>4 Идентификация персон для РНТД 4.1 Входные требования к документам</head><label></label><figDesc></figDesc><table><row><cell cols="2">В данной статье рассматривается второй вариант документ подвергается формальному контролю. На</cell><cell cols="2">данных с описаниями персон Persons и сводную</cell></row><row><cell cols="2">идентификации, этом этапе необходимо проверить его корректность при котором создаются</cell><cell cols="2">базу данных документов CERIF, для которых</cell></row><row><cell cols="2">авторитетные базы данных. Он может быть полезен с точки зрения соответствия схеме данных CERIF</cell><cell cols="2">установлены связи с соответствующими персонами.</cell></row><row><cell cols="2">в том случае, если нет готовых авторитетных баз [23]. Также возможна и проверка отдельных полей с</cell><cell></cell></row><row><cell cols="2">данных и при этом нет уверенности, что пользователи уже зарегистрированы в социальных сетях или в системах учета публикаций. Для помощью словарей допустимых значений. Далее из входного документа извлекаем определения базовых сущностей CERIF (в данной реализации данного подхода необходимо решать работе рассматривается сущность типа «Персона»). следующие задачи: 1. Формальный контроль входных данных. Извлечение означает, что создается временный авторитетный документ, в который помещается вся информация о сущности, содержащаяся во входном 2. Автоматическое формирование авторитетных документе CERIF. При этом, как правило, во баз данных, которые содержат документы, описывающие идентифицируемые объекты. 3. Авторитетный контроль входных данных входном документе упоминается более одной персоны (в проекте участвует сразу несколько исполнителей), временные документы создаются (установление связи). Предлагается технология связывания для каждой из них.</cell><cell cols="2">Источники данных } 1 2 .. n Единый репозиторий результатов научно-технической деятельности (РНТД)</cell></row><row><cell cols="2">документов, которую можно использовать для</cell><cell></cell></row><row><cell cols="2">связывания с уже существующими системами идентификаторов, при условии, что в данных системах существуют профили идентифицируемых объектов.</cell><cell>Система идентификации персон</cell><cell>Persons</cell></row><row><cell cols="2">При этом не идет речь о создании собственной</cell><cell></cell></row><row><cell cols="2">системы универсальных идентификаторов. Для</cell><cell></cell></row><row><cell cols="2">технических нужд в процессе работы используются</cell><cell></cell></row><row><cell>исключительно документов и объектов. внутренние</cell><cell>идентификаторы</cell><cell>Сводная БД (CERIF)</cell></row><row><cell>3.4 Формат данных</cell><cell></cell><cell></cell></row><row><cell cols="2">Данные, используемые в работе, поступают в виде документов в формате CERIF 6 . Данный формат</cell><cell cols="2">Рис. 1. Взаимодействие системы идентификации персон и РНТД</cell></row><row><cell cols="2">является официальной рекомендацией для членов Европейской комиссии (European Commission). Он определяет набор обязательных и дополнительных полей, которые должны использоваться для описания научных проектов, в том числе название проекта, краткое описание, описание участников, наименование финансирующей организации и т.п. В качестве дополнительной информации могут быть указаны ссылки на другие проекты и на публикации в рамках данного проекта [22].</cell><cell cols="2">Основные придерживались идентификации сущностей: принципы, при разработке которых • Сохранение исходных данных обеспечивает мы модели возможность возвращения входных документов к предыдущему состоянию, до того, как они были связаны. Если будет сделана ошибка при установлении связи, ее легко можно будет исправить. На практике это требование означает, что вместо того чтобы изменять документы в</cell></row><row><cell></cell><cell></cell><cell cols="2">исходной базе данных, создается новая база данных</cell></row><row><cell></cell><cell></cell><cell>с установленными связями.</cell></row><row><cell></cell><cell></cell><cell cols="2">• Использование меток содержимого, т.е.</cell></row><row><cell cols="2">К следующие требования: входным документам • документы должны требованиям формата CERIF; • в упоминании персоны должны быть как предъявляются соответствовать минимум указаны фамилия и первый инициал на одном из двух языков (русском или английском).</cell><cell cols="2">лексем, которые несут смысловую нагрузку и описывают данные. Этот принцип позволяет получать данные из системы без изменений (в их первоначальном виде) и, в то же время, при необходимости осуществлять более сложную навигацию по ним. Таким образом, мы дополняем данные и решаем проблему идентификации ). С этой точки зрения могут быть полезны социальные сети, которые активно сущностей.</cell></row><row><cell cols="2">4.2 Краткое описание алгоритма работы Место системы идентификации персон в РНТД представлено на рисунке 1. Система работает с данными РНТД, формирует авторитетную базу</cell><cell cols="2">развиваются в настоящее время, например, LinkedIn, Facebook, ВКонтакте и др. Поскольку основное В процессе обработки входных документов создается ресурс авторитетной базы, который внимание в них уделяется именно связям между объектами. Можно использовать профили пользователей для их идентификации при условии, что существует API. Этот подход представляется содержит документы с описанием персон. Авторитетные документы наполняются только той информацией, которая есть во входных данных, без привлечения сторонних источников. перспективным и будет развиваться в нашей В общем виде алгоритм работы программного дальнейшей работе. комплекса выглядит следующим образом. Входной</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_5"><head></head><label></label><figDesc>ИВТ СО РАН. Особенностью данной системы является то, что в процессе ее работы создается авторитетная база данных с описаниями персон в автоматическом режиме, без участия пользователя. Первое встреченное упоминание ложится в основу авторитетного документа, а последующие могут при необходимости дополнять этот документ. Такой подход был выбран из-за того, что при создании системы в нашем распоряжении не было готовой авторитетной базы данных. Однако допускается и возможность подключения готовой базы данных, если она доступна.В качестве формата авторитетных данных был выбран формат RUSMARC/Authorities<ref type="bibr" target="#b23">[29]</ref>, широко распространенный в библиотечном сообществе. Такой выбор позволяет в дальнейшем осуществлять простую интеграцию с библиотечными данными.</figDesc><table><row><cell>документы для поиска среди них нечетких</cell><cell>бы рассчитать количество ошибок и верно</cell></row><row><cell>дубликатов.</cell><cell>установленных связей между документами.</cell></row><row><cell>В работе модуля cfwrk предусмотрены несколько</cell><cell>При этом можно оценивать полноту и точность в</cell></row><row><cell>этапов сравнения для выявление нечетких</cell><cell>двух вариантах. Если рассматривать все возможные</cell></row><row><cell>дубликатов. При этом можно изменить функции</cell><cell>комбинации документов как потенциальные связи,</cell></row><row><cell>сравнения и использовать другие методы сравнения,</cell><cell>то в результате получим оценку метода в целом. А</cell></row><row><cell>не нарушая логики работы программного</cell><cell>если среди связей рассматривать только те, которые</cell></row><row><cell>комплекса.</cell><cell>были отобраны как потенциальные с помощью</cell></row><row><cell>Модуль cfupdate предназначен для дополнения авторитетного документа отсутствующей информацией или вариантными значениями отдельных полей. Программный комплекс cflib является</cell><cell>процедуры поиска подобных документов, то получим оценку работы механизма сопоставления документов. Второй вариант подходит в том случае, если на этапе сужения круга документов для сравнения не происходит потери нужных связей.</cell></row><row><cell>платформо-независимым и может работать под управлением различных операционных систем или</cell><cell>6 Описание программного комплекса</cell></row><row><cell>сред, включая Cygwin для MS Windows. Комплекс cflib написан на нескольких языках программирования: C, Perl и XSLT</cell><cell>6.1 Функциональное описание программного комплекса cflib</cell></row><row><cell>7 Заключение</cell><cell>В качестве системы идентификации персон (рис. 1) в данной работе выступает программный</cell></row><row><cell>В данной работе приводится описание системы идентификации персон, которая создавалась в процессе разработки Единого репозитория результатов научно-технической деятельности</cell><cell>комплекс cflib, состоящий из следующих модулей: • cfchk -проверка и коррекция входных документов, внедрение временных меток содержимого;</cell></row><row><cell>(РНТД) в Для выявления нечетких дубликатов в полноты можно рассчитать с упоминаниях персон использовались помощью следующей формулы: индексирование по биграммам и расстояние</cell><cell>• cfwrk -сравнение временного и найденного документов; • cfsearch -поиск в авторитетной базе данных; • cfupdate -дополнение документа из авторитетной базы данных. Основные модули программного комплекса cflib представлены на рисунке 2. Inbox cfsearch Persons cfchk cfwrk cfupdate Outbox</cell></row><row><cell>ive редактирования. Сравнение состоит из нескольких FalseNegat e TruePostiv e TruePostiv ecall R  , (1) этапов. При необходимости можно предусмотреть и  где TruePositive -количество верно установленных связей с созданными авторитетными документами, FalseNegative -количество упущенных связей. Точность оценивается по формуле ve FalsePosti e TruePostiv e TruePostiv ecision Pr   , (2) где FalsePositive -количество неверно установленных связей. больше вариантов сравнения документов, а также изменить используемые для сравнения методы -логика работы системы от этого не пострадает. В дальнейшей работе планируется рассмотреть различные методы сравнения документов, исследовать возможность построения обучающих выборок из документов в формате CERIF, а также использовать различные сторонние системы для идентификации персон (в частности, систему Silk).</cell><cell>Рис. 2. Основные модули программного комплекса Модуль cfchk кроме проверки входного документа на корректность также осуществляет внедрение меток содержимого, используемых для работы. К таким меткам относятся временные идентификаторы для отдельных персон, наборы биграмм и другая информация, которая понадобится при дальнейшей работе. При помещении документа в базу данных Persons он индексируется в соответствии с</cell></row><row><cell>Для расчета описанных показателей необходима тестовая выборка, на основе которой можно было</cell><cell>подготовленным профилем индексирования. В этот профиль включено индексирование по биграммам, что позволяет модулю cfsearch извлекать подобные</cell></row></table></figure>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="2" xml:id="foot_0">Linked Open Data.</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="3" xml:id="foot_1">http://code.google.com/p/cerif-linked-data/</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="4" xml:id="foot_2">Silk Link Discovery Framework -http://www4.wiwiss.fuberlin.de/bizer/silk</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="5" xml:id="foot_3">/ 5 ORCID, ResearcherID, SPIN-код соответственно.</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="6" xml:id="foot_4">CERIF -формат обмена научно-исследовательскими данными, разработанный EuroCRIS</note>
		</body>
		<back>
			<div type="annex">
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Experience of Person Identification for CRIS-Systems</head><p>Anna A. Knyazeva, Igor Y. Turchanovsky, Oleg S. Kolobov, Oleg L. Zhizhimov The system of persons identification which was created in the process of development of a unified repository of scientific and technical activities (RSTA) in ICT SB RAS is described in this paper. The principles and methods used to create the system as well as its structure are briefly described. An algorithm for establishing an authoritative database with descriptions of persons automatically, without user intervention, is given. Indexing with bigrams and editing distance were used for detecting near-duplicate references to persons.</p></div>			</div>
			<div type="references">

				<listBibl>

<biblStruct xml:id="b0">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">С</forename><surname>Умаров</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Н</forename><forename type="middle">В</forename><surname>Попова</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><surname>Зелепухина</surname></persName>
		</author>
		<title level="m">Некоторые аспекты создания информационных систем для сбора и хранения научной и наукометрической информации // Прикаспийский журнал: управление и высокие технологии</title>
				<imprint>
			<date type="published" when="2013">2013</date>
			<biblScope unit="volume">3</biblScope>
			<biblScope unit="page" from="111" to="118" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b1">
	<monogr>
		<title/>
		<author>
			<persName><surname>Researchgate</surname></persName>
		</author>
		<ptr target="http://researchgate.net" />
		<imprint/>
	</monogr>
</biblStruct>

<biblStruct xml:id="b2">
	<monogr>
		<ptr target="http://www.eurocris.org/Index.php?page=concepts_benefits&amp;t=1" />
		<title level="m">CRIS concept and CRIS benefits</title>
				<imprint/>
	</monogr>
</biblStruct>

<biblStruct xml:id="b3">
	<monogr>
		<ptr target="http://science.aspu.ru" />
		<title level="m">Астраханский государственный университет</title>
				<imprint/>
	</monogr>
	<note>Результаты научной деятельности</note>
</biblStruct>

<biblStruct xml:id="b4">
	<analytic>
		<title level="a" type="main">RuCRIS: A Pilot CERIF based System to Aggregate Heterogeneous Data of Russian Research Projects</title>
		<author>
			<persName><forename type="first">A</forename><forename type="middle">E</forename><surname>Guskov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">O</forename><forename type="middle">L</forename><surname>Zhizhimov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">V</forename><surname>Kikhtenko</surname></persName>
		</author>
		<author>
			<persName><forename type="first">D</forename><forename type="middle">M</forename><surname>Skachkov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">D</forename><surname>Kosyakov</surname></persName>
		</author>
		<ptr target="http://www.sciencedirect.com/science/article/pii/S1877050914008175/pdf?md5=d74bdd8e7724f217d214b6aaff40c1eapid=1-s2.0-S1877050914008175-main.pdf" />
	</analytic>
	<monogr>
		<title level="j">Procedia Computer Science</title>
		<idno type="ISSN">1877-0509</idno>
		<imprint>
			<biblScope unit="volume">33</biblScope>
			<biblScope unit="page" from="163" to="167" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b5">
	<monogr>
		<author>
			<persName><forename type="first">С</forename><forename type="middle">И</forename><surname>Паринов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">М</forename><surname>Когаловский</surname></persName>
		</author>
		<title level="m">Технология семантического структурирования контента научных электронных библиотек // Труды XIII Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» -RCDL-2011</title>
				<meeting><address><addrLine>Воронеж</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2011">19-22 окт. 2011. 2011</date>
		</imprint>
		<respStmt>
			<orgName>Воронежский государственный</orgName>
		</respStmt>
	</monogr>
	<note>ун-т</note>
</biblStruct>

<biblStruct xml:id="b6">
	<monogr>
		<title level="m" type="main">Классификация и использование семантических связей между информационными объектами в научных электронных библиотеках // Информатика и ее применения</title>
		<author>
			<persName><forename type="first">М</forename><forename type="middle">Р</forename><surname>Когаловский</surname></persName>
		</author>
		<author>
			<persName><forename type="first">С</forename><surname>Паринов</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2012">2012</date>
			<biblScope unit="volume">6</biblScope>
			<biblScope unit="page" from="31" to="41" />
		</imprint>
	</monogr>
	<note>вып. 3</note>
</biblStruct>

<biblStruct xml:id="b7">
	<monogr>
		<author>
			<persName><forename type="first">J</forename><surname>Talburt</surname></persName>
		</author>
		<title level="m">Entity resolution and information quality</title>
				<editor>
			<persName><forename type="first">John</forename><forename type="middle">R</forename><surname>Talburt</surname></persName>
		</editor>
		<meeting><address><addrLine>San Francisco</addrLine></address></meeting>
		<imprint>
			<publisher>Morgan Kaufmann/Elsevier</publisher>
			<date type="published" when="2011">2011</date>
			<biblScope unit="page">256</biblScope>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b8">
	<analytic>
		<title level="a" type="main">Overview of record linkage and current research directions</title>
		<author>
			<persName><forename type="first">W</forename><forename type="middle">E</forename><surname>Winkler</surname></persName>
		</author>
		<idno>-44</idno>
		<ptr target="http://www.census.gov/srd/papers/pdf/rrs2006-02.pdf" />
	</analytic>
	<monogr>
		<title level="m">Electronic resource</title>
				<editor>
			<persName><forename type="first">W</forename><forename type="middle">E</forename><surname>Winkler</surname></persName>
		</editor>
		<editor>
			<persName><forename type="first">U</forename><forename type="middle">S</forename><surname>Census</surname></persName>
		</editor>
		<editor>
			<persName><surname>Bureau</surname></persName>
		</editor>
		<meeting><address><addrLine>Washington</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2006">2006</date>
		</imprint>
	</monogr>
	<note type="report_type">tech. report</note>
	<note>Stat. res. div</note>
</biblStruct>

<biblStruct xml:id="b9">
	<analytic>
		<title level="a" type="main">Duplicate Record Detection: A survey</title>
		<author>
			<persName><forename type="first">A</forename><surname>Elmagarmid</surname></persName>
		</author>
		<author>
			<persName><forename type="first">P</forename><surname>Ipeirotis</surname></persName>
		</author>
		<author>
			<persName><forename type="first">V</forename><surname>Verykios</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="j">IEEE Transactions on Knowledge and Data Engineering</title>
		<imprint>
			<biblScope unit="volume">19</biblScope>
			<biblScope unit="issue">1</biblScope>
			<biblScope unit="page" from="1" to="16" />
			<date type="published" when="2007">2007</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b10">
	<monogr>
		<title level="m" type="main">Learning to Combine Trained Distance Metrics for Duplicate Detection in Databases</title>
		<author>
			<persName><forename type="first">M</forename><surname>Bilenko</surname></persName>
		</author>
		<idno>AI-02-296</idno>
		<editor>M. Bilenko, R. Mooney</editor>
		<imprint>
			<date type="published" when="2002">2002</date>
		</imprint>
		<respStmt>
			<orgName>Artificial Intelligence Lab, University of Texas at Austin</orgName>
		</respStmt>
	</monogr>
	<note type="report_type">Technical Report</note>
</biblStruct>

<biblStruct xml:id="b11">
	<analytic>
		<title level="a" type="main">Interactive deduplication using active learning / S. Sarawagi, A. Bhamidipat</title>
		<author>
			<persName><forename type="first">S</forename><surname>Sarawagi</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proceedings of the eighth ACM SIGKDD international conference on Knowledge discovery and data mining</title>
				<meeting>the eighth ACM SIGKDD international conference on Knowledge discovery and data mining</meeting>
		<imprint>
			<biblScope unit="page" from="269" to="278" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b12">
	<analytic>
		<title level="a" type="main">Open Repository of Semantic Linkages</title>
		<author>
			<persName><forename type="first">S</forename><surname>Parinov</surname></persName>
		</author>
		<ptr target="http://socionet.ru/publication.xml?h=repec:rus:mqijxk:29" />
	</analytic>
	<monogr>
		<title level="m">Proceedings of 11th International Conference on Current Research Information Systems e-Infrastructure for Research and Innovations (CRIS 2012)</title>
				<meeting>11th International Conference on Current Research Information Systems e-Infrastructure for Research and Innovations (CRIS 2012)<address><addrLine>Prague</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2012">2012</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b13">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">Н</forename><surname>Бездушный</surname></persName>
		</author>
		<author>
			<persName><forename type="first">М</forename><forename type="middle">В</forename><surname>Кулагин</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><surname>Серебряков</surname></persName>
		</author>
		<idno>-T. 10</idno>
		<title level="m">и др. Предложения по наборам метаданных для научных информационных ресурсов // Вычислительные технологии</title>
				<imprint>
			<date type="published" when="2005">2005</date>
			<biblScope unit="page" from="29" to="48" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b14">
	<analytic>
		<author>
			<persName><forename type="first">М</forename><forename type="middle">В</forename><surname>Кулагин</surname></persName>
		</author>
		<author>
			<persName><forename type="first">А</forename><surname>Лопатенко</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">С. Научные информационные системы и электронные библиотеки. Потребность в интеграции // Сборник трудов Третьей Всероссийской конференции по электронным библиотекам -RCDL&apos;2001</title>
				<imprint>
			<date type="published" when="2001">2001</date>
			<biblScope unit="page" from="14" to="19" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b15">
	<monogr>
		<author>
			<persName><forename type="first">Н</forename><forename type="middle">А</forename><surname>Мазов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><surname>Гуреев</surname></persName>
		</author>
		<idno>-4</idno>
		<ptr target="http://www.gpntb.ru/win/inter-events/crimea2012/disk/124.pdf" />
		<title level="m">Проблемы идентификации метаданных в наукометрических базах данных Web of Knowledge, Scopus и РИНЦ на примере профилей авторов // Библиотеки и информационные ресурсы в современном мире науки, культуры, образования и бизнеса: 19-я междунар. конф. «Крым 2012</title>
				<editor>
			<persName><forename type="first">Труды</forename><surname>Конф</surname></persName>
		</editor>
		<imprint>
			<date type="published" when="2012">2-10 июня 2012. 2012</date>
			<biblScope unit="page">1</biblScope>
		</imprint>
	</monogr>
	<note>Изд-во ГПНТБ России</note>
</biblStruct>

<biblStruct xml:id="b16">
	<monogr>
		<author>
			<persName><forename type="first">В</forename><forename type="middle">Н</forename><surname>Гуреев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Н</forename><surname>Мазов</surname></persName>
		</author>
		<ptr target="http://www.gpntb.ru/win/inter-events/crimea2014/disk/066.pdf" />
		<title level="m">Идентификация в информационных библиографических системах: проблемы и решения // Библиотеки и информационные ресурсы в современном мире науки, культуры, образования и бизнеса: 21-я междунар. конф. «Крым 2014</title>
				<editor>
			<persName><forename type="first">Труды</forename><surname>Конф</surname></persName>
		</editor>
		<imprint>
			<date type="published" when="2014">7-15 июня 2014. 2014</date>
			<biblScope unit="page" from="1" to="7" />
		</imprint>
	</monogr>
	<note>Изд-во ГПНТБ России</note>
</biblStruct>

<biblStruct xml:id="b17">
	<monogr>
		<ptr target="http://cerifsupport.org/cerif-in-brief/" />
		<title level="m">CERIF in Brief</title>
				<imprint/>
	</monogr>
</biblStruct>

<biblStruct xml:id="b18">
	<analytic>
		<title level="a" type="main">Advances in Record Linkage Methodology as Applied to Matching the 1985 Census of Tampa, Florida</title>
		<author>
			<persName><forename type="first">M</forename><forename type="middle">A</forename><surname>Jaro</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="j">Journal of the American Statistical Society</title>
		<imprint>
			<biblScope unit="volume">84</biblScope>
			<biblScope unit="issue">406</biblScope>
			<biblScope unit="page" from="414" to="420" />
			<date type="published" when="1989">1989</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b19">
	<analytic>
		<title level="a" type="main">Real-world data is dirty: data cleansing and the merge/purge problem</title>
		<author>
			<persName><forename type="first">M</forename><forename type="middle">A</forename><surname>Hernandez</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><forename type="middle">J</forename><surname>Stolfo</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="j">Journal of Data Mining and Knowledge Discovery</title>
		<imprint>
			<biblScope unit="volume">1</biblScope>
			<biblScope unit="issue">2</biblScope>
			<date type="published" when="1998">1998</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b20">
	<monogr>
		<author>
			<persName><forename type="first">Christen</forename><forename type="middle">P</forename><surname>Churches</surname></persName>
		</author>
		<author>
			<persName><forename type="first">T</forename></persName>
		</author>
		<title level="m">Febrl: Freely extensible biomedical record linkage Manual</title>
				<imprint>
			<date type="published" when="2003-11">November 2003</date>
		</imprint>
	</monogr>
	<note>release 0.2.2 edition</note>
</biblStruct>

<biblStruct xml:id="b21">
	<analytic>
		<author>
			<persName><forename type="first">В</forename><surname>Левенштейн</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Двоичные коды с исправлением выпадений, вставок и замещений символов // Докл</title>
				<imprint>
			<date type="published" when="1965">1965</date>
			<biblScope unit="volume">163</biblScope>
			<biblScope unit="page" from="845" to="848" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b22">
	<monogr>
		<title level="m" type="main">Introduction to Information Retrieval</title>
		<author>
			<persName><forename type="first">C</forename><surname>Manning</surname></persName>
		</author>
		<author>
			<persName><forename type="first">P</forename><surname>Raghavan</surname></persName>
		</author>
		<author>
			<persName><forename type="first">H</forename><surname>Schütze</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2008">2008</date>
			<publisher>Cambridge University Press</publisher>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b23">
	<monogr>
		<author>
			<persName><surname>Федерации</surname></persName>
		</author>
		<ptr target="http://www.rusmarc.ru/index.html" />
		<title level="m">Нац. служба развития системы форматов RUSMARC</title>
				<imprint/>
	</monogr>
	<note>Российский коммуникативный формат (RUSMARC)</note>
</biblStruct>

				</listBibl>
			</div>
		</back>
	</text>
</TEI>
