<?xml version="1.0" encoding="UTF-8"?>
<TEI xml:space="preserve" xmlns="http://www.tei-c.org/ns/1.0" 
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 
xsi:schemaLocation="http://www.tei-c.org/ns/1.0 https://raw.githubusercontent.com/kermitt2/grobid/master/grobid-home/schemas/xsd/Grobid.xsd"
 xmlns:xlink="http://www.w3.org/1999/xlink">
	<teiHeader xml:lang="ru">
		<fileDesc>
			<titleStmt>
				<title level="a" type="main">Метод обнаружения дубликатов в потоке текстовых документов</title>
			</titleStmt>
			<publicationStmt>
				<publisher/>
				<availability status="unknown"><licence/></availability>
			</publicationStmt>
			<sourceDesc>
				<biblStruct>
					<analytic>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">А М</forename><surname>Андреев</surname></persName>
						</author>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">Д В</forename><surname>Березкин</surname></persName>
						</author>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">И А</forename><surname>Козлов</surname></persName>
						</author>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">К В</forename><surname>Симаков</surname></persName>
						</author>
						<author>
							<persName><forename type="first">Мгту</forename><forename type="middle">Н Э</forename><surname>Им</surname></persName>
						</author>
						<author>
							<persName><roleName>Москва</roleName><surname>Баумана</surname></persName>
						</author>
						<title level="a" type="main">Метод обнаружения дубликатов в потоке текстовых документов</title>
					</analytic>
					<monogr>
						<imprint>
							<date/>
						</imprint>
					</monogr>
					<idno type="MD5">9213E6692252C9E12EA060918DF9670C</idno>
				</biblStruct>
			</sourceDesc>
		</fileDesc>
		<encodingDesc>
			<appInfo>
				<application version="0.7.2" ident="GROBID" when="2023-03-25T05:41+0000">
					<desc>GROBID - A machine learning software for extracting information from scholarly documents</desc>
					<ref target="https://github.com/kermitt2/grobid"/>
				</application>
			</appInfo>
		</encodingDesc>
		<profileDesc>
			<abstract>
<div xmlns="http://www.tei-c.org/ns/1.0"><p>Работа посвящена решению задачи устранения дублирующихся документов из потока текстовых сообщений. Приведена многокритериальная модель документа, предложен метод обнаружения дубликатов на основе бинарной классификации с помощью метода опорных векторов. Основной акцент сделан на обеспечении применимости метода для обработки документов из разных предметных областей. Предложен способ снижения вычислительной сложности метода посредством предварительной фильтрации кандидатов.</p></div>
			</abstract>
		</profileDesc>
	</teiHeader>
	<text xml:lang="ru">
		<body>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="1">Введение</head><p>В настоящее время во многих предметных областях существует потребность в формировании больших текстовых коллекций. При этом производится сбор текстовой информации из открытых Интернет-источников, а также специализированных ресурсов. Основной областью использования создаваемых таким образом хранилищ документов является интеллектуальная обработка текстов, которую, как правило, можно отнести к классу Text Mining.</p><p>С ростом количества разнообразных источников данных в сети Интернет (новостные сайты, блоги, социальные сети) всё более серьезной проблемой становится дублирование информации. Сообщения, публикуемые одним источником, зачастую многократно перепечатываются другими (в исходном виде или с небольшими изменениями). В результате, при выполнении автоматического сбора документов из многочисленных источников в формируемой текстовой коллекции накапливаются идентичные или близкие по содержанию документыдубликаты. В некоторых задачах наличие дубликатов должно учитыватьсянапример, при определении значимости сообщений <ref type="bibr">[14]</ref>. Но в большинстве случаев попада-ние таких документов в коллекцию снижает её качество <ref type="bibr">[12,</ref><ref type="bibr">16]</ref>.</p><p>В данной статье рассматривается решение задачи обнаружения дубликатов в потоке текстовых сообщений. Особое внимание уделяется обеспечению возможности использования разработанного метода для обработки документов из различных предметных областей.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2">Постановка задачи</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.1">Функционирование системы сбора и обработки новостной информации</head><p>В работе <ref type="bibr" target="#b7">[9]</ref> авторами было предложено решение задачи качественного автоматического сбора новостных данных из Интернет-источников, предполагающего извлечение с веб-страницы текста новости, а также сопутствующих метаданных, включающих название, дату публикации, автора новости и др. При этом осуществляется контроль корректности извлекаемой информации, то есть проверка соответствия текстов загружаемых документов исходным текстам новостей на сайте.</p><p>Текстовые данные, извлеченные с веб-сайтов, подвергаются обработке различными методами интеллектуального анализа <ref type="bibr" target="#b5">[7]</ref><ref type="bibr" target="#b6">[8]</ref>, такими как автоматическая классификация и кластеризация документов, извлечение знаний и фактов из естественноязыковых текстов, выявление трендов и прогноз развития ситуаций.</p><p>Для эффективного применения перечисленных методов обработки текстовых данных необходимо обеспечить качество анализируемой коллекции документов. Помимо вышеупомянутой корректности каждого конкретного текста, качество коллекции подразумевает требование оригинальности составляющих её новостей. Присутствие в обрабатываемом наборе одинаковых или очень близких по содержанию документов может отрицательно сказаться на качестве обработки. Это касается работы модулей, выполняющих статистический анализ документов, например, модуля анализа трендов. Его работа основана на выявлении в коллекции новостей, относящихся к анализируемой ситуации, и определении зависимости частоты встречаемости таких документов от времени. Появление дублей приведет к многократному учету модулем идентичных новостей, что повлечет за собой некорректный вид построенной зависимости.</p><p>Для обеспечения оригинальности документов, составляющих текстовую коллекцию, в систему сбора необходимо встроить подсистему, задачей которой является оперативное обнаружение и удаление из коллекции нечетких дубликатов (рис. 1).</p><p>Она должна анализировать каждый загружаемый документ и принимать решение о его оригинальности. Для этого необходимо сравнить его с загруженными ранее новостями и определить, является ли он нечетким дубликатом одной из них. При обнаружении дубля он должен быть удален до этапа загрузки данных в базу данных.</p><p>Рис. 1. Место подсистемы обнаружения дубликатов в системе автоматизированного сбора и анализа новостной информации</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.2">Особенности решаемой задачи</head><p>Если проблема обнаружения и удаления полных дублей тривиальна, то при необходимости распознавать нечеткие дубликаты (то есть, документы, имеющие различный текст, но близкие по содержанию) возникают значительные сложности.</p><p>В связи с явлением частичного дублирования в работе <ref type="bibr" target="#b8">[10]</ref> предлагается понятие информативной необходимости элемента высказывания: «Всякий частично-дублетный элемент, если он отвечает коммуникативной задаче высказывания, признается информативно-необходимым в той же мере, что и прочие, недублетные элементы речи: такой элемент информативно необходим постольку, поскольку вносит свой уникальный, неповторимый в других элементах, вклад в суммарную информацию, передаваемую высказыванием». Таким образом, задача обнаружения нечетких дубликатов состоит в распознавании и удалении сообщений, не являющихся информативно-необходимыми.</p><p>Установить информативную необходимость и ценность некоторого высказывания возможно только с учетом соответствующего ситуативного контекста. Так, при ручной проверке документов эксперт, определяя наличие или отсутствие дублирования, принимает решение с учетом предметной области и характера документов, составляющих ана-лизируемую коллекцию. Например, при работе с юридическими документами особое внимание должно уделяться метаданнымдля текстов такого типа два документа с практически идентичным содержанием, но различающимися названиями и датами публикации не могут считаться дублями. Другой подход используется при анализе экономических новостей, например, сводок о состоянии фондового рынкадубликатами не должны признаваться документы, имеющие одно и то же название и одинаковый текст, но различающиеся числовыми данными (значениями курсов валют).</p><p>Таким образом, в разных случаях эксперт сравнивает документы с точки зрения различных критериев (близость текстового содержания, сходство названий, разница во времени публикации), то есть использует различные модели распознавания дубликатов в зависимости от предметной области и контекста коммуникационных сообщений. Поэтому не представляется возможным выработать единую систему правил для обнаружения нечеткого дублирования сразу для всех случаев. Следовательно, разрабатываемая подсистема должна иметь возможность гибкой настройки на разные предметные области, что позволит ей моделировать деятельность эксперта по распознаванию дублей с использованием различных моделей. Поскольку система сбора выполняет извлечение документов из множества источников, которые относятся к различным предметным областям, необходимо обеспечить возможность работы с несколькими моделями распознавания дубликатов одновременно.</p><p>Еще одной проблемой, с которой приходится столкнуться при решении задачи устранения дубликатов, является большой объем обрабатываемых данных. Наличие в коллекции сотен тысяч документов делает весьма трудоемким анализ каждого нового сообщения путем сравнения его с каждым из ранее загруженных. Эта проблема может быть решена с помощью приближенных методов, но их применение ведет к снижению качества обнаружения дубликатов, то есть уменьшению точности и полноты <ref type="bibr">[12]</ref>. При разработке предлагаемого подхода решалась задача совмещения высокого качества и низкой вычислительной сложности проверки документов.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3">Обзор методов обнаружения дублей</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.1">Методы, основанные на использовании шинглов</head><p>Одним из наиболее популярных методов, используемых при поиске нечетких дубликатов вебдокументов, является алгоритм шинглов <ref type="bibr" target="#b1">[2,</ref><ref type="bibr" target="#b3">5]</ref> В качестве элементов могут использоваться слова, встречающиеся в текстах коллекции <ref type="bibr" target="#b9">[11]</ref>. При этом значениями элементов вектора (1), представляющего некоторый документ, являются веса соответствующих слов, отражающие их значимость для этого документа:</p><formula xml:id="formula_0">) ..., , , ( 2 1 n i i i i w w w d  ,<label>(1)</label></formula><p>где N -общее количество различных слов во всех документах, -вес j-ого слова в i-ом документе. Хотя такой выбор признакового пространства является наиболее распространенным, могут применяться и другие характеристики текстов, например, частота появления различных пар символов или частота появления тех или иных частей речи <ref type="bibr">[17]</ref>. j i w В работе <ref type="bibr" target="#b0">[1]</ref> векторная модель использована при решении задачи обнаружения дубликатов. При этом вектором представляется не отдельный документ, а пара документов из обучающей выборки. В качестве значения элемента вектора здесь используется произведение весов соответствующего слова в первом и втором документе пары. Полученный вектор подвергается классификации с помощью метода опорных векторов (support vector machine, SVM) [15] для принятия решения о наличии или отсутствии дублирования.</p><p>Несколько иной подход предложен в статье <ref type="bibr" target="#b10">[13]</ref>. Он также использует векторное представление пары документов, но вектор в целом здесь характеризует схожесть элементов пары, а его отдельные компонентыблизость документов с точки зрения различных критериев. Пары, отмеченные в обучающей выборке как «дубликаты» или «не дубликаты», представлены двумя кластерами точек многомерного пространства. Таким образом, задача обнаружения дублей сводится к классификации новых пар документов, то есть отнесению их к одному из этих кластеров. Классификация основана на выборе кластера, центроид которого находится ближе к точке, представляющей новую пару документов.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.4">Метод, основанный на выявлении близких по смыслу частей текстов</head><p>В [16] решается несколько иная, но близкая задача: формирование из группы документов, описывающих некоторое событие, одного сообщения, содержащего только оригинальную информацию о событии. Для этого выполняется поиск и исключение из текстов документов фрагментов, содержащих идентичную информацию. С этой целью выполняется представление документов цепочками значимых слов, сравнение этих цепочек и обнаружение их схожих участков.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3.5">Анализ рассмотренных методов обнаружения дубликатов</head><p>У сигнатурных методов и алгоритмов, использующих шинглы, есть некоторые схожие черты: эти методы минимизируют вычислительную сложность операции сравнения документов. Поэтому они находят широкое применение в системах, работающих с гигантскими объемами данных (например, в поисковых системах). Обратной стороной медали является их узкая направленностьэти методы и модели представления текстов, которыми они оперируют (шинглы, сигнатуры), пригодны лишь для устранения дублей и не могут быть использованы для других задач. Однако, как было показано выше, очищенные от дубликатов данные впоследствии подвергаются разнообразной обработке и анализу. Поэтому представляется целесообразным применять для обнаружения дублей алгоритмы и модели, которые могут быть использованы для задач интеллектуальной обработки текстов.</p><p>Модель и метод, представленные в [16], также предназначены исключительно для решения конкретной задачи, а именно устранения идентичных фрагментов сообщений. Кроме того, для эффективного использования этого метода документы должны быть предварительно распределены по кластерам, соответствующим событиям. В нашей же ситуации устранение дублей, напротив, выполняется на этапе предварительной обработки данных перед использованием интеллектуальных аналитических методов, таких как обнаружение событий.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="4">Предложенный подход к обнаружению дубликатов</head><p>В целях обеспечения возможности применения разрабатываемой модели документов для решения различных задач из области Text Mining, было решено использовать в качестве её основы векторное представление текстов. Однако использование слов документов в качестве признаков (1) позволяет сравнить сообщения лишь с точки зрения состава слов, что недостаточно для принятия правильного решения. Во многих предметных областях существенную роль играют и другие критерии (см. 2.2), и эти критерии должны быть включены в модель.</p><p>Таким образом, модель должна предусматривать возможность сравнения документов по различным признакам. Окончательно же решение должно приниматься на основе анализа пары документов с точки зрения всех критериев. Исходя из этого, удобно представить пару документов вектором (2), элементами которого являются результаты сравнения документов по соответствующим признакам:</p><p>) , (</p><formula xml:id="formula_1">j i d d ) ..., ,<label>, ( , 2 , 1 ,</label></formula><p>, ), другойотсутствие ( ):</p><formula xml:id="formula_2">k j i j i j i j i      ,<label>(2)</label></formula><formula xml:id="formula_3">k j i,  i d j d j i,   M  M           . , 0 ; , 1 ) ( , , M M D j i j i    (3)</formula><p>С учетом выбранного подхода, процесс обнаружения дублей можно разбить на следующие этапы (рис. 2):</p><p>1. Построение модели документа, отражающей характеристики новостного сообщения с точки зрения каждого из выбранных критериев.   1200 пар документов были проанализированы экспертами вручную. В результате выполненного анализа были выявлены следующие критерии, характеризующие модель распознавания дубликатов.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.1">Содержание текста</head><p>В большинстве случаев определяющее значение имеет близость текстов. Прежде всего, это характерно для общественно-политических новостей, вклад которых в суммарную информацию, передаваемую новостным потоком, определяется оригинальностью их текстового содержания.</p><formula xml:id="formula_4">1 cos 2 2 1 1 ( , ) ( ) ( )        N n N n n i j w w i j n n i j N n n w w d d w i w s m . (<label>5</label></formula><formula xml:id="formula_5">)</formula><p>На первый взгляд, в целях обнаружения дубликатов лучше использовать евклидово расстояние, поскольку размер должен играть роль при сравнении документов: тексты существенно различающейся длины с очень низкой вероятностью являются нечеткими дубликатами. Однако для обеспечения большей гибкости системы было решено разделить оценку документов с содержательной и структурной точки зрения. Чтобы сделать оценку содержательной близости документов независимой от других характеристик, решено использовать для сравнения косинусную меру близости. При использовании неотрицательных весов слов косинусная мера принимает значения в интервале [0, 1], поэтому в качестве оценки различия векторов используется значение</p><formula xml:id="formula_6">, c o s 1 ( ,    w i j w w i j si d m d ) ) . (<label>6</label></formula><formula xml:id="formula_7">)</formula></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.2">Содержание заголовка</head><p>Отдельно при принятии решения учитываются заголовки сообщений, причем их роль значительно варьируется в зависимости от предметной области. При перепечатке новостей общественнополитической тематики с одного сайта на другой нередко изменяется только заголовок, причем иногдавесьма существенно. В таком случае наличие дублирования может быть обнаружено на основе близости остального текста новостей. Однако для сообщений другого типа (например, правового характера), различие заголовков имеет решающее значение, и такие документы не должны признаваться дубликатами, несмотря на близкое содержание.</p><p>В модели заголовок текста представляется аналогично основному тексту (4), с той лишь разницей, что в качестве элементов вектора используются слова, встречающиеся в заголовках документов коллекции:</p><p>, где общее количество различных слов в заголовках всех документов, вес j-го слова в заголовке i-го документа. </p><formula xml:id="formula_8">c i c i c i c i c j c i c j d d d d d d sim    ) , ( .<label>(7)</label></formula><p>Такая мера близости принимает во внимание лишь количество совпадающих и различающихся предложений, но не учитывает, какие именно предложения совпадают и различаются. Однако совпадение значимых, содержательных предложений должно иметь больший вес, чем одновременное появление в обоих документах одинаковых коротких и незначительных фраз. В связи с этим вместо количества предложений используется их суммарный вес. Вес каждого предложения рассчитывается как сумма весов составляющих его слов.</p><p>Кроме того, представленная мера является симметричной, и потому она плохо подходит для сравнения документов, один из которых получен из другого путем удаления нескольких предложений: в этом случае первое сообщение содержит дополнительную информацию относительно второго, но второе не имеет оригинальных данных относительно первого. Чтобы учесть требуемую несимметричность, было решено использовать меру включения вместо меры сходства:</p><formula xml:id="formula_9">          c i w c i c i w d c N k k d d c N k k c j c i c inc c c d d sim ] [ ] [ ) , (<label>1 1 .</label></formula><p>(</p><formula xml:id="formula_10">)<label>8</label></formula><p>Для оценки различия документов с точки зрения предложений используются значения и . ) , ( 1</p><formula xml:id="formula_11">c j c i c inc d d sim   , c j i  ) , ( 1 , c i c j c inc c i j d d sim    Аналогичным образом выполняется сравнение абзацев, результатом которого являются значения меры различия и . p j i,  p i j, </formula></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.4">Числовые данные</head><p>Кроме документов, содержащих только текстовую информацию, часто встречаются и те, которые включают числовые данные. В ряде случаев даже незначительное изменение этих данных может существенно повлиять на содержание сообщения. Примером таких документов являются новостные сообщения из области экономики (новости о со-стоянии фондового рынка) или спорта (сообщения о результатах соревнований). Такие документы не должны признаваться дубликатами даже при полном совпадении их текста.</p><p>Для сравнения документов с точки зрения числовых значений каждое сообщение представляется набором чисел, извлеченных из его текста:</p><p>, где количество различных чисел в i-ом документе. Для выполнения оценки сходства таких наборов также используется мера включения, однако элементы сравниваемых множеств не являются взвешенными, а потому учитывается лишь количество одинаковых и различающихся числовых значений: </p><formula xml:id="formula_12">} ..., , , { 2 1 d n i N i i i n i n n n d  d n i N n i n i n i n j n i n inc d d d d d sim   ) , ( .<label>(9</label></formula></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.5">Фотографии и ссылки</head><p>Информация в сообщении может быть представлена не только текстом или числовыми данными, но и различными объектами, включенными в текст документафотографиями, видеороликами, ссылками на сторонние источники. Присутствие в документе дополнительных фото-и видеоматериалов значительно повышает вероятность его оригинальности При сравнении фотоматериалов, включенных в сообщение, возникают сложности: определить идентичность фотографий в двух документах проблематично, поскольку одинаковые с точки зрения эксперта фотографии могут иметь различные URL и разный размер. Поэтому было принято решение учитывать не сами фотографии, а их количество в документе:</p><p>. Также в модель включается компонент, отражающий количество ссылок, присутствующих в тексте сообщения:</p><p>. Различие документов с точки зрения этих критериев определяется как разность соответствующих значений:</p><p>, .</p><formula xml:id="formula_13">im i d im j d h i d im i im j i d   ,  h j h i h j i d d   , </formula></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.6">Дата и время публикации</head><p>Существенным фактором, влияющим на принятие решения о наличии или отсутствии дублирования, является разница во времени публикации сообщений. Так, при дублировании новостных статей перепечатыванию обычно подвергаются свежие новости, недавно опубликованные на сайте первоисточника. С увеличением интервала между моментами появления документов в сети вероятность дублирования быстро убывает В модели эта характеристика сообщения представлена посредством POSIX-времени момента публикации (которое определяется как количество секунд, прошедших с полуночи 1 января 1970 года до момента, когда документ был опубликован источником):</p><p>. Различие между документами определяется как разность между моментами публикации сообщений в секундах:</p><p>.</p><formula xml:id="formula_14">dt i d dt j dt i dt j i d d   , </formula></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="5.7">Авторитетность источника</head><p>При анализе документов эксперты обращают внимание на источники сообщений, при этом они руководствуются своими представлениями об авторитетности источников. Статья из авторитетного источника (который обычно публикует оригинальные материалы) имеет существенно меньшую вероятность быть признанной дубликатом, чем документ, полученный из источника, регулярно занимающегося перепечаткой чужих сообщений.</p><p>Авторитетность источника</p><formula xml:id="formula_15">s представляется значением ] 1 , 0 [ ) (  s aut</formula><p>, отражающим вероятность публикации им оригинального сообщения. Это значение может быть задано экспертом вручную или получено на основе обучающей выборки как соотношение количества оригинальных документов, поступивших от источника, к общему количеству опубликованных им сообщений.</p><p>В модель документа включается компонент, отражающий авторитетность источника, опубликовавшего этот документ:</p><p>, где функция, устанавливающая соответствие между документом и его источником.</p><p>)) ( (</p><formula xml:id="formula_16">i a i d src aut d  ) ( ( i d src</formula><p>Таким образом, модель документа представляет собой совокупность компонентов, характеризующих сообщение с точки зрения различных критериев:</p><formula xml:id="formula_17">) , ,<label>, , , , , , ( a</label></formula><formula xml:id="formula_18">i dt i h i im i p i c i n i t i w i i d d d d d d d d d d  .<label>(10)</label></formula><p>6 Метод обнаружения дубликатов </p><formula xml:id="formula_19">d k i  j d j , )<label>, , , , , , , , ( , , , , , , , , , ,</label></formula><formula xml:id="formula_20">a j i dt j i h j i im j i p j i c j i n j i t j i w j i j i            (11)</formula><p>Ввиду вышеуказанной несимметричности мер сходства, используемых для некоторых критериев, результатом сравнения двух документов являются два различных вектора и , характеризующие степень отличия первого и второго сообщения друг от друга. Каждый из этих векторов интерпретируется с помощью функции</p><formula xml:id="formula_21">j i,  ( i j,  )  D (3).</formula><p>Для интерпретации результата сравнения необходимо решить задачу бинарной классификации, то есть отнести вектор к классу или . Для настройки параметров классификатора используется обучающая выборканабор векторов, каждый из которых снабжен меткой , обозначающей класс, к которому принадлежит этот вектор.</p><formula xml:id="formula_22"> M {  M m  M }  M , </formula><p>Задача бинарной классификации состоит в том, чтобы для вновь поступившего на исследование вектора определить класс, к которому он принадлежит, то есть значение m. Для её решения будем использовать метод опорных векторов (SVM). Этот метод основан на построении в K-мерном пространстве (K -1)-мерной гиперплоскости, разделяющей объекты классов</p><formula xml:id="formula_23">) ..., , ,<label>( 2 1 K</label></formula><formula xml:id="formula_24">      M и  M . В</formula><p>зависимости от расположения вектора  относительно этой гиперплоскости, выполняется его отнесение к одному из классов. Возможны следующие результаты интерпретации:</p><formula xml:id="formula_25"> 0 ) ( ) ( , ,   i j j i D D   . В этом случае оба до- кумента признаются оригинальными;  ) ( . Один из документов явля- ется оригиналом, а второй -дублем; ) ( , , i j j i D D     1 ) (</formula><p>. Оба документа являются дублями друг относительно друга. То есть, ни один из них не содержит оригинальных данных относительно другого.</p><formula xml:id="formula_26">) ( , ,   i j j i D D  </formula><p>На основе полученных результатов принимается решение о дальнейших действиях в отношении документов. Так, в разработанной системе решалась задача проверки документов в момент их поступления от источника, при этом загружаемые сообщения сравнивались на предмет дублирования с документами, уже загруженными в базу. Поэтому интерес представлял лишь один из результатов интерпретацииявляется ли загружаемый документ дубликатом ранее полученного сообщения. Однако при обработке готовой коллекции документов с целью обнаружения и устранения дубликатов важно выявить все пары сообщений, в которых имеет место дублирование, для чего требуется использовать оба результата.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="6.2">Метод предварительного отбора кандидатов</head><p>Предложенный метод выявления нечетких дубликатов имеет существенный недостатоквысокую вычислительную сложность. Каждое новое сообщение подвергается сравнению со всеми ранее загруженными, и при каждом сравнении выполняется расчет близости документов по множеству критериев. Однако очевидно, что в большинстве случаев в таком тщательном анализе нет необходимостисильно различающиеся по тексту документы с высокой вероятностью различны и по содержанию. Следовательно, нужно исключать из рассмотрения те из ранее загруженных новостей, которые слишком сильно отличаются от текущей.</p><p>С этой целью вышеописанный метод предваряется процедурой отбора документов, дубликатом которых может быть текущая новость (то есть, отбора кандидатов на роль оригинала этой новости). Эта процедура, по сути, также решает задачу обнаружения дубликатов, причем основными требованиями, предъявляемыми к ней, являются минимальная вычислительная сложность и максимальная полнота (поскольку отброшенные из числа кандидатов документы далее рассматриваться не будут).</p><p>В качестве такой процедуры рассматривались представленные в работе [12] приближенные методы обнаружения дубликатов, имеющие высокую производительность. Ввиду наличия набора взвешенных слов, было решено использовать для описания сообщения сигнатуру, представляющую собой строку, состоящую из сцепленных в алфавитном порядке нескольких наиболее «тяжелых» слов документа. При этом процедура отбора кандидатов заключается в выборе из ранее загруженных документов тех, которые имеют такую же сигнатуру, как и текущая новость. Такие пары документов с совпадающими сигнатурами должны быть подвергнуты проверке основным методом, представленным в предыдущем подразделе. В работе [12] предложено использовать сигнатуры из 6 слов, но это приводит к низкому значению полноты (0.54). В целях получения высокой полноты, было решено сократить количество слов, составляющих сигнатуру, до двух. Проведенный эксперимент доказывает целесообразность многокритериального сравнения использовании всех критериев достигаются более высокие показатели качества (F-мера в зоне насыщения равна 0,82), чем при анализе документов только с точки зрения слов (0,67) или параграфов (0,64).</p><p>При анализе результатов эксперимента было выявлено несколько факторов, негативно сказ хся на качестве. Одним из них является человеческий фактор: каждый эксперт, принимавший участие в подготовке обучающей и тестовой выборок, имеет свое представление о том, какие документы являются информативно необходимыми, а какиенет, в результате чего возникают конфликты в суждениях экспертов. Также эксперимент показал, что система не может обнаруживать дублирование в случае переписывания оригинального текста без изменения его содержания (рерайтинга), что говорит о необходимости доработки модели для обнаружения такого рода дублирования. Наконец, при проведении эксперимента была выполнена попытка настройки единой модели распознавания для всех документов, загружаемых с новостных сайтов. Но эти документы принадлежат различным предметным областямсреди общественно-политических новостей попадаются экономические, спортивные, юридические. Для повышения качества работы эти документы должны анализироваться с использованием специализированных моделей распознавания.</p><p>Проведенный эксперимент также показал, что среднее время, затрачиваемое на анализ пары тов основным методом, составляет 5 мс. С учетом высокой эффективности метода предварительной фильтрации это означает, что система способна обрабатывать 10 000-50 000 документов в час (в зависимости от количества загруженных ранее сообщений, с которыми требуется сравнивать новые документы). </p></div><figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_0"><head>Труды</head><label></label><figDesc>16-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» -RCDL-2014, Дубна, Россия, 13-16 октября 2014 г.</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_1"><head>2 .</head><label>2</label><figDesc>Сравнение моделей двух документов и получение результирующего вектора j i,  . 3. Интерпретация вектора с помощью решающей функции ) ( , j i D  .</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_2"><head>2 . 5</head><label>25</label><figDesc>Этапы обнаружения дубликатов Для обеспечения возможности сравнения составов слов документов, модель должна включать векторное представление текста сообщения (1). Если слово не встречается в документе, его вес равен нулю. Для остальных слов вес рассчитывается по методу TF-IDF с использованием алгоритма Okapi BM25 [6]. Рассчитанный таким образом вес слова wt = tf * idf пропорционален частоте его употребления в документе tf и обратно пропорционален частоте употребления слова в других документах коллекции idf. В результате, модель текста документа представляет собой вектор: i d Модель документа Важным этапом решения задачи является выбор критериев для сравнения документов. Набор критериев должен быть достаточно выразительным, чтобы обеспечивать возможность гибкой настройки модели в соответствии со спецификой различных предметных областей. Для определения набора критериев было проведено исследование выборки текстовых документов, автоматически собираемых из различных Интернет-источников. В качестве источников были выбраны 35 сайтов по различной тематике: основные новостные сайты, публикующие материалы общественнополитической и экономической тематики, официальные сайты органов государственной власти РФ, некоторые сайты органов законодательной и исполнительной власти субъектов РФ. Такой набор сайтов позволил охватить значительное число тем и типов информационных сообщений (ленты новостей, аналитические статьи и обзоры, документы правового характера, документы, содержащие финансовоэкономические показатели).</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" xml:id="fig_3"><head>Рис. 3 .</head><label>3</label><figDesc>Зависимость точности (тонкая сплошн линия), полноты (тонкая пунктирная линия) и F-меры (жирная линия) от мощности обучающей выборки аяDamerau, F. 1964. A technique for comp detection and correction Помимо обнаружения и устранения дубликатов, предлагаемый метод может быть использован для Com ения других задач интеллектуального анализа текстов. При соответствующей настройке набора учитываемых критериев и порога близости документов, необходимого для вынесения решения о наличии дублирования, метод может быть применен для решения общей задачи обнаружения документов, близких по содержанию к заданному. Это позволит, в частности, выполнять формирование подборок тематически близких документов, а также сообщений, которые с большой долей вероятности связанны с каким-то общим событием. Таким образом, имеется возможность использования разработанного метода для решения задачи динамической кластеризации коллекции документов. Еще одним перспективным направлением развития метода является снабжение его во Тр только обнаружения наличия или отсутствия дублирования, но и выделения в тексте близких по содержанию сообщений фрагментов с оригинальной (недублированной) информацией. его основе лежит отнесение пар документов к классу «дубликатов» или «недубликатов» с помощью метода опорных векторов. Предлагаемый метод обладает высокой гибкостью благодаря возможности его настройки для оботки сообщений из различных предметных областей. Это достигается посредством включения в модель документа компонентов, отражающих критерии, которыми руководствуются эксперты при анализе текстовых коллекций вручную. Для обеспечения низкой вычислительной сложности предложена процедура отбора пар те основе сравнения числовых сигнатур документов. Это позволяет применять основной метод лишь к документам, прошедшим отбор. Представленный метод был апробирован при решении задачи анализа потока текстовых ий, [12] Зеленков Ю.Г, Сегалович И.В. Сравнительный анализ методов определения нечетких дуб для Web-документов // Электронные би перспективные методы и технологии, электронные коллекции: Труды 9-й ружаемых из открытых интернет-источников, с целью устранения документов, являющихся дубликатами ранее загруженных материалов.</figDesc></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_0"><head>3.3 Методы, использующие векторные модели</head><label></label><figDesc></figDesc><table><row><cell></cell><cell cols="14">оригинального алгоритма предложили несколько</cell></row><row><cell></cell><cell cols="10">способов сэмплирования множества.</cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="14">Дальнейшим развитием этого метода стал алго-</cell></row><row><cell></cell><cell cols="14">ритм «супершинглов» [4]. Его идея состоит в при-</cell></row><row><cell></cell><cell cols="14">менении к элементам множества шинглов различ-</cell></row><row><cell></cell><cell cols="14">ных хэш-функций и выборе для каждой из них шин-</cell></row><row><cell></cell><cell cols="14">гла, минимизирующего её значение. Из выбранных</cell></row><row><cell></cell><cell cols="14">шинглов формируются группы, именуемые «супер-</cell></row><row><cell></cell><cell cols="14">шинглами». Два документа считаются похожими,</cell></row><row><cell></cell><cell cols="14">если мера сходства их наборов «супершинглов» не</cell></row><row><cell></cell><cell cols="4">меньше заданного значения.</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="2">3.2 Сигнатурные методы</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="14">Другим распространенным классом приближен-</cell></row><row><cell></cell><cell cols="14">ных подходов к поиску нечетких дубликатов явля-</cell></row><row><cell></cell><cell cols="14">ется класс сигнатурных методов. Подробный обзор</cell></row><row><cell></cell><cell cols="14">алгоритмов этого класса выполнен в [12]. Общей</cell></row><row><cell></cell><cell cols="14">идеей является представление документа с помо-</cell></row><row><cell></cell><cell cols="14">щью одного числового значения -«сигнатуры», что</cell></row><row><cell></cell><cell cols="14">сводит проверку схожести документов к сравнению</cell></row><row><cell></cell><cell cols="14">их сигнатур. Совпадение этих значений означает,</cell></row><row><cell></cell><cell cols="14">что документы являются нечеткими дубликатами.</cell></row><row><cell></cell><cell cols="14">Существует множество способов вычисления сигна-</cell></row><row><cell></cell><cell>тур документов:</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="14"> использование хэш-функции, вычисленной</cell></row><row><cell></cell><cell cols="14">для всего документа (это позволяет обнаруживать</cell></row><row><cell></cell><cell cols="2">лишь точные дубликаты);</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="14"> использование хэш-функции, вычисленной</cell></row><row><cell></cell><cell cols="14">для строки, полученной из сцепленных в алфавит-</cell></row><row><cell></cell><cell cols="14">ном порядке нескольких слов документа с наиболь-</cell></row><row><cell></cell><cell cols="14">шими значениями весов, рассчитанных различными</cell></row><row><cell></cell><cell cols="14">методами (например, TF, TF-IDF и OptFreq);</cell></row><row><cell></cell><cell cols="14"> использование хэш-функции, вычисленной для</cell></row><row><cell></cell><cell cols="14">строки, полученной из сцепленных в алфавитном по-</cell></row><row><cell></cell><cell cols="14">рядке нескольких наиболее длинных или «тяжелых»</cell></row><row><cell></cell><cell cols="14">(то есть, состоящих из слов с наибольшим суммарным</cell></row><row><cell></cell><cell cols="12">значением весов) предложений документа.</cell><cell></cell></row><row><cell></cell><cell cols="14">Несколько иной подход предложен в работе [14]:</cell></row><row><cell></cell><cell cols="14">здесь сигнатура представляет собой не хэш-сумму</cell></row><row><cell></cell><cell cols="14">цепочки слов, а саму цепочку. При этом документы</cell></row><row><cell></cell><cell cols="14">признаются дубликатами при совпадении заданного</cell></row><row><cell></cell><cell cols="4">числа элементов их цепочек.</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="14">В задачах интеллектуальной обработки текстов</cell></row><row><cell></cell><cell cols="14">(Text Mining) широко используются векторные модели</cell></row><row><cell></cell><cell cols="14">текстовых документов. При этом каждое сообщение</cell></row><row><cell></cell><cell cols="14">представляется в виде вектора в многомерном призна-</cell></row><row><cell></cell><cell>ковом пространстве</cell><cell>D </cell><cell>(</cell><cell>D</cell><cell>1</cell><cell>,</cell><cell>D</cell><cell>2</cell><cell>,</cell><cell>...,</cell><cell>D</cell><cell>N</cell><cell>)</cell><cell>, каждый</cell></row><row><cell></cell><cell cols="14">элемент которого отражает некоторую характеристику</cell></row><row><cell>. Он</cell><cell>документа.</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>основан на представлении документа в виде множе-</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>ства всевозможных последовательностей фиксиро-</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>ванной длины k, состоящих из соседних слов. Такие</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>последовательности называются «шинглами». Два</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>документа считаются похожими, если их множества</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>шинглов значительно пересекаются. Количество</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>шинглов примерно равно длине документа в словах,</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>поэтому в целях повышения эффективности авторы</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_4"><head></head><label></label><figDesc>)</figDesc><table><row><cell cols="17">Расстояние между документами по данному</cell></row><row><cell cols="7">критерию равно</cell><cell cols="2"></cell><cell>, n i</cell><cell>j</cell><cell></cell><cell>1</cell><cell></cell><cell cols="3">n inc sim</cell><cell>(</cell><cell>d</cell><cell>n i</cell><cell>,</cell><cell>d</cell><cell>n j</cell><cell>)</cell><cell>.</cell></row><row><cell cols="17">Для некоторых предметных областей важен не</cell></row><row><cell cols="17">только состав набора чисел, но и порядок их следо-</cell></row><row><cell cols="17">вания в тексте документа. Это относится, в частно-</cell></row><row><cell cols="17">сти, к спортивным новостям, где разные последова-</cell></row><row><cell cols="17">тельности одних и тех же чисел могут соответство-</cell></row><row><cell cols="17">вать различным результатам соревнований (напри-</cell></row><row><cell cols="17">мер, два сета в теннисном матче, завершившиеся со</cell></row><row><cell cols="17">счетом «6:4» и «4:6»). В таком случае для представ-</cell></row><row><cell cols="2">ления</cell><cell></cell><cell cols="9">сообщения</cell><cell></cell><cell></cell><cell></cell><cell cols="2">используется</cell><cell>кортеж</cell></row><row><cell>n i d </cell><cell>{ n 1 i</cell><cell>,</cell><cell>2 i n</cell><cell>,</cell><cell>...,</cell><cell cols="2">N i n</cell><cell cols="2">a n i</cell><cell>}</cell><cell cols="3">, где</cell><cell></cell><cell cols="2">N</cell><cell>d n i</cell><cell>-общее количество</cell></row><row><cell cols="13">чисел в i-ом документе.</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="17">В этом случае для сравнения документов необ-</cell></row><row><cell cols="17">ходимо выбрать меру различия, учитывающую по-</cell></row><row><cell cols="17">рядок следования элементов. Такой мерой является</cell></row><row><cell cols="17">расстояние Дамерау-Левенштейна [3], равное коли-</cell></row><row><cell cols="17">честву операций вставки, удаления, замены и пере-</cell></row><row><cell cols="17">становки элементов, необходимых для преобразова-</cell></row><row><cell cols="17">ния одной последовательности символов (в данном</cell></row><row><cell cols="17">случае -чисел) в другую. Эта мера является моди-</cell></row><row><cell cols="17">фикацией расстояния Левенштейна, отличающаяся</cell></row><row><cell cols="17">наличием операции перестановки двух соседних</cell></row><row><cell cols="17">символов (транспозиции). Это важно для нашей за-</cell></row><row><cell cols="17">дачи, поскольку при перепечатке документа иногда</cell></row><row><cell cols="17">изменяется порядок следования его абзацев и пред-</cell></row><row><cell cols="17">ложений, что приводит к появлению перестановок в</cell></row><row><cell cols="16">последовательности чисел.</cell></row><row><cell cols="17">Расстояние между сообщениями при использо-</cell></row><row><cell cols="13">вании этой меры равно</cell><cell cols="2"></cell><cell>, n i</cell><cell>j</cell><cell></cell><cell>dist</cell><cell>DL</cell><cell>(</cell><cell>d</cell><cell>n i</cell><cell>,</cell><cell>d</cell><cell>n j</cell><cell>)</cell><cell>и явля-</cell></row><row><cell cols="11">ется симметричным.</cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_6"><head>7 Экспериментальная проверка метода</head><label></label><figDesc></figDesc><table><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>В рамках второго эксперимента выполнялась</cell></row><row><cell cols="8">В рамках данной работы были проведены экспе-рименты, направленные на анализ качества работы разработанной подсистемы обнаружения дублика-тов, реализующей предложенный метод. Все экспе-рименты проводились на ПЭВМ со следующими основными параметрами: процессор Intel Core 2 Duo 2,2 ГГц, объем ОЗУ 2 Гб.</cell><cell>тестирова-использовались 26 036 документов, извлечен-оценка качества основного метода. Для ния ных с 20 новостных сайтов. С помощью метода фильтрации было отобрано 2650 пар-кандидатов, каждая из которых была проанализирована экспер-тами на предмет наличия дублирования. Часть пар использовалась для обучения, на остальных выпол-нялось тестирование метода. Целью эксперимента</cell></row><row><cell cols="8">Целью первого эксперимента была оценка каче-ства метода предварительного отбора потенциаль-ных дубликатов на примере анализа общественно-</cell><cell>было определение зависимости показателей качест-ва (точности, полноты и F-меры) от мощности обу-чающей выборки и от учитываемых критериев.</cell></row><row><cell cols="8">политических новостей. Тестирование производи-лось в течение суток. В качестве входных данных использовались 1502 документа, извлеченных с 20 новостных сайтов. Каждый из документов подвер-гался сравнению с 10293 загруженными ранее со-общениями. В общей сложности было выполнено 16 586 310 сравнений документов, при этом 259 пар были отобраны для проверки основным методом.</cell><cell>Полученные зависимости представлены на рис. 3 авов (а -при использовании только близости сост сло в, б -при использовании только схожести параграфов, в -при использовании всех критериев, приведенных в разделе 5). Как видно из рисунка, при использовании 400 исходит насыщение, и с обучающих примеров про дал ьнейшим увеличением обучающей выборки ка-</cell></row><row><cell cols="8">Таблица 1. Оценка качества метода отбора кандидатов p N or N dup N</cell><cell>чество работы метода не улучшается. Таким обра-зом, для обучения системы достаточно 400 пар до-кументов, размеченных экспертами.</cell></row><row><cell cols="8">Всего Прошли отбор Отброшено</cell><cell>16 586 310 16 586 121 259 108 16 586 051 16 586 013</cell><cell>189 151 38</cell><cell>при</cell><cell>документов:</cell></row><row><cell></cell><cell></cell><cell cols="4">Где</cell><cell>N</cell><cell>p</cell><cell>-общее количество пар,</cell><cell>N</cell><cell>or</cell><cell>-число</cell></row><row><cell cols="3">пар</cell><cell cols="5">мен , эле ты которых не дублируют др друга, и уг</cell></row><row><cell>N</cell><cell cols="4">Из dup</cell><cell cols="3">а 189 пар дубликатов отбор прошла 151 пар -количество пар документов-дубликатов.</cell><cell>щи</cell><cell>ываю-</cell></row><row><cell cols="2">(80</cell><cell cols="6">%). Таким образом, использование сигнатуры из</cell></row><row><cell cols="8">двух слов позволяет увеличить полноту по сравне-</cell></row><row><cell cols="8">нию с шестисловными сигнатурами, однако добить-</cell></row><row><cell cols="8">ся полноты, близкой к 100%, не удалось. Метод час-</cell></row><row><cell cols="8">то отбрасывает дубликаты в случаях, когда один из</cell></row><row><cell cols="8">документов является урезанной копией другого -</cell></row><row><cell cols="8">отсутствие нескольких параграфов значительно</cell></row><row><cell cols="8">а влияет на веса слов. Ан лиз результатов экспери-</cell></row><row><cell cols="8">ментов показывает необходимость доработки мето-</cell></row><row><cell cols="8">да предварительного отбора.</cell></row><row><cell></cell><cell></cell><cell cols="6">ользуются для обуче-Отброшенные пары не исп</cell></row><row><cell cols="4">ния</cell><cell cols="4">и тестирования основного метода, однако было</cell></row><row><cell cols="8">обнаружено, что 38 ошибочно отброшенных пар</cell></row><row><cell cols="8">дубликатов по своим характеристикам близки к тем</cell></row><row><cell cols="8">151, которые прошли отбор. Таким образом, недос-</cell></row><row><cell cols="8">таточная полнота метода предварительного отбора</cell></row><row><cell cols="8">ведет к появлению в коллекции большего количест-</cell></row><row><cell cols="8">ва дублирующихся сообщений, но не снижает каче-</cell></row><row><cell cols="8">ство обучения основного метода.</cell></row><row><cell></cell><cell></cell><cell cols="6">х отбор, дублика-Среди всех 259 пар, прошедши</cell></row><row><cell cols="8">ты доказывает необходимость дополнительного анали-составляют 58%. Столь низкая точность метода за отобранных пар. При этом метод продемонстри-</cell><cell>мен</cell><cell>доку-</cell></row><row><cell cols="8">ровал высокую эффективность (под эффективно-</cell></row><row><cell cols="8">стью понимается отношение количества пар, от-</cell></row><row><cell cols="8">брошенных на этапе предварительного отбора, к</cell></row><row><cell cols="8">общему числу пар): из 16 586 310 пар документов</cell></row><row><cell cols="8">было отброшено 16 586 051 (0,99998%).</cell></row></table></figure>
		</body>
		<back>
			<div type="annex">
<div xmlns="http://www.tei-c.org/ns/1.0"><head>The M in a Stream of Text Documents</head><p>ndreev, D. Berezkin, I. Kozlov, K. Sima The problem of duplicate documents elimination m a stream of text messages is considered. lticriterion model of text document is given. Criteria are chosen to properly represent documents from different domains. An approach for duplicates detection based on binary classification is proposed. A method of candidates preliminary filtration is proposed in order to reduce the computational complexity of the approach.</p></div>			</div>
			<div type="references">

				<listBibl>

<biblStruct xml:id="b0">
	<analytic>
		<title level="a" type="main">Detection Us Measures</title>
		<author>
			<persName><forename type="first">M</forename><surname>Bilenko</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proceedings of the Ninth ACM SIGKDD International Conference on Knowl Discovery and Data Mining(KDD-2003)</title>
				<meeting>the Ninth ACM SIGKDD International Conference on Knowl Discovery and Data Mining(KDD-2003)<address><addrLine>Washington DC</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2003-08">August, 2003</date>
			<biblScope unit="page" from="39" to="48" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b1">
	<analytic>
		<author>
			<persName><forename type="first">A</forename><surname>Broder</surname></persName>
		</author>
		<ptr target="http://www.cs.princeton.edu/courses/archiveВсе5Трmunications" />
	</analytic>
	<monogr>
		<title level="m">Algorithms for duplicate docum</title>
				<imprint>
			<date type="published" when="1964">1964</date>
			<biblScope unit="volume">7</biblScope>
			<biblScope unit="page" from="171" to="176" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b2">
	<monogr>
		<author>
			<persName><forename type="first">D</forename><surname>Fetterly</surname></persName>
		</author>
		<author>
			<persName><forename type="first">M</forename><surname>Manasse</surname></persName>
		</author>
		<author>
			<persName><forename type="first">M</forename><surname>Najork</surname></persName>
		</author>
		<title level="m">A Large-Scale Study of the Evolution of Web May 20-24</title>
				<meeting><address><addrLine>Budapest, Hungary</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2003">2003</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b3">
	<analytic>
		<title level="a" type="main">Finding Similar Files in a Lar System</title>
		<author>
			<persName><forename type="first">U</forename><surname>Manber</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Winter USENIX Technical Conference</title>
				<imprint>
			<date type="published" when="1994">1994</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b4">
	<monogr>
		<author>
			<persName><forename type="first">S</forename><surname>Robertson</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><surname>Walker</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><surname>Jones</surname></persName>
		</author>
		<author>
			<persName><forename type="first">M</forename><surname>Hancock</surname></persName>
		</author>
		<author>
			<persName><forename type="first">M</forename><surname>Beaulieu</surname></persName>
		</author>
		<author>
			<persName><surname>Gatford</surname></persName>
		</author>
		<title level="m">Okapi at trec-3. Text REtrieval Conference (TREC-3)</title>
				<imprint>
			<date type="published" when="1995">1995</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b5">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">М</forename><surname>Андреев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Д</forename><forename type="middle">В</forename><surname>Березкин</surname></persName>
		</author>
		<title level="m">Симаков К.В. Модел языковых текстов и метод ее обучения // Электронные библиотеки: перспективные методы и технологии, электронные коллек уды 8-й Всероссийской научной конференции (RCDL&apos;</title>
				<imprint>
			<publisher>Суздаль</publisher>
			<date type="published" when="2006">2006. 2006</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b6">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">М</forename><surname>Андреев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Д</forename><forename type="middle">В</forename><surname>Березкин</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><surname>Морозов</surname></persName>
		</author>
		<author>
			<persName><surname>Симаков</surname></persName>
		</author>
		<title level="m">К.В. Метод кластеризации документов текстовых коллекций и синтеза аннотаций кластеров // Электронные библиотеки: перспективные методы и хнологии, электронные коллекции: Труды 10-й Всероссийской научной конференции (RCDL&apos;</title>
				<imprint>
			<date type="published" when="2008">2008. 2008</date>
			<biblScope unit="page" from="220" to="229" />
		</imprint>
	</monogr>
	<note>Дубна</note>
</biblStruct>

<biblStruct xml:id="b7">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">М</forename><surname>Андреев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Д</forename><forename type="middle">В</forename><surname>Березкин</surname></persName>
		</author>
		<title level="m">Козлов Симаков К.В. Метод обнаружения изме структуры веб-сайтов в системе сбора новостной информации // Электронные библиотеки: перспективные методы и хнологии, электронные коллекции: Труды 14-й Всероссийской научной конференции</title>
				<meeting><address><addrLine>RCDL-</addrLine></address></meeting>
		<imprint>
			<date type="published" when="2012">2012. 2012</date>
			<biblScope unit="page" from="124" to="133" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b8">
	<monogr>
		<author>
			<persName><forename type="first">М</forename><surname>Блох</surname></persName>
		</author>
		<idno>-160</idno>
		<title level="m">Теоретические основы грамм учебник. -2-е изд</title>
				<imprint>
			<publisher>Высш</publisher>
			<date type="published" when="2000">2000</date>
		</imprint>
	</monogr>
	<note type="report_type">исправл</note>
</biblStruct>

<biblStruct xml:id="b9">
	<monogr>
		<author>
			<persName><forename type="first">Е</forename><forename type="middle">И</forename><surname>Большакова</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Э</forename><forename type="middle">С</forename><surname>Клышинский</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Д</forename><forename type="middle">В</forename><surname>Ландэ</surname></persName>
		</author>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">А</forename><surname>Носков</surname></persName>
		</author>
		<title level="m">Автоматическая обработка текстов на естественном языке и компьютерная лингвистика : учеб. пособие. -российской научной конференции (RCDL&apos;</title>
				<imprint>
			<date type="published" when="2007">2007. 2007</date>
			<biblScope unit="page" from="166" to="174" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b10">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">А</forename><surname>Князева</surname></persName>
		</author>
		<author>
			<persName><forename type="first">И</forename><forename type="middle">Ю</forename><surname>Турчановский</surname></persName>
		</author>
		<author>
			<persName><forename type="first">О</forename><surname>Ко</surname></persName>
		</author>
		<title level="m">Выявление дубликатов в библиографических базах данных // Электронные библиотеки: перспективные методы и те уды 15-й Всероссийской научной конференции (RCDL2013). -Ярославль</title>
				<imprint>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="276" to="282" />
		</imprint>
	</monogr>
</biblStruct>

				</listBibl>
			</div>
		</back>
	</text>
</TEI>
