<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Методы обнаружения массово порождаемых неестественных текстов на основе анализа разнообразия тематической структуры текстов</article-title>
      </title-group>
      <pub-date>
        <year>2007</year>
      </pub-date>
      <fpage>195</fpage>
      <lpage>200</lpage>
      <abstract>
        <p>Данная работа посвящена разработке методов и средств обнаружения массово порождаемых неестественных текстов. В работе предлагается теоретическая обобщенная модель текстов, порожденных по образцам. На основе теоретической модели предлагается алгоритм обнаружения неестественных текстов. Данный алгоритм анализирует тематическую структуру текстов, и определяется по ней неестественные тексты. Предложенный алгоритм проверяется на задаче обнаружения поискового спама.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>1. Введение</p>
      <p>В связи с ростом объема информации в сети
Интернет поисковые машины стали основным
средством для эффективного доступа к ней. Задача
поисковой машины – на каждый поисковый запрос
выдавать ранжированный набор страниц, наиболее
соответствующих запросу. Мера соответствия
страницы запросу, называемая релевантностью,
вычисляется на основе характеристик страниц и
запросов.</p>
      <p>
        Появление сайта в первой десятке выдачи
популярных поисковых систем по коммерческим
запросам обеспечивает большой приток
посетителей на сайт. В связи с этим возникает
конкуренция между создателями сайтов за
попадание на верхние позиции выдачи поисковых
систем. Она приводит к тому, что создатели сайтов
пытаются повлиять на работу алгоритмов,
применяемых в поисковых системах, чтобы
незаслуженно повысить оценку релевантности
страниц. Это явление получило название
поискового спама [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ].
      </p>
      <p>
        Поисковый спам ухудшает качество поиска и
увеличивает нагрузку на поисковую систему. Он
был признан одной из основных угроз для
современных поисковых систем [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. По некоторым
оценкам до 20% всего содержимого сети Интернет
является поисковым спамом [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ], уровень
поискового спама в выдаче ведущих поисковых
систем составляет 3-6% [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ].
      </p>
      <p>Поисковые системы используют различную
информацию для ранжирования страниц:
содержимое страницы и сайта, на которой она
расположена; ссылки между страницами и сайтами
и пр. В настоящее время существует несколько
разновидностей поискового спама, нацеленных на
различные алгоритмы, применяемые внутри
поисковых систем. Например, ссылочный спам
нацелен на алгоритмы ссылочного ранжирования,
такие как PageRank.</p>
      <p>Одной из разновидностей поискового спама
является массовое порождение неестественных
текстов. При использовании такого спама целью
спамеров является попадание в выдачу по запросам
с малым количеством релевантных страниц. Это
позволяет странице с большой вероятностью
показаться по этому запросу. Чтобы
максимизировать количество переходов
пользователей по таким запросам спамерам
приходится создавать тысячи страниц, каждая из
которых должна показываться по одному или
нескольким низкочастотным запросам. Такой спам
особенно опасен для поисковых систем, так как
спамерские страницы непосредственно
показываются в выдаче.</p>
      <p>Так как создание большого количества страниц с
текстом вручную не представляется возможным,
спамеры применяют автоматические алгоритмы
массового порождения текстов. При этом им
необходимо максимально затруднить обнаружение
таких текстов со стороны поисковой системы.
Существует два основных подхода к массовому
порождению текстов:
• Копирование существующих
естественных текстов;
• Синтез текстов на основе естественных
документов-образцов.</p>
      <p>
        В настоящее время существует целый ряд
эффективных методов обнаружения дубликатов,
которые позволяют обнаруживать скопированные
тексты в масштабах сети Интернет [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]. В связи с
этим большое распространение получили
алгоритмы автоматического порождения текстов.
      </p>
      <p>Данная работа посвящена алгоритмам
обнаружения массово порождаемых неестественных
текстов.
1.1 Обзор существующих решений</p>
      <p>
        В основе многих методов обнаружения
неестественных текстов лежит подход,
предложенный в работе [
        <xref ref-type="bibr" rid="ref7">8</xref>
        ]. В этой работе
предлагается 10 эвристик для анализа
статистических характеристик текстов. Признаки,
полученные на основе эвристик, объединяются в
автоматический классификатор поискового спама с
помощью методов машинного обучения.
      </p>
      <p>
        Развитием данного подхода является работа [
        <xref ref-type="bibr" rid="ref11">12</xref>
        ].
В данной работе предлагается использовать метод
скрытого распределение Дирихле, для определения
спаммерских текстов. Данный метод ориентирован
на обнаружение текстов определенных тематик,
свойственных поисковому спаму. В работе [
        <xref ref-type="bibr" rid="ref12">13</xref>
        ]
рассматривается алгоритм на основе объединения
текстовых характеристик и характеристик
ссылочной структуры. При этом используется
методика для повышения качества классификации
при несбалансированном обучающем наборе.
      </p>
      <p>
        В работе [
        <xref ref-type="bibr" rid="ref10">11</xref>
        ] предлагается подход к
определению неестественных текстов, в основе
которого лежит гипотеза, что неестественные
тексты не могут одновременно удовлетворять всем
ограничениям, свойственным естественным
текстам. При обучении алгоритма выделяется
большое количество статистических признаков,
связанных с читаемостью, единством стиля и
жанровыми особенностями, которые впоследствии
объединяются в автоматический классификатор.
2. Теоретическая модель неестественных
текстов
      </p>
      <p>Одной из целей исследования является изучение
теоретических основ обнаружения неестественных
текстов, порожденных на основе
документовобразцов.</p>
      <p>Автоматическая генерация текстов в настоящее
время является нерешенной задачей. Естественным
текстам свойственно большое количество
закономерностей, которые сложно воспроизвести
автоматическими методами:
• Локальная связность;
• Единство стиля и жанра;
• Синтаксическая структура
предложений;
• Глобальная тематическая связность
текста;
• Структура изложения;</p>
      <p>• И т.п.</p>
      <p>При порождении поискового спама
используются различные алгоритмы порождения
текстов. Рассмотрим алгоритмы, которые
используют выборку естественных текстов для
обучения генераторов текстов.</p>
      <p>В данной работе был рассмотрен ряд алгоритмов
порождения текстов, зачастую применяемых для
порождения неестественных текстов:
• Алгоритм на основе модели «мешок
слов»;
• Алгоритм на основе цепей Маркова
порядка k;
• Алгоритм на основе копирования
фрагментов документов-образцов.</p>
      <p>Чтобы выработать общий алгоритм обнаружения
текстов, порожденных генераторами на основе
образцов, важно выделить их общие черты. В
данном разделе предлагается обобщенная модель
генератора текстов, на основе образцов.</p>
      <p>Пусть Dобразцы – набор текстов-образцов.
Рассмотрим множество троек (t): документ (d),
номер слова (m), слово, стоящее в данной позиции
(v):</p>
      <p>T = {t} = {(d , m, v)};
| T |=</p>
      <p>∑ | d |;
d∈Dобразцы
Опишем процесс порождения текста на основе
обобщенной модели. На первом шаге произвольным
образом выбирается начальное состояние цепи.
Затем на каждом последующем шаге, исходя из
матрицы вероятностей, выбирается следующее
состояние, при переходе в состояние t = (d , m, v) к
порождаемому документу добавляется слово v.
Процесс заканчивается, когда порожденный текст
достигает определенной длины.</p>
      <p>Все вышеперечисленные алгоритмы порождения
текстов на основе образцов можно представить в
виде однородной цепи Маркова с пространством
состояний T, у которой переходная матрица P
определяется разновидностью алгоритма.
2.1 «Мешок слов»</p>
      <p>Так как в данной модели вероятность
порождения любого слова на любом шаге
пропорциональна частоте этого слова в наборе,
матрица переходов будет иметь простейший вид:
1
Ptit j = P( X n+1 = t j | X n = ti ) =
(1)
| T |
;
2.2 Алгоритм на основе цепей Маркова</p>
      <p>Пусть k – порядок цепи Маркова, тогда элемент
матрицы переходов для этого алгоритма не равен
нулю, только если предыдущие k слов для двух
состояний совпадают. Введем сходства на
множестве состояний. Два состояния схожи по k
предыдущим, если предыдущие k слов для этих
двух состояний совпадают.</p>
      <p>Очевидно, отношение сходства по k
предыдущим состояниям является отношением
эквивалентности и множество состояний
разделяется на классы эквивалентности T1k ,..,TNkk .
Обозначим P(T ) - множество состояний,
непосредственно предшествующих состояниям из
множества T. Тогда вероятность перехода между
состояниями может быть выражена через их классы
эквивалентности:
⎧ 1
⎪
Ptit j = ⎨| Tlk |
⎪
⎩
, t j ∈Tlk , ti ∈ P(Tlk );
0, иначе;
(2)
2.3 Алгоритм на основе фрагментов текстов
Для генераторов на основе фрагментов текстов
введем дополнительные обозначения. Пусть B –
множество состояний, в которых фрагменты
начинаются, а E – множество состояний, в которых
фрагменты заканчиваются, тогда элемент матрицы
переходов можно выписать в следующем виде:
⎧ 1
⎪ | B | , ti ∈ E, t j ∈ B;
⎪
Ptit j = ⎨1, d i = d j , m j = mi + 1, ti ∉ E; (3)
⎪ 0, иначе;
⎪
⎩
3. Модель тематической структуры
текстов</p>
      <p>Одной из важных характеристик естественных
текстов является глобальная тематическая связность
текстов. У текстов чаще всего есть одна основная
тема, и несколько второстепенных. Изучение
неестественных текстов показывает, что они
зачастую бессмысленны и лишены единой
тематики. При этом в тексте встречаются слова из
различных документов-образцов, посвященных
разным тематикам. Таким образом, на интуитивном
уровне тематика синтетических текстов более
разнообразна и расплывчата. Чтобы использовать
это наблюдение для обнаружения неестественных
текстов, вначале формализуем понятие тематики.</p>
      <p>Предлагаемый подход к формализации понятия
тематики аналогичен лингвистической теории,
сформулированной авторами [6]. В рамках данной
теории утверждается, что любой осмысленный
документ – это некоторое высказывание над
несколькими макроконцептами. При этом разные
концепты в разной степени участвуют в
формировании текста, что соответствует основным
и второстепенным тематикам в документе.</p>
      <p>Также в модели предполагается, что тематик
конечное
множество
число.</p>
      <p>Пусть
всех
тематик,
Θ = {Θ1,.., ΘK }
тогда вектор
(4)
Теоретические исследования методов
порождения неестественных текстов позволяют
формально доказать нарушение тематической
структуры в порожденных текстах.</p>
      <p>Теорема 1. Пусть Dобразцы – набор
документовобразцов для генератора текстов, и задана
тематическая структура каждого документа. Пусть с
помощью генератора порождается документ dпорожд
длины l. Тогда с ростом l тематическая структура
порожденного документа ипорожд сходится по
вероятности к усредненной тематической структуре
документов-образцов:
∑| d |θ d</p>
      <p>∑| d |
θ порожд ⎯⎯Ρ → d∈Dобразцы
;</p>
      <p>(5)
d∈Dобразцы
Важным следствием данной теоремы является
то, что распределение тематик более разнообразно в
порожденных текстах, чем в документах-образцах.
Если в естественных текстах зачастую присутствует
одна ярко выраженная тематика, то в порожденных
документах тематика более расплывчатая.
4. Предлагаемый алгоритм обнаружения
4.1 Моделирование тематик с помощью модели
СРД</p>
      <p>
        В настоящее время существует несколько
подходов к моделированию тематик текстов. В
данной работе использовалась статистическая
модель для текстов скрытое распределение Дирихле
(СРД), также известная как Latent Dirichlet
Allocation (LDA) [
        <xref ref-type="bibr" rid="ref6">7</xref>
        ].
      </p>
      <p>В модели СРД считается, что тематика
определяется вероятностью порождения слов из
словаря. Считается, что существует ограниченное
число тематик N. При этом одно и то же слово
имеет ненулевую вероятность порождения в разных
тематиках. В данной модели каждому документу
ставится в соответствие вектор вероятностей
тематик и, порожденный из распределения Дирихле
с вектором параметров б. При этом считается, что
каждое слово в документе порождено строго одной
тематикой.</p>
      <p>Модель СРД также позволяет по имеющемуся
набору документов восстановить вероятности слов
в тематиках и веса тематик и для каждого
документа. Тематики в модели СРД,
восстановленные по коллекции текстов, обладают
рядом свойств, которые делают их похожими на
тематики в интуитивном представлении:
• Слова, которые часто встречаются
вместе в одних и тех же текстах,
получают высокий вес в одних и тех же
тематиках;
• Любое слово может порождаться
разными тематиками с разной
вероятностью;
• Часто употребляемые слова, такие как
предлоги и союзы, будут иметь высокую
вероятность порождения в любой
тематике.</p>
      <p>
        Описанные свойства позволяют рассматривать
веса тематик для документов, полученные в модели
СРД, как некоторую модель интуитивного понятия
о тематиках документа. В данной работе тематики
текстов моделировались с помощью модели СРД,
обученной на 10000 документах из коллекции
Romip.ByWeb [
        <xref ref-type="bibr" rid="ref7">8</xref>
        ]. При этом использовались
следующие параметры модели:
• Количество тематик: K=100;
• Вектор параметров распределения
Дирихле: б=(0.01,..,0.01);
4.2 Методы оценки разнообразия тематической
структуры
      </p>
      <p>Из теоремы 1 следует, что с ростом длины
порожденного документа его тематическая
структура будет стремиться к усредненной
тематической структуре набора
документовобразцов.
4.2.1 Оценка разнообразия тематической
структуры на основе критерия Пирсона
Для того чтобы оценить естественность
тематической структуры можно применить
критерий согласия Пирсона. Будем использовать
критерий Пирсона, чтобы проверить гипотезу, что
наблюдаемые веса тематик подчиняются
усредненному распределению тематик.</p>
      <p>В реальности усредненные веса тематик
документов-образцов могут быть не известны.
Чтобы обойти эту проблему воспользуемся
особенностью модели СРД. В модели считается, что
веса тематик документов подчиняются
распределению Дирихле с однородными
r
параметрами α . Математическое ожидание такой
⎛ 1
случайной величины равно ⎜
⎝ K
,..,
1 ⎞</p>
      <p>⎟ . Таким
K ⎠
образом, в качестве усредненного веса тематик в
документах-образцах можно взять математическое
ожидание весов тематик в модели СРД:</p>
      <p>K ⎛ 1 2
χ 2 (d ) = K 2 ∑ ⎜ −θ i d ⎟⎞ ; (6)
i=1 ⎝ K ⎠
4.2.2 Оценка разнообразия тематической
структуры на основе закона Ципфа</p>
      <p>
        Естественным текстам свойственен ряд
статистических закономерностей, таких как закон
Ципфа [
        <xref ref-type="bibr" rid="ref8">9</xref>
        ]. Закон Ципфа утверждает, что если
упорядочить слова текста по частотности, то
частота каждого слова будет обратно
пропорциональна его порядковому номеру.
      </p>
      <p>Предлагаемый подход опирается на гипотезу,
что для весов тематик справедлива аналогичная
закономерность – если упорядочить тематики по
весу в документе, то вес тематики будет обратно
пропорционален ее порядковому номеру. Вес
тематики иk с порядковым номером k подчиняется
следующему соотношению:
θ k (s, c) ≈
c
;</p>
      <p>(7)
k s
где s – параметр, характеризующий
разнообразие тематик в тексте, c – константа. Чем
больше параметр s тем больший вес будет у
основных тематик, чем меньше s, тем более
разнообразны тематики в документе.</p>
      <p>Для оценки разнообразия тематик в тексте
можно по частотам тематик в тексте оценить
параметры s и c. Для вычисления значения s
формулу (15) удобно привести к логарифмической
шкале:
log(θ k (s, c)) ≈ log(c) − s log(k ); (8)
Чтобы
из
этого
уравнения
получить
приближенное значение s для текста, воспользуемся
(9)
методом наименьших квадратов:
f k = log(θ k (s, c));
rk = log( k );
s = −</p>
      <p>K ∑ rk f k − ∑ rk ∑ f k
k k k</p>
      <p>⎞
K ∑ (rk )2 − ⎜⎛ ∑ rk ⎟</p>
      <p>k ⎝ k ⎠
Характеристика разнообразия тематик в тексте,
вычисленная по формуле (9) может также
использоваться как один из факторов для оценки
разнообразия тематик текстов. Чем больше
значение параметра Ципфа для текста, тем с менее
разнообразна тематическая структура документа.
4.2.3 Алгоритм машинного обучения для
обнаружения неестественных текстов</p>
      <p>Предлагаемый алгоритм машинного обучения
для обнаружения неестественных текстов состоит
из двух основных частей:
• Модель СРД, применяющаяся для
автоматического построения
тематической структуры текстов;
• Алгоритм машинного обучения на
основе деревьев решений;
При обучении данного алгоритма вначале
строится модель СРД по обучающей выборке
документов. По этой модели с помощью формул (6)
и (9) можно оценить тематическое разнообразие
естественных и неестественных документов,
содержащихся в обучающей выборке.</p>
      <p>
        Характеристики тематического разнообразия
используются как факторы при построении
автоматического классификатора. Наряду с
факторами тематического разнообразия
применяются многочисленные статистические
характеристики, предложенные в работе [
        <xref ref-type="bibr" rid="ref9">10</xref>
        ].
      </p>
      <p>В результате обучение происходит дважды:
вначале на выборке качественных документов
Таблица 1. Характеристики классификации
неестественных текстов различными вариантами
алгоритма
Точность
Полнота</p>
      <p>F-мера
БМазеошваояквселросви.я 98,41% 98,50% 98,45%
БазоЦваМя -в2е.рсия 96,19% 96,11% 96,15%
БазоЦваМя -в3е.рсия 94,08% 92,29% 93,18%
БПарзеодвлаяожвеернсиияя. 92,69% 91,87% 92,28%
УлуМчше шенонкасялвоевр.сия 99,70% 99,25% 99,47%
УлучшЦенМна-2я.версия 98,37% 97,93% 98,15%
УлучшЦенМна-3я.версия 97,72% 97,09% 97,40%
УлПучршеделнонжаяенвиеря.сия 96,23% 97,03% 96,63%
обучается модель СРД, затем по обучающему
набору обучается классификатор спама.</p>
      <p>В данной работе используется алгоритм
классификации, основанный на деревьях решений
C4.5 с добавлением процедуры объединения
нескольких деревьев путем голосования.</p>
      <p>
        При классификации текстов, с помощью
предварительно обученной модели СРД,
вычисляется разнообразие тематической структуры
текстов, затем вычисляются характеристики,
предложенные в работе [
        <xref ref-type="bibr" rid="ref9">10</xref>
        ]. В итоге
автоматический классификатор оценивает
вероятность, что текст неестественный на основе
факторов тематического разнообразия и других
статистических факторов.
5. Результаты экспериментов
      </p>
      <p>Важной частью работы является
экспериментальное подтверждение применимости
предлагаемого алгоритма обнаружения
неестественных текстов.</p>
      <p>В рамках первого эксперимента проверялась
способность предложенного алгоритма решать
модельную задачу – обнаруживать документы,
порожденные каждым из рассмотренных
алгоритмов генерации неестественных текстов.</p>
      <p>Измерялась точность полнота и F-мера
обнаружения неестественных текстов при
использовании классификатора, обученного на
выборке естественных текстов из коллекции
ROMIP.ByWeb и наборе текстов, порожденных
различными генераторами текстов:
• Генератор на основе модели «мешок
слов» (мешок слов);
• Генератор на основе цепей Маркова
порядка 2 (ЦМ-2);
• Генератор на основе цепей Маркова
порядка 3 (ЦМ-3);
• Генератор на основе копирования
предложений (предложения);
Обучающие выборки составлялись из 10000
документов из коллекции ROMIP.ByWeb в качестве
примеров естественных текстов, и 10000
документов, порожденных одним из генераторов,
обученных на текстах из той же коллекции.
Тестовые выборки составлялись аналогичным
образом и не содержали пересечения с
обучающими.</p>
      <p>
        В ходе эксперимента было построено два
классификатора для каждой тренировочной
выборки. В качестве базового был взят
классификатор с использованием характеристик,
предложенных в работе [
        <xref ref-type="bibr" rid="ref9">10</xref>
        ]. Также была построена
улучшенная версия классификатора с добавлением
характеристик тематического разнообразия
предложенных в данной работе.
      </p>
      <p>Разница в точности и полноте классификаторов
позволяет оценить выигрыш при использовании
характеристик тематического разнообразия.
Результаты эксперимента приведены в таблице 1.</p>
      <p>
        Чтобы сравнить предлагаемые алгоритмы
обнаружения поискового спама с существующими
аналогами был проведен ряд экспериментов на
наборе данных WebspamUK-2007 [
        <xref ref-type="bibr" rid="ref10">11</xref>
        ]. Этот набор
представляет собой набор всех страниц из доменной
зоны .uk, собранный за 2007 год. 4000 сайтов из
данного набора размечены вручную авторами
набора на предмет принадлежности поисковому
спаму. Набор размеченных сайтов разделен на
обучающую и тестовую выборки.
      </p>
      <p>
        В рамках эксперимента на обучающей выборке
обучались две версии алгоритма – базовая без
характеристик тематической структуры и
улучшенная, содержащая характеристики,
предложенные в разделе 4. Версии алгоритма
сравнивались между собой, а также с лучшими
результатами других исследователей на данном
наборе. В частности сравнение проводилось с
алгоритмом победителя соревнований по
обнаружению поискового спама Web Spam
Challenge 2008 [
        <xref ref-type="bibr" rid="ref13">14</xref>
        ], а также с лучшим результатом
на данном наборе, показанным алгоритмом Linked
LDA [
        <xref ref-type="bibr" rid="ref11">12</xref>
        ].
      </p>
      <p>Общепринятой метрикой для измерения
качества классификаторов поискового спама на
данном наборе является площадь под ROC-кривой
(Area Under ROC-Curve, AUC). ROC-кривая – это
кривая, которую описывает алгоритм
классификации на графике, осями которого
являются верно-положительные и
ложноположительные срабатывания. Чем больше площадь
под ROC-кривой, тем в среднем больше полнота
алгоритма при фиксированной точности.</p>
      <p>Результаты эксперимента и сравнение с
существующими аналогами приведено в таблице 2.
Как видно, улучшенный алгоритм превосходит, как
базовую версию, так и лучшие на текущий момент
алгоритмы классификации поискового спама.
Базовый алгоритм
Улучшенный алгоритм</p>
      <p>
        Linked LDA [
        <xref ref-type="bibr" rid="ref11">12</xref>
        ]
0.847
6. Результаты работы
      </p>
      <p>Для решения задачи определения автоматически
порожденных неестественных текстов разработан
новый алгоритм машинного обучения на основе
оценки разнообразия тематик документа.</p>
      <p>Теоретически и численно обоснована
применимость разработанного алгоритма для
обнаружения неестественных текстов,
порожденных генераторами текстов на основе
цепей Маркова, широко используемых для создания
веб-спама.</p>
      <p>Разработанный алгоритм апробирован на
стандартном наборе данных реальных сайтов
WebspamUK-2007. Получены более высокие
характеристики классификации веб-спама, по
сравнению с известными методами.
Литература</p>
      <p>© A.S. Pavlov</p>
      <p>This work is dedicated to development of methods
and tools for detecting mass-generated unnatural texts.
A generalized model of unnatural texts generated using
natural samples is proposed. An algorithm for unnatural
texts detection is also proposed. The algorithm is based
on theoretical properties of unnatural texts and uses
topical diversity analysis to distinguish natural and
unnatural texts. The proposed algorithm is evaluated on
web spam detection task.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Gyongyi</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Garcia-Molina</surname>
          </string-name>
          ,
          <source>H. Web Spam Taxonomy // Proceedings of the 1st International Workshop on Adversarial Information Retrieval on the Web</source>
          , May
          <year>2005</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Henzinger</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Motwani</surname>
            <given-names>R.</given-names>
          </string-name>
          , Silverstein C. Challenges in Web Search Engines // SIGIR Forum 36(
          <issue>2</issue>
          ),
          <year>2002</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>C.</given-names>
            <surname>Castillo</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Donato</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Becchetti</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Boldi</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Leonardi</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Santini</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Vigna</surname>
          </string-name>
          ,
          <article-title>A reference collection for web spam</article-title>
          ,
          <source>ACM SIGIR Forum</source>
          , v.
          <volume>40</volume>
          n.2, p.
          <fpage>11</fpage>
          -
          <lpage>24</lpage>
          ,
          <year>December 2006</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <article-title>[4] Анализаторы поисковых машин</article-title>
          . http://analyzethis.ru/.
          <year>2011</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Зеленков</surname>
            <given-names>Ю.Г.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Сегалович</surname>
            <given-names>И</given-names>
          </string-name>
          .В.
          <article-title>Сравнительный анализ методов определения нечетких дубликатов для Web-документов // Труды 9ой Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии</article-title>
          , электронные коллекции» - RCDL'
          <year>2007</year>
          , Переславль, Россия,
          <year>2007</year>
          .
          <article-title>- Том 1</article-title>
          , С.
          <fpage>166</fpage>
          -
          <lpage>174</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Blei</surname>
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ng</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Jordan</surname>
            <given-names>M</given-names>
          </string-name>
          .
          <source>Latent Dirichlet allocation // Journal of Machine Learning Research</source>
          ,
          <volume>3</volume>
          (
          <issue>5</issue>
          ):
          <fpage>993</fpage>
          -
          <lpage>1022</lpage>
          ,
          <year>2003</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <article-title>[8] Веб коллекция BY.web</article-title>
          . http://romip.ru/ru/collections/by.web-2007.html.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Gelbukh</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sidorov</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          <article-title>Zipf and Heaps Laws' Coefficients Depend on Language //</article-title>
          <source>In Proceedings of the Conference on Intelligent Text Processing and Computational Linguistics (CICLing-2001), February 18-24</source>
          ,
          <year>2001</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Павлов</surname>
            <given-names>А.С.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Добров</surname>
            <given-names>Б</given-names>
          </string-name>
          .В.
          <article-title>Методы обнаружения поискового спама, порожденного с помощью цепей Маркова // Труды 11й Всероссийской научной конференции "Электронные библиотеки: перспективные методы и технологии, электронные коллекции"</article-title>
          - RCDL'
          <year>2009</year>
          , Петрозаводск:
          <year>2009</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [11] Yahoo! Research:
          <article-title>"Web Spam Collections"</article-title>
          . http://barcelona.research.yahoo.net/webspam/datase ts/ Crawled by the Laboratory of Web Algorithmics, University of Milan, http://law.dsi.unimi.it/. URLs retrieved May
          <year>2007</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [12]
          <string-name>
            <given-names>I.</given-names>
            <surname>Bнrу</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Siklуsi</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Szabу</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A. A.</given-names>
            <surname>Benczъr</surname>
          </string-name>
          ,
          <article-title>Linked latent Dirichlet allocation in web spam filtering</article-title>
          ,
          <source>Proceedings of the 5th International Workshop on Adversarial Information Retrieval on the Web, April 21-21</source>
          ,
          <year>2009</year>
          , Madrid, Spain.
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Geng</surname>
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Jin</surname>
            <given-names>X.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wang</surname>
          </string-name>
          . C.
          <article-title>-</article-title>
          H. CASIA at Web Spam Challenge 2008
          <source>Track III // Proceedings of the 4th international workshop on Adversarial information retrieval on the web</source>
          , Beijing, China. ACM,
          <year>2008</year>
          .
          <volume>32</volume>
          _
          <fpage>33</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [14]
          <string-name>
            <given-names>Web</given-names>
            <surname>Spam</surname>
          </string-name>
          <article-title>Challenge</article-title>
          . http://webspam.lip6.fr/wiki/pmwiki.php,
          <year>2008</year>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>