<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Подход к фильтрации запрещенного контента в веб- пространстве</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>lsidorova@iis.nsk.su</string-name>
          <email>lsidorova@iis.nsk.su</email>
        </contrib>
        <contrib contrib-type="author">
          <string-name>© E.A. Sidorova</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>© I.S. Kononenko</string-name>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Novosibirsk State University</institution>
          ,
          <addr-line>Novosibirsk</addr-line>
          ,
          <country country="RU">Russia</country>
        </aff>
      </contrib-group>
      <fpage>64</fpage>
      <lpage>71</lpage>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        Задача избирательного распространения
информации, сформулированная Луном (Luhn) в
1958 г., получила наименование «фильтрация» в
1975 г. (Denning). Система фильтрации контролирует
поток документов, отбирая в нем полезные
документы в соответствии с некоторым критерием
(информационная потребность пользователя). Более
полно задача определена в [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]: процесс фильтрации
предназначен для отбора или удаления информации
из динамического потока данных.
Труды XIX Международной конференции
«Аналитика и управление данными в областях с
интенсивным использованием данных»
(DAMDID/ RCDL’2017), Москва, Россия, 10–13
октября 2017 года
      </p>
      <p>Введение законодательного регулирования
содержания информационных ресурсов обострило
проблему обнаружения и блокировки запрещенного
контента, к которому относится любое запрещенное
государством для просмотра и ознакомления
информационное наполнение ресурса или веб-сайта
(текст, мультимедиа, графика). При существующей
скорости прироста и обновления информации в
полной мере контролировать ее содержание с
помощью модераторов-людей практически
невозможно.</p>
      <p>
        Современные подходы к автоматической
фильтрации запрещенного контента чаще всего
основаны на использовании списков ссылок на сайты
(URL-фильтрация) [13], распознавании ключевых
слов из списка запрещенных, а также на основе
тематической классификации, например [
        <xref ref-type="bibr" rid="ref6 ref9">6, 10</xref>
        ].
Указанные методы не дают требуемого качества: в
первом случае списки составляются вручную и не
позволяют оценивать новые сайты, во-втором случае
ключевые слова дают очень грубую оценку и либо
ложно блокируют сайты с употреблением терминов
в других смыслах, либо недостаточно полно
покрывают способы выражения запрещенной
информации. Что касается тематической
классификации, то, помимо большой зависимости от
обучающей выборки, она не позволяет определить
цели, с которыми дается та или иная информация,
что приводит к ложному срабатыванию фильтра, а
для огромных массивов интернет-данных это
недопустимо.
      </p>
      <p>
        При рассмотрении различных методов
фильтрации [
        <xref ref-type="bibr" rid="ref3 ref5">3, 5</xref>
        ], таких, как Boolean Information
Filtering, Vector Space Model, Neural Networks и т. п.,
подчеркивается важность семантических проблем,
т. е. проблем неоднозначности терминов
(синонимия, полисемия, омонимия), затрудняющих
сопоставление терминов в процессе содержательной
фильтрации. Для преодоления семантических
проблем, например, в [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], предложен метод,
основанный на лингвистической онтологии, в
качестве которой используется WordNet [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ].
Основным недостатком такого подхода является
трудоемкость построения лингвистической
онтологии для заданного языка и предметной
области.
      </p>
      <p>В предлагаемом нами решении используется
комплексный подход, при котором решение о
запрещенности страницы принимается на основании
не только ее тематики, но и прагматики, т. е. вида
деятельности, осуществляемой посредством сайта в
целом. Дополнение тематического анализа
жанровым, а также использование лексических
признаков, позволяющих явным образом задать
семантику терминов, дает возможность более точно
распознать и локализовать запрещенный контент.
2 Задача фильтрации контента</p>
      <p>
        Фильтрация текстового контента традиционно
рассматривается как разновидность
информационного поиска. С другой стороны,
фильтрацию можно рассматривать как особый
случай классификации по двум категориям
(релевантные и нерелевантные). В обзоре [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ]
сформулированы сходства и различия
информационного поиска, фильтрации и бинарной
категоризации. Фильтрация, в отличие от поиска,
основана не на запросах, а на представлении
индивидуальных или групповых интересов (профиль
пользователя). Запрос – сиюминутный интерес, а
профиль – долговременный (возможно меняющийся)
интерес.
      </p>
      <p>Базовое сходство всех направлений заключается
в наличии следующих компонентов:
1. Представление веб-объекта (документа).
2. Представление информационного класса
(информационной потребности, категории,
профиля пользователя).
3. Сопоставление документа и класса с помощью
алгоритмов, вычисляющих меру сходства.</p>
      <p>Запрещенный контент − это любое
содержательное наполнение веб-сайта,
предоставление которого для просмотра и
ознакомления запрещено государством. На
территории РФ действует федеральный закон №
149ФЗ «Об информации, информационных технологиях
и о защите информации», в соответствии с которым
устанавливаются основания для включения сайтов в
список запрещённых. Список тематик блокируемых
ресурсов открыт и включает, к примеру, такие типы
запрещенного контента, как: контент,
предназначенный только для взрослых, пропаганда
против отдельного лица, группы или организации;
материалы, связанные с наркотиками; контент,
связанный с оружием, и др.</p>
      <p>Для апробации предлагаемого подхода в качестве
запрещенного рассматривался текстовый контент на
русском языке, относящийся к теме «Наркомания и
наркотики».</p>
      <p>В силу высокой сложности задачи выявления
запрещенного контента предложенное решение
основано на совокупности различных методов
анализа текстов и интернет-документов, включая
методы машинного обучения и инженерный подход.</p>
      <p>Машинное обучение не является полностью
автоматическим, оно также требует экспертной
деятельности по аннотированию обучающего
множества текстов метками классов. Однако
сформированные автоматически (хотя и на основе
экспертной разметки) описания классов содержат
много «шумящей» лексики, которая на этапе
классификации текстов понижает точность работы
алгоритма.</p>
      <p>Инженерный подход предполагает создание
описаний классов с участием эксперта, который,
используя ускоряющие его деятельность
программные модули нормализации текста и
генерации частотных словарей, формирует ресурсы
для классификатора. Несмотря на трудоемкость
реализации, инженерный подход обеспечивает
высокое качество классификации текстов за счет
экспертной фильтрации «шума» и дополнения
словарей (описаний классов) недостающей
лексикой, отсутствующей в обучающей коллекции.</p>
      <p>Особенность предлагаемого решения состоит в
интеграции тематических и жанровых методов
классификации текстовых ресурсов на базе
инженерных правил принятия решения о наличии
вредоносного контента. Использование
тематических градаций в теме «Наркомания и
наркотики» обеспечивает построение ее описания во
всем многообразии и полноту классификации
контента.</p>
      <p>Необходимость использования жанровой
классификации вызвана особенностями основной
темы и требованиями к принимаемому решению –
определению принадлежности контента к двум
классам: запрещенному контенту и незапрещенному.
Определение жанра позволяет уточнить решение,
полученное на базе тематической классификации.
Этому же способствуют используемые логические
правила принятия решения о запрещенности
контента, построенные на основе результатов
жанровой и тематической классификации.</p>
      <p>В силу особенностей текстов исследуемой
тематики традиционный алгоритм обработки текстов
дополнен модулем анализа специальной
тематической и стилистически окрашенной лексики
– научная терминология, сленг наркоманов,
обесценная лексика, жаргон
интернетпользователей, тематическая лексика на латинице и
транслите.</p>
      <p>Для оптимизации времени работы приложения
алгоритм реализуется в два этапа:
1. предварительный анализ: установление наличия
в тексте лексики, характерной для заданной
тематики;
2. основной алгоритм: тематическая и жанровая
классификации с принятием окончательного
решения о запрещенности / незапрещенности
контента.</p>
      <p>Предусмотрена возможность обоснования
полученных решений путем предоставления
промежуточных результатов работы алгоритма
фильтрации в понятной для конечного пользователя
форме: найденной лексики, полученной уточненной
тематики, жанра и используемых решающих правил.
3 Модель знаний</p>
      <p>Предлагаемое нами решение основано на
использовании лингвистических и предметных
знаний и включает следующие ресурсы:
1. Рубрикаторы: тематический, жанровый (жанры
интернет-текстов), прагматический (жанры
сайтов) и лексический (признаки терминов).
2. Предметный словарь, включающий
тематическую и жанровую лексику.
3. Жанровые шаблоны веб-текстов.
4. Прагматические модели веб-сайтов.
5. Решающие правила.</p>
      <p>Рассмотрим их подробнее.</p>
      <p>Тематический рубрикатор вводит уточняющие
подтемы для базовой тематики «Наркомания и
наркотики» и включает как запрещенные темы, так и
незапрещенные (см. Рис. 1).</p>
      <p>Назначение данного рубрикатора:
• отделить сайты по заданной тематике;
• дать объяснение пользователю, почему сайт
заподозрен или отнесен к запрещенным.</p>
      <p>Жанровый рубрикатор предназначен для
классификации веб-страниц и веб-сайтов по жанрам,
что в дальнейшем используется как для уточнения
тематической классификации, так и для повышения
качества фильтрации на основе правил.
Рисунок 1 Фрагмент тематического рубрикатора
Выделяются такие жанры веб-ресурсов, как
Торговая площадка, Аптека, Сайт медицинской
организации, Энциклопедический ресурс, Новостная
лента, Персональная страница, Комментарий и т. п.</p>
      <p>Предметный словарь − структурированное
хранилище терминов (слов и словокомплексов), в
котором содержится вся необходимая информация
для предварительного отбора тематически
релевантных страниц, тематического и жанрового
анализа текстового контента и принятия решения о
блокировке.</p>
      <p>Начальное наполнение словаря генерируется на
этапе обучения с использованием размеченного
экспертами корпуса веб-страниц, относящихся к
исследуемой тематике, с применением
универсального морфоанализатора, снабженного
функцией предсказания незнакомой лексики.</p>
      <p>Дополнительными источниками тематической
лексики являются законодательно утверждённые
Правительством РФ перечни наименований
контролируемых наркотических средств,
психотропных веществ и их прекурсоров, а также
соответствующих видов растений, которые
периодически пополняются и корректируются
(примерно раз в год). Соответствующие документы
доступны на официальных интернет-сайтах
правовой информации, таких, как www.consultant.ru
и pravo.gov.ru.</p>
      <p>Далее осуществляется настройка предметного
словаря экспертами, которые выделяют в его составе
специальные подсловари, используя систему
лексических признаков: тематическая лексика,
научные термины, сленг наркоманов, термины на
латинице, жанровая лексика и др. В задачу экспертов
входит пополнение этих подсловарей, выявление
регулярных ошибок фильтрации и формирование
правил для изменения состава и структуры словаря.</p>
      <p>Для создания и настройки словаря
использовалась технология создания
терминологических словарей KLAN [12].</p>
      <p>Жанровые шаблоны веб-текстов формируются
на основе лексических маркеров жанра и условий их
встречаемости в текстовом фрагменте. Маркеры
строятся на основе терминов словаря, при этом
используются возможности представления
совместной встречаемости терминов,
альтернативности терминов в конкретной позиции
(квазисинонимия), а также иерархической
вложенности маркеров друг в друга. Например,
страницы сайта типа Торговая площадка содержат
следующие элементы:
•
•
•
количественные конструкции (маркер: единица
измерения “гр”, “мгр”),
списки количественных конструкций (прайсы) с
маркерами из жанровой лексики:
Цены: 5гр. – 5 000 р, 10гр.–- 9 000 р
жанровая лексика: цена, товар, закладка.</p>
      <p>Шаблон веб-страницы составляется из маркеров,
на которые накладываются позиционные условия на
тип фрагмента (заголовок, ссылка, выделенный
текст, текст). Как и при описании маркеров,
поддерживаются альтернативы и совместная
встречаемость маркеров.</p>
      <p>Рассмотрим для примера новостной шаблон:
«новостная лента»: [&lt;_навигацияНовость, all_h&gt;]
_навигацияНовость: [«главное за сутки»]
[«главное за сегодня»][«главное за день»]
[«все новости»][«основные новости»]
[«последние новости»][«лента новостей»]
Содержательно данный шаблон описывает
следующее правило: если в одном из заголовков
встретится один из маркеров группы
_навигацияНовость, то это новостная лента.</p>
      <p>Модель веб-сайта задается набором жанров
вебстраниц, которые обязательно должны
присутствовать на сайте и являются в совокупности
его отличительным признаком. Для каждого сайта
может быть задано несколько шаблонов. Например,
модель интернет-магазина представлена двумя
альтернативами:
[Магазин, Описание товара, ПредложениеТовара,
Корзина, Доставка, Оплата]
[Магазин, Описание товара, ПредложениеТовара,
CтатусЗаказа]
Принятие решения осуществляется на основе
решающих правил, в посылках которых описываются
условия того, будет ли анализируемый контент
запрещен или разрешен. Эти условия строятся на
термах, значениями которых являются конкретные
тематики, жанры текста, жанры сайта и лексические
признаки. Применяются правила двух видов:
положительные и отрицательные,
характеризующие текст, соответственно, как
разрешенный или запрещенный. Правилами
описываются, например, следующие экспертные
наблюдения:</p>
      <p>a) Если анализируемому контенту приписан
лексический признак &lt;40&gt; «Обсценная лексика», он
отнесен к тематике [601] «Употребление
наркоманами» и жанру &lt;401&gt; «Торговая площадка»
или (404) «Научная/информационная статья», то
текст следует отнести к запрещенному контенту;
b) Текст по теме [1102] «Выращивание
наркотических растений», написанный в жанре (407)
«Словарная статья», относится к незапрещенному
контенту. А текст по той же теме, представленный в
ином жанре, может диагностироваться правилами
как запрещенный контент и т. п.</p>
      <p>Экспертные правила, помимо полноты, обладают
высокой объяснительной способностью, что
является существенным для нашей задачи.</p>
      <p>Отметим, что правила принятия решений можно
было бы сформировать автоматически при
достаточном объеме обучающей выборки.
Эксперимент показал, что экспертные правила не
противоречат правилам, сформированным
автоматически по обучающей выборке. Таким
образом, можно рассматривать такой метод
автоматического формирования правил как способ
верификации правил, написанных экспертом.
4 Фильтрация контента</p>
      <p>Анализ текстового контента осуществляется в
несколько этапов. К основным этапам относятся
тематическая и жанровая классификация текста,
жанровый анализ сайта и принятие решения о
запрещенности контента.</p>
      <p>Объем статьи не позволяет в полной мере
раскрыть каждый этап обработки текста, поэтому мы
сконцентрируемся на основных идеях и
используемых подходах.
4.1 Классификация текста</p>
      <p>Прежде всего, необходимо уметь выявлять
соответствие контента исследуемой тематике
(подозрительность текста). При принятии решения
о степени подозрительности контента необходимы:
а) Словарь тематической лексики, присутствие
которой в тексте позволяет предположить тему
«Наркомания и наркотики». Словарь содержит слова
и словосочетания данного лексико-семанти-ческого
поля, как специальные научные и нейтральные, так и
жаргонные (сленг наркоманов). Эта лексика
включает названия наркотиков, наркосодержащих
лекарств и растений, названия состояний под
воздействием наркотиков и т. п.</p>
      <p>б) Критерий для определения возможной
принадлежности к данной теме (степени
подозрительности) текста, содержащего термины из
словаря. Вычисление критерия опирается на степень
присутствия тематической лексики с учетом
лексического признака однозначности/
неоднозначности (омонимичная, т. е. тематически
неоднозначная лексика из рассмотрения на данном
шаге исключается).</p>
      <p>Для подозрительных текстов применяется
уточняющая классификация в соответствии с
заданными рубриками с использованием весовых
характеристик терминов, вычисляемых как
ожидаемая взаимная информация (EMI) [9]. Данная
мера позволяет оценить, сколько информации о
классе – в теоретико-информационном смысле –
содержит термин. Обучение и настройка алгоритма
классификации производилась с участием эксперта.</p>
      <p>
        При оценке релевантности текста классу
(тематике) помимо веса термина учитывалась «зона
текста», в которой встретился термин [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]: так,
например, вес терминов в заголовках удваивался.
      </p>
      <p>
        Способ взвешивания терминов, основанный на
расчете EMI, дает улучшение на 5% по сравнению со
способом взвешивания типа TF*IDF.
4.2 Жанровый анализ
В отличие от основной
массы
подходов к
фильтрации, которые реализуют только
контентанализ страниц ресурсов, т. е. тематический анализ
по ключевым словам, либо ограниченный жанровый
анализ
(преимущественно
по
формальным
признакам, таким, как длина текста, количество
букв, цифр и специальных признаков, количество
ссылок и т. п. [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ]), предложенный нами
подход
осуществляет
тематический
многоаспектный
      </p>
      <p>жанровоанализ
и
классификацию.
Используемые в рамках данного подхода признаки
классификации явным или опосредованным образом
не</p>
      <p>только
отражают
ресурсов,
прагматические
но
и
аспекты
тематику
такие</p>
      <p>анализируемых
коммуникативножанра,
как
вид
деятельности, осуществляемой посредством ресурса,
включая цели и задачи деятельности и целевую
аудиторию как ее участника, медийные свойства
ресурсов,
стилистические
особенности
используемых языковых средств.</p>
      <p>Признаки жанрово-тематической классификации
делятся на группы, каждая из которых отражает
определенный аспект классификации:
Макроуровень – ресурс в целом;
Микроуровень
страница, раздел, блок).</p>
      <p>(компоненты
ресурса:
4. Жанрово-прагматическая
классификация
ресурсов (на основе прагматических аспектов
содержания и представления):
Праксиологические
(деятельностные)
аспекты
(вид</p>
      <p>деятельности,
осуществляется посредством ресурса);
которая
Аспекты
связанные
содержания</p>
      <p>и
с</p>
      <p>каналом
(медийные свойства ресурсов).
представления,
коммуникации
5. Жанрово-стилистическая
классификация
ресурсов:
Лексико-стилистические
содержания
и</p>
      <p>аспекты
представления
(стилистические особенности используемых
языковых
стилистически
средства).</p>
      <p>средств
с
акцентом</p>
      <p>на
окрашенные
языковые
Представление о жанре закладывается на этапе
формирования
целенаправленно
экспертами.
классификации
обучающей
выборки,</p>
      <p>которая
отбирается
и</p>
      <p>размечается
Предлагаемая
процедура</p>
      <p>жанровой
совмещает
статистический
и
экспертный подходы к анализу жанра и опирается на
метод вычисления меры принадлежности текста к
жанру
методов машинного обучения.
4.3 Принятие решения на основе правил
Решение
контента
параметров:
о</p>
      <p>запрещенности/незапрещенности
принимается
на
основе
следующих
∑</p>
      <p>=1  (  )= 1;
1.  ̅ =(p(t1), p(t2), ..., p(ti), ..., p(tNt)) – вектора
релевантности текстового контента тематикам
рубрикатора,
где</p>
      <p>Nt
–
число
рубрикаторе, p(ti) – вероятность
тематик в
реализации
тематики ti в анализируемом тексте, i = 1, ..., Nt;
2.  ̅⁡=(p(j1), ..., p(jNj)) – вектора релевантности

контента текста</p>
      <p>жанрам текста, заданным в
жанровом рубрикаторе, где Nj – число жанров
текста в рубрикаторе; 
∑
 =1  (  )= 1;
3.  ̅ ⁡=(p(js1), ... ,p(jsNs)) – вектора релевантности
контента всего сайта жанрам сайта, заданным в
рубрикаторе, где Ns – число жанров сайта в
рубрикаторе; 
помощью веб-браузера на стороне клиента,
формируется в общем случае из множества
вебтекстов с добавлением незначащего для анализа
контента – элементов оформления страницы,
баннеров, рекламы и т. п., а также медиа-контента.</p>
      <p>Обработка сайта начинается с анализа его
структуры, затем формируется начальный индекс
сайта (в случае обновления сайта индекс
модифицируется), фиксируются зависимости между
веб-текстами. После этого тексты сайта
последовательно анализируются.
Рисунок 2 Схема выявления запрещенного
контента</p>
      <p>Каждый веб-текст очищается от html-разметки
(значащие элементы разметки, такие, как заголовки,
ссылки, выделение фрагмента стилем, сохраняются),
осуществляется лингвистический анализ текста,
обеспечивающий поиск в нем терминов словаря, и
сбор статистической информации. Далее
производится оценка тематической принадлежности
текста к базовой теме «Наркомания и наркотики» –
т. н. «оценка подозрительности» текста (текст
считается подозрительным, если его контент
соответствует базовой теме). В определении
подозрительности участвует только однозначная
лексика, наличие которой позволяет снять
возможную тематическую неоднозначность текста.
Для неподозрительных текстов дальнейшая оценка
запрещенности не проводится, определяется лишь
жанр текста, который заносится в индекс сайта.</p>
      <p>Жанровая классификация позволяет определить
жанр текста на основе словаря маркеров и
структурного анализа текста в соответствии с
разметкой. Если на основе маркеров и жанровых
шаблонов жанр веб-текста определить не удалось, то
применяется уточняющая классификация на основе
методов машинного обучения.</p>
      <p>Уточняющая классификация обеспечивает не
только определение жанра текста, но и уточнение
(конкретизацию) его тематики в соответствии с
типами противоправных и разрешенных действий в
рамках темы «Наркомания и наркотики». При
уточняющей классификации используется
обученный на размеченном корпусе текстов
предметный словарь. Результатом уточняющей
классификации являются векторы релевантности
текста темам и жанрам, которые сохраняются в
индексе сайта.</p>
      <p>После первичной обработки всех веб-текстов
сайта осуществляется анализ его жанра. Каждый
жанр сайта описывается одной или несколькими
моделями. Модель сайта фиксирует набор жанров
текста, которые обязательно должны встретиться на
сайте данного жанра. Данные модели составляются
экспертами вручную на основе анализа структуры
веб-сайтов обучающей коллекции. Вычисление
оценки степени соответствия сайта какому-либо
жанру осуществляется по моделям сайтов и оценкам,
полученным для жанров веб-текстов сайта.
Полученные оценки для жанра веб-сайта и
составляющих его веб-текстов сохраняются в
индексе сайта.</p>
      <p>Принятие решения о запрещенности сайта
осуществляется на основе решающих правил,
которые применяются только для подозрительных
текстов. Особенностью параметра подозрительности
текста является то, что он «распространяется» на все
связанные тексты (связи между текстами
фиксируются структурой сайта и хранятся в индексе
сайта). Поэтому на стадии предварительной
обработки осуществляется поиск всех
подозрительных текстов по связям и выполнение
уточняющей классификации для тех из них, для
которых она ранее не проводилась. Результатом
применения правил к тексту является оценка
запрещенности страницы.</p>
      <p>Оценка запрещенности всего сайта определяется
как максимум из оценок запрещенности по всем
текстам сайта.
6 Результаты эксперимента</p>
      <p>Для оценки качества фильтрации были
сформированы одна обучающая и две тестовых
коллекции, содержащие веб-тексты:
1. Обучающая коллекция, состоящая из 468
вебтекстов на русском языке, относящихся к теме
«Наркомания и наркотики». Все тексты
размечены экспертами. Разметка включает
экспертную оценку запрещенности /
незапрещенности контента, тематику, жанр
вебтекста и жанр веб-сайта, на котором был
размещен данный текст.
2. Тестовая коллекция веб-текстов, включающая
около 123 тыс. русскоязычных веб-страниц, часть
которых относится к теме «Наркомания и
наркотики», но не содержит запрещенный
контент.
3. Коллекция собрана вручную на основе сайтов
Яндекс-каталога (https://yandex.ru/yaca). Тестовая
коллекция веб-текстов, включающая 569
вебтекстов на русском языке, содержащих
запрещенный контент по теме «Наркомания и
наркотики».</p>
      <p>Полученные коллекции включают веб-тексты
различных функциональных стилей – от
нормативных и официальных документов до
сообщений и комментариев на форумах и в
социальных сетях, – что позволяет адекватно
оценить качество фильтрации на всем многообразии
интернет-жанров. К сожалению, в открытом доступе
отсутствуют размеченные коллекции текстов по
данной тематике, чем объясняется небольшой объем
первой и третьей коллекций, которые создавались
нашими экспертами вручную. Объем веб-текстов в
коллекциях варьировался от 213 до 65655 Кб.</p>
      <p>На основе обучающего корпуса текстов был
построен словарь, который в дальнейшем был
дополнен терминами из специализированных
словарей. Словарь содержит более 50 тыс. терминов
(без учета стоп-слов). Его общий количественный и
качественный состав отражен в Таблице 1.</p>
      <p>Таблица 1 Терминологический состав словаря
Лексем Слово- Подозри- Жанро- Сленг
комплексов тельных вых
24175 26540 5349 1895 3161
Как видно из таблицы 1, ключевые слова для
предварительного отбора текстов по теме
(«подозрительные», т. е. однозначные тематические
термины) составляют десятую часть объема словаря.</p>
      <p>Оценка качества классификации была дана в виде
показателей полноты (R), точности (P) и F-меры.
Рассматривалась бинарная классификация (1) и
уточняющая тематическая классификация (2). Оба
сравниваемых метода основаны на машинном
обучении, но во втором случае используется
расширенный набор тем, причем для каждой из них
указано, является ли она запрещенной или нет.
(1)
(2)
Таблица 2 Сравнение методов классификации
R P F-мера Скорость
52,0% 65,4% 57,9% ~ 0,07 мс
72,6% 69,7% 71,1% ~ 0,10 мс
Как видно из Таблицы 2, использование
уточняющего тематического рубрикатора,
построенного по специальной ориентированной на
задачу фильтрации методике, позволило улучшить
показатели полноты и точности в сравнении с
бинарной классификацией (когда контент сразу
классифицируется на два класса – запрещенный и
незапрещенный), соответственно, на 20% и 10%.
Однако эти показатели все еще являются низкими.
Таблица 3 Оценка качества фильтрации
Кол-во Правильных
(страниц) ответов (%)
Нейтральная
коллекция
Отрицательная
коллекция
~ 123 тыс.</p>
      <p>99.4%
569
фильтрации, в которой тематическая классификация
сочетается с жанровой и применяются решающие
правила (отметим, что результаты, полученные
тематическим классификатором, использовались
здесь в качестве промежуточных.)</p>
      <p>Таким образом, ошибка первого рода составила
0,6%, ошибка второго рода – 13,01%.</p>
      <p>Большая часть ошибок обоих типов связана с
неполнотой словаря. Так, возможны существенные
лакуны в подсловарях латиницы и транслита
(например, отсутствуют названия наркотиков
25inbome, JWH, нбоме, дживиаш). Не всегда в словаре
учтена возможная лексическая или
лексикоморфологическая неоднозначность (например, доб.
может представлять в тексте наркотик или
сокращение от добавочный).</p>
      <p>Ложно-положительная оценка характерна для
страниц, которые не проходят предварительный этап
фильтрации ввиду отсутствия однозначной
тематической лексики. Так, не блокируются
(отсеиваются как неподозрительные) страницы,
содержащие предложения или рекламу
наркотических веществ, завуалированные путем
использования неоднозначной лексики (например,
соли для ванн), а также намеренно искаженные
(зашифрованные) тексты.</p>
      <p>Ложно-отрицательная оценка характерна для
следующих типов веб-текстов: а) информационные
статьи о наркотических веществах или растениях (в
частности, о выращивании декоративных растений),
жанр которых не определен как энциклопедическая/
словарная статья; б) новостные тематические тексты
с позитивной окраской (Умеренное потребление
алкоголя и амфетамина может улучшить память у
пожилых людей); в) тематически нейтральные
страницы комментариев на форумах и в блогах с
вкраплением шутливых тематических комментариев
(Наркотой там не барыжите, случайно? – реплика
при обсуждении вопросов информационной
безопасности).
Заключение</p>
      <p>Предложенный подход реализован в виде
приложения, интегрированного в платформу Plesk.
Приложение позволяет выявлять и блокировать
сайты, содержащие запрещенную информацию по
теме «Наркомания и наркотики» и/или
осуществляющие незаконную деятельность по
торговле, распространению, транспортировке,
изготовлению и пропаганде наркотиков.</p>
      <p>К преимуществам предложенного подхода
относятся, во-первых, глубокий анализ текстового
контента веб-ресурса с учетом его тематических и
жанровых особенностей, во-вторых, совмещение
статистических и инженерных методов анализа
текста, в частности, предложен уникальный метод
принятия решения о запрещённости контента на
основе решающих правил, учитывающих результаты
его жанровой и тематической классификации,
втретьих, масштабируемость и технологичность
разработанных программных средств, что позволяет
легко адаптироваться к различным предметным
областям посредством настройки базы знаний.</p>
      <p>В предложенном подходе, на наш взгляд,
достигнут баланс между ручной работой эксперта и
автоматическим обучением, где, во-первых, словари
создаются и обучаются автоматически, а эксперты
пополняют их номенклатурными терминами и
сленгом, во-вторых, неполнота жанровых
(функциональных) описаний интернет-ресурсов
(создаются экспертом) компенсируется поддержкой
статистического жанрового классификатора, и
наконец, решающие правила потенциально могут
строиться автоматически, а оценка применимости
правила для каждого конкретного случая
оценивается по вероятностной формуле.</p>
      <p>Дальнейшее развитие описанной технологии
связано с необходимостью автоматизации
поддержки словаря в актуальном состоянии.
Автоматизация возможна на базе жанрового анализа
страниц, относящихся к жанрам «Нормативный
список» (отслеживание словарей официальных
наименований контролируемых веществ и растений)
и «Словарная статья» (отслеживание словарей
универсального и тематического сленга, обсценной
лексики). Однако главным источником тематической
лексики по-прежнему остаются эксперты, т. к.
интернет-словари тематического сленга
существенно отстают от происходящих в среде
наркоманов изменений лексики.</p>
      <p>В качестве актуального направления
исследований по данной тематике также
рассматривается возможность применения методов
сентимент-анализа для улучшения распознавания
трудноуловимой темы пропаганды наркотиков,
представленной в информационных сообщениях,
создающих привлекательный образ наркомана и
процесса употребления наркотических веществ.
Благодарности
Литература</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Cohen</surname>
            ,
            <given-names>William W.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Singer</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          :
          <article-title>Context-sensitive Learning Methods for Text Categorization</article-title>
          .
          <source>ACM Transactions on Information Systems</source>
          ,
          <volume>17</volume>
          , pp.
          <fpage>141</fpage>
          -
          <lpage>173</lpage>
          (
          <year>1999</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Goґmez</surname>
          </string-name>
          ,
          <string-name>
            <surname>Josґe</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Giraґldez</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>De Buenaga</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          :
          <article-title>Text Categorization for Internet Content Filtering</article-title>
          . Inteligencia Artificial, Revista Iberoamericana de Inteligencia Artificial,
          <volume>920</volume>
          , pp.
          <fpage>34</fpage>
          -
          <lpage>52</lpage>
          (
          <year>2003</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Khozooii</surname>
            ,
            <given-names>N.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Haratizadeh</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Keyvanpour</surname>
            ,
            <given-names>M.R.:</given-names>
          </string-name>
          <article-title>An Analytical Framework for Web Information Filtering Techniques</article-title>
          .
          <source>Int. J. of Hybrid Information Technology</source>
          ,
          <volume>6</volume>
          (
          <issue>6</issue>
          ), pp.
          <fpage>345</fpage>
          -
          <lpage>358</lpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Nanas</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          :
          <article-title>Literature Review: Information Filtering for Knowledge Management</article-title>
          . The Open University,
          <year>2001</year>
          . http://kmi.open.ac.uk/publications/ pdf/kmi01-
          <fpage>16</fpage>
          .pdf
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Nouali</surname>
            <given-names>O.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Blache</surname>
            <given-names>P</given-names>
          </string-name>
          .
          <article-title>Automatic Classification and Filtering of Electronic Information: KnowledgeBased Filtering Approach</article-title>
          .
          <source>Int. Arab J. of Information Technology</source>
          ,
          <volume>1</volume>
          (
          <issue>1</issue>
          ), pp.
          <fpage>85</fpage>
          -
          <lpage>92</lpage>
          (
          <year>2004</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Sebastiani</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          :
          <source>Machine Learning in Automated Text Categorization. ACM Computing Surveys</source>
          ,
          <volume>34</volume>
          (
          <issue>1</issue>
          ), pp.
          <fpage>1</fpage>
          -
          <lpage>47</lpage>
          (
          <year>2002</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Shoval</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Maidel</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Shapira</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          :
          <article-title>An Ontology Content-based Filtering Method</article-title>
          .
          <source>Int. J. Information Theories &amp; Applications</source>
          , 15, pp.
          <fpage>303</fpage>
          -
          <lpage>314</lpage>
          (
          <year>2008</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Воронов</surname>
            ,
            <given-names>С.О.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Воронцов</surname>
          </string-name>
          , К.В.:
          <article-title>Автоматическая фильтрация русскоязычного научного контента методами машинного обучения и тематического моделирования. Компьютерная лингвистика и интеллектуальные технологии: По материалам ежегодной Межд</article-title>
          . конф. «Диалог».
          <year>2015</year>
          . http://www.dialog-
          <volume>21</volume>
          .ru/digests/ dialog2015/materials/pdf/VoronovSOVorontsovK V. pdf
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Патент</surname>
            <given-names>РФ</given-names>
          </string-name>
          №
          <fpage>2446460</fpage>
          ,
          <string-name>
            <surname>МПК</surname>
          </string-name>
          <article-title>G06F21/20. Способ и система фильтрации веб-контента /Осипов Г</article-title>
          .С.,
          <string-name>
            <surname>Тихомиров</surname>
            <given-names>И</given-names>
          </string-name>
          .А.,
          <source>Соченков И.В.; патентообладатель ИСА РАН; заявл. 2010-11- 18; опубл. 27.03</source>
          .2012
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>