<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Lotus Script,
встоенные классы Lotus Script и Java. - М.:изд.
«Светотон»</journal-title>
      </journal-title-group>
    </journal-meta>
    <article-meta>
      <title-group>
        <article-title>Статистическая обработка общественно-политических текстов о регионах России</article-title>
      </title-group>
      <pub-date>
        <year>2000</year>
      </pub-date>
      <volume>935</volume>
      <fpage>18</fpage>
      <lpage>19</lpage>
      <abstract>
        <p>В статье описываются методы и результаты обработки большого массива общественнополитических текстов о регионах России, собранного за 15 лет, начиная с 2001 года. Статистическая обработка осуществлялась с помощью программы анализа данных AtteStat в среде электронных таблиц Microsoft Excel. Результаты работы могут быть полезны системным администраторам, планирующим размещение информации на серверах, а также экспертам, оценивающим общественнополитическую жизнь регионов России.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>В последние годы заметно вырос интерес к
мониторингу и оценке региональной информации,
представленной в СМИ. Известно более 200 систем
мониторинга социальных медиа. Одна из таких
систем мониторинга, анализирующая
интернеттексты по теме «Социально-политическая жизнь
регионов Российской Федерации» с помощью
лингвистического процессора, описывается в статье
[1]. Успеха в этой области добилось также
российское агентство «Смыслография», которое
разрабатывает коммуникационные рейтинги
регионов на основе контент-анализа с
использованием материалов
информационноаналитической службы Factiva.com в Топ-100
ведущих англоязычных СМИ [2]. Каждому региону
присваивается общий балл, учитывающий
количество его упоминаний и долю благоприятных
публикаций.</p>
      <p>В представленной работе предлагается
использовать методы математической статистики
для составления рейтингов регионов по количеству
публикаций в СМИ. Был обработан большой массив
публикаций российских СМИ по региональной
проблематике за 15 лет, каждый документ которого
соотнесен с одним или несколькими регионами, что
Труды XVIII Международной конференции
DAMDID/RCDL’2016 «Аналитика и управление
данными в областях с интенсивным
использованием данных», Ершово, 11-14 октября
2016
2 Формирование баз данных по регионам
России
2.1 Источники для формирования баз данных</p>
      <p>Базы данных по регионам России формируются
путем отбора информации из множества
информационных ресурсов:
 сообщений ведущих информационных
агентств России: ИТАР-ТАСС,
ИНТЕРФАКС, REGNUM, РБК, ПРАЙМ,
АК&amp;М, Россия сегодня, Росбалт, lenta.ru,
vz.ru, Newsru, Полит.Ру, Утро.Ру,
inopressa.ru, expert.ru;


статей из основных центральных и
московских газет и журналов: АИФ,
Известия, Новые известия, Независимая
газета, РБК-daily, КоммерсантЪ-Daily,
Комсомольская правда, ИМ Ведомости,
Российская газета, Парламентская газета,
Новая газета, Советская Россия, Московская
правда, Московский комсомолец, Вечерняя
Москва, Огонек и т.д.;
официальной российской информации,
поступающей с сайтов российских органов
государственной власти (пресс-служб
президента, правительства, генеральной
прокуратуры, министерств, агентств, служб,
надзоров, управлений).</p>
      <p>Объем информационных ресурсов,
использованных для формирования баз данных
региональной информации, составил около 8 млн.
документов.
2.2 Фильтрация информации</p>
      <p>Во избежание дублирования информации
исключались источники, содержащие обзоры и
дайджесты. Также не допускалось попадание в базы
данных расписаний спортивных мероприятий,
турнирных таблиц, результатов спортивных
соревнований. Кроме того, сопровождающий базу
региональной информации сотрудник ежедневно
просматривает и при необходимости корректирует
автоматически распределенную по регионам
информацию. Это позволяет, в частности, более
точно формировать информацию, относящуюся к
региону «Москва».
2.3 Методика отбора информации</p>
      <p>В качестве среды для функционирования баз
данных используется платформа IBM Lotus
Domino/Notes, располагающая встроенным языком
программирования Lotus Script [4]. Специальная
программа, разработанная на языке Lotus Script,
отбирает информацию из информационных
ресурсов, содержащих региональную информацию, с
помощью запросов, составленных для каждого из 85
регионов России.</p>
      <p>Пример запроса для региона «Калужская
область» приводится ниже:
((Калужск*|Калуга|Калуге|Калуги|Калугой|Калугу|
Обнинск*|Балабаново|Медын*|Малоярославец*)
AND NOT ((Калужск* sentence
площад*)|(Калужск* sentence шоссе)|(Калужск*
застав*)|(метро Калужск*)|метро sentence
"Калужская"|"м.
Калужская"|КалужскоРижск*|Синема парк на Калужской|"Калужская
пл."|"на Калужской")))</p>
      <p>В данном запросе используются следующие
шаблоны и логические операторы:</p>
      <p>* (звездочка) - замена нескольких символов в
указанной позиции слова;
«» (кавычки) – точное написание фразы;</p>
      <p>AND NOT – запрещенные слова и
словосочетания;
| (или) – содержит хотя бы одно из слов;
sentence (предложение) – разделенные
оператором слова находятся в одном предложении.</p>
      <p>В поисковых запросах также могут быть
использованы другие логические операторы (ранг
соответствия, абзац, операторы полей, верхнего
регистра и веса).</p>
      <p>Региональная информация распределялась также
по тематическим рубрикам с помощью запросов,
составленных для каждой рубрики. Пример запроса
для тематики «Религиозно-политические проблемы»
приводится ниже:
(религиозн*|православ*|старообряд*|церков*|ислам*
|фундаментали*|клерикал*|миссионер*|католи*|РПЦ
|РПЦЗ|христиан*|епископ*|архиер*|Ватикан*|иуд*|
пап* римск*|пресвитер*|священник*|диакон*|
патриарх*|экумени*|конфесси*|администратур*|
межконфессион*|внутриконфессион*|далай-лам*|
конфуцианств*|сект*&amp;!секто*|саентолог*|мормон*|
мечет*|мусульман*|шариат*|тоталитарн* братств*|
митрополит*|священнослужител*|служител*
культ*|суфийск* орден*|католикос*|протестант*|
раввин*|дацан*|лютеран*|будди*|баптист*|масон*|
пятидесятник*|евангели*|монастыр*|синод*|собор*|
паломни*|хамбо-лам*|курия|курией|курии|курию)
3 Методы статистической обработки
При статистической обработке использовалась
программа анализа данных AtteStat, версия 13,
предназначенная для работы в среде электронных
таблиц Microsoft Excel 4.1 [3]. Использовались
модули программного обеспечения: проверки
нормальности распределения Normal Distribution
Check for Excel (NDC), корреляционного анализа
Correlation Analysis for Excel (CORA), кластерного
анализа Cluster Analysis for Excel (CLA).
3.1 Проверка нормальности распределения</p>
      <p>По всем годам, начиная с 2001 до 2015, было
подсчитано количество поступивших в базы данных
документов и определен закон распределения
документов. Всего в базы данных поступило 2653060
документов, что составляет ~ 33% от общего объема
использованных информационных ресурсов.</p>
      <p>На рис.1 приведен график зависимости
количества документов от года поступления (по оси
х цифра 1 соответствует 2001 году, 2 – 2002 году, 15
– 2015 году).</p>
      <p>Проверка нормальности распределения
проводилась по модифицированным критериям
Колмогорова, Смирнова и хи-квадрат Фишера [3].
Оказалось, что количество поступивших за год
документов в базу данных по регионам (случайная
величина) подчиняется нормальному закону
распределения (по всем трем критериям гипотеза о
нормальности не отклонялась). Это позволяет
строить прогнозы о размере региональных баз
данных, что имеет значение при планировании
размещения информации на серверах и закупке
серверов.
3.2 Корреляционный анализ</p>
      <p>Анализировалась теснота связи (корреляционная
зависимость) между количеством документов по
регионам, поступившим за два года, с помощью
коэффициента корреляции Фехнера. Вычисления
производились по формуле
где C - число пар совпадающих знаков отклонений
количества документов в анализируемые годы от
соответствующих средних значений, H - число пар
несовпадающих знаков.</p>
      <p>В таблице 1 приведены значения коэффициента
Фехнера для некоторых сравниваемых периодов.
Значения коэффициента Фехнера указывают на
наличие корреляционной связи, причем теснота
связи выше для пар, у которых годы идут подряд.
Рисунок 1 Зависимость количества документов от года поступления
Таблица 1 Корреляционная связь между
количеством поступающих документов
Период (пары лет)
2001, 2015
Коэффициент Фехнера</p>
      <p>0,6867
2002, 2003
2002, 2013
2004, 2005
2008, 2009
2009, 2010
2012, 2013
2013, 2014
2014, 2015
0,9036
0,7108
0,8072
0,8313
0,9277
0,8313
0,8313
0,7349
3.3 Кластерный анализ</p>
      <p>Методами кластерного анализа решается задача
разбиения множества регионов таким образом,
чтобы все регионы, принадлежащие одному
кластеру, были более похожи друг на друга по
степени освещения их в прессе, чем на объекты
(регионы) других кластеров. Так как оцениваются
только количественные признаки, был выбран метод
Уорда. Каждый объект (регион), описываемый k
признаками (количество документов за один
конкретный год), может быть представлен как точка
в k-мерном пространстве на одном из n объектов.
Сходство с другими объектами определялось как
Евклидово расстояние между кластерами:
где: Xi , Xj - координаты i-го и j-го объектов в
kмерном пространстве;
xil - xjl - величина l-той компоненты у i-го (j-го)
объекта (l=1,2,...,k; i,j=1,2,...,n).</p>
      <p>Сущность этого метода заключается в том, что на
первом шаге каждый объект рассматривается как
отдельный кластер. Процесс объединения кластеров
происходит последовательно: на основании матрицы
расстояний объединяются наиболее близкие
объекты. Сначала объединяются два ближайших
кластера. Для них определяются средние значения
каждого признака и рассчитывается сумма квадратов
отклонений:</p>
      <p>l = ∑i∑j(xij - xjl)2 ,
где: l - номер кластера,
i - номер объекта (i = 1,2, ... , nl),
nl - количество объектов в l - том кластере,
j - номер признака (j = 1,2, ..., k),
k - количество признаков, характеризующих
каждый объект.</p>
      <p>В дальнейшем объединяются те объекты или
кластеры, которые дают наименьшее приращение
величины l.</p>
      <p>Кластеризация проводилась по 83 регионам за
период с 2001 по 2013 гг. (табл. 2) и по 85 регионам
(после вхождения в состав России двух новых
субъектов) за 2015 гг. (табл.3).</p>
      <p>В таблицах регионы обозначены кодами, которые
используются во всех государственных органах
России [5]. Например, код «77» относится к Москве,
«78» - Санкт-Петербургу, «91» - Республике Крым,
«92» - Севастополю и т.д.</p>
      <p>Сравнение результатов кластеризации за
20012013 и 2015 годы показывает, что регионы, входящие
в первую десятку, в целом, сохранили свои позиции,
за исключением Чеченской республики. В группу
лидеров вошли также два новых российских региона.</p>
      <p>Можно составить рейтинг регионов по каждому
году, исходя из количества документов, в которых
упоминается регион. Так, в 2015 году абсолютными
лидерами были Москва (1место) и С.-Петербург (2
место), затем следовали Краснодарский край,
Московская область, Приморский край, Республика
Крым, Севастополь, Новосибирская область,
Красноярский край, и замыкал десятку Татарстан.
Регионы-аутсайдеры представляли Ненецкий АО (81
место) и области: Ульяновская (82 место), Тульская
(83 место), Магаданская (84 место), Липецкая (85
место). Любопытно, что Башкортостан, занявший
седьмое место в рейтинге регионов в зарубежных
средствах массовой информации по итогам 2015 года
[2], оказался только на 16-ом месте. Такие различия
можно объяснить разными подходами к отбору
информации.
Таблица 2 Результаты кластеризации регионов
(2001-2013 гг.)</p>
      <p>Номер Численность Коды субъектов РФ
кластера кластера
1 1
2 1
3 3
4 8
5 19
77
78
20,25,50
16,23,24,27,38,39,54,66
02,05,06,15,26,34,36,41,
52,53,55,59,61,63,64,65,
72,73,74
6 24 07,10,14,22,28,30,31,32,
40,42,46,47,48,49,51,56,
60,62,69,70,71,75,76,83
7 27 01,03,04,08,09,11,12,
13,17,18,19,21,29,33,35,
37,43,44,45,57,58,67,68,
79, 86,87,89
Таблица 3 Результаты кластеризации регионов за
2015 год</p>
      <p>Номер Численность Коды субъектов РФ
Кластера кластера
1 1
2 1
3 3
4 3
5 3
6 18
77
78
23,25,50
54,91,92
16,24,66
02,05,26,27,34,36,38,39,
41,52,55,59,61,63,65,70,
72,74</p>
      <p>Зарубежные СМИ традиционно проявляют
интерес к спортивным и статусным мероприятиям в
российских регионах, таким как подготовка к
чемпионату мира по футболу в 2018 году,
российским спортивным первенствам, проведению
саммитов ШОС и БРИКС, а в рассматриваемых нами
базах данных наибольший интерес представляет
общественно-политическая информация о жизни
регионов.</p>
      <p>При анализе информации о регионах важны не
только количественные характеристики о числе
документов, в которых упоминается регион, но и
качественные, т.е. тематический характер. В
качестве примера были выбраны три наиболее
востребованные нашими пользователями тематики
(«Религиозно-политические проблемы», «Права
человека», «Охрана окружающей среды» (ООС)),
для которых построены графики зависимостей
количества документов от года поступления (см.
рис.2).</p>
      <p>Нами была проведена кластеризация документов
за 2014-2015 годы по трем перечисленным выше
тематикам. В табл.4 представлены регионы, которые
попали в первые четыре кластера, хотя бы по одной
тематике (указывается номер кластера и в скобках
рейтинг региона), а по другим тематикам они могут
занимать даже последние позиции. Документы с
упоминанием Москвы составили отдельные
кластеры по всем тематикам, а с упоминанием
Санкт-Петербурга - по двум тематикам.
4 Заключение</p>
      <p>Проведенный анализ может быть использован
для прогнозирования размера региональных баз,
составления рейтинга регионов по освещению в
прессе в целом и с учетом тематики, а также
просмотра изменений рейтингов в динамике.</p>
      <p>В работе показано, что наряду с методами
контент-анализа, семантико-ориентированного
лингвистического анализа для мониторинга
публикаций о регионах можно использовать методы
математической статистики – корреляционный и
кластерный анализ. Эти методы не требуют затрат,
связанных с работой экспертов. Однако для
статистического анализа нужно располагать
большим объемом информации.
Субъект РФ
Москва
Религия
Права
человека
1 (1)
Литература</p>
      <p>Statistical processing of the social and political
texts about Russian regions</p>
      <p>N.N. Abramova</p>
      <p>The article describes the methods and results of the
processing of the social and political texts about the
Russian regions that was collected since 2001 during 15
years. Statistical processing was carried out using the
data analysis program AtteStat in the environment of
Microsoft Excel spreadsheets. The results can be used by
system administrators for planning the placement of
information on the servers, as well as by experts
evaluating the social and political life of the Russian</p>
      <p>Federation regions.</p>
    </sec>
  </body>
  <back>
    <ref-list />
  </back>
</article>