=Paper= {{Paper |id=Vol-1297/090-97_paper-15 |storemode=property |title=Методы автоматического построения формализованного представления содержания материалов электронных средств массовых коммуникаций для решения задачи мониторинга и оценки деятельности органов власти (Methods for Automatic Construction of a Formalized Representation of the Contents of Electronic Mass Communication Materials to Solve the Problem of Monitoring and Assessment of Authorities) |pdfUrl=https://ceur-ws.org/Vol-1297/090-97_paper-15.pdf |volume=Vol-1297 |dblpUrl=https://dblp.org/rec/conf/rcdl/NikitinKK14 }} ==Методы автоматического построения формализованного представления содержания материалов электронных средств массовых коммуникаций для решения задачи мониторинга и оценки деятельности органов власти (Methods for Automatic Construction of a Formalized Representation of the Contents of Electronic Mass Communication Materials to Solve the Problem of Monitoring and Assessment of Authorities) == https://ceur-ws.org/Vol-1297/090-97_paper-15.pdf
Методы автоматического построения формализованного
 представления содержания материалов электронных
 средств массовых коммуникаций для решения задачи
  мониторинга и оценки деятельности органов власти

© Ю.В. Никитин                 © Ал-др А. Хорошилов           © Ал-ей А. Хорошилов
          Институт проблем информатики Российской академии наук (ИПИ РАН),
                                      Москва
yuri.v.nikitin@gmail.com          khoroshilov@mail.ru       alex_khoroshilov@mail.ru

                                                            Все более широкое приобщение населения к
                 Аннотация                               электронным информационным ресурсам, в том
   В    данной     статье   рассматриваются              числе рост популярности социальных сервисов
   возможности создания формализованного                 среди молодежи и стимулирование государством
                                                         использования гражданами электронных госуслуг, с
   представления            информационных
   публикаций в сети Интернет для получения              одной стороны, предоставляет все больше
   показателей    количественной      оценки             возможностей      для    оперирования    данными,
                                                         получаемыми в электронном виде по сети Интернет,
   деятельности органов власти по материалам
   таких публикаций. Также рассматриваются               с другой стороны, все более возрастающий объем
   методы построения формализованного                    подобной информации с каждым годом в
                                                         значительной мере усложняет задачу обработки
   описания информационных сообщений и
   методы адаптации автоматизированных                   этих сведений, затрудняя деятельность экспертов-
   средств     семантической       обработки             аналитиков в области оценки общественного мнения
                                                         о деятельности органов власти.
   сообщений для получения наиболее
   адекватных результатов анализа в заданной                В этих условиях эксперты-аналитики все чаще
   предметной области.                                   ставят задачи перехода от качественных экспертных
                                                         оценок по результатам изучения материалов
1 Введение                                               информационных              сообщений            к
                                                         автоматизированным количественным методам
   В настоящее время приобретает все большую             оценки общественного мнения о деятельности
актуальность получение обратной связи от                 органов власти. Такие методы имеют два
населения при оценке деятельности органов власти.        неоспоримых взаимосвязанных преимущества: во-
Такая оценка востребована как самими органами            первых, дают возможность получения более
власти для принятия оперативных решений, их              объективных статистических показателей, благодаря
вышестоящими и надзорными структурами, так и             росту объема обрабатываемых данных, во-вторых,
различными общественными и исследовательскими            максимально освобождают результаты оценки от
организациями по мониторингу общественного               субъективного экспертного представления о
мнения.                                                  действительной ситуации по тем же самым
   Одним из возможных источников сбора                   причинам      и    вследствие    более    глубокой
информации      для     проведения     подобных          автоматизации       обработки     этого     объема
исследований      является       информационное          информации, воспринять которую в ее исходном
пространство электронных средств массовых                виде за короткий период времени ни один эксперт
коммуникаций в сети Интернет, включающее такие           просто не в состоянии.
источники информации, как электронные средства              В то же время решение данной задачи
массовой информации (СМИ), публикации в блогах           сталкивается с рядом комплексных проблем.
и на форумах, сообщения в социальных сетях,              Прежде всего, необходимы современные и
сервисы коротких сообщений (например, Twitter) и         адекватные средства семантического анализа
электронные ресурсы обратной связи с населением          неструктурированной текстовой информации. Далее
на государственных порталах по приему жалоб и            необходимо определить набор показателей для
обращений граждан.                                       проведения      количественного    статистического
                                                         анализа. В настоящее время имеется серьезная
Труды 16-й Всероссийской научной конференции             проблема с отсутствием определенного набора
«Электронные библиотеки: перспективные методы и          показателей для подобных оценок. Это связано с
технологии, электронные коллекции» — RCDL-2014,          тем, что ранее у занимающихся этими вопросами
Дубна, Россия, 13-16 октября 2014 г.                     исследователей не было большого опыта обработки



                                                    90
данных такого объема, а также не было четкого                    в) выделение и классификация объектов, их
представления о возможностях формализации                    признаков и отношений между ними и
текстов, доступных методах преобразования                    классификация текстов по типам отношений автора
неструктурированных данных в структурированные               сообщения к основным объектам мониторинга;
– т.е. не было понятия о доступном инструментарии.              г) автоматизированная настройка декларативных
    В данной статье мы предлагаем возможный                  (словарных) средств лингвистического процессора
инструментарий для проведения таких оценок и                 на заданную предметную область.
предлагаем методы автоматической обработки                      3. Обработка      данных     с    применением
неструктурированной       текстовой   информации,            технологий «Big Data»:
позволяющей разработать модель количественных
                                                                а) обеспечение      распределенной     массово-
показателей. Мы также рассматриваем условия, при
                                                             параллельной лингвистической и статистической
которых приведенные методы будут адекватны
                                                             обработки загружаемых данных;
поставленной задаче в рамках заданной предметной
области, посредством настройки декларативных                    б) обеспечение масштабируемости на множество
средств к заданной предметной области с учетом               узлов обработки без деградации инфраструктуры
большого объема обрабатываемых данных.                       обработки данных [2, 3].
    Мы      провели     моделирование     процесса              Подзадача 1 (мониторинг материалов) является
автоматизированной обработки текстов с целью                 достаточно     тривиальной    задачей,   имеющей
получения количественных показателей на примере              множество     программно-технических     решений.
информационных сообщений Интернет-СМИ и                      Подзадача 3 (обработка данных с применением
пользователей социальной сети «ВКонтакте» о                  технологий «Big Data») является самостоятельным
деятельности органов власти Ханты-Мансийского                направлением исследований, и мы оставляем ее за
автономного округа (ХМАО).                                   рамками данной статьи, при этом учитывая
                                                             требования        по      распределенности       и
2 Программно-техническое обеспечение                         масштабируемости к средствам лингвистической
                                                             обработки текстов.
2.1 Общие требования к процессу автоматизации                   В данной статье мы рассматриваем подзадачу 2
                                                             (лингвистическая обработка неструктурированных
    Для автоматизации решения задачи оценки
                                                             текстов), методы ее обеспечения и требования к
деятельности органов власти по материалам
                                                             созданию декларативных (словарных) средств [1, 7].
Интернет-публикаций        необходимо     обеспечить
программно-техническую реализацию следующих                  2.2 Требования к лингвистическому
основных ее подзадач:
                                                             программному обеспечению
    1. Мониторинг         материалов       Интернет-
публикаций:                                                       Современные системы автоматизированной
                                                             семантической обработки неструктурированной
    а) консолидация     информационных        потоков
                                                             текстовой информации, разрабатываемые для
различных типов: ленты новостей на сайтах и
                                                             решения задач данного типа, должны обеспечивать
порталах Интернет-СМИ, органов власти и
                                                             выполнение следующих процедур лингвистического
комментарии пользователей к ним, публикации на
                                                             анализа текстов [1–9]:
форумах и в блогах, сообщения пользователей
социальных сетей и сервисов коротких сообщений,                  а) графематический анализ текста;
электронные обращения граждан и другие                           б) морфологический анализ слов;
доступные ресурсы;                                               в) семантико-синтаксический анализ текстов;
    б) оперативный        мониторинг       изменения             г) концептуальный анализ текстов;
информации        на     подключенных        ресурсах
                                                                 д) дистрибутивно-статистический           анализ
(информационных источниках) и сбор (считывание
                                                             текстов.
и загрузка) содержимого текстовых материалов;
                                                                 Графематический анализ предназначен для
    в) унификация       форматов      представления
                                                             предварительного        анализа     текста        по
текстовых сообщений, извлечение возможных
                                                             представляющей его последовательности символов
реквизитов          публикаций,         аналогичных
                                                             [2, 3]. В результате этого анализа определяется язык
библиографическому описанию (источник, рубрика,
                                                             текста, устанавливаются местоположения слов,
автор, наименование публикации, временной период
                                                             предложений, абзацев, фамильно-именной группы,
и т.п.), в зависимости от типа источника.
                                                             дат, адресов и т.п.
    2. Лингвистическая                    обработка
                                                                 Морфологический анализ слов естественных
неструктурированных текстов:
                                                             языков предназначен для определения структуры
    а) автоматическое создание формализованного              слов и назначения им грамматических признаков,
представления смысловой структуры текста;                    необходимых для выполнения последующих
    б) кластеризация сходных по смысловому                   процедур автоматической обработки текстовой
содержанию текстов – группировка текстов                     информации       (например,     синтаксического    и
публикаций по темам (информационным поводам);                концептуального анализа текстов) [8, 9].



                                                        91
    Семантико-синтаксический анализ текстов                    б) степень доверия (например, официальный
проводится     с    целью      формализованного             источник, аккредитованное СМИ, «бульварная
представления их структуры – выделения в них                пресса», подписанное обращение гражданина,
смысловых единиц и установления связей между                анонимное сообщение и т.п.);
ними. При этом структура текстов может                         в) вид сообщения (например, информационное
интерпретироваться по-разному и описываться на              сообщение, жалоба, комментарий к сообщению,
различных формализованных языках [7, 8].                    мнение пользователей сети и т.п.);
    Концептуальный анализ текстов предназначен                 г) отношение        к     власти       (например,
для определения смысловой структуры текстов,                подведомственный источник, аффилированный
выявления их понятийного (концептуального)                  источник, оппозиционный источник, независимая
состава текстов и установления связей между                 пресса и т.п.).
наименованиями понятий [7, 8].
                                                               Аннотация к тексту документа в общем случае,
    Дистрибутивно-статистический         анализ             может быть авторской и изначально сопровождать
текстов естественных языков предназначен для                данный текст, а может отсутствовать в исходном
установления статистических закономерностей                 тексте,    тогда    средствами     лингвистического
совместной встречаемости наименований понятий               процессора создается автоматический реферат
[1, 9].                                                     документа [9].
2.3 Требования к извлечению данных                             В отличие от автореферата (авторского реферата,
                                                            отражающего авторское представление о важных, на
   Основной        задачей      при     выполнении          его взгляд, тезизах документа), автоматический
семантической обработки неструктурированной                 реферат      выделяет     значимое       содержимое
текстовой информации является представление                 дистрибутивно-статистическим               способом,
смысловой структуры текста в формализованном                основываясь на реальных смысловых акцентах в
виде [8, 9].                                                тексте и на значимости терминов (объектов) в
   В      классическом     виде    формализованное          заданной предметной области.
представление текстового содержания документа                  Так же в отличие от автореферата, который
должно содержать:                                           может представлять собой стандартный шаблон с
   а) библиографические реквизиты (например,                аналитическими ответами на ключевые вопросы о
информационный источник, рубрика, автор,                    содержании документов данного типа, т.е.
наименование и дата публикации и т.п.);                     фактически являющимся пересказом (например,
   б) аннотацию или реферат документа;                      автореферат диссертации), автоматический реферат
                                                            содержит реальный, не измененный текст
   в) список ключевых выражений;                            документа.
   г) классификацию документа по смысловому                    Зачастую документ, содержащийся в базе
содержанию – отнесение его к той или иной рубрике           данных (БД), может интересовать пользователей в
и кластеризация (группировка) текстов публикаций            разрезе различных тематик. В таком случае
по темам (информационным поводам).                          необходимо         подготовить       автоматический
   Рассмотрим более подробно каждый из                      контекстный реферат документа в разрезе
реквизитов        формализованного        описания          рассматриваемой тематики или поискового запроса.
применительно к поставленной задаче.                           В отличие от аннотации такой реферат
   Библиографические реквизиты выделяются на                необходимо строить каждый раз заново с учетом
этапе мониторинга информационных публикаций.                потребности пользователя в той или иной
Структура      реквизитов     документа     (статьи,        информации, а также ограничений на объем
сообщения, комментария) закладывается в шаблон              реферата.
загрузки и парсинга (разбора на структурные                    С помощью автоматического реферирования
элементы) страницы с текстом публикации для                 также можно выравнивать объемы сравниваемых по
каждого конкретного информационного источника.              смыслу документов – для задач кластеризации
Соответственно, выделение данных реквизитов                 документов с аналогичным содержанием.
происходит на стадии унификации формата
документа.                                                     Ключевые выражения применительно к
                                                            материалам электронных публикаций в рамках
   При этом на уровне данных реквизитов,                    нашей задачи не являются важными средством
определенных еще до проведения лингвистического             визуализации смыслового содержания текста, в
анализа, проводится классификация документа,                отличие, например, от текстов научно-технических
основанная на типе информационного источника.               публикаций [4–8].
Такая классификация может проводиться по
различным основаниям:                                          При этом список ключевых выражений
                                                            (наиболее значимых для данного текста с учетом
   а) тип документа (например, статья в СМИ,                предметной области) и выделенных из текстов
официальное сообщение, публикация в блоге,                  объектов      (например,    персоны,      должности,
комментарий в социальной сети, электронное                  должностные лица, организации, территории,
обращение граждан и т.п.);



                                                       92
производственные         объекты,    географические         информационных сообщениях – позитивные,
объекты, бренды) играет ключевую роль в                     негативные или нейтральные.
построении формализованного описания документа                 Кластеризация (группировка) документов
для его последующего семантического анализа                 выполняется на последнем этапе лингвистической
[2, 3].                                                     обработки документов.
    Как и в случае с аннотацией, в отличие от
авторских ключевых выражений (указанных                     3 Экспериментальные данные
вручную и отражающих авторское представление о
важных, на его взгляд, терминах документа), данные          3.1 Предметная область и исходные данные для
выражения выделяются семантико-синтаксическим               испытаний
и словарным методами, основываясь на реальном
содержании текста и на значимости терминов в                   Для проверки изложенной гипотезы авторы
заданной      предметной     области    (выявленной         провели           моделирование          процесса
дистрибутивно-статистическим методом).                      автоматизированной обработки текстов с целью
                                                            получения количественных показателей на примере
    Выделение объектов из списка ключевых                   информационных сообщений Интернет-СМИ и
выражений, таких как должностные лица,                      пользователей социальной сети «Вконтакте» о
организации,       территории,     производственные         деятельности органов власти Ханты-Мансийского
объекты, географические объекты и бренды,                   автономного округа (ХМАО).
представляет отдельный интерес, т.к. данные
выражения        зачастую     являются    объектами            Сначала мы провели сбор и анализ региональных
мониторинга.                                                публикаций ХМАО с целью автоматизированного
                                                            выделения наименований органов власти, объектов
    В отличие от обычных ключевых выражений,                инфраструктуры и должностных лиц в объеме около
чаще предназначенных только для визуализации                1000 статей по материалам Интернет-СМИ ХМАО,
смыслового содержания, и чуть реже –                        сайтов органов государственной власти ХМАО
фигурирующих в качестве тематических тегов                  (www.admhmao.ru) и городского портала органов
документа, выделение объектов мониторинга из                местного     самоуправления     Ханты-Мансийска
текстов позволяет определить основные опорные               (www.admhmansy.ru).
точки для формализованных показателей:
                                                               Далее       мы       собрали     региональные
    1) выделить из текста объекты и их предикаты;           пользовательские публикации социальной сети
    2) дать классификацию объектов и отношений к            «ВКонтакте»      в     объеме   около     650 Мб
объектам на основе классификации предикатов;                неформатированного текста для анализа лексики,
    3) установить по тексту связи между объектами.          определяющей тональности высказываний граждан.
    Классификация объектов проводится на основе                Кроме того нами был проанализирован
базового       классификатора      лингвистического         представительный набор коротких сообщений
процессора      и     дополнительного    специально         Twitter, который мы рассматривали только для
созданного по корпусу текстов классификатора                анализа и сравнения лексического состава
заданной предметной области.                                сообщений информационных источников различных
    Базовый классификатор содержит только                   типов, и не использовали в дальнейшем для
основные классы (например, персона, должность,              проведения нашего эксперимента по извлечению
географический объект, дата-время, обычный                  данных.
концепт (термин) и т.п.)                                       По результатам первичного анализа текстов
    Классификатор предметной области позволяет              сделаны выводы о необходимости разделения
задать      более     конкретную     классификацию          настройки декларативных средств по трем
применительно к заданной предметной области                 отдельным корпусам текстов с учетом их
(например, орган федеральной, региональной,                 особенностей:
муниципальной власти, его подразделение или                    1) официальные тексты, публикации СМИ,
подведомственное предприятие и т.п.).                       формальные заявления, обращения граждан,
    Классификация объектов позволяет отнести                экспертные заключения – любые связные тексты со
информационное сообщение к той или иной                     строгим языковым стилем;
рубрике, а также применительно к нашей задаче                  2) тексты социальных сетей, блогосферы и
определить к какой ветви структуры органов власти           форумов – характеризуются большим количеством
относится      объект    мониторинга    для    более        орфографических ошибок, опечаток, неправильно
нацеленного анализа высказываний, приведенных в             употребляемых      значений слов, сокращений,
публикациях.                                                жаргонизмов и профессионализмов, неологизмов,
    Классификация          предикатов      позволяет        молодежной неформальной, нецензурной лексики,
установить отношения к основным объектам                    несвязной структурой текстов и анафорическими
мониторинга (органам власти и государственным               связями с предыдущими комментариями и
функциям) авторов суждений, приведенных в                   сообщениями;




                                                       93
   3) короткие сообщения Twitter (твиты) – SMS-            семантических поиск и подбор документов, их
подобные      текстовые      сообщения      строго         автоматическое реферирование и перевод.
ограниченного      размера,     характеризующиеся             5) Электронная      библиотека      документов
тезисным стилем изложения информации, большим              МетаФраз (база данных) – ресурс, входящий в
количеством сокращений и наличием хэш-тегов                состав Системы семантической обработки текстов
вида #subject, при этом часть из этих тегов                МетаФраз, предназначенный для загрузки и
фигурирует       в    качестве     дополнительных          хранения в БД документов (текстовых файлов) и
идентификаторов темы, расположенных в начале               результатов    их   лингвистической     обработки.
или в конце сообщения, а часть из низ являются             Электронная библиотека документов реализована с
непосредственными       членами     синтаксической         использованием СУБД MS SQL Server.
структуры предложения (т.е. значимыми словами в
                                                              ПО МетаФраз обладает всеми необходимыми
связном тексте).
                                                           программными      процедурами     лингвистической
3.2 Использование лингвистического                         обработки       неструктурированных       текстов,
программного обеспечения                                   необходимых для решения данной задачи, и
                                                           позволяет адаптировать декларативные средства для
   Для проведения экспериментов мы использовали            настройки на заданную предметную область путем
разработанное авторами статьи лингвистическое              быстрого автоматизированного создания словарей
программное обеспечение (ПО) МетаФраз [10].                по корпусу текстов.
   Лингвистическое программное обеспечение
                                                           3.3 Автоматизированная настройка
МетаФраз R10 (Metafraz Lingware R10) разработано
в       виде       единого        интегрированного         декларативных (словарных) средств на заданную
многофункционального программного комплекса                предметную область
(Системы), состоящего из нескольких программных               Для решения задач автоматической обработки
продуктов,     предназначенных      для    решения         информации в заданной предметной области
отдельных функциональных задач в области                   необходимо провести работу по составлению
компьютерной лингвистики.                                  семантических декларативных средств, в которых
   В состав ПО МетаФраз R10, используемого для             представляется понятийный состав предметной
проведения экспериментов, входят следующие                 области и фиксируются смысловые отношения
компоненты:                                                между понятиями.
   1) Библиотека         словарей         МетаФраз            Общая технологическая схема составления
(MF Dictionary Lib R10) – основной ресурс Системы,         концептуального     словаря    представляется    в
содержащий комплекс декларативных (словарных)              следующем виде.
средств для задач фразеологического машинного                 Предварительно составленный корпус текстов
перевода и семантической (смысловой) обработки             подвергается обработке процедурой семантико-
текстов, а также набор грамматических таблиц для           синтаксического и концептуального анализа
базовых лингвистических процедур.                          текстов, в результате чего из текстов выделяются
   2) Ядро лингвистического процессора и системы           отдельные слова и словосочетания различной
перевода (Kernel) – основной модуль Системы,               длины. После этого по массиву выделенных из
включающий набор лингвистических программных               текстов слов и словосочетаний составляется
библиотек, обеспечивающих выполнение всех                  частотный словарь.
лингвистических процедур Системы.                             Полученный         словарь      обрабатывается
   3) Лингвистический       комплекс      МетаФраз         процедурой орфографического и синтаксического
(MF Lingware Complex R10) – программный продукт            контроля, в результате чего из этого словаря
Системы, входящий в состав автоматизированных              исключаются некорректные слова и словосочетания.
систем МетаФраз, поддерживающих функционал                 Частотная      часть     словаря     подвергается
создания и верификации словарей МетаФраз,                  лингвистической обработке, в результате которой из
включает модули создания частотных словарей по             словаря    исключается    малоинформативная      и
корпусу текстов, конвертации текстовых словарей в          некорректная лексика.
формат словарей МетаФраз и модуль Системы                     Далее выполняется автоматическое приведение
перевода МетаФраз.                                         наименований понятий к их канонической форме и
   4) Система семантической обработки текстов              формируется частотный словарь наименований
МетаФраз (MF Text Analyst R10) – программный               понятий. И, наконец, на завершающем этапе
продукт     Системы,      входящий      в    состав        выполняется семантико-статистический анализ
автоматизированных          систем        МетаФраз,        частотного словаря на основе статистических
поддерживающих       функционал      семантической         данных о количественном и качественном составе
(смысловой)     обработки     неструктурированных          этого словаря. С этой целью автоматически
текстов на естественном языке, извлечения                  формируется       характеристическая       таблица
сущностей и установления связей, рубрикацию и              частотного словаря. Для этого частотный словарь
кластеризацию документов, морфологический и                предварительно упорядочиваются по убыванию
                                                           частот встречаемости слов в текстах и для каждой



                                                      94
частоты вычисляются такие параметры как его                   – информирующие                     сообщения
кратность, накопленная частота, накопленная               (преимущественно СМИ) в отношении конкретных
кратность и относительная накопленная частота.            информационных поводов (фактов, событий,
Эти параметры позволяют выявить частотный                 персон);
понятийный состав предметной области и соотнести              – сообщения,                демонстрирующие
его с параметром покрытием этой частотой текстов          осведомленность     населения   по    конкретным
предметной области.                                       информационным поводам;
   Автоматизация составления словарей позволяет               – отношение населения (позитивное, негативное,
в короткие сроки и с минимальными трудозатратами          нейтральное) к конкретным информационным
создать для заданной предметной области систему           поводам.
взаимосвязанных        наименований     понятий,
                                                              На основе результатов этой обработки созданы
основанную на корпусе реальных текстов в
                                                          классификационные словари объектов и отношений
предметной области.
                                                          в заданной предметной области.
3.4 Создание классификаторов в предметной
                                                          3.5 Обработка текстов средствами МетаФраз
области
                                                             После настройки декларативных           средств
   Для создания классификаторов в предметной              лингвистического программного обеспечения на
области были реализованы следующие этапы                  заданную предметную область мы провели
обработки корпуса текстов собранных публикаций:           автоматическую обработку имеющегося массива
   1) разработаны методы, алгоритмы и ПО для              тестовых данных.
выявления        предикативных        (глагольных)           Для каждого документа было автоматически
словосочетаний, характеризующих направление               сформировано формализованное представление
деятельности органов государственной власти и             документа, включающее:
оценки их качества по корпусу текстов публикаций
СМИ;                                                         1. Список ключевых выражений со следующим
                                                          набором данных по каждому из них:
   2) разработаны методы, алгоритмы и ПО для
выявления оценочных суждений о деятельности                       а) ключевое выражение;
органов государственной власти и оценки их                        б) нормализованное ключевое выражение
качества    (по    корпусу   текстов    сообщений         (пословно в канонической форме);
социальных сетей);                                                в) хеш выражения;
   3) проанализирован корпус текстов СМИ,                         г) вес выражения в тексте с учетом
относящихся к тематике деятельности органов               предметной области;
власти ХМАО, автоматизированным способом                          д) группа (группы) по классификатору;
выделено свыше 2000 объектов, связанных со
структурой органов власти региона и их                            е) адреса в исходном тексте (координаты
деятельностью (государственными функциями);               всех вхождений в тексте).
   4) по корпусу текстов СМИ выявлено более 6000             2. Общий          автоматический        реферат
предикативных      (глагольных)    словосочетаний,        (автоконспект) заданного объема по документу.
характеризующих       направление     деятельности           3. Список объектов со следующим набором
органов государственной власти и оценки их                данных по каждому из них:
качества;                                                         а) наименование объекта;
   5) определены типы выделенных объектов и                       б) нормализованное наименование объекта
проведена их классификация, определяющая их               (пословно в канонической форме);
отношение к структуре органов власти:
                                                                  в) хеш выражения;
        – губернаторская структура (губернатор
                                                                  г) вес выражения в тексте с учетом
лично, пресс-служба, аппарат, аффилированные
                                                          предметной области;
лица губернатора);
                                                                  д) класс объекта;
        – исполнительная власть (правительство,
министерства, госпредприятия);                                    е) адреса в исходном тексте (координаты
                                                          всех вхождений в тексте).
        – законодательная власть;
                                                             4. Список объектов с предикатами со следующим
        – муниципальная (городские и районные
                                                          набором данных:
власти, коммунальные службы, муниципальные
предприятия) –                                                    а) объект;
и их структурным подразделениям и выполняемым                     б) предикат;
государственным функциям;                                         в) класс    предиката    (для    типизации
   6) определены типы сообщений СМИ и                     отношений к объектам мониторинга).
публикаций в социальных сетях с точки зрения их              5. Список     установленных     связей   между
отношения к объектам мониторинга:                         объектами:




                                                     95
        а) объект 1;                                       4 Заключение
        б) предикат-связь;
                                                              В настоящей статье авторы рассмотрели
        в) объект 2.                                       возможности       создания     формализованного
   Также было проведено последовательное                   представления     содержания    информационных
отождествление документов по степени смысловой             сообщений       для    получения     показателей
близости для кластеризации документов –                    количественной оценки деятельности органов
группировка текстов публикаций по темам                    власти по материалам электронных средств
(информационным поводам).                                  массовых коммуникаций.
   Для отождествления смысловой близости                      Авторы описали структуру и методы создания
документов в нашей задаче применялись не полные            формализованного описания документа для этой
тексты документов, а их автоконспекты.                     задачи, а также методы создания декларативных
   Автоконспект      документа,   представляющий           средств для получения наиболее адекватных
собой автоматический реферат по наиболее                   результатов анализа в заданной предметной
значимым для данного текста и всей предметной              области.
области ключевым выражениям, позволяет провести               Проведенные эксперименты на реальных данных
группировку документов по их основному (наиболее           показали жизнеспособность данного подхода, на
значимому) информационному поводу. этот процесс            основе которого можно создавать действующие
также облегчается фиксированным (изначально                системы мониторинга и семантического анализа
заданным      в    настройках    лингвистического          информационных сообщений.
процессора) объемом автоконспекта.                            В то же время необходимо более серьезно
                                                           прорабатывать методы решения поставленных задач
3.6 Оценка применимости полученных
                                                           с        привлечением      экспертов-аналитиков,
показателей                                                специализирующихся в данной предметной области.
   Представленное формализованное описание                    Авторы данной статьи продолжают работы по
документов и методы его построения, а также                этой проблеме.
методы       кластеризации      документов       по
информационным поводам позволили получить                  Литература
следующие данные, пригодные для проведения
количественного анализа по текстам публикаций:              [1] Старовойтов А.В., Пошатаев О.Н.,
                                                                Прохоров С.Н., Хорошилов А.А. Методы
   1) все сообщения (публикации СМИ, сообщения                  автоматизированного составления и ведения
пользователей «ВКонтакте») сгруппированы по                     словарей // Сб. Информатизация и связь /
информационным        поводам     –     что    дает             Центр информационных технологий и систем
количественно измеряемый параметр частоты                       органов исполнительной власти. – 2013. –
встречаемости информационного повода и его доли                 № 3. – С. 91–97.
значимости в общем объеме публикаций;
                                                            [2] Богданов Ю.М., Пошатаев О.Н.,
   2) все    сообщения     классифицированы      по             Хорошилов А.А. Принципы создания
нескольким основаниям:                                          высокопроизводительных систем обработки и
        а) тип    информационного        сообщения              анализа текстовой информации // Сб.
(публикации СМИ, высказывания пользователей                     Информатизация и связь / Центр
соцсетей);                                                      информационных технологий и систем органов
        б) положение        основного       объекта             исполнительной власти. – 2013. – № 3. – С. 74–
мониторинга, определяющего информационный                       81.
повод, в иерархической структуре органов власти и           [3] Пошатаев О.Н., Хорошилов А.А. Методы
их подведомственных организаций;                                анализа текстов в технологиях «Big Data» // сб.
        в) оценка основного объекта мониторинга                 «Электронные библиотеки: перспективные
(позитивная, негативная, нейтральная) –                         методы и технологии, электронные
                                                                коллекции», XV Всероссийская научная
   что дает возможность проводить многомерный                   конференция RCDL 2013, Ярославль, Россия,
анализ сообщений по интенсивности воздействия                   14–17 октября. – С. 30–38.
СМИ, откликам пользователей сети, оценкам
                                                            [4] Белоногов Г.Г., Гиляревский Р.С.,
деятельности власти в разрезе иерархии органов
власти     и   функциональной      принадлежности               Селедков С.Н., Хорошилов А.А. О путях
предприятий и государственных услуг и т.п.                      повышения качества поиска текстовой
                                                                информации в системе Интернет // Научно-
   Расширение возможностей классификации и                      техническая информация. Сер. 2.
группировки сообщений с привлечением экспертов                  Информационные процессы и системы /
позволит существенно увеличить количество                       Всероссийский институт научной и
предоставляемых      показателей,     позволяющих               технической информации РАН. – 2012. –
проводить количественный статистический анализ                  № 8. – С. 15–22.
данных.




                                                      96
[5] Белоногов Г.Г., Гиляревский Р.С.,                      [9] Белоногов Г.Г., Калинин Ю.П.,
    Хорошилов А.А. Проблемы автоматической                     Хорошилов А.А. Компьютерная лингвистика и
    смысловой обработки текстовой информации //                перспективные информационные технологии.
    Научно-техническая информация. Сер. 2.                     Теория и практика построения систем
    Информационные процессы и системы /                        автоматической обработки текстовой
    Всероссийский институт научной и                           информации. – Москва: Информационно-
    технической информации РАН. – 2012. –                      издательское агентство «Русский мир», 2004. –
    № 11. – С. 24–28.                                          247 с.
[6] Белоногов Г.Г., Гиляревский Р.С.,                     [10] Сайт МетаФраз. http://www.metafraz.ru
    Хорошилов А.А., Хорошилов-мл. А.А.
    Автоматическое распознавание смысловой                 Methods for Automatic Construction of a
    близости документов // Научно-техническая             Formalized Representation of the Contents
    информация. Сер. 2. Информационные                       of Electronic Mass Communication
    процессы и системы / Всероссийский институт
    научной и технической информации РАН. –
                                                              Materials to Solve the Problem of
    2011. – № 7. – С. 15–22.                              Monitoring and Assessment of Authorities
[7] Белоногов Г.Г., Гиляревский Р.С.,
    Хорошилов Ал-др А., Хорошилов Ал-ей А.                      Yury V. Nikitin, Alexander A. Khoroshilov,
    Развитие систем автоматической обработки                               Alexei A. Khoroshilov
    текстовой информации // Нейрокомпьютеры:                  This paper addresses to the possibility of generating
    разработка, применение. – 2010. – № 8. – С. 4–        a formalized representation of the information
    13.                                                   publications in the Internet to derive a quantitative
[8] Белоногов Г.Г., Хорошилов Ал-др А.,                   evaluation of the authorities based on the content of
    Хорошилов Ал-ей А. Единицы языка и речи в             such publications. It also covers methods of
    системах автоматической обработки                     constructing a representation of messages and methods
    текстовой // Научно-техническая информация.           of adaptation of automated semantic processing tools
    Сер. 2. Информационные процессы и системы /           for obtaining the most appropriate analysis results in a
    Всероссийский институт научной и                      given domain.
    технической информации РАН. – 2005. –
    № 11. – С. 21–29.




                                                     97