<?xml version="1.0" encoding="UTF-8"?>
<TEI xml:space="preserve" xmlns="http://www.tei-c.org/ns/1.0" 
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 
xsi:schemaLocation="http://www.tei-c.org/ns/1.0 https://raw.githubusercontent.com/kermitt2/grobid/master/grobid-home/schemas/xsd/Grobid.xsd"
 xmlns:xlink="http://www.w3.org/1999/xlink">
	<teiHeader xml:lang="ru">
		<fileDesc>
			<titleStmt>
				<title level="a" type="main">Методы автоматического построения формализованного представления содержания материалов электронных средств массовых коммуникаций для решения задачи мониторинга и оценки деятельности органов власти</title>
			</titleStmt>
			<publicationStmt>
				<publisher/>
				<availability status="unknown"><licence/></availability>
			</publicationStmt>
			<sourceDesc>
				<biblStruct>
					<analytic>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">Ю В</forename><surname>Никитин</surname></persName>
						</author>
						<title level="a" type="main">Методы автоматического построения формализованного представления содержания материалов электронных средств массовых коммуникаций для решения задачи мониторинга и оценки деятельности органов власти</title>
					</analytic>
					<monogr>
						<imprint>
							<date/>
						</imprint>
					</monogr>
					<idno type="MD5">51FDC72AE3058D464267DD2F63E6DDB1</idno>
				</biblStruct>
			</sourceDesc>
		</fileDesc>
		<encodingDesc>
			<appInfo>
				<application version="0.7.2" ident="GROBID" when="2023-03-25T05:41+0000">
					<desc>GROBID - A machine learning software for extracting information from scholarly documents</desc>
					<ref target="https://github.com/kermitt2/grobid"/>
				</application>
			</appInfo>
		</encodingDesc>
		<profileDesc>
			<abstract/>
		</profileDesc>
	</teiHeader>
	<text xml:lang="ru">
		<body>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Аннотация</head><p>Графематический анализ предназначен для предварительного анализа текста по представляющей его последовательности символов <ref type="bibr" target="#b1">[2,</ref><ref type="bibr" target="#b2">3]</ref>. В результате этого анализа определяется язык текста, устанавливаются местоположения слов, предложений, абзацев, фамильно-именной группы, дат, адресов и т.п.</p><p>Морфологический анализ слов естественных языков предназначен для определения структуры слов и назначения им грамматических признаков, необходимых для выполнения последующих процедур автоматической обработки текстовой информации (например, синтаксического и концептуального анализа текстов) <ref type="bibr" target="#b7">[8,</ref><ref type="bibr" target="#b8">9]</ref>.</p><p>Семантико-синтаксический анализ текстов проводится с целью формализованного представления их структурывыделения в них смысловых единиц и установления связей между ними. При этом структура текстов может интерпретироваться по-разному и описываться на различных формализованных языках <ref type="bibr" target="#b6">[7,</ref><ref type="bibr" target="#b7">8]</ref>.</p><p>Концептуальный анализ текстов предназначен для определения смысловой структуры текстов, выявления их понятийного (концептуального) состава текстов и установления связей между наименованиями понятий <ref type="bibr" target="#b6">[7,</ref><ref type="bibr" target="#b7">8]</ref>.</p><p>Дистрибутивно-статистический анализ текстов естественных языков предназначен для установления статистических закономерностей совместной встречаемости наименований понятий <ref type="bibr" target="#b0">[1,</ref><ref type="bibr" target="#b8">9]</ref>. </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.3">Требования к извлечению данных</head></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Основной</head></div><figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_0"><head>Труды 16-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» -RCDL-2014, Дубна, Россия, 13-16 октября 2014 г.</head><label></label><figDesc></figDesc><table><row><cell cols="4">данных такого объема, а также не было четкого</cell><cell></cell><cell></cell></row><row><cell cols="4">представления о возможностях формализации</cell><cell></cell><cell></cell></row><row><cell cols="4">текстов, доступных методах преобразования</cell><cell></cell><cell></cell></row><row><cell cols="4">неструктурированных данных в структурированные</cell><cell></cell><cell></cell></row><row><cell cols="4">-т.е. не было понятия о доступном инструментарии.</cell><cell></cell><cell></cell></row><row><cell cols="4">В данной статье мы предлагаем возможный</cell><cell></cell><cell></cell></row><row><cell cols="4">инструментарий для проведения таких оценок и</cell><cell></cell><cell></cell></row><row><cell cols="4">предлагаем методы автоматической обработки</cell><cell></cell><cell></cell></row><row><cell cols="2">неструктурированной</cell><cell>текстовой</cell><cell>информации,</cell><cell></cell><cell></cell></row><row><cell cols="4">позволяющей разработать модель количественных</cell><cell></cell><cell></cell></row><row><cell cols="4">показателей. Мы также рассматриваем условия, при</cell><cell></cell><cell></cell></row><row><cell cols="4">которых приведенные методы будут адекватны</cell><cell></cell><cell></cell></row><row><cell cols="4">поставленной задаче в рамках заданной предметной</cell><cell></cell><cell></cell></row><row><cell cols="4">области, посредством настройки декларативных</cell><cell></cell><cell></cell></row><row><cell cols="4">средств к заданной предметной области с учетом</cell><cell></cell><cell></cell></row><row><cell cols="4">большого объема обрабатываемых данных.</cell><cell></cell><cell></cell></row><row><cell cols="4">В возможности создания формализованного данной статье рассматриваются представления информационных публикаций в сети Интернет для получения показателей количественной оценки средств семантической предметной области. адекватных результатов анализа в заданной сообщений для получения наиболее обработки методы адаптации автоматизированных описания информационных сообщений и методы построения формализованного таких публикаций. Также рассматриваются деятельности органов власти по материалам Мы провели моделирование процесса автоматизированной обработки текстов с целью получения количественных показателей на примере информационных сообщений Интернет-СМИ и пользователей социальной сети «ВКонтакте» о деятельности органов власти Ханты-Мансийского автономного округа (ХМАО).</cell><cell cols="3">оценок по результатам изучения материалов ставят задачи перехода от качественных экспертных В этих условиях эксперты-аналитики все чаще о деятельности органов власти. аналитиков в области оценки общественного мнения этих сведений, затрудняя деятельность экспертов-значительной мере усложняет задачу обработки подобной информации с каждым годом в с другой стороны, все более возрастающий объем Все более широкое приобщение населения к электронным информационным ресурсам, в том числе рост популярности социальных сервисов среди молодежи и стимулирование государством использования гражданами электронных госуслуг, с одной стороны, предоставляет все больше возможностей для оперирования данными, получаемыми в электронном виде по сети Интернет,</cell></row><row><cell cols="4">1 Введение В настоящее время приобретает все большую актуальность получение обратной связи от населения при оценке деятельности органов власти. Такая оценка востребована как самими органами власти для принятия оперативных решений, их вышестоящими и надзорными структурами, так и различными общественными и исследовательскими организациями по мониторингу общественного мнения.</cell><cell cols="3">информационных автоматизированным количественным методам сообщений к оценки общественного мнения о деятельности органов власти. Такие методы имеют два неоспоримых взаимосвязанных преимущества: во-первых, дают возможность получения более объективных статистических показателей, благодаря росту объема обрабатываемых данных, во-вторых, максимально освобождают результаты оценки от субъективного экспертного представления о действительной ситуации по тем же самым</cell></row><row><cell cols="4">Одним из возможных источников сбора</cell><cell>причинам</cell><cell>и</cell><cell>вследствие</cell><cell>более</cell><cell>глубокой</cell></row><row><cell>информации исследований</cell><cell cols="3">для является проведения информационное подобных</cell><cell cols="3">автоматизации информации, воспринять которую в ее исходном обработки этого объема</cell></row><row><cell cols="4">пространство электронных средств массовых</cell><cell cols="3">виде за короткий период времени ни один эксперт</cell></row><row><cell cols="4">коммуникаций в сети Интернет, включающее такие</cell><cell cols="3">просто не в состоянии.</cell></row><row><cell cols="4">источники информации, как электронные средства массовой информации (СМИ), публикации в блогах и на форумах, сообщения в социальных сетях, сервисы коротких сообщений (например, Twitter) и электронные ресурсы обратной связи с населением на государственных порталах по приему жалоб и обращений граждан.</cell><cell cols="3">В то же время решение данной задачи сталкивается с рядом комплексных проблем. Прежде всего, необходимы современные и адекватные средства семантического анализа неструктурированной текстовой информации. Далее необходимо определить набор показателей для проведения количественного статистического</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="3">анализа. В настоящее время имеется серьезная</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="3">проблема с отсутствием определенного набора</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="3">показателей для подобных оценок. Это связано с</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="3">тем, что ранее у занимающихся этими вопросами</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="3">исследователей не было большого опыта обработки</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_1"><head>2 Программно-техническое обеспечение 2.1 Общие требования к процессу автоматизации</head><label></label><figDesc></figDesc><table><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>в) выделение и классификация объектов, их</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>признаков и отношений между ними и</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>классификация текстов по типам отношений автора</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>сообщения к основным объектам мониторинга;</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>г) автоматизированная настройка декларативных</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>(словарных) средств лингвистического процессора</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>на заданную предметную область.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>3. Обработка</cell><cell>данных</cell><cell>с</cell><cell>применением</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>технологий «Big Data»:</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>а) обеспечение</cell><cell>распределенной</cell><cell>массово-</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>параллельной лингвистической и статистической</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>обработки загружаемых данных;</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>б) обеспечение масштабируемости на множество</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>узлов обработки без деградации инфраструктуры</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>обработки данных [2, 3].</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>Подзадача 1 (мониторинг материалов) является</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>достаточно</cell><cell>тривиальной</cell><cell>задачей,</cell><cell>имеющей</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>множество</cell><cell>программно-технических</cell><cell>решений.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>Подзадача 3 (обработка данных с применением</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>технологий «Big Data») является самостоятельным</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>направлением исследований, и мы оставляем ее за</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>рамками данной статьи, при этом учитывая</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>требования</cell><cell>по</cell><cell>распределенности</cell><cell>и</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>масштабируемости к средствам лингвистической</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>обработки текстов.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>В данной статье мы рассматриваем подзадачу 2</cell></row><row><cell cols="5">Для автоматизации решения задачи оценки деятельности органов власти по материалам Интернет-публикаций необходимо обеспечить</cell><cell>(лингвистическая обработка неструктурированных текстов), методы ее обеспечения и требования к созданию декларативных (словарных) средств [1, 7].</cell></row><row><cell cols="5">программно-техническую реализацию следующих</cell></row><row><cell cols="2">основных ее подзадач:</cell><cell></cell><cell></cell></row><row><cell cols="2">1. Мониторинг</cell><cell>материалов</cell><cell></cell><cell>Интернет-</cell></row><row><cell>публикаций:</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="2">а) консолидация</cell><cell cols="2">информационных</cell><cell>потоков</cell></row><row><cell cols="5">различных типов: ленты новостей на сайтах и</cell></row><row><cell cols="5">порталах Интернет-СМИ, органов власти и</cell></row><row><cell cols="5">комментарии пользователей к ним, публикации на</cell></row><row><cell cols="5">форумах и в блогах, сообщения пользователей</cell></row><row><cell cols="5">социальных сетей и сервисов коротких сообщений,</cell></row><row><cell cols="5">электронные обращения граждан и другие</cell></row><row><cell cols="2">доступные ресурсы;</cell><cell></cell><cell></cell></row><row><cell cols="2">б) оперативный</cell><cell>мониторинг</cell><cell></cell><cell>изменения</cell></row><row><cell>информации</cell><cell>на</cell><cell cols="2">подключенных</cell><cell>ресурсах</cell></row><row><cell cols="5">(информационных источниках) и сбор (считывание</cell></row><row><cell cols="5">и загрузка) содержимого текстовых материалов;</cell></row><row><cell cols="2">в) унификация</cell><cell>форматов</cell><cell cols="2">представления</cell></row><row><cell cols="5">текстовых сообщений, извлечение возможных</cell></row><row><cell>реквизитов</cell><cell cols="2">публикаций,</cell><cell cols="2">аналогичных</cell></row><row><cell cols="5">библиографическому описанию (источник, рубрика,</cell></row><row><cell cols="5">автор, наименование публикации, временной период</cell></row><row><cell cols="4">и т.п.), в зависимости от типа источника.</cell></row><row><cell cols="3">2. Лингвистическая</cell><cell></cell><cell>обработка</cell></row><row><cell cols="3">неструктурированных текстов:</cell><cell></cell></row><row><cell cols="5">а) автоматическое создание формализованного</cell></row><row><cell cols="5">представления смысловой структуры текста;</cell></row><row><cell cols="5">б) кластеризация сходных по смысловому</cell></row><row><cell cols="5">содержанию текстов -группировка текстов</cell></row><row><cell cols="5">публикаций по темам (информационным поводам);</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_2"><head>2.2 Требования к лингвистическому программному обеспечению</head><label></label><figDesc></figDesc><table><row><cell cols="2">Современные системы автоматизированной</cell></row><row><cell cols="2">семантической обработки неструктурированной</cell></row><row><cell cols="2">текстовой информации, разрабатываемые для</cell></row><row><cell cols="2">решения задач данного типа, должны обеспечивать</cell></row><row><cell cols="2">выполнение следующих процедур лингвистического</cell></row><row><cell>анализа текстов [1-9]:</cell><cell></cell></row><row><cell>а) графематический анализ текста;</cell><cell></cell></row><row><cell>б) морфологический анализ слов;</cell><cell></cell></row><row><cell cols="2">в) семантико-синтаксический анализ текстов;</cell></row><row><cell>г) концептуальный анализ текстов;</cell><cell></cell></row><row><cell>д) дистрибутивно-статистический</cell><cell>анализ</cell></row><row><cell>текстов.</cell><cell></cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_3"><head>3 Экспериментальные данные 3.1 Предметная область и исходные данные для испытаний</head><label></label><figDesc></figDesc><table><row><cell>производственные 3) короткие сообщения Twitter (твиты) -SMS-объекты, географические</cell><cell>б) степень доверия (например, официальный информационных сообщениях -позитивные, семантических поиск и подбор документов, их</cell></row><row><cell>объекты, бренды) играет ключевую роль в подобные текстовые сообщения строго</cell><cell>источник, аккредитованное СМИ, «бульварная негативные или нейтральные. автоматическое реферирование и перевод.</cell></row><row><cell>задачей семантической обработки неструктурированной при выполнении текстовой информации является представление смысловой структуры текста в формализованном виде [8, 9]. В классическом виде формализованное представление текстового содержания документа должно содержать: а) библиографические реквизиты (например, информационный источник, рубрика, автор, наименование и дата публикации и т.п.); б) аннотацию или реферат документа; в) список ключевых выражений; г) классификацию документа по смысловому содержанию -отнесение его к той или иной рубрике и кластеризация (группировка) текстов публикаций по темам (информационным поводам). Рассмотрим более подробно каждый из реквизитов формализованного описания применительно к поставленной задаче. Библиографические реквизиты выделяются на этапе мониторинга информационных публикаций. Структура реквизитов документа (статьи, сообщения, комментария) закладывается в шаблон загрузки и парсинга (разбора на структурные элементы) страницы с текстом публикации для каждого конкретного информационного источника. Соответственно, выделение данных реквизитов происходит на стадии унификации формата документа. При этом на уровне данных реквизитов, определенных еще до проведения лингвистического анализа, проводится классификация документа, основанная на типе информационного источника. Такая классификация может проводиться по различным основаниям: а) тип документа (например, статья в СМИ, официальное сообщение, публикация в блоге, комментарий в социальной сети, электронное обращение граждан и т.п.); построении формализованного описания документа для его последующего семантического анализа [2, 3]. Как и в случае с аннотацией, в отличие от авторских ключевых выражений (указанных вручную и отражающих авторское представление о важных, на его взгляд, терминах документа), данные выражения выделяются семантико-синтаксическим и словарным методами, основываясь на реальном содержании текста и на значимости терминов в заданной предметной области (выявленной дистрибутивно-статистическим методом). Выделение объектов из списка ключевых выражений, таких как должностные лица, организации, территории, производственные объекты, географические объекты и бренды, представляет отдельный интерес, т.к. данные выражения зачастую являются объектами мониторинга. В отличие от обычных ключевых выражений, чаще предназначенных только для визуализации смыслового содержания, и чуть реже -фигурирующих в качестве тематических тегов документа, выделение объектов мониторинга из текстов позволяет определить основные опорные точки для формализованных показателей: 1) выделить из текста объекты и их предикаты; 2) дать классификацию объектов и отношений к объектам на основе классификации предикатов; 3) установить по тексту связи между объектами. Классификация объектов проводится на основе базового классификатора лингвистического процессора и дополнительного специально созданного по корпусу текстов классификатора заданной предметной области. Базовый классификатор содержит только основные классы (например, персона, должность, географический объект, дата-время, обычный концепт (термин) и т.п.) Классификатор предметной области позволяет задать более конкретную классификацию применительно к заданной предметной области (например, орган федеральной, региональной, муниципальной власти, его подразделение или подведомственное предприятие и т.п.). Классификация объектов позволяет отнести информационное сообщение к той или иной рубрике, а также применительно к нашей задаче определить к какой ветви структуры органов власти относится объект мониторинга для более нацеленного анализа высказываний, приведенных в публикациях. Классификация предикатов позволяет установить отношения к основным объектам мониторинга (органам власти и государственным функциям) авторов суждений, приведенных в ограниченного размера, характеризующиеся тезисным стилем изложения информации, большим количеством сокращений и наличием хэш-тегов вида #subject, при этом часть из этих тегов фигурирует в качестве дополнительных идентификаторов темы, расположенных в начале или в конце сообщения, а часть из низ являются непосредственными членами синтаксической структуры предложения (т.е. значимыми словами в связном тексте). 3.2 Использование лингвистического программного обеспечения Для проведения экспериментов мы использовали разработанное авторами статьи лингвистическое программное обеспечение (ПО) МетаФраз [10]. кластеризацию документов, морфологический и сущностей и установления связей, рубрикацию и текстов на естественном языке, извлечения (смысловой) обработки неструктурированных поддерживающих функционал семантической автоматизированных систем МетаФраз, продукт Системы, входящий в состав МетаФраз (MF Text Analyst R10) -программный 4) Система семантической обработки текстов перевода МетаФраз. формат словарей МетаФраз и модуль Системы корпусу текстов, конвертации текстовых словарей в включает модули создания частотных словарей по создания и верификации словарей МетаФраз, систем МетаФраз, поддерживающих функционал Системы, входящий в состав автоматизированных (MF Lingware Complex R10) -программный продукт 3) Лингвистический комплекс МетаФраз лингвистических процедур Системы. библиотек, обеспечивающих выполнение всех включающий набор лингвистических программных перевода (Kernel) -основной модуль Системы, 2) Ядро лингвистического процессора и системы базовых лингвистических процедур. текстов, а также набор грамматических таблиц для перевода и семантической (смысловой) обработки средств для задач фразеологического машинного содержащий комплекс декларативных (словарных) (MF Dictionary Lib R10) -основной ресурс Системы, 1) Библиотека словарей МетаФраз компоненты: проведения экспериментов, входят следующие В состав ПО МетаФраз R10, используемого для компьютерной лингвистики. отдельных функциональных задач в области продуктов, предназначенных для решения (Системы), состоящего из нескольких программных многофункционального программного комплекса в виде единого интегрированного Лингвистическое программное обеспечение МетаФраз R10 (Metafraz Lingware R10) разработано</cell><cell>пресса», подписанное обращение гражданина, анонимное сообщение и т.п.); в) вид сообщения (например, информационное сообщение, жалоба, комментарий к сообщению, мнение пользователей сети и т.п.); г) отношение к власти (например, подведомственный источник, аффилированный источник, оппозиционный источник, независимая пресса и т.п.). Аннотация к тексту документа в общем случае, может быть авторской и изначально сопровождать данный текст, а может отсутствовать в исходном тексте, тогда средствами лингвистического процессора создается автоматический реферат документа [9]. В отличие от автореферата (авторского реферата, отражающего авторское представление о важных, на его взгляд, тезизах документа), автоматический реферат выделяет значимое содержимое дистрибутивно-статистическим способом, основываясь на реальных смысловых акцентах в тексте и на значимости терминов (объектов) в заданной предметной области. Так же в отличие от автореферата, который может представлять собой стандартный шаблон с аналитическими ответами на ключевые вопросы о содержании документов данного типа, т.е. фактически являющимся пересказом (например, автореферат диссертации), автоматический реферат содержит реальный, не измененный текст документа. Зачастую документ, содержащийся в базе данных (БД), может интересовать пользователей в разрезе различных тематик. В таком случае необходимо подготовить автоматический контекстный реферат документа в разрезе рассматриваемой тематики или поискового запроса. В отличие от аннотации такой реферат необходимо строить каждый раз заново с учетом потребности пользователя в той или иной информации, а также ограничений на объем реферата. С помощью автоматического реферирования также можно выравнивать объемы сравниваемых по смыслу документов -для задач кластеризации документов с аналогичным содержанием. Ключевые выражения применительно к материалам электронных публикаций в рамках нашей задачи не являются важными средством визуализации смыслового содержания текста, в отличие, например, от текстов научно-технических публикаций [4-8]. При этом список ключевых выражений (наиболее значимых для данного текста с учетом предметной области) и выделенных из текстов объектов (например, персоны, должности, должностные лица, организации, территории, Кластеризация (группировка) документов выполняется на последнем этапе лингвистической обработки документов. Для проверки изложенной гипотезы авторы провели моделирование 5) Электронная библиотека документов МетаФраз (база данных) -ресурс, входящий в состав Системы семантической обработки текстов МетаФраз, предназначенный для загрузки и хранения в БД документов (текстовых файлов) и результатов их лингвистической обработки. Электронная библиотека документов реализована с использованием СУБД MS SQL Server. ПО МетаФраз обладает всеми необходимыми программными процедурами лингвистической процесса автоматизированной обработки текстов с целью получения количественных показателей на примере обработки неструктурированных текстов, необходимых для решения данной задачи, и позволяет адаптировать декларативные средства для информационных сообщений Интернет-СМИ и настройки на заданную предметную область путем пользователей социальной сети «Вконтакте» о быстрого автоматизированного создания словарей деятельности органов власти Ханты-Мансийского по корпусу текстов. автономного округа (ХМАО). Сначала мы провели сбор и анализ региональных местного самоуправления Далее мы собрали «ВКонтакте» в объеме около употребляемых сообщениями; связями с предыдущими комментариями и несвязной структурой текстов и анафорическими молодежной неформальной, нецензурной лексики, жаргонизмов и профессионализмов, неологизмов, значений слов, сокращений, орфографических ошибок, опечаток, неправильно форумов -характеризуются большим количеством 2) тексты социальных сетей, блогосферы и строгим языковым стилем; экспертные заключения -любые связные тексты со формальные заявления, обращения граждан, 1) официальные тексты, публикации СМИ, особенностей: отдельным корпусам текстов с учетом их настройки декларативных средств по трем сделаны выводы о необходимости разделения По результатам первичного анализа текстов данных. проведения нашего эксперимента по извлечению типов, и не использовали в дальнейшем для сообщений информационных источников различных анализа и сравнения лексического состава Twitter, который мы рассматривали только для представительный набор коротких сообщений Кроме того нами был проанализирован определяющей тональности высказываний граждан. неформатированного текста для анализа лексики, 650 Мб пользовательские публикации социальной сети региональные (www.admhmansy.ru). Ханты-Мансийска (www.admhmao.ru) и городского портала органов сайтов органов государственной власти ХМАО 1000 статей по материалам Интернет-СМИ ХМАО, инфраструктуры и должностных лиц в объеме около выделения наименований органов власти, объектов публикаций ХМАО с целью автоматизированного 3.3</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_4"><head>Автоматизированная настройка декларативных (словарных) средств на заданную предметную область</head><label></label><figDesc></figDesc><table><row><cell>отношения к объектам мониторинга: данных. публикаций в социальных сетях с точки зрения их проводить количественный статистический анализ частоты вычисляются такие параметры как его кратность, накопленная частота, накопленная кратность и относительная накопленная частота. Эти параметры позволяют выявить частотный понятийный состав предметной области и соотнести его с параметром покрытием этой частотой текстов предметной области. Автоматизация составления словарей позволяет в короткие сроки и с минимальными трудозатратами создать для заданной предметной области систему взаимосвязанных наименований понятий, основанную на корпусе реальных текстов в предметной области. 3.4 Создание классификаторов в предметной области Для создания классификаторов в предметной области были реализованы следующие этапы обработки корпуса текстов собранных публикаций: 1) разработаны методы, алгоритмы и ПО для выявления предикативных (глагольных) словосочетаний, характеризующих направление деятельности органов государственной власти и а) объект 1; б) предикат-связь; в) объект 2. Также было проведено последовательное отождествление документов по степени смысловой близости для кластеризации документов -группировка текстов публикаций по темам (информационным поводам). Для отождествления смысловой близости документов в нашей задаче применялись не полные тексты документов, а их автоконспекты. Автоконспект документа, представляющий собой автоматический реферат по наиболее значимым для данного текста и всей предметной области ключевым выражениям, позволяет провести группировку документов по их основному (наиболее значимому) информационному поводу. этот процесс также облегчается фиксированным (изначально заданным в настройках лингвистического процессора) объемом автоконспекта. 3.6 Оценка применимости полученных показателей оценки их качества по корпусу текстов публикаций СМИ; 2) разработаны методы, алгоритмы и ПО для выявления оценочных суждений о деятельности органов государственной власти и оценки их качества (по корпусу текстов сообщений социальных сетей); 3) проанализирован корпус текстов СМИ, относящихся к тематике деятельности органов власти ХМАО, автоматизированным способом структурой органов власти региона и их 4) по корпусу текстов СМИ выявлено более 6000 предикативных (глагольных) характеризующих направление деятельности органов государственной власти и оценки их качества; 5) определены типы выделенных объектов и проведена их классификация, определяющая их отношение к структуре органов власти: -губернаторская структура (губернатор лично, пресс-служба, аппарат, аффилированные лица губернатора); -исполнительная власть (правительство, министерства, госпредприятия); -муниципальная (городские и районные власти, коммунальные службы, муниципальные предприятия) -и их структурным подразделениям и выполняемым государственным функциям; 6) определены типы сообщений СМИ и предоставляемых показателей, позволяющих позволит существенно увеличить количество группировки сообщений с привлечением экспертов Расширение возможностей классификации и предприятий и государственных услуг и т.п. власти и функциональной принадлежности деятельности власти в разрезе иерархии органов -законодательная власть; СМИ, откликам пользователей сети, оценкам анализ сообщений по интенсивности воздействия что дает возможность проводить многомерный (позитивная, негативная, нейтральная) -в) оценка основного объекта мониторинга их подведомственных организаций; повод, в иерархической структуре органов власти и мониторинга, определяющего информационный б) положение основного объекта соцсетей); (публикации СМИ, высказывания пользователей а) тип информационного сообщения словосочетаний, нескольким основаниям: 2) все сообщения классифицированы по деятельностью (государственными функциями); значимости в общем объеме публикаций; встречаемости информационного повода и его доли выделено свыше 2000 объектов, связанных со количественно измеряемый параметр частоты информационным поводам -что дает пользователей «ВКонтакте») сгруппированы по 1) все сообщения (публикации СМИ, сообщения количественного анализа по текстам публикаций: следующие данные, пригодные для проведения информационным поводам позволили получить Представленное формализованное описание документов и методы его построения, а также методы кластеризации документов по</cell><cell>Для решения задач автоматической обработки информации в заданной предметной области необходимо провести работу по составлению семантических декларативных средств, в которых представляется понятийный состав предметной области и фиксируются смысловые отношения между понятиями. Общая технологическая схема составления концептуального словаря представляется в следующем виде. Предварительно составленный корпус текстов подвергается обработке процедурой семантико-синтаксического и концептуального анализа текстов, в результате чего из текстов выделяются отдельные слова и словосочетания различной длины. После этого по массиву выделенных из текстов слов и словосочетаний составляется частотный словарь. Полученный словарь обрабатывается процедурой орфографического и синтаксического контроля, в результате чего из этого словаря исключаются некорректные слова и словосочетания. Частотная часть словаря подвергается лингвистической обработке, в результате которой из словаря исключается малоинформативная и некорректная лексика. Далее выполняется автоматическое приведение наименований понятий к их канонической форме и формируется частотный словарь наименований понятий. И, наконец, на завершающем этапе выполняется семантико-статистический анализ частотного словаря на основе статистических данных о количественном и качественном составе этого словаря. С этой целью автоматически формируется характеристическая таблица частот встречаемости слов в текстах и для каждой объектами: предварительно упорядочиваются по убыванию 5. Список установленных связей между частотного словаря. Для этого частотный словарь -информирующие сообщения 4 Заключение (преимущественно СМИ) в отношении конкретных информационных поводов (фактов, событий, В настоящей статье авторы рассмотрели возможности создания формализованного персон); -сообщения, представления содержания информационных демонстрирующие осведомленность населения по сообщений для получения показателей конкретным количественной оценки деятельности органов информационным поводам; власти по материалам электронных средств -отношение населения (позитивное, негативное, массовых коммуникаций. нейтральное) к конкретным информационным Авторы описали структуру и методы создания поводам. формализованного описания документа для этой На основе результатов этой обработки созданы задачи, а также методы создания декларативных классификационные словари объектов и отношений в заданной предметной области. средств для получения наиболее адекватных результатов анализа в заданной предметной области. 3.5 Обработка текстов средствами МетаФраз После настройки декларативных Проведенные эксперименты на реальных данных средств показали жизнеспособность данного подхода, на лингвистического программного обеспечения на основе которого можно создавать действующие заданную предметную область мы провели системы мониторинга и семантического анализа автоматическую обработку имеющегося массива информационных сообщений. тестовых данных. В то же время необходимо более серьезно Для каждого документа было автоматически сформировано формализованное представление документа, включающее: прорабатывать методы решения поставленных задач с привлечением экспертов-аналитиков, специализирующихся в данной предметной области. в) класс предиката (для отношений к объектам мониторинга). типизации б) предикат; а) объект; набором данных: 4. Список объектов с предикатами со следующим всех вхождений в тексте). е) адреса в исходном тексте (координаты д) класс объекта; предметной области; г) вес выражения в тексте с учетом в) хеш выражения; (пословно в канонической форме); б) нормализованное наименование объекта а) наименование объекта; данных по каждому из них: 3. Список объектов со следующим набором 2. Общий автоматический (автоконспект) заданного объема по документу. реферат всех вхождений в тексте). е) адреса в исходном тексте (координаты 1. Список ключевых выражений со следующим набором данных по каждому из них: д) группа (группы) по классификатору; предметной области; г) вес выражения в тексте с учетом в) хеш выражения; (пословно в канонической форме); б) нормализованное ключевое выражение а) ключевое выражение; Авторы данной статьи продолжают работы по этой проблеме.</cell></row></table></figure>
		</body>
		<back>
			<div type="annex">
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Methods for Automatic Construction of a Formalized Representation of the Contents of Electronic Mass Communication Materials to Solve the Problem of Monitoring and Assessment of Authorities</head><p>Yury V. Nikitin, Alexander A. Khoroshilov, Alexei A. Khoroshilov This paper addresses to the possibility of generating a formalized representation of the information publications in the Internet to derive a quantitative evaluation of the authorities based on the content of such publications. It also covers methods of constructing a representation of messages and methods of adaptation of automated semantic processing tools for obtaining the most appropriate analysis results in a given domain.</p></div>			</div>
			<div type="references">

				<listBibl>

<biblStruct xml:id="b0">
	<monogr>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">В</forename><surname>Старовойтов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">О</forename><forename type="middle">Н</forename><surname>Пошатаев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">С</forename><surname>Прохоров</surname></persName>
		</author>
		<title level="m">Хорошилов А.А. Методы автоматизированного составления и ведения словарей // Сб. Информатизация и связь / Центр информационных технологий и систем органов исполнительной власти</title>
				<imprint>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="91" to="97" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b1">
	<monogr>
		<author>
			<persName><forename type="first">Ю</forename><forename type="middle">М</forename><surname>Богданов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">О</forename><forename type="middle">Н</forename><surname>Пошатаев</surname></persName>
		</author>
		<title level="m">Хорошилов А.А. Принципы создания высокопроизводительных систем обработки и анализа текстовой информации // Сб. Информатизация и связь / Центр информационных технологий и систем органов исполнительной власти</title>
				<imprint>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="74" to="81" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b2">
	<monogr>
		<author>
			<persName><forename type="first">О</forename><forename type="middle">Н</forename><surname>Пошатаев</surname></persName>
		</author>
		<author>
			<persName><forename type="first">А</forename><surname>Хорошилов</surname></persName>
		</author>
		<title level="m">Электронные библиотеки: перспективные методы и технологии, электронные коллекции», XV Всероссийская научная конференция RCDL 2013</title>
				<meeting><address><addrLine>Ярославль, Россия</addrLine></address></meeting>
		<imprint>
			<biblScope unit="page" from="30" to="38" />
		</imprint>
	</monogr>
	<note>.А. Методы анализа текстов в технологиях «Big Data» // сб</note>
</biblStruct>

<biblStruct xml:id="b3">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Р</forename><forename type="middle">С</forename><surname>Гиляревский</surname></persName>
		</author>
		<author>
			<persName><forename type="first">С</forename><forename type="middle">Н</forename><surname>Селедков</surname></persName>
		</author>
		<author>
			<persName><forename type="first">А</forename><surname>Хорошилов</surname></persName>
		</author>
		<title level="m">О путях повышения качества поиска текстовой информации в системе Интернет // Научнотехническая информация</title>
				<imprint>
			<date type="published" when="2012">2012</date>
			<biblScope unit="page" from="15" to="22" />
		</imprint>
	</monogr>
	<note>Информационные процессы и системы / Всероссийский институт научной и технической информации РАН</note>
</biblStruct>

<biblStruct xml:id="b4">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Р</forename><forename type="middle">С</forename><surname>Гиляревский</surname></persName>
		</author>
		<title level="m">Хорошилов А.А. Проблемы автоматической смысловой обработки текстовой информации // Научно-техническая информация</title>
				<imprint>
			<date type="published" when="2012">2012</date>
			<biblScope unit="volume">11</biblScope>
			<biblScope unit="page" from="24" to="28" />
		</imprint>
	</monogr>
	<note>Информационные процессы и системы / Всероссийский институт научной и технической информации РАН</note>
</biblStruct>

<biblStruct xml:id="b5">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Р</forename><forename type="middle">С</forename><surname>Гиляревский</surname></persName>
		</author>
		<author>
			<persName><forename type="first">А</forename><forename type="middle">А</forename><surname>Хорошилов</surname></persName>
		</author>
		<title level="m">Хорошилов-мл. А.А. Автоматическое распознавание смысловой близости документов // Научно-техническая информация. Сер. 2. Информационные процессы и системы / Всероссийский институт научной и технической информации РАН</title>
				<imprint>
			<date type="published" when="2011">2011</date>
			<biblScope unit="page" from="15" to="22" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b6">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Р</forename><surname>Гиляревский</surname></persName>
		</author>
		<idno>-№ 8</idno>
		<title level="m">Хорошилов Ал-др А., Хорошилов Ал-ей А. Развитие систем автоматической обработки текстовой информации // Нейрокомпьютеры: разработка, применение</title>
				<imprint>
			<date type="published" when="2010">2010</date>
			<biblScope unit="page" from="4" to="13" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b7">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<title level="m">Хорошилов Ал-ей А. Единицы языка и речи в системах автоматической обработки текстовой // Научно-техническая информация</title>
				<imprint>
			<date type="published" when="2005">2005</date>
			<biblScope unit="volume">11</biblScope>
			<biblScope unit="page" from="21" to="29" />
		</imprint>
	</monogr>
	<note>Информационные процессы и системы / Всероссийский институт научной и технической информации РАН</note>
</biblStruct>

<biblStruct xml:id="b8">
	<monogr>
		<author>
			<persName><forename type="first">Г</forename><forename type="middle">Г</forename><surname>Белоногов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Ю</forename><surname>Калинин</surname></persName>
		</author>
		<title level="m">Хорошилов А.А. Компьютерная лингвистика и перспективные информационные технологии. Теория и практика построения систем автоматической обработки текстовой информации. -Москва: Информационноиздательское агентство «Русский мир</title>
				<imprint>
			<date type="published" when="2004">2004</date>
			<biblScope unit="page">247</biblScope>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b9">
	<monogr>
		<ptr target="http://www.metafraz.ru" />
		<title level="m">Сайт МетаФраз</title>
				<imprint/>
	</monogr>
</biblStruct>

				</listBibl>
			</div>
		</back>
	</text>
</TEI>
