<?xml version="1.0" encoding="UTF-8"?>
<TEI xml:space="preserve" xmlns="http://www.tei-c.org/ns/1.0" 
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" 
xsi:schemaLocation="http://www.tei-c.org/ns/1.0 https://raw.githubusercontent.com/kermitt2/grobid/master/grobid-home/schemas/xsd/Grobid.xsd"
 xmlns:xlink="http://www.w3.org/1999/xlink">
	<teiHeader xml:lang="ru">
		<fileDesc>
			<titleStmt>
				<title level="a" type="main">Комбинированная виртуально-материализованная среда интеграции больших неоднородных коллекций данных</title>
			</titleStmt>
			<publicationStmt>
				<publisher/>
				<availability status="unknown"><licence/></availability>
			</publicationStmt>
			<sourceDesc>
				<biblStruct>
					<analytic>
						<author>
							<persName><forename type="first">©</forename><forename type="middle">С А</forename><surname>Ступников</surname></persName>
							<affiliation key="aff0">
								<address>
									<settlement>ИПИ РАН, Москва</settlement>
								</address>
							</affiliation>
						</author>
						<author>
							<persName><forename type="first">©а</forename><forename type="middle">Е</forename><surname>Вовченко</surname></persName>
							<affiliation key="aff0">
								<address>
									<settlement>ИПИ РАН, Москва</settlement>
								</address>
							</affiliation>
						</author>
						<title level="a" type="main">Комбинированная виртуально-материализованная среда интеграции больших неоднородных коллекций данных</title>
					</analytic>
					<monogr>
						<imprint>
							<date/>
						</imprint>
					</monogr>
					<idno type="MD5">227B20D888AF683A2894AF90CD8B08B6</idno>
				</biblStruct>
			</sourceDesc>
		</fileDesc>
		<encodingDesc>
			<appInfo>
				<application version="0.7.2" ident="GROBID" when="2023-03-25T05:41+0000">
					<desc>GROBID - A machine learning software for extracting information from scholarly documents</desc>
					<ref target="https://github.com/kermitt2/grobid"/>
				</application>
			</appInfo>
		</encodingDesc>
		<profileDesc>
			<abstract/>
		</profileDesc>
	</teiHeader>
	<text xml:lang="ru">
		<body>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Аннотация</head><p>К моделям данных, появившимся в последнее время, относятся разнообразные NoSQL-модели: документные модели (системы SimpleDB, MongoDb, CouchDB), модели с колоночным хранением (системы HBase, HyperTable, Cassandra), модели «ключ-значение» (системы Voldemort, Riak, Redis, Scalaris).</p><p>Развиваются онтологические и семантические модели, такие, как семейства RDF и OWL; графовые модели (системы Neo4j, Dex, GraphDB, HyperGraphDB, Trinity, Pregel); модели, основанные на многомерных массивах -ММмодели (SciDB).</p><p>Методы создания унифицированного представления различных видов нетрадиционных моделей в канонической информационной модели (общем языке, унифицирующем языки разнообразных моделей данных) в последнее время активно исследовались в ИПИ РАН. Были рассмотрены подходы к унификации моделей данных различных классов: семантических (OWL <ref type="bibr" target="#b8">[10]</ref>, RDF <ref type="bibr" target="#b2">[3]</ref>), графовых <ref type="bibr" target="#b4">[5]</ref>, ММ-моделей <ref type="bibr" target="#b3">[4]</ref>, NoSQL-моделей <ref type="bibr" target="#b1">[2]</ref>. В качестве канонической модели рассматривался язык СИНТЕЗ <ref type="bibr" target="#b9">[11]</ref>  <ref type="bibr" target="#b0">[1]</ref>, реализованы адаптеры реляционной и объектно-реляционной моделей, адаптер веб-сервисов, XML-адаптер и другие. Формальной базой для построения адаптеров служат отображения моделей данных ресурсов в каноническую модель <ref type="bibr" target="#b5">[6]</ref>, разработанные в результате унификации моделей ресурсов.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="2.1">Платформа для материализованной интеграции ресурсов в комбинированной архитектуре</head><p>Для материализованной интеграции ресурсов в комбинированной архитектуре необходима масштабируемая платформа манипулирования большими разноструктурированными данными (ПМБРД). В качестве такой платформы в данной работе выбрана связка системы Hadoop и системы организации реляционных хранилищ данных над Hadoop -WR-Hadoop (в качестве которой могут использоваться, например, системы Big SQL <ref type="bibr" target="#b17">[22]</ref> или Hive <ref type="bibr" target="#b7">[9]</ref>).</p><p>Платформа Потенциально, в качестве ПМБРД может быть выбрана и другая платформа: например, вместо Hadoop могут быть использованы такие системы, как Apache Spark <ref type="bibr" target="#b6">[8,</ref><ref type="bibr" target="#b23">28]</ref>, GraphLab <ref type="bibr" target="#b15">[20,</ref><ref type="bibr" target="#b20">25]</ref>, Disco <ref type="bibr" target="#b12">[14]</ref>  </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head n="3">Преобразование коллекций данных нетрадиционных моделей в интегрированное представление</head><p>Рассмотрим пример коллекции данных, представленной в модели данных графовой СУБД Neo4j <ref type="bibr" target="#b21">[26]</ref>. Небольшой подграф базы данных о фильмах, включающий основные виды вершин, ребер и атрибутов, изображен на рис. 2.</p><p>Вершины графа соответствуют фильмам и людям, ребра графа соответствуют участию людей в создании фильма как актеров (CAST) или режиссера (DIRECTS). Люди характеризуются именем (name), фильмыназванием (title) и годом создания (year), роли актеровименем персонажа (character). Вершины и ребра графа обладают уникальными идентификаторами.</p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Рисунок 2. Пример графа в модели данных Neo4j</head><p>Графовая БД системы Neo4j может быть сериализована в формате JSON. Представление для вышеприведенного графа в JSON выглядит следующим образом:</p><p>[{ "id": 1, "type": "node", "labels": ["MOVIE"], "properties": {"title": "Lost in translation", "year": 2003} }, { "id": 2, "type": "node", "labels": ["PEOPLE"], "properties": {"name": "Bill Murray"} }, { "id": 3, "type": "node", "labels": ["PEOPLE"], "properties": {"name": "Sofia Coppola"} }, { "id": 4, "type": "relationship", "start_node": 1, "end_node": 2, "relationship_type": "CAST", "properties": {"character": "Bob Harris"} }, { "id": 5, "type": "relationship", "start_node": 3, "end_node": 1, "relationship_type": "DIRECTS" }] { "http://dbpedia.org/resource/Cambridge": { "http://dbpedia.org/property/officialName": [ { "type": "literal", "lang" : "en", "value" : "City of Cambridge" } ], "http://dbpedia.org/ontology/areaTotal": [ { "type": "literal", "value": 115650000, "datatype": "http://www.w3.org/XMLSchema#double"}], "http://dbpedia.org/ontology/isPartOf": [ { "type": "uri", "value": "http://dbpedia.org/resource/East_of_England" }, { "type": "uri", "value": "http://dbpedia.org/resource/Cambridgeshire" } ], "http://dbpedia.org/ontology/leaderName": [ { "type": "uri", "value": "http://dbpedia.org/resource/Andrew_Lansley"} ] } } { "http://dbpedia.org/resource/Andrew_Lansley": { "http://dbpedia.org/property/name": [ { "type" : "literal", "lang" : "en", "value" : "Andrew Lansley" } ], "http://dbpedia.org/ontology/birthDate": [ { "type": "literal", "value": "1956-12-10+02:00", "datatype": http://www.w3.org/XMLSchema#date } ], "http://dbpedia.org/ontology/party": [ { "type": "uri", "value": "http://dbpedia.org/resource/Conservative_ Party_(UK)" } ] , "http://dbpedia.org/ontology/electionMajority": [ { "type": "literal", "value": 7838, "datatype" : "http://www.w3.org/XMLSchema#integer"}] } }</p><p>Свойства Кембриджа как объекта включают, в частности, название (officialName), площадь (areaTotal), вышестоящие территориальные образования (isPartOf), лидера (leaderName). Свойства Эндрю Лэнсли, как объекта базы знаний , включают имя (name), дату рождения (birthDate), партию (party), количество голосов на выборах (electionMajority).</p><p>Реляционное представление объектов такого рода может выглядеть следующим образом. Схема реляционной БД состоит из двух отношений, одно из которых соответствует городам (Cities), другоеперсонам (Persons). Атрибутам отношений соответствуют свойства объектов. В RDFхранилищах подобные отношения, группирующие свойства однородных объектов, называются таблицами свойств (property tables <ref type="bibr" target="#b24">[29]</ref>).  { "user_id": "6835", "message_id": 254, "source": "ВКонтакте", "extracted_objects":{ "persons": [{ "name": "Василий", "surname": "Петров", "position": "губернатор"}], "territorial_entities": [ {"name": "Бобруйская", "type": "область"}, {"name": "Ухтомский", type: "район"}] }, "sentiment": "negative", "negative_keywords":</p><p>["барак", "отчаяние", "прогнивший"] } </p></div>
<div xmlns="http://www.tei-c.org/ns/1.0"><head>В тексте сообщения упоминаются губернатор</head></div><figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_1"><head>Труды 16-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» -RCDL-2014, Дубна, Россия, 13-16 октября 2014 г.</head><label></label><figDesc></figDesc><table><row><cell cols="3">слабоструктурированных</cell><cell></cell><cell cols="2">данных,</cell><cell>объясняется</cell><cell>данных, подлежащие интеграции. В процессе</cell></row><row><cell>множеством</cell><cell cols="3">фактических</cell><cell>и</cell><cell cols="2">потенциальных</cell><cell>загрузки происходит преобразование данных из</cell></row><row><cell cols="7">применений. Например, развитие Веб-приложений,</cell><cell>схемы коллекции в общую схему хранилища. При</cell></row><row><cell cols="7">социальных сетей, сенсорных сетей, финансовых и</cell><cell>необходимости,</cell><cell>хранилища</cell><cell>могут</cell></row><row><cell cols="7">торговых приложений, интенсивная работа с</cell><cell>масштабироваться на большие объемы данных (хотя</cell></row><row><cell cols="7">данными в науке (в науках о Земле, в</cell><cell>это требует соответствующих материальных затрат).</cell></row><row><cell cols="7">биоинформатике), и пр. требуют использования</cell><cell>Хранилища предоставляют удобную и эффективную</cell></row><row><cell cols="7">данных, которые с трудом поддаются частичной</cell><cell>платформу преобразования и интеграции данных, а</cell></row><row><cell cols="7">структуризации. Твиты и посты в блогах являются</cell><cell>также решения сложных аналитических задач над</cell></row><row><cell>включают</cell><cell cols="5">слабоструктурированные</cell><cell>текстовые</cell><cell>данными.</cell></row><row><cell cols="7">отрывки, Преобразование изображения такого структурированный формат для семантического и видео-ролики. контента в анализа и поиска является трудной задачей, имеющей целью отображение структур и семантики данных в форму, «понимаемую» компьютером для извлечения информации из данных.</cell><cell>Материализованная интеграция реализуется в комбинированной архитектуре с использованием свободно распространяемой платформы распределенного хранения и обработки данных Hadoop [27]; а также системы организации реляционных хранилищ данных над Hadoop (WR-Hadoop для краткости), в качестве которой могут</cell></row><row><cell>Данная</cell><cell>работа</cell><cell></cell><cell cols="2">относится</cell><cell></cell><cell>к</cell><cell>области</cell><cell>использоваться, например, платформы Big SQL [22]</cell></row><row><cell cols="7">конструирования средств поддержки систем с</cell><cell>или Hive [9].</cell></row><row><cell cols="7">интенсивным использованием данных. Методы унификации моделей данных образуют формальную базу работы.</cell><cell>В данной статье рассматриваются основные принципы построения комбинированной виртуально-материализованной архитектуры и</cell></row><row><cell cols="7">Целью работы является разработка и реализация</cell><cell>подходы к ее реализации. Создание программных</cell></row><row><cell cols="7">комбинированной виртуально-материализованной</cell><cell>средств реализации рассматриваемой архитектуры</cell></row><row><cell cols="7">архитектуры среды интеграции неоднородных</cell><cell>является</cell><cell>предметом</cell><cell>дальнейшей</cell><cell>работы.</cell></row><row><cell>коллекций</cell><cell cols="2">данных</cell><cell></cell><cell cols="3">различного</cell><cell>вида</cell><cell>Ближайшей задачей является выбор конкретной</cell></row><row><cell cols="7">(структурированных, слабоструктурированных и</cell><cell>системы WR-Hadoop, одним из вариантов которой</cell></row><row><cell cols="3">неструктурированных).</cell><cell cols="2">Такая</cell><cell cols="2">среда</cell><cell>должна</cell><cell>является поддержка обеих систем Big SQL и Hive.</cell></row><row><cell cols="7">поддерживать материализованную интеграцию коллекций данных, как виртуальную, так и представленных как в традиционных, так и нетрадиционных моделях данных.</cell><cell>Статья организована следующим образом. В разделе 2 рассматриваются основные черты комбинированной архитектуры. В разделе 3 иллюстрируются преобразования коллекций,</cell></row><row><cell cols="7">Необходимость поддержки двух различных</cell><cell>представленных в нетрадиционных моделях данных,</cell></row><row><cell cols="7">видов интеграции объясняется тем, что как</cell><cell>в их интегрированное представление в модели</cell></row><row><cell cols="7">виртуальный, так и материализованный подходы</cell><cell>данных сопряжения Hadoop -среда посредников. В</cell></row><row><cell cols="7">интеграции имеют свои достоинства и недостатки.</cell><cell>разделе 4 рассматривается пример задачи</cell></row><row><cell cols="7">Виртуальная интеграция осуществляется с использованием технологии предметных</cell><cell>интеграции неоднородных коллекций данных в комбинированной среде.</cell></row><row><cell cols="7">посредников [12], образующих промежуточный</cell></row><row><cell cols="7">слой между пользователем (приложением) и</cell></row><row><cell cols="7">неоднородными информационными ресурсами. При</cell></row><row><cell cols="7">этом данные из ресурсов не материализуются в</cell></row><row><cell>посреднике.</cell><cell>К</cell><cell cols="3">достоинствам</cell><cell></cell><cell>виртуальной</cell></row><row><cell cols="7">интеграции относится то, что развертывание и</cell></row><row><cell cols="7">поддержка системы виртуальной интеграции значительно дешевле развертывания и поддержки системы материализованной интеграции (хранилища данных) исходя как из временных, так и из материальных затрат. Обычно системы виртуальной интеграции используются для интеграции ресурсов, данные из которых трудно преобразовывать и (или) владельцами которых являются разные лица. Однако, данные в интегрируемых ресурсах не должны быть слишком большими, либо запросы к ресурсам должны обладать достаточной степенью селективности для того, чтобы объем данных, передаваемых из ресурса, не был слишком велик. При материализованной интеграции предполагается создание хранилища данных (warehouse), в которое загружаются коллекции</cell><cell>, комбинированную слабоструктурированную (фреймовую) и объектную поддерживающий модель данных. Для поддержки новых моделей данных создаются системы управления данными, обладающие масштабируемостью, высокой доступностью, возможностью разбиения коллекций данных произвольным образом на разделы для параллельной обработки. Растущая популярность использования слабоструктурированных баз данных (в различных видах NoSQL) наряду с реляционными базами, в совокупности с технологиями программирования Hadoop и MapReduce, обеспечивающими параллельную обработку огромных массивов</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_2"><head>2 Архитектура комбинированной виртуально-материализованной среда интеграции коллекций данных</head><label></label><figDesc></figDesc><table><row><cell cols="5">Рисунок 1. Архитектура комбинированной среды интеграции неоднородных коллекций данных</cell></row><row><cell cols="5"> пользователь задает программы (запросы) над</cell></row><row><cell cols="5">концептуальной схемой. Эти запросы</cell></row><row><cell cols="2">переписываются</cell><cell>в</cell><cell cols="2">посреднике</cell><cell>с</cell></row><row><cell cols="5">использованием взглядов в частичные</cell></row><row><cell cols="5">подзапросы в терминах конкретных ресурсов.</cell></row><row><cell cols="5">Переписывание осуществляется в языке</cell></row><row><cell cols="5">правил канонической модели посредников;</cell></row><row><cell cols="5"> взаимодействие ресурсов и посредника</cell></row><row><cell>реализуется</cell><cell>при</cell><cell></cell><cell>помощи</cell><cell>адаптеров,</cell></row><row><cell cols="5">располагающихся между посредником и</cell></row><row><cell cols="5">ресурсами. Адаптеры преобразуют запросы</cell></row><row><cell cols="5">из языка правил канонической модели в язык ресурса, а также преобразуют результат исполнения запроса из формата ресурса в формат посредника.</cell><cell>Архитектура интеграции неоднородных коллекций данных комбинированной среды (рис. 1) основана на существующей архитектуре предметных посредников [12].</cell></row><row><cell cols="5">Таким образом, для виртуальной интеграции ресурсов, основанных на традиционных и нетрадиционных моделях, необходимо построение адаптеров соответствующих моделей данных. В области построения адаптеров для среды предметных посредников накоплен большой опыт, разработаны общая архитектура адаптеров и методы конструирования адаптеров</cell><cell>Основные следующим образом: черты  концептуальная схема данных, предлагаемая архитектуры выглядят пользователю системой интеграции (посредником), формируется независимо от интегрируемых ресурсов;  ресурсы, релевантные концептуальной схеме, регистрируются в посреднике: их схемы</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>связываются с концептуальной схемой при</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>помощи</cell><cell>представлений</cell><cell>(взглядов).</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>Определение</cell><cell>взглядов</cell><cell>осуществляется</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>полуавтоматически и требует привлечения</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell>экспертов;</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_5"><head></head><label></label><figDesc>другоеребрам (Relationships, табл. 2).</figDesc><table><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>(filter) и преобразования элементов массивов</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>(transform), связанные оператором организации</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>потоков данных (-&gt;).</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>В качестве еще одного примера коллекции</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>данных</cell><cell>рассмотрим</cell><cell>базу</cell><cell>знаний</cell><cell>DBpedia</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>(http://dbpedia.org/).</cell><cell>Коллекция</cell><cell>содержит</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>структурированную информацию, извлеченную из</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>свободной энциклопедии Википедия. Данные в</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>коллекции представлены в модели RDF. В качестве</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>примеров данных рассмотрим RDF-спецификации</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>города Кембридж (Великобритания) и его</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>представителя в Парламенте Эндрю Лэнсли.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>Спецификации представлены в формате JSON:</cell></row><row><cell></cell><cell cols="5">Здесь start_node и end_node обозначают</cell></row><row><cell cols="2">исходящую</cell><cell>и</cell><cell cols="2">входящую</cell><cell>вершины</cell><cell>ребра</cell></row><row><cell cols="6">соответственно; labels множество меток,</cell></row><row><cell cols="4">присвоенных вершине.</cell><cell></cell></row><row><cell></cell><cell cols="5">Реляционное представление данной графовой БД</cell></row><row><cell cols="6">может выглядеть следующим образом. Схема</cell></row><row><cell cols="6">реляционной БД состоит из двух отношений, одно</cell></row><row><cell cols="6">из которых соответствует вершинам графа (Nodes,</cell></row><row><cell cols="6">табл. 1), Таблица 1. Отношение Nodes</cell></row><row><cell>id</cell><cell>labels</cell><cell></cell><cell>title</cell><cell cols="2">year</cell><cell>name</cell></row><row><cell>1</cell><cell>["MOVIE"]</cell><cell></cell><cell>"Lost in</cell><cell cols="2">2003</cell></row><row><cell></cell><cell></cell><cell></cell><cell>translation"</cell><cell></cell></row><row><cell>2</cell><cell>["PEOPLE"]</cell><cell></cell><cell></cell><cell></cell><cell>"Bill Murray"</cell></row><row><cell>3</cell><cell>["PEOPLE"]</cell><cell></cell><cell></cell><cell></cell><cell>"Sofia Coppola"</cell></row><row><cell></cell><cell cols="5">Таблица 2. Отношение Relationships</cell></row><row><cell>id</cell><cell>start_node</cell><cell></cell><cell>end_node</cell><cell cols="2">relationship_type</cell><cell>character</cell></row><row><cell>4</cell><cell>1</cell><cell></cell><cell>2</cell><cell>"CAST"</cell><cell>"Bob Harris"</cell></row><row><cell>5</cell><cell>3</cell><cell></cell><cell>1</cell><cell cols="2">"DIRECTS"</cell></row><row><cell></cell><cell cols="5">Преобразование графовой БД в реляционное</cell></row><row><cell cols="6">представление может быть осуществлено при</cell></row><row><cell cols="6">помощи следующих двух функций, определенных</cell></row><row><cell cols="2">на языке Jaql:</cell><cell></cell><cell></cell><cell></cell></row><row><cell></cell><cell cols="5">createNodesRelation = fn(movie_graph_db)(</cell></row><row><cell></cell><cell cols="5">movie_graph_db-&gt;filter $.type == "node"-&gt;</cell></row><row><cell></cell><cell cols="5">transform { id: $.id, labels: $.labels,</cell></row><row><cell></cell><cell cols="5">title: $.properties.title, year: $.properties.year,</cell></row><row><cell></cell><cell cols="5">name: $.properties.name } );</cell></row><row><cell></cell><cell cols="5">createRelationshipRelation = fn(movie_graph_db)(</cell></row><row><cell></cell><cell cols="5">movie_graph_db-&gt;filter $.type == "relationship"-&gt;</cell></row><row><cell></cell><cell cols="3">transform { id: $.id,</cell><cell></cell></row><row><cell></cell><cell cols="5">start_node: $.start_node, end_node: $.end_node,</cell></row><row><cell></cell><cell cols="5">relationship_type: $.relationship_type,</cell></row><row><cell></cell><cell cols="5">character: $.properties.character } );</cell></row><row><cell></cell><cell cols="5">Функции принимают на вход представление</cell></row><row><cell cols="6">графовой БД в формате JSON. Первая из функций</cell></row><row><cell cols="6">возвращает отношение Nodes в формате JSON,</cell></row><row><cell cols="6">пригодное для загрузки в соответствующую</cell></row><row><cell cols="6">реляционную таблицу, вторая -отношение</cell></row><row><cell cols="2">Relationships.</cell><cell></cell><cell>При</cell><cell cols="2">определении</cell><cell>функций</cell></row><row><cell cols="6">используются выражения фильтрации массивов</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_6"><head></head><label></label><figDesc>Таблица 3. Отношение Cities</figDesc><table><row><cell>subject</cell><cell cols="2">officialName</cell><cell>area Total</cell><cell></cell><cell>isPartOf</cell><cell>leaderName</cell></row><row><cell>"http://dbpedia.org/</cell><cell cols="2">["City of</cell><cell>[115650000]</cell><cell cols="2">["http://dbpedia.org/resource/</cell><cell>["http://dbpedia.org/</cell></row><row><cell>resource/Cambridge"</cell><cell cols="2">Cambridge"]</cell><cell></cell><cell cols="2">East_of_England",</cell><cell>resource/Andrew_Lansley"]</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"http://dbpedia.org/resource/</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Cambridgeshire"]</cell></row><row><cell></cell><cell></cell><cell></cell><cell cols="3">Таблица 4. Отношение Persons</cell></row><row><cell>subject</cell><cell></cell><cell></cell><cell cols="2">birthdate</cell><cell>party</cell><cell>election</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>Majority</cell></row><row><cell>"http://dbpedia.org/</cell><cell></cell><cell>["Andrew</cell><cell cols="2">["1956-12-10+02:00"]</cell><cell>["http://dbpedia.org/resource/</cell><cell>[7838]</cell></row><row><cell cols="2">resource/Andrew_Lansley"</cell><cell>Lansley"]</cell><cell></cell><cell></cell><cell>Conservative_Party_(UK) "]</cell></row><row><cell cols="4">Преобразование RDF-объектов персон в кортежи</cell><cell></cell></row><row><cell cols="4">отношения Persons может быть осуществлено при</cell><cell></cell></row><row><cell cols="4">помощи функции createPersonTuple, определенной</cell><cell></cell></row><row><cell>на языке</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="3">createPersonTuple = fn(person_rdf) (</cell><cell></cell><cell></cell></row><row><cell cols="4">pa = ["http://dbpedia.org/property/name",</cell><cell></cell></row><row><cell cols="4">"http://dbpedia.org/ontology/birthDate",</cell><cell></cell></row><row><cell cols="4">"http://dbpedia.org/ontology/party",</cell><cell></cell></row><row><cell cols="4">"http://dbpedia.org/ontology/electionMajority"],</cell><cell></cell></row><row><cell cols="4">properties_record = index(values(person_rdf), 0),</cell><cell></cell></row><row><cell>if( not</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="2">containedIn( "false",</cell><cell></cell><cell></cell><cell></cell></row><row><cell>for($pa in pa)</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="2">if(containedIn($pa,</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="4">names(record(values(person_rdf)))))</cell><cell></cell></row><row><cell>["true"]</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="2">else ["false"])</cell><cell></cell><cell></cell><cell></cell></row><row><cell>)</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="3">if( arity(person_rdf) == 1 )</cell><cell></cell><cell></cell></row><row><cell cols="4">{ subject: index(names(person_rdf), 0),</cell><cell></cell></row><row><cell cols="2">name: for( $name in</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="4">properties_record."http://dbpedia.org/property/</cell><cell></cell></row><row><cell cols="3">name") [$name.value],</cell><cell></cell><cell></cell></row><row><cell cols="3">birthday: for( $birthday in</cell><cell></cell><cell></cell></row><row><cell cols="4">properties_record."http://dbpedia.org/ontology/</cell><cell></cell></row><row><cell cols="3">birthDate") [$birthday.value],</cell><cell></cell><cell></cell></row><row><cell cols="2">party: for( $party in</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="4">properties_record."http://dbpedia.org/ontology/</cell><cell></cell></row><row><cell cols="3">party") [$party.value],</cell><cell></cell><cell></cell></row><row><cell cols="3">electionMajority: for( $em in</cell><cell></cell><cell></cell></row><row><cell cols="4">properties_record."http://dbpedia.org/ontology/</cell><cell></cell></row><row><cell cols="4">electionMajority") [$em.value]</cell><cell></cell></row><row><cell>}</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell>);</cell><cell></cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="4">Функция принимает на вход RDF спецификацию</cell><cell></cell></row><row><cell cols="4">персоны в формате JSON и возвращает кортеж,</cell><cell></cell></row><row><cell cols="4">пригодный для загрузки в соответствующую</cell><cell></cell></row><row><cell cols="4">реляционную таблицу. При определении функции</cell><cell></cell></row><row><cell cols="4">используются условное выражение if, выражение</cell><cell></cell></row><row><cell cols="4">цикла for, встроенные функции манипулирования</cell><cell></cell></row><row><cell cols="4">массивами и записями names, values, record, index</cell><cell></cell></row><row><cell cols="4">[16] и вспомогательная функция containedIn(elm,</cell><cell></cell></row><row><cell cols="4">arr), возвращающая значение true, если значение elm</cell><cell></cell></row><row><cell cols="3">является элементом массива arr:</cell><cell></cell><cell></cell></row><row><cell cols="2">containedIn = fn(elm, arr)(</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="4">exists(for( $iter in arr ) if($iter == elm) [true]) );</cell><cell></cell></row><row><cell cols="4">Функция преобразования RDF-объектов городов</cell><cell></cell></row><row><cell cols="3">определяется аналогичным образом.</cell><cell></cell><cell></cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_7"><head>4 Пример задачи интеграции неоднородных коллекций данных</head><label></label><figDesc></figDesc><table><row><cell cols="5">В рамках задачи анализу подлежат статьи из</cell><cell></cell></row><row><cell cols="5">СМИ и сообщения из социальных сетей за</cell><cell></cell></row><row><cell cols="5">определенный период времени (текущий год,</cell><cell></cell></row><row><cell cols="5">квартал и т.д.) и опубликованные авторами,</cell><cell></cell></row><row><cell cols="5">проживающими в определенном регионе. Такие</cell><cell></cell></row><row><cell>статьи</cell><cell>и</cell><cell>сообщения</cell><cell>извлекаются</cell><cell>из</cell><cell></cell></row><row><cell cols="5">соответствующих ресурсов, загружаются в Hadoop и</cell><cell></cell></row><row><cell cols="5">пропускаются через средства текстовой аналитики 2 ,</cell><cell></cell></row><row><cell cols="5">развернутые на каждом из узлов кластера. Анализ</cell><cell></cell></row><row><cell cols="5">текста позволяет извлечь из текстов статей и</cell><cell></cell></row><row><cell cols="5">сообщений различные упоминаемые объекты:</cell><cell></cell></row><row><cell cols="5">персоны их должности), территориальные</cell><cell></cell></row><row><cell cols="5">образования, организации и т.д. Также анализ текста</cell><cell></cell></row><row><cell cols="5">позволяет оценить тональность сообщения -</cell><cell></cell></row><row><cell cols="5">выявить позитивное, нейтральное или негативное</cell><cell></cell></row><row><cell cols="5">отношение автора текста к теме текста. Таким</cell><cell></cell></row><row><cell cols="5">образом, тональность текста может быть связана с</cell><cell></cell></row><row><cell cols="4">объектами, упоминаемыми в тексте.</cell><cell></cell><cell></cell></row><row><cell cols="5">Например, приведенного выше сообщения из сети ВКонтакте, информация, извлеченная из может выглядеть следующим образом:</cell><cell cols="2">Рассматриваемая задача состоит в определении отношения населения к экономическим и политическим вопросам в конкретном регионе. В задаче используются следующие информационные</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>ресурсы:</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2"> архивы региональных электронных СМИ;  социальные сети (например, ВКонтакте);  сервисы микроблогов (например, Twitter).</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Ресурсы существенным образом отличаются по</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">структуре, а также по характеру и лексике текстов.</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Например, сообщение из Twitter, представленное в</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">формате JSON, содержит текст, идентификатор</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">сообщения, язык сообщения, дату создания,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">информацию о пользователе (приведена лишь часть</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">данных, составляющих сообщение):</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">{ "text": "В первом квартале 2014 ввод жилья в</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>Бобруйской</cell><cell>области</cell><cell>вырос</cell><cell>на</cell><cell>30</cell><cell>процентов</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">http://t.co/9cTJcnkucI",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"id": 441892291058622460,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>"lang": "ru",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"created_at": "Fri Mar 07 11:05:06 +0000 2014",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"user": { "name":"Петр Иванов",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"screen_name":"32_minute",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"id": 2191013094}</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>}</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">Сообщение из сети ВКонтакте содержит</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">идентификатор сообщения, идентификатор автора,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">идентификатор получателя, дату создания, текст,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">количество «лайков», количество переотправок</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">(приведена лишь часть данных, составляющих</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">сообщение; текст сообщения приведен не</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>полностью):</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>{ "id": 254,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"from_id":2785124,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"to_id":6835,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"date":1387737719,</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"text":"Бобруйская область -регион# в котором</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">добывается больше половины всего леса в России. Однако</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">на благосостоянии простых жителей Ухтомского района</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">это никак не сказывается. …",</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"likes":{"count": 10},</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell cols="2">"reposts":{"count": 5, "user_reposted": 5}</cell></row><row><cell></cell><cell></cell><cell></cell><cell></cell><cell></cell><cell>}</cell></row></table></figure>
<figure xmlns="http://www.tei-c.org/ns/1.0" type="table" xml:id="tab_8"><head></head><label></label><figDesc>Big SQL<ref type="bibr" target="#b25">[30]</ref>. Эти средства появились в июле 2014 г., в момент создания финальной версии статьи. Федерализация является прямым аналогом виртуальной интеграции в предметных посредниках. Архитектура системы федерализации BigSQL (рис. 2) средства выполнения программ (Runtime Engine), адаптеры (Wrappers) и удаленные базы данных. Важным компонентом является Optimizer, осуществляющий планирование исполнения запроса с использованием статистической оценочной модели. Для доступа к конкретным ресурсам используются адаптеры. На текущий момент поддерживается федерализация для реляционных СУБД DB2, Oracle, Teradata и Netezza. Поддерживается реализация собственных адаптеров пользователем на языках C++ и Java. Big SQL обладают рядом сходных черт: слои выполнения программ, адаптеров и ресурсов; планирование запросов; настраиваемые адаптеры. Рисунок 2. Архитектура BigSQL Federalization Преимуществом подхода предметных посредников является ориентация на разномодельные ресурсы. Посредники позволяют интегрировать модельно неоднородные ресурсы: реляционные, объектно-реляционные, XML, NoSQL, веб-сервисы и др. Средства BigSQL ориентированы на виртуальную интеграцию реляционных баз данных. Подробный анализ средств федерализации Big SQL и их сравнение с предметными посредниками являются задачами дальнейшей работы.</figDesc><table><row><cell cols="5">сообщений и статей, упоминающих этих лиц или</cell></row><row><cell cols="2">организации.</cell><cell></cell><cell></cell><cell></cell></row><row><cell cols="5">Отношение населения к экономическим и</cell></row><row><cell cols="5">политическим вопросам может быть также</cell></row><row><cell cols="5">ограничено некоторой темой, например, «проблемы</cell></row><row><cell cols="5">жилищно-коммунального хозяйства». В этом случае</cell></row><row><cell cols="5">анализу подвергаются лишь те сообщения, в</cell></row><row><cell cols="5">которых присутствуют ключевые слова (или их</cell></row><row><cell cols="5">комбинации), относящиеся к теме, например,</cell></row><row><cell cols="5">{жилье, ЖКХ, отопление, электричество, тариф,</cell></row><row><cell cols="4">барак, ветхий, аварийный}.</cell><cell></cell></row><row><cell cols="5">Дополнительные аналитические возможности</cell></row><row><cell cols="5">предоставляет виртуальная интеграция социальных</cell></row><row><cell cols="5">графов (хранимых в графовой базе данных,</cell></row><row><cell cols="5">например, Neo4j [26]) и хранилища сообщений и</cell></row><row><cell>статей</cell><cell>в</cell><cell>одном</cell><cell>предметном</cell><cell>посреднике.</cell></row><row><cell cols="5">Социальные графы (образуемые отношениями</cell></row><row><cell cols="5">«друг» или «подписчик») загружаются в графовую</cell></row><row><cell cols="5">базу данных, предоставляющую операции и</cell></row><row><cell cols="5">алгоритмы анализа графов. Предметный посредник,</cell></row><row><cell cols="5">интегрирующий социальные графы и хранилище</cell></row><row><cell cols="5">статей и сообщений, позволяет формулировать и</cell></row><row><cell cols="5">исполнять программы, определяющие влияние</cell></row><row><cell cols="5">социальных сетей на формирование отношения</cell></row><row><cell cols="5">населения к экономическим и политическим</cell></row><row><cell cols="5">Василий Петров, территориальные образования Бобруйская область и Ухтомский район. Текст носит отрицательную тональность. Материализованные статьи и сообщения, обогащенные информацией, извлеченной из текстов, преобразуются к виду, удовлетворяющему единой схеме хранилища 3 . В хранилище помещаются также данные, извлеченные из профилей пользователей социальных сетей. Определение отношения населения к экономическим и политическим вопросам может быть осуществлено путем различных запросов к схеме хранилища. Могут быть сделаны выводы, например, об отношении населения к конкретным лицам, организациям за определенные промежутки времени и на определенной территории путем подсчета позитивных, нейтральных и негативных В статье рассмотрены основные принципы организации архитектуры комбинированной виртуально-материализованной среды интеграции больших неоднородных коллекций данных и подходы к ее реализации. Целью архитектуры является сопряжение возможностей предметных посредников по интеграции разномодельных коллекций данных и возможностей по манипулированию разноструктурированными данными, предоставляемыми платформой Hadoop и ее надстройками. Масштабирование обработки коллекций данных при помощи технологии Hadoop представляется дополнением, существенно расширяющим возможности технологии предметных посредников по решению задач над неоднородными информационными ресурсами. Реализация архитектуры, ее практическое применение и сравнение с родственными подходами распределенных запросов в посредниках [1] и Заключение вопросам. Например, может быть отслежено распространение во времени позитивных, нейтральных и негативных сообщений, относящихся к некоторой теме (заданной ключевыми словами) в связных подграфах социальных сетей. 5 Родственные работы В качестве примера подхода, родственного предлагаемой в данной статье комбинированной виртуально-материализованной архитектуре, необходимо упомянуть средства федерализации, поддерживаемые в Архитектура и подход к выполнению являются задачами дальнейшей работы.</cell></row></table></figure>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="2" xml:id="foot_0">Обсуждение методов и средств текстовой аналитики выходит за рамки данной статьи.</note>
			<note xmlns="http://www.tei-c.org/ns/1.0" place="foot" n="3" xml:id="foot_1">Принципы построения схемы хранилища для задачи выходят за рамки данной статьи, ввиду ограниченности ее объема.</note>
		</body>
		<back>
			<div type="annex">
<div xmlns="http://www.tei-c.org/ns/1.0"><head>Combined Virtual and Materialized Environment for Integration of Large Heterogeneous Data Collections</head><p>Sergey Stupnikov, Alexey Vovchenko Architecture of a combined virtual and materialized environment for integration of heterogeneous data collections is provided. Collections are assumed to contain structured, semi-structured or unstructured data. Combination of virtual and materialized integration is motivated by advantages and disadvantages of both approaches. Virtual integration is supported by subject mediation technology. Materialized integration is provided by Hadoop (open source software framework for storage and distributed processing of large datasets) accompanied by a system implementing relational warehouse over Hadoop (as examples, Hive and Big SQL are considered).</p></div>			</div>
			<div type="references">

				<listBibl>

<biblStruct xml:id="b0">
	<analytic>
		<title level="a" type="main">Вовченко Рассредоточенная реализация приложений в среде предметных посредников : дис</title>
		<author>
			<persName><forename type="first">А</forename></persName>
		</author>
	</analytic>
	<monogr>
		<title level="j">канд. техн. наук</title>
		<imprint>
			<biblScope unit="volume">05</biblScope>
			<biblScope unit="issue">13</biblScope>
			<biblScope unit="page">216</biblScope>
			<date type="published" when="2012">2012</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b1">
	<monogr>
		<author>
			<persName><forename type="first">Н</forename><forename type="middle">А</forename><surname>Скворцов</surname></persName>
		</author>
		<title level="m">Отображение моделей данных NoSQL в объектные спецификации // Труды 14-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» RCDL&apos;2012</title>
				<imprint>
			<publisher>Ун-т города Переславля</publisher>
			<date type="published" when="2012">2012</date>
			<biblScope unit="page" from="78" to="87" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b2">
	<monogr>
		<author>
			<persName><forename type="first">Н</forename><forename type="middle">А</forename><surname>Скворцов</surname></persName>
		</author>
		<title level="m">Отображение модели данных RDF в каноническую модель предметных посредников // Труды 15-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» RCDL&apos;2013. -Ярославль: Ярославский гос. ун-т им</title>
				<imprint>
			<publisher>Демидова</publisher>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="202" to="209" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b3">
	<monogr>
		<author>
			<persName><forename type="first">С</forename><forename type="middle">А</forename><surname>Ступников</surname></persName>
		</author>
		<title level="m">Унификация модели данных, основанной на многомерных массивах, при интеграции неоднородных информационных ресурсов // Труды 14-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» RCDL&apos;2012</title>
				<imprint>
			<publisher>Ун-т города Переславля</publisher>
			<date type="published" when="2012">2012</date>
			<biblScope unit="page" from="67" to="77" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b4">
	<monogr>
		<author>
			<persName><forename type="first">С</forename><forename type="middle">А</forename><surname>Ступников</surname></persName>
		</author>
		<title level="m">Отображение графовой модели данных в каноническую объектнофреймовую информационную модель при создании систем интеграции неоднородных информационных ресурсов // Труды 15-й Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» RCDL&apos;2013. -Ярославль: Ярославский гос</title>
				<imprint>
			<publisher>Демидова</publisher>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="193" to="202" />
		</imprint>
	</monogr>
	<note type="report_type">ун-т им</note>
</biblStruct>

<biblStruct xml:id="b5">
	<monogr>
		<author>
			<persName><forename type="first">С</forename><forename type="middle">А</forename><surname>Ступников</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Н</forename><forename type="middle">А</forename><surname>Скворцов</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><forename type="middle">И</forename><surname>Будзко</surname></persName>
		</author>
		<author>
			<persName><forename type="first">В</forename><forename type="middle">Н</forename><surname>Захаров</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Л</forename></persName>
		</author>
		<title level="m">Калиниченко. Методы унификации нетрадиционных моделей данных. Системы высокой доступности // Радиотехника</title>
				<imprint>
			<date type="published" when="2014">2014</date>
			<biblScope unit="volume">1</biblScope>
			<biblScope unit="page" from="18" to="39" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b6">
	<monogr>
		<ptr target="http://spark.apache.org/" />
		<title level="m">Apache Spark project</title>
				<imprint>
			<date type="published" when="2014">2014</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b7">
	<monogr>
		<title level="m" type="main">Programming Hive Data Warehouse and Query Language for Hadoop</title>
		<author>
			<persName><forename type="first">Edward</forename><surname>Capriolo</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Dean</forename><surname>Wampler</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Jason</forename><surname>Rutherglen</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2012">2012</date>
			<publisher>O&apos;Reilly Media</publisher>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b8">
	<analytic>
		<title level="a" type="main">OWL as Yet Another Data Model to be Integrated // Advances in Databases and Information Systems</title>
		<author>
			<persName><forename type="first">L</forename><forename type="middle">A</forename><surname>Kalinichenko</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><forename type="middle">A</forename><surname>Stupnikov</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proc. II of the 15th East-European Conference</title>
				<meeting>II of the 15th East-European Conference<address><addrLine>Vienna</addrLine></address></meeting>
		<imprint>
			<publisher>Austrian Computer Society</publisher>
			<date type="published" when="2011">2011</date>
			<biblScope unit="page" from="178" to="189" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b9">
	<monogr>
		<title level="m" type="main">SYNTHESIS: a Language for Canonical Information Modeling and Mediator Definition for Problem Solving in Heterogeneous Information Resource Environments</title>
		<author>
			<persName><forename type="first">L</forename><forename type="middle">A</forename><surname>Kalinichenko</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><forename type="middle">A</forename><surname>Stupnikov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">D</forename><forename type="middle">O</forename><surname>Martynov</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2007">2007</date>
			<publisher>IPI RAN</publisher>
			<biblScope unit="page">171</biblScope>
			<pubPlace>Moscow</pubPlace>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b10">
	<analytic>
		<title level="a" type="main">Mediation Framework for Enterprise Information System Infrastructures</title>
		<author>
			<persName><forename type="first">L</forename><forename type="middle">A</forename><surname>Kalinichenko</surname></persName>
		</author>
		<author>
			<persName><forename type="first">D</forename><forename type="middle">O</forename><surname>Briukhov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">D</forename><forename type="middle">O</forename><surname>Martynov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">N</forename><forename type="middle">A</forename><surname>Skvortsov</surname></persName>
		</author>
		<author>
			<persName><forename type="first">S</forename><forename type="middle">A</forename><surname>Stupnikov</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proc. of the 9th International Conference on Enterprise Information Systems ICEIS 2007. -Funchal</title>
				<meeting>of the 9th International Conference on Enterprise Information Systems ICEIS 2007. -Funchal</meeting>
		<imprint>
			<date type="published" when="2007">2007</date>
			<biblScope unit="page" from="246" to="251" />
		</imprint>
	</monogr>
	<note>Volume Databases and Information Systems Integration</note>
</biblStruct>

<biblStruct xml:id="b11">
	<analytic>
		<title level="a" type="main">Jaql: A Scripting Language for Large Scale Semistructured Data Analysis</title>
		<author>
			<persName><forename type="first">Kevin</forename><forename type="middle">S</forename><surname>Beyer</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Vuk</forename><surname>Ercegovac</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Rainer</forename><surname>Gemulla</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Andrey</forename><surname>Balmin</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Mohamed</forename><surname>Eltabakh</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Carl-Christian</forename><surname>Kanne</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Fatma</forename><surname>Ozcan</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Eugene</forename><forename type="middle">J</forename><surname>Shekita</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="j">VLDB</title>
		<imprint>
			<date type="published" when="2011">2011</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b12">
	<monogr>
		<ptr target="http://discoproject.org/" />
		<title level="m">Disco framework for distributed computing based on the MapReduce paradigm</title>
				<imprint>
			<date type="published" when="2014">2014</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b13">
	<analytic>
		<title level="a" type="main">HIL: a high-level scripting language for entity integration</title>
		<author>
			<persName><forename type="first">Mauricio</forename><surname>Hernández</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Georgia</forename><surname>Koutrika</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Rajasekar</forename><surname>Krishnamurthy</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Lucian</forename><surname>Popa</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Ryan</forename><surname>Wisnesky</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proceedings of the 16th International Conference on Extending Database Technology EDBT</title>
				<meeting>the 16th International Conference on Extending Database Technology EDBT</meeting>
		<imprint>
			<date type="published" when="2013">2013</date>
			<biblScope unit="page" from="549" to="560" />
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b14">
	<monogr>
		<ptr target="http://www.json.org/" />
		<title level="m">Introducing JSON</title>
				<imprint>
			<date type="published" when="2014">2014</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b15">
	<analytic>
		<title level="a" type="main">GraphLab: A New Parallel Framework for Machine Learning</title>
		<author>
			<persName><forename type="first">Yucheng</forename><surname>Low</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Joseph</forename><surname>Gonzalez</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Aapo</forename><surname>Kyrola</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Danny</forename><surname>Bickson</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Carlos</forename><surname>Guestrin</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Joseph</forename><forename type="middle">M</forename><surname>Hellerstein</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Conference on Uncertainty in Artificial Intelligence (UAI)</title>
				<imprint>
			<date type="published" when="2010">2010</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b16">
	<monogr>
		<title level="m" type="main">MapReduce Design Patterns: Building Effective Algorithms and Analytics for Hadoop and Other Systems</title>
		<author>
			<persName><forename type="first">Donald</forename><surname>Miner</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2012">2012</date>
			<publisher>O&apos;Reilly Media</publisher>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b17">
	<monogr>
		<title level="m" type="main">What&apos;s the big deal about Big SQL? Introducing relational DBMS users to IBM&apos;s SQL technology for Hadoop</title>
		<author>
			<persName><forename type="first">Cynthia</forename><forename type="middle">M</forename><surname>Saracco</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Uttam</forename><surname>Jain</surname></persName>
		</author>
		<ptr target="http://www.ibm.com/developerworks/library/bd-bigsql/bd-bigsql-pdf.pdf" />
		<imprint>
			<date type="published" when="2013">2013</date>
		</imprint>
	</monogr>
	<note type="report_type">IBM DeveloperWorks</note>
</biblStruct>

<biblStruct xml:id="b18">
	<monogr>
		<ptr target="http://hive.apache.org/" />
		<title level="m">The Apache Hive data warehouse software</title>
				<imprint>
			<date type="published" when="2014">2014</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b19">
	<monogr>
		<ptr target="http://goo.gl/GqkDX1" />
		<title level="m">The Forth Paradigm: Data-Intensive Scientific Discovery</title>
				<editor>
			<persName><forename type="first">Tony</forename><surname>Hey</surname></persName>
		</editor>
		<editor>
			<persName><forename type="first">Stewart</forename><surname>Tansley</surname></persName>
		</editor>
		<editor>
			<persName><forename type="first">Kristin</forename><surname>Tolle</surname></persName>
		</editor>
		<meeting><address><addrLine>Redmond</addrLine></address></meeting>
		<imprint>
			<publisher>Microsoft Research</publisher>
			<date type="published" when="2009">2009</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b20">
	<monogr>
		<ptr target="http://graphlab.org/projects/index.html" />
		<title level="m">The GraphLab Project</title>
				<imprint/>
	</monogr>
</biblStruct>

<biblStruct xml:id="b21">
	<monogr>
		<ptr target="http://goo.gl/cHiOGF" />
		<title level="m">The Neo4j Manual</title>
				<imprint>
			<date type="published" when="2014">2014</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b22">
	<monogr>
		<title level="m" type="main">Hadoop: The Definitive Guide. O&apos;Reilly Media</title>
		<author>
			<persName><forename type="first">Tom</forename><surname>White</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2012">2012</date>
		</imprint>
	</monogr>
	<note>Third Edition edition</note>
</biblStruct>

<biblStruct xml:id="b23">
	<monogr>
		<title level="m" type="main">Spark: Cluster Computing with Working Sets</title>
		<author>
			<persName><forename type="first">Matei</forename><surname>Zaharia</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Mosharaf</forename><surname>Chowdhury</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Michael</forename><forename type="middle">J</forename><surname>Franklin</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Scott</forename><surname>Shenker</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Ion</forename><surname>Stoica</surname></persName>
		</author>
		<imprint>
			<date type="published" when="2010">2010</date>
			<pubPlace>HotCloud</pubPlace>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b24">
	<analytic>
		<title level="a" type="main">Efficient RDF Storage and Retrieval in Jena2</title>
		<author>
			<persName><forename type="first">Kevin</forename><surname>Wilkinson</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Craig</forename><surname>Sayers</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Harumi</forename><surname>Kuno</surname></persName>
		</author>
		<author>
			<persName><forename type="first">Dave</forename><surname>Reynolds</surname></persName>
		</author>
	</analytic>
	<monogr>
		<title level="m">Proc. of the First International Workshop on Semantic Web and Databases</title>
				<meeting>of the First International Workshop on Semantic Web and Databases</meeting>
		<imprint>
			<date type="published" when="2003">2003</date>
		</imprint>
	</monogr>
</biblStruct>

<biblStruct xml:id="b25">
	<monogr>
		<title level="m" type="main">Set up and use federation in InfoSphere BigInsights Big SQL V3</title>
		<author>
			<persName><forename type="first">Mara Elisa De Paiva Fernandes</forename><surname>Matias</surname></persName>
		</author>
		<idno>0. 22</idno>
		<ptr target="http://www.ibm.com/developerworks/library/ba-federation-biginsights/index.html" />
		<imprint>
			<date type="published" when="2014-07">July 2014. July 2014</date>
		</imprint>
	</monogr>
	<note>First published 08</note>
</biblStruct>

				</listBibl>
			</div>
		</back>
	</text>
</TEI>
