<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Oracle для анализа и исследования Больших Данных</article-title>
      </title-group>
      <contrib-group>
        <aff id="aff0">
          <label>0</label>
          <institution>Oracle Tools for Big data Analysis © Olga Gorchinskaya, Master Principal Sales Consultant, Business Analytics Oracle Corporation</institution>
        </aff>
      </contrib-group>
      <fpage>65</fpage>
      <lpage>66</lpage>
      <abstract>
        <p>Доклад посвящается инструментальной среде Oracle для совместного анализа и исследования структурированной, слабоструктурированной и неструктурированной информации. Стремительно развивающееся направление Больших Данных меняет концепцию аналитики огромные объемы разнообразной, чаще всего неструктурированной информации требуют новых подходов и технологий для эффективного ее использования. Традиционный подход к бизнес-анализу данных, основанный на идеях хранилища данных как «единого источника истины», предполагает работу в рамках четко фиксированной модели данных, гарантирует качество и непротиворечивость информации. В этом случае заранее известно, какие структуры данных содержатся в хранилище, и анализ в основном сводится к выполнению вычислительных процедур по агрегированию, детализации, фильтрации данных и визуализации результатов. Специфика Больших Данных связана не только с огромными объемами, но и с огромным разнообразием и изменчивостью, и это не позволяет ориентироваться на какую-либо заранее разработанную модель данных. В этом случае анализ данных должен сопровождаться многочисленными поисковыми операциями, в результате которых уточняется запрос на необходимую информацию. Такой подход к аналитике, при котором собственно аналитические операции интенсивно интегрируются с поисковыми, и нет модели данных в традиционном понимании, лежит в основе нового направления - Information Discovery или Исследование данных. Компания Oracle предлагает технологическую платформу для исследования данных - Endeca Information</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Труды 14-й Всероссийской научной конференции
«Электронные библиотеки: перспективные методы и
технологии, электронные коллекции» — RCDL-2012,
Переславль-Залесский, Россия, 15-18 октября 2012 г.
Discovery.</p>
      <p>Продукт Endeca Information Discovery
представляет собой платформу для исследования
структурированных, слабоструктурированных и
неструктурированных данных из различных
меняющихся источников в условиях нечетких
критериев поиска. Средства семантического анализа
позволяют выявлять в неструктурированном тексте
понятия, связи, факты и другие релевантные
данные. Система может быть дополнена как
собственными дополнительными модулями,
расширяющими функционал решения, так и
модулями сторонних производителей,
обеспечивающих, например, улучшенную
морфологическую поддержку и/или поддержку
различных дополнительных иностранных языков. В
результате система предоставляет средства
расширенного агрегирования и поиска информации,
в сочетании с мощной аналитикой.</p>
      <p>В состав Endeca Information Discovery входят
следующие компоненты:
 Studio. Интерактивная,
компонентноориентированная среда для быстрой
итеративной разработки и разворачивания
приложений для исследования данных. В
рамках таких приложений пользователи
получают удобные средства поиска и
исследования информации,
ориентированные на решение конкретных
прикладных задач.
 Oracle Endeca Text Enrichment. Модуль
поддерживает возможности
полнотекстового поиска и анализа, включая
выявление сущностей – физических лиц,
организаций, адресной информации,
автоматическое формирование аннотаций и
др.
 Oracle Endeca Text Enrichment with
Sentiment Analysis. Этот add-on module
включает средства обогащения текстовых
данных, а также предоставляет методы
углубленого анализа текста для извлечения
эмоциональной окраски или оттенков.
Оттенки представляются в виде числовых
значений и могут относиться как ко всему
тексту в целом, так и к конкретным
сущностям. Впоследствии эти значения
используются в рамках фасетного поиска,
объединяясь с другими данными.</p>
      <p>В докладе обсуждаются возможности платформы
Endeca Information Discovery, рассказывается об
особенностях разработки на ее основе прикладных
систем исследования данных, а также обсуждаются
примеры использования этого продукта для
решения практических задач.</p>
    </sec>
  </body>
  <back>
    <ref-list />
  </back>
</article>