<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Цифровая библиотека научных статей по количественной спектроскопии</article-title>
      </title-group>
      <contrib-group>
        <aff id="aff0">
          <label>0</label>
          <institution>Zinaida Apanovich</institution>
          ,
          <addr-line>Pavel Vinokurov, Alexey Akhlyostin, Alexey Privezentsev, Alexander Fazliev</addr-line>
        </aff>
      </contrib-group>
      <fpage>205</fpage>
      <lpage>214</lpage>
      <abstract>
        <p>В докладе обсуждается подход к построению цифровой библиотеки научных статей для предметной области, в которой фактологическая часть существенно превосходит понятийную. На примере библиотеки статей по количественной спектроскопии показано как использование модели публикации (статьи), содержащей решение задач предметной области и свойства этого решения, приводит к автоматической каталогизации решений. Особое внимание в работе уделено визуализации индивидов онтологии, характеризующих пары источников информации. Визуализация позволяет давать качественную оценку состоятельности решений задач спектроскопии в случае анализа данных большого объема.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Авторы благодарны РФФИ (гранты 11-07-00660
и 11-07-0038) и РАН (проект РАН 15/10) за
финансирование работы.</p>
      <p>
        Систематизация ресурсов библиотечного фонда в
библиотеках основана на библиографических записях,
определяемых тем или иным стандартом [1]. В
большинстве библиотек научные статьи не являются
единицами хранения. В цифровых библиотеках
научные публикации в журналах, трудах
конференций или сборниках статей являются единицами
хранения, и, как правило, в таких библиотеках
содержатся системы поиска статей, основанные на
библиографических записях, относящихся к статьям.
В работе [
        <xref ref-type="bibr" rid="ref12 ref27">2, 3</xref>
        ] описаны функциональные требования
к библиотечным записям.
Труды 14-й Всероссийской научной конференции
«Электронные библиотеки: перспективные методы и
технологии, электронные коллекции» — RCDL-2012,
Переславль-Залесский, Россия, 15-18 октября 2012 г.
      </p>
      <p>На практике системы поиска ресурсов в научных
цифровых библиотеках опираются на тексты статей
на естественном языке. Большая часть поисковых
систем не использует формализованные понятия
предметных областей, содержащиеся в искомых
ресурса в явном или неявном виде, по простой
причине: большинство понятий не формализовано.
Задачу поиска с учетом терминологии предметной
области решают с помощью
информационнопоисковых тезаурусов (см., например, [4]). В таком
подходе терминология предметной области
формируется с учетом лингвистических особенностей языка и
онтологических отношений терминов предметной
области. Существенной сложностью в формировании
терминологии является ее изменение во времени. Как
правило, такими изменениями пренебрегают и
ограничиваются только онтологическими
отношениями верхнего уровня или, если требуется детализация,
онтологиями предметной области. Прикладные
онтологии [5] характеризуют наиболее динамичную
часть знаний и требуют для их представления
описания с большим количеством деталей.</p>
      <p>
        В докладе рассматривается онтология источников
информации, связанных с публикациями по
количественной спектроскопии. В этой предметной
области причиной динамичного изменения
терминологии является прогресс в измерительной аппаратуре,
инициирующий создание все более сложных
математических моделей молекул для изучения новых
диапазонов волновых чисел и параметров
спектральных линий.
При выполнении грантов и проектов авторы
собрали опубликованные решения шести задач в
количественной спектроскопии для атмосферных
молекул (вода [
        <xref ref-type="bibr" rid="ref29">6</xref>
        ], диоксид углерода [7], аммиак [8],
метан [
        <xref ref-type="bibr" rid="ref32">9</xref>
        ], сероводород [10] и т.д.). Части
публикаций, содержащие решения одной из шести
задач количественной спектроскопии, были
выделены и загружены в информационные системы,
каждая из которых включала в себя молекулы
определенной симметрии. Созданные системы
содержат все опубликованные решения задач в
рамках моделей данных, описанных в работе [11].
Рис.1 Модель публикации. а) – оригинал публикации, б) –
решение задачи спектроскопии и в) – свойства решения
задачи спектроскопии.
      </p>
      <p>Каждое такое решение является частью
публикации, а в количественной спектроскопии
основной частью, так как содержит наибольшее
число типизованных фактов. В простом случае
выбирая модель публикации или ее части, можно
ограничиться решением задач спектроскопии, что
соответствует публикации таких решений на сайтах
и FTP. База данных по молекуле диоксида углерода,
описанная в предыдущей части статьи, и
содержащая опубликованные решения задач, может быть
рассмотрена как модель электронной библиотеки.
Решение задачи, дополненное свойствами, может
служить более точной формальной моделью
публикации. В спектроскопии такой набор свойств
был предложен в [12].</p>
      <p>Ниже рассмотрена модель публикации для
предметной области «Количественная спектроскопия».
Она может применяться и для других предметных
областей в которых фактологическая часть
значительно превышает понятийную. Эта модель
позволяет автоматизировать процесс каталогизации
научных статей и их частей. Рассмотрен пример
библиотеки по количественной спектроскопии.
Наконец, представлены примеры визуализации
индивидов, характеризующих индивидуальные
свойства решений задач спектроскопии и парных
отношений между источниками данных.</p>
      <p>Целью выполненной работы являлось
построение цифровой библиотеки, в рамках которой
возможен дифференцированный поиск достоверных
информационных ресурсов или недостоверных
ресурсов в предметной области по принятым в ней
критериям. Для достижения цели построена модель
публикации, выбраны языки спецификации данных,
информации и знаний, созданы источники данных и
информации. Показано, что анализ достоверности
значительного количества источников данных
существенно проще при графическом
представлении парных отношений.
2 Модель публикации</p>
      <p>Создание модели публикации для цифровой
библиотеки научных статей связано с задачей
автоматической каталогизации информационных
ресурсов по количественной спектроскопии.
Имеющаяся у авторов коллекция статей уже превышает
8000 публикаций, относящихся к периоду с 1926</p>
      <p>Основой для построения модели является
допущение о том, что публикация содержит факты,
являющиеся решениями ряда задач спектроскопии.
Эти факты разделены на две группы. К первой
группе относятся такие решения задач, которые
можно отнести к одной молекуле и одному методу
решения. Ко второй группе относятся все
оставшиеся решения.</p>
      <p>Извлеченные из публикаций факты являются
частями и представляются в цифровой библиотеке в
форме первичных или составных источников
данных. С каждым источником данных связывается
источник информации, содержащий свойства
соответствующего решения задачи спектроскопии. На
рис.1 схематически показано представление модели
в виде двух частей с помощью интерфейсов
представления данных и информации.</p>
      <p>Для формирования источника данных
используется реляционная модель данных, а источника
информации – язык онтологий OWL DL.
Представление источников информации в виде индивидов
онтологии является основой для автоматической
каталогизации решений задач спектроскопии.</p>
      <p>Рис.1 б) демонстрирует отображение данных
соответствующей публикации в информационной
системе, а рис.1 в) – представление автоматически
сгенерированных в ИС свойств этого решения.
2.1 Независимые части публикации (первичные
источники данных)</p>
      <p>Разнообразие молекул, для которых решались
задачи, выделенные в работе [11], и методов,
которыми они решались, достаточно большое. По
этой причине в одной публикации могут быть
приведены решения нескольких задач разными
методами и для разных молекул или их
изотопологов. При систематизации данных, извлеченных из
публикаций, такое смешение создает много
проблем. По этой причине в работе используется
информационный объект, представляющий
оригинальные данные публикации, относящиеся к одной
молекуле, одной задаче спектроскопии и одному
методу решения.</p>
      <p>Определение 1. Все части опубликованного
решения задачи количественной спектроскопии,
дополненные названием молекулы,
библиографической ссылкой и названием метода решения задачи
(или ссылкой на описание метода) называются
первичным источником данных.</p>
      <p>Мы предполагаем, что пустые решения не
публикуются. С другой стороны решения задач
могут содержать данные измерений, которые со
временем устаревают или неверные решения.
Источник данных, содержание которого целиком
отклонено экспертами будем называть ничтожным.
Количество таких источников в современной
спектроскопии незначительно.</p>
      <p>Формализованный первичный источник данных
содержит решение задачи и обладает свойствами
[14] (isSolutionOf, hasMethod, isRelatedToSubstance и
hasReference), имеющими кардинальность равную
1. Важной характеристикой источника данных
является независимость значений этих свойств от
времени. Ключевым свойством в определении
источника данных является hasReference. Значение
этого свойства должно быть определено явно и
являться публикацией.</p>
      <p>
        В количественной спектроскопии, наряду с
журналами, монографиями, отчетами и трудами
конференций, в последнее десятилетие появились
публикации решений задач в Вебе. Необходимость
публикации в Вебе обусловлена значительными их
объемами (превышающими сотни Гб.) Примерами
таких ресурсов являются спектральные данные,
размещенные в Европе [15,16], России [17], США
[
        <xref ref-type="bibr" rid="ref2 ref26">18,19</xref>
        ] и т.д.
      </p>
      <p>Первичные источники данных, относящиеся к
одной публикации, не имеют общих данных. Этот
факт схематично представлен на рис.2а, где овалом
обозначена публикация, а треугольниками –
источники данных. В публикации по количественной
спектроскопии может содержаться не один
первичный источник данных.
2.2 Составные источники данных (агрегации
первичных данных в статьях)</p>
      <p>Определение 2. Информационный объект,
обладающий базовыми свойствами первичного
источника данных, кардинальность любого из которых
отличается от единицы, называется составным
источником данных.</p>
      <p>
        Примером составного источника данных
является любой экспертный массив спектральных
данных (например, Hitran [
        <xref ref-type="bibr" rid="ref2">19</xref>
        ]).
2.3 Источник информации
      </p>
      <p>Первичный источник можно наделять
дополнительными свойствами. Перечень и число этих
свойств зависит от информационных задач, для
решения которых используются такие свойства.
Источник данных с дополнительными свойствами
назовем источником информации.</p>
      <p>Определение 3. Первичный источник данных,
наделенный дополнительными свойствами,
называется первичным источником информации
извлеченной из публикации.
Источник информации представляет собой набор
свойств и их значений, относящихся к источнику
данных. Для ряда информационных задач,
например, задачи поиска достоверных решений задач
количественной спектроскопии, можно выбрать
Рис.2 Соотношения между публикациями, источниками
данных и источниками информации.
свойства, значения которых вычисляются
автоматически. Как правило, источник информации включает
в себя некоторые высказывания из публикации,
содержащей источник данных, который этот
источник информации описывает. Большая часть
источника информации характеризует знания,
содержащиеся в публикации в неявном виде.</p>
      <p>Перечень дополнительных свойств определяется
исследователем, исходя из информационных задач,
которые ему необходимо решать. В нашей работе
таких задач две. Это задача семантического поиска
и задача автоматического построения экспертного
массива данных. Заметим, что первичные источники
информации, относящиеся к одной публикации, не
содержат идентичных высказываний. Различие
между публикацией и первичным источником
информации может быть существенно меньшим по
сравнению с различием между публикацией и
первичным источником данных. Различие
обусловлено теми дополнительными свойствами решения
задачи в публикации, которые вошли в определение
того или иного источника информации. Например,
такими дополнительными свойствами могут быть
описание достоверности решения задачи, описание
стандартных отклонений исходного источника
данных от других источников данных и т.д.. Кроме
того, высказывания, содержащиеся в первичном
источнике информации, могут не содержаться в
публикации. Это утверждение демонстрируется на
рис.2b, на котором шестиугольником обозначен
источник информации.</p>
      <p>В данной работе изучаются конкретные
источники информации, всегда связанные с
источником данных (другими словами кардинальность
свойства hasDataSource, доменом которого является
класс источников информации, равна 1).</p>
      <p>На рис.2с показан случай, когда источник
информации содержит высказывания из другой
публикации.
3 Цифровая библиотека научных статей</p>
      <p>Накопление и распространение опубликованных
научных статей в значительной мере ограничено
законодательством разных стран. Это
обстоятельство приводит к тому, что для значительной части
исследователей научные факты недоступны. С
появлением сети Интернет проблема доступа к
опубликованным данным постепенно решается. Это
связано с тем, что для большинства исследователей
интерес представляют фактологические части
публикаций, например, результаты измерений в
естественных науках. Подобные наборы фактов все
чаще накапливаются в базах данных, доступных в
сети Интернет.</p>
      <p>Однако, в большинстве случаев, целью сбора
данных является создание экспертных массивов.
Такой подход характерен для исследователей,
работающих в прикладных, по отношению к
фундаментальным научным дисциплинам, областях.</p>
      <p>Библиотечная деятельность ориентирована на
организацию всей содержащейся в статьях
информации в формах, удобных для исследователя. Как
правило, эта деятельность ограничена поддержкой
систем поиска информации.</p>
      <p>На наш взгляд цифровые научные библиотеки
могут сосредоточиться на автоматической
интеграции цифровой информации, связанной с научными
публикациями. Такая интеграция должна быть тесно
связанной с решением задачи проверки
непротиворечивости интегрируемой информации.</p>
      <p>Решение задачи интеграции требует
переосмысления используемых на практике структур
библиографической записи, а, следовательно, и уточнения
функциональных требований к ним.
3.1 Библиографическое описание – источник
информации</p>
      <p>В начале 90-х в Швеции состоялся семинар по
библиографическим записям. Одним из результатов
семинара была резолюция об определении
функциональных требований к библиографическим записям.
Созданная позже модель такой записи была
попыткой формирования логической основы понимания
правил библиографического описания.</p>
      <p>
        В документе функциональные требования к
записям [
        <xref ref-type="bibr" rid="ref12 ref27">2</xref>
        ] определены с точки зрения следующих
основополагающих задач пользователей при поиске
и использовании библиотечных каталогов:



«использование данных для того, чтобы найти
материалы, которые соответствуют заявленным
поисковым критериям (например, в контексте
поиска всех документов на данную тему или
пластинки, выпущенной под конкретным
заглавием);
использование полученных данных для того,
чтобы идентифицировать объект (например,
для подтверждения соответствия документа,
зарегистрированного в записи, документу,
который искал пользователь, или для обнаружения
различий между двумя текстами или
пластинками с одинаковым заглавием);
использование данных, чтобы выбрать объект,
который отвечает потребностям пользователя
(например, выбрать текст на языке, который
пользователь знает или вариант компьютерной
программы, совместимой с компьютером и
операционной системой, доступной
пользователю);
использование данных для того, чтобы
приобрести или получить доступ к описанному
объекту (например, для размещения заказа на
покупку издания, передачи запроса копию
книги из библиотечной коллекции или чтобы
получить онлайновый доступ к электронному
документу, хранящемуся в удаленном
компьютере)».
      </p>
      <p>Подобные требования можно распространить на
источники информации, введенные выше. Они в
предложенной модели публикации играют роль
библиографической записи, содержа в себе
значительную часть свойств, присущих ей. Однако
источники информации также содержат то, что не
присуще библиографическим записям.</p>
      <p>В первую очередь речь идет о свойствах
ориентированных на описание качества данных,
размещенных в статьях и о корреляциях данных,
извлеченных из разных публикаций.
3.2 Каталоги – таксономии классов онтологии
информационных ресурсов предметной области</p>
      <p>Исследование функционального назначения
библиографической записи предназначалось для
облегчения работы при автоматизации процесса
каталогизации информационных ресурсов.</p>
      <p>С другой стороны, возникший почти на
десятилетие позже подход Semantic Web
ориентирован на более широкий круг задач систематизации
ресурсов в глобальной информационной системе
(Web). Более того, при реализации подхода были
созданы соответствующие средства для
представления ресурсов с разной степенью детализации. Эта
детализация позволяет строить в автоматическом
режиме таксономии классов, а машина вывода
позволяет отслеживать наследственность и
противоречия, возникающие при создании таких
таксономий.</p>
      <p>Выделенные концепты предметной области в
фактологической части статей, включенные в
модель публикации, позволяют строить их
онтологическое описание. Эти описания наряду с
индивидами содержат понятийную часть, представляемую
таксономиями классов.</p>
      <p>В рамках языка онтологий OWL DL можно
строить классы, накладывая ограничения на свойства.
Несложно построить в автоматическом режиме все
классы по ограничениям на объектные свойства, т.к.
число индивидов ограничено.</p>
      <p>На рис. 3 показан пример визуализации части
таксономии классов, характеризующий типы задач
спектроскопии, решения которых описываются
прикладной онтологией, и индивидов, связанных с
этими классами.</p>
      <p>Примером цифровой библиотеки, использующей
модель публикации, описанную выше, является
информационная система W@DIS. Эта система
основана на коллекции публикаций по
количественной спектроскопии. В настоящее время в
коллекцию входит около восьми тысяч публикаций.
Большая часть этих публикаций не может быть
выложена в свободный доступ.</p>
      <p>Для решения ряда задач предметных областей,
связанных со спектроскопией, пользователям
необходима только часть фактов, содержащихся в
публикациях этой коллекции. Эти факты относятся к
решениям шести задач спектроскопии, связанных с
нахождением параметров состояний и переходов
молекул. Отметим, что коллекция предназначена
для исследователей, занимающихся атмосферной
спектроскопией.</p>
      <p>Оцифрованные факты из публикаций
импортированы в информационную систему и представляют
собой разные типы источников данных. При
импорте данных [20] в систему для каждого
источника данных автоматически создается
источник информации [14], содержащий описание
свойств импортированных решений задач
спектроскопии.</p>
      <p>Поскольку каждая конкретная публикация
представляется в виде набора источников данных и
частей источников информации, относящихся к
каждому из источников данных, то каталогизацию
публикаций можно заменить более
детализированной каталогизацией источников информации.
Рис.3 Представление таксономии классов и относящихся к ним источников информации
4.1 Визуализация индивидов онтологии</p>
      <p>Источники информации в ИС представлены с
помощью языка онтологий OWL DL. Их можно
разделить на две группы. К группе независимых
источников отнести те индивиды, которые
характеризуют свойства отдельного источника
данных, а к другой группе, отнести индивиды,
описывающие свойства пары источников данных.</p>
      <p>Для работы исследователя с этими индивидами
необходимы инструментальные средства
визуализации индивидов обеих групп. Ниже подобная
визуализация обсуждается на примерах.</p>
      <p>Визуализация отдельного источника
информации (здесь рассмотрена только визуализация
свойств решений задач) позволяет оценить уровень
детализации и информационные аспекты анализа
данных, характеризуемых этими свойствами.
Прежде всего это относится к грубым ошибкам,
относящимся к несоблюдению правил отбора.</p>
      <p>Визуализация индивида, описывающего свойства
пары источников информации, предоставляет более
детальную информацию о качестве анализируемых
данных. Она позволяет определять рассогласование
между данными, полученными разными группами
исследователей по ряду критериев (максимально
допустимая разница значений физических величин,
среднеквадратическое отклонение, нарушение
порядка следования сравниваемых значений). В
количественной спектроскопии необходимость
визуализации отношений между источниками
информации обусловлена огромным количеством
значений свойств, используемых при анализе
сравниваемых данных.</p>
      <p>4.2. Независимые источники информации</p>
      <p>Демонстрируемые ниже примеры требуют
детального описания онтологии, которое приведено
в работе [14]. Опуская детали, сосредоточимся на
представлении структуры индивида,
характеризующего индивидуальные свойства описываемого
источника данных и представляющего источник
информации. Заметим, что число узлов и листьев
остается неизменным при представлении такого
индивида в виде дерева.</p>
      <p>Проиллюстрируем это на примере. На рис. 4
прямоугольники обозначают индивиды, а стрелки –
свойства. Внутри каждого прямоугольника
выписаны свойства и значения свойств, относящихся к
данному индивиду. Заметим, что индивид А0
является элементом класса T6-IS, А1 – элементом
класса OutputData_MD, А2 – элементом класса
TransitionsQuantumNumbers_MD, А3 – элементом
класса EinsteinCoefficient_MD, А4 - элементом
класса Wavenumbers_MD, В1 В2 – элементами
класса BandQuantumNumbersList.</p>
      <p>Семиугольником выделено свойство (число
переходов в источнике информации, отклоненных
экспертами), значение которого может меняться со
временем. Треугольники описывают свойства,
характерные только для исследуемой молекулы,
применяемой к ней нотации и процесса, в котором
участвует молекула.</p>
      <p>
        Индивид, представленный на рис.4, является
библиографической записью, относящейся к
решению задачи о параметрах спектральных линий,
извлеченному из статьи [
        <xref ref-type="bibr" rid="ref8">21</xref>
        ].
Рис.4 Представление индивида, характеризующего свойства решения обратной задачи по определению параметров
контура спектральной линии
4.3 Источники информации, относящиеся к
парам источников данных
      </p>
      <p>Представление источника информации,
характеризующего свойства всех пар, включающих
выбранный источник данных со всеми другими
источниками данных, значительно сложнее. Визуализация
такого источника информации для исследователя
необходима по ряду причин. Во-первых, в
спектроскопии принято сравнивать результаты
экспериментов, выполненных разными группами. Во-вторых,
таких парных отношений может быть нескольких
типов. В-третьих, число источников данных в ИС
изменяется во времени (появляются новые работы
по измерению параметров состояний и переходов).
В четвертых, увеличивается точность измерений,
следовательно, необходим пересмотр
количественных значений критериев, определяющих
достоверность фактов. В-пятых, число фактов при сравнении
источников данных может составлять десятки
тысяч, что заставляет представлять их в
графическом виде. Пр едставление этой
информации в текстовом виде громоздко и
позволяет увидеть только локальную картину.</p>
      <p>С другой стороны, методы визуализации
информации являются общепризнанным
инструментом представления глобального взгляда на
абстрактные данные большого объема.</p>
      <p>Для того чтобы представить реальную картину,
дающую представление обо всех публикациях,
принадлежащих данному набору и о связях между
этими публикациями, необходимо построить и
визуализировать графовую модель имеющихся
данных.</p>
      <p>
        С этой целью генерировались графы, вершинами
которых являются отдельные публикации, а
ребрами свойства парных отношений, а затем
осуществлялась визуализация этих графов. Прежде
всего, следует отметить, что хотя, количество
вершин в этих графах не очень велико, эти графы
имеют весьма высокую плотность. Плотность графа
определяется как отношение количества ребер в
данном графе, к количеству ребер полного графа с
тем же множеством вершин. Известно, что основной
проблемой при визуализации таких графов является
большое количество пересечений ребер, которое
слабо зависит от выбранного алгоритма
визуализации. То есть независимо от алгоритма
визуализации, количество пересечений ребер, а значит, и
визуальная загруженность изображения велики.
Известны подходы, когда для визуализации таких
графов используются алгоритмы типа LinLog [
        <xref ref-type="bibr" rid="ref14">22</xref>
        ],
при котором сильно связанные вершины
располагаются близко друг к другу, а слабо связанные
вершины – далеко. Ребра графа при этом подходе
вообще не изображаются, чтобы не загромождать
изображение. В нашем случае такое решение
абсолютно непригодно, потому что основная
информация, которая интересует пользователя – это именно
ребра. Пользователь заинтересован увидеть с
первого взгляда, какое ребро (то есть,
характеристика парного отношения) представляет собой
достоверную информацию, то есть значения,
соответствующие этой паре для
колебательновращательных полос, а также увидеть, насколько
эти значения совпадают (или не совпадают). По
этой же причине для визуализации данных этого
типа не подходит и метод создания жгутов ребер
[23]. Поэтому основное внимание при выборе
способа визуализации уделялось именно
информации, связанной с количеством «хороших» или
«плохих» колебательно-вращательных полос.
      </p>
      <p>Как уже было сказано, в качестве вершин графа
рассматриваются отдельные публикации. На
изображении каждая публикация идентифицируется
номером в базе данных, годом публикации и
первыми буквами фамилий авторов. Цвет вершины
соответствует типу задачи, решение которой
описано в данной публикации, а радиус вершины –
ее степени, то есть количеству ребер, связывающих
эту публикацию с другими публикациями.
Поскольку разброс в степенях вершин может быть весьма
велик, для вычисления радиуса вершины
используется логарифмическая зависимость от ее степени.</p>
      <p>Помимо элемента ds:RMSPair, пару публикаций
может описывать один элемент ds:BandRMSPair,
имеющий те же самые идентификаторы для
публикаций и сообщающий, сколько общих
«колебательно-вращательных полос» ==
ds:RMSVibrationalBand имеется в указанных двух
публикациях.</p>
      <p>Каждая общая колебательная полоса
описывается элементом ds:RMSVibrationalBand, в
котором кроме авторов информации о парных
публикациях есть идентификатор полосы,
состоящий из шести чисел (например _1_0_0_0_0_0_ ),
квантовые числа.</p>
      <p>В описании каждой общей полосы</p>
      <p>ds:RMSVibrationalBand
важны два свойства:</p>
      <p>ds:hasMaxDifferenceValueOfBand
(максимальная разность значений) и</p>
      <p>ds:hasRMSDeviationValueOfBand
(значение отклонения полосы)</p>
      <p>Если hasMaxDifferenceValueOfBand &gt; 0.05, или
ds:hasRMSDeviationValueOfBand &gt; 0.1, это может
указывать на ошибку в данных.</p>
      <p>При этом, оценка максимальной разницы
значений hasMaxDifferenceValueOfBand является
более грубой, оценка максимального отклонения
более тонкой. Поэтому строится как минимум два
разных изображения графа, одно изображение
соответствует «плохим» максимальным разностям, а
второе – «плохим» отклонениям.</p>
      <p>Так же как в случае с радиусами вершин,
разброс между количеством
колебательно-вращательных полос, общих для двух публикаций, тоже
весьма велик и может меняться в диапазоне от
одной полосы до миллиона. Понятно, что ширина
ребра должна каким-то образом зависеть от этого
количества полос, но пропорциональная
зависимость при таком большом разбросе не совсем
уместна, изображение и так загромождено большим
количеством ребер. Поэтому все множество ребер
сортируется по количеству
колебательно-вращательных полос и вводится шкала, состоящая из пяти
градаций, и каждое ребро попадает в один из
классов. Ребру при визуализации приписывается
ширина, соответствующая его классу. Таким
образом, ширина ребра соответствует количеству общих
колебательно-вращательных полос для одной
RMSPair.</p>
      <p>Помимо общего количества
колебательновращательных полос, изображение должно
показывать, сколько полос от общего количества
имеют либо «плохую» разность, либо «плохое»
отклонение. Для демонстрации этого свойства
используется градиентная раскраска каждого ребра.</p>
      <p>Если «плохих» ребер нет вообще, то ребро
разбивается на три части. В центре прозрачная
часть, по краям – серая. Прозрачная часть
используется для уменьшения визуальной загруженности
изображения.</p>
      <p>Если есть «плохие» ребра, каждое такое ребро
разбивается на 5 частей, центральная часть –
прозрачная, две крайние, самые ближние к
инцидентным вершинам части, соответствуют «плохим»
полосам. Ближе к центру расположены две
симметричные серые части, соответствующие
«хорошим» полосам. Длина красной части
пропорцииональна количеству «плохих» полос.</p>
      <p>Что касается собственно алгоритма
визуализации, нами была сделана модификация алгоритма
Фрюхтермана-Рейнгольда. Дело в том, что силовые
алгоритмы такие как алгоритм
ФрюхтерманРейнгольда [24] или Камада–Кавая [25] не
применим к размещению вершин высокой степени в
центре изображения. Для графов, соответствующих
данной проблеме, такое решение непригодно,
поскольку центральная часть и так загружена
большим количеством ребер. Поэтому наша
модификация алгоритма «выталкивает» вершины
высокой степени на периферию изображения,
позволяя проследить ребра, инцидентные этим
вершинам.
Рис.5 Графическое представление парных отношений (среднеквадратическое отклонение между отдельными
колебательными полосами) между источниками информации на примере первичных источников данных, содержащих
решение обратной задачи T6 [26] для молекулы воды</p>
      <p>Остановимся на интерпретации графа
изображенного на рис.5. Узлами графа являются
источники информации. Цвет ребер соответствует одному
из двух вариантов: красный цвет соответствует
неудовлетворительному значению отклонения, а
серый цвет – удовлетворительному значению. У
сравниваемых источников информации могут
содержаться несколько отдельных идентичных
колебательных полос. В таком случае ширина линии,
изображающей ребро, становится по величине
пропорциональной числу идентичных
колебательных полос, а ребро раскрашивается в
соответствующие цвета пропорционально числу
удовлетворительных или неудовлетворительных значений.</p>
      <p>Как следует из цветовой гаммы графа,
представленного на рис.5 в публикациях
включенных в ИВС существует значительное число
переходов молекулы воды среднеквадратические значения
которых являются неудовлетворительными.
4 Заключение</p>
      <p>В работе рассмотрен пример построения
цифровой научной библиотеки публикаций. Основное
внимание было уделено описанию модели
публикации в такой библиотеке. Предложено создавать
модели публикаций, содержащих количественную
информацию, состоящими из двух частей:
результатов решений задач и свойств этих решений.
Представление свойств решений в форме индивидов
прикладной онтологии позволяет автоматически
строить детализированные таксономии классов,
главным образом по ограничениям на свойства
онтологии. Существенным является то, что при
построении таксономий пустые классы в них не
включаются.</p>
      <p>Согласование фактологических частей
публикаций осуществляется по выбранному набору свойств
решений задач предметной области. В
количественной спектроскопии такие свойства связаны
характеристиками качества данных: удовлетворение
правилам отбора, согласование значений данных в
пределах ошибок измерений, согласование порядка
следования значений идентифицированных
физических величин. Рассмотрены примеры
визуализации всех индивидов характеризующих парные
отношения между источниками информации.</p>
      <p>Наряду с автоматической обработкой данных
важным является принятие исследователем решения
о качестве данных исходя их просмотра
визуализации свойств, характеризующих свойства
данных.</p>
      <p>Заметим, что в рамках проекта РФФИ частью
авторов создаются цифровые библиотеки
публикаций по атмосферной химии и радиации [26].
Поскольку эти предметные области содержат
значительное число опубликованных данных
создаваемые библиотеки создаются с помощью
описанной модели публикации, но для решений задач
соответствующих предметных областей.
Литература
[1] MARC 21 Format for Bibliographic Data.</p>
      <p>
        http://www.loc.gov/marc/bibliographic
[
        <xref ref-type="bibr" rid="ref12 ref27">2</xref>
        ] Функциональные требования к
библиографиическим записям : окончат. отчет / Рос. библ.
ассоц., Рос. гос. б-ка ; пер. с англ. [В. В.
Арефьев] ; науч. ред. пер.: Т. А. Бахтурина, Н.
      </p>
      <p>Digital scientific library of quantitative</p>
      <p>spectroscopy publications
A method of developing a digital library of scientific
articles for the domain in which the factological part is
significantly bigger than the notional one is being
discussed in the report. Using the example of a
library of articles on quantitative spectroscopy we
demonstrate how the use of a publication (article) model
containing domain problems solutions and their
properties leads to automated cataloguing of solutions.</p>
      <p>Visualization of ontology individuals characterizing the
pairs of information sources was of significant
importance in this work. Visualization allows one to get
a qualitative estimation of consistency of spectroscopy
problems' solutions in the case of analyzing huge
amount of data.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <year>2006</year>
          . - [150]
          <fpage>с</fpage>
          . [3]
          <string-name>
            <given-names>Functional</given-names>
            <surname>Requirements</surname>
          </string-name>
          for Bibliographic
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          19,
          <string-name>
            <surname>Final</surname>
            <given-names>Report</given-names>
          </string-name>
          ,
          <year>1998</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          www.ifla.org/files/cataloguing/frbr/frbr.pdf [4]
          <string-name>
            <surname>Лукашевич</surname>
            <given-names>Н.В.</given-names>
          </string-name>
          , Тезаурусы в задачах
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <year>2011</year>
          ,
          <year>512С</year>
          . [5]
          <string-name>
            <surname>Oberle</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          <article-title>Semantic management of middleware,</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          Berlin: Springer,
          <year>2006</year>
          . 268 pp. [
          <volume>6</volume>
          ]
          <string-name>
            <surname>Privezentsev</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fazliev</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Tsarkov</surname>
            <given-names>D.</given-names>
          </string-name>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Spectroscopy</surname>
          </string-name>
          ,
          <source>Proc. of the 7th International</source>
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <source>(OWLED</source>
          <year>2010</year>
          ), San Francisco, California, USA,
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>June</surname>
          </string-name>
          21-22,
          <year>2010</year>
          . Edited by Evren
          <string-name>
            <surname>Sirin</surname>
          </string-name>
          , Kendall
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Clark</surname>
          </string-name>
          ,
          <string-name>
            <surname>CEUR-WS Proc</surname>
          </string-name>
          . Vol-
          <volume>614</volume>
          , [Электронный
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>ресурс</surname>
          </string-name>
          ] - http://ceur-ws.
          <source>org/</source>
          Vol-
          <volume>614</volume>
          /
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <article-title>owled2010_submission_6</article-title>
          .pdf [7]
          <string-name>
            <surname>Lavrentiev</surname>
            <given-names>N.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Privesentsev</surname>
            <given-names>A.I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fazliev</surname>
            <given-names>A.Z.</given-names>
          </string-name>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <article-title>data on CO2 Molecule, Abstracts of the 22-nd</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Spectroscopy</surname>
          </string-name>
          ,
          <year>2011</year>
          , p.
          <fpage>353</fpage>
          . [8]
          <string-name>
            <surname>Voronina</surname>
            <given-names>S.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yurchenko</surname>
            <given-names>S.N.</given-names>
          </string-name>
          , Fazliev
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <source>of the 22-nd Colloquium on High Resolution</source>
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <given-names>Molecular</given-names>
            <surname>Spectroscopy</surname>
          </string-name>
          ,
          <year>2011</year>
          , p.
          <fpage>163</fpage>
          . [9]
          <string-name>
            <surname>Козодоев</surname>
            <given-names>А.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Вельмужова</surname>
            <given-names>И</given-names>
          </string-name>
          .А., Сенников
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <article-title>уровни энергии молекулы H2S, Оптика атм</article-title>
          . и
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <year>2011</year>
          /part2 [12]
          <string-name>
            <surname>Козодоев</surname>
            <given-names>А.В.</given-names>
          </string-name>
          ,
          <source>Привезенцев А.И. Фазлиев А.З.</source>
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <source>ournal/</source>
          <year>2006</year>
          / part3/KPF [13]
          <string-name>
            <surname>Быков</surname>
            <given-names>А.Д.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Науменко</surname>
            <given-names>О</given-names>
          </string-name>
          .Б.,
          <string-name>
            <surname>Синица</surname>
            <given-names>Л</given-names>
          </string-name>
          .Н.,
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Томск</surname>
          </string-name>
          , Из-во
          <source>ИОА СО РАН</source>
          ,
          <year>2008</year>
          ,
          <volume>360</volume>
          c. [14]
          <string-name>
            <surname>Привезенцев</surname>
            <given-names>А.И.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Царьков</surname>
            <given-names>Д</given-names>
          </string-name>
          .В.,
          <string-name>
            <surname>Фазлиев</surname>
            <given-names>А</given-names>
          </string-name>
          .З.,
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <year>2012</year>
          /part2 [15]
          <string-name>
            <surname>Dubernet</surname>
            <given-names>M.L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Boudon</surname>
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Culhane L</surname>
          </string-name>
          . et al., Vir-
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          <string-name>
            <given-names>Spectrosc.</given-names>
            &amp;
            <surname>Rad</surname>
          </string-name>
          . Transfer.
          <year>2010</year>
          . v.
          <volume>111</volume>
          , No 15.
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          p.
          <fpage>2151</fpage>
          -
          <lpage>2159</lpage>
          . [16]
          <string-name>
            <surname>Jacquinet-Husson</surname>
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Scott</surname>
            <given-names>N.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Chedin</surname>
            <given-names>A.</given-names>
          </string-name>
          et al.,
        </mixed-citation>
      </ref>
      <ref id="ref23">
        <mixed-citation>
          2008. v.
          <volume>109</volume>
          . No 6. p.
          <fpage>1043</fpage>
          -
          <lpage>1059</lpage>
          . [17]
          <string-name>
            <surname>Tashkun</surname>
            <given-names>S.A.</given-names>
          </string-name>
          and
          <string-name>
            <surname>Perevalov</surname>
            <given-names>V.I. CDSD</given-names>
          </string-name>
          -
          <volume>4000</volume>
          :
        </mixed-citation>
      </ref>
      <ref id="ref24">
        <mixed-citation>
          <string-name>
            <surname>High-Temperature Spectroscopic</surname>
            <given-names>CO2</given-names>
          </string-name>
          ,
          <article-title>The 11th</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref25">
        <mixed-citation>
          <string-name>
            <surname>HITRAN Database Conference</surname>
          </string-name>
          , June 16 - June
        </mixed-citation>
      </ref>
      <ref id="ref26">
        <mixed-citation>
          18,
          <year>2010</year>
          , Cambridge,
          <year>2010</year>
          , p.
          <fpage>10</fpage>
          . [18]
          <string-name>
            <surname>Toth</surname>
            <given-names>R.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Brown</surname>
            <given-names>L.R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Miller</surname>
            <given-names>C.E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Devi</surname>
            <given-names>V.</given-names>
          </string-name>
        </mixed-citation>
      </ref>
      <ref id="ref27">
        <mixed-citation>
          <article-title>base of CO2 line parameters: 4300-7000 cm-1</article-title>
          ,
          <string-name>
            <surname>J.</surname>
          </string-name>
        </mixed-citation>
      </ref>
      <ref id="ref28">
        <mixed-citation>
          <string-name>
            <given-names>Quant. Spectrosc.</given-names>
            &amp;
            <surname>Rad</surname>
          </string-name>
          . Transfer.
          <year>2008</year>
          , v.
          <volume>109</volume>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref29">
        <mixed-citation>
          <issue>No 6</issue>
          , p.
          <fpage>906</fpage>
          -
          <lpage>921</lpage>
          . [19]
          <string-name>
            <surname>Rothman</surname>
            <given-names>L.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gordon</surname>
            <given-names>I.E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Barbe</surname>
            <given-names>A.</given-names>
          </string-name>
          et al. The
        </mixed-citation>
      </ref>
      <ref id="ref30">
        <mixed-citation>
          <article-title>HITRAN 2008 molecular spectroscopic database,</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref31">
        <mixed-citation>
          <string-name>
            <given-names>J. Quant. Spectrosc.</given-names>
            &amp;
            <surname>Rad</surname>
          </string-name>
          .Transfer.
          <year>2009</year>
          . v.
          <volume>110</volume>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref32">
        <mixed-citation>
          <article-title>No 9</article-title>
          . p.
          <fpage>533</fpage>
          -
          <lpage>572</lpage>
          . [20]
          <string-name>
            <surname>Ахлёстин</surname>
            <given-names>А.Ю.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Козодоев</surname>
            <given-names>А</given-names>
          </string-name>
          .В., Лаврентьев
        </mixed-citation>
      </ref>
      <ref id="ref33">
        <mixed-citation>
          <year>2012</year>
          /part3/AKLPF [21]
          <string-name>
            <given-names>R.A.</given-names>
            <surname>Toth</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C.E.</given-names>
            <surname>Miller</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.R.</given-names>
            <surname>Brown</surname>
          </string-name>
          , V. Malathy
        </mixed-citation>
      </ref>
      <ref id="ref34">
        <mixed-citation>
          <article-title>between 2200 and 7000 cm-1</article-title>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Quant</surname>
          </string-name>
          . Spectrosc.
        </mixed-citation>
      </ref>
      <ref id="ref35">
        <mixed-citation>
          <string-name>
            <surname>&amp; Rad.Transfer.</surname>
          </string-name>
          ,
          <year>2007</year>
          , Volume
          <volume>243</volume>
          ,
          <string-name>
            <surname>Issue</surname>
            <given-names>1</given-names>
          </string-name>
          ,
        </mixed-citation>
      </ref>
      <ref id="ref36">
        <mixed-citation>
          <string-name>
            <surname>Pages</surname>
          </string-name>
          43-
          <volume>61</volume>
          [22]
          <string-name>
            <given-names>З.</given-names>
            <surname>В</surname>
          </string-name>
          . Апанович, П.С. Винокуров, Т.А. Кислици-
        </mixed-citation>
      </ref>
      <ref id="ref37">
        <mixed-citation>
          <string-name>
            <surname>технологии.</surname>
          </string-name>
          <year>2011</year>
          <article-title>- том 9, выпуск 3, с</article-title>
          . 5-
          <fpage>14</fpage>
          . [23]
          <string-name>
            <given-names>A.</given-names>
            <surname>Noack</surname>
          </string-name>
          . Energy Models for Graph Cluste-
        </mixed-citation>
      </ref>
      <ref id="ref38">
        <mixed-citation>
          <string-name>
            <surname>Applications</surname>
          </string-name>
          ,
          <volume>11</volume>
          (
          <issue>2</issue>
          ):
          <fpage>453</fpage>
          -
          <lpage>480</lpage>
          ,
          <year>2007</year>
          . [24]
          <string-name>
            <surname>Fruchterman</surname>
            <given-names>T. M. J.</given-names>
          </string-name>
          , Reingold E. M. Graph
        </mixed-citation>
      </ref>
      <ref id="ref39">
        <mixed-citation>
          <source>Practice and Experience</source>
          ,
          <year>1991</year>
          , Vol.
          <volume>21</volume>
          ,
          <issue>N11</issue>
          , P.
        </mixed-citation>
      </ref>
      <ref id="ref40">
        <mixed-citation>
          1129-
          <fpage>1164</fpage>
          . [25]
          <string-name>
            <surname>Kamada</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kawai</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          <article-title>An algorithm for drawing</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref41">
        <mixed-citation>
          <string-name>
            <surname>Letters</surname>
          </string-name>
          ,Vol.
          <volume>31</volume>
          ,
          <year>1989</year>
          , pp.
          <fpage>7</fpage>
          -
          <lpage>15</lpage>
          . [26]
          <string-name>
            <given-names>К.</given-names>
            <surname>М</surname>
          </string-name>
          . Фирсов, В.А. Фролькис, Ю. В. Воронина,
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>