<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Извлечение низкочастотных терминов из специализированных текстов</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>@yandex.ru</string-name>
        </contrib>
      </contrib-group>
      <fpage>142</fpage>
      <lpage>147</lpage>
      <abstract>
        <p>Аннотация Исследована возможность повышения качества выделения терминов предметной области в узкоспециализированных научных текстах. Для этого вначале с помощью семантико-синтаксического анализа и построения дерева зависимостей выделялись тематически значимые фрагменты текста. Затем производились кластеризация фрагментов и поиск терминов с использованием семантического классификатора. Показано, что данный метод позволяет с высокой вероятностью обнаруживать термины даже с единичной встречаемостью.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Во многих дисциплинах сейчас разрабатываются
стандартные онтологии предметных областей,
которые предназначены для совместного
использования экспертами и автоматическими
системами обработки информации. Процесс
создания онтологии характеризуется высокой
трудоемкостью, поскольку необходимо адекватно и
максимально полно описать каждый концепт
(термин), входящий в нее, с указанием всех
возможных связей с другими концептами. В нашем
исследовании анализируется начальный этап
построения онтологии предметной области –
автоматическое формирование списка терминов. В
качестве исходного материала были взяты статьи
Большого экономического словаря [7].
Представлены результаты кластеризации корпуса
определений экономических понятий с
последующим выделением терминов для каждого
кластера. Объем корпуса был ограничен размерами,
позволяющими вести ручную экспертную обработку
для контроля качества работы автомата.
Труды XVIII Международной конференции
DAMDID/RCDL’2016 «Аналитика и управление
данными в областях с интенсивным
использованием данных», Ершово, 11-14 октября
2016
2 Смежные исследования</p>
      <p>
        Отбор терминов для помещения в онтологию
обычно осуществляется с помощью
лингвистического и статистического анализа [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]. В
работе [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ] использован гибридный метод: сначала
отбираются все существительные, из которых потом
по результатам статистического анализа с
использованием информации о семантике слов
формируется список возможных терминов.
      </p>
      <p>
        Для повышения точности отбора в [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] применялся
кластерный анализ англоязычного текста,
использующий адаптивный алгоритм Леска «с
помощью нахождения пересечений смыслов слов в
WordNet». Результаты применения метода
сравнивались с результатами, полученными при
использовании частотного словаря, частотного
семантического словаря и позиционного метода.
Стоит отметить, что в [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] изначально показатели
полноты и точности в определении ключевых слов по
частотному словарю были довольно высокими.
Схожая методика используется и в нашей работе.
Однако целью работы [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] было извлечения ключевых
слов, характеризующих каждый текст из корпуса, а
цель нашего исследования – извлечение терминов,
характеризующих конкретную область знаний.
      </p>
      <p>
        В [
        <xref ref-type="bibr" rid="ref9">11</xref>
        ] рассматривалась задача онтологического
анализа терминологических словарей методом
семантического анализа дефиниций и построения
OWL-описаний выделенных объектов. Однако
выявление концептов для описания в основном
базировалось на ручной обработке.
3 Специфика текста и предварительная
обработка
      </p>
      <p>Для анализа мы выбрали фрагмент Большого
экономического словаря [7], состоящий из 1020
словарных статей, относящихся к банковской
деятельности.</p>
      <p>Для контроля качества работы системы
предварительно вручную было выделено 462
однословных термина. Мы сосредоточились именно
на однословных терминах, потому, что их
автоматическое выделение представляет
наибольшие трудности. Двухсловные термины в
данных текстах имеют четко выраженную структуру:
прилагательное + существительное, расположенные
контактно, и могут быть найдены стандартными
частотными методами.</p>
      <p>Выбранный тип текста (словарь) имеет свои
особенности. С одной стороны, все словарные статьи
построены по одному шаблону: заголовок статьи и
дефиниция, состоящая, как правило, из гиперонима и
дополнительной информации. При этом термины
предметной области могут встречаться в обеих
частях словарной статьи. Как оказалось, в
заголовочные части входит только 59% терминов.
Такая структурированность облегчает обработку
текста.</p>
      <p>
        С другой стороны, как отмечалось в [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ], для
текстов научной направленности типична ситуация,
при которой одни термины предметной области
встречаются очень часто (БАНК – 826 вхождений,
3% от всех неслужебных слов корпуса), а другие –
имеют только единичные вхождения (РЕТРАТТА,
ХЕДЖЕР и др.). При стандартных методах отбора
лексем (типа TF-IDF, LDA) для дальнейшей
обработки, отбрасываются как те, так и другие. В то
же время среди слов со средней частотностью
большую часть составляют слова общей лексики.
Например, термин ПОКУПАТЕЛЬ с абсолютной
частотой вхождений 45 в анализируемом корпусе
имеет по частоте встречаемости существительных
56-й ранг из 98. В первом столбце табл. 1,
построенному по частотному словарю, приведены 19
существительных из окрестности слова
ПОКУПАТЕЛЬ в интервале с 50 ранга (частота 51)
по 62 ранг (частота 39). Оказывается, что к
экономическим терминам (выделены жирным
шрифтом) относятся только 42% лемм.
Таблица 1 Сравнение разных методов создания
частотных списков
      </p>
      <p>Частотный
Методы словарь
ы
м
м
е
Л
условия
покупка
депозит
прибыль
средства
требование</p>
      <p>TF-IDF
институт
соглашение
условия
актив
владелец
прибыль
Предлагаемый
метод
заемщик
кредитор
аккредитив
цена
средства
оплата
вкладчик
сделка
затрата
использование уровень
производство обращение
вложение</p>
      <p>орган
ПОКУПАТЕЛЬ ПОКУПАТЕЛЬ ПОКУПАТЕЛЬ
Расход
соглашение
договор
вкладчик
часть
владелец
обращение
риск
время
тПерромциеннотв 42%
договор
залог
требование
часть
долг
чек
время
47%
осуществление фонд
погашение
организация
компания
облигация
залог
валюта
чек
документ
рынок
89%
Аналогичные результаты получаются при
анализе распределения терминов по TF-IDF (табл. 1,
второй столбец). Здесь термин ПОКУПАТЕЛЬ имеет
38-й ранг из 80. В таком же диапазоне из 19
существительных (относящихся к 36–43 рангам)
терминами являются 47% лемм.</p>
      <p>
        Дополнительные проблемы создает
использование модели bag-of-words, явно
противоречащей структурности словарной статьи.
При проведении данного исследования вместо
bagof-words использовался фрагмент дерева
подчинения, построенного с помощью
семантикосинтаксического парсера SemSin [
        <xref ref-type="bibr" rid="ref7">8</xref>
        ]. Этот фрагмент
(«краткое определение») включал в себя
заголовочный термин и его гиперонимы с
препозитивными определениями и зависимыми
существительными в родительном падеже (рис. 1).
      </p>
      <p>В качестве примера рассмотрим следующую
словарную статью (слова, включенные в краткое
определение, выделены жирным шрифтом):
ОБМЕННЫЙ КУРС – курс, по которому одна
валюта обменивается на другую, цена денежной
единицы страны, выраженная в иностранной
валюте &lt;…&gt;.
Рисунок 1 Построение краткого определения по
фрагменту дерева подчинения</p>
      <p>В правую часть кратких определений входит 16%
выделенных вручную терминов, остальные – в
полные определения. Такой подход позволил
исключить из анализа большое количество слов
общей лексики и выявить
конструкции, состоящие из
расположенных слов
«нелокальные»
неконтактно
4. Кластеризация словарных статей
Выделение терминов происходило в три этапа:
Формирование списка терминов из слов,
принадлежащих выделенным классам.</p>
      <p>
        Для сравнения дефиниций была построена
векторная модель текста. Каждому i-му абзацу,
соответствующему одной словарной статье, был
приписан нормализованный вектор {wn,i}, где wn ,i –
частота токена n в i-ом абзаце. В качестве токена
выступала либо лемма-существительное (сравнение
«по леммам»), либо ее семантический класс
(сравнение «по классам»), выявленный в ходе
синтаксического анализа, выполняемого парсером
SemSin. В последнем случае предполагалось, что
слова, принадлежащие одному классу,
эквивалентны: например, леммы банкнота и валюта
относятся к одному классу «Купюры». Классы
определялись в соответствии с семантическим
классификатором, аналогичным описанному в [
        <xref ref-type="bibr" rid="ref10">13</xref>
        ].
В нем 192 тыс. лексем распределены по 1688
классам.
      </p>
      <p>
        Существует много разных способов
кластеризации данных. Выбор наиболее
подходящего способа обусловлен особенностями
анализируемых данных и целей исследования. Был
применен стандартный иерархический
агломеративный алгоритм кластеризации Уорда.
Метод Уорда направлен на минимизацию суммы
разностей квадратов расстояний внутри каждого
кластера [
        <xref ref-type="bibr" rid="ref5 ref8">5, 9</xref>
        ].
      </p>
      <p>
        Для кластеризации мы использовали пакет
scikit-learn (Python) [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ]. Данная реализация алгоритма
накладывает ограничения на выбор способа
измерения расстояния между векторами, поэтому
была применена метрика Евклида.
      </p>
      <p>Сначала все объекты являются отдельными
кластерами. На каждой итерации алгоритма к
текущему кластеру s добавляется один объект t так,
что межкластерное расстояние между новым
кластером u  s  t и любым другим кластером
меньше внутрикластерного расстояния.</p>
      <p>
        Во многих отношениях метод Уорда является
наиболее точным среди других иерархических
методов [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]. В отличие от неиерархических методов,
метод Уорда является устойчивым (не зависит от
выбора начального приближения) и выделяет
кластеры произвольной формы. Кроме того, как
указано в [
        <xref ref-type="bibr" rid="ref8">9</xref>
        ], расстояние по Уорду обладает
свойством растяжения. Это означает, что по мере
роста кластера, расстояние от него до остальных
кластеров увеличивается, что приводит к более
чистому результату даже для «низкоконтрастных»
текстов, в которых переход к новому разделу не
означает смены лексикона. К недостаткам
иерархического метода кластеризации относится то,
что один из образуемых кластеров, как правило,
значительно больше всех остальных.
      </p>
      <p>Оптимальным для дальнейшей обработки
оказалось разбиение текста на 35 кластеров,
включающих от 4 до 282 словарных статей (среднее
значение равно 29, медиана — 18).</p>
      <p>Варианты классификации «по классам» и «по
леммам» сравнивались с использованием данных о
внутрикластерных и межкластерных расстояниях
(Табл. 2). Чем больше разница между этими
параметрами, тем точнее проведена кластеризация.
Для используемой метрики расстояние лежит в
интервале 0…1,41.
Таблица 2 Средние значения внутрикластерных и
межкластерных расстояний
среднее среднее
внутрикластерное межкластерное
0.41</p>
      <p>
        Отметим, что результаты кластеризации
подтверждают вывод, сделанный в [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ]: основной
классифицирующей силой в русскоязычных текстах
обладают существительные. Если при кластеризации
по леммам-существительным отношение
межкластерного и внутрикластерного расстояния
равно 2,2 (табл. 2), то в контрольной кластеризации с
учетом также прилагательных и глаголов оно
составило только 1,08.
      </p>
      <p>В целом, вариант отбора лексики «по классам»
показывает более точные результаты. Например,
термин ЦЕССИОНАРИЙ имеет три значения: лицо,
становящееся кредитором (1); правопреемник (2);
страховая компания (3). Во всех вариантах значение
(1) верно определяется как относящееся к кластеру
«Люди». При сравнении «по леммам», значения (2) и
(3) объединяются в кластер, состоящий из 436
словарных статей. При сравнении «по классам» эта
лемма в значении (2) попадает в кластер «Люди», а в
значении (3) в кластер «Финансовые организации».</p>
      <p>Для более точного исследования разницы
результатов отбора лексики «по леммам» и «по
классам», было сформировано два списка: список
терминов-кандидатов «по классам» и список
терминов-кандидатов «по словам» соответственно.
5 Автоматическое выделение терминов
Кластеризация, описанная в разделе 4,
проводилась на основе словаря кратких определений,
что позволило существенно понизить зашумленность
данных. На следующих этапах алгоритма выделения
терминов мы использовали изначальные полные
словарные статьи, поскольку, как было отмечено
ранее, термины могут встречаться в любой части
словарной статьи.</p>
      <p>Сначала было выделено по три наиболее частых
класса для каждого кластера. Стоит отметить, что
полученный список классов, отличается от
частотного списка классов, созданного до
кластеризации из данных обо всем тексте в целом.
Например, при отборе лексики «по классам» после
кластеризации найдено 36 самых распространенных
классов (Финансы, Деньги, Платежи,
Учреждения…). Кроме того, обнаружено 7
существенных классов, которых не было в
изначальном частотном списке классов (Документы,
Торговля и сервис…). К ним относятся, например,
термины РЫНОК, АУКЦИОН.</p>
      <p>Затем, для каждого кластера отбирались
существительные, принадлежащие наиболее
частотным классам данного кластера. Эти
существительные и вошли в итоговый список
терминов-кандидатов.
6 Обсуждение результатов
6.1 Анализ списка терминов-кандидатов «по
классам»</p>
      <p>Из 311 отобранных слов «по классам» к
терминам, выделенным экспертами относилось 249.
Таким образом, точность отбора составила 0,8. В
третьем столбце табл. 1 показана окрестность
термина ПОКУПАТЕЛЬ (19 ранг) в частотном
словаре итогового отбора. Если, как и выше,
рассмотреть группу из 19 слов (с 13 по 24 ранги), то
оказывается, что доля терминов в выборке
увеличилась до 89% (по исходному частотному
словарю – 42%). При этом из 17 терминов 13
«уникальны», т. е. встречаются в корпусе только
один раз, например, ЗАЕМЩИК, ВАЛЮТА, ФОНД,
РЫНОК. В то же время, в остальных столбцах
присутствуют только по три уникальных термина.</p>
      <p>Лексический анализ показал, что итоговый
список терминов-кандидатов включает 95 из 147
терминов с единичной встречаемостью:
ПРЕДОПЛАТА, ЛУИДОР, ФИДУЦИАРИЙ,
КОМПАНИЯ-ХОЛДИНГ…. Из них 40 терминов
встречались только в правой части словарной статьи,
включая 25 терминов, не вошедших в краткие
определения.</p>
      <p>Для оценки качества выделения терминов был
выбран стандартный способ оценки эффективности
выделения информации, основанный на показателях
точности и полноты. В нашем случае точность – доля
правильных терминов среди слов-кандидатов,
найденных автоматически, а полнота показывает,
какую часть из терминов, выделенных экспертами,
удалось обнаружить автоматически.</p>
      <p>На рис. 2 и 3 представлены оценки точности и
полноты соответственно. Предварительно список
терминов-кандидатов был разбит на 10 примерно
равных интервалов так, что термины-кандидаты с
одинаковой частотой были в одном интервале. По
оси абсцисс показана округленная средняя
частотность терминов-кандидатов в данном
интервале.
Точность</p>
      <p>1
0,5
0
1
2
3</p>
      <p>4 6 10 15 30 60 170
Частотность лемм
Рисунок 2 Зависимость точности выделения
терминов от частотности их употребления в тексте
Как видно из рис. 2, точность не зависит от
частоты встречаемости термина-кандидата. Между
тем, чем чаще встречается термин, тем выше
вероятность, что он будет обнаружен автоматически
(рис. 3). Стоит заметить, что представленный метод
извлекает термины, встречающиеся один или два
раза, с вероятностью 40%. Данные из таблицы 3
показывают, что стандартные методы выделяют
такие низкочастотные термины значительно хуже.
Полнота</p>
      <p>1
0,8
0,6
0,4
0,2
0
1
2
3 5 6 10 15 30 60 170
Частотность лемм
Рисунок 3 Зависимость полноты выделения
терминов от частотности их употребления в тексте
В табл. 3 представлены средние оценки точности
и полноты, подсчитанные с помощью 4-х разных
методов:
1. по частотному словарю;
2. по списку слов, составленному по весам
TF</p>
      <p>IDF;
3. по частотному словарю слов, являющихся
заголовками словарных статей;
4. по частотному списку терминов-кандидатов,
созданному по описанному методу «по
леммам» и «по классам».</p>
      <p>Количество слов во всех списках одинаковое (311
по количеству терминов-кандидатов, выделенных
автоматически), слова располагаются в порядке
убывания частоты встречаемости. Например,
частотность в первом списке изменяется от 826 до 10.
Каждый список сравнивался со списком терминов,
выделенных экспертами. По таблице 3 видно, что
результаты предлагаемого метода значительно выше
остальных представленных способов выделения
терминов.
Таблица 3 Точность и полнота, полученные по
разным методам выделения терминов
Точность
Полнота</p>
      <p>F-мера
Частотный
словарь</p>
      <p>Список терминов-кандидатов «по леммам»
включает 349 лемм. Как видно из таблицы 3,
результаты оценки качества выделения терминов
немного выше результатов выделения по заголовкам,
но значительно ниже результатов «по классам».</p>
      <p>Списки терминов-кандидатов «по классам» и «по
леммам» включают 192 общих терминов (42% от
общего количества терминов): ВАЛЮТА, ДОЛЛАР,
ЧЕКОДЕРЖАТЕЛЬ… и 54 слова общей лексики:
БУМАГА, ГАРАНТИЯ, ОРГАНИЗАЦИЯ,
ОСНОВАТЕЛЬ.… При этом 57 терминов
встречаются только в списке терминов-кандидатов
«по классам»: ФИНАНСЫ, БРОКЕР, ВАРРАНТ,
ДЕБЕТ… В списке терминов-кандидатов «по
леммам» таких слов всего 30.</p>
      <p>Таким образом, сравнение двух способов отбора
первичных данных показало, что предпочтительнее
использовать способ отбора «по классам».
7 Заключение</p>
      <p>В работе представлены результаты
многоэтапного выделения однословных терминов из
словаря предметной области с использованием
классификатора. Показано, что традиционные
методы определения терминов по частотному
словарю или по весам TF-IDF не дают верной
картины распределения терминов в
узкоспециализированном тексте. Кроме того,
несмотря на очевидность решения задачи — выборки
терминов из заголовков статей словаря — оказалось,
что уникальные термины могут встречаться также в
любых частях дефиниций. Качество выделения
терминов-кандидатов оценивалось с помощью
списка терминов, найденных экспертами.</p>
      <p>Метод, примененный в этой работе, увеличивает
вероятность выделения терминов почти в два раза.
Он зависит не от начального частотного
распределения терминов в тексте, а от качества
кластеризации. Благодаря этому, учитываются как
термины с единичным вхождением, так и
высокочастотные термины, равномерно
распределенные по всему тексту. Средняя по
частотности точность выделения терминов составила
0,8, полнота – 0,54, F-мера – 0,65.</p>
      <p>Для проверки общности полученных результатов
была проведена обработка текстов совершенно иной
структуры и из другой предметной области, а
именно, глав двух монографий, посвященных
парусному вооружению судов [10, 12]. Несмотря на
то, что лексика этих книг сильно различается (между
ними полтора века), общие закономерности
сохраняются. Вручную было выделено 244 термина,
имеющих отношение к кораблям. Как и в
экономической сфере имеется термин с очень
высокой частотностью (ПАРУС – 238 вхождений,
4,4% от всех неслужебных слов). Наряду с этим 112
терминов (46%) встречаются только один раз.</p>
      <p>При обработке по описанному выше алгоритму
было найдено 158 лемм-кандидатов, из которых 152
термина. Таким образом, точность выделения
терминов для судовой тематики составила 0,96, а
полнота – 0,62. Этот результат показывает
независимость предлагаемого метода выделения
терминов от выбора конкретной предметной области.
Литература
Extraction of low-frequent terms from
domain-specific texts</p>
      <p>We examined the way to improve the quality of
lowfrequent term recognition in scientific texts. Firstly,
domain-relevant fragments were extracted from the text
with the help of dependency tree. Then the fragments
were clustered and candidate terms were defined using
the semantic classifier. The studies suggest that this
approach allows extracting unique terms as well.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Haggag</surname>
            <given-names>M. H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Abutabl</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Basil</surname>
            <given-names>A</given-names>
          </string-name>
          .
          <article-title>Keyword extraction using Clustering and Semantic Analysis</article-title>
          .
          <source>International Journal of Science and Research</source>
          , Vol.
          <volume>3</volume>
          #
          <issue>11</issue>
          (November
          <year>2014</year>
          ). Pp 1128-
          <fpage>1132</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Lacasta</surname>
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Nogueras-Iso</surname>
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zarazaga-Soria J. Terminological</surname>
          </string-name>
          <article-title>Ontologies: Design, Management and Practical Applications. Semantic Web and Beyond: Computing for Human Experience</article-title>
          . Springer-Verlag,
          <year>2010</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Pazienza</surname>
            <given-names>M. T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pennacchiotti</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zanzotto F.M.</surname>
          </string-name>
          <article-title>Terminology extraction: an analysis of linguistic and statistical approaches</article-title>
          .
          <source>Knowledge Mining</source>
          , Springer Verlag,
          <year>2005</year>
          . Pp 255-
          <fpage>281</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4] SciPy [Электронный ресурс] URL: http://docs.scipy.org/doc/scipy/reference/generated /scipy.cluster.hierarchy.linkage.html#scipy.cluster. hierarhie.
          <source>linkage (дата обращения: 5</source>
          .
          <fpage>05</fpage>
          .
          <year>2016</year>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Srinivasan</surname>
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pepe</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rodrigez</surname>
            <given-names>V.F.</given-names>
          </string-name>
          <article-title>A comparision between ethnographic and clustering-based semi-automatic technics for cultural ontologies</article-title>
          .
          <source>Journal of the American Society for Information Science and Technology</source>
          ,
          <year>2008</year>
          , №
          <volume>5</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Артемова</surname>
            <given-names>Г.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Боярский</surname>
            <given-names>К</given-names>
          </string-name>
          .К.,
          <string-name>
            <surname>Гусарова</surname>
            <given-names>Н</given-names>
          </string-name>
          .Ф.,
          <string-name>
            <surname>Добренко</surname>
            <given-names>Н</given-names>
          </string-name>
          .В.,
          <string-name>
            <surname>Каневский</surname>
            <given-names>Е</given-names>
          </string-name>
          .А.
          <article-title>Категоризация текстов для структурирования массива исторических документов // Труды XVI Всероссийской научной конференции RCDL2014 «Электронные библиотеки: перспективные методы и технологии, электронные коллекции»</article-title>
          .
          <source>Дубна</source>
          ,
          <year>2014</year>
          . С.
          <volume>159</volume>
          -
          <fpage>164</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Боярский</surname>
            <given-names>К.К.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Каневский</surname>
            <given-names>Е</given-names>
          </string-name>
          .А. Семантико- синтаксический парсер SemSin // Научно- технический вестник информационных технологий,
          <source>механики и оптики</source>
          .
          <source>2015. т. 15. № 5. С</source>
          .
          <volume>869</volume>
          -
          <fpage>876</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Воронцов</surname>
            <given-names>К.В.</given-names>
          </string-name>
          <article-title>Лекции по алгоритмам кластеризации и многомерного шкалирования</article-title>
          .
          <year>2007</year>
          . URL: http://www.ccas.ru/voron/download/Clustering.pdf (дата
          <source>обращения: 5</source>
          .
          <fpage>05</fpage>
          .
          <year>2016</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [11]
          <string-name>
            <surname>Лезин</surname>
            <given-names>Г.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Клименко</surname>
            <given-names>Е</given-names>
          </string-name>
          .Н.,
          <string-name>
            <surname>Силина</surname>
            <given-names>Е</given-names>
          </string-name>
          .Ф.
          <article-title>Онтологическая интерпретация дефиниций терминологического словаря // Прикладная лингвистика в науке и образовании. Сборник трудов VII международной конференции</article-title>
          . - СПб.: «Книжный дом»,
          <year>2014</year>
          . С.
          <volume>50</volume>
          -
          <fpage>54</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Тузов</surname>
            <given-names>В.А.</given-names>
          </string-name>
          <article-title>Компьютерная семантика русского языка</article-title>
          . СПб:
          <string-name>
            <surname>Изд-во С</surname>
            .-Петерб. ун-та, 2004
            <given-names>K.</given-names>
          </string-name>
          <string-name>
            <surname>Boyarsky</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          <string-name>
            <surname>Archakova</surname>
          </string-name>
          , E. Kanevsky
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>