<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>О влиянии семантики на точность определения парафраз в русскоязычных текстах</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>© K. Boyarsky</string-name>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>EMI RAS</institution>
          ,
          <addr-line>St Petersburg</addr-line>
          ,
          <country country="RU">Russia</country>
        </aff>
      </contrib-group>
      <fpage>238</fpage>
      <lpage>245</lpage>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>В последнее время значительный интерес
исследователей, работающих в области поиска
информации, привлекает проблема выявление
парафраз.</p>
      <p>
        В англоязычной литературе существует большое
количество работ по идентификации парафраз с
Труды XIX Международной конференции
«Аналитика и управление данными в областях с
интенсивным использованием данных»
(DAMDID/ RCDL’2017), Москва, Россия, 10–13
октября 2017 года
проводилось лексически. Было показано, что такой
метод значительно точнее, чем простое лексическое
сравнение. Близкая техника, основанная на
семантической информации WordNet,
использовалась в [
        <xref ref-type="bibr" rid="ref1 ref6">5</xref>
        ]. Pershina [
        <xref ref-type="bibr" rid="ref14">13</xref>
        ] дополнительно
для идентификации парафраз использовала базу
идиом. Лучшие результаты по идентификации
парафраз в англоязычных текстах дают F-меру около
82%.
      </p>
      <p>
        Для русскоязычных текстов работы по
идентификации парафраз весьма немногочисленны
[
        <xref ref-type="bibr" rid="ref19">18</xref>
        ]. Значительные сложности возникают в связи с
особенностями русского языка, который отличается
свободным порядком слов и богатой морфологией
[
        <xref ref-type="bibr" rid="ref17">16</xref>
        ]. Целью настоящей работы являются
исследование эффективности различных вариантов
анализа парафраз в русскоязычных текстах и
определение оптимальной степени использования
семантической информации.
      </p>
      <p>
        Данная работа проводилась в рамках конкурса по
идентификации русских парафраз, представленных в
корпусе paraphraser.ru [
        <xref ref-type="bibr" rid="ref11">10</xref>
        ]. В рамках этого конкурса
предлагалось два варианта анализа пар новостных
заголовков: разделение на две группы (парафразы и
не парафразы) и на три группы, с выделением
дополнительно группы нечетких парафраз. По
представленным данным оказалось, что первый
вариант анализа обладает существенно большей
точностью. В значительной мере это связано с
субъективностью выделения нечетких парафраз.
Поэтому было выбрано разделение на две группы.
      </p>
      <p>Для определения того, являются ли два
предложения парафразами, т. е. одинаков ли их
смысл для носителей языка, необходимо ввести
числовую меру сходства. В качестве такой меры мы
использовали коэффициент Жаккара  . Если два
предложения A и B содержат соответственно n(A) и
n(B) лексических единиц, то</p>
      <p>( )∩ ( )
 = .</p>
      <p>( )∪ ( )
В соответствии с этим критерием мера сходства
определяется как отношение числа совпадающих
единиц к общему числу различных единиц.</p>
      <p>Следует решить два вопроса: что считать
лексической единицей, подлежащей сравнению, и
каков критерий собственно сравнения. Для
сравнения нами были выбраны четыре варианта.</p>
      <p>Вариант 1. В качестве единицы для сравнения
принимается слово или иная непрерывная
последовательность знаков. Предполагается, что эта
последовательность достаточно длинная, так что
одно- и двухбуквенные слова не учитываются.</p>
      <p>Преимущества. Не требуется каких-либо средств
для разбора текста. Выявление совпадающей группы
знаков с большой вероятностью означает наличие
однокоренных слов, близких по смыслу. Если же
такая группа представляет отдельное слово, то
возможно, что это слово выполняет одну и ту же
функцию в обоих высказываниях.</p>
      <p>Недостатки. Похожие фрагменты с большой
вероятностью включают в себя служебные слова. Их
совпадение часто носит случайный характер и не
отражает смысла фрагмента текста (хотя, например,
совпадение отрицания не может служить для
определения меры близости). Кроме того, поскольку
русский язык относится к синтетическому типу, то
даже очень небольшая перефразировка, совершенно
не меняющая смысл высказывания, приводит к
изменению словоформ. Это существенно снижает
точность анализа.</p>
      <p>Вариант 2. В качестве единицы для сравнения
вместо словоформы принимается нормализованная
форма слова (лемма). Исключаются служебные
слова. Производится настройка парсера на
предметную область путем исключения
омонимичных словоформ, не принадлежащих к
данной предметной области. Например, словоформе
белку соответствуют две леммы: белок и белка. В
тексте по биологии будет выбрана только первая из
них.</p>
      <p>Преимущества. Устраняются сложности,
связанные с богатством словоформ каждой леммы.
Повышается независимость анализа от конкретного
строя предложения (человек, который смеется vs
смеющийся человек).</p>
      <p>Недостатки. Требуется инструмент для
морфологического анализа. Достаточно часто
(примерно в 7% случаев) лемма по словоформе
определяется неоднозначно, т. е. возникает проблема
омонимии. Остаются вопросы, связанные со
служебными словами.</p>
      <p>Вариант 3. При сравнении учитывается
семантика слов.</p>
      <p>Преимущества. Слова сравниваются не столько
по написанию, сколько по смыслу, что, в принципе,
должно повысить точность определения парафраз.</p>
      <p>Недостатки. Сложность и неоднозначность
семантического анализа. Необходимость
использования семантических словарей. Если в
английском языке эту функцию выполняет semantic
web, то для русского языка соответствующие
инструменты слабо развиты, отсутствует принятый в
качестве стандарта де-факто семантический словарь.</p>
      <p>Вариант 4. Сравнение производится с учетом
полного дерева разбора.</p>
      <p>Преимущества. Возможность анализа сходства
неконтактно стоящих групп слов, выделения
смысловых блоков, описывающих термины
предметной области.</p>
      <p>Недостатки. Повышение вероятности ошибок
парсера. Недостаточная проработанность вопроса о
выделении контекстных блоков. Чувствительность
метода к замене одних оборотов другими, например,
причастного оборота придаточным предложением.</p>
      <p>
        Из русскоязычных парсеров, способных
проводить глубинный анализ предложения, наиболее
известны ЭТАП-3 [
        <xref ref-type="bibr" rid="ref13">12</xref>
        ], а также парсеры фирм Яndex
[
        <xref ref-type="bibr" rid="ref3">2</xref>
        ], Abbyy [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ], «Диктум» [
        <xref ref-type="bibr" rid="ref10">9</xref>
        ]. Два первых парсера
работают с помощью системы правил, два других
используют свою собственную технологию. Все
парсеры тем или иным образом используют словари.
      </p>
      <p>
        В данной работе использовался
cемантикосинтаксический парсер SemSin [
        <xref ref-type="bibr" rid="ref23">22</xref>
        ]. Это система,
сочетающая в себе функции лемматизатора,
синтаксического и семантического анализатора.
Парсер включает в свой состав словари,
классификатор, блок морфологического анализа,
предсинтаксический модуль [
        <xref ref-type="bibr" rid="ref22">21</xref>
        ] и набор
продукционных правил [
        <xref ref-type="bibr" rid="ref24 ref25">23,24</xref>
        ].
      </p>
      <p>В процессе анализа предложения одновременно
выполняются снятие грамматической и частеречной
омонимии, сегментация предложения и построение
синтаксического дерева зависимостей.</p>
      <p>
        Полученное дерево содержит максимально
полную информацию о предложении. Эта
информация может в дальнейшем служить основой
для решения самых разных задач: выявления
терминов [
        <xref ref-type="bibr" rid="ref16">15</xref>
        ], классификации текстов [
        <xref ref-type="bibr" rid="ref8">7</xref>
        ] и т. д. В
данной работе обсуждается, какая именно
информация полезна для определения близости
смысла предложений, т. е. для идентификации
парафраз.
2 Анализ текста
      </p>
      <p>
        Основное внимание было уделено анализу
различных способов описания семантики и
включения ее в процедуру идентификации парафраз.
Все примеры и экспертные оценки брались из
корпуса русских парафраз [
        <xref ref-type="bibr" rid="ref20">19</xref>
        ].
2.1 Лемматизация
      </p>
      <p>
        Как было показано в [
        <xref ref-type="bibr" rid="ref15">14</xref>
        ], в русском языке (в
отличие от английского и французского) в задачах
кластеризации текстов наибольшей
дифференцирующей силой обладают
существительные. Однако для идентификации
парафраз выделение только существительных
слишком грубо и не может охватить всех тонкостей
смысла. Поэтому для сравнения оставлялись
существительные, прилагательные, глаголы и
отглагольные формы (причастия, деепричастия) и
числительные. Примеры влияния лемматизации на
величину коэффициента Жаккара приведены в
табл. 1.
Таблица 1 Влияние лемматизации
Предложения Словофор
      </p>
      <p>мы
1 0.067
Лемм
ы
0.455
2
Отметим, что лемматизация увеличивает степень
согласованности предложений как в случае, когда
они являются парафразами (пример 1), так и когда
совпадение слов случайно, а совпадения смысла нет
(пример 2). Таким образом, лемматизация
безусловно повышает точность сравнения лексики
предложений, но недостаточна для сравнения
смысла.
2.2 Семантика. Учет классов</p>
      <p>Для более точного сравнения предложений был
использован семантический классификатор,
содержащий около 1700 классов. Его основой
является классификатор Тузова [27],
ориентированный именно на компьютерный анализ
текстов. Дерево классов построено с таким расчетом,
чтобы семантические классы имели определенные
синтаксические свойства. Например, список
действий, которые может производить живое
существо, отличается от действий неодушевленных
предметов, у разных классов могут быть разные
атрибуты и т. д. Кроме того, формат этого
классификатора удобен для его автоматического
использования.</p>
      <p>Наш классификатор отличается, в частности, от
классификатора Шведовой [26]. Например, слово
жрец в обоих случаях классифицируется
практически одинаково: как определенный тип
профессии человека. В то же время слово желание у
Шведовой находится в ветви дерева духовный мир–
чувства–…, в то время как в нашем классификаторе
психические явления и чувства рассматриваются как
свойства человека. В классификаторе WordNet
положение слова priest в общем соответствует
русским классификаторам, слова desire – ближе к
классификатору Шведовой.</p>
      <p>При разработке классификатора очень трудно,
если вообще возможно, определить, на каком ярусе
дерева нужно поместить то или иное слово, по
какому признаку разделять подклассы, в какой
момент прекращать дальнейшее ветвление.
Например, коса (scythe) в WordNet относится к
классу режущих инструментов, а в нашем
классификаторе и у Шведовой – к классу
сельскохозяйственных орудий. При идентификации
парафраз принималось, что принадлежность разных
слов в первом и втором предложениях одному классу
означает близость их смысла.</p>
      <p>Часто вместо конкретного слова в тексте
появляется его гипероним. Для обнаружения
гиперонимов класс определялся с точностью 1
уровень иерархии. Таким образом обеспечивается
совпадение слов, выделенных полужирным
шрифтом в следующих примерах.</p>
      <p>Лавров подарил Керри помидоры… vs Лавров
подарил Керри овощи…</p>
      <p>Жертвами взрыва … стали не менее трех
человек vs Жертвой взрыва… стал гражданин
Великобритании.</p>
      <p>Исключение составляют имена собственные,
поскольку, например, все названия городов
относятся к одному классу, также к одному классу
относятся все фамилии людей.</p>
      <p>
        Сравнением классов во многих случаях
перекрываются отношения синонимии. Однако
следует иметь в виду, что из-за морфологических
особенностей в русском языке значительно меньше
совпадений словоформ у различных частей речи.
Так? в английском gold это и существительное, и
прилагательное, в русском – существительное
золото, прилагательное золотой. При определении
синонимии в русскоязычном RusNet [
        <xref ref-type="bibr" rid="ref21">20</xref>
        ]
подразумевается совпадение частей речи у
синонимичных слов. Сравнение «по классам» в этом
смысле шире и позволяет делать заключение о
близости смысла даже при существенной
перефразировке:
      </p>
      <p>Турецкий сухогруз подвергся обстрелу… vs
Турецкий сухогруз обстреляли.</p>
      <p>Несомненно, вопрос о том, являются ли два
существительных, относящихся к одному классу,
синонимами, неоднозначен. Например, слова
веревка, бечевка легко могут взаимозаменяться в
тексте, а слова помидор, огурец – нет. Тем не менее,
анализ показывает, что близость классов чаще всего
означает близость смысла.
2.3 Семантика. Синонимия и семантические
гнезда</p>
      <p>В ряде случаев сравнения по классам оказывается
недостаточно. Известна, например, «теннисная
проблема» [25], заключающаяся в том, что слова,
относящиеся к одной предметной области, часто
находятся в совершенно разных ветвях
классификатора, что затрудняет не только
идентификацию парафраз, но и решение задач
классификации и кластеризации текстов. Наш
словарь содержит дополнительную информацию о
семантической близости слов. Будем называть
группу семантически связанных слов семантическим
гнездом. Фактически появление дополнительных
связей означает превращение дерева классов в
семантическую сеть. Имеется несколько ситуаций,
приводящих к образованию семантических гнезд.
• Производные слова</p>
      <p>Все лексемы в словаре делятся на базовые и
производные, причем под производными
подразумеваются не только слова, однокоренные с
базовыми [27]. Базовых лексем несколько меньше
половины (около 83000). Из них примерно 20000
образуют семантические гнезда, к которым
относятся производные слова с близким смыслом.
Так, к гнезду базового слова чувство принадлежит
более 100 производных слов, среди которых есть
существительные (нечувствительность, аналгезия),
прилагательные (чувствительный,
душещипательный), глаголы (чувствовать,
обуревать). В некоторых случаях семантический
класс производного слова совпадает с классом
базового, в других – отличается. Например, базовое
слово сигнал относится к подклассу ветви
семантического дерева информация. Производные от
него слова: сигнальный, сигнализация,
сигнализировать имеют тот же класс, а слово
сигнальщик – человек с определенным родом занятий
– совсем другой. Принадлежность производных слов
к общему гнезду добавляет около 7500 связей в
семантическую сеть (помимо связей класс –
подкласс).
• Географические названия</p>
      <p>Как указывалось выше, имена собственные
сравниваются только по леммам. Но одна и та же
страна может называться по-разному, и это
необходимо учитывать при анализе парафраз. Часто
в качестве названия страны используется
аббревиатура. Поэтому в словарь были внесены
дополнительные сведения о тождественной
синонимии слов и выражений.</p>
      <p>В Британии палата общин одобрила однополые
браки.</p>
      <p>Палата общин Великобритании одобрила
однополые браки.</p>
      <p>США просят РФ немедленно отменить запрет
на ввоз мяса.</p>
      <p>США призвали Россию немедленно снять запрет
на импорт мяса.</p>
      <p>КНДР готовится нанести ракетный удар по
США.</p>
      <p>Северная Корея пригрозила ракетным ударом по
США.</p>
      <p>Неким аналогом отношений класс – подкласс для
географических названий является информация о
принадлежности населенного пункта к региону и
стране. Такая информация была добавлена в словарь,
хотя и в довольно ограниченном размере. Например,
указано, что Дамаск – столица Сирии, а город
СентЛуис находится в штате Миссури страны США:</p>
      <p>Неизвестный открыл огонь в бизнес-школе
штата Миссури.</p>
      <p>В Сент-Луисе преступник открыл огонь в
бизнес-школе.
• Характеристики людей и организаций</p>
      <p>Следующей группой слов, для которых в словарь
были внесены дополнительные связи, приводящие к
образованию семантических гнезд, являются
характеристики людей по национальности и месту
жительства. Необходимо не только знать, что
сибиряк – название человека по месту жительства, но
и что это место – именно Сибирь. Таким образом,
каждое такое слово «прикреплено» к
соответствующей стране, региону или городу:</p>
      <p>Американец выиграл в лотерею за 100 евро
картину П. Пикассо.</p>
      <p>Житель Пенсильвании выиграл в лотерею
картину Пикассо.</p>
      <p>Для некоторых часто встречающихся имен
высокопоставленных деятелей в качестве
составляющих семантического гнезда указаны их
должности и страны:</p>
      <p>Синдзо Абэ в письме президенту РФ
объяснил, почему не приедет на 9 мая.</p>
      <p>В письме Путину японский премьер
объяснил причины отказа приехать в Москву 9
Мая.</p>
      <p>США приостановили
истребителей в Египет.</p>
      <p>поставку
Обама приостановил
истребителей F-16 в Египет.</p>
      <p>поставки
Еще одну группу семантических гнезд
составляют связи по принадлежности определенных
социальных групп к организациям и т. д. Коммунист
– наименование человека не просто по
принадлежности к какой-то общественной
организации, а именно к компартии, а хоккеист
среди всех видов спорта имеет отношение только к
хоккею:</p>
      <p>Депутаты от КПРФ попросили Путина
взять под защиту гималайского медведя.</p>
      <p>Коммунисты попросили Путина защитить
гималайских медведей.</p>
      <p>Сборная России по хоккею проиграла
финнам и во втором матче Евротура.</p>
      <p>Российские хоккеисты проиграли на
Евротуре четыре матча подряд.
• Идиомы</p>
      <p>Отдельную группу семантических гнезд
образуют связи устойчивых выражений и идиом с их
семантическими аналогами:</p>
      <p>В Красноярском крае исчез заместитель
прокурора.</p>
      <p>В Красноярском крае пропал без вести
помощник прокурора района.</p>
      <p>Ушел из жизни Уго Чавес.</p>
      <p>Умер Уго Чавес.
Рассмотрим следующий пример.</p>
      <p>Оппозиция ФРГ угрожает правительству
судом из-за шпионского скандала.</p>
      <p>Немецкая оппозиция пригрозила
правительству иском из-за скандала с BND.
Если сравнивать эти предложения только по
леммам, то имеются три совпадения (оппозиция,
правительство, скандал) с коэффициентом Жаккара
J=0.27. При учете классов получаем совпадение для
глаголов угрожать и пригрозить, становится J=0.40.
Название ФРГ входит в семантическое гнездо слова
Германия, в это же гнездо входит слово немецкий
(производное от базового слова немец, которое, в
свою очередь связано со словом Германия).
Получаем J=0.55. Наконец, лексемы суд и иск тоже
входят в общее гнездо. Окончательно получаем
J=0.75, что вполне отражает смысловую близость
этих предложений. На данный момент число
семантических связей таких типов в словаре около 12
тыс.
2.4 Дерево зависимостей</p>
      <p>Нами была сделана попытка использовать
построенное парсером дерево зависимостей для
уточнения сравнения смысла предложений. Было
выдвинуто предположение, что совпадение субъекта
действия и собственно предиката повышает
вероятность того, что рассматриваемые предложения
являются парафразами. В этом случае при расчете
коэффициента Жаккара совпадение лемм
учитывалось с весовым коэффициентом 1.5.</p>
      <p>Однако на практике оказалось, что у пар
предложений, обладающих указанным свойством,
коэффициент Жаккара обычно и так уже велик.
Поэтому его незначительное увеличение
сравнительно редко переводит эту пару из разряда
«не парафраза» в разряд «парафраза». Но эти редкие
переходы тоже представляют определенный интерес.
В табл. 2 приведены значения коэффициентов
Жаккара при учете совпадений лемм, классов и
семантических гнезд (LCS) и дополнительно
предикатных пар (LCSP).
Таблица 2 Влияние совпадения пары субъект–предикат на величину коэффициента Жаккара
Предложения LCS LCSP Комментарий
1 МИД Чехии: дипломат получил выговор за 0.33 0.50 Верный результат, предложения
высказывание о пожаре в Одессе идентичны по смыслу
Оправдавший сожжение людей в Одессе
чешский дипломат получил выговор
2 Кобзон назвал результат России на 0.27 0.45 Верный результат, предложения
Евровидении очень достойным идентичны по смыслу
Иосиф Кобзон назвал второе место Полины
Гагариной достойным
3 Лужков назвал свою ферму примером для 0.37 0.62
российского правительства</p>
      <p>Лужков назвал российскую экономику
«антинародной»
4
6</p>
      <p>МВД насчитало 200 тыс. участников
празднования Дня Победы в Севастополе</p>
      <p>МВД насчитало 250 тыс. участников акции
«Бессмертный полк» в Москве</p>
      <p>Эксперты из России и Белоруссии
направились с проверкой в Эстонию</p>
      <p>Российские военные эксперты направились с
проверкой в Эстонию
Ошибочный рост коэффициента
совпадения, связанный с
игнорированием прямого
дополнения к переходному
глаголу
Ошибочный рост коэффициента
совпадения, связанный с
игнорированием различия в месте
действия
В стандарте не считаются
парафразами. Несомненно, это
одно и то же событие, очевидно,
ошибка разметки
Таблица показывает, что учет совпадений субъект
– предикат в некоторых случаях облегчает
нахождение парафраз (примеры 1, 2). Однако это
может привести и к ложному повышению степени
сходства предложений (примеры 3, 4). В некоторых
случаях определение того, является ли пара
предложений парафразами, имеет пограничный
характер и может интерпретироваться различными
экспертами по-разному (пример 5). Иногда
возможны просто экспертные ошибки (пример 6). В
общем учет совпадений пары субъект – предикат
привел к незначительному снижению качества
анализа. Однако это изменение лежит в пределах
погрешности. Нам представляется перспективным
направлением развития работы дальнейшее
расширения анализа дерева зависимостей с целью
снижения коэффициента сходства у пар
предложений, отличающихся, например, по месту
действия, и уменьшению числа ложных
срабатываний.
3 Результаты</p>
      <p>Ниже приведены результаты анализа смысловой
близости пар предложений для выявления парафраз,
выполненного по следующим схемам.</p>
      <p>По словам (W). При сравнении учитывались все
слова, включая служебные части речи.</p>
      <p>По леммам (L). Учитывались существительные,
прилагательные, глаголы, числительные.</p>
      <p>По леммам и классам (LC). Дополнительно
учитывалось совпадение классов по семантическому
дереву.</p>
      <p>По леммам, классам и семантическим гнездам
(LCS). Дополнительно учитывалось совпадение
классов по семантической сети.</p>
      <p>Примеры влияния схемы расчета на величину
коэффициента Жаккара приведены в табл. 3.
На этапе обучения системы проводилось
пополнение словаря специфическими терминами, а
также определение оптимального «уровня отсечки»:
с какого значения коэффициента Жаккара считать
пару предложений парафразом. Рассчитывались
стандартные параметры: аккуратность (A), точность
(P), полнота (R) и F-мера (F):
Типичные распределения показаны на рис. 1.</p>
      <p>Зависимости имели качественно сходный
характер и для остальных схем подсчета. Очевидно,
что, снижая уровень отсечки, т. е. относя к
парафразам почти все пары предложений, можно
добиться сколь угодно высокого значения полноты, а
повышая этот уровень, – сколь угодно высокого
значения точности. Оценка качества анализа
проводилась по параметрам аккуратность и F-мера,
для которых оптимальный уровень отсечки оказался
в интервале 0.35…0.40.
4 Заключение</p>
      <p>
        Результаты по качеству идентификации парафраз
приведены в табл. 4. Сравнение проводилось по
разметке Золотого стандарта [
        <xref ref-type="bibr" rid="ref12">11</xref>
        ]. Для каждой из
рассмотренных схем сравнения приведены лучшие
значения аккуратности A и F-меры F.
Рисунок 1 Зависимость параметров точности от
уровня отсечки
      </p>
      <p>LCSP
0.742
0.795
На основании этой таблицы можно сделать
следующие выводы.</p>
      <p>В большинстве случаев заголовки новостей,
относящиеся к одному и тому же событию,
лексически очень сходны, и могут быть определены
как парафразы любым способом.</p>
      <p>Применение методов семантико-синтаксического
сравнения (LC) улучшает результаты по сравнению
не только с простым посимвольным сравнением, но
и со сравнением по леммам.</p>
      <p>Увеличение «глубины» семантического анализа
за счет перехода от дерева классов к семантической
сети (LCS) улучшает качество анализа.</p>
      <p>Дополнительный учет совпадений субъект –
предикат (LCSP) незначительно ухудшает качество
за счет увеличения числа ложных срабатываний.</p>
      <p>
        Заметим, что в статье [
        <xref ref-type="bibr" rid="ref19">18</xref>
        ], табл. V, приводятся 15
пар предложений, особенно трудных для анализа
парафраз. Три метода, рассматриваемые в этой
статье, дают соответственно 6, 6 и 7 ошибок.
Предлагаемый нами метод LCS дает только 2
ошибки.
      </p>
      <p>
        Таким образом, достигнутые показатели качества
лежат на уровне лучших результатов конкурса по
классификации предложений на две группы:
парафразы и не парафразы (у лидеров A=0.7459 и
F=0.8078 [
        <xref ref-type="bibr" rid="ref11">10</xref>
        ]). Наши показатели также вполне
сравнимы с результатами, получаемыми на
англоязычных текстах. При классификации на три
группы наши результаты существенно ниже из-за
сложности выделения группы «сомнительных
парафраз».
      </p>
      <p>Преимуществом обсуждаемого метода является
то, что в процессе работы используется только
словарная информация, так что переобучение
системы при смене предметной области не требуется.
Литература</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <volume>5 5 5 5 5 5 5 5 5 5</volume>
          ,
          <issue>0</issue>
          ,
          <issue>1</issue>
          ,
          <issue>2</issue>
          ,
          <issue>3</issue>
          ,
          <issue>4</issue>
          ,
          <issue>5</issue>
          ,
          <issue>6</issue>
          ,
          <issue>7</issue>
          ,
          <issue>8</issue>
          ,
          <fpage>9</fpage>
          <volume>0 0 0 0 0 0 0 0 0 0 Таблица</volume>
          <year>4</year>
          <article-title>Аккуратность и F-мера при различных схемах сравнения</article-title>
          <string-name>
            <surname>Схема W L LC LCS</surname>
          </string-name>
          <article-title>A 0</article-title>
          .
          <source>692 0.718 0.743 0.744 F 0.762 0.774 0.784 0</source>
          .
          <fpage>800</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Anisimovich</surname>
            ,
            <given-names>K.V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Druzhkin</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          <string-name>
            <surname>Ju</surname>
          </string-name>
          .,
          <string-name>
            <surname>Minlos</surname>
            ,
            <given-names>F.R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Petrova</surname>
            ,
            <given-names>M.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Selegey</surname>
            ,
            <given-names>V.P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zuev</surname>
            ,
            <given-names>K.A.</given-names>
          </string-name>
          :
          <article-title>Syntactic and Semantic Parser Based on ABBYY Compreno Linguistic Technologies</article-title>
          .
          <article-title>Компьютерная лингвистика и интеллектуальные технологии</article-title>
          .
          <source>По материалам ежегодной Межд</source>
          . конф. «
          <article-title>Диалог»</article-title>
          .
          <source>М.: РГГУ</source>
          ,
          <volume>2</volume>
          (
          <issue>11</issue>
          (
          <issue>18</issue>
          )),
          <fpage>сс</fpage>
          .
          <fpage>91</fpage>
          -
          <lpage>103</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Antonova</surname>
            ,
            <given-names>A.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Misyurev</surname>
            ,
            <given-names>A.V.</given-names>
          </string-name>
          :
          <article-title>Russian Dependency Parser SyntAutom at the DIALOGUE2012 Parser Evaluation Task. Компьютерная лингвистика и интеллектуальные технологии</article-title>
          .
          <source>По материалам ежегодной Межд</source>
          . конф. «
          <article-title>Диалог»</article-title>
          .
          <source>М.: РГГУ</source>
          ,
          <volume>2</volume>
          (
          <issue>11</issue>
          (
          <issue>18</issue>
          )),
          <fpage>сс</fpage>
          .
          <fpage>104</fpage>
          -
          <lpage>118</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Barron-Cedeno</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Vila</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Marti</surname>
            ,
            <given-names>M.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rosso</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          : Plagiarism Meets Paraphrasing:
          <article-title>Insights for the Next Generation in Automatic Plagiarism Detection</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>39</volume>
          (
          <issue>4</issue>
          ), pp.
          <fpage>917</fpage>
          -
          <lpage>947</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Corley</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mihalcea</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          :
          <source>Measuring the Semantic Similarity of Texts. Proc. of the ACL Workshop on Empirical Modeling of Semantic Equivalence and Entailment</source>
          , Association for Computational Linguistics Stroudsburg, PA, USA, pp.
          <fpage>13</fpage>
          -
          <lpage>18</lpage>
          (
          <year>2005</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Fernando</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Stevenson</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          :
          <string-name>
            <given-names>A Semantic</given-names>
            <surname>Similarity</surname>
          </string-name>
          <article-title>Approach to Paraphrase Detection</article-title>
          .
          <source>Proc. of the Computational Linguistics UK, 11th Annual Research Colloquium</source>
          (
          <year>2008</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Finch</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hwang</surname>
            ,
            <given-names>Y.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sumita</surname>
            ,
            <given-names>E.:</given-names>
          </string-name>
          <article-title>Using Machine Translation Evaluation Techniques to Determine Sentence-Level Semantic Equivalence</article-title>
          .
          <source>Proc. of the 3rd Int. Workshop on Paraphrasing</source>
          , pp.
          <fpage>17</fpage>
          -
          <lpage>24</lpage>
          (
          <year>2005</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Artemova</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Boyarsky</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gouzйvitch</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gusarova</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dobrenko</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kanevsky</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Petrova</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          :
          <article-title>Text Categorization for Generation of Historical Shipbuilding Ontology</article-title>
          .
          <source>Communications in Computer and Information Science</source>
          ,
          <volume>468</volume>
          , pp.
          <fpage>1</fpage>
          -
          <lpage>14</lpage>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>[8] http://wordnet.princeton.edu/</mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>[9] http://www.dictum.ru/ru/syntax-analysis/blog</mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>[10] http://www.paraphraser.ru.</mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [11] http://www.paraphraser.ru/download/get?file_id=
          <fpage>5</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Iomdin</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Petrochenkov</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sizov</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Tsinman</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          : ETAP Parser:
          <article-title>State of the Art</article-title>
          .
          <article-title>Компьютерная лингвистика и интеллектуальные технологии</article-title>
          .
          <source>По материалам ежегодной Межд</source>
          . конф. «
          <article-title>Диалог»</article-title>
          .
          <source>М.: РГГУ</source>
          ,
          <volume>2</volume>
          (
          <issue>11</issue>
          (
          <issue>18</issue>
          )),
          <fpage>сс</fpage>
          .
          <fpage>119</fpage>
          -
          <lpage>131</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Pershina</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>He</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          <string-name>
            <surname>Grishman</surname>
          </string-name>
          , R.: Idiom Paraphrases:
          <article-title>Seventh Heaven vs Cloud Nine</article-title>
          .
          <source>Proc. of the EMNLP 2015 Workshop on Linking Models of Lexical, Sentential and Discourse-level Semantics</source>
          , pp.
          <fpage>76</fpage>
          -
          <lpage>82</lpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Avdeeva</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Artemova</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Boyarsky</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gusarova</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dobrenko</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kanevsky</surname>
          </string-name>
          , E.: Subtopic Segmentation of Scientific Texts: Parametr Optimisation.
          <source>Communications in Computer and Information Science</source>
          ,
          <volume>518</volume>
          , pp.
          <fpage>3</fpage>
          -
          <lpage>15</lpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Avdeeva</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Boyarsky</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kanevsky</surname>
          </string-name>
          , E.:
          <article-title>Extraction of Low-frequent Terms from Domainspecific Texts by Cluster Semantic Analyses</article-title>
          .
          <source>Proc. of the ISMW-FRUCT</source>
          <year>2016</year>
          .
          <article-title>Saint-Petersburg, Russia</article-title>
          , FRUCT Oy, Finland, pp.
          <fpage>86</fpage>
          -
          <lpage>89</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          [16]
          <string-name>
            <surname>Nivre</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Boguslavsky</surname>
            ,
            <given-names>I.M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Iomdin</surname>
            ,
            <given-names>L.L. Parsing</given-names>
          </string-name>
          <article-title>the SynTagRus Treebank of Russian</article-title>
          .
          <source>Proc. of the 22nd Int. Conf. on Computational Linguistics</source>
          ,
          <volume>1</volume>
          , pp.
          <fpage>641</fpage>
          -
          <lpage>648</lpage>
          . Association for Computational Linguistics (
          <year>2008</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          [17]
          <string-name>
            <surname>Pham</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bernardi</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          , Zhang,
          <string-name>
            <given-names>Y.Z.</given-names>
            ,
            <surname>Baroni</surname>
          </string-name>
          ,
          <string-name>
            <surname>M.</surname>
          </string-name>
          :
          <article-title>Sentence Paraphrase Detection: When Determiners and Word Order Make the Difference</article-title>
          .
          <source>Proc. of the Towards a Formal Distributional Semantics Workshop at IWCS</source>
          , pp.
          <fpage>21</fpage>
          -
          <lpage>29</lpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          [18]
          <string-name>
            <surname>Pronoza</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yagunova</surname>
          </string-name>
          , E.:
          <article-title>Comparison of Sentence Similarity Measures for Russian Paraphrase Identification</article-title>
          .
          <source>Artificial Intelligence and Natural Language and Information Extraction</source>
          ,
          <article-title>Social Media and Web Search FRUCT Conf</article-title>
          ., pp.
          <fpage>74</fpage>
          -
          <lpage>82</lpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          [19]
          <string-name>
            <surname>Pronoza</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yagunova</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pronoza</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>Construction of a Russian Paraphrase Corpus: Unsupervised Paraphrase Extraction</article-title>
          .
          <source>Proc. of the 9th Russian Summer School in Information Retrieval, August 24-28</source>
          ,
          <year>2015</year>
          , Saint-Petersburg,
          <source>Russia (RuSSIR</source>
          <year>2015</year>
          , Young Scientist Conference), Springer CCIS
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          [20]
          <string-name>
            <surname>Азарова</surname>
            ,
            <given-names>И.В.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Митрофанова</surname>
          </string-name>
          , О.А.,
          <string-name>
            <surname>Синопальникова</surname>
          </string-name>
          , А.А.:
          <article-title>Компьютерный тезаурус русского языка типа WordNet. Компьютерная лингвистика и интеллектуальные технологии</article-title>
          .
          <source>Труды Межд. конф. «Диалог</source>
          <year>2003</year>
          ». М.: Наука, сс.
          <fpage>43</fpage>
          -
          <lpage>50</lpage>
          (
          <year>2003</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          [21]
          <string-name>
            <surname>Боярский</surname>
            ,
            <given-names>К.К.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Каневский</surname>
          </string-name>
          , Е.А.:
          <article-title>Предсинтаксический модуль в анализаторе SemSin. Интернет и современное общество: сб. научных статей. Труды XVI Всерос. объединенной конф. «Интернет и современное общество»</article-title>
          .
          <source>СПб.: НИУ ИТМО</source>
          ,
          <year>сс</year>
          .
          <fpage>280</fpage>
          -
          <lpage>286</lpage>
          (
          <year>2013</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref23">
        <mixed-citation>
          [22]
          <string-name>
            <surname>Боярский</surname>
            ,
            <given-names>К.К.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Каневский</surname>
          </string-name>
          , Е.А.:
          <article-title>Семантико- синтаксический парсер SemSin. Научно- технический вестник информационных технологий</article-title>
          ,
          <source>механики и оптики</source>
          ,
          <volume>15</volume>
          (
          <issue>5</issue>
          ), сс.
          <fpage>869</fpage>
          -
          <lpage>876</lpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref24">
        <mixed-citation>
          [23]
          <string-name>
            <surname>Боярский</surname>
            ,
            <given-names>К.К.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Каневский</surname>
          </string-name>
          , Е.А.:
          <article-title>Система продукционных правил для построения синтаксического дерева предложения. Прикладна лiнгвiстика та лiнгвiстичнi технологii: MegaLing-2011</article-title>
          . К.: Довiра, сс.
          <fpage>73</fpage>
          -
          <lpage>80</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref25">
        <mixed-citation>
          [24]
          <string-name>
            <surname>Боярский</surname>
            ,
            <given-names>К.К.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Каневский</surname>
          </string-name>
          , Е.А.:
          <article-title>Язык правил для построения синтаксического дерева. Интернет и современное общество: Материалы XIV Всерос. объединенной конф. «Интернет и современное общество»</article-title>
          . СПб.: ООО «МультиПроджектСистемСервис», сс.
          <fpage>233</fpage>
          -
          <lpage>237</lpage>
          (
          <year>2011</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>