<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Статистическая модель для распознавания смыслов в текстах иностранного языка с обучением на примерах из параллельных текстов</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>© Alexander Ermakov</string-name>
          <email>ermakov@rco.ru</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>RCO Llc</string-name>
          <email>pavel@rco.ru</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Moscow</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Russia</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Pavel Polyakov</institution>
        </aff>
      </contrib-group>
      <fpage>397</fpage>
      <lpage>404</lpage>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Вопросы
поиска стали
межязыкового
предметом
информационного
систематического
Труды XIX Международной конференции
«Аналитика и управление данными в областях с
интенсивным использованием данных»
(DAMDID/ RCDL’2017), Москва, Россия, 10–13
октября 2017 года
необходимых для обучения всех статистических
алгоритмов.</p>
      <p>В основе предлагаемого нами подхода лежат
идеи, имеющие аналогии с таковыми,
используемыми в статистическом машинном
переводе, наиболее полная информация по которому
представлена на веб-ресурсе [7]. Тем не менее,
предложенная модель и исследования, посвященные
ей, нам не встречались.</p>
      <p>Под присутствием заданного смысла в тексте
будем понимать описание или упоминание в этом
тексте:
• фактов и ситуаций определенного класса,
например: владение акциями предприятий,
заключение договоров между организациями,
встречи персон;
• определенных событий, например: война в Сирии,</p>
      <p>санкции против России;
• определенных тем, например: образ России в</p>
      <p>зарубежных СМИ, политика Дональда Трампа.
Тогда задачу информационного поиска в общем виде
можно представить как задачу распознавания
присутствия заданного смысла в анализируемых
текстах и выделения фрагментов текста,
релевантных искомому смыслу.</p>
      <p>Для распознавания смыслов в русскоязычном
тексте можно использовать разработанный нами
лингвистический анализатор RCO Fact Extractor [8],
который извлекает структурированные описания
ситуаций, событий и фактов, выраженные в тексте
заданными конфигурациями синтаксически
связанных слов [9].</p>
      <p>Адаптация русскоязычного лингвистического
анализатора к новому языку представляет собой
нетривиальную ресурсоемкую задачу, требующую
построения синтаксического анализатора этого
языка и ряда сопутствующих лингвистических
компонентов. В настоящей работе предложен
альтернативный подход к построению
распознавателя смыслов на иностранном языке, не
требующий глубокого машинного анализа этого
языка. Подход строит модель статистического
распознавателя смысла на новом языке в форме n-ок
совместно встречающихся слов, с возможностью
вставки не более заданного количества посторонних
слов между словами n-ок. Появление всех слов
какой-либо из n-ок в пределах текстового окна
ограниченной длины интерпретируется как наличие
целевого смысла. На практике поиск смысла,
описанного в такой форме, может быть эффективно
реализован средствами поисковой машины,
поддерживающей поиск заданных слов в пределах
окна заданной длины с сохранением заданного
порядка слов или без такового.</p>
      <p>Для обучения распознавателя использованы
корпус параллельных текстов и русскоязычный
лингвистический анализатор, который выделяет
целевые смыслы и содержащие их фрагменты из
русских текстов на основе
синтактикосемантических шаблонов [9]. Параллельные им
фрагменты из текстов иностранного языка также
считаются релевантными смыслам и используются
для последующей настройки параметров
статистической модели. Такой подход требует для
настройки распознавателя на каждый новый язык: а)
соответствующего параллельного корпуса,
представительного в плане присутствия разных
способов выражения целевых смыслов; б)
простейшего лингвоанализатора, способного строить
варианты нормальных форм для словоформ
иностранного языка; в) для некоторых видов
распознаваемых смыслов от лингвоанализатора
может потребоваться умение выделять именованные
сущности.
2 Модель статистического
распознавателя смыслов</p>
      <p>Будем называть смысло-текстом текстовый
фрагмент, содержащий такую конфигурацию
синтаксически связанных слов, появление которой в
произвольном тексте говорит о присутствии в нем
заданного смысла. Идеальным смысло-текстом
является такой фрагмент, в котором отсутствуют
лишние слова, появление которых не является
обязательным для идентификации присутствия
смысла, например: Берлага заключил договор с
Корейко; договор Берлаги и Корейко (для смысла
«договора между персонами»); усиление влияния
России на Ближнем Востоке; Газпром использует
свое монопольное положение на рынке
энергоносителей (смысл «образ России в
зарубежных СМИ»).</p>
      <p>Определим статистический распознаватель
смыслов (СРС) как механизм, который для данного
текста d определяет, присутствует ли в нем заданный
смысл Se: формирует реакцию Re(Se,d)=1, если
смысл присутствует, и Re(Se,d)=0, если отсутствует.</p>
      <p>Построим модель СРС в следующем виде.
Распознаватель считает, что смысл Se присутствует в
тексте d (реакция Re(Se,d)=1), если текст содержит
хотя бы одну n-ку из множества S=Ug,n sgn, g=0..G,
n=1..N, где sgn={(w1,w2,…,wn,g)} – подмножество
nок, каждая из которых содержит n определенных
слов wi, допуская между ними вставку произвольных
слов в количестве, не превышающем g. Далее будем
обозначать профиль СРС как S={s1,s2,…,sJ}, где J –
количество n-ок в профиле, нумеруя подряд n-ки в
профиле и опуская обозначения n и g в них.
Множество n-ок S будем называть профилем смысла
Se. В зависимости от степени свободы порядка слов
в языке к словам n-ок либо следует применять
требование сохранения их порядка в окне (пр.,
армянский, казахский), либо нет (сербский,
белорусский). С практической точки зрения
достаточными представляются значения N=4, что
соответствует, например, упоминанию целевого
объекта с тремя дополнительными словами,
достаточно точно идентифицирующими искомую
ситуацию с объектом.</p>
      <p>Обучение СРC смыслу Se представляет собой
процедуру поиска такого профиля S, который
обеспечит наилучшее качество работы СРС на
текстах обучающего корпуса D.</p>
      <p>За оценку правдоподобия профиля S возьмем
совокупную оценку ожидаемых от него полноты P и
точности R распознавания смысла (т. н. F1-мера в
теории информационного поиска):
q(S,D)=2P(S,D)R(S,D)/(P(S,D)+R(S,D)),</p>
      <p>
        (
        <xref ref-type="bibr" rid="ref1">1</xref>
        )
где P(S,D)=|D*1(S)|/|D1(S)|, R(S,D)=|D*1(S)|/|D(Se)|,
D(Se) – множество смысло-текстов обучающего
корпуса, релевантных смыслу Se, D1(S) – множество
всех смысло-текстов, распознанных профилем S,
D*1(S) – множество смысло-текстов, правильно
распознанных профилем S. Тогда наилучший
профиль S*, обеспечивающий максимальное
качество СРС, определится как:
(
        <xref ref-type="bibr" rid="ref2">2</xref>
        )
(
        <xref ref-type="bibr" rid="ref3">3</xref>
        )
      </p>
      <p>S*=arg maxS q(S,D)
Для ускорения поиска максимума q(S,D) в
пространстве S комбинаций n-ок определим
правдоподобие вхождения отдельной n-ки sj в S* как</p>
      <p>
        q(sj)=(1–1/|D*1(sj)|D*1(sj)|/|D1(sj)|,
где множитель |D*1(sj)|/|D1(sj)| характеризует
ожидаемую точность, а множитель 1–1/|D*1(sj)|
повышает вероятность включения в профиль n-ок с
большей частотой встречаемости в релевантных
смысло-текстах D*1(sj), поскольку от таковых
ожидается большая полнота распознавания смысла.
Тогда наилучший профиль S* в соответствии с (
        <xref ref-type="bibr" rid="ref2">2</xref>
        )
можно построить, применив следующий жадный
алгоритм поиска в пространстве состояний.
      </p>
      <p>
        Вначале алгоритм собирает все уникальные n-ки
sj, для которых значение q(sj) в соответствии с (
        <xref ref-type="bibr" rid="ref3">3</xref>
        )
выше определенного порогового значения –
кандидатов на включение в профиль. Каждой
n-кекандидату соответствует массив идентификаторов
содержащих ее смысло-текстов di.
      </p>
      <p>
        Далее n-ки сортируются по убыванию значений
q(sj), и первая n-ка включается в профиль на шаге 1:
S1={s1}, чем начинается выполнение итерационного
алгоритма расширения профиля новыми n-ми, идя по
убыванию значений q(sj). Обозначим St-1 профиль,
полученный на итерации t–1, а st-1 – последнюю
обработанную n-ку, включенную или не включенную
в профиль. На следующей итерации t производится
попытка добавить к профилю очередную n-ку st.
Вычисляются оценки качества нового получаемого
профиля P(St,D), R(St,D), q(St,D), и новый профиль St
признается лучше старого при одновременном
соблюдении следующих условий:
q(St,D)&gt;q(St-1,D) и RG(st|St-1,D)/TG(st|St-1,D)&gt;Pmin, (
        <xref ref-type="bibr" rid="ref4">4</xref>
        )
где Pmin – минимальная допустимая точность
профиля (мы использовали Pmin=0.7), RG(st|St-1,D) –
прирост количества релевантных смысло-текстов,
распознаваемых профилем St-1 после добавления к
нему n-ки st, TG(st|St-1,D) – прирост количества всех
смысло-текстов, распознаваемых профилем St-1 после
добавления к нему n-ки st.
      </p>
      <p>При выполнении обоих условий n-ка добавляется
к профилю St-1, и формируется новый профиль St,
который принимается за S*; в противном случае n-ка
пропускается, и делается попытка добавления к
профилю следующей n-ки st+1 – итерация t+1.
Расширение профиля прекращается при
прохождении всех n-ок-кандидатов или при
достижении порога по допустимому количеству n-ок
в профиле. Тогда производится возвращение на шаг
назад к профилю без добавления последней n-ки,
делается попытка добавить следующую за ней n-ку
из числа кандидатов и т. д. Таким способом
обходится дерево возможных комбинаций n-ок в
профиле, и наилучший полученный профиль S*
запоминается. При включении n-ок в порядке
убывания их q(sj) можно ожидать, что лучшие
варианты профиля будут получены на более ранних
шагах алгоритма.
3 Выравнивание параллельных текстов</p>
      <p>Для обучения СРС необходимо сформировать
обучающее множество смысло-текстов D(Se)={di},
релевантных смыслу Se. В качестве таковых
отбираются смысло-тексты иностранного языка,
параллельные тем русскоязычным смысло-текстам, в
которых лингвистическим анализатором выделен
смысл Se. Источниками параллельных
смыслотекстов, достаточно объемными и
представительными в плане разнообразия
содержания, являются корпуса переводов новостных
сообщений. Такие корпуса в общем случае не
содержат строго параллельных текстов, в которых
предложения с одинаковыми порядковыми
номерами в последовательности могли бы выступать
в роли параллельных смысло-текстов. Более того,
переводы новостных сообщений часто содержат
иную разбивку на предложения, чем их оригиналы, в
том числе нередко опускают оригинальные
предложения и вставляют новые. Аналогично,
перевод предложения может содержать
пропуски/вставки ряда значимых слов в описании
ситуации – переводчики новостей нередко опускают
детали или добавляют собственные интерпретации.</p>
      <p>Вследствие этого обучение профилей СРС
требует проведения машинной процедуры
предварительного выравнивания квазипараллельных
текстов, которая устанавливает соответствие между
предложениями на двух языках по принципу «одно к
одному», «одно к нескольким» или «несколько к
одному», а также отбрасывает предложения, перевод
которых является излишне «вольным».</p>
      <p>Обычно методы выравнивания предложений
используют алгоритм динамического
программирования, который позволяет
вычислительно эффективно определить такую
последовательность пар сопоставленных друг другу
предложений, для которой сумма расстояний между
предложениями в каждой паре будет минимальна.
При этом сущность используемого метода
заключается в способе определения сходства между
парой предложений двух языков. В качестве
русскоязычной точки входа в методы выравнивания
можно указать работу отечественных исследователей
[11]. Наиболее полная информация с зарубежной
библиографией по данной теме доступна на
вебресурсе [6].</p>
      <p>Реализованный нами метод требует наличия
словаря переводных соответствий слов двух языков,
желательно с вариантами синонимичных переводов,
а также лингвистических анализаторов обоих
языков, способных разделять текст на предложения,
а предложения – на сущности, которым
приписываются варианты их перевода. В качестве
сущностей анализаторы должны выделять слова и,
желательно, словосочетания, обозначающие
различные классы именованных (персоны,
организации, географические объекты) и
специальных (даты, периоды времени, денежные
суммы) объектов. Именованные и специальные
сущности в новостных текстах являются опорными
точками для выравнивания параллельных
предложений. Сущности приписывается набор
альтернативных вариантов перевода (если это
удается), а в некоторых случаях, например, для
именованных персон, – еще и вариант
транскрибирования.</p>
      <p>Будем называть количеством сопоставлений
переводов Eq(ei|dj) количество сущностей из
предложения ei={eki}, k=1..K, i=1..I, сопоставленных
с сущностями из предложения dj={dpj}, p=1..P, j=1..J.
Здесь I и J – количества предложений в параллельных
текстах E и D; K и P – количества сопоставляемых
сущностей в соответствующих предложениях i и j, из
числа которых исключены общеупотребимые слова
обоих языков, вероятность совпадения переводов
которых в паре произвольных предложений высока
(прежде всего, это союзы, местоимения, предлоги).</p>
      <p>Сущности eki и dpj считаются сопоставленными,
если выполняется любое из трех условий:
1. обе сущности относятся к классу специальных, и
их тип (дата, период времени, денежная суммы)
одинаков;
2. один из вариантов имени сущности точно
совпадает с одним из вариантов перевода/
транскрипции одного из имен другой сущности;
3. условие 2 выполняется не для точного, а для
«нечеткого» совпадения, когда эквивалентными
признаются строки, имеющие относительное
количество совпавших триграмм символов не
менее порогового.</p>
      <p>Условие 1 позволяет сопоставить сущности,
выражаемые специальными конструкциями (пр.
даты), для которых получение совпадающих
переводов маловероятно вследствие разнообразия
используемых форматов написания в каждом из
языков.</p>
      <p>Условие 3 необходимо для сопоставления, в
первую очередь, именованных сущностей – персон и
организаций, при переводе которых
человекомпереводчиком часто не соблюдается исходный
формат, кроме того, в силу потенциальной
неполноты словарей перевода имен, не все части
сложных имен могут иметь варианты перевода в
словаре. Так, имена персон (как полные, так и
краткие) обычно удается сопоставить именно по
«нечеткому» совпадению транскрипций. Нередко
такое сравнение транскрипций работает для
географических мест, обычно не общеизвестных
(местных), а также для организаций, напротив,
общеизвестных (международных).</p>
      <p>Заметим, что величина Eq(ei|dj) и вычисляемая
наоборот величина Eq(dj|ei) в общем случае будут
иметь различные значения в силу возможных
повторений слов или вариантов их переводов в
одном предложении, а также в силу использования
«нечеткого» сравнения строк.</p>
      <p>Мера прямого сходства переводов определяется
как Tr(ei|dj)= Eq(ei|dj)/K, а мера обратного сходства –
как Tr(dj|ei)=Eq(dj|ei)/P.</p>
      <p>
        Обозначим (i(t), j(t)), t=1...T, последовательность
номеров пар предложений ei и dj из параллельных
текстов E={ei}, i=1..I, и D={dj}, j=1..J, где j(
        <xref ref-type="bibr" rid="ref1">1</xref>
        )≥1,
i(
        <xref ref-type="bibr" rid="ref1">1</xref>
        )≥1, j(T)≤J, i(T)≥I. Здесь t – переменная, введенная
для установления возможного соответствия между
номерами предложений i(t) и j(t). Тогда (i(t),j(t))
представляет собой возможную последовательность
выравнивания предложений при условии, что
i(t)≤i(t+1) и j(t)≤j(t+1).
      </p>
      <p>В ходе поиска наилучшей последовательности
выравнивания (i(t),j(t))* методом динамического
программирования используются два правила:
• пара предложений (ei(t),dj(t)) может быть
включена в последовательность выравнивания
при одновременном выполнении двух условий:</p>
      <p>max{Tr(ei(t),dj(t)),Tr(dj(t)|ei(t))}&gt;Trmax
•
и</p>
      <p>min{Tr(dj(t)|ei(t)), Tr(ei(t),dj(t))}&gt;Trmin,
где Trmax и Trmin – эмпирически подбираемые
параметры, в нашем случае – 0.5 и 0.25
соответственно. Увеличение значений Trmax и
Trmin приводит к повышению точности
выравнивания, а их уменьшение – к повышению
полноты за счет снижения точности. Чем больше
полнота используемого словаря переводных
соответствий, тем более высокими могут быть
выбраны значения Trmax и Trmin;
последовательность выравнивания A признается
лучше другой последовательности B, если
величина ∑t(Eq(ei(t)|,dj(t))+Eq(dj(t)| ei(t))) –
совокупное количество сопоставлений
переводов – для последовательности A
превышает таковую величину для
последовательноcти B.</p>
      <p>После нахождения наилучшего отображения
параллельных предложений «одно к одному»
делается попытка отобразить предложения,
пропущенные в последовательности выравнивания,
на те предложения, с которыми уже выровнены
предложения, соседние с пропущенными, при
реализации выравнивания «одно к нескольким» для
случаев несинхронной разбивки исходного и
целевого текста на предложения. В контексте задачи
обучения СРС процедура выравнивания имеет целью
получить смысло-текст минимального размера,
поэтому разрешается объединять в один
смыслотекст не более двух предложений. В финале
происходит отбрасывание тех пар смысло-текстов,
для которых мера прямого или обратного сходства
переводов оказывается ниже определенного порога –
ожидается, что соответствующий перевод является
излишне «вольным».
4 Реализация и эксперименты</p>
      <p>Эксперименты по обучению СРС были
проведены на корпусе новостных текстов,
полученных с армянского сайта http://news.am. Из
двух разделов данного сайта (http://news.am/rus/news/
и http://news. am/arm/news/) были скачаны по 300
тысяч русских и армянских текстов, из числа
которых по формальному признаку – совпадению
идентификаторов – было получено 230 тысяч пар
предположительно параллельных русско-армянских
текстов.</p>
      <p>Для анализа русских текстов был использован
лингвистический анализатор RCO Fact Extractor [8],
который проводил полный синтаксический анализ
текста, выделяя сущности разных типов с
отношениями между ними, а также события и факты
с их участниками в соответствии с заданными
синтактико-семантическими шаблонами [9]. Для
анализа армянских текстов был разработан неполный
лингвистический анализатор, который разбивал
текст на слова и предложения, проводил
морфологический анализ и определял для каждого
слова возможные варианты его нормальной формы, а
также распознавал на основе формальных правил и
сворачивал в одну сущность особые цепочки слов –
обозначения именованных персон, организаций,
географических объектов, дат и обстоятельств
времени. Основой для построения армянского
морфословаря послужил Восточно-армянский
национальный корпус [1], правила описания особых
сущностей были разработаны лингвистом на языке
Cape для компонента RCO Pattern Extractor [10].</p>
      <p>Армяно-русский словарь переводов содержал
более 100 тысяч единиц и был сформирован путем
консолидации переводов из нескольких
интернетисточников. Статистические переводчики Яндекс и
Гугл могут переводить по-разному различные
словоформы одного и того же слова, например,
разным формам армянского слова «ծառայություն»
соответствуют формы русских слов сервис, служба,
услуга, обслуживание, а также ряд ошибочных
переводов. Эмпирически было подобрано правило
определения достоверности переводов, согласно
которому признаются недостоверными те варианты,
которые встречаются со взвешенной частотой,
отношение которой к взвешенной частоте самого
частого варианта составляет менее 0.7. Взвешенная
частота есть сумма частот встречаемости в каждом из
источников, умноженных на вес источника, который
определяет уровень доверия к нему. На практике
были использованы три источника переводов: а)
переводы встретившихся в текстах словоформ,
полученные из Яндекса, с весом 1; б) переводы тех
же словоформ, полученные из Гугла, с весом 2
(переводы Гугла мы считали достовернее переводов
Яндекса); в) строгий словарь объемом 22 тысячи слов
(нормальных форм), полученный из
интернетисточника
http://www.classes.ru/allarmenian/dictionary-armenian-russian.htm, с весом 100,
что означало отброс всех вариантов Яндекс- и
Гуглпереводов слов, встретившихся в строгом словаре.
На переводы в Яндекс и Google были отправлены все
армянские словоформы, встретившихся не менее чем
в двух документах 230-тысячного корпуса текстов, а
также именованные сущности, что составило 350
тысяч единиц.</p>
      <p>С использованием полученного словаря
переводов алгоритм, описанный в Разделе 3, разбил
230 тысяч пар текстов на 1370 тысяч пар
параллельных фрагментов – смысло-текстов, а для
690 тысяч русских и 585 тысяч армянских
предложений не было найдено достаточно близких
параллельных переводов. Данная процедура заняла
около восьми часов работы одного процессорного
ядра.</p>
      <p>Программные компоненты обучения СРС
работают в три фазы.</p>
      <p>
        На Фазе I обрабатывается корпус xml-файлов,
которые формируются двумя лингвистическими
анализаторами и содержат описание сущностей,
выделенных в армянских смысло-текстах, а также
идентификаторы смыслов, которым релевантны
параллельные им русские смысло-тексты.
Собираются все n-ки из нормальных форм
сущностей, упоминавшиеся в армянских
смыслотекстах, длиной от 2 до 4, допуская встречаемость
между словами n-ок посторонних слов количеством
от 0 до 5. Также собираются параметризованные
варианты n-ок, в которых конкретные именованные
сущности заменяются на свои типы – персона,
организация, география. Все омонимичные варианты
нормальных форм сущностей порождают
соответствующие варианты n-ок. Количество разных
n-ок, получаемых таким образом, имеет порядок
сотен миллионов, поэтому для хранения статистики
(общие частоты встречаемости n-ок в корпусе и
частоты n-ок по каждому смыслу) в оперативной
памяти применяется процедура периодического
забывания – как только количество сохраненных n-ок
превышает 10 миллионов (что не превышает 2 Гбайт
ОЗУ), из памяти удаляются данные по наиболее
редко встретившимся n-кам, имеющим низкие
оценки правдоподобия вхождения в профиль
какоголибо смысла в соответствии с (
        <xref ref-type="bibr" rid="ref3">3</xref>
        ). В финале для
каждого смысла отбирается до 1,5 тысяч лучших
nок – кандидатов на последующее включение в
профиль, получивших наибольшие оценки
правдоподобия вхождения в профиль q(sj) в
соответствии с (
        <xref ref-type="bibr" rid="ref3">3</xref>
        ), но не менее 0.01, и сохраняются в
файле – препрофиле смысла. Время обработки 230
тысяч новостных текстов для 40 смыслов (см.
Таблицу 1) на этой фазе занимает около 4 часов
работы одного процессорного ядра.
      </p>
      <p>На Фазе II загружаются файлы препрофилей
смыслов, и вновь обрабатывается корпус xml-файлов
с описаниями сущностей, выделенных в
параллельных смысло-текстах. В результате для
каждой n-ки в препрофилях подсчитываются частоты
ее встречаемости в окнах различной длины с
количеством допустимых вставок посторонних слов
от 0 до 5. Одновременно для n-ки собираются
идентифкаторы смысло-текстов, ее содержащих, по
каждому из окон. Собранная информация
сохраняется в полных файлах препрофилей смыслов.
Время выполнения этой фазы составляет около 1
часа.</p>
      <p>
        На Фазе III загружается файл с полной
информацией об n-ках препрофилей смыслов и
выполняется алгоритм построения профиля СРС,
который выбирает n-ки из препрофиля в профиль,
вычисляя для каждой возможной комбинации n-ок
оценку правдоподобия и запоминая комбинацию с
максимальной оценкой как лучший вариант профиля
S* в соответствии с (
        <xref ref-type="bibr" rid="ref2">2</xref>
        ). Максимальное количество
просматриваемых комбинаций ограничивалось 1
миллионом, что оказалось с избытком достаточно
для получения наилучшего варианта профиля –
средний номер шага процедуры перебора
комбинаций, на котором был получен наилучший
вариант S*, по 40 профилям составил около 2 тысяч,
а наибольшее из значений (для профиля
«путешествия») не превышает 20 тысяч. Для
большинства смыслов количество всех комбинаций,
подлежащих проверке на выполнение условий (
        <xref ref-type="bibr" rid="ref4">4</xref>
        ),
оказалось значительно меньше миллиона вследствие
относительно небольшого количества обучающих
примеров и соответствующих n-ок-кандидатов на
включение в профиль. В итоге время выполнения
данной фазы составило в среднем одну секунду на
профиль.
      </p>
      <p>Настройка СРС проводилась на полученном
корпусе из 1.370 тысяч пар параллельных
смыслотекстов для 40 смыслов – ситуаций, отобранных из
более чем 200 типовых ситуаций, распознаваемых
русскоязычными лингвистическими шаблонами
RCO Fact Extractor. Названия этих смыслов-ситуаций
приведены в первом столбце Таблицы 1. Именно к
ним обнаружено в корпусе наибольшее количество
релевантных смысло-текстов, которое указано в
третьем столбце Exm.</p>
      <p>В экспериментах было построено два отдельных
СРС – профили русского СРС строились на русских
смысло-текстах и состояли из n-ок русских
сущностей, выделенных RCO Fact Exctractor, а
профили армянского СРС строились на
параллельных армянских смысло-текстах и состояли
из n-ок армянских слов, выделенных разработанным
армянским лингвоанализатором. Обучение СРС «с
русского на русский» позволяло исследовать работу
СРС в чистом виде, без влияния факторов
посторонних составляющих– несовершенств
армянского лингвоанализатора, процедуры
выравнивания параллельных фрагментов и
недостатков собственно параллельных переводов.
Значения, полученные для армянского и русского
СРС, в Таблице 1 приведены вместе и разделены
символом '/'.</p>
      <p>Каждая из 40 ситуаций предполагает вовлечение
в нее одного или двух участников, представленных в
тексте произвольными именованными сущностями.
Поэтому, вместо конкретных слов – имен
собственных, n-ки профилей включали в себя
обозначения типов именованных сущностей (O –
организация, P – персона, G – географическое место),
которые указаны во втором столбце Таблицы 1. Знак
'|' разделяет возможные альтернативы. Например, для
смысла владение акциями во втором столбце указано
O|P O, что означает, что в n-ку слов, входящую в
профиль данного смысла, должны обязательно войти
какая-либо именованная персона или организация
(владелец акций) плюс именованная организация
(эмитент акций).</p>
      <p>
        Различия между цифрами (количество
релевантных смысло-текстов) в столбцах Exm и
TrainExm обусловлено следующим. Оценка
правдоподобия вхождения n-ки в профиль смысла
q(sj) в соответствии с (
        <xref ref-type="bibr" rid="ref3">3</xref>
        ) равна 0 в случае единичной
частоты встречаемости n-ки, вследствие чего такие
nки не могли быть включены в профиль в силу
объективной недостаточности данных для обучения
СРС. В результате этого многие смысло-тексты, не
содержащие ни одной n-ки с частотой более 1 и
относительно высоким значением q(sj)&gt;0,01,
фактически не могли участвовать в обучении.
Поэтому при расчете значений R в соответствии с (
        <xref ref-type="bibr" rid="ref1">1</xref>
        )
в качестве D(Se) бралось множество смысло-текстов,
содержащих хотя бы одну из n-ок-кандидатов на
включение в профиль. Это позволяло оценить
качество алгоритма обучения относительно
независимо от качества обучающей выборки, а также
от качества лингвистического анализа армянского
текста, которое априори было хуже качества анализа
русского – прежде всего, экспериментальный
морфоанализатор для армянского языка не мог
приводить разные формы слова к одной форме с
такой же полнотой и точностью, как
морфоанализатор для русского языка. Именно эти
фактором в первую очередь обусловлено то, что
среднее по столбцу TrainExm для армянского языка –
509 – оказалось вдвое меньше, чем для русского –
1056. Соответственно, среднее количество n-грамм,
включенных в армянские профили, в столбце n-s –
145 – оказалось меньше, чем для русского языка –
173. Кроме того, армянские переводы русских
новостных текстов нередко опускают описания
деталей событий, в которых содержится целевой
смысл в исходных текстах, распознаваемый русским
лингвоанализатором.
      </p>
      <p>
        С учетом сказанного средние значения полноты
(0.61 для армянского языка против 0.71 для русского
в столбце R) и точности (0.94 для армянского языка
против 0.91 для русского) представляются нам
близкими. Соответствующие значения F1-меры,
балансирующей полноту и точность в соответствии с
(
        <xref ref-type="bibr" rid="ref1">1</xref>
        ), различаются еще меньше – 0.73 против 0.78.
Реально ожидаемая полнота, рассчитанная с учетом
всех 3587 примеров в корпусе, для русских текстов
составляет около 0,21 (0.71 умножить на 1056/3587),
а для армянских текстов – 0,09 (0.61 умножить на
509/3587).
Таблица 1 Данные по профилям смыслов. Имена столбцов: Sense – имя смысла; Param – типы
сущностейпараметров в n-ках; Exm – количество релевантных смысло-текстов в обучающем корпусе; TrainExm –
количество релевантных смысло-текстов, участвовавших в обучении профиля; n–s – количество n-ок,
вошедших в профиль; P, R – точность и полнота на обучающем корпусе в соответствии с (
        <xref ref-type="bibr" rid="ref1">1</xref>
        ). Символом '/'
разделены значения, полученные на армянских и русских смысло-текстах
      </p>
      <p>Sense
митинги/забастовки
уход с рынка
поставки
предоставление услуг
открытие торг. точек
новые проекты
проведение тендера
отзыв продукции
открытие филиала
купля/продажа акций
выпуск товаров
создание компании
экономические
показатели
объединение
партнерство
рейтинги
юбилей
банкротство
купля/продажа финансов
выигрыш призов
благотворительность
скандалы
суды, расследования
конфликты
финансовая деятельность
успехи–неудачи
планы/намерения
мероприятия
владение акциями
владение организациями
договора
отставка с должности
авторство
кандидат на выборах
письма
назначение на должность
путешествия
физическое насилие
разговор
встреча
среднее</p>
      <p>Param
G
O
O
O
O
O
O
O
O
O
O
O
O
O O
O O
O|P
O|P
O|P
O|P
O|P
O|P
O|P
O|P
O|P O|P
O|P
O|P
O|P
O|P
O|P O
O|P O
O|P O|P
P
P
P
P
P
P G
P P
P P
P P
n-s P
500/500 0.95/0.87
5/6 1.0/1.0
8/34 0.92/0.90
4/18 1.0/0.88
11/9 1.0/0.86
15/21 0.95/0.94
10/39 0.96/0.92
23/30 0.94/0.94
33/50 0.96/0.88
58/83 0.98/0.86
61/102 1.0/0.92
51/59 0.98/0.98
182/178 0.97/0.92
1/12
23/53
10/29
10/26
14/26
36/66
107/132
112/98
166/284
93/192
109/380
230/159
331/355
390/273
500/500
14/42
135/183
211/313
166/143
150/126
217/279
229/216
352/417
500/500
11/47
299/436
429/500
145/173</p>
      <p>Предложен и экспериментально исследован
подход к распознаванию смыслов (упоминаний
целевых ситуаций, событий и фактов) в тексте,
который допускает относительно простую
реализацию предположительно для любого языка,
при наличии возможности автоматического
выделения требуемых смыслов на русском языке.
Подход требует наличия корпуса квазипараллельных
текстов – переводов с русского языка на
иностранный или обратно. Также желательно
наличие простейшего лингвистического
анализатора, способного строить варианты
нормальных форм для словоформ иностранного
языка, что позволяет существенно повысить полноту
распознавания смыслов, не требуя примеров
параллельных текстов, в которых описывающие
смысл слова стоят во всех возможных формах. В
зависимости от видов распознаваемых смыслов от
лингвистического анализатора может потребоваться
умение выделять именованные сущности.</p>
      <p>Описанные эксперименты показали высокую
точность распознавания смыслов для большого
количества разнообразных смыслов (40) на
обучающей выборке большого объема (230 тысяч
пар квазипараллельных текстов, более 1370 тысяч
пар армянских и русских предложений), что, в силу
особенностей выбранного способа описания смысла
(n-ок слов, совместно встречающихся в окне),
позволяет ожидать высокой точности распознавания
и на других текстах. Невысокая полнота
распознавания говорит о необходимости увеличить
размер корпуса параллельных новостных текстов в
несколько раз (с 230 тысяч пар до миллиона).</p>
      <p>В экспериментах не использовалась контрольная
выборка текстов, отличная от обучающей, для
проверки полученных оценок ожидаемой точности и
полноты в силу отсутствия возможности получения
качественной экспертной разметки корпуса не
только армянских, но и каких-либо других текстов на
предмет релевантности различным смыслам. Тем не
менее, просмотр содержимого построенных
профилей – русских и армянских n-ок слов – показал
релевантность подавляющего большинства из них
целевым смыслам, что повышает уверенность в
эффективности подхода.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <given-names>Eastern</given-names>
            <surname>Armenian National Corpus</surname>
          </string-name>
          , http://eanc.net
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Grefenstette</surname>
            ,
            <given-names>G</given-names>
          </string-name>
          . (ed.):
          <string-name>
            <surname>Cross-Language Information</surname>
          </string-name>
          Retrieval. Springer, 177 p. (
          <year>1998</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>He</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          :
          <string-name>
            <surname>Cross-Language Information Retrieval</surname>
          </string-name>
          . Information Retrieval:
          <article-title>Searching in the 21st Century, Part 11</article-title>
          . Wiley and Sons Ltd, pp.
          <fpage>233</fpage>
          -
          <lpage>254</lpage>
          (
          <year>2009</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Nie</surname>
            ,
            <given-names>J-Y.</given-names>
          </string-name>
          :
          <string-name>
            <surname>Cross-Language Information Retrieval</surname>
          </string-name>
          .
          <source>Synthesis Lectures on Human Language Technologies</source>
          . Morgan &amp; Claypool Publishers,
          <volume>3</volume>
          (
          <issue>1</issue>
          ), pp.
          <fpage>1</fpage>
          -
          <lpage>125</lpage>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Nie</surname>
            ,
            <given-names>J-Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gao</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cao</surname>
          </string-name>
          , G.:
          <article-title>Translingual Mining from Text Data</article-title>
          .
          <source>Mining Text Data, Part X. Springer US</source>
          , pp.
          <fpage>323</fpage>
          -
          <lpage>359</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <given-names>SMT</given-names>
            <surname>Research Survey</surname>
          </string-name>
          <article-title>Wiki: A Comprehensive Survey of Statistical Machine Translation Research Publications</article-title>
          . Sentence Alignment, http:// www.statmt.org/survey/Topic/SentenceAlignment
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <given-names>Statistical</given-names>
            <surname>Machine</surname>
          </string-name>
          <string-name>
            <surname>Translation</surname>
          </string-name>
          , maintained by Philipp Koehn, http://www.statmt.org
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <given-names>RCO</given-names>
            <surname>Fact</surname>
          </string-name>
          <article-title>Extractor - инструмент компьютерного анализа текстовой информации компании «ЭР СИ О»</article-title>
          , http://www.rco.ru/?page_id=
          <fpage>3554</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Ермаков</surname>
            ,
            <given-names>А.Е.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Плешко</surname>
          </string-name>
          , В.В.,
          <string-name>
            <surname>Митюнин</surname>
          </string-name>
          , В.А.:
          <article-title>RCO Pattern Extractor: компонент выделения особых объектов в тексте. Информатизация и информационная безопасность правоохранительных органов: Сборник трудов XII Межд. науч</article-title>
          . конф., Москва, сс.
          <fpage>312</fpage>
          -
          <lpage>317</lpage>
          (
          <year>2003</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>