<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <abstract>
        <p>Аннотация-Стандартный подход для оценки качества направлено на то, чтобы улучшать качество работы систем систем распознавания речи основан на вычислении числа распознавания для различных практических ситуаций. К неправильно распознанных слов (метрика WER, Word Error сожалению, основной фокус в данных работах направлен фRеaкteт)и.вДнаынмнывйбоплоьдшхоиднсятввлеяселтусячапевр.оОстдынмакои, односнтеатуоччинтоыэвфа-- на эксперименты с моделью распознавания, а именно ет несколько существенных факторов. Во-первых, системы эксперименты с архитектурой и типом нейронной сети распознавания голоса могут допускать ошибки, существенно (использование сверточных [11; 14] или рекуррентных семеняющие смысл фразы, а метрика WER не является чув- тей [8], архитектуры на основе трансформеров [16], и т.д.), ствительной к данному типу ошибок. Во-вторых, в реальных методами аугментации и другими техниками обучения тпорчинлаояжетнриаянхскортибсиацстиеям срлаосвпоозвнасвлаонвиоя, аголспосеацитфриечбунеатясядлняе глубинных сетей, а также способами ускорить обучение и конкретного приложения функциональность: возможность применение систем распознавания в реальных задачах. В определить потребность пользователя (интент) для голосо- то же время, все эти методы сравниваются на основе единвых ассистентов; качество распознавания автомобильного ственной метрики - числе ошибочно распознанных слов номера, адреса, номера телефона и т.д. Таким образом, (WER), которая хотя и сильно коррелирует с качеством вкоачзнеистквааетрансепообзхноадвиамноисятьв вкорнакзрреатбнотыкхе пмреитлроижкендиляях,оацетнакки- распознавания, тем не менее не является чувствительной же необходимо научиться оценивать качество современных к ошибкам, существенно меняющим суть произнесенного систем не только в терминах числа ошибочно распознанных текста. Таким образом, улучшения моделей по существуюслов, но и с учетом того, что целью является передача смысла щей метрике не позволяют оценить влияние тех или иных фразы. В данной работе мы разработали общий подход к изменений на то, как эти изменения будет воспринимать сптовсатрмоеетнрииюк.тОаксонгоовнтиаяпаидмееятрниокво,гаотпаокджхеодсапо-соибсопцоелнькзиовкаанчиее- пользователь. В результате, в распознавании речи сегодня краудсорсинга и последующего сведения задачи построения возникает проблема, близкая к той, с которой столкнулся метрики к хорошо изученной задаче обучения с учителем. информационный поиск в 2000-х годах, когда стало понятВ качестве примера использования данного подхода мы но, что не все документы одинаково хорошо отвечают на предлагаем обобщение метрики WER - метрику MERaLM, запрос пользователя, а существующие метрики, такие, как облдаодсатоюищнустювасмлеид:ууючщетимтиого, что не все ошибки одинаково MAP, не позволяют улучшать системы в сторону выявлевлияют на точность передачи смысла фразы и легкая ин- ния более релевантных документов [5]. В качестве решетерпретируемость. ния было предложено семейство метрик DCG и NDCG [5]. Ключевые слова- автоматическое распознавание речи, В распознавании речи сегодня наблюдается аналогичная метрика, машинное обучение. проблема - отсутствует подход к построению метрик, отражающих то, как пользователи воспринимают работу I. Введение системы: какое распознавание считать ”хорошим”, а какое Автоматическое распознавание речи в настоящее время ”плохим”? Передает ли распознавание смысл исходного активно применяется для решения большого числа прак- текста? Какие ошибки считать существенными, а какие тических задач: голосовые помощники, автоматическая нет? Насколько влияет добавление или пропуск частицы генерация субтитров, автоматизация работы центров обра- ”не” на восприятие смысла? Человек, так или иначе, ботки звонков и т.д. Современные методы, основанные на может дать ответы на эти вопросы, в то время как метрика применении методов глубинного обучения, достигли каче- WER - нет, и мы считаем, что для дальнейшего развития ства, сравнимого с человеком [13] на общедоступных кор- систем распознавания голоса нужно понять, что и зачем пусах транскрибированных аудио таких, как LibriSpeech. мы хотим оптимизировать. В практических задачах требуется работать с шумными Наиболее эффективный подход к построению оценки данными, часто плохого качества (например, записи звон- качества систем распознавания голоса - привлечь к этой ков в телефонии), для которых разработанные системы задаче человека (например, на основе краудсорсинга), копоказывают существенно худшее качество. Тем не менее, торый сможет формализовать такие понятия, как ”смысл этого качества уже достаточно для того, чтобы актив- фразы передан точно”. Однако экспертная оценка стоит но внедрять автоматическое распознавание в различные дорого и требует большого количества времени и усилий приложения. Большое количество работ в данной области на проведение любого эксперимента. Поэтому в данной</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        работе мы предлагаем решение, близкое по духу к тому,
которое было применено для оценки ранжирования в
информационном поиске с помощью метрики DCG и NDCG;
и в системах автоматического перевода при переходе к
оцениванию с помощью метрики BLEU [
        <xref ref-type="bibr" rid="ref3">4</xref>
        ]. Вместо того,
чтобы привлекать экспертов к оценке каждой системы
распознавания, мы их используем один раз для обучения
модели, которая будет автоматически предсказывать
рейтинги экспертов.
проблема того, что замена слова на его синоним, будет
”стоить дорого”, а значит отображение семантических
свойств предложений все еще не отображается.
      </p>
      <p>Остальные метрики машинного перевода, являются
различными модификациями метрики BLEU и не подлежат
рассмотрению в рамках данной статьи.</p>
      <p>III. Методология сравнения метрик
Мы выяснили какую задачу должна решать метрика для
оценки качества систем распознавания речи, рассмотрели</p>
      <p>
        II. Обзор существующих метрик существующие метрики и выявили ряд основных
недоНа данный момент в задачах автоматического распо- статков. Теперь необходимо разработать новый способ
знавания речи используется метрика WER. Она является оценки, который будет лишен этих проблем.
стандартом и используется для оценки качества систем. Первая задача, которая возникает при разработке новой
Однако, несмотря на свою популярность, эта метрика метрики — формализация понятия того, что одна метрика
имеет ряд существенных недостатков. Основным из них лучше чем другая. Одним из естественных способов такой
является одинаковый вес ошибки. Как следствие, ошибки формализации является определение необходимого набора
в словах сильно искажающих смысл и ошибки в незначи- свойств, которыми должна обладать ”хорошая” метрика. В
тельных для содержания словах будут иметь одинаковые некоторых приложениях удается доказать, что такой набор
веса. свойств определяет метрику однозначно. Так, например,
На основе WER было разработано большое количество для некоторых моделей машинного обучения используют
метрик, которые также применяются в области автома- технику SHAP values [
        <xref ref-type="bibr" rid="ref14">15</xref>
        ] из теории игр. Она позволяет,
тического распознавания речи и вот некоторые из них: в некотором смысле, оптимально оценить вклад разных
расстояние Левенштейна [1], WER with embeddings [
        <xref ref-type="bibr" rid="ref9">10</xref>
        ], признаков в итоговую модель. Аналогичные идеи можно
MR-WER (Multi-Reference WER) [
        <xref ref-type="bibr" rid="ref8">9</xref>
        ], Match Error Word, использовать и при построении метрик оценки качества.
Normalized WER, WIL (Word Information Lost)[
        <xref ref-type="bibr" rid="ref6">7</xref>
        ]. Тогда критерий качества метрики формализуется так —
Эти метрики созданы в качестве альтернативы WER для любая метрика, удовлетворяющая набору свойств (по сути,
применения в более узких областях: особенности языка, аксиом). Основная цель — составить такой набор аксиом,
особенности конкретной задачи и т.д. Однако их основная что метрика, удовлетворяющая этим аксиомам,
единственидея состоит в подсчете количества ошибок. Такая же идея на. В случае прикладных задач выбор метрики — выбор
лежит и в основе WER. Таким образом, все эти метрики наиболее ”хорошего” для конкретной задачи набора
аксиобладают одинаковыми недостатками. ом.
      </p>
      <p>
        Стоит отметить, что автоматическое распознавание го- К сожалению, такой подход в общем случае не
реалилоса не единственная область машинного обучения, где зуем. Во-первых, составление списка аксиом трудная и,
используются метрики для оценки качества через сравне- во многом, субъективная задача. Во-вторых, даже имея
ние пар предложений. В машинном переводе стандартной список аксиом, построить метрику, удовлетворяющую им,
метрикой качества является BLEU (Bilingual evaluation а также доказать, что такая метрика единственна, выглядит
understudy) [
        <xref ref-type="bibr" rid="ref3">4</xref>
        ]. Но метрики машинного перевода не под- как нерешаемая задача.
ходят для задачи распознавания речи по двум причинам. Поэтому в данной статье мы предлагаем другой подход.
Во-первых, это другая задача, для которой нет одного Вместо того, чтобы математически корректно вводить
направильного ответа, в отличии от распознавания (в данной бор аксиом и доказывать, что какие-то метрики им
удоработе не рассматриваются языки, имеющие неоднознач- влетворяют, мы предлагаем сформулировать некоторую
ное орфографическое представление). Во-вторых, ни одна ”идеальную” метрику для оценки качества распознавания
метрика, использующаяся в машинном переводе, не отоб- речи. Основная цель метрики — согласованность с
челоражает отсутствие или наличие семантических различий веком в рамках конкретной задачи. Поэтому идеальной
предложений. метрикой можно назвать эксперта и подробную
инструкЗадача машинного перевода интересна тем, что в ней цию, по которой эксперт сможет однозначно сопоставить
были предприняты попытки внедрить идею передачи се- паре предложений (истинному тексту на аудио и гипотезе)
мантической составляющей в метрику. Так появилась мет- некоторую оценку качества распознавания под требования
рика NIST [
        <xref ref-type="bibr" rid="ref5">6</xref>
        ]. Она является усовершенствованной версией конкретного приложения. Тогда качество метрики в рамках
стандартной метрики BLEU, но учитывает то, что штраф определенной прикладной задачи — это мера
согласованза разные ошибки должен быть разным. Величина штрафа ности с такой ”идеальной” метрикой. Ту метрику, которая
обратно пропорциональна встречаемости ошибки. Такой лучше согласована, будем считать лучшей.
способ позволяет давать малые штрафы за мелкие ошибки Чтобы применять такой подход для оценки качества
в артиклях, а большие за ошибки в значимых словах. метрики в рамках конкретной прикладной задачи
необПри таком способе формирования штрафа хорошо видна ходимо формализовать понятие согласованности метрики
с ”идеальной”. ”Идеальная” метрика обладает одним
существенным недостатком — высокая стоимость.
Человеческий труд стоит очень дорого, поэтому использовать
его непрерывно и в больших масштабах
нецелесообразно. Воспользуемся подходом, использующимся в задачах
машинного обучения — подготовим репрезентативный
набор данных и получим значения ”идеальной” метрики
только на нем. Подготовка такого набора — отдельная и
трудная задача. В рамках данной статьи нет возможности
уделить ей необходимое внимание. Таким образом, чтобы
упорядочить метрики качества распознавания, достаточно
один раз посчитать для каждой из них меру
согласованности с ”идеальной” на фиксированном репрезентативном
наборе данных.
      </p>
      <p>
        Заметим, что в описанном процессе не формализовано
понятие согласованности. Оно связано непосредственно
с множеством значений метрики. В экспериментах,
которые будут описаны в этой статье для простоты выбрана
бинарная шкала оценивания. В таком случае в качестве
меры согласованности может быть использована любая
метрика качества модели бинарной классификации. Для
определенности мы будем использовать AUC — area under
the curve (одна из основных метрик для оценки качества
бинарной классификации [
        <xref ref-type="bibr" rid="ref2">3</xref>
        ]).
      </p>
      <p>IV. Подход к построению семейства метрик
Основной принцип построения метрики —
согласованность с ”идеальной” метрикой. Согласованность
измеряется на некотором фиксированном наборе данных,
репрезентативно представляющем конкретную предметную
область. При этом, в качестве метрики можно рассматривать
любую функцию от пары предложений. Как следствие,
новой метрикой может быть любая функция пар
предложений, однозначно описывающаяся некоторым набором
параметров. Тогда задача построения новой метрики
сводится к выбору модели, сбору данных для обучения этой
модели и, собственно, обучения.</p>
      <p>
        В качестве базовой модели была выбрана модификация
стандартной метрики WER. Как и в метрике для
машинного перевода NIST [
        <xref ref-type="bibr" rid="ref5">6</xref>
        ] попробуем усовершенствовать
функцию штрафа, рассмотрев произвольную функцию от
пар слов, характеризующуюся набором параметров.
      </p>
      <p>Формально можно записать ее следующим образом:</p>
      <p>MERa = min σ ( E(wi,wj)∼ DˆQ(wi, wj)) ,</p>
      <p>)
где</p>
      <p>x
σ(x) = 1 +eex — сигмоидальная функция,</p>
      <p>E(wi,wj)∼ Dˆ — эмпирическое математическое ожидание
(по парам слов (wi, wj)),</p>
      <p>Q(u, v) — стоимость замены слова u на слово v.</p>
      <p>Минимум берется по всем ”выравниваниям”
предложений. Под ”выравниванием” подразумеваем следующее —
каждому слову из первого предложения ставим в
соответствие слово из второго (что соответствует замене) или
пустое слово (что соответствует удалению). Если во
втором предложении остались слова без пары, им в
соответствие ставится пустое слово (что соответствует операции
вставки). Таким образом, пара предложений однозначно
представляется в виде пар слов, некоторые из которых
могут быть пустыми.</p>
      <p>В результате получается семейство метрик MERa
(Meaning error rate), где каждый элемент семейства
задается своей функцией стоимости.</p>
      <p>Далее рассмотрим базовый пример стоимостной
функции, который был реализован.</p>
      <p>V. Стоимость исправления смысловой ошибки
В качестве функции стоимости можно рассматривать
абсолютно любую функцию. Для базовой реализации
используем линейную функцию от выбранных признаков для
пары слов.</p>
      <p>Выбор признаков, а также данные для обучения модели
являются ключевыми элементами процесса построения
новой метрики. Основная сложность заключается в том,
что во многом эти составляющие взаимосвязаны и выбрать
признаки, которые наиболее точно будут отображать
влияние на итоговый смысл фразы очень сложно без данных,
репрезентативно представляющих предметную область.
Как уже было ранее отмечено, сбор такого набора данных
является отдельной крайне трудоемкой задачей и выходит
за рамки этой статьи. В связи с этим, выбор признаков
был основан на некоторых эмпирических предположениях
о важности с точки зрения совпадения по смыслу, однако
в дальнейшем этот список можно и нужно расширить
и возможно найти более значимые. Выбранный набор
признаков в таблице I.</p>
      <p>Таблица I
Описание признаков
Признак
совпадает словарная форма слова
исходное слово — ”нет”
распознанное слово — ”нет”
слова полностью совпадают
исходное слово — ”не”
распознанное слово — ”не”
исходное слово — ”да”
распознанное слово — ”да”
По сути, функция, которую мы строим, соответствует
некоторой модели бинарной классификации (в базовой
реализации — линейной). Модель обладает некоторым
набором параметров, которые заранее не известны, а
значит, их нужно как-то оценить (для линейной — набор
коэффициентов при признаках).</p>
      <p>VI. Оценка параметров
1) Подготовить обучающее множество. В качестве
наблюдений в нашей задаче выступают пары
(распознанный текст, исходный текст на аудио), а в
качестве целевой переменной — оценка эксперта о
том, насколько точно предсказание передает смысл
текста. В наших экспериментах мы использовали
бинарные предсказания, но в дальнейшем можно
легко добавить вероятностные предсказания.
2) Метод оценки, по сути, функция, которую мы
строим, соответствует некоторой модели бинарной
классификации (в базовой реализации — линейной).
Модель обладает некоторым набором параметров,
которые заранее не известны, а значит их нужно
както оценить (для линейной — набор коэффициентов
при признаках).</p>
      <p>VI-A. Данные</p>
      <p>В качестве набора обучающих данных были собраны
результаты распознавания голоса нескольких облачных
сервисов компаний Яндекс и Google. Исходные аудио
были собраны на основе реального набора данных
телефонии (полученные результаты распознавания доступны
по ссылке https://github.com/gordeeva-ln/MERa).</p>
      <p>Собранный набор данных представляет из себя
множество пар — исходный текст аудио и текст, распознанный
одним из указанных выше сервисов.</p>
      <p>Далее на его основе создали задание для сервиса
Яндекс.Толока, в которой попросили людей (экспертов)
разметить пары собранного набора данных на два класса. К
первому классу относятся предложения, совпадающие по
смыслу, ко второму — различающиеся. Заметим, что не
для любой пары предложений можно однозначно
установить, к какому классу нужно ее отнести. Поэтому каждая
пара была отправлена одновременно трем пользователям.
Таким образом, был собран набор данных,
использующийся для эксперимента и содержащий в себе около 5000
размеченных пар.</p>
      <p>VI-B. Оценка параметров</p>
      <p>
        Наша задача свелась к стандартной логистической
регрессии. Для оценки оптимальных параметров необходимо
найти минимум логистической функции потерь.
Сложность задачи заключается в том, что стандартные методы
оптимизации применять не получается, т.к. оптимальное
выравнивание зависит от параметров, которые мы
оцениваем, а методы непрерывной оптимизации можно
использовать только при фиксированном выравнивании. Поэтому
мы используем некоторый аналог EM-алгоритма [
        <xref ref-type="bibr" rid="ref1">2</xref>
        ], на
каждой итерации сначала фиксируем оптимальное
выравнивание при текущей оценке параметров, затем обновляем
оценку параметров с помощью градиентного спуска, затем
снова пересчитываем оптимальное выравнивание.
      </p>
      <p>VI-C. Представление данных</p>
      <p>Чтобы пояснить дальнейшие рассуждения, введем
несколько вспомогательных обозначений:
• Один элемент обучающего множества — пара
пред</p>
      <p>ложений.
• В процессе подсчета метрики MERa для каждой пары
предложений получаем набор пар слов. Метрика для
Обозначение
X
ytrain
ypred
Q
U
S
C</p>
      <p>Таблица II
Используемые обозначения
Описание
исходные данные (набор пар предложений)
ответы асессоров
(0 если смысл одинаковый, 1 если разный)
значение метрики для пары предложений
функция стоимости для пары слов
матрица признаков для уникальных
(внутри датасета) пар
вектор значений score на соответствующих
уникальных парах
матрица, в которой элемент (i, j)
соответствует количеству раз, которое
уникальная пара под номером j встречается
в паре предложений под номером i
пары предложений — среднее значение Q на парах
слов — поэтому порядок слов не важен (важен лишь
набор пар).
• Составляем список уникальных пар по всему набору
данных и представляем каждый элемент исходных
данных как вектор, где каждый элемент равен
количеству раз, которое соответствующая уникальная
пара встречается в множестве пар для этой пары
предложений (матрица C).
• Таким образом, получаем равенство ypred = CS.</p>
      <p>Такое представление данных удобно в контексте
используемого алгоритма.</p>
      <p>VI-D. Алгоритм
1) Выбираем некоторую начальную модель,
предсказывающую метрику для пары слов. В случае модели,
являющейся линейной функцией, достаточно задать
набор стартовых весов (можно выбирать случайно).
2) Разбиение на пары:
Согласно текущей модели, для каждой пары
предложений получаем оптимальное (минимально
возможное) значение метрики при наилучшем
возможном ”выравнивании” (разбиении на пары слов) и
соответствующее разбиение. Затем получаем
матрицы C, S и U . Оптимальное выравнивание ищется
с помощью динамического программирования,
аналогичного динамическому программированию для
вычисления WER, с той лишь разницей, что вес
удаления, вставки и замены одного слова на другое
вычисляется с помощью модели, а не является
константным.
3) Шаг градиентного спуска:
Посчитать производную функции потерь
непосредственно по параметрам модели может быть
достаточно сложно, поэтому возьмем производную по S. При
помощи представления ypred = CS производную по
S посчитать легко.
Обучим новую модель, которая по U (уникальным
парам) будет предсказывать направление
градиентного спуска по S и добавим ее к существующей.
4) Повторяем шаги 2-3 пока алгоритм не начнет
переобучаться.</p>
      <p>VII. Эксперименты
На основе предложенной модели и собранных данных
был проведен набор экспериментов. Полученные
коэффициенты при выбранных параметрах линейной модели в
таблице1.</p>
      <p>Анализируя полученные коэффициенты, можно
сделать несколько выводов. Во-первых, в основном значения
очень малы. Такого результата можно было ожидать, так
как выбор признаков был сделан не исходя из
экспериментов, а исходя из интуитивных представлений. Вторая
причина в том, что в качестве данных были выбраны
реальные распознавания голоса. Ошибки, с которыми не
справляются существующие на данный момент метрики
и которые при этом можно описать в виде признаков от
пар слов, встречаются крайне редко, но именно на такие
ошибки метрика должна реагировать. Поэтому так важно
и для обучения, и для сравнения метрик между собой
собрать подробный репрезентативный набор данных. В
рамках данной работы, не было задачи показать
насколько сильное влияние оказывают выбранные признаки.
Вовторых, наибольший положительный вес имеет признак,
отвечающий за полное совпадение слов. По полученным
выводам нельзя судить о значимости признаков, они всего
лишь отражают данные, на которых модель обучалась.</p>
      <p>Стоит отметить, что до сих пор про признаки было
сказано только то, что корректно выбрать их можно после
тщательного анализа данных, но как этот анализ
проводить и как выделять признаки — отдельная задача.</p>
      <p>Теперь переходим к оценке и попытаемся предсказать
для пары предложений эквивалентны они по смыслу
или нет. Для текущего набора коэффициентов результаты
представлены в таблице III.</p>
      <p>
        Таблица III
Сравнение метрик. Для сравнения качества использовался AUC[
        <xref ref-type="bibr" rid="ref2">3</xref>
        ]
Метрика AUC
WER 0.69
Расстояние Левенштейна 0.63
Лемматизированный WER (LER) 0.67
      </p>
      <p>MERaLM 0.77
Можем заметить, что MERaLM действительно показала
лучшее качество по сравнению с предыдущими метриками
(WER, Расстояние Левенштейна) по основным
характеристикам. Метрика LER, по сути, является частным случаем
метрики MERaLM с единственным признаком —
словарной формой слова. Тот факт, что LER показал результаты
хуже, чем MERaLM говорит о том, что одного
признака недостаточно. Но комбинация с другими, пусть даже
незначительными признаками дает значительный прирост
в качестве.</p>
      <p>1https://github.com/gordeeva-ln/MERa/Коэффициенты.pdf
Таким образом, мы показали, что с помощью методов
машинного обучения и правильной подготовки признаков
можно отлавливать потери смысла. Разумеется данная
конкретная модель не является оптимальной. Большее число
признаков и более качественные методы обучения
позволяют получать лучшие результаты. Но, наборы признаков
будут зависеть от конкретной задачи и данных и наша цель
была показать работоспособность подхода, с чем такой
простой пример успешно справился.</p>
      <p>VIII. Направление для дальнейших исследований
В данной работе мы предложили подход к построению
семейства метрик. В качестве примера мы рассмотрели
простую линейную модель, обобщающую метрику WER.
Несмотря на тот факт, что в качестве модели выбран
наиболее простой вариант, набор признаков выбран не
оптимально, а на основе эмпирических предположений, нам
удалось показать, что даже на таком наборе параметров
существующие метрики оказываются хуже.</p>
      <p>
        • В анализе естественного языка наилучшее качество
в обширном спектре задач показывают нейросетевые
модели на основе BERT [
        <xref ref-type="bibr" rid="ref11">12</xref>
        ] и XLNet [
        <xref ref-type="bibr" rid="ref16">17</xref>
        ]. Модели
на основе нейронных сетей сложно интерпретировать,
но для ситуации, когда требуется только
предсказывать вероятность того, что распознавание передает
смысл предложения, такие модели должны
показывать очень хороший результат.
• Достоинство предложенной метрики MERa—
хорошая интерпретируемость. Однако в рамках данной
статьи она была использована в качестве
демонстрации работы нового подхода и во многом нуждается в
улучшениях. Для последующего использования,
необходимо пересмотреть набор признаков и выбранную
моделей для оценки параметров.
• Сбор данных для обучения метрики является одной
из ключевых задач. От того, насколько полно данные
описывают ситуации, которые важно распознать как
одинаковые или разные по смыслу, зависит качество
работы метрики. В зависимости от той предметной
области, в которой метрика будет использована, этот
набор данных окажется своим и всегда можно будет
дообучиться.
      </p>
      <p>IX. Заключение
В рамках этой статьи мы по-новому взглянули на
метрики для задачи автоматического распознавания голоса и
обнаружили, что существующие варианты не удовлетворяют
базовым понятиям релевантности для данной задачи. Мы
предложили новый подход, который, несмотря на свою
простоту, позволяет отобразить насколько передает
метрика информацию об эквивалентности гипотезы и исходного
текста по смыслу. В качестве демонстрации применения
этого подхода было предложено новое семейство метрик,
которое строится на основе оценки передачи смысла.
Проведенный эксперимент показал, что метрика из этого
семейства, реализованная на основе линейной модели
оказывается лучше старых согласно нашему методу оценки
качества метрик.</p>
      <p>Список литературы</p>
    </sec>
    <sec id="sec-2">
      <title>Liudmila Gordeeva</title>
      <p>ITMO University</p>
    </sec>
    <sec id="sec-3">
      <title>Vasily Ershov</title>
      <p>Yandex</p>
    </sec>
    <sec id="sec-4">
      <title>Igor Labutin</title>
      <p>Yandex / SPb HSE
lulu.gordeeva07@gmail.com</p>
    </sec>
    <sec id="sec-5">
      <title>Igor Kuralenok</title>
      <p>Yandex / JetBrains Research</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Dempster</surname>
            ,
            <given-names>A. P.</given-names>
          </string-name>
          / Laird,
          <string-name>
            <given-names>N. M.</given-names>
            /
            <surname>Rubin</surname>
          </string-name>
          ,
          <string-name>
            <surname>D. B.</surname>
          </string-name>
          (
          <year>1977</year>
          ):
          <article-title>Maximum likelihood from incomplete data via the EM algorithm1-38.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Bradley</surname>
            ,
            <given-names>Andrew P.</given-names>
          </string-name>
          (
          <year>1997</year>
          ):
          <article-title>The Use of the Area under the ROC Curve in the Evaluation of Machine Learning Algorithms</article-title>
          ,
          <volume>7</volume>
          :
          <fpage>1145</fpage>
          -
          <lpage>1159</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Papineni</surname>
          </string-name>
          , Kishore / Roukos, Salim / Ward, Todd / Zhu, Wei
          <string-name>
            <surname>Jing</surname>
          </string-name>
          (
          <year>2002</year>
          ):
          <article-title>Bleu: a Method for Automatic Evaluation of Machine TranslationIn: Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics311-318.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Järvelin</surname>
          </string-name>
          , Kalervo / Kekäläinen, Jaana(
          <year>2002</year>
          )
          <article-title>: Cumulated Gain-Based Evaluation of</article-title>
          IR Techniques,
          <volume>4</volume>
          :
          <fpage>422</fpage>
          -
          <lpage>446</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Lin</surname>
          </string-name>
          , Chin Yew / Och, Franz
          <string-name>
            <surname>Josef</surname>
          </string-name>
          (
          <year>2004</year>
          )
          <article-title>: Automatic Evaluation of Machine Translation Quality Using Longest Common Subsequence</article-title>
          and
          <string-name>
            <surname>Skip-Bigram</surname>
            <given-names>StatisticsIn</given-names>
          </string-name>
          :
          <article-title>Proceedings of the 42nd Annual Meeting on Association for Computational Linguistics605-es.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Morris</surname>
          </string-name>
          , Andrew Cameron / Maier, Viktoria / Green, Phil(
          <year>2004</year>
          )
          <article-title>: From WER and RIL to MER and WIL: improved evaluation measures for connected speech recognition2765-2768.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Chan</surname>
          </string-name>
          , William / Jaitly, Navdeep / Le, Quoc V. / Vinyals, Oriol(
          <year>2015</year>
          ): Listen, Attend and Spell.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Ali</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          / Magdy, W. / Bell, P. / Renais,
          <string-name>
            <surname>S.</surname>
          </string-name>
          (
          <year>2015</year>
          )
          <article-title>: Multi-reference WER for evaluating ASR for languages with no orthographic rulesIn: 2015</article-title>
          <source>IEEE Workshop on Automatic Speech Recognition and Understanding (ASRU</source>
          )
          <fpage>576</fpage>
          -
          <lpage>580</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Le</surname>
          </string-name>
          , Ngoc Tien / Servan, Christophe / Lecouteux, Benjamin / Besacier, Laurent(
          <year>2016</year>
          )
          <article-title>: Better Evaluation of ASR in Speech Translation Context Using Word EmbeddingsIn:</article-title>
          <year>Interspeech 2016</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [11]
          <string-name>
            <surname>Pratap</surname>
          </string-name>
          , Vineel / Hannun, Awni / Xu, Qiantong / Cai, Jeff / Kahn, Jacob / Synnaeve, Gabriel / Liptchinsky, Vitaliy / Collobert, Ronan(
          <year>2018</year>
          )
          <article-title>: wav2letter++: The Fastest Open-source Speech Recognition System</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Devlin</surname>
          </string-name>
          , Jacob / Chang, Ming Wei / Lee, Kenton / Toutanova, Kristina(
          <year>2019</year>
          )
          <article-title>: BERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingIn: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies</article-title>
          , Volume
          <volume>1</volume>
          (Long and Short Papers)
          <fpage>4171</fpage>
          -
          <lpage>4186</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Synnaeve</surname>
          </string-name>
          , Gabriel u.a.(
          <year>2019</year>
          ):
          <article-title>End-to-end ASR: from Supervised to Semi-Supervised Learning with Modern Architectures</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Li</surname>
          </string-name>
          , Jason / Lavrukhin, Vitaly / Ginsburg, Boris / Leary, Ryan / Kuchaiev, Oleksii / Cohen, Jonathan M. / Nguyen, Huyen / Gadde, Ravi
          <string-name>
            <surname>Teja</surname>
          </string-name>
          (
          <year>2019</year>
          ):
          <article-title>Jasper: An End-to-End Convolutional Neural Acoustic Model</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Lundberg</surname>
            ,
            <given-names>Scott M</given-names>
          </string-name>
          / Lee, Su In (
          <year>2017</year>
          )
          <article-title>: A Unified Approach to Interpreting Model Predictions</article-title>
          . In: Guyon,
          <string-name>
            <surname>I.</surname>
          </string-name>
          / Luxburg, U. V. / Bengio, S. / Wallach, H. / Fergus, R. / Vishwanathan, S. / Garnett,
          <string-name>
            <surname>R.</surname>
          </string-name>
          (Hg.),
          <source>Advances in Neural Information Processing Systems</source>
          <volume>30</volume>
          .Curran Associates, Inc.:
          <fpage>4765</fpage>
          -
          <lpage>4774</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [16]
          <string-name>
            <surname>Mohamed</surname>
          </string-name>
          , Abdelrahman / Okhonko, Dmytro / Zettlemoyer, Luke (
          <year>2019</year>
          )
          <article-title>: Transformers with convolutional context for ASR .</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [17]
          <string-name>
            <surname>Yang</surname>
          </string-name>
          , Zhilin / Dai, Zihang / Yang, Yiming / Carbonell, Jaime / Salakhutdinov, Russ R / Le, Quoc V (
          <year>2019</year>
          )
          <article-title>: XLNet: Generalized Autoregressive Pretraining for Language Understanding</article-title>
          . In: Wallach, H. / Larochelle, H. / Beygelzimer, A. / Alché Buc, F.d'/ Fox, E. / Garnett,
          <string-name>
            <surname>R.</surname>
          </string-name>
          (Hg.),
          <source>Advances in Neural Information Processing Systems</source>
          <volume>32</volume>
          .Curran Associates, Inc.:
          <fpage>5754</fpage>
          -
          <lpage>5764</lpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>