<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Представление новостных сюжетов с помощью событийных фотографий</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>© M.M. Postnikov</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Lomonosov Moscow State University, Faculty of Computational Mathematics and Cybernetics</institution>
          ,
          <addr-line>Moscow</addr-line>
          ,
          <country country="RU">Russia</country>
        </aff>
      </contrib-group>
      <fpage>359</fpage>
      <lpage>366</lpage>
      <abstract>
        <p>The task of annotating a news story with images associated with specific texts is discussed in the article. The definition of “event photography” containing specific information supplementing text of a story is introduced. Neural networks (Inception v3) are used to solve a task for a special marked collection of 4114 images using the transfer learning method. The average precision of the results is more than 94.7%.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Распространение интернета, социальных сетей,
развитие носимой электроники, внедрение хороших
камер в каждый мобильный телефон – благодаря
всем этим факторам, но не ограничиваясь ими,
интернет становится главным источником новостей
для современного человека, в то время как
телевидение и печатные средства массовой
информации постепенно уходят на второй план. С
развитием технологий растут и скорость
распространения информации, и ее количество.</p>
      <p>Иллюстрации несут значительную часть
информации, иногда даже большую, чем
иллюстрируемый текст.</p>
      <p>В данной работе рассмотрена задача определения
изображений, «полезных» для понимания новостных
сообщений, иллюстрируемых ими. Как известно,
новостные сообщения прежде всего содержат
информацию о некотором событии и должны
отвечать на вопрос: «Что произошло?».
Труды XIX Международной конференции
«Аналитика и управление данными в областях с
интенсивным использованием данных»
(DAMDID/ RCDL’2017), Москва, Россия, 10–13
октября 2017 года</p>
      <p>Для ответа на общий вопрос обычно требуется
ответить на совокупность частных вопросов: «Кто?
Где? Когда? Каким образом?» и т. д. Важно
научиться отличать полезные изображения от тех,
которые не несут важной конкретной информации
(см. Рис. 1).</p>
      <p>В рамках данной работы событийной
фотографией будем называть изображение,
используемое для иллюстрации новости, для
которого выполняются следующие требования:</p>
      <p>а) изображение соответствует тексту новостной
статьи;</p>
      <p>б) изображение является фотографией с места
событий или могло бы ей быть (подразумевается
событие, описываемое в новостной статье).</p>
      <p>Например, фотографии с футбольного матча,
места происшествия или встречи глав государств с
соответствующими новостными текстами являются
событийными. Если же на фотографии изображены
логотип, рекламный баннер, вывеска, изображение
взято из фотобанка или фотография не соответствует
новости,
тогда
данная
иллюстрация
не
будет
считаться событийной.</p>
      <p>Задача
является
актуальной
при
создании
новостных агрегаторов по большому количеству
источников.</p>
      <p>Большой интерес для исследования представляют
социальные
свидетельств
сети
–</p>
      <p>огромное
очевидцев
в
первую
количество
очередь
публикуется в социальной сети, а затем уже может
найти свое отражение в СМИ.</p>
      <p>Идея работы состоит в том, чтобы попробовать
выделить
ключевые
объекты
на
изображении,
сопоставить их с текстом
и достичь
желаемого
результата.
⁡{( 1,  1,  1), … , (  ,   ,   )}.</p>
      <p>Будем также считать, что задана неотрицательная
целочисленная функция потерь  ( ,  ), которая
показывает, насколько отличается предсказанное
классификатором значение  от истинного значения.</p>
      <p>Обучающую
выборку
Ω
разделим
на</p>
      <p>две
˜
непересекающиеся коллекции:
• тренировочную
(используется для обучения</p>
      <p>˜
Ω⁡ = ⁡   ⁡ × ⁡  ⁡× ⁡   ⁡ =
модели)
⁡Ω</p>
      <p>= ( 1,  1,  1), … , (  ,   ,   );
• тестовую (используется для оценивания модели)
Ω</p>
      <p>= (  +1,   +1,   +1), … , ( |Ω|,  |Ω|,  |Ω|).</p>
      <p>Задача классификации состоит в нахождении
функции  ∗ =  (  ,   ):</p>
      <p>∗ = argmin⁡ ( (  , 
 ),   ), (

,   ,   )∈ ⁡ Ω ,
которая называется классификатором. Значение  ∗
может быть вещественным из диапазона [0;1], его
можно считать вероятностью того, что изображение
является событийным.</p>
      <p>Решение
задачи
можно</p>
      <p>рассматривать как
решение следующих трех подзадач.
2.1 Детектор объектов
На этапе
обработки
изображения
построим
модель, которая принимает на вход изображение, а
возвращает
вектор
вероятностей
присутствия
определенных объектов на изображении.
Рисунок 2 Пример изображения для детектирования
объектов</p>
      <p>Например, пусть на вход подается следующее
изображение (см. Рис. 2). Пусть рассматривается
присутствие
автомобиль,
следующих
человек,</p>
      <p>классов:
домашнее
мотоцикл,
растение,
велосипед, автобус, поезд, птица, лодка, лошадь,
самолет, бутылка, телевизор, кресло, собака, кот,
стол, кровать, корова, овца. Результатом работы
время события. Однако некоторые фотографии могут
содержать
не главные
объекты, но
окружение,
которое, вообще говоря, не является специфичным
именно для конкретного события (типа события).</p>
      <p>
        В статье [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] приведены данные, что качество
распознавания конкретных событий по размеченным
коллекциям в настоящее время имеет следующие
характерные оценки (на коллекции WIDER [
        <xref ref-type="bibr" rid="ref21">21</xref>
        ], 60
классов, 60 000 изображений): 42%
корректных
ответов среди первых, 60% – среди первых пяти.
      </p>
      <p>Таким образом, пока нет возможности с высокой
степенью
определения
использовать
изображений.</p>
      <p>уверенности
опереться
на</p>
      <p>методы
типа
события
по</p>
      <p>изображению,
методы
При</p>
      <p>
        порождения
этом
в
[
        <xref ref-type="bibr" rid="ref19">19</xref>
        ]
      </p>
      <p>описания
определена
характеристика «важности» того или иного типа
объекта для описания того или иного типа события,
например,
изображение
местных
достопримечательностей для альбома о путешествии
или изображения невесты и жениха для фотоальбома
о свадьбе.</p>
      <p>
        Авторы
[
        <xref ref-type="bibr" rid="ref19">19</xref>
        ]
предлагают
выделять
наиболее важные объекты путем выявления среднего
по большому количеству изображений о событиях
одного типа.
4 Модели
Для
построения
детектора
объектов
на
изображении
используется
комбинация
из двух
моделей. Первая из них – обученная на большом
объеме
изображений
сверточная
нейросеть,
используемая для извлечения вектор-признаков с
изображения.
      </p>
      <p>Вторая
модель
–
это
основной
классификатор, который преобразует полученные
вектор-признаки
первой</p>
      <p>модели в нужные нам
«вероятностные» признаки.</p>
      <p>Нейронная сеть – широко используемый метод
машинного
результаты
обучения,</p>
      <p>показывающий
в
анализе
изображений,
отличные
текстов,
распознавании речи и других областях. В последнее
время
сверточные
нейронные
сети
получили
большое распространение, и эта область машинного
обучения сейчас активно развивается.</p>
      <p>На
вход
первой
нейронной
сети
изображение, на
выходе</p>
      <p>получается
вектор-признак, который далее подается на вход
основному классификатору.
4.1 Логистическая регрессия
где   – вес j-го признака,  0 – порог принятия
= ( 0,  1, … ,   )– вектор весов, ⟨ ,  ⟩ –
произведение
признакового
описания
объекта на вектор весов. Считается, что  0( )= −1,
 ( )=
∑ln(1 +  xp−  ∗⟨  , ⟩)→ min.</p>
      <p />
      <p>Результаты
объединяются в один вектор.</p>
      <p>этих
4.2 Градиентный бустинг
моделей
затем
Градиентный</p>
      <p>бустинг – метод машинного
алгоритм, последовательно строит базовые модели
так, что каждая следующая улучшает качество всего
ансамбля. Градиентный бустинг деревьев решений
строит модель в виде суммы деревьев:
 ( )= ℎ0 +
∑</p>
      <p>ℎ( ;   ),

 =1
где ℎ0 – некоторое начальное приближение,   ∈  –
параметр,
регулирующий
скорость
обучения и
влияние отдельных деревьев на всю модель, ℎ ( ;   )
– базовый алгоритм с вектором параметров   .</p>
      <p>=</p>
      <p>∑(  ,   (  ))→ min – некоторая функция
потерь.</p>
      <p>Модели обучаются на вектор-признаках – выходе
первой нейронной сети.</p>
      <p>Аналогично
классификатору,</p>
      <p>использующему
логистическую</p>
      <p>
        регрессию, рассматривается набор
моделей
градиентного
бустинга –
по
одной
на
каждый класс. Реализация градиентного бустинга
берется из библиотеки sklearn с параметрами по
умолчанию [
        <xref ref-type="bibr" rid="ref10 ref12">10, 12</xref>
        ]. Результаты этих моделей так же
объединяются в один вектор.
Рисунок 3 Схема потока данных обучения моделей
4.3 Нейронная сеть
      </p>
      <p>Рассмотрим нейросеть, на вход которой подается
вектор-признак с первой нейросети, а на выходе
нашей задачи (при повышении оценки для одного
класса все остальные занижаются). Нами последний
слой был заменен на Sigmoid, так как решается задача
многозначной классификации.
5.1 Обработка изображения</p>
      <p>Для представления изображения в виде вектора
используются модели, описанные в п. 4.1. Для
данного преобразования применяется метод,
называемый переносом обучения (transfer learning).</p>
      <p>
        Перенос обучения – метод, позволяющий
применить знания, полученные в процессе решения
одной задачи, для решения другой схожей задачи.
Например, можно взять уже предобученную на
большом объеме данных нейронную сеть и
дообучить ее на своих данных. Применение данного
метода обычно позволяет сэкономить большое
количество ресурсов (как времени, так и
вычислительных ресурсов). В данной работе в
качестве предобученной модели использована
Inception v3, обученная для ImageNet Large Visual
Recognition Challenge на данных 2012 года [
        <xref ref-type="bibr" rid="ref14">14</xref>
        ].
      </p>
      <p>В случае обработки изображений берется первая
модель (предобученная нейросеть), на вход которой
подается изображение. Затем из этой сети
извлекается некоторый слой, который и будет
являться промежуточным векторным
представлением нашего изображения. Данный слой
обычно содержит большое количество признаков,
помогающих решать задачу классификации. Далее
этот слой подается на вход уже второй модели
(линейной регрессии, градиентному бустингу или
другой нейронной сети). На выходе мы получаем
вектор вероятностей присутствия объектов для
каждого из классов.
5.2 Обработка текста</p>
      <p>Для представления текста в векторном виде
используется TF-IDF. Для каждого документа из
коллекции его исходный текст токенизируется, а
токены приводятся в начальную форму. Затем
считается подокументная частотность
преобразованных токенов и вычисляется TF-IDF
вектор для каждого документа.
5.3 Объединение текста и изображений</p>
      <p>Результаты обработки коллекции новостей с
изображениями по пп. 5.1 и 5.2 подаются на вход
нейросети, которая комбинирует полученную
информацию с двух входов и возвращает число в
диапазоне от 0 до 1 – вероятность того, что
изображение подходит для иллюстрации текста.
Нами проверено, влияет ли использование
текстовых признаков на качество определения
фотографии как событийной или же достаточно
использования только признаков, выделенных на
изображении.
6 Исходные данные</p>
      <p>В качестве данных для обучения и отладки
моделей были использованы как готовые наборы
данных, так и специально собранные для решения
поставленной задачи.
6.1 CIFAR-10</p>
      <p>
        CIFAR-10 – это коллекция размеченных
изображений, взятых из другого набора данных
подназванием «80 million tiny images» [
        <xref ref-type="bibr" rid="ref16">16</xref>
        ].
      </p>
      <p>Описание коллекции:
• 60000 размеченных изображений;
• 10 классов, 6000 изображений на класс (самолет,
автомобиль, птица, кошка, олень, собака,
лягушка, лошадь, корабль, грузовик);
• размер изображений фиксированный, 32х32;
• один класс на одном изображении.
6.2 Pascal VOC2012</p>
      <p>
        Pascal VOC2012 – это коллекция размеченных
изображений, которые были собраны для
соревнования по распознаванию и классификации
объектов [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ].
      </p>
      <p>Описание коллекции:
• 11540 размеченных цветных изображений;
• 20 классов, в среднем по 577 изображений на
класс (мотоцикл, автомобиль, человек, домашнее
растение, велосипед, автобус, поезд, птица,
лодка, лошадь, самолет, бутылка, телевизор,
кресло, собака, кот, стол, кровать, корова, овца);
• размер изображений не фиксирован, но</p>
      <p>максимальная длина сторон – 500 пикселей;
• не менее одного класса на изображении.
6.3 Коллекция изображений на базе ImageNet</p>
      <p>
        Для обучения детектора объектов нужно
просмотреть новостные иллюстрации, понять, какие
объекты там чаще всего встречаются, и собрать
собственную коллекцию для обучения. Нами
выделено 38 классов объектов, которые чаще всего
встречаются в новостных иллюстрациях, и для них
была собрана коллекция изображений на базе
ImageNet [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ].
      </p>
      <p>Описание коллекции:
• 62357 размеченных цветных изображений;
• 38 классов, в среднем по 1640 изображений на
класс (воздушная техника, животное, баннер,
лодка, здание, церковь, концерт, конструкция,
толпа, документ, электронное устройство,
огонь/дым, флаг, еда, в помещении, военная
воздушная техника, военный транспорт, гора,
нефтегазовые строения, картина, человек,
растение, общественный транспорт, дорога,
корабль, снаружи, солдат, космический корабль,
спикер, транспорт специальных служб, спорт,
деловой костюм, телекамера, служебная форма,
транспорт, военный корабль, вода, оружие);
• размер изображений не фиксирован;
• не менее одного класса на изображении.
6.4 Коллекция новостей</p>
      <p>В качестве обучающей коллекции для
определения событийной фотографии был собран
набор новостей, содержащий 4114 примеров. В
результате разметки получилось 3100 позитивных и
1014 негативных примеров событийных фотографий.
Таблица 1 Значение AP для 4 моделей на наборе данных Pascal VOC2012
ь
т
а
в
о
р
К
о
л
с
е
р
К
д
з
е
о
П
а
в
о
р
о
К
а
к
л
ы
т
у
Б
к
е
в
о
л
е
Ч
7.1 Выбор модели для обработки изображений</p>
      <p>
        В качестве основной метрики была использована
AP (average precision), определенная в статье [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ] и
вычисляемая по следующей формуле:
 = 1 ∑   ( ),
11  ∈{0,0.1,...,1}
˜
  ( )= m˜:  ˜a≥x⁡ ( )– интерполяция точности, где
      </p>
      <p>˜
 ( ) – это измеренное значение точности для</p>
      <p>˜
значения полноты  , p(x) – кривая «точность–
полнота».</p>
      <p>
        Сравнения качества моделей на наборе данных
Pascal VOC2012 отображено в таблице1. Здесь также
приведены значения AP для модели HCP-2000C [
        <xref ref-type="bibr" rid="ref20">20</xref>
        ]
на конкурсном тестовом множестве (не на том,
который был использован для сравнения моделей 1–
3).
      </p>
      <p>Из полученных оценок можно сделать вывод, что
нейронная сеть с текущими параметрами лучше
подходит для решения поставленной задачи, в
дальнейшем будем рассматривать ее как основную
модель.
Рисунок 4 Зависимость значения функции потерь от
итерации
На графике (см. Рис. 4) можно наблюдать, как
сходится функция потерь нейросетевой модели на
различных наборах данных. Поведение функций
довольно похожее, но на Pascal VOC2012 при более
медленной сходимости достигается лучшее качество.
Графики MAE (средней абсолютной ошибки) ведут
себя одинаковым образом (см. Рис. 5).
Рисунок 5 Зависимость значения MAE от итерации
7.2 Обучение модели на собственном наборе
данных</p>
      <p>Убедившись, что модель работает и показывает
хорошие результаты на готовых наборах данных,
нужно перейти к следующему этапу – обучению
модели на собственной коллекции.
7.3 Применение моделей к новостям</p>
      <p>Для этого обучается модель согласованности,
которая по входным данным определяет, является
изображение событийным или нет.</p>
      <p>Обучим две модели, одна из которых принимает
на вход одно лишь векторное представление
изображения, а другая принимает на вход, помимо
прочего, векторное представление
соответствующего новостного текста. Во второй сети
каждый из двух векторов входа преобразуется в
вектор общей длины, затем конструируется новый
вектор, получающийся конкатенацией
поэлементного умножения и поэлементного
сложения предыдущих слоев. Финальный слой
каждой сети – Softmax. На выходе нейросети
получаем два значения  1,  2 в интервале [0;1],
первое из которых – вероятность того, что
изображение не является событийным для этой
фотографии, а второе – что является ( 1 +  2 = 1).
Для обучения нейронной сети использована</p>
      <p>˜ ˜
следующая функция потерь:  ( ,  )= −( ⁡log⁡ +</p>
      <p>˜
(1 −  )log(1 −  ))– софтмакс кросс-энтропия.</p>
      <p>На Рис. 6 показаны графики значения функции
потерь для каждой из двух моделей. Отметим, что
модель, использующая текст, имеет склонность к
переобучению после ~1500 итераций.
Рисунок 6 Зависимость значений средней точности
для различных моделей на тестовых данных
7.4 Результаты</p>
      <p>Следующие шаги после обучения детектора – его
применение к новостным изображениям, получение
векторного представления изображений и перевод
текстов в векторную форму. Примеры работы
программы изображены на Рис. 7 и 8.
Рисунок 7 Пример работы программы
Рисунок 8 Пример работы программы
8 Интерпретация результатов</p>
      <p>В работе исследован метод ранжирования
изображений для иллюстрации новостного сюжета, а
именно, выявления изображений, которые с большей
вероятностью содержат информацию, дополняющую
текстовое сообщение. Представлен метод с
использованием переноса обучения результатов</p>
      <p>Inception v3, когда несколько последних слоев
обученной нейронной сети заменяются
специфическим классификатором для исследуемой
коллекции изображений.</p>
      <p>В проведенных экспериментах специфический
классификатор на основе нейронных сетей несколько
превзошел логистическую регрессию и градиентный
бустинг (однако для практических целей данные
методы также можно использовать).</p>
      <p>На коллекции из 4114 изображений (из них 3100
событийных), размеченной одним из авторов,
достигнут результат 93,2% средней точности при
обучении только по изображениям и 94,7% при
использовании текстовой информации.</p>
      <p>Целью дальнейших исследований являются
применение более сложных и современных моделей
классификации, введение дополнительных
признаков, выделенных на изображениях, оценка
применимости данной работы на таких источниках
новостей, как социальные сети, улучшение и
расширение собранных коллекций.
Литература</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Ahsan</surname>
            ,
            <given-names>U.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sun</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hays</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Essa</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          :
          <article-title>Complex Event Recognition from Images with Few Training Examples. Applications of Computer Vision</article-title>
          (WACV),
          <source>2017 IEEE Winter Conference on</source>
          , pp.
          <fpage>669</fpage>
          -
          <lpage>678</lpage>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Chollet</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          <article-title>and others: Keras</article-title>
          . https://github.com/ fchollet/keras
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Cui</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Liu</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Chen</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Chang</surname>
            ,
            <given-names>S.F.</given-names>
          </string-name>
          :
          <article-title>Building a Large Concept Bank for Representing Events in Video</article-title>
          .
          <source>arXiv preprint arXiv:1403.7591</source>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Everingham</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Van Gool</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Williams</surname>
            ,
            <given-names>C.K.I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Winn</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zisserman</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>The PASCAL Visual Object Classes (VOC) Challenge: A Retrospective</article-title>
          .
          <source>Int. J. of Computer Vision</source>
          ,
          <volume>111</volume>
          (
          <issue>1</issue>
          ), pp.
          <fpage>98</fpage>
          -
          <lpage>136</lpage>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Everingham</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Winn</surname>
            ,
            <given-names>J.: The</given-names>
          </string-name>
          <string-name>
            <surname>PASCAL Visual Object Classes Challenge 2012 (VOC2012) Development Kit</surname>
          </string-name>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>[6] ImageNet. http://image-net.org/index</mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Krizhevsky</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sutskever</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hinton</surname>
          </string-name>
          , G.E.:
          <article-title>ImageNet Classification with Deep Convolutional Neural Networks</article-title>
          .
          <source>Advances in Neural Information Processing Systems</source>
          , pp.
          <fpage>1097</fpage>
          -
          <lpage>1105</lpage>
          (
          <year>2012</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Oquab</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bottou</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Laptev</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sivic</surname>
          </string-name>
          , J.:
          <article-title>Learning and Transferring Mid-Level Image Representations using Convolutional Neural</article-title>
          .
          <source>Networks. М.: CVF</source>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Simonyan</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zisserman</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>Very Deep 5Convolutional Networks for Large-Scale Image Recognition</article-title>
          .
          <source>arXiv preprint arXiv:1409.1556</source>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Sklearn</surname>
          </string-name>
          , GradientBoostingClassifier. http://scikitlearn.org/stable/modules/generated/sklearn.ensemb le.
          <source>GradientBoostingClassifier</source>
          .html
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <surname>Sklearn</surname>
          </string-name>
          , LogisticRegression. http://scikit-learn. org/stable/modules/generated/sklearn.linear_model .LogisticRegression.html
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Sklearn</surname>
          </string-name>
          . OneVsRestClassifier. http://scikitlearn.org/stable/modules/generated/sklearn.multicl ass.
          <source>OneVsRestClassifier</source>
          .html
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Srivastava</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hinton</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Krizhevsky</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sutskever</surname>
            ,
            <given-names>I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Salakhutdinov</surname>
          </string-name>
          , R.:
          <article-title>Dropout: A Simple Way to Prevent Neural Networks from Overfitting</article-title>
          .
          <source>J. of Machine Learning Research</source>
          ,
          <volume>15</volume>
          (
          <issue>1</issue>
          ), pp.
          <fpage>1929</fpage>
          -
          <lpage>1958</lpage>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Szegedy</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Vanhoucke</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ioffe</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wojna</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Shlens</surname>
          </string-name>
          , J.:
          <article-title>Rethinking the Inception Architecture for Computer Vision</article-title>
          .
          <source>Proc. of the IEEE Conference on Computer Vision and Pattern Recognition</source>
          , pp.
          <fpage>2818</fpage>
          -
          <lpage>2826</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [15]
          <article-title>TensorFlow: Large-scale machine learning on heterogeneous systems</article-title>
          . http://tensorflow.org (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [16]
          <string-name>
            <surname>The</surname>
            <given-names>CIFAR</given-names>
          </string-name>
          -
          <volume>10</volume>
          dataset. https://www.cs.toronto. edu/~kriz/cifar.html
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          [17]
          <string-name>
            <surname>Theano</surname>
            <given-names>Development</given-names>
          </string-name>
          <string-name>
            <surname>Team</surname>
          </string-name>
          .
          <article-title>Theano: A Python Framework for Fast Computation of Mathematical Expressions</article-title>
          .
          <source>arXiv preprint arXiv:1605.02688</source>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          [18]
          <string-name>
            <surname>van Mitenburg</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Elliot</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          :
          <article-title>Room for Improvement in Automatic Image Description: an Error Analysis</article-title>
          .
          <source>arXiv preprint arXiv:1704.04198</source>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          [19]
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lin</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Shen</surname>
            ,
            <given-names>X.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mech</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Miller</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cottrell</surname>
            ,
            <given-names>G.W.</given-names>
          </string-name>
          :
          <article-title>Event-specific Image Importance</article-title>
          .
          <source>Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition</source>
          , pp.
          <fpage>4810</fpage>
          -
          <lpage>4819</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          [20]
          <string-name>
            <surname>Wei</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Xia</surname>
            ,
            <given-names>W.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Huang</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ni</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dong</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zhao</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yan</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          : CNN:
          <article-title>Single-label to Multilabel</article-title>
          .
          <source>arXiv preprint arXiv:1406.5726</source>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          [21]
          <string-name>
            <surname>Yang</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Luo</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Loy</surname>
            ,
            <given-names>C.C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Tang</surname>
            ,
            <given-names>X.</given-names>
          </string-name>
          :
          <article-title>Wider Face: A Face Detection Benchmark</article-title>
          .
          <source>Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition</source>
          , pp.
          <fpage>5525</fpage>
          -
          <lpage>5533</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          [22]
          <string-name>
            <surname>Zeiler</surname>
            ,
            <given-names>M.D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fergus</surname>
          </string-name>
          , R.:
          <article-title>Visualizing and Understanding Convolutional Networks</article-title>
          .
          <source>European Conf. on Computer Vision</source>
          . Springer, Cham, pp.
          <fpage>818</fpage>
          -
          <lpage>833</lpage>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>