<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <abstract>
        <p>Tracking of the wild animal displacements in natural parks involves an analysis of large amount of visual data obtained by several camera traps. The problem statement connects with a matching of individual images with other images of the same species. The accumulated volume of video materials allows to solve the problem based on Deep Learning technique, in particular the Siamese neural network. The proposed method was tested using a dataset obtained on the territory of Ergaki natural park, Krasnoyarsk Territory, Russia.</p>
      </abstract>
      <kwd-group>
        <kwd>monitoring of wild animals</kwd>
        <kwd>camera traps</kwd>
        <kwd>image processing</kwd>
        <kwd>deep learning</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Введение. Использование фотоловушек для мониторинга диких животных становится
все более популярным способом неинвазивного наблюдения за дикими животными в их
среде обитания. Проблема заключается в обработке больших объемов информации,
полученных, например, в течение полугода от нескольких десятков фотоловушек, установленных в
национальных парках и на особо охраняемых природных территориях. Выбор мест
установки определяется работниками парков в местах троп, водопоев, солонцов и т.д. Ставится
задача сопоставления визуальных данных конкретной особи с видеоматериалами, полученными
от распределенной сети фотоловушек, с целью нахождения локальных миграций данной
особи. Такая задача является одной из завершающих задач мониторинга диких животных
при условии, что выполнен предварительный отсев малоинформативных снимков и
распознан вид животного. Большой накопленный объем видеоматериалов позволяет решить эту
проблему с использованием технологии Deep Learning, в частности с использованием сети
глубокого обучения Siamese Neural Network. Метод протестирован с использованием набора
данных изображений, полученных на территории природного парка «Ергаки», Красноярский
край, Россия.</p>
      <p>Постановка задачи. Известно, что каждое животное имеет свой ареал обитания, и
поэтому его появление может быть зафиксировано ограниченным количеством близлежащих
фотоловушек NF. В силу удаленности территорий национальных парков фотоловушки не
связаны в единую информационную сеть и не могут передавать текущую информацию на
сервер. Они способны сохранять серию снимков в имеющемся накопителе после
срабатывания датчика движения. Обычно длительность между отснятыми снимками составляет 3-5 с,
что позволяет получить несколько изображений особи в разных положениях. Фотоловушки
срабатывают в любое время суток и при любых метеорологических условиях, что приводит к
появлению плохих по качеству снимков или снимков с отсутствием животного. Следует
отметить, что появление человека фиксируется аналогичным образом. Серия снимков
Sim = {Im1, Im2, Im3, …, ImNs}, где IMi – i-й снимок, Ns – количество снимков в серии, имеет
атрибуты дата Ds, время Ts, температура Ks. Примем, что срабатывание фотоловушки
инициируется одним визуальным объектом VOi  {VO1, VO2, …, VONa}, где VONa – количество
классов, включая класс неопознанного визуального объекта. Таким образом, мощность
множества полученных снимков IMT за установленный временной интервал определяется как
сумма:</p>
      <p>NF
IMT    count Simi </p>
      <p>i1
где count () – функция подсчета количества снимков в i-й серии.</p>
      <p>
        Примем, что из полученного множества снимков удалены неинформативные снимки
[7], содержащие отсутствие визуального объекта или значительные артефакты, вызванные
условиями съемки. При этом неиформативные снимки могут составлять от 60% до 75% от
общего объема видеоматериалов [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. К оставшемуся множеству снимков IMS применяется
процедура составления модели фона (для конкретной фотоловушки), что позволяет
достаточно быстро и точно находить визуальный объект [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. Отобранное множество снимков
содержит подмножества изображений видов IMA и подмножество изображений человека IMH:
      </p>
      <p>IM S   IM A1 , IM A2 , , IM AM  IM H ,
где M – количество видов (классов) животных.</p>
      <p>
        Авторами разработан метод распознавания видов животных с использованием
объединенной сверточной нейронной сети, включающей две структуры VGG16 для распознавания
изображений головы и части тела животного и одну структуру VGG19 для распознавания
изображения животного в целом [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]. Выходы трех структур объединяются, что позволило
получить точность распознавания 80,6% Top-1 и 94,1% Top-5 на сбалансированном наборе
данных. Для несбалансированного набора данных (что является характерной ситуацией для
данной задачи в силу количества животных на конкретной территории и особенностей их
поведения) были получены худшие результаты, а именно 38,7% Top-1 и 54,8% Top-5. Тем не
менее, данный подход позволяет разделить подмножества изображений по видам животных.
Таким образом, мы получаем подмножество заданного вида IMAi, которое содержит
изображения нескольких особей, относящихся к этому виду. Данная информация является
исходной для идентификации конкретной особи и отслеживания ее перемещения с
использованием видеоматериалов, полученных от NF фотоловушек.
      </p>
      <p>Технологии Deep Learning. Технологии глубокого обучения (Deep Learning)
позволяют автоматически извлекать абстрактные признаки из исходных («сырых») данных за счет
того, что каждый слой нейронов использует операции свертки на перекрывающихся
небольших по размеру регионах, поступающих от предыдущих слоев. Причем, на первых
сверточных слоях размер таких регионов больше, чем на последующих сверточных слоях сети, так
как пространственная область сокращается от слоя к слою и применение большой по размеру
маски приведет к пропуску структурных особенностей. Последним слоем глубокой
нейронной сети, как правило, является слой softmax, выполняющий роль классификатора. Однако
для обучения таких сетей требуется большой объем исходных данных, промаркированный
вручную. Отметим, что задача обнаружения и распознавания диких животных удовлетворяет
таким условиям и поэтому может быть решена с помощью сверточных нейронных сетей.</p>
      <p>
        Применение технологий глубокого обучения для классификации изображений,
полученных от фотоловушек, началось несколько лет назад, и с появлением новых архитектур
сверточных нейронных сетей точность распознавания повышалась. Одной из первых была
работа [8], в которой ставилась задача автоматической идентификации 20 классов животных
при наличии 20 000 изображений. Была достигнута точность распознавания около 38%, что,
тем не менее, превышало точность классификации с применением традиционной технологии
на основе «портфеля слов». В [9] было показано, что технологию Deep Learning можно
успешно применять на небольших наборах изображений, если требуется отделить птиц от
млекопитающих (набор данных из 1572 изображений) и распознать два вида млекопитающих
(набор данных из 2597 изображений). Сеть предварительно была обучена на наборе данных
ImageNet [10]. Как для обнаружения животных на снимках, так и для распознавания их видов
применяются различные сети глубокого обучения, например, AlexNet (8 слоев) [11], NiN
(Network in Network) (16 слоев) [12], VGG (Visual Geometry Group, Department of Engineering
Science, University of Oxford) (22 слоя) [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ], GoogLeNet (32 слоя) [13], а также ResNet (18, 34,
50, 101 и 152 слоя) [14]. Точность детектирования при использовании современных
сверточных нейронных сетей высока и может достигать 93,8% Top-1 и 98,8% Top-5 [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ], однако
следует понимать, что такие высокие значения получаются для набора изображений животных,
обитающих на конкретной территории в конкретных климатических условиях и при наличии
хорошо обученной сети.
      </p>
      <p>Метод идентификации особи по изображениям. Помимо сверточных нейронных
сетей с одним входом в последние годы появились такие архитектуры, которые предполагают
подачу двух или даже трех изображений одновременно на две или три ветви сети. Такие сети
называются двойными (сиамскими) или тройными. При идентификации конкретной особи из
ограниченного набора изображений животных данного вида сиамская структура сети будет
полезной.</p>
      <p>Архитектура сиамской сети впервые была предложена в 1994 г. для верификации
подписи, представленной временным рядом [15]. Позже эта архитектура усилена сверточными
нейронными сетями для верификации лиц с использованием техники уменьшения
размерности [16]. В последние годы сиамские сверточные сети стали использоваться для повторной
идентификации людей, лиц, а также как системы сопровождения объектов.</p>
      <p>
        Архитектура сиамской сети такова, что обучение осуществляется путем подачи на
входы двух изображений одновременно. Причем, используются две идентичные параллельные
нейронные сети, содержащие одинаковые наборы весовых коэффициентов W. Общая
структура сиамской нейронной сети представлена на рисунке 1. Однако следует отметить, что
имеются другие решения, когда традиционная структура данной сети изменяется путем
применения неодинаковых наборов весовых коэффициентов [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ].
      </p>
      <p>Рис. 1. Общая структура сиамской нейронной сети.</p>
      <p>На входы обоих сетей поступают входные изображения X1 и X2, их выходами являются
векторы признаков OX1 и OX2. Далее вычисляется расстояние между этими векторами и
формируется функция EW(X1, X2), которая и характеризует сходство или различие входных
изображений. В качестве сетей выбрана архитектура VGG19 (Visual Geometry Group),
которая хорошо зарекомендовала себя в задачах распознавания благодаря однотипным
конволюционным слоям 33 элементов (Conv), слоям подвыборки (Maxpooling) и полносвязным
слоям (Fullyconnected) из 4096 нейронов, как показано на рисунке 2.</p>
      <p>Рис. 2. Структура сиамской нейронной сети на основе VGG19.</p>
      <p>Экспериментальные результаты. Для обучения сиамской сверточной сети
использовался набор из 842 изображений косуль, полученных на территории природного парка
«Ергаки», Красноярский край, Россия. Данный набор содержит изображения 8 особей косули,
полученных от 4 фотоловушек, расположенных в разных местах природного парка. На
основе исходного набора была сгенерирована обучающая выборка размером порядка 12000
изображений, содержащая случайным образом выбранные пары изображений одной и той же
особи, а также разных особей. Далее обучающая выборка была искусственно расширена до
40000 изображений с помощью аугментации (augmentation). Для аугментации применялись
следующие действия:
• Поворот изображения на [–45, +45] градусов случайным образом.
• Горизонтальное отражение изображения со случайным сдвигом.
• Масштабирование изображения с коэффициентом [0,75; 1,25].
• Кадрирование изображения.
• Сдвиг каждого цветового канала на [–25,5; +25,5] единиц случайным образом.
Далее полученный набор изображений был разделен на обучающую и тестовую
выборки в соотношении 80% на 20%. Сиамская сверточная нейронная сеть была реализована на
языке программирования Python 3.5 с использованием фреймворка TensorFlow 1.5.
Эксперименты проводились на ПК с процессором Intel i7 3.2GHz, 16GB оперативной памяти,
видеокартой 8GB Nvidia GeForce GTX 1070 под операционной системой Windows 7.</p>
      <p>Для отслеживания перемещения животного по природному парку требовалось
сопоставить изображение конкретной особи с изображениями всех особей данного вида, имеющихся
в базе данных. Таким образом, результатом сиамской сверточной нейронной сети являлась
оценка подобия двух входных изображений на основе эвклидовой метрики. Результаты
сопоставления конкретных особей косули с привязкой к четырем фотоловушкам представлены
в таблице.</p>
      <p>Фотоловушка 1
Фотоловушка 2
Фотоловушка 3
Фотоловушка 4</p>
      <p>Таблица. Результаты точности сопоставления особей косули.
По одному снимку, % По серии из 5 снимков, %
41,2 56,2
42,4 58,4
43,1 57,5
44,6 59,0
Среднее значение точности сопоставления особей по одному снимку составляет 42,8%,
а по серии из пяти снимков – 57,8%. Более точного сопоставления можно добиться
увеличением серии тестовых снимков для конкретной особи.</p>
      <p>Заключение. Предложенный метод сопоставления визуальных данных конкретной
особи с видеоматериалами, полученными от распределенной сети фотоловушек, основан на
использовании сиамской сверточной нейронной сети. Предполагается, что изображений
особей конкретного вида отобраны, и требуется провести сопоставление снимков для
определения миграции особи по природному парку с точностью до мест, в которых установлены
фотоловушки. Задача является сложной в силу различных условий съемки и малого количества
изображений, пригодных для распознавания конкретной особи. Относительно низкая
точность распознавания конкретной особи обусловлена небольшим набором исходных
изображений и может быть повышена за счет большей исходной выборки.</p>
      <p>Исследование выполнено при финансовой поддержке Российского фонда
фундаментальных исследований, Правительства Красноярского края, Красноярского краевого фонда
науки в рамках научного проекта (грант № 18-47-240001 а).
[7] Favorskaya M.N., Buryachenko V.V. Selecting informative samples for animal recognition in
the wildlife // In: Czarnowski I., Howlett R., Jain L. (eds) Intelligent Decision Technologies
2019. SIST, vol 143, Malta: Springer, 2019. pp. 65-75.
[8] Chen G., Han T.X., He Z., Kays R., Forrester T. Deep convolutional neural network based
species recognition for wild animal monitoring // Proceedings of the 2014 IEEE International
Conference on Image Processing. Paris, France: IEEE, 2014. pp. 858-862.
[9] Gomez A., Diez G., Salazar A., Diaz A. Animal identification in low quality camera-trap
images using very deep convolutional neural networks and confidence thresholds // Proceedings
of the International Symposium on Visual Computing. Las Vegas, Nevada, USA: Springer,
2016. pp. 747-756.
[10] Deng J., Dong W., Socher R., Li L.-J., Li K., Fei-Fei L. Imagenet: A large-scale hierarchical
image database // Proceedings of the 2009 IEEE Conference on Computer Vision and Pattern
Recognition, Miami, FL, USA: IEEE, 2009. pp. 248-255.
[11] Krizhevsky A., Sutskever I., Hinton G.E. Imagenet classification with deep convolutional
neural networks // Proceedings of the 25th International Conference on Neural Information
Processing Systems, Vol. 1, Nevads, USA: IEEE, 2012. pp. 1097-1105.
[12] Lin M., Chen Q., Yan S. Network in network // Proceedings of the International Conference
on Learning Representations, Banff, Canada: IEEE, 2014. pp. 1-10.
[13] Szegedy C., Liu W., Jia Y., Sermanet P., Reed S., Anguelov D., Erhan D., Vanhoucke V.,
Rabinovich A. Going deeper with convolutions // Proceedings of the 2015 IEEE Conference on
Computer Vision and Pattern Recognition, Boston, USA: IEEE, 2015. pp. 1-9.
[14] He K. Zhang X., Ren S., Sun J. Deep residual learning for image recognition // Proceedings of
the 2016 IEEE Conference on Computer Vision and Pattern Recognition Las Vegas, NV,
USA: IEEE, 2016. pp. 770-778.
[15] Bromley J., Guyon I., Lecun Y., Säckinger E., Shah R. Signature verification using a
”Siamese” time delay neural network // Proceedings of the Neural Information Processing
Systems, Denver, Colorado, USA: IEEE, 1994. pp. 737–744.
[16] Chopra S., Hadsell R., LeCun Y. Learning a similarity metric discriminatively, with
application to face verification // Proceedings of the 2005 IEEE Conference on Computer Vision and
Pattern Recognition, Vol. 1, San Diego, CA, USA: IEEE, 2005. pp. 539–546.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Newey</surname>
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Davidson</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Nazir</surname>
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fairhurst</surname>
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Verdicchio</surname>
            <given-names>F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Irvine</surname>
            <given-names>R</given-names>
          </string-name>
          .J., van der Wal R.
          <article-title>Limitations of recreational camera traps for wildlife management and conservation research: A practitioner's perspective /</article-title>
          / Ambio.
          <year>2015</year>
          . Vol.
          <volume>44</volume>
          , pp.
          <fpage>624</fpage>
          -
          <lpage>635</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Favorskaya</surname>
            <given-names>M.N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Buryachenko</surname>
            <given-names>V.V.</given-names>
          </string-name>
          <article-title>Background extraction method for analysis of natural images captured by camera traps // Informatsionno-upravliaiushchie sistemy [Information and Control Systems]</article-title>
          .
          <year>2018</year>
          . Vol.
          <volume>6</volume>
          , pp.
          <fpage>35</fpage>
          -
          <lpage>45</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Favorskaya</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pakhirka</surname>
            <given-names>A</given-names>
          </string-name>
          .
          <article-title>Animal species recognition in the wildlife based on muzzle and shape features using joint CNN</article-title>
          .
          <source>Procedia Computer Science</source>
          .
          <year>2019</year>
          .
          <article-title>(in print).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Simonyan</surname>
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zisserman</surname>
            <given-names>A</given-names>
          </string-name>
          .
          <article-title>Very deep convolutional networks for large-scale image recognition</article-title>
          .
          <year>2014</year>
          . arXiv preprint arXiv:
          <volume>1409</volume>
          .
          <fpage>1556</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Norouzzadeh</surname>
            <given-names>M.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Nguyen</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kosmala</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Swanson</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Palmer</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Packer</surname>
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Clune</surname>
            <given-names>J</given-names>
          </string-name>
          .
          <article-title>Automatically identifying, counting, and describing wild animals in camera-trap images with deep learning /</article-title>
          / PNAS.
          <year>2018</year>
          . Vol.
          <volume>115</volume>
          , no.
          <issue>25</issue>
          . pp.
          <fpage>E5716</fpage>
          -
          <lpage>E5725</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Shaham</surname>
            <given-names>U.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lederman R.R</surname>
          </string-name>
          .
          <article-title>Learning by coincidence: Siamese networks and common variable learning // Pattern Recognition</article-title>
          .
          <year>2018</year>
          . Vol.
          <volume>74</volume>
          . pp.
          <fpage>52</fpage>
          -
          <lpage>63</lpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>