<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Управление вычислительными ресурсами Сибирского Суперкомпьютерного Центра</article-title>
      </title-group>
      <pub-date>
        <year>2015</year>
      </pub-date>
      <fpage>667</fpage>
      <lpage>675</lpage>
      <abstract>
        <p>Разбираются вопросы эксплуатации суперкомпьютера НКС-30Т Сибирского Суперкомпьютерного Центра Коллективного Пользования с системой управления очередью заданий PBS Pro. Центр коллективного пользования «Сибирский Суперкомпьютерный Центр» (ССКЦ) организован как структурное подразделение ИВМиМГ СО РАН в соответствии с постановлением Президиума СО РАН от 06.03.2001 № 100 «О создании Сибирского суперкомпьютерного центра коллективного пользования СО РАН». В ССКЦ были установлены и эксплуатировались разнообразные системы пакетной обработки (batch system): - Distributed Queuing System (DQS) на комплексе RM600 E30; - Система управления прохождением параллельных заданий (СУППЗ) на кластерах МВС-1000/32 и МВС-1000/128; - Sun Grid Engine на кластере НКС-160; - PBS Pro 11.1 на суперкомпьютере НКС-30Т.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Коммуникационная сеть кластера QDR Infiniband, транспортная и сервисная сети – Gigabit
.Ethernet. Кластерная файловая система Ibrix была модернизирована в 2014 году.</p>
      <p>Сервер HP ProLiant DL980 G7 с одним терабайтом оперативной памяти включен в состав
НКС-30Т как нестандартный вычислительный узел.</p>
      <p>Программно-аппаратная среда кластера позволяет использовать облачные технологии для
создания специализированных вычислительных сред. Гетерогенность ресурсов кластера
позволяет гибко варьировать параметры выделяемых в облако виртуальных ресурсов.
В настоящее время в ССКЦ СО РАН функционирует две, основанные на KVM
виртуализированные вычислительные среды, являющихся частями более крупных виртуальных кластеров.
Первая - ИЯФ-НГУ-ССКЦ [4]. Используется для обработки данных физических экспериментов
в физике высоких энергий, осуществляемых в ИЯФ СО РАН. Вторая - Академпарк-ССКЦ.
Разработана совместно с Академпарком Технопарка Новосибирского Академгородка и
предназначена для решения задач BigData (геофизика, обработка медицинских данных и другие). Оба
виртуальных кластера для обмена данными с ССКЦ используют Суперкомпьютерную сеть
Новосибирского Научного Центра (10 Гбит/с).
2.2 Программное обеспечение</p>
      <p>Системное программное обеспечение включает в себя Red Hat Enterprise Linux 5.4, HP
Cluster Management Utility (CMU) 7.0 и систему управления пакетной обработкой PBS Pro 11.1.</p>
      <p>Средства разработки включают Intel MPI 4.1, Intel TraceAnalyzer/Collector, компиляторы
Intel C++ и Intel Fortran из состава Composer XE 2013 SP1, включающие библиотеки Intel MKL,
Intel IPP и Intel TBB. Дополнительно установлены компиляторы и библиотеки из Intel Parallel
Studio XE 2015. Такой подход позволяет использовать дорогостоящие лицензии на старые
версии программного обеспечения Intel.</p>
      <p>Из коммерческих пакетов установлены Gaussian g09 Rev D.01 w/LINDA, ANSYS CFD
версии 14.5.7. с лицензиями HPC, обеспечивающими параллельное выполнение программ
Fluent, а также ANSYS CFD 16.1 (без лицензий HPC)..</p>
      <p>Архитектура ССКЦ поддерживает две современных парадигмы параллельных вычислений
– MPI для систем с распределенной памятью (МРР-кластеров)и OpenMP для систем с общей
памятью. Смешанная схема вычислений(MPI+OpenMP) позволяет запуск на каждый
вычислительный узел кластера по одному MPI-процессу, который запускает внутри каждого
вычислительного модуля несколько потоков с помощью OpenMP.</p>
      <p>Для гибридной архитектуры: суперкомпьютер состоит из набора соединенных между
собой узлов, для обмена данными используется MPI; каждый узел состоит из двух CPU и трёх
GPU; на каждом узле запускается 1 процесс MPI, управляющий вычислениями (процесс
выполняется на CPU); из MPI процесса запускаются потоки (threads) OpenMP, каждый из которых
управляет работой одного GPU. Другой вариант: запускаются три MPI процесса на узел,
каждый управляет закрепленным за ним GPU.
3. Использование вычислительных ресурсов
Таблица 1. Использование машинного времени по годам
32
2012
116
Таблица 2. Отчет по работе пользователей за 2014 год
Всего пользователей – 155
Всего организаций – 29
Академических организаций – 24
Университетов – 3
(СФУ, Красноярск), НГУ, НГТУ)
Другие организации – 2
(СибНИА им. Чаплыгина,
СибНИГМИ)
Всего грантов, программ,
проектов, тем — 176
Из них Российских — 171
Международных — 5
Грантов РФФИ – 67
Программ РАН – 22
Проектов СО РАН – 30
Программ Минобрнауки – 18
Другие – 34
Всего публикаций – 158
Российских – 88
Зарубежных – 70
Доктор. диссерт. – 1,
Кандидат. диссерт. – 5,
Дипломы – 7,
Патенты – 2.</p>
      <p>Приведенная статистика показывает, что ЦКП ССКЦ действительно центр коллективного
пользования, крупнейший за Уралом. Его пользователи в основном сотрудники СО РАН. С
увеличением вычислительных ресурсов число заданий и загрузка вычислительной техники –
возрастает. Спад в 2014 году связан с уменьшением потока заданий пользователей и потерями
машинного времени на модернизацию программного обеспечения кластерной файловой
системы IBRIX и наращивание дискового пространства в августе - сентябре. Основные затраты
пришлись на сохранение по частям 27 Терабайт пользовательских данных и последующее их
восстановление.
4. Обеспечение безопасности</p>
      <p>Установлен сетевой экран (firewall), разрешающий доступ по протоколу ssh/scp/sftp только
из сетей, в которых есть зарегистрированные пользователи ССКЦ. На исходящий трафик
ограничений не налагается. Более точные ограничения накладываются средствами Linux
(hosts.allow , AllowUsers).</p>
      <p>Пользователи авторизуются по ключу ssh, который создаётся каждым пользователем
индивидуально. Секретная часть ключа ssh хранится у пользователя, а открытая посылается
администратору кластера.
5. Использование возможностей PBS Pro</p>
      <p>
        PBS Professional [
        <xref ref-type="bibr" rid="ref2">5</xref>
        ] это коммерческая система для планирования заданий и управления
загрузкой высокопроизводительных вычислительных кластеров.
5.1 Очереди заданий
      </p>
      <p>На кластере организовано несколько очередей, каждая очередь поддерживает работу с
однотипными серверами одного поколения. Написан скрипт pbsinfo, выдающий число свободных
вычислительных узлов и отдельных ядер в каждой очереди.</p>
      <p>
        [kuchin@nks-g6 ~]$ pbsinfo
QUEUE NODES FREE CORES FREE NODES TOTAL GPUS FREE GPUS TOTAL
----------- ----------- ----------- ----------- -----------
----------workq(G5) 0 0*8 64 0 0
g6_q(G6) 36 36*8+37 128 0 0
G7_q(G7) 1 1*12 96 0 0
SMP_G7_q(G7) 0 0*80+67 1 0 0
SL_q(GPU) 0 0*12 40 0 120
Рис. 2. Пример выдачи pbsinfo
Для специальных целей можно создать очередь, поддерживающую работу с
неоднородными серверами. Например, сервер с большой оперативной памятью и несколько серверов с
графическими ускорителями Nvidia Tesla.
Пользователь, поставивший в очередь большое число заданий, которые выйдут в счет и
захватят все свободные ресурсы, фактически будет использовать кластер монопольно и
блокировать счет заданий других пользователей. Для таких пользователей вводится лимит на число
решаемых задач и лимит на число выделяемых процессорных ядер.
5.3 Учет использования заданиями пользователей машинного времени
За выполненное задачей пользователя время принимается время решения задачи
умноженное на число выделенных задаче процессорных ядер. За основу подсистемы учета заданий
пользователей взята [
        <xref ref-type="bibr" rid="ref3">6</xref>
        ] версии pbsacct-1.4.7.tar.gz. Пользователи каждого института СО РАН
объединяются в отдельную группу. Информация по загрузке вычислительных ресурсов
выдается по каждой очереди и интегрально по всем очередям кластера. Дополнительно выдается
информация по использованию заданиями графических ускорителей. Отметим что в приведенном
примере информация о пользователях (login, Full name) не приведена и урезана до первых пяти
строк.
      </p>
      <p>GPU May 2015
Portable Batch System accounting statistics
------------------------------------------Processing a total of 31 accounting files... done.</p>
      <p>The first job record is dated Fri 01 May 2015 02:38:12 AM NOVT.
The last job record is dated Sun 31 May 2015 12:23:12 AM NOVT.
QUEUE(S): all (GPU only)
Group
----TOTAL</p>
      <p>itam
uiggm
niboch</p>
      <p>icmmg
altstu
nsu</p>
      <p>Wallclock
#jobs days
-----
--------</p>
      <p>Average Average GPUs Average
Percent #cores #GPUs days q-days
------- ------- ------- ---------
------611
6. Виртуальный кластер ИЯФ-НГУ-ССКЦ
Рис. 5. Пользователи, заказывающие GPU.</p>
      <p>Рис. 6. Общая схема ресурсов ССКЦ
Виртуальный кластер ИЯФ-НГУ-ССКЦ используется для обработки данных физических
экспериментов в физике высоких энергий, осуществляемых в ИЯФ СО РАН [4]. Задачи
характеризуются использованием однопоточных программ и хорошей параллелизацией на уровне
данных. Для создания виртуальных ресурсов на локальном кластере используются штатные
возможности PBS Pro. PBS Pro запускает требуемую виртуальную машину, описанную в
скрипте (prologue) и останавливает ее по завершению задания (epilogue), после чего
вычислительный узел может использоваться в обычном режиме другими заданиями. В качестве среды
виртуализации используется KVM. Обмен данными между ИЯФ СО РАН и ССКЦ
осуществляется через суперкомпьютерную сеть Новосибирского Научного Центра (10 Гбит/с).
Основные задачи, решаемые на виртуальном кластере ИЯФ-НГУ-ССКЦ:
* Эксперимент КЕДР
Работа проводится на электрон-позитронном коллайдере ВЭПП-4М с детектором КЕДР.
Эксперименты в области рождения ψ-резонансов (J/ψ, ψ(2S), ψ(3770)) и τ-лептона. Использует
Scientific Linux CERN 3.
* Эксперимент ATLAS
Работа проводится на Большом адронном коллайдере (БАК) (ЦЕРН, Швейцария). Анализ
данных эксперимента ATLAS в рамках ATLAS Exotics Working Group.
* Эксперимент СНД
Работа проводится на коллайдере ВЭПП-2000 со Сферическим нейтральным детектором
(СНД). Изучение процессов электрон-позитронной аннигиляции в области энергии до 2 ГэВ в
системе центра масс.</p>
      <p>Рис. 7. Схема виртуального кластера ИЯФ-НГУ-ССКЦ
7. Виртуальный кластер Академпарк-ССКЦ</p>
      <p>Виртуальный кластер Академпарк-ССКЦ создан совместно с департаментом системной
интеграции Компании ТехноСити для Академпарка Технопарка Новосибирского
Академгородка. Предназначена для решения задач обработки BigData. В первую очередь это геофизика,
обработка медицинских данных, обработка трафика. Функционирует вне очереди заданий на
MPP-G6 части кластера ССКЦ.
Рис. 8. Схема виртуального кластера Академпарк-ССКЦ
8. Работа с пользователями</p>
      <p>
        11 -14 марта 2014 г.совместно с NVIDIA и Учебным центром по технологии CUDA
(CUDA Teaching Center) НГУ была проведена Школа-тренинг по углубленному изучению
технологий программирования графических процессоров [
        <xref ref-type="bibr" rid="ref4">7</xref>
        ]. На школе были рассмотрены
вопросы профилирования, отладки, оптимизации кода на CUDA, применения технологии OpenACC.
Практическая часть занятий школы проходила на гибридном расширении кластера НКС-30Т с
GPU NVIDIA TESLA M2090.
      </p>
      <p>
        15 -16 мая 2014 г.на ресурсах ССКЦ сотрудниками Intel проведен ТРЕНИНГ Intel®
Software Development Excellence Program Применение Intel® Parallel Studio XE и Intel® Cluster
Studio XE в решении исследовательских задач [
        <xref ref-type="bibr" rid="ref5">8</xref>
        ].
      </p>
      <p>Проводится регулярный семинар «Архитектура, системное и прикладное программное
обеспечение кластерных суперЭВМ» на базе ССКЦ, кафедры Вычислительных систем НГУ и
Центра Компетенции по высокопроизводительным вычислениям СО РАН – Intel [9].
9. Проблемы и выводы
1. Моральное устаревание вычислительной техники.
2. Завершение гарантийного обслуживания, т.е. все ремонты за счет института.
3. Недостаточная пропускная способность Ibrix, соответственно, в конечном итоге
скорость обменов определяется быстродействием дисковой полки.
4. Неприспособленность Ibrix к работе с большими файлами размером в сотни Гигабайт.
5. Новый кластер должен быть с жидкостным охлаждением..</p>
      <p>6. Часть вычислительных узлов должна быть с сопроцессорами Intel Xeon Phi, часть с GPU
Nvidia и приблизительно половина без сопроцессоров и ускорителей только с процессорами
Intel Xeon.</p>
      <p>7. Несколько вычислительных узлов должны быть серверами с большой оперативной
памятью в 2 – 4 Терабайта и локальным дисковым массивом не менее 10 Терабайт.</p>
      <p>8. В качестве коммуникационной среды должен быть Mellanox Infiniband и/.или Intel
OmniPath.</p>
      <p>9. Обязательно должна быть параллельная файловая система Lustre или Panasas, а также
файловое хранилище большой емкости для хранения и архивирования неиспользуемых данных.</p>
      <p>Выявленные во время эксплуатации проблемы будут учтены при наращивании
вычислительных ресурсов и закупке следующего кластера.
Литература
3. Гибридный кластер НКС-30Т</p>
      <p>URL: http://www2.sscc.ru/HKC-30T/HKC-30T.htm
9. «Архитектура, системное и прикладное программное обеспечение кластерных
суперЭВМ»
URL: http://www2.sscc.ru/Seminars/NEW/Seminars.htm
Control and managing the HPC cluster in Siberian
Supercomputer Center
Nikolay Kuchin, Boris Glinsky, Igor Chernykh, Sergey Lomakin and Igor Makarov
The paper presents the experience of exploitation high-performance computing cluster
installed in the Siberian Supercomputer Center (SSCC ICMMG SB RAS). SSCC has more
than 150 users from more than 20 academic institutions. One important example of virtual
computing environment is the integration KVM with batch system PBS Pro.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          2. Б.М. Глинский, Д.А. Караваев, И.М. Куликов, Н.В. Кучин, Н.В. Снытников. Масштабируе- мые вычисления с применением гибридного кластера// Материалы международной конфе- ренции
          <source>«Mathematical and Informational Technologies</source>
          , MIT-2013», с.
          <volume>89</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          5.
          <string-name>
            <given-names>PBS</given-names>
            <surname>Professional</surname>
          </string-name>
          .URL: http://www.pbsworks.com/Product.aspx?id=
          <fpage>1</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          6. pbsacct -
          <source>Accounting Report Tool</source>
          . URL:http://www.mcs.anl.gov/research/projects/openpbs/patches/pbsacct/README.txt
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          7.
          <string-name>
            <surname>Школа</surname>
          </string-name>
          <article-title>- тренинг по программированию на</article-title>
          GPU URL: http://www2.sscc.ru/Seminars/Nvidia%
          <fpage>20Cuda</fpage>
          -
          <lpage>2014</lpage>
          .htm
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          8.
          <string-name>
            <surname>Применение</surname>
          </string-name>
          <article-title>Intel® Parallel Studio XE и Intel® Cluster Studio XE URL</article-title>
          : http://www2.sscc.ru/SORAN-INTEL/documents_2014.htm
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>