<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>1 Нижегородский государственный университет им. Н.И. Лобачевского, 2 Институт прикладной физики РАН</article-title>
      </title-group>
      <pub-date>
        <year>2015</year>
      </pub-date>
      <fpage>495</fpage>
      <lpage>509</lpage>
      <abstract>
        <p>Рассматривается проблема эффективного использованияускорителей Xeon Phi при моделировании лазерной плазмы. Приводится анализ особенностей архитектуры Xeon Phi, влияющих на производительность кода при численном моделировании плазмы методом частиц в ячейках. Описывается параллельный программный мк-о плекс PICADOR, оптимизированный ранее для расчетов нуаскорителях. Производительность программного комплекса на Xeon Phi в сравнении с CPU исследуется при решении трех вычислительно трудоемких задач. Дается соотношение времени реа-сч та на Xeon Phi и CPU на разных этапах меточдаастиц в ячейках. Демонстрируется, что в зависимости от особенностей задачи Xeon Phi может как опережать, такт- и о ставать от CPU при выполнении расчетов.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        Трехмерное моделирование плазмы методом частиц в
ячейках на Intel Xeon Phi: оптимизация вычислений и
примеры использования1
Данная работа посвящена вопросам эффективной реализации метода частиц в ячейках для
ускорителей Intel Xeon Phi, выполненной в контексте программного комплексPаICADOR.
Первые шаги в данном направлении быил сделаны нами в работах [
        <xref ref-type="bibr" rid="ref17 ref19">18, 20</xref>
        ]. Было показано, что
применение различных подходов к оптимизации расчетов (улучшение локальности обращений
в память, частичная векторизация и др.) при решении модельной задачи 5п0римакрочастицах
на ячейку позволяет достичь 7,7 наносекунд на макрочастицу на ускорителе Intel Xeon Phi
5110P (60 ядер, 240 потоков, 8 ГБ ОЗУ) при базовом значе1н4иинаносекунд на макрочастицу
на Intel Xeon E-52660 с частотой 2,2 ГГц (Sandy Bridge, 8 ядер, 20 МшБ-пкаэмяти, поддержка
AVX). Кроме того, необходимо отметить работу21[], основным результатом которой также
является оптимизация дляXeon Phi одной из реализаций метдоа частиц в ячейках. При
реешнии модельной задачи, содержащей вдвое большее числмоакрочастиц на ячейку, на ускорителе
Intel Xeon Phi достигнуто 1,7 наносекунд на макрочастицу. Данные результаты нельзя
сопсотавлять напрямую по следующим причинам: в отличиоет широко применяемой
вPICмоделировании сетки Йи (Yee), в работе 2[1] использована прямая сетка, кардинально
упорщающая векторизацию вычислений, а также использовано вдвое большее число частиц, что
повышает эффективность использования ресурсов.
      </p>
      <p>В данной работемы делаем следующий шаг визучении производительности комплекса
PICADOR на Xeon Phi в реальных условия х. Для этого мы рассматриваемследующие задачи,
представляющие научный интерес: лазерное ускорение протонов в тонких мишенях с сублв-о
новыми неоднородностями на облучаемой сторон,екомпрессия лазерных импульсов на
кильавтерной плазменной волне, генерация гамма-излучения в сходящейся дипольной
волн.еЗначения параметров расчета, влияющих на производительность кода, выбираются исходяфииззики
задачи. Основное внимание уделяется сравнению производительности кода нCаPU и Xeon Phi
и выделению особенностей задачи, влияющих на время расчета.
2. Краткая характеристика вычислительной схемы метода частиц в
ячейках</p>
      <p>
        В данном разделе приводится краткое описанивеычислительной схемы метода частиц в
ячейках в соответствии с1[
        <xref ref-type="bibr" rid="ref8">8</xref>
        ], подробное описание метода содержится в1][.
      </p>
      <p>Область моделирования имеет форму прямоугольного параллелепипеда со сторонамиа,- п
раллельными осям декартовой системы координат. В расчетной области заданы электрическое
и магнитное поляE и B, динамика электромагнитного поля описывается системой уравнений
Максвелла. В методе частиц в ячейках плазма моделируется набором из N
заряженмныакхрочастиц, каждая из которых характеризуется переменными импульсоpм и координатами r, а
также постоянными массой m и зарядом q. Координаты и скорость частvимценяются согласно
релятивистским уравнениям движения. Движение заряженных частиц создает плазменныеокти
j, которые входят в качестве источников в уравнения Максвелла, таким образом, замыкаяо-сам
согласованную систему уравнений.
Рис. 1. Вычислительная схема метода частиц в ячейках. Итерация цикла соответствует моделированию
одного шага по времени. Уравнения приведены в системе СГСЭ. Надписи над стрелками показывают
зависимости по данным между этапами метода18[]
3. Факторы, влияющие на производительность PIC-кодов</p>
      <p>Главным фактором, влияющим на производительность и масштабируемостPьIC-кодов и
используемых в них реализаций численных схем, является эффективность использования е-р
сурсов параллелизма на разных уровнях. Требуют решения вопросы организации параллельной
обработки на уровне распределенной памяти (узлы кластера),на уровне общей памяти
(вычислительные ядра в рамках одного узла)н,а уровне SIMD-инструкций (в рамках каждого ядра
процессора), отдельного обсуждения заслуживает вопрос оибспользовании ускорителей.</p>
      <p>
        Отметим, что потенциальная возможность параллельных расчетов заложена в основу ом-ет
да частиц в ячейка х. Действительно, в методеPIC макрочастицы не взаимодействуют друг с
другом напрямую, и операции частица-сетка являются пространственно локальными.
Испоьлзуя данные факторы, разработчики ПО разделяют расчетную область на домены по террии-тор
альному принципу и организуют обмены между соседними доменами. Сочетание этого поо-дх
да с эффективными схемами балансировки нагрузки позволяет при решении ряда задач ид-ост
гать приемлемой масштабируемости при использовании тысяч узлов кластер1а1,[
        <xref ref-type="bibr" rid="ref21">22</xref>
        ].
      </p>
      <p>
        При работе в рамках одного узла перед программистами вновь встает задача балансировки,
однако, как показывает практика, она решается достаточно успешно базовыми средствами
OpenMP, что в счоетании с использованиемреализаций SMT (simultaneous multithreading) в
современных процессорах позволяет добиться близкой к единице эффективности масштабиер-у
мости относительно однопоточной реализации1[
        <xref ref-type="bibr" rid="ref8">8</xref>
        ].
      </p>
      <p>
        К сожалению, при переходе к следующему уровню параллелизмSаIM( D) возникают
значительные трудности 1[
        <xref ref-type="bibr" rid="ref19 ref20 ref8">8, 20, 21</xref>
        ]. Причины этих трудностей заключены в самой природе метода,
одновременно обрабатывающего большие массивы данных, содержащие информацию о рк-оо
динатах и скоростях макрочастиц, а также об электромагнитном поле, заданном в узслеатхки,
дискретизирующей трехмерную область моделирования. В силу особенностей вычислительной
схемы метода для разных ее этапов целесообразно применять разные схемы расположения в
памяти данных о полях и макрочастицах. Это соображение справедливо как с точки зрефни-я э
фективности работы с памятью (минимизация количества кэ-пшромахов), так и в
контекстсеокращения накладных расходов на упаковку/распаковку данных при работе с векторнымои- к
мандами. Насколько известно авторам, на сегодняшний день тнуениверсального решения
данной проблемы, хотя в ряде частных случаев удается добиться хороших результат2о3в]. [
Достижение приемлемой производительности вычислений на ускорителяGхPU также
вызывает большой интерес. Так, при реализации нGаPU возникает проблема эффективной
организации доступа к памяти в условиях работы тысяч потоков и малого объема-пкаэмшяти.
Некоторые методы решения указанных проблем описаны авторамPиIC-кодов [
        <xref ref-type="bibr" rid="ref13 ref21 ref22">14, 22, 23</xref>
        ].
      </p>
      <p>Остановимся подробнее на факторах,ограничивающих производительность PIC-кодов на
Xeon Phi. Сопроцессор Intel Xeon Ph–i ускоритель вычислений общего назначения, реализован
в виде отдельной платы, присоединяемой к базовой вычислительной системе через сPлCотI
Express. Данный недостатокXeon Phi в сочетании с ограниченным объемом оперативной пяа-м
ти на сопроцессоре (–816 ГБ в зависимости от модели) может привести к низкой проиизв-од
тельности из-за необходимости копирования данных между основной системой и оурсиктелем.
Применительно кPIC-кодам эта проблема решается за счет использования достаточно болоь-ш
го числа узлов кластера, что, по крайней мере в решаемых нами задачах, позволяет уложиться в
заявленные объемы памяти.Xeon Phi содержит 61 вычислительное ядро с аппаратной дп-о
держкой до 244 потоков команд. Каждое ядро является полнофункциональным, но облне-гче
ным (не поддерживает внеочередное выполнение, прогноз ветвлений и другие усовершенос-тв
вания, значительно влияющие на произовдительность). В то же время, ядрXа eon Phi
поддерживают специально разработанный векторный набор команд, для обработки которых прае-дн
значен 512-битный блок векторных вычислений. Блок содержит 32 специальных -5б1и2тных
регистра и допускает выполнение за т1акт до 8 операций над числами плавающей точкой
двойной точности (в два раза больше, чем в AVX). Одной из отличительных особенностсе-й си
темы команд является аппаратная поддержка операций fused multi-paldyd (FMA), реализующих
операцию x = x + a ∙ b без промежуточного округления. Пиковая производительность при ср-а
четах в двойной точности составляет околоT1FLOPS, что приблизительно в 5 раз превосходит
пиковую производительность современныхCPU.</p>
      <p>Рассмотрим, какой вклад в производительностьPIC-кодов вносят отмеченные выше
особенности архитектуры. Так, уменьшение производительности ядер составляет потенциальную
проблему в связи с тем, что, например, наличиFеMA-инструкций, дающих вклад в размере
50% от пиковой производительности, далеко не всегда может быть еэфктфивно использовано в
реализации численных схем. В то же время, практика показывает, что наличие большогои-кол
чества ядер с аппаратонй поддержкой SMT можно задействовать достаточно эффективно, по
крайней мере, в тех задачах, где число частиц на ячейкуяеятвсля достаточно большим (далее
будет показано, чтопри решении некоторых задач оптимизированным кодоXмeon Phi
начинает опережатьXeon по скорости расчетов,начиная по крайней мерес 10 частиц на ячейку).</p>
      <p>С нашей точки зрения, основным фактором, лимитирущюим эффективность использования
PIC-кодов на Xeon Phi, является сложность векторизации кода. Данная проблема, описанная
выше в контексте программирования дляCPU, еще в большей степени проявляется нXаeon
Phi, обладающем более вместительными векторнымирегистрами. Код, который плохо
вектоирзуется при длине вектора 4, обычно еще хуже векторизуется при длине вектора 8. Тем не менее,
применение специальных схем векторизации кода с использованием интринсиков в сочетании с
достаточно хорошей эффективностью мсаштабируемости на общей памяти при большом числе
потоков позволяет частично решить проблему, получив в итоге выигрыш по времени пов- сра
нению с CPU. Учитывая схожесть подходов к оптимизации вычислений дCляPU и Xeon Phi,
сравнительно малые трудозатраты на дааптацию кода дляXeon Phi, а также перспективы
повяления более производительной редакции ускорителя делают его достаточно перспективным
устройством для численного моделирования плазмы.
4. Краткое описание программного комплекса PICADOR</p>
      <p>
        Программный комплекс для моделирования плазмы PICADOR ориентирован на решение
больших задач в области моделирования лазерной плазмы на гетерогенных кластерных ес-ист
мах с использованием многоядерных центральных процессоров, графических процессоров и
сопроцессоров Intel Xeon hPi. PICADOR использует метод частиц в ячейках и его расширения
для повышения точности и учета дополнительных физических эффектов. Поддерживаютсоя- к
нечно-разностные схемы FDTD f(inite difference time domain) [
        <xref ref-type="bibr" rid="ref23">24</xref>
        ] и NDF n(umerical dispersion
free) [
        <xref ref-type="bibr" rid="ref11">12</xref>
        ] для численного интегрирования уравнений поля, генерация лазерного импульса на
границе, периодические и поглощающие граничные условия25[], метод Бориса для
интегриорвания уравнений движения 1[], формфакторы частиц первого и второго рпяодка, схемы
взвешивания токов Есиркепова [
        <xref ref-type="bibr" rid="ref25">26</xref>
        ] и Вилласенора-Бунемана [
        <xref ref-type="bibr" rid="ref26">27</xref>
        ], бегущее окно, а также
динаимческая балансировка нагрузки 1[
        <xref ref-type="bibr" rid="ref7">7</xref>
        ].
      </p>
      <p>
        Программная реализация выполнена на языке C++ с использованием объектн-о
ориентированной методологии. При проектировании программного комплекса предусмотрена
возможность расширения кода новыми модулями, реализующими дополнительные численные
схемы (интерфейс MDK, Module Development Kit [
        <xref ref-type="bibr" rid="ref18">19</xref>
        ]). В 2014–2015 гг. с использованием
куазанного интерфейса реализованыи успешно интегрированы вPICADOR несколько численных
схем. Для достижения лучшей произвдоительности ядро кода, содержащее наиболее
вычиислтельно трудоемкие операции, реализованос использованием низкоуровневых структур данны.х
Расчетная часть кода является полностью параллельной. Реализация для кластерных систем
выполнена с использованием тенхологии MPI. Расчеты внутри одного узла распараллелены при
помощи технологии OpenMP. Векторизация кода для использованияSIMD-расширений
центральных процессоров достигается при помощи оптимизирующих компилятороIвntel C/C++
Compiler либо GCC. Программная реализация для графических процессоров выполнена при
помощи NVIDIA CUDA. Реализация оптимизирована с использованием возможностей разчл-и
ных уровней памяти GPU и высокоэффективных атомарных операциях в современных гир-аф
ческих процессорах. Перенос вычислений наIntel Xeon Phi в основном не требовал
значитеьлной модификации кода. Так, многие оптимизации кода, изначально выполняемые для поев-ыш
ния производительности наXeon Phi, сокращали время работы программы и на центральном
процессоре. Тем не мнеее, для лучшей векторизации численных схем нXаeon Phi были
разработаны низкоуровневые реализации с использованием интринсиков.
      </p>
      <p>При выполнении расчетовPICADOR показывает следующие результаты
производительонсти и масштабируемости. Эффективность сильной мсшатабируемости на распределенной
памяти PICADOR достигает 70% при переходоет 16 до 2048 ядерCPU. Эффективность сильной
масштабируемости на общей памяти в некоторых задачах достигает 99% при перехоотде1 до
16 ядер CPU, для Xeon Phi– 78% при переходеот 1 до 60 ядер. Ускорение при использовании
сопроцессора Xeon Phi составляет около 2 раз по сравнению-ясде8рным центральным
процессором. Все перечисленные результаты получены при выполниеин расчетов в двойной точности.</p>
      <p>Программный комплекс PICADOR активно используется в научных расчетах. С его по-м
щью был решён ряд актуальных задач современной физики плазмы. В частности, была па-оказ
на возможность эффективной генерации пучка высокоэнергичных многозарядных ионов при
облучении структурированных твердотельныхмишеней, был обнаружен новый режим
взаиомдействия в условиях доминирования радиационных потер–ь так называемый аномальный
ардиационный захват, – был проведён ряд работ по исследованию динамики взаимодействия в
условиях развития квантовоэлектродинамическихкаскадов – электрон-позитронных лавин,
рождающихся в сверхсильных полях. Расчеты ведутся с использованием суперкомпьютеров
МВС-100К, МВС-10П (МСЦ РАН),«Ломоносов» (МГУ), «Лобачевский» (ННГУ).
5. Тестовая инфраструктура и способ оценки производительности
При выполнении экспериментов использовался узел кластера ННГУ
«Лобачевски,й»содержащий 2 процессора Intel Sandy Bridge E-25660 2.2 ГГц (8 ядерна каждомCPU), 64 ГБ
оперативной памяти и 2 сопроцессорIаntel Xeon Phi 5110P (60 ядер, 240 потоков, память Г8Б).
Задачи запускались либо на двухCPU с использованием всех доступных вычислительных ядер (2
процесса по 8 потоков в каждом), либо на двXуeхon Phi (2 процесса по 240 потоков в каждом).
Предварительно было установлено, что данный режим запуска в больштивнес случаев является
оптимальным для текущей реализации. Сравнение производительности выполнялось на
кжадом этапе вычислительной схемыи в целом, отдельно замерялось время обменов даннымПир. и
обсуждении задач и достигнутых результатовобращалось внимание на следующиефакторы,
влияющие на производительность: число макрочастиц на ячейку; наличие или
отсутствиедисбаланса нагрузки между процессами в результате разбиения расчетной области на
домен;ыналичие или отсутствиедисбаланса между потоками в одном домене.</p>
      <p>
        На графиках производительности используются следующие краткие обозначения этапов и
расширений метода частиц в ячейках: «Токи–»взвешивание токов, «Частицы»– интерполяция
поля и движение частиц, F«DTD» – интегрирование уравнений поля, «PML» – поглощающие
граничные условия, «Генератор»– генерация импульса на границе расчетной области«,QED» –
рождение фотонов и электро-нпозитронных пар, «Обмены» – общее время обменов данными
между узлами, «Вычисление»– общее время вычислительной части.
Одной из актуальных пролбем современной физики взаимодействия лазерного излучения
сверхвысокой интенсивности с веществом является генерация и ускорение пучков протонов и
других ионов 2[
        <xref ref-type="bibr" rid="ref8">8</xref>
        ]. При относительно небольших интенсивностях излучения, не превышающих
1020 Вт/см2, наиболее эффективнымспособом ускорения является так называемый метод TNSA
(target normal sheath acceleration) [
        <xref ref-type="bibr" rid="ref28">29</xref>
        ]. В этом методе ускорение происходит с обратной стороны
тонкой (толщиной от нескольких нанометров до нескольких микрон) металлической фольги
или пластиковой пленки, облучаемой сфокусированнымлазерным импульсом. Ускорение
порисходит за счет квазистатического поля, возникающего при разлете облака электронов, ен-агр
тых лазерным излучением до релятивистских температур.
      </p>
      <p>Несмотря на простоту реализации, метод TNSA, однако, обладает относительно нсеовкыой
эффективностью – даже в наилучших условиях в энергию ускоряемых протонов идёт не более
нескольких процентов энергии падающего лазерного импульса30[]. В последнее время
обсуждается несколько способов увеличения эффективности. Один из них заключается в том, чтобы
нанести на облучаемую поверхность мишени субволновые неоднородности, которые улучшили
бы поглощение лазерного излучения и тем самым увеличили боыликчество энергии,
передаваемой частицам 3[1]. Эта задача анализировалась в ряде работ путем двумерного моделиар-ов
ния. Однако для анализа ситуации в реальном экспиемренте, особенно в случае
неоднородонстей сложной формы, необходимо проведение полномасштабного трехмерного моделирования,
которое требует большого количества вычислительных ресурсов. По этой причине такое ем- од
лирование может в значительной степени выигрьатот использования Xeon PhiД. ля
демонстрационных целей предполагалось, что лазерный импульс падает нормально на мишень и имеет
относительно широкий поперечный размер. Это позволило решать задачу в предположении
представления импульса в виде плоской волныО.блучаемая мишень представляла собой
фоьлгу толщиной 0,3 мкм, состоящую из ионов золота 19A7+u31, компенсированных
соответствующим количеством электронов. Концентрация электронов в слое составлял∙а10321 см-3. Слой
ускоряемых протонов располагался на обртаной стороне мишени и имел толщину 0м,1км. На
облучаемую поверхность мишени были нанесены периодические прямоугольные неоднороод-н
сти, образующие так называемую наногребенку. Период наногребенки составлял 0,5 мкым,- в
сота – 0,3 мкм, а толщина отдельного выступ–а 0,15 мкм. Начальная температура плазмы вр-а
нялась 100 эВ, что является обычным значением для столкновительного нагрева в поле мо-ощн
го лазерного излучения.</p>
      <p>Как было отмеченовыше, лазерный импульс предполагался бескоенчным в поперечном
направлении за счет использования периодических граничных условий. В продольном навп-ра
лении он имел форму кривой Гаусса с шириной на полувысоте по амплитуде равной 42 фс.
Длина волны излучения равнялась 1 мкм. Интенсивность излучения авксмимуме достигала
значения 3,75∙1019 Вт/см2. Такие параметры являются типичными для тит-аснапфировых
лазерных систем пиковой мощностью в десятки тераватт, широко распространенных в современных
лабораториях. Расчетная область имела физические размеры 1×21×1 мкм, а соответствующая
сетка – 512×64×64 ячеек. Шаг по времени составил 0,026 фс, а полное время расч–ё3т0а0 фс,
таким образом,было совершено 11 512 шагопво времени.
Рис. 2. Зависимость максимальной энергии ускоренных протонов от числа макрочастиц на ячейку
Одним из важнейших параметров PI-Cмоделирования является число макрочастицна
ячейку (particles per cell, ppc). Обсуждаемая задача отличается существенным влиянием, коо-т
рое оказывает данный параметр на результаты моделирования. Какпоказано на рисунке 2, при
варьировании ppc от 10 до80 наблюдается непрерывный рост максимальной энергии
усконреных протонов в конце расчета, пока он не достигает своего максимума в11М4,э8В. Это
объясняется тем фактом, чтомалого числа частицне хватает для разрешения «хвоста» функции
распределения нагретых электронов по энергиям. В то же время известно, что име«нхнвоост»
этого распределения определяет максимальную энергию, которую может полиутчь ускоренный
протон. Учитывая тот факт, что начиная с 80 макрочастиц на ячейку рост максимальнойр-эне
гии прекращается, именно это значение лучше всего использовать для численного моделиа-ров
ния.</p>
      <p>Рис. 3. Время расчета на разных этапах метода частиц в ячейках с использовандивеумх CPU или двух
Xeon Phi. Число макрочастицна ячейкуppc варьируется от 10 до 8.0Столбцы, соответствующие времени
расчета при разном значенииppc, наложены друг на друга
Проанализируем производительность приложенияпри изменении числа макрочастицна
ячейку (ppc) от 10 до 80(рисунок 3). Из диаграммы видно, чтонезависимо от значенияppc
Xeon Phi уверенно опережает Xeon как по времени вычислительной части (до 2,6 раза при
ppc = 80), так и по общему времени счета (д,о621 раза приppc = 80), причем с ростомppc
преимущество ожидаемо возрастает вместе с объемом вычислени.йДанная картина наблюдается
на всех этапах расчета за искюлчением обменов, гдеXeon Phi в несколько раз отстает оCтPU.
Данное соотношение времен в основном обусловлено необходимостью обмена информацией
между MPI-процессами. При работе врамках одного узлаобмен данными междуCPU
реализуется средствами MPI на общей памяти,тогда как при использовании Xeon Phi требуются
дополнительные обмены данными между ускорителем иCPU. В целом при решении данной за-д
чи реализация дляXeon Phi показывает свою эффективность.
7. Компрессия лазерных импульсов на кильватерной плазменной
волне</p>
      <p>Другой задачей, на которой проводилось сравнение производительностCиPU и Xeon Phi,
является компрессия фемтосекундных лазерных импульсов до предель-нкооротких
длительностей (1–2 периода поля). В настоящее время хорошо освоена технология генерации феме-тос
кундных лазерных импульсов с длиной волны0,8–1 мкм петаваттного уровня мощности[32].
Длительность импульсов на выходе из лазерной системы составляет около 10 периодов поля.
Однако в ряде приложений, таких как генерация аттосекундных импульсиоувскорение частиц,
требуются мощные предельно короткие лазерные импульсы. Генерация таких импульсов в
рамках лазерной системыявляется труднопреодолимой задачей, поэтому необходимы другие
способы укорочения лазерных импульсов. Одним из способов является компрессия фемет-ос
кундных импульсов кильватерной плазменной волной, возбуждаемой самим импульсо[м33].
Для создания плазмы используется струя газа, который ионизируется под действием лазерного
импульса. Ввиду неоднородности распределения электронов в плазменной волне, передний
фронт импульса движется в более плотной плазмеи,меет меньшую скорость, чем задний
фронт, двигающийся в менее плотной плазме. Такое взаимодействие приводит к компрессии и
формированию резкого переднего фронта импульсаВ. ажное и недостаточно изученное влияние
накладывает эффект нестационарной самофокусиорвки коротких импульсов[34], ввиду чего
необходимо использование трехмерного моделирования. При численном моделировании
днаной задачи необходимо использовать болшьое число макрочастиц, чтобы исключить влияние
шумов пространственного распределения плазмы, определяющего компрессию.</p>
      <p>Для моделирования описанного взаимодействия использовался линейн-пооляризованный
импульс с огибающейsin2, длительностью 30 фс по полуширне интенсивности и
супергаусосвым поперечным профилем с диаметром 10 мкм. Длина волсноыставляла 0,8 мкм, пиковая
нитенсивность являлась равной 3,3∙1019 Вт/см2. Лазерный импульс фокусируется на однородную
плазму с концентрацией ∙81018 см-3. Расчетная область 20×24×24 мкм разбивалась на
256×128×128 ячеек. Количество макрочастиц на ячейку равнялос2ь0.</p>
      <p>Рис. 4. Время расчета на разных этапах метода частиц в ячейках с использованием дCвPуUх или двух</p>
      <p>
        Xeon Phi. Число макрочастицна ячейкуppc = 20
Полученные времена счета на двухXeon Phi по сравнению с двумяCPU представлены на
рисунке 4. Как и в предыдущей задач,еXeon Phi опережает CPU на всех наиболее трудоемких
этапах расчета, кроме обменов. Выигрыш по времени работы вычислительной части составляет
1,5 раза, тогда как общее время расчета с учетом обменов данными лучшеXдeлoяn Phi в 1,25
раза. На первый взгляд может сложиться впечатнлеие, что данные показатели выглядят
существенно скромнее, чемитоговые результаты в предыдущей задаче, но этов полной
мереобъясняется в 4 раза меньшим числом частиц, задействованных в расчетДаехй.ствительно, в
предыдущей задаче приppc = 20 два Xeon Phi обгоняют два CPU в 1,21 раза, что весьма близко кб-о
суждаемому результату. В целом необходимо отметить, что использование реализации для
Xeon Phi для решения данной задачиявляется целесообразным.
В сверхсильных электромагнитных полях (&gt;1203 Вт/см2) становятся возможными
приницпиально новые процессы (испускание жестких фотонов и рождение такими фотонами элект-рон
позитронных пар), которые открывают новые режимы взаимодействия в плазме, в частности
каскадную генерацию частиц 3[
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]. Подобные режимы планируется достичь в рамках проекта
XCELS [
        <xref ref-type="bibr" rid="ref33">36</xref>
        ] при взаимодействии релятивистскисильных лазерных полей с плазменнмыи
мишенями. Отметим, что гамм-аизлучение находит большое примененеи в ядерной
физикеп:олучение радиоизотопов для медицины, неинвазивный анализ ядерных отходов, генерацияй-не
тронных пучков.
      </p>
      <p>
        Дипольная волна представляет осбой инвертированное излучение диполя и реализует еи-д
альную фокусировку лазерного излучения.Данную структуру поля в рамках проекта XCELS
планируется моделировать в виде 12 сходящихся лазерных пучков, позволяющих достичьо-в ф
кусе интенсивностей на уровне 0126 Вт/см2. В рассматриваемой задаче дипольная волна в рф-о
ме полубесконечного импульса с резким передним фронтом падает на плазменную мишень. На
начальном этапе мишень сжимается в центр расчетной области. После этого при превышении
порогового значения интенсивности лазерного поля развивается электромагнитный каска,дв
процессе которого число электронов, позитронов и фотонов в области каскада растет оэ-ксп
ненциально. Такое взаимодействие перспективнос точки зрения эффективной конверсии
алзерной энергии вэнергию узконаправленного гамма-излучения [
        <xref ref-type="bibr" rid="ref34">37</xref>
        ].
      </p>
      <p>Для моделирования описанного взаимодействия использовалась полубесконечная дипьо-л
ная волна с резким передним фронмто. Длина волнысоставляла λ = 0,9 мкм, мощность
дипоьлной волны – 40 ПВт. Лазерный импульс фокусируется на однородную плазменную мишень
диаметром 3 длины волны с концентрацией 1160см-3. Расчетная область ×44×4 мкм разбивается
на 256×256×256 ячеек. Количество макрочастиц на ячейку в начале расчетравно 20, однако в
процессе развития каскада данный параметр сильно растет. При этом каскад идет в силгь-но о
раниченной области размером порядка 0.2 ×λ 0.2 λ × 0.5 λ вблизи центра расчетной области,
что приводит к сильно неоднородному распределению частиц по ячейкам.</p>
      <p>Отметим, что неконтролируемое увеличение числа частиц может привести к неудовлое-тв
рительным затратам памяти и чрезмерному времени расчета. Для нивелирования даннофго- э
фекта при превышении некотроого порогового числа частиц в домене запускается процедура
объединения частиц с близкими свойствамиП.роцессы генерации новых и объединения
суещствующих частиц выполняются в рамках одного из этапов расчетного цикQлаED( ), не
задействованного при решении епрвых двух задач.</p>
      <p>На рисунке 5 представлено сравнение времени работы двXухeon Phi и двух CPU при
решении данной задачи.Было обнаружено, что появившийся дополнительный этап расчета зиа-н
мает существенное время как нCаPU, так и наXeon Phi. В целом результаты показывают, что
данная задача не является перспективной с точки зрения использования текущей реализации
для Xeon Phi в связи с ее отставанием по времени в 1,4 раза.
Рис. 5. Время расчета на разных этапах метода частиц в ячейках псоилсьзованием двухCPU или двух</p>
      <p>Xeon Phi. Число макрочастиц на ячейкpуpc в начале расчета равно 20
Рис. 6. Зависимость времени выполнения блоков последовательных итераций по времеонти среднего
числа макрочастицна ячейкуи дисбаланса нагрузки. Используются дваCPU или два Xeon Phi
Рис. 7. Концентрация макрочастиц в начале расчета ипвериод возникновения каскада
Вследствие того, чтопреобладающее число макрочастиц сосредоточено в малой частиср-а
четной области(рисунок 7), привычислениях на Xeon Phi возникает дисбаланс нагрузки между
потоками (голубая линия на рисунке )6. При этом отношение между максимальным и средним
числом макрочастиц, обрабатываемых потоками, достигает 8. Отметим, что при аналогичном
расчете на CPU используется всего 16 потоков, в связи с чеамналогичное отношение не
превышает 1,5. Наличие дисбаланса нагрузки нраяду с интенсивной работой процедур
создания/объединения частицприводит к росту времени расчетакак наXeon Phi, таки наCPU. При
этом потеря эффективности параллелизма в текущей реализациниа Xeon Phi приводит
кзначительно более существенному замедленюи, что и оказывает определяющее воздействие на ои-т
говое соотношение времен.Данный эффект может быть преодолен за счет создания интекл-ле
туального планировщика, учитывающего динамику изменения числа макрочастиц в ячейках,
что является одним из перспективнынхаправлений дальнейшей работы.
9. Заключение</p>
      <p>В работе представлена оптимизированная дляIntel Xeon Phi реализация метода частиц в
ячейках для моделирования лазерной плазмы, выполненная в рамках программного комплекса
PICADOR. Сформулированы основные факторы, влияющие на производительностPьIC-кодов
на разных уровнях параллельных вычислительных системВ. отличие отранее опубликованных
результатов успешного использованияXeon Phi при решении модельной задачи, выполнен
анлиз производительности в сравнении с многоядернымCPU в трех реальных расчтеах.</p>
      <p>Во всех рассмотренных задачах встречаетсясущественно неравномерное распределение
частиц в расчетной области. Данная разновидностьдисбаланса может затруднить достижение
хорошей производительности и на CPU, и наXeon Phi, однако при надлежащем
разбиенииболасти на домены во всех задачах удается достичь достаточного баланса нагрузки междоу- пр
цессами. Следующим фактором, существенно влияющим на фэфективность использования
Xeon Phi по сравнению с многоядернымCPU, является число макрочастиц на ячейку, испоь-л
зуемое в расчетах.Показано, что даже при 10макрочастицах на ячейкуXeon Phi вполне может
обогнать CPU, и эта разница увеличивается вмеестсчислом используемыхмакрочастиц.</p>
      <p>Тем не менее,существует еще одна особенность,ограничивающая класс задач, для
решения которых целесообразно использовать обсуждаемую реализациюметода частиц в ячейках
для Xeon Phi. Данная особенность в полной мере проявялется в третьей задаче и приводит к
отставанию по сравнению с CPU. Суть эффекта заключается внеобходимости учета при
моедлировании процессов создания/объединения частиц в сочетании с существенным изменением
их количества и положенияв расчетной област и. Разработка планировщика, регулирующего
нагрузку между потоками наXeon Phi, является одним из направлений дальнейшей работы.</p>
      <p>Подводя итоги, необходимо отметить, чтоXeon Phi может быть эффективно использован
для численного решения задач физики плазмы проагмрмным комплексом PICADOR с учетом
описанных выше ограничений.
Литература
32. Sung J. H. et al. // Opt. Lett. 2010. Vol. 35, No. 3021.
Case study of using Intel Xeon Phi for solving particle-in-cell
plasma simulation problems
Iosif Meyerov, Sergey Bastrakov, Igor Surmin, Arkady Gonoskov, Evgeny Efimenko, Aleksei
Bashinov, Artem Korzhimanov, Anton Larin, Alexander Muraviev, Anatoly Rozanov and
Mikhail Savichev</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          6.
          <article-title>Лазерное ускорение протонов в тонких мишенях с субволновыми неоднородностями на облучаемой стороне</article-title>
          .
          <source>Моделирование на Xeon Phi</source>
          <volume>8</volume>
          .
          <string-name>
            <surname>Генерация</surname>
          </string-name>
          гамма
          <article-title>-излучения в сходящейся дипольной волне</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <surname>Hockney</surname>
            <given-names>R.</given-names>
          </string-name>
          ,
          <source>Eastwood J. Computer Simulation Using Particles. IOP, Bristol and NY</source>
          ,
          <year>1989</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          3.
          <string-name>
            <surname>Tskhakaya D. The</surname>
          </string-name>
          Particle-in-Cell Method // Computational Many-
          <source>Particle Physics. Lecture Notes in Physics</source>
          ,
          <year>2008</year>
          . Vol.
          <volume>739</volume>
          . P.
          <volume>161</volume>
          -
          <fpage>189</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          4.
          <string-name>
            <surname>Tarakanov</surname>
            <given-names>V.P.</given-names>
          </string-name>
          <article-title>User's Manual for Code KRAAT</article-title>
          . Springfield, VA: Berkeley Research Associates,
          <year>1992</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          5.
          <string-name>
            <surname>Romanov</surname>
            <given-names>D.V.</given-names>
          </string-name>
          , et al.
          <article-title>Self-Organization of a Plasma due to 3D Evolution of the Weibel Instability // Phys</article-title>
          . Rev.
          <source>Lett</source>
          .
          <year>2004</year>
          . Vol.
          <volume>93</volume>
          , No.
          <volume>215004</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          6.
          <string-name>
            <surname>Popov</surname>
            <given-names>K.I.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bychenkov</surname>
            <given-names>V.</given-names>
          </string-name>
          <string-name>
            <surname>Yu.</surname>
          </string-name>
          , et al.
          <article-title>Vacuum electron acceleration by tightly focused laser pulses with nanoscale targets // Phys</article-title>
          . Plasmas.
          <year>2009</year>
          . Vol.
          <volume>16</volume>
          ., No.
          <volume>053106</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          7.
          <string-name>
            <surname>Nerush</surname>
            <given-names>E.N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kostyukov</surname>
            <given-names>I.</given-names>
          </string-name>
          <string-name>
            <surname>Yu</surname>
          </string-name>
          .
          <article-title>Carrier-Envelope Phase Effects in Plasma-Based Electron Acceleration with Few-Cycle Laser Pulses // Phys</article-title>
          . Rev.
          <source>Lett</source>
          .
          <year>2009</year>
          . Vol.
          <volume>103</volume>
          . No.
          <volume>035001</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          8.
          <string-name>
            <surname>Kraeva</surname>
            <given-names>M.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Malyshkin</surname>
            <given-names>V.E.</given-names>
          </string-name>
          <string-name>
            <surname>Assembly</surname>
          </string-name>
          <article-title>Technology for Parallel Realization of Numerical Models on MIMD-Multicomputers /</article-title>
          / FGCS.
          <year>2001</year>
          . Vol.
          <volume>17</volume>
          , No. 6. P.
          <volume>755</volume>
          -
          <fpage>765</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          10.
          <article-title>Переп лкина А</article-title>
          .Ю.,
          <source>ЛевченкоВ</source>
          .Д.,
          <string-name>
            <surname>Горячев</surname>
            <given-names>И</given-names>
          </string-name>
          .А.
          <article-title>Трехмерный кинетический код CFHall дял моделирования</article-title>
          замагниченной плазмы// Матем. Моделир.
          <year>2013</year>
          . Т.
          <volume>25</volume>
          , №11. С.
          <volume>98</volume>
          -
          <fpage>110</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          11.
          <string-name>
            <surname>Fonseca</surname>
            <given-names>R.A.</given-names>
          </string-name>
          , et al.
          <article-title>Exploiting multi-scale parallelism for large scale numerical modelling of laser wakefield accelerators // Plasma Physics</article-title>
          and
          <string-name>
            <given-names>Controlled</given-names>
            <surname>Fusion</surname>
          </string-name>
          .
          <year>2013</year>
          . Vol.
          <volume>55</volume>
          , No.
          <volume>124011</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          12.
          <string-name>
            <surname>Pukhov</surname>
            <given-names>A</given-names>
          </string-name>
          .
          <string-name>
            <surname>Three-Dimensional Electromagnetic Relativistic</surname>
          </string-name>
          Particle-in
          <source>-Cell code VLPL // Journal of Plasma Physics</source>
          .
          <year>1999</year>
          . Vol.
          <volume>61</volume>
          . P.
          <volume>425</volume>
          -
          <fpage>433</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          13.
          <string-name>
            <surname>Bowers K.J.</surname>
          </string-name>
          , et al.
          <article-title>Advances in petascale kinetic plasma simulation with VPIC</article-title>
          and Roadrunner // J. Phys.: Conf. Ser.
          <year>2009</year>
          . Vol.
          <volume>180</volume>
          . P. 1-
          <fpage>10</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          14.
          <string-name>
            <surname>Burau</surname>
            <given-names>H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Widera</surname>
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Honig</surname>
            <given-names>W.</given-names>
          </string-name>
          , et al.
          <article-title>PIConGPU: A Fully Relativistic Particle-in-Cell Code for a GPU Cluster /</article-title>
          / IEEE Transactions on Plasma Science.
          <year>2010</year>
          . Vol.
          <volume>33</volume>
          . P.
          <volume>2831</volume>
          -
          <fpage>2839</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          15.
          <string-name>
            <surname>Bastrakov</surname>
            <given-names>S.</given-names>
          </string-name>
          , et al.
          <source>Particle-in-cell plasma simulation on heterogeneous cluster systems // Journal of Computational Science</source>
          .
          <year>2012</year>
          . Vol.
          <volume>3</volume>
          . P.
          <volume>474</volume>
          -
          <fpage>479</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          16.
          <string-name>
            <surname>Bastrakov</surname>
            <given-names>S.</given-names>
          </string-name>
          , et al.
          <article-title>Particle-in-Cell Plasma Simulation on CPUs, GPUs</article-title>
          and Xeon Phi Coprocessors // ISC, LNCS.
          <year>2014</year>
          . Vol.
          <volume>8488</volume>
          . P.
          <volume>513</volume>
          -
          <fpage>514</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          17.
          <string-name>
            <surname>Бастраков</surname>
            <given-names>С</given-names>
          </string-name>
          .
          <article-title>И. и др.Динамическая балансировка в кодеPICADOR для моделирования плазмы // Вычислительные методы и программировани</article-title>
          .
          <source>2е013. Т. 14. С</source>
          .
          <volume>67</volume>
          -
          <fpage>74</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          18.
          <string-name>
            <surname>Сурмин</surname>
            <given-names>И</given-names>
          </string-name>
          .
          <article-title>А.и др. Моделирование плазмы методом частиц в ячейках с использованиеом- с процессоров</article-title>
          <source>Intel Xeon Phi // Вычислительные методы и программирование2.014. Т. 15. С</source>
          .
          <volume>530</volume>
          -
          <fpage>536</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          19.
          <string-name>
            <surname>Gonoskov</surname>
            <given-names>A.</given-names>
          </string-name>
          , et al.
          <article-title>Extending PIC schemes for the study of physics in ultra-strong laser fields /</article-title>
          / arXiv preprint arXiv:
          <volume>1412</volume>
          .
          <fpage>6426</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          20.
          <string-name>
            <surname>Surmin</surname>
            <given-names>I.A.</given-names>
          </string-name>
          et al.
          <article-title>Particle-in-</article-title>
          <string-name>
            <surname>Cell</surname>
          </string-name>
          Laser-Plasma Simulation on Xeon Phi Coprocessors // arXiv preprint arXiv:
          <volume>1505</volume>
          .
          <fpage>07271</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          21.
          <string-name>
            <surname>Nakashima</surname>
            <given-names>H</given-names>
          </string-name>
          .
          <article-title>Manycore challenge in particle-in-cell simulation: How to exploit 1 TFlops peak performance for simulation codes with irregular computation // Comp</article-title>
          . &amp;
          <string-name>
            <surname>El</surname>
          </string-name>
          . Engineering.
          <year>2015</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          22.
          <string-name>
            <surname>Bussmann</surname>
            <given-names>M.</given-names>
          </string-name>
          et al.
          <source>Radiative Signatures of the Relativistic Kelvin-Helmholtz Instability // Proceedings SC13: Int. Conference for HPC, Networking, Storage and Analysis</source>
          ,
          <year>2013</year>
          . - 5-1.
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          23.
          <string-name>
            <surname>Decyk</surname>
            <given-names>V.K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Singh</surname>
            <given-names>T.V.</given-names>
          </string-name>
          <article-title>Particle-in-cell algorithms for</article-title>
          emerging computer architectures // Computer Physics Communications.
          <year>2014</year>
          . Vol.
          <volume>185</volume>
          , No. 3. P.
          <volume>708</volume>
          -
          <fpage>719</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref23">
        <mixed-citation>
          24.
          <string-name>
            <surname>Taflove</surname>
            <given-names>A.</given-names>
          </string-name>
          <string-name>
            <surname>Computational</surname>
          </string-name>
          <article-title>Electrodynamics: The Finite-Difference Time-Domain Method</article-title>
          . London: Artech House,
          <year>1995</year>
          . 599 p.
        </mixed-citation>
      </ref>
      <ref id="ref24">
        <mixed-citation>
          25.
          <string-name>
            <surname>Berenger J.-P. A Perfectly Matched</surname>
          </string-name>
          <article-title>Layer for the Absorption of Electromagnetic Waves /</article-title>
          / Journal of Computational Physics,
          <year>1994</year>
          . Vol.
          <volume>114</volume>
          . P.
          <volume>185</volume>
          -
          <fpage>200</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref25">
        <mixed-citation>
          26.
          <string-name>
            <surname>Esirkepov</surname>
            <given-names>T.</given-names>
          </string-name>
          <article-title>Exact charge conservation scheme for Particle-in-Cell simulation with an arbitrary form</article-title>
          -factor // Computer Physics Communications,
          <year>2001</year>
          . Vol.
          <volume>135</volume>
          . P.
          <volume>144</volume>
          -
          <fpage>153</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref26">
        <mixed-citation>
          27.
          <string-name>
            <surname>Villasenor</surname>
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Buneman</surname>
            <given-names>O</given-names>
          </string-name>
          .
          <article-title>Rigorous charge conservation for local electromagnetic</article-title>
          field solvers // Computer Physics Communications.
          <year>1992</year>
          . Vol.
          <volume>69</volume>
          , No. 2. P.
          <volume>306</volume>
          -
          <fpage>316</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref27">
        <mixed-citation>
          28.
          <string-name>
            <surname>Macchi</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Borghesi</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Passoni</surname>
            <given-names>M.</given-names>
          </string-name>
          <article-title>Ion acceleration by super-intense laser-plasma interaction</article-title>
          // Reviews of Modern Physics.
          <year>2013</year>
          . Vol.
          <volume>85</volume>
          . P.
          <volume>58</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref28">
        <mixed-citation>
          29.
          <string-name>
            <surname>Wilks S.C.</surname>
          </string-name>
          , et al.
          <article-title>Energetic proton generation in ultra-intense laser-solid interactions</article-title>
          // Physics of Plasmas.
          <year>2001</year>
          . Vol.
          <volume>8</volume>
          , No.
          <volume>542549</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref29">
        <mixed-citation>
          30.
          <string-name>
            <surname>Green</surname>
            <given-names>J.S.</given-names>
          </string-name>
          , et al.
          <article-title>High efficiency proton beam generation through target thickness control in femtosecond laser-plasma interactions //</article-title>
          <source>Appl. Phys. Letters</source>
          .
          <year>2014</year>
          . Vol.
          <volume>104</volume>
          , No.
          <volume>214101</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref30">
        <mixed-citation>
          31.
          <string-name>
            <surname>Pae K.H.</surname>
          </string-name>
          , et al.
          <article-title>Proposed hole-target for improving maximum proton energy driven by a short intense laser pulse</article-title>
          // Physics of Plasmas.
          <year>2009</year>
          . Vol.
          <volume>16</volume>
          , No.
          <volume>073106</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref31">
        <mixed-citation>
          33.
          <string-name>
            <surname>Pipahl</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Anashkina</surname>
            <given-names>E. A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Toncian</surname>
            <given-names>M.</given-names>
          </string-name>
          et al. // Phys. Rev.
          <string-name>
            <surname>E.</surname>
          </string-name>
          <year>2013</year>
          . Vol.
          <volume>87</volume>
          ., No.
          <volume>033104</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref32">
        <mixed-citation>
          35.
          <string-name>
            <surname>Bell</surname>
            <given-names>A.R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kirk</surname>
            <given-names>J.G.</given-names>
          </string-name>
          <article-title>Possibility of Prolific Pair Production with High-Power Lasers // Phys</article-title>
          . Rev.
          <source>Lett</source>
          .
          <year>2008</year>
          . Vol.
          <volume>101</volume>
          , No.
          <volume>200403</volume>
          .
        </mixed-citation>
      </ref>
      <ref id="ref33">
        <mixed-citation>
          36.
          <string-name>
            <surname>Bashinov</surname>
            <given-names>A.V.</given-names>
          </string-name>
          , et al.
          <article-title>New horizons for extreme light physics with mega-science project</article-title>
          <source>XCELS // Eur. Phys. J. Special Topics</source>
          .
          <year>2014</year>
          . Vol.
          <volume>223</volume>
          . P.
          <volume>1105</volume>
          -
          <fpage>1112</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref34">
        <mixed-citation>
          37.
          <string-name>
            <surname>Gonoskov</surname>
            <given-names>A.</given-names>
          </string-name>
          , et al.
          <source>Anomalous Radiative Trapping in Laser Fields of Extreme Intensity // Phys. Rev. Lett</source>
          .
          <year>2014</year>
          . Vol.
          <volume>113</volume>
          , No.
          <volume>014801</volume>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>