<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Robot Path planning using reinforcement learning and nonlinear approximation function (Planeación de trayetoria utilizando aprendizaje por reforzamiento y función de aproximación)</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Miguel Angel Rodriguez Ruiz</string-name>
          <email>al115156@alumnos.uacj.mx</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Luis Pérez Domínguez</string-name>
          <email>luis.dominguez@uacj.mx</email>
          <xref ref-type="aff" rid="aff2">2</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>David Luviano Cruz Luis Carlos Mendez Gonzalez</string-name>
          <email>david.luviano@uacj.mx</email>
          <email>david.luviano@uacj.mx Email: luis.mendez@uacj.mx</email>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Ciudad Universitaria, Universidad Autónoma de Ciudad Juárez</institution>
          ,
          <addr-line>Ciudad Juárez Chihuahua</addr-line>
          <country country="MX">México</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Universidad Autónoma de ciudad Juárez Universidad Autónoma de ciudad Juárez</institution>
          ,
          <addr-line>Ciudad Juárez Chihuahua</addr-line>
          <country>México Ciudad Juárez Chihuahua México</country>
        </aff>
        <aff id="aff2">
          <label>2</label>
          <institution>Universidad Autónoma de ciudad Juárez</institution>
          ,
          <addr-line>Ciudad Juárez Chihuahua</addr-line>
          <country country="MX">México</country>
        </aff>
      </contrib-group>
      <abstract>
        <p>-In the present work we address the problem of dimensionality in reinforcement learning, this problem is called the curse of dimensionality, which is reflected in the increase of the state-action pairs to be learned, this happen when the number of actions and states in the environment increase, in this manner we propose to use a nonlinear approximation function (neural network) to offer an appriximate action to the agent when this is in a unknokn state in the task, this proposal will be validated by the planning of trajectories for a mobile robot in a unknown environtment using reinforcement learning.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>En el presente trabajo se aborda el problema de la
dimensionalidad en el aprendizaje por reforzamiento, este problema se
denomina la maldición de la dimensionalidad, lo que se refleja en
el aumento de los pares estado-acción a aprender, lo que ocurre
cuando el número de acciones y estados en el entorno aumenta
, se propone utilizar una función de aproximación no lineal
(red neuronal) para ofrecer una acción aproximada al agente
cuando éste se encuentre en un estado desconocido en la tarea,
esta propuesta será validada por la planificación de trayectorias
para un móvil robot en un entorno desconocido utilizando el
aprendizaje por reforzamiento.</p>
      <p>I. INTRODUCCIÓN</p>
      <p>
        Diversos tipos de funciones de aproximación han sido
propuestos en el campo de la teoría de control y del
aprendizaje máquina, entre ellos, las redes neuronales ofrecen la
particularidad de realizar aproximaciones de funciones no
lineales, siempre y cuando se tenga acceso a una serie de
datos de entrenamiento adecuados [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. En lo que refiere
tareas en que involucran sistemas no lineales o sistemas en
donde una programación previa para resolver un problema
no es posible, el aprendizaje por reforzamiento (RL) ha sido
utilizado con éxito[
        <xref ref-type="bibr" rid="ref2">2</xref>
        ], ya que permite a los agentes aprender
nuevos comportamientos de tal manera que puedan predecir y
adaptarse a los cambios en el medio en donde se desarrollan
[
        <xref ref-type="bibr" rid="ref3">3</xref>
        ].
      </p>
      <p>
        El aprendizaje por reforzamiento es un método semi
supervisado de aprendizaje, en donde el objetivo es maximizar una
función de recompensa escalar la cual es definida por el
entorno y las entidades que interactúan con el entorno llamados
agentes [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ]. En cada paso de aprendizaje, el agente toma una
medición del entorno y toma una acción, lo que motiva que el
entorno transite a un nuevo estado, esta transición es evaluada
por medio de la función de recompensa escalar, es importante
mencionar, que a los agentes no se les dice que acción tomar,
por lo que deben de explorar el entorno para encontrar las
acciones que le proporcionen una mayor recompensa[
        <xref ref-type="bibr" rid="ref12">12</xref>
        ].
      </p>
      <p>
        La realimentación utilizado por el aprendizaje por
reforzamiento en forma de función de recompensa es menos
informativo que un método de aprendizaje supervisado tal como una
red neuronal artificial, pero más informativo que un método
de aprendizaje supervisado tal como clustering [
        <xref ref-type="bibr" rid="ref15">15</xref>
        ].
      </p>
      <p>
        Distintos tipos de aplicaciones del aprendizaje por
reforzamiento han tenido cabida en la teoría control, entre ellos, para
manejar y controlar una red inteligente eléctrica[
        <xref ref-type="bibr" rid="ref4">4</xref>
        ],por medio
de visión y RL enseñar a un robot a realizar disparos de una
pelota a una meta [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ],utilizar RL profundo para que un brazo
manipulador aprenda movimientos en 3D [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ], para coordinar
actividades cooperativas entre agentes [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ].
      </p>
      <p>
        Un área en donde el aprendizaje por reforzamiento ha sido
provechoso es la planeación de trayectoria para robots móviles,
en donde se genera una trayectoria desde un punto de inicio
hasta un punto final respetando ciertas restricciones impuestas
al desplazamiento, tales como obstáculos, delimitación del
área de trayectoria. La generación de trayectoria puede ser
realizada con distintos tipos de algoritmos de búsqueda, en
[
        <xref ref-type="bibr" rid="ref8">8</xref>
        ] el método de grafos es utilizado para diseñar un espacio
de tareas mediante búsqueda heurística, en [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ] gráficos un
direccionados son usados para la planeación de trayectoria, en
[
        <xref ref-type="bibr" rid="ref10">10</xref>
        ] utilizan algoritmos genéticos para encontrar una
trayectoria óptima.
      </p>
      <p>
        A pesar del aparente éxito del aprendizaje por reforzamiento
en la generación de trayectoria, los problemas abordados están
limitados a estados discretos con un número finito de acciones
disponibles para los agentes, debido a que se sufre de la
llamada maldición de la dimensionalidad, la cual es el
crecimiento exponencial de los pares estados-acciones a aprender
conforme el número de estados y acciones se incrementan
en el problema [
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], lo que conlleva a un incremento en el
tiempo de cómputo y de la cantidad de memoria necesaria
para almacenar los datos asociados al algoritmo.
      </p>
      <p>
        Por lo anterior, es necesario incorporar una estrategia
adicional al aprendizaje por reforzamiento, la cual nos ofrezca
la oportunidad de generalizar los resultados obtenidos con
el objetivo de minimizar el tiempo de cómputo y memoria
necesaria. En este artículo se tomaran las ventajas del
aprendizaje de reforzamiento junto con una red neuronal multicapa,
los cuales serán usados para la planeación de trayectorias
en entornos dinámicos, el algoritmo estará integrado por dos
etapas de aprendizaje, la primera se usará el algoritmo
Qlearning [
        <xref ref-type="bibr" rid="ref14">14</xref>
        ], en donde el modelo de la tarea será conocido por
medio de una función de transición de estados y de la función
de recompensa escalar, en esta etapa el agente explorara el
entorno de tarea con la finalidad de colectar información
estados-acciones, es decir cuál es la acción optima a tomar
cada uno de los estados explorados, en la segunda etapa, la
información obtenida por el algoritmo de RL será usada para
entrenar una red neuronal multicapa la cual nos brindara las
acciones optimas a tomar por el agente (robot) en estados que
no fueron explorados en la primera etapa de aprendizaje.
      </p>
      <p>La propuesta sometida nos dará la oportunidad de obtener
las acciones optimas a tomar cuando el agente se encuentre
en estados que son desconocidos por este, debido a que no
fueron explorados en la primera etapa o por que el entorno de
trabajo cambio, lo que nos ofrecerá un grado de robustez.</p>
    </sec>
    <sec id="sec-2">
      <title>II. APRENDIZAJE POR REFORZAMIENTO</title>
      <p>En esta sección se presenta el proceso de decisión de
Markov y la caracterización de su solución óptima, los cuales
son la base del aprendizaje por reforzamiento.</p>
      <p>
        Definition 1: Un proceso finito de Markov para un agente
es una tupla (S, A, f,ρ ):
f : S × A × S ! [
        <xref ref-type="bibr" rid="ref1">0, 1</xref>
        ]
ρ : S × A × S ! R
donde S es el conjunto finito de estados en el entorno, A es
el conjunto finito de acciones disponibles para el agente, f es
la función de probabilidad de transición de estados y ρ es la
función de recompensa la cual se asume acotada [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ].
      </p>
      <p>El estado actual del entorno de trabajo el cual el agente
observa es definido como st 2 S, el cual describe al estado en
cada paso de tiempo discreto t ,el agente observa el estado y
toma una acción definida como at. Como resultado el entorno
cambia su estado a algún st+1 2 S de acuerdo a la función de
probabilidad de transición de estados f , la probabilidad de
acabar en el estado st+1 después que la acción at es ejecutada
en el estado st es f (st, at, st+1).</p>
      <p>El agente recibe una recompensa escalar rt+1 2 R, de
acuerdo a la función de recompensa ρ : rt+1 = ρ(st, at, st+1).
Esta recompensa evalúa el efecto inmediato de la acción at ,
es decir, la transición desde el estado st al estado st+1 .Esta
recompensa refleja que tan productiva fue la acción tomada
at. Sin embargo esta señal no dice nada acerca de los efectos
a largo plazo de esta acción tomada.</p>
      <p>Para sistemas deterministas, la función de probabilidad de
transición de estados f y la función de recompensa ρ toman
la forma:
f¯ =
ρ¯
=</p>
      <p>S × A ! S</p>
      <p>S × A ! R</p>
      <p>
        Donde la recompensa es completamente determinada por el
estado actual y la acción actual rt+1 = ρ (st, at). Algunos
procesos de decisión de Markov tienen estados terminales los
cuales son estados donde una vez alcanzados no pueden ser
abandonados en el futuro, se toma que todas las recompensas
recibidas en un estado terminal se toman como cero. En tal
caso, el proceso de aprendizaje es usualmente separado en
distintos episodios, los cuales son trayectorias comenzando
desde algún estado inicial y finalizando en un estado terminal
[
        <xref ref-type="bibr" rid="ref16">16</xref>
        ].
      </p>
      <p>El comportamiento del agente es descrito por su política
π, la cual especifica como el agente escoge sus acciones en
un estado determinado del medio. La política π puede ser
determinista :
o estocástica:</p>
      <p>
        π¯ = S ! A
π = S × A ! [
        <xref ref-type="bibr" rid="ref1">0, 1</xref>
        ]
Una política es llamada estacionaria si esta no cambia en el
tiempo. El objetivo final del aprendizaje por reforzamiento es
encontrar una política π, para todo estado s que maximice el
retorno R :
      </p>
      <p>Rπ = E
( X1 γkrt+1#### s0 = s,π
t=0 #
)
(2)
(1)
donde γ 2 [0, 1) es el factor de descuento, la expresión
anterior es tomada sobre la probabilidad de transición de
estados sobre la política π, debemos notar que R representa
la recompensa acumulada por el agente en el largo plazo.</p>
      <p>
        Existen otras formas de definir el retorno R en función de
la actividad realizada [
        <xref ref-type="bibr" rid="ref17">17</xref>
        ]. El factor de descuento γ puede ser
considerado como codificación de la incertidumbre creciente
acerca de la recompensa que sera obtenida en el futuro o como
un medio para acotar la suma en (2) de otro modo crecería de
manera no acotada.
      </p>
      <p>Por lo tanto el objetivo del agente es maximizar su
rendimiento a largo plazo caracterizado por el retorno R, solo
recibiendo la realimentación acerca de su inmediata actuación
en forma de la señal de recompensa r. Una forma de obtener
el anterior resultado es por medio del cálculo de una función
óptima estado-acción de valor llamada función Q (Q-function)</p>
      <p>Qh : S × A ! R
la cual da un retorno R esperado dada una política π
comenzando desde cualquier par estado-acción:</p>
      <p>Qπ(s, a) = E
( X1 γkr t+1#### s0 = s, a0 = a,π
t=0 #
)</p>
    </sec>
    <sec id="sec-3">
      <title>La función Q óptima es definida como Q∗</title>
      <p>Q∗ (s, a) = max Qπ (s, a)
π
La cual satisface la ecuación de optimalidad de Bellman:
Q∗ (s, a) =
s´2S
X f (s, a) %ρ &amp;s, a, s0 ' + γ max Q∗ &amp;s0 , a0 '(
a0
(6)</p>
      <p>
        La secuencia Qt converge a Q∗ bajo las siguientes
condiciones [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]:
(3)
(4)
(5)
• Distintos valores de la función Q son guardados y
actualizado para cada par estado-acción.
• La sumatoria P1
      </p>
      <p>t=0 α es finita.
• Asintóticamente todas los pares stado-acción son
visitadas de manera infinita.</p>
      <p>III. APRENDIZAJE POR REFORZAMIENTO CON RED</p>
      <p>NEURONAL</p>
      <p>En esta sección se describe la estrategia propuesta en este
artículo, la cual consta de dos etapas de aprendizaje, la primera
se usara un algoritmo de aprendizaje de reforzamiento y en
la segunda etapa se entrenara una red neuronal con los datos
obtenidos en la primera.</p>
      <sec id="sec-3-1">
        <title>A. Aprendizaje por reforzamiento</title>
        <p>
          En esta etapa se usara el algoritmo de aprendizaje
Qlearning , el cual asegura la convergencia hacia los valores
Q óptimos, la cual se reflejara en una política de acciones π
optimas, lo anterior por medio de garantizar que el algoritmo
Q-learning es una contracción [
          <xref ref-type="bibr" rid="ref14">14</xref>
          ].
        </p>
        <p>
          En el algoritmo se Q-learning la experiencia del agente
consiste en una secuencia de episodios en donde el agente:
• observa su estado actual st
• Selecciona y realiza una acción at
• Observa el estado siguiente st+1
• Recibe la recompensa rt
• Ajusta los valores Qt usando un factor de aprendizaje α
de acuerdo a :
Qt (st, at)
=
(1 − α) Qt−1 (st, at) + ...
+α rt + γ max Qt−1 (st+1, a0)i
h
a0
(7)
donde α 2 (0, 1) es el factor de aprendizaje. La
secuencia Qt converge a Q∗ converge bajo ciertas condiciones,
incluyendo que el agente se mantenga intentado realizar todas
las acciones en todos los estados, lo que implica que el agente
en ocasiones debe de explorar y en otras realizar lo que
dicta la política de acciones encontrada [
          <xref ref-type="bibr" rid="ref18">18</xref>
          ]. La exploración
que realizaremos será escogiendo una acción aleatoria con
probabilidad ϵ 2 (0, 1) y escogiendo una acción codiciosa
(que ofrezca una mayor recompensa) con una probabilidad
(1 − ϵ) .
        </p>
        <p>Bajo las condiciones anteriores mencionadas, el algoritmo
converge en un numero finito de iteraciones, lo que indica que
la fase de aprendizaje ha sido terminada y se ha obtenido las
acciones optimas a ejecutar por el agente en cada uno de los
estados visitados.</p>
        <p>B. Fase de aprendizaje mediante red neuronal</p>
        <p>Las redes neuronales tienen una habilidad poderosa de
fusión de datos y tolerancia a fallas. Ya que las redes
neuronales de una sola capa solo resuelven los problemas de
clasificación lineales, una red neuronal con múltiples capas es
utilizada para estimar las acciones mejor valuadas que serán
usadas por los agentes en los estados que no fueron visitados
durante la fase de aprendizaje por reforzamiento. El flujo de
aprendizaje es mostrado en la Figura 1.</p>
        <p>Las acciones disponibles para los agentes en los estados
no visitados durante la fase de aprendizaje por reforzamiento
serán aproximados por la siguiente red neuronal compuesta
por 1 capa oculta:
aˆt+1 = W σ(V [st])
(8)
donde W 2 Rn×m, V 2 Rm×n, m es el número del nodo
oculto el cual es diseñado por el usuario, n es el número de
agentes que se encuentran en el entorno en este caso n = 1,
V representa los pesos en la capa oculta, σ es una función
de activación neuronal, se usa una función sigmoidea en esta
propuesta.</p>
        <p>Las entradas para la red neuronal son los estado st y la
salida de la red serán las acciones aproximadas aˆt que el agente
deberá de tomar para llevar a cabo la meta encomendada. Es
de notar, que el aprendizaje utilizado en las redes neuronales es
un método de aprendizaje supervisado. Por lo que las muestras
para el entrenamiento de la red neuronal provendrán de la fase
anterior de aprendizaje, el cual nos brindará como entradas
de entrenamiento los estados del sistema y como salida las
acciones óptimas encontradas para cada uno de los agentes.</p>
        <p>El error entrenamiento e(k) a la salida de la neurona j está
definido como</p>
        <p>ej (k) = yj (k) − dj (k)
donde yj (k) es el estado medido por el agente, y dj (k) es el
patrón de acciones de los agentes. Las sumas instantáneas de
los errores al cuadrado de la salida es dado por
l
" (k) = 1 X ej2 (k)
2</p>
        <p>j=1
donde l es el número de neuronas de la capa de salida.
Usando el algoritmo backpropagation para entrenar la red
neuronal, el peso que conecta la neurona i con la neurona
j es actualizado de la siguiente manera:
wij (k + 1) = wij (k) − η
donde η es el parámetro de razón de aprendizaje del algoritmo
@"(k)
backpropagation. El termino @wij(k) puede ser calculado:
Las derivadas parciales están dadas por
'0j ,vj (k)- ,</p>
        <p>= 1,</p>
        <p>Una función lineal es utilizada en la capa de salida de la red
neuronal
wij (k + 1) = wij (k) − ηyi (k) ej (k)
(9)
De tal manera que wki puede ser actualizado como:
además
Por lo tanto
wki (k + 1) = wki (k) − η
= nej (k) '0j ,vj (k)- Wij</p>
        <p>
          '0i [vi (k)] yk (k)
= ei (k) '0i [vi (k)] yk (k)
wki (k + 1) = wki (k) − ηyk (k) ei (k) '0i [vi (k)]
(10)
donde ei (k) '0i [vi (k)] es el error en backpropagation [
          <xref ref-type="bibr" rid="ref15">15</xref>
          ].
        </p>
      </sec>
    </sec>
    <sec id="sec-4">
      <title>IV. PLANEACIÓN DE TRAYECTORIA</title>
      <p>Con la finalidad de validar la propuesta realizada, se
presenta una tarea de planeación de trayectoria para un robot
móvil, en la cual el agente o robot deberá de encontrar el
camino optimo (el que le ofrezca una mayor cantidad de
recompensa numérica), evitando obstáculos presentes en el
entorno y evitando salir del espacio físico del medio de trabajo.
La única información disponible que tendrá el agente será la
función de recompensa y la función de transición de estados
determinista.</p>
      <p>En cada paso de aprendizaje, los estados actuales (la
posición en forma de coordenadas del agente en el plano XY ) será
observada y referida a una tabla estado-acción. En el caso que
el agente se encuentre en un estado no disponible en la tabla,
la acción que deberá ejecutar el agente será proveída por la
estimación realizada por la red neuronal.</p>
      <sec id="sec-4-1">
        <title>A. Resultados de simulación</title>
        <p>
          La simulación será realizado en un entorno de trabajo
discretizado, el cual tendrá un tamaño en el plano de 5 × 5
en el plano XY , x 2 [
          <xref ref-type="bibr" rid="ref1 ref5">1, 5</xref>
          ] y 2 [
          <xref ref-type="bibr" rid="ref1 ref5">1, 5</xref>
          ] por lo que el
estado será representado por coordenadas cartesianas que
represente la posición del robot, el vector de estado s 2
[x, y]. Cada robot tendrá 4 acciones disponibles que podrá
realizar: moverse hacia arriba, abajo, izquierda y derecha,
A 2 [izquierda,derecha,arriba,abajo] .
        </p>
        <p>La posición inicial del robot es mostrada en la figura 2, la
función de recompensa ρ está dada:
r =
r =
r =
−5 si sale del entorno o choca
10 si llega a la meta
0 cualquier otra situación</p>
        <p>La tabla con los valores estados-acción tendrá un tamaño
de 100 entradas, |S| = 5 × 5 , |A| = 4.Los valores obtenidos
al finalizar la primera etapa de aprendizaje utilizando el
algoritmo Q-learning son mostrados en la figura 3, despues de
29 iteraciones se logra la convergencia, los parámetros usados
se muestran en la tabla (I). En la figura (4), se muestran las
trayectorias optimas obtenidas mediante Q-learning, todas
estas trayectorias ofrecen la misma recompensa total al seguirlas
de 98.38.</p>
        <p>Para la segunda etapa de aprendizaje, los valores Q
estadoacción óptimos encontrados en la primera fase, son usados
para entrenar una red neuronal de una capa oculta, en donde las
entradas a la red serán los estados y la salida será las acciones.
La codificación de las acciones para su uso en la red neuronal
son 1-izquierda, 2-derecha, 3-arriba, 4-abajo. El algoritmo
utilizado para entrenar la red neuronal es Backpropagation,
las especificaciones de la red neuronal se muestran en la tabla
(II).</p>
        <p>La figura (5) muestra la acción propuesta por la red neuronal
en color verde, cuando el robot se encuentra en un estado que
no se encuentra en la tabla de valores estados acciones (3),
la red neuronal ofrece una acción aproximada a realizar, esta
acción tiene como objetivo acercarnos a un estado conocido
por el agente en color azul, lo que producirá que se integre a
una de las trayectorias optimas encontradas en la primera fase
de aprendizaje</p>
        <p>V. CONCLUSIONES</p>
        <p>La propuesta presentada ofrece un método hibrido entre
una técnica de aprendizaje semi-supervisado (aprendizaje por
Fig. 4. Trayectorias optimas encontradas con aprendizaje por reforzamiento
Fig. 5. Acción aproximada ofrecida por la red neuronal</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>Numero de neuronas de la 1ra capa oculta</title>
      <p>Funcion de activacion en la capa de salida</p>
      <p>Funcion de activacion en capa oculta
1
10</p>
      <p>Funcion Lineal
Funcion Sigmoide
reforzamiento) y una técnica de aprendizaje supervisado (red
neuronal), lo que permite tener un grado de robustez cuando
las condiciones del entorno de trabajo cambian, es de hacer
mención, que las acciones propuestas por la red neuronal
son sub-optimas, en el sentido que en general no ofrecen la
trayectoria más corta hacia una trayectoria optima conocida,
esto debido a errores de aproximación, como trabajo a futuro
queda generalizar la propuesta en espacios no discretos, así
como implementar la técnica de manera experimental en robot
móviles diferenciales.</p>
      <p>Una de las principales ventajas de esta técnica es que se
evita el volver a ejecutar el algoritmo Q-learning cuando las
condiciones del entorno cambian, cuando el problema tiene
muchos estados y acciones disponibles, la convergencia es
lenta.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Sofge</surname>
            <given-names>D</given-names>
          </string-name>
          ,
          <string-name>
            <surname>White</surname>
            <given-names>D</given-names>
          </string-name>
          (
          <year>1990</year>
          )
          <article-title>Neural network based process optimizationand control</article-title>
          .
          <source>In Proceedings of the 29th IEEE Conference on Decision and Control. Hawai</source>
          , USA
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Kaelbling</surname>
            <given-names>L. P.</given-names>
          </string-name>
          ,
          <article-title>Reinforcement learning: A survey</article-title>
          ,
          <source>Journal of Artificial Intelligence Research</source>
          ,
          <volume>4</volume>
          (
          <issue>3</issue>
          ),
          <fpage>237</fpage>
          -
          <lpage>285</lpage>
          ,
          <year>1996</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Sutton</surname>
            ,
            <given-names>R. S.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Barto</surname>
            ,
            <given-names>A. G.</given-names>
          </string-name>
          (
          <year>1998</year>
          ).
          <article-title>Reinforcement learning: An introduction</article-title>
          (Vol.
          <volume>1</volume>
          ,
          <source>No. 1)</source>
          . Cambridge: MIT press.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Kara</surname>
            ,
            <given-names>E. C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Berges</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Krogh</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Kar</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2012</year>
          , November).
          <article-title>Using smart devices for system-level management and control in the smart grid: A reinforcement learning framework</article-title>
          .
          <source>In Smart Grid Communications (SmartGridComm)</source>
          ,
          <year>2012</year>
          IEEE Third International Conference on (pp.
          <fpage>85</fpage>
          -
          <lpage>90</lpage>
          ). IEEE.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Asada</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Noda</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Tawaratsumida</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Hosoda</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          (
          <year>1996</year>
          ).
          <article-title>Purposive behavior acquisition for a real robot by vision-based reinforcement learning</article-title>
          .
          <source>Machine learning</source>
          ,
          <volume>23</volume>
          (
          <issue>2</issue>
          ),
          <fpage>279</fpage>
          -
          <lpage>303</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Gu</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Holly</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lillicrap</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Levine</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2017</year>
          , May).
          <article-title>Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates</article-title>
          .
          <source>In Robotics and Automation (ICRA)</source>
          ,
          <year>2017</year>
          IEEE International Conference on (pp.
          <fpage>3389</fpage>
          -
          <lpage>3396</lpage>
          ). IEEE.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Foerster</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Assael</surname>
            ,
            <given-names>Y. M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>de Freitas</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Whiteson</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2016</year>
          ).
          <article-title>Learning to communicate with deep multi-agent reinforcement learning</article-title>
          .
          <source>In Advances in Neural Information Processing Systems</source>
          (pp.
          <fpage>2137</fpage>
          -
          <lpage>2145</lpage>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Bhattacharya</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Likhachev</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Kumar</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          (
          <year>2010</year>
          ,
          <article-title>May). Multi-agent path planning with multiple tasks and distance constraints</article-title>
          .
          <source>In Robotics and Automation (ICRA)</source>
          ,
          <year>2010</year>
          IEEE International Conference on (pp.
          <fpage>953</fpage>
          -
          <lpage>959</lpage>
          ). IEEE.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>K. H. C.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Botea</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          (
          <year>2011</year>
          ).
          <article-title>MAPP: a scalable multi-agent path planning algorithm with tractability and completeness guarantees</article-title>
          .
          <source>Journal of Artificial Intelligence Research</source>
          ,
          <volume>42</volume>
          ,
          <fpage>55</fpage>
          -
          <lpage>90</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Cai</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Peng</surname>
            ,
            <given-names>Z.</given-names>
          </string-name>
          (
          <year>2002</year>
          ).
          <article-title>Cooperative coevolutionary adaptive genetic algorithm in path planning of cooperative multi-mobile robot systems</article-title>
          .
          <source>Journal of Intelligent &amp; Robotic Systems</source>
          ,
          <volume>33</volume>
          (
          <issue>1</issue>
          ),
          <fpage>61</fpage>
          -
          <lpage>71</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <surname>Littman</surname>
            ,
            <given-names>M. L.</given-names>
          </string-name>
          (
          <year>1994</year>
          ).
          <article-title>Markov games as a framework for multi-agent reinforcement learning</article-title>
          .
          <source>In Proceedings of the eleventh international conference on machine learning</source>
          (Vol.
          <volume>157</volume>
          , pp.
          <fpage>157</fpage>
          -
          <lpage>163</lpage>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Busoniu</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Babuska</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>De Schutter</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>A comprehensive survey of multiagent reinforcement learning</article-title>
          .
          <source>IEEE Transactions on Systems, Man</source>
          , And
          <string-name>
            <surname>Cybernetics-Part</surname>
            <given-names>C</given-names>
          </string-name>
          :
          <article-title>Applications</article-title>
          and Reviews,
          <volume>38</volume>
          (
          <issue>2</issue>
          ),
          <year>2008</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [13]
          <string-name>
            <surname>Foerster</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Nardelli</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Farquhar</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Torr</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kohli</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Whiteson</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2017</year>
          ).
          <article-title>Stabilising experience replay for deep multi-agent reinforcement learning</article-title>
          .
          <source>arXiv preprint arXiv:1702</source>
          .
          <fpage>08887</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Watkins</surname>
            ,
            <given-names>C. J.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Dayan</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          (
          <year>1992</year>
          ).
          <article-title>Q-learning</article-title>
          .
          <source>Machine learning</source>
          ,
          <volume>8</volume>
          (
          <issue>3- 4</issue>
          ),
          <fpage>279</fpage>
          -
          <lpage>292</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Haykin</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>1994</year>
          ).
          <article-title>Neural networks: a comprehensive foundation</article-title>
          .
          <source>Prentice Hall PTR.</source>
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [16]
          <string-name>
            <surname>Kaelbling</surname>
            ,
            <given-names>L. P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Littman</surname>
            ,
            <given-names>M. L.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Cassandra</surname>
            ,
            <given-names>A. R.</given-names>
          </string-name>
          (
          <year>1998</year>
          ).
          <article-title>Planning and acting in partially observable stochastic domains</article-title>
          .
          <source>Artificial intelligence</source>
          ,
          <volume>101</volume>
          (
          <issue>1</issue>
          ),
          <fpage>99</fpage>
          -
          <lpage>134</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          [17]
          <string-name>
            <surname>Wei</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hu</surname>
            ,
            <given-names>X.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          (
          <year>2013</year>
          ).
          <article-title>Consensus of linear multi-agent systems subject to actuator saturation</article-title>
          .
          <source>International Journal of Control, Automation and Systems</source>
          ,
          <volume>11</volume>
          (
          <issue>4</issue>
          ),
          <fpage>649</fpage>
          -
          <lpage>656</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          [18]
          <string-name>
            <surname>Busoniu</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Babuska</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          , &amp;
          <string-name>
            <surname>De Schutter</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2006</year>
          , December).
          <article-title>Multiagent reinforcement learning: A survey</article-title>
          .
          <source>In Control, Automation, Robotics and Vision</source>
          ,
          <year>2006</year>
          . ICARCV'
          <volume>06</volume>
          . 9th International Conference on (pp.
          <fpage>1</fpage>
          -
          <lpage>6</lpage>
          ). IEEE.
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>