<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Statistical Learning to Detect Potential Dropouts in Higher Education: A Public University Case Study</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>César Noboa</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Milton Ordóñez</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Jorge Magallanes</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Escuela Superior Politécnica del Litoral</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>ESPOL</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>(Oficina de Admisiones)</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Campus Gustavo Galindo Km.</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Vía Perimetral</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>P.O. Box</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Guayaquil</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Ecuador enoboa@espol.edu.ec</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Escuela Superior Politécnica del Litoral</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>ESPOL</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Campus Gustavo Galindo Km.</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Vía Perimetral</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>P.O. Box</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Guayaquil</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Ecuador xordonez@espol.edu.ec</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Escuela Superior Politécnica del Litoral, ESPOL, (Facultad de Ingeniería en Electricidad y Computación)</institution>
          ,
          <addr-line>Campus Gustavo Galindo Km. 30.5 Vía Perimetral, P.O. Box 09-01-5863, Guayaquil</addr-line>
          ,
          <country country="EC">Ecuador</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Palabras Clave: College Dropout, Early Dropout Prediction</institution>
          ,
          <addr-line>Dropout Risk Factors</addr-line>
          ,
          <country>Statistical Learning Classification Techniques</country>
        </aff>
      </contrib-group>
      <abstract>
        <p>Early detection of students tending to drop out is crucial to improve not only graduation rates but also education quality. By using basic statistical learning techniques, this work presents a simple way to predict possible dropouts based on their demographic and academic characteristics. In order to reasonably predict while gaining a better understanding of the dropout phenomenon, after a preliminary analysis, 4 classification methods are applied including 2 easy-tointerpret ones. Some of the main results of this study show that almost 22% of current students are potential dropouts while being an older student and failing many subjects tend to cause dropout; on the other hand, passing more than 12 subjects and long-term access to library materials can prevent students from leaving college.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        En la educación superior, la deserción estudiantil es un problema relevante, no sólo en
América Latina sino en países desarrollados. Aunque no existe consenso para medir la
calidad de la educación, uno de los indicadores importantes es el tiempo de titulación
para graduarse (TTG), el cual está relacionado directamente con la deserción estudiantil
[
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. Las estimaciones a nivel mundial sitúan esta tasa de deserción en el 40% [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. En
Estados Unidos, esta tasa es de alrededor del 30% y representa una pérdida de 9 billones
de dólares en la educación de estos estudiantes [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]. Sin embargo, la deserción no sólo
afecta a la calidad de la educación y a la economía de un país, sino que tiene
repercusiones sobre el desarrollo de la sociedad, puesto que ésta demanda las
contribuciones derivadas de la población con educación superior como son: la
innovación, la producción de conocimiento y el descubrimiento científico [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ].
      </p>
      <p>
        Existen varias investigaciones que determinan en alguna medida la deserción en
América Latina. En la gran mayoría se trata acerca de la determinación de los factores
que conllevan a la deserción, la medición del número de desertores y los mecanismos
para disminuirlo [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ]. Existen dos propuestas para la cuantificación de la deserción: La
primera, se establece como la proporción de estudiantes que se titulan en un tiempo
determinado que corresponde a la duración de la carrera; y la segunda, simplemente es
el número de estudiantes que abandona sus estudios. Para disminuir la deserción, estas
investigaciones proponen mejorar los mecanismos de detección temprana de
potenciales desertores.
      </p>
      <p>
        La aplicación de los métodos de aprendizaje estadístico para abordar el problema de
la deserción ya ha sido propuesta por varios estudios, analizando ya sea, la deserción o
culminación de un curso [
        <xref ref-type="bibr" rid="ref5 ref6">5,6</xref>
        ] o de una carrera [
        <xref ref-type="bibr" rid="ref3 ref7 ref8 ref9">3,7,8,9</xref>
        ]. Algunos de los métodos
empleados en estas investigaciones son: regresión logística, k-vecinos más cercanos,
árboles de decisión incluido random forests, redes bayesianas, redes neuronales, entre
otros. En el presente trabajo, se ha preferido mantener un equilibrio entre facilidad de
interpretación y precisión [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ], poniendo especial énfasis en la detección de desertores
antes que en la reducción de malas clasificaciones. Se han escogido 2 métodos que
generan modelos comprensibles: árboles de decisión y regresión logística; y 2 métodos
que tienen gran capacidad de precisión: naive bayes y k-vecinos más cercanos. Estos 4
métodos empleados de manera conjunta producirán una solución de compromiso entre
comprensibilidad y precisión, siendo esta última evaluada principalmente por el
porcentaje de desertores detectados.
      </p>
      <p>En este artículo, se presenta un marco de trabajo para los sistemas de detección
temprana de potenciales desertores, en el cual se propone utilizar las 4 técnicas ya
mencionadas de manera conjunta. Para medir la efectividad del marco de trabajo, estas
técnicas son aplicadas sobre el conjunto de datos del Sistema Académico de la Escuela
Superior Politécnica del Litoral (ESPOL), institución pública de educación superior del
Ecuador.
2</p>
    </sec>
    <sec id="sec-2">
      <title>Metodología</title>
      <sec id="sec-2-1">
        <title>2.1 Análisis preliminar</title>
        <p>En esencia este proyecto trata de comparar las características de los estudiantes
desertores versus las características de aquellos que no lo son, para luego de esto definir
una regla o modelo que los diferencie. En este trabajo, un estudiante es considerado
desertor si ha dejado de estudiar los últimos 3 años (2015, 2016, y 2017) y no se ha
graduado.</p>
        <p>En la Fig. 1 se observa la tendencia del porcentaje de deserción de los estudiantes
que ingresaron a la ESPOL en el período 2009-2013 clasificados por género. Este
porcentaje de deserción ha ido decreciendo hasta situarse en el 10.56% para las mujeres
y el 14.48% para los hombres; sin embargo, aún son porcentajes altos, especialmente,
si se los traduce a cantidades absolutas.</p>
        <p>La Fig. 1 también refleja que existe una considerable diferencia en la deserción de
ambos grupos. Ésta muestra no sólo que ha existido mayor porcentaje de desertores
varones que de mujeres, sino que la brecha entre estos 2 grupos se ha acortado, pero
siempre ha existido. La Tabla 1 muestra la comparación porcentual de desertores según
su género. El estadístico  2 de Pearson para la prueba de independencia de esta tabla
de contingencia es 78.96 con un valor p&lt; 0.0001, lo cual indica que la deserción y el
género no son independientes. Sin embargo, esto último no implica que el género tiene
la capacidad suficiente para discriminar entre estudiantes desertores y no desertores.</p>
        <p>Tabla 1. Deserción de estudiantes que ingresaron desde el 2009 al 2013.</p>
        <p>Desertor
No Desertor</p>
        <p>Totales</p>
        <p>Femenino
Cantidad
498
2,878
3,376</p>
      </sec>
      <sec id="sec-2-2">
        <title>2.2 Selección del conjunto de datos objetivo</title>
        <p>Para la selección del conjunto de datos objetivo, se tomará como “instante de tiempo”
el segundo semestre del año 2011. En concreto, el conjunto de datos objetivo lo
conforman los estudiantes que ingresaron a la ESPOL desde el año 2009 y estudiaron
en el semestre 2011-2s con las características que tuvieron en ese instante de tiempo.
Este conjunto de datos consta de 4294 estudiantes de los cuales 525 son desertores.</p>
        <p>El conjunto de variables seleccionadas se divide en 2 grupos: las variables
relacionadas a las características personales del estudiante y las variables relacionadas
a su comportamiento académico. En la Tabla 2 se indica la descripción de cada una de
estas variables. El período de prueba mencionado en las variables “Superadas” y
“Perdidas” se refiere al semestre en que un estudiante tiene la última oportunidad de
aprobar una materia luego de haberla reprobado 2 veces en semestres anteriores;
reprobar dicha materia en el período a prueba restringe al estudiante de continuar en la
misma carrera.</p>
        <p>Tabla 2. Descripción de las variables seleccionadas.
#
1
2
3
4
5
6
7
8
9
10
11
12</p>
        <p>Variable
SEXO</p>
        <p>EDAD
FACTOR_P
RESIDENCIA
APROBADAS
REPROBADAS</p>
        <p>PROMEDIO
ANTIGÜEDAD</p>
        <p>PERDIDAS
SUPERADAS
T_AUTONOMO</p>
        <p>DESERTOR</p>
        <p>Descripción
Sexo del estudiante
Edad del estudiante
Indicador del nivel
socioeconómico</p>
        <p>Tipo de residencia
# de materias aprobadas
# de materias reprobadas</p>
        <p>Promedio general
# de semestres de estudio
# de veces en que perdió</p>
        <p>un período de prueba
# de veces en que superó
un período de prueba
# de días de consulta de
material de la biblioteca
principal en el semestre</p>
        <p>actual
Etiqueta que indica si el
estudiante ha o no ha
desertado</p>
        <p>Tipo
Categórica
Numérica
Numérica
Categórica
Numérica
Numérica
Numérica
Numérica
Numérica
Numérica
Numérica
Categórica,
variable
respuesta</p>
        <p>Posibles valores</p>
        <p>{F, M}
16 en adelante</p>
        <p>0 a 40
{LOCAL,PROV}
0 en adelante
0 en adelante
0 a 10
0 a 5
Desde 0 en</p>
        <p>adelante
Desde 0 en</p>
        <p>adelante
Desde 0 en
adelante
{SI,NO}
2.3</p>
      </sec>
      <sec id="sec-2-3">
        <title>Entrenamiento de los modelos de clasificación</title>
        <p>Para la aplicación de las técnicas se toma el 70% de los datos para entrenamiento y el
30% restante para pruebas. Se toman varias muestras aleatorias con el esquema 70-30.
Posterior a la generación de los modelos con las muestras de entrenamiento, se evalúa
la precisión de los modelos.</p>
        <p>Los métodos aplicados que presentan modelos fáciles de interpretar son: árbol de
decisión y regresión logística. Ambos métodos permiten determinar las variables que
tienen mayor influencia en la deserción universitaria. En la Fig. 2 se observa el árbol
de decisión obtenido con una de las muestras.</p>
        <p>
          Los árboles de decisión pueden presentar reglas incidentales que carecen de
generalidad, tomarlas en cuenta conduciría al efecto conocido como sobreajuste [
          <xref ref-type="bibr" rid="ref11">11</xref>
          ].
Luego del entrenamiento con las distintas muestras se obtiene la siguiente regla general:
Si (APROBADAS &lt; 12.5 y REPROBADAS &gt; 4.5)
entonces ES DESERTOR
caso contrario NO ES DESERTOR
        </p>
        <p>La regresión logística es un método de clasificación que permite predecir la
probabilidad de deserción del estudiante.</p>
        <p>
          Los resultados de la aplicación de este método a una de las muestras de
entrenamiento se exponen en la Fig. 3. Tal como se observa, las variables pro-deserción
son edad y número de materias reprobadas con coeficientes de 0.2 y 0.23
respectivamente; mientras que las variables que podrían evitar la deserción son el
número de materias aprobadas y el trabajo autónomo del estudiante con coeficientes de
-0.1 y -0.006 respectivamente; todas estas variables de influencia con un valor p menor
a 0.0001. Los otros 2 métodos que se aplican al conjunto de datos son: K-vecinos más
cercanos y Naive Bayes. Estos métodos que se conocen como métodos retardados, no
siempre generan un modelo explícito a la manera del árbol de decisión o la regresión
logística y emplean el mayor tiempo de procesamiento cuando son consultados acerca
de la clasificación de un nuevo elemento [
          <xref ref-type="bibr" rid="ref12">12</xref>
          ].
        </p>
      </sec>
      <sec id="sec-2-4">
        <title>2.4 Validación de los modelos de clasificación</title>
        <p>El principal interés es predecir con razonable precisión la tasa de deserción de un
conjunto de estudiantes, es por esto, que el porcentaje de correctas clasificaciones no
es muy utilizado como medida de evaluación.</p>
        <p>Aplicando validación cruzada 10-fold para los métodos naive bayes y regresión
logística se obtienen porcentajes de detección promedio de 28.57% y 28.56%
respectivamente.</p>
        <p>
          La técnica de validación cruzada es especialmente útil para la determinación del
valor idóneo de k, en el método de los k-vecinos más cercanos. En este caso, se emplea
la validación cruzada Leave-One-Out, que consiste en tomar todos los elementos
excepto uno para entrenar el modelo, siendo el elemento sobrante empleado para la
prueba [
          <xref ref-type="bibr" rid="ref13">13</xref>
          ]. Los resultados de esta validación se muestran en la Fig. 4, se observa que
el valor de k que produce el mayor porcentaje de detección es k=2. Sin embargo, no es
conveniente elegir este valor, pues en caso de existir un vecino desertor y otro
nodesertor no se podría determinar la clase a la que pertenece el estudiante que se requiere
clasificar. Por lo tanto, el k idóneo para este modelo es k=1, con la ventaja adicional de
que el costo computacional es menor.
        </p>
        <p>35.00%
30.00%
25.00%
20.00%
15.00%
10.00%
5.00%
0.00%
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24
% de Detección</p>
      </sec>
    </sec>
    <sec id="sec-3">
      <title>Resultados y discusión</title>
      <p>En esta sección, se presentan los resultados de evaluar cada método con 5 conjuntos de
prueba. Al evaluar cada método se podrá obtener las tasas de: malas clasificaciones,
falsos positivos, falsos negativos y detección.</p>
      <p>En el caso de regresión logística es común etiquetar a un nuevo estudiante como
desertor si la probabilidad de deserción que se obtiene es mayor que 0.5. Sin embargo,
valores menores para este umbral disminuyen los falsos negativos, aunque en
contraparte aumentan los falsos positivos. A este respecto, la Fig. 5 muestra el
comportamiento de las distintas tasas al variar el umbral. La selección del umbral no es
del todo objetiva; depende, en gran medida, de los recursos disponibles de la institución
para atender a los falsos positivos. De acuerdo a la figura, un valor para el umbral
pudiera ser 0.3 ó 0.4, ya que se obtiene un porcentaje de detección mayor al 30% con
un porcentaje de falsos positivos menor al 10%. Es interesante notar que el porcentaje
de malas clasificaciones (% de error) varía muy poco para valores del umbral entre 0.3
y 0.8.</p>
      <p>100.00%
90.00%
80.00%
70.00%
60.00%
50.00%
40.00%
30.00%
20.00%
10.00%
0.00%
0.2
0.3
0.4
0.6
0.7</p>
      <p>0.8
0.5</p>
      <p>Umbral
% falsos negativos
% falsos positivos
% detección
% de error</p>
      <p>La Tabla 3 muestra un resumen de la prueba de cada uno de los métodos. En esta
tabla se observan los mejores y peores resultados por cada método, siendo el método
con mejor porcentaje de detección promedio, la regresión logística con umbral 0.4.</p>
      <p>Tabla 3. Porcentajes de detección por método y por muestra.</p>
      <p>Métodos
muestra 1
muestra 2
muestra 3
muestra 4
muestra 5
Promedio</p>
      <p>Para encontrar el porcentaje de detección global de desertores, es necesario aplicar
de forma secuencial cada método e ir contabilizando los nuevos desertores que surgen.</p>
      <p>La Tabla 4 muestra el resumen final de la aplicación sucesiva de los 4 métodos del
proyecto. Tal como se observa, la estimación de la capacidad del proyecto para predecir
la deserción universitaria es mayor al 52% y su precisión para clasificar correctamente
es mayor al 82%.</p>
      <p>Tabla 4. Porcentaje de detección acumulado y precisión por muestra.</p>
      <p>Métodos
muestra 1
muestra 2
muestra 3
muestra 4
muestra 5
Promedio</p>
      <p>Finalmente, se aplican los métodos entrenados al conjunto de 9,159 estudiantes
registrados en el segundo semestre del año 2017, de los cuales por supuesto se
desconoce su futura deserción. La Fig. 6 muestra los potenciales desertores empleando
los 4 métodos. De acuerdo a esto, más del 22% de los estudiantes posiblemente
desertarán. Es notorio que los métodos incomprensibles naive bayes y knn-1 agregan
gran cantidad de desertores que los otros 2 métodos no detectan (311 + 747 vs. 9 + 73).
4</p>
    </sec>
    <sec id="sec-4">
      <title>Conclusiones y trabajos futuros</title>
      <p>De manera general, los resultados obtenidos muestran que mientras más avanza el
estudiante en sus estudios menos probable es su deserción; y a excepción de la edad,
las características personales de los estudiantes poco inciden en su retiro de la
universidad.</p>
      <p>De acuerdo al método de árbol de decisión, reprobar más de 4 materias en las
primeras fases de la carrera contribuye significativamente a la deserción. En el caso de
la regresión logística, las variables que más contribuyen a la deserción son: la edad y la
cantidad de materias reprobadas. En promedio, se obtuvo que los estudiantes con mayor
edad tienen 22% más posibilidades (odds) de desertar frente a los que son un año menor;
y, por cada materia reprobada las posibilidades de desertar frente a no hacerlo se
incrementan en un 28%; en cambio, cada materia aprobada reduce la razón entre la
probabilidad de desertar versus no desertar en un 16% y la consulta de material
bibliográfico reduce esta misma razón en 1% por cada día de consulta.</p>
      <p>Puesto que las variables “perdidas” y “superadas” no influyen en la deserción, se
concluye que reprobar una materia estando a prueba no es garantía de deserción
universitaria; así como superar un período de prueba tampoco implica mayor resiliencia
en los estudios.</p>
      <p>Luego de los experimentos realizados, se estima que la capacidad promedio del
proyecto para detectar un posible desertor es mayor al 52%; y, la capacidad promedio
para clasificar a un estudiante en el grupo correcto es mayor al 82%.</p>
      <p>En el caso de la predicción sobre los datos actuales, al aplicar los 4 métodos de
discriminación a los 9,159 estudiantes registrados en el segundo semestre del 2017, se
obtuvo que alrededor del 22% de los estudiantes fueron detectados como posibles
desertores por al menos uno de los métodos; mientras que 220 estudiantes fueron
detectados por más de 2 métodos aumentando así su riesgo de deserción.</p>
      <p>
        Los resultados preliminares obtenidos en este artículo indican que el proceso de
enseñanza-aprendizaje pudiera verse beneficiado al enfocarse en los estudiantes
detectados como posibles desertores, permitiendo que éstos tengan mayor acceso no
sólo a material bibliográfico especializado sino a mejores oportunidades de incrementar
su trabajo autónomo favoreciendo así su aprendizaje activo. Algunos de los siguientes
pasos para potenciar estos resultados serían, estimar el tiempo que tienen los directivos
antes de que el estudiante deserte, como se calcula en [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]; y, la incorporación al análisis
de aspectos no cognitivos, como se sugiere en [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ]. También un análisis longitudinal
semestre a semestre para obtener la precisión promedio para detectar potenciales
desertores, la incorporación de otros métodos como SVM para incrementar la capacidad
de detección y el aumento en la recolección de datos relativos al trabajo autónomo del
estudiante que va más allá de consultas bibliográficas, son algunas de las propuestas
para futuras investigaciones.
      </p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          1.
          <string-name>
            <surname>Ferreyra</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Avitabile</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Botero</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Haimovich</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Urzúa</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          :
          <article-title>Momento decisivo La educación superior en América Latina y el Caribe Resumen</article-title>
          .
          <source>Grupo Banco Mundial</source>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <surname>El</surname>
            <given-names>Telégrafo</given-names>
          </string-name>
          :
          <article-title>La deserción universitaria bordea el 40%</article-title>
          . https://www.eltelegrafo.com.ec/noticias/sociedad/4/la-desercion
          <article-title>-universitaria-</article-title>
          <string-name>
            <surname>bordea-</surname>
          </string-name>
          el-
          <volume>40</volume>
          (
          <year>2016</year>
          ). Accedido el 19 de Mayo de 2018
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          3.
          <string-name>
            <surname>Aulck</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Velagapudi</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Blumenstock</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>West</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          :
          <article-title>Predicting student dropout in higher education</article-title>
          .
          <source>ICML Workshop on #Data4Good: Machine Learning in Social Good Applications</source>
          , pp.
          <fpage>16</fpage>
          -
          <lpage>20</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          4.
          <string-name>
            <surname>Munizaga</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Cifuentes</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Beltrán</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>Retención y Abandono Estudiantil en la Educación Superior Universitaria en América Latina y el Caribe: Una Revisión Sistemática. Education policy analysis archives</article-title>
          , Vol.
          <volume>26</volume>
          , No.
          <volume>61</volume>
          , pp.
          <fpage>1</fpage>
          -
          <lpage>36</lpage>
          (
          <year>2018</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          5.
          <string-name>
            <surname>Oedaa</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ; Hashimoto,
          <string-name>
            <surname>G.</surname>
          </string-name>
          :
          <article-title>Log-Data Clustering Analysis for Dropout Prediction in Beginner Programming Classes</article-title>
          .
          <source>Procedia Computer Science</source>
          , Vol.
          <volume>112</volume>
          , pp.
          <fpage>614</fpage>
          -
          <lpage>621</lpage>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          6.
          <string-name>
            <surname>Badr</surname>
          </string-name>
          , G.;
          <string-name>
            <surname>Algobail</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Almutairi</surname>
            ,
            <given-names>H.</given-names>
          </string-name>
          ; Almutery,
          <string-name>
            <surname>M.</surname>
          </string-name>
          : Predicting Students' Performance in University Courses:
          <article-title>A Case Study and Tool in KSU Mathematics Department</article-title>
          . Procedia Computer Science, Vol.
          <volume>82</volume>
          , pp.
          <fpage>80</fpage>
          -
          <lpage>89</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          7.
          <string-name>
            <surname>Hutt</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ; Gardener,
          <string-name>
            <given-names>M.</given-names>
            ;
            <surname>Kamentz</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            ;
            <surname>Duckworth</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            ;
            <surname>D'Mello</surname>
          </string-name>
          ,
          <string-name>
            <surname>S.</surname>
          </string-name>
          : Prospectively Predicting 4
          <article-title>-year College Graduation from Student Applications</article-title>
          .
          <source>Proceedings of the 8th International Conference on Learning Analytics and Knowledge</source>
          , pp.
          <fpage>280</fpage>
          -
          <lpage>289</lpage>
          (
          <year>2018</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          8.
          <string-name>
            <surname>Ahuja</surname>
            , R.; Kankane,
            <given-names>Y.</given-names>
          </string-name>
          :
          <article-title>Predicting the probability of student's degree completion by using different data mining techniques</article-title>
          .
          <source>Fourth International Conference on Image Information Processing (ICIIP)</source>
          , pp.
          <fpage>1</fpage>
          -
          <lpage>4</lpage>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          9.
          <string-name>
            <surname>Martins</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ;
          <string-name>
            <surname>Carvalho</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ; Victorino,
          <string-name>
            <given-names>C.</given-names>
            ;
            <surname>Holanda</surname>
          </string-name>
          ,
          <string-name>
            <surname>M.</surname>
          </string-name>
          :
          <article-title>Early Prediction of College Attrition Using Data Mining</article-title>
          .
          <source>16th IEEE International Conference on Machine Learning and Applications (ICMLA)</source>
          , pp.
          <fpage>1075</fpage>
          -
          <lpage>1078</lpage>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          10.
          <string-name>
            <surname>James</surname>
          </string-name>
          , G.;
          <string-name>
            <surname>Witten</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ; Hastie,
          <string-name>
            <given-names>T.</given-names>
            ;
            <surname>Tibshirani</surname>
          </string-name>
          ,
          <string-name>
            <surname>R.</surname>
          </string-name>
          : An Introduction to Statistical Learning. Springer 7th Ed, pp.
          <volume>25</volume>
          (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          11.
          <string-name>
            <surname>Russell</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ; Norvig,
          <string-name>
            <surname>P.</surname>
          </string-name>
          :
          <article-title>Artificial Intelligence A Modern Approach</article-title>
          . Pearson Education 3rd Ed, pp.
          <volume>705</volume>
          (
          <year>2010</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          12.
          <string-name>
            <surname>Makhabel</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          :
          <article-title>Learning Data Mining with R</article-title>
          . Packt Publishing 1st Ed, pp.
          <volume>143</volume>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          13.
          <string-name>
            <surname>Witten</surname>
          </string-name>
          , I.;
          <string-name>
            <surname>Frank</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ; Hall,
          <string-name>
            <given-names>M.</given-names>
            ;
            <surname>Pal</surname>
          </string-name>
          ,
          <string-name>
            <surname>C.</surname>
          </string-name>
          :
          <article-title>Data Mining Practical Machine Learning Tools and Techniques</article-title>
          . Elsevier 4th Ed, pp.
          <fpage>167</fpage>
          -
          <lpage>169</lpage>
          (
          <year>2016</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>