<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Drawing the tra c map in school networks</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Juan Francisco Rodriguez Saredo</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Regina Motz</string-name>
          <email>rmotzg@fing.edu.uy</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Instituto de Computacion</institution>
          ,
          <addr-line>Facultad de Ingenier a, UdelaR</addr-line>
          ,
          <country country="UY">Uruguay</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Programa de Desarrollo de las Ciencias Basicas</institution>
          ,
          <addr-line>Informatica</addr-line>
          ,
          <country country="UY">Uruguay</country>
        </aff>
      </contrib-group>
      <abstract>
        <p>This work shows an application designed to identify groups in the use of an online educational network associated with the socioeconomic characteristics of the neighborhoods of Montevideo where their users live. The network has a wide coverage throughout the national territory and o ers Internet access to all students (children and adolescents). The knowledge obtained from the study can be applied as support for decision making.</p>
      </abstract>
      <kwd-group>
        <kwd>Clustering</kwd>
        <kwd>Hopkins</kwd>
        <kwd>Clara</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>Introduccion</title>
      <p>La gestion y analisis de los datos obtenidos en los ambientes educacionales
habitualmente presentan di cultades para su conduccion. La aplicacion de tecnicas de
clustering para obtener conocimiento util de ellos, posee di cultades adicionales
tales como la de nicion del espacio por sus atributos, la medida de distancia a
utilizar y las muestras con las cuales generar el modelo, entre otras.</p>
      <p>
        La originalidad y di cultad de este trabajo radica en que se debe trabajar con
dos datasets de muy diferente origen: por un lado se dispone de datos de acceso a
los recursos provenientes de una red extendida en todo el territorio nacional, con
una amplia cobertura que posibilita el acceso a Internet desde todos los centros
educacionales (Primaria, Secundaria y UTU) [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ] y, por otro lado, datos que se
recabaron de la Web en caracter de datos abiertos disponibles y provenientes de
organismos o ciales 3.
      </p>
      <p>Resulta interesante determinar si existe algun tipo de relacion entre el uso
de los recursos educacionales en l nea y el lugar donde habita el estudiante. Los
barrios de la ciudad poseen caracter sticas unicas que genera una
idiosincrasia que, se conjetura, in uye en sus habitos de estudio. Un factor importante
para analizar es el constituido por los aspectos relacionados con el nivel socio
economico de cada uno de los barrios.</p>
      <p>
        Existen abundantes estudios relativos a usos de tecnicas de clustering en
ambientes de educacion. Algunos de ellos consolidan los diferentes tipos de
algoritmos de agrupacion aplicados en el contexto de la miner a de datos
educativos, para abordar diferentes problemas que se presentan en EDM (educational
3 http://municipioe.montevideo.gub.uy/sites/municipioe/files/
censo 2011 - informe im.pdf
data mining) [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ] y otros aplican las tecnicas a datos que no pertenecen a una
plataforma de estudio en particular sino que tambien abarcan registros de acceso
a cualquier otro tipo de sitio Web [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ].
      </p>
      <p>A los efectos de aplicar las tecnicas descriptivas se clasi can las localidades de
la ciudad en cuatro categor as, fundamentados en los datos abiertos mencionados
anteriormente (estas se describen en la Seccion 4, Analisis del Problema ).
2</p>
    </sec>
    <sec id="sec-2">
      <title>Alcance del Trabajo</title>
      <p>Los datos son originados a traves de dos fuentes. Una de ellas la constituye
la red educacional donde cada local de estudio tiene asignado un conjunto de
direcciones IP, las cuales son jas, conocidas y estan asociadas a su ubicacion
geogra ca y al tipo de local de estudio. Los registros de navegacion disponibles son
almacenados en formato de texto plano y contienen ciertos atributos de las visitas
a los sitios Web. De cada observacion generada, se utilizan los atributos: fecha,
hora, IP y URL solicitada. La segunda fuente proporciona datos demogra cos
provenientes de organismos o ciales y aportan importante informacion sobre los
municipios que forman la capital del pa s y las caracter sticas socio-economicas
de los barrios que lo integran. Estos datos pueden ser accedidos en la Web.</p>
      <p>El trabajo intenta obtener relaciones entre las conductas de empleo de los
recursos educacionales utilizables en la red y la situacion socio-economica del
estudiante basado en su lugar de residencia.
3</p>
    </sec>
    <sec id="sec-3">
      <title>Objetivo</title>
      <p>El objetivo principal es aplicar tecnicas de anal tica sobre los datos obtenidos
de los archivos que se generan diariamente por la navegacion de los usuarios
de la red, asociando las ip de los centros de estudio con las caracter sticas de la
localidad donde habita. Los resultados obtenidos seran destinados al soporte para
la toma de decisiones de las autoridades del Plan, facilitandose su interpretacion
por medio de una adecuada visualizacion de los resultados a traves de mapas
\inteligentes".
4</p>
    </sec>
    <sec id="sec-4">
      <title>Analisis del Problema</title>
      <p>El analisis del problema permite identi car los siguientes desaf os:
{ De los datos generados en la red, extraer aquellos relacionados con accesos
a sitios de estudio.
{ A partir de los datos disponibles en la Web, construir un ranking de los
barrios que represente en forma dedigna la situacion socio-economica de cada
uno (En este tem se consideraran los datos demogra cos o ciales disponibles
en la Web).
{ Asociar ambos grupos de datos.
{ Determinar los grupos de datos a los cuales aplicar las tecnicas de clustering.
{ Tecnicas de Agrupamiento a ser empleada.</p>
      <p>Los cinco puntos antes nombrados son desarrollados a continuacion.
Datos generados en la red La extraccion de los datos de tra co en Internet a
sitios de estudio se efectuo a traves de rutinas desarrolladas en Python, aplicando
expresiones regulares al atributo \URL solicitada". Luego de una adecuada
sanitacion de los datos se extraen los registros que contienen dichas expresiones. Un
ejemplo de las expresiones regulares empleadas para este caso es:
'\setminus S+clients3\setminus S+',
'\setminus S+windowsupdate\setminus S+',
'\setminus S+mcafee\setminus S+',
'\setminus S+216.239.32.20/generate_204\S+',
'\setminus S+clients1\setminus S+',
'\setminus S+connectivitycheck\setminus S+',
'\setminus S+URLMOD\setminus S+',
'\setminus S+msftncsi\setminus S+'
Clasi cacion de los barrios Los datos disponibles en la Web sobre la situacion
socio-economica de los barrios componentes de cada municipio se fundamentan
en los registros obtenidos en el ultimo Censo Nacional. Esta informacion esta
acompan~ada de valoraciones generales sobre los municipios que dividen a
Montevideo. Se utilizo un procedimiento ad hoc para la construccion del ranking: se
observaron las valoraciones de cada municipio y a cada caracter stica positiva
detectada en la valoracion, se le asigno un coe ciente positivo y a las negativas
uno negativo. Este procedimiento permitio clasi car a los municipios en cuatro
categor as: Muy Favorable (MF ), Favorable (F ), Desfavorable (D) y Muy
Desfavorable (MD). Luego se revisaron los barrios de cada municipio y puntualmente
algunos fueron cambiados de categor a en base al conocimiento de su realidad
particular (4 barrios en un total de 75).</p>
      <p>Asociacion de los registros de tra co con los barrios Para logar la
asociacion de los dos grupos de datos fue necesario efectuar un procesamiento
apropiado de los atributos comunes entre ellos, que posibilitara un posterior
relacionamiento. El atributo comun es el nombre del barrio y se debio realizar
un relevamiento de cada uno de los registros de los centros de estudio (alrededor
de 1200 en Montevideo) que utilizan el sistema.</p>
      <p>Grupos de datos a los cuales aplicar las tecnicas de clustering A
partir del analisis exploratorio de los datos (desarrollado en la Seccion 5) se puede
de nir tres grandes grupos de usuarios: Primaria (Escuela Publica), Secundaria
(Liceo Publico), UTU (Centros de estudio publicos donde se ensen~an
mayormente o cios, de nivel ensen~anza media).</p>
      <p>
        Tecnicas de Agrupamiento a ser empleada Se considera que dos locales de
estudio estan proximos, si la cantidad de conexiones en un per odo de tiempo son
parecidas con un umbral de tolerancia. El espacio as de nido no es eucl deo, lo
cual condiciona la eleccion del algoritmo de clustering a ser utilizado. Un espacio
es euclidiano si el promedio de cualquier conjunto de sus puntos pertenece al
espacio [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ].
5
      </p>
    </sec>
    <sec id="sec-5">
      <title>Analisis exploratorio de los datos</title>
      <p>
        Para el analisis exploratorio de los datos, se empleo el lenguaje R (version 3.6.1)
conectado a la base de datos MongoDB (version 3.2.10 ). A los efectos de evaluar
si existe una tendencia al agrupamiento de los datos se utiliza el estad stico de
Hopkins [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]. La funcion Hopkins del paquete clustertend disponible en R permitio
obtener en todos los estudios valores cercanos a 0,004, lo que es indicativo de
presencia de agrupamientos.
      </p>
      <p>Evaluacion de la existencia de agrupamientos Los estudios que se
realizaron en esta etapa consistieron en la apreciacion de la existencia de
agrupamientos y en la determinacion del taman~o de la muestra para cada estudio.</p>
      <p>
        El Lenguaje R permite al menos dos formas de evaluar la tendencia a la
clusterizacion de los datos. Una de ellas es el estad stico de Hopkins que indica que
tan alejado esta una muestra aleatoria de presentar una distribucion uniforme
y, en consecuencia, de presentar agrupaciones (cuanto mas alejado de tal
distribucion mayor es la probabilidad de que los datos se agrupen). La otra opcion
es el uso de otra funcionalidad consistente en la evaluacion visual de la tendencia
al agrupamiento de los datos (VAT: Visual Assessment of cluster Tendency ). El
procedimiento se fundamenta en el calculo de la matriz de disimilaridad entre
los objetos de la muestra considerando que la distancia es eucl dea [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ].
      </p>
      <p>Debido a que la medida de distancia no es eucl dea, el metodo VAT es
descartado, empleandose el estad stico de Hopkins para evaluar la existencia
de clusteres.</p>
      <p>
        Taman~o de la muestra A los efectos de determinar el taman~o de la muestra
mas apropiado, se empleo el concepto de saturacion (saturacion es denominada la
situacion en la cual, agregar nuevas observaciones, no mejora las perspectivas de
obtener nueva informacion) [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. En esta etapa, tambien se identi caron posibles
outliers.
      </p>
      <p>Procedimiento Luego de asociados los registros se exportaron a una base de
datos relacional y se condujeron consultas para observar las tendencias.</p>
      <p>A los efectos de normalizar los datos de entrada se dividio la cantidad de
conexiones entre la poblacion de cada barrio, evitando que localidades con gran
cantidad de habitantes distorsionen los resultados.</p>
      <p>Algunos resultados de las consultas efectuadas se presentan en la Figura 1.</p>
      <p>De este resultado se destaca que los unicos barrios cuyos centros educativos
utilizaban en ese d a los recursos eran los considerados Muy Desfavorables (MD ).</p>
      <p>En base a esta informacion, el estudio se oriento a investigar la existencia
de clusteres de centros de estudio en determinados barrios que utilizaban con
mayor intensidad la red educacional en funcion de su realidad socio-economica.
6</p>
    </sec>
    <sec id="sec-6">
      <title>Tecnicas aplicadas y resultados obtenidos</title>
      <p>Debido a que el espacio no es eucl deo se empleo el paquete de datamining
disponible en el lenguaje R: CLARA (Clustering Large Applications). Este
algoritmo efectua la busqueda de clusteres en base a medoides (puntos ya existentes
del cluster), prescindiendo de la busqueda de centroides.</p>
      <p>A continuacion se presentan algunos de los resultados que evidencian el mayor
uso de los recursos por parte de los sectores socio-economicos mas desamparados.
Sumarizaciones Iniciales En la tabla de la Figura 2 se presentan la cantidad
de habitantes de acuerdo al tipo socio-economico categorizado en este trabajo y
la cantidad de barrios de acuerdo a los tipos. Ambos resultados fueron
importantes en el transcurso del estudio tanto para efectuar los calculos como para la
interpretacion de los resultados.</p>
      <p>En la Imagen 1 de la Figura 3 se presentan los datos de una muestra
correspondiente a la conectividad de acuerdo al tipo socio-economico y al tipo de
local de ensen~anza correspondiente a 14 d as seleccionados en forma aleatoria.
La ultima columna de la mencionada tabla consiste en los logaritmos naturales
del porcentaje de la poblacion de cada barrio (ya que son numero muy pequen~os)
y se presentan en la gra ca de barras de la Imagen 2 de la misma Figura. En
ella, el opuesto del logaritmo indica el uso que cada estrato de la poblacion (una
longitud de la barra pequen~a es indicativo que hay un uso intenso de los
recursos). Por ejemplo, los alumnos de UTU del tipo MF ser an los que menos
utilizan los recursos (para la muestra seleccionada) y los alumnos de Escuela
Publica del tipo MD (contexto economico-social muy desfavorable) quienes mas
los emplean.</p>
      <p>Resultados obtenidos para los estudiantes de ensen~anza primaria
(Escuela Publica) Para este sector se presentan 3 estudios realizados en marzo
2016, noviembre 2016 y mayo 2017.</p>
      <p>Estudio 1 En la primer imagen de la Figura 4 se observan los datos empleados
para la construccion del dendograma presentado en la segunda imagen.</p>
      <p>Del analisis del dendograma se observan cuatro clusteres bien de nidos (sin
ningun dato mal clasi cado de acuerdo al algoritmo). Se aprecian un
agrupamiento de barrios Desfavorables, D (color anaranjado) y de Muy
Desfavorables, MD (color rojo). Luego se aprecian dos clusteres de Faborables, F (color
amarillo) y Muy Favorables, MF (color verde). Se concluye que para estos datos
existe una mayor cantidad de barrios que utilizan los recursos pertenecientes
a contextos Desfavorables. El siguiente agrupamiento con mayor cantidad de
barrios corresponde a contextos Muy Desfavorables.</p>
      <p>Las categor as F y MF, si bien se agrupan en dos clusteres diferentes, se
puede comprobar que el uso que hacen de los recursos es m nimo. Por ultimo la
hoja que no pertenece a ningun grupo presenta 608 conexiones, quedando fuera
de los grupos y se trata de un barrio del tipo D.</p>
      <p>Estudio 2 El segundo estudio corresponde a una muestra de noviembre de 2016
de Escuela Publica. El dendograma correspondiente se presenta en la primer
imagen de la Figura 5. Se utiliza el mismo sistema de referencia de colores para
las categor as de los barrios que en el Estudio 1. Se observan cuatro clusteres. El
primero y el tercero (empezando por izquierda) corresponden a localidades D, el
segundo presenta una prevalencia de barrios tambien D y el cuarto, no permite
decidir ya que estan mezcladas varias categor as.</p>
      <p>Estudio 3 El estudio correspondiente a mayo de 2017 de las escuelas publicas,
se aprecia en la segunda imagen de la Figura 5. De los cinco agrupamientos
identi cados, los tres primeros presentan individuos de todas las poblaciones no
permitiendo desarrollar una conclusion y el cuarto y quinto presentan una mayor
presencia de D y MD si se consideran conjuntamente.</p>
      <p>Resultados obtenidos para los estudiantes de ensen~anza media (Liceo
Publico) Del estudio para los liceos publicos, en marzo de 2016, se obtiene el
dendograma de la Figura 6, donde se aprecian cuatro agrupamientos. Se observa
una tendencia diferente a la presentada en las muestras correspondientes a la
Escuela Publica. El primer cluster es mayoritariamenteF y MF, el segundo es MF
y el tercero es mayormente D. El cuarto no presenta caracter sticas relevantes.
Resultados obtenidos para los estudiantes de ensen~anza media (UTU )
Al igual que en los otros centros de estudio se observan los agrupamientos de
acuerdo a los barrios (Figura 7). Empleando el mismo sistema de referencias de
colores, se observan cuatro agrupamientos, tres de los cuales son
mayoritariamente F y uno de ellos MD y D.</p>
      <p>Bosquejo de un mapa de tra co En base a los datos disponibles se presenta
una distribucion del uso de la red por barrio en Montevideo, la cual presenta
una idea primaria de la visualizacion del empleo de los recursos en relacion
a la distribucion geogra ca. El suministro de datos en tiempo real permitira la
activacion de indicadores que podr an cruzarse con datos provenientes de diversas
fuentes, como se establecio en la Seccion 3, Objetivo (Figura 8).</p>
    </sec>
    <sec id="sec-7">
      <title>Conclusiones y trabajos futuros</title>
      <p>Los clusteres obtenidos en cada uno de los estudios indica la presencia de
agrupamientos relacionados con la situacion socio-economica de cada barrio.</p>
      <p>A nivel de primaria (escuelas publicas) se observan agrupamientos mas
acentuados y de nidos que en los otros tipos de locales de estudio en los datos
correspondientes a los primeros meses. En los sucesivos meses, se podr a considerar
una tendencia a la uniformizacion en el uso.</p>
      <p>De la observacion de los datos se puede a rmar que en el an~o 2016 los barrios
mas desamparados eran los que mas utilizaban los recursos (casi en exclusividad).
En abril 2017 aunque el uso era mayor por parte de todos, los barrios con mas
pobreza son los que mas lo emplean.</p>
      <p>En cambio, para Liceos Publicos y UTU se observa una tendencia a un mayor
uso en las categor as favorables y muy favorables.</p>
      <p>La presencia de estos agrupamientos permite formular algunas conjeturas
que relacionan el nivel social y economico con el uso de la red educacional. En
caso de que efectivamente sea esta la realidad, se podra llevar adelante pol ticas
integradas (sociales y educativas) para aprovechar las caracter sticas relevadas
en el estudio.</p>
      <p>En lo que concierne a la visualizacion de los resultados, si las autoridades
educativas entienden que es de interes, se suministrara a los mapas inteligentes
datos obtenidos en tiempo real. Esto permitira, enmarcado en un adecuado y
mas ambicioso proyecto de ciencia de datos, un analisis temporal complementado
con otras fuentes de informacion con el objetivo de prevencion de inasistencias
y mejoras educativas (relativas al uso de los recursos). Por ejemplo si se dispone
de informacion proveniente del Ministerio del Interior de un incremento de
actividades delictivas en determinados lugares, puede detectarse la incidencia en
la asistencia a clases (efectuando el cruzamiento de datos provenientes del
ministerio nombrado y los recibidos por el uso de la red educativa).</p>
      <p>Una aplicacion interesante podr a consistir en el cruce de datos provenientes
del Ministerio de Salud Publica relativos a enfermedades estacionales (gripes y
resfr os, por ejemplo) e inasistencias a clase detectadas por el poco empleo de la
red.</p>
      <p>En relacion a las expresiones regulares utilizadas para identi car los sitios de
estudio, es posible ampliar el corpus a los efectos de mejorar la calidad de los
agrupamientos.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          1.
          <string-name>
            <surname>Dutt</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Aghabozrgi</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ismail</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mahroeian</surname>
          </string-name>
          , H.:
          <article-title>Clustering algorithms applied in educational data mining</article-title>
          .
          <source>International Journal of Information and Electronics Engineering</source>
          <volume>5</volume>
          (
          <issue>2</issue>
          ),
          <volume>112</volume>
          (
          <year>2015</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <surname>Glaser</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Strauss</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          :
          <article-title>Discovery of grounded theory: Strategies for qualitative research</article-title>
          .
          <source>Routledge</source>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          3. Han,
          <string-name>
            <given-names>J</given-names>
            .,
            <surname>Pei</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            ,
            <surname>Kamber</surname>
          </string-name>
          ,
          <string-name>
            <surname>M.</surname>
          </string-name>
          :
          <article-title>Data mining: concepts and techniques</article-title>
          .
          <source>Elsevier</source>
          (
          <year>2011</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          4.
          <string-name>
            <surname>Hu</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hathaway</surname>
            ,
            <given-names>R.J.:</given-names>
          </string-name>
          <article-title>An algorithm for clustering tendency assessment</article-title>
          .
          <source>WSEAS Trans. Math</source>
          .
          <volume>7</volume>
          (
          <issue>7</issue>
          ),
          <volume>441</volume>
          {450 (Jul
          <year>2008</year>
          ), http://dl.acm.org/citation.cfm?id=
          <volume>1466906</volume>
          .
          <fpage>1466908</fpage>
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          5.
          <string-name>
            <surname>Leskovec</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rajaraman</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ullman</surname>
          </string-name>
          , J.:
          <source>Mining of Massive Dataset</source>
          . Cambridge University Press (
          <year>2014</year>
          )
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          6.
          <string-name>
            <surname>Saredo</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Motz</surname>
          </string-name>
          , R.:
          <article-title>Application of clustering techniques on data generated by an Online Educational Network</article-title>
          . In:
          <article-title>Anais dos Workshops do Congresso Brasileiro de Informatica na Educaca~o</article-title>
          . vol.
          <volume>6</volume>
          , p.
          <volume>714</volume>
          (
          <year>2017</year>
          )
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>