<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Discovering interconnections between Uruguay and the world using popular internet tra c</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Diego Kiedanski dkiedanski@ ng.edu.uy</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
          <xref ref-type="aff" rid="aff2">2</xref>
          <xref ref-type="aff" rid="aff3">3</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Copyright c by the paper's authors. Copying permitted for private and academic purposes. In: Proceedings of the IV School of Systems and Networks (SSN 2018)</institution>
          ,
          <addr-line>Valdivia</addr-line>
          ,
          <country country="CL">Chile</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Eduardo Gramp n</institution>
        </aff>
        <aff id="aff2">
          <label>2</label>
          <institution>Facultad de Ingenier a, Universidad de la Republica Montevideo</institution>
          ,
          <country country="UY">Uruguay</country>
        </aff>
        <aff id="aff3">
          <label>3</label>
          <institution>Mateo Nogueira</institution>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2017</year>
      </pub-date>
      <abstract>
        <p>Understanding how Uruguay connects with the world has both practical and theoretical relevance. A lot of research has been done in this subject but none of them focused on Uruguay. In this investigation we intend to do analyze how Uruguay interconnects with the world using popular YouTube CDN tra c.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>Comprender como se interconecta Uruguay con el
mundo a traves de Internet tiene relevancia tanto
practica como teorica. El estudio de la topolog a de la
red es una de las formas mas intuitivas de comenzar
dicho estudio. Este acercamiento, sin embargo, no
contempla el tra co sobre la red o el comportamiento
de los usuarios.</p>
      <p>
        Los servicios OTT (Over-The-Top) son uno de los
mayores responsables del tra co global, siendo video
streaming 72% del tra co de Internet en 2016 [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. Es
natural esperar que, al estudiar de donde, cuando
y como proviene el contenido, estemos arrojando
(mucha) luz sobre como nuestro pa s hace uso de
Internet. Como ejemplo, se propone estudiar YouTube.
Se tomo esta decision debido a que el contenido es de
acceso libre y bastante extenso.
      </p>
      <p>
        El contenido de YouTube (y muchos OTT en
general) es provisto desde CDNs (Content Delivery
Networks), grandes redes distribuidas y opacas a
usuarios externos. Esto hace que el problema de
estudiar el origen y las rutas del tra co sea mucho mas
complejo. Existen diversos trabajos que han intentado
localizar los servidores y caches que proveen contenido
a un determinado ISP, mayoritariamente combinando
tecnicas de analisis de tra co con herramientas de
diagnostico (como ping y traceroute) [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ][
        <xref ref-type="bibr" rid="ref3">3</xref>
        ][
        <xref ref-type="bibr" rid="ref4">4</xref>
        ].
      </p>
      <p>
        La bibliograf a existente ha explorado estas
preguntas sobre todo para actores en Europa [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ][
        <xref ref-type="bibr" rid="ref5">5</xref>
        ],
pero poco o nada se ha hecho en America Latina
y Uruguay. Un primer objetivo es por lo tanto
reproducir estos resultados en nuestro pa s y ubicar
geogra camente (en la medida de lo posible) los
distintos servidores en los que se encuentra el contenido
que consumimos, como cambian estos con el tiempo,
que rutas utilizan para alcanzar nuestro pa s, etc.
Lo que, es mas, existen diversas mejoras posibles a
dichos estudios que ser a interesante poner en practica.
      </p>
      <p>
        Los estudios mas recientes sobre CDN encontrados
utilizan medidas pasivas, recolectadas desde un ISP
[
        <xref ref-type="bibr" rid="ref3">3</xref>
        ][
        <xref ref-type="bibr" rid="ref4">4</xref>
        ]. Estos estudios, ademas, se basan en tra co
generado por personas en su uso cotidiano de estas
plataformas, y, probablemente sin conocer el
contenido en s , debido al uso de TLS en la mayor a de los
servicios. Ademas, el tra co es analizado un tiempo
despues de generado. Nuestro trabajo utiliza tra co
generado por nosotros mismos, lo que nos permite
tener un experimento mas controlado, debido a que
podemos decidir que parte del contenido de toda la
plataforma nos interesa, y, nos da en un futuro, la
posibilidad de volver a visitar el mismo contenido,
para comparar si hubo cambios a nivel de tra co. Se
planea realizar una geolocalizacion de los servidores
de contenido lo mas automatizada y rapido posible.
Es decir, al encontrar un nuevo servidor de contenido
desconocido, geolocalizarlo en el momento (o cuanto
antes posible).
      </p>
      <p>
        Aunque la metodolog a de trabajo esta enfocada en
utilizar YouTube, se puede generalizar a otros tipos
de contenido. Es necesario, primero, conseguir algun
servicio o plataforma que utilice contenido multimedia
brindado por una CDN. Este paso esta por fuera
del alcance del trabajo. Luego es necesario de nir
una forma de navegar por el contenido recolectando
los servidores de los cuales es obtenido el contenido
multimedia junto con otros datos espec cos de
ese contenido que, puedan resultar relevantes. Por
ejemplo, en el caso de videos de YouTube la cantidad
de visitas al video, fecha de carga e idioma del t tulo
consideramos que son ejemplos de esto. La forma
de navegar por el contenido es dependiente sobre si
se requiere realizar la recoleccion automaticamente
o manualmente. Tomando lo primero como
referencia, dado que, una recoleccion manual implicar a
demasiado trabajo, se pueden utilizar en el caso
de computadoras de escritorio herramientas de
navegacion automatica como Selenium [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ] junto con
Browser-Mob Proxy[
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] para capturar el tra co (y
asociarlo al contenido correspondiente). Finalmente,
resta plani car un experimento para de nir cuando
capturar los datos y la metodolog a a usar para
analizarlos.
      </p>
      <p>Una vez que se tiene la informacion de los
servidores de origen, muchas preguntas surgen
naturalmente: &gt;Hay alguna correlacion entre cercan a de los
servidores y el contenido popular en Uruguay?, &gt;Y
entre los videos recomendados a usuarios?
2</p>
    </sec>
    <sec id="sec-2">
      <title>Trabajo Previo</title>
      <p>
        Investigaciones anteriores se han enfocado en
descubrir el funcionamiento de YouTube [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ][
        <xref ref-type="bibr" rid="ref5">5</xref>
        ]. Para
reproducir un video, es necesario acceder a un
frontend web para lo cual se obtiene una direccion IP
consultando al servidor de DNS local. Luego, el
frontend responde con un servidor de contenido inicial
donde el video (que posee un identi cador unico) esta
alojado. Es posible que el servidor no contenga el
video y el usuario sea redirigido hacia otro servidor.
Pueden ocurrir multiples redirecciones, y las mismas
pueden ser de un servidor en un datacenter a otro en
el mismo datacenter o a un datacenter diferente.
      </p>
      <p>
        Los autores de [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ], descubren namespaces de
servidores de contenido junto con una jerarqu a de
redirecciones. 80% de las direcciones IP correspond an
a Google/YouTube y las restantes a otros ISP como
Comcast y Bell-Canada. Algunos hostnames de esas
direcciones IP conten an codigos IATA de aeropuertos,
lo que facilitaban la geolocalizacion de esos servidores.
Ademas, investigan las posibles causas por las que el
usuario es redireccionado.
Para la investigacion se intento replicar los resultados
obtenidos en los estudios previos. Sin embargo,
se descubrio que los antiguos dominios utilizados
por YouTube ya no son utilizados. En su lugar, se
utilizan unos nuevos dominios de la forma
*.googlevideo.com. Los nombres parecen estar agrupados
por localizacion, pero no hay ninguna informacion
que lo con rme. Las redirecciones a otro servidor
cuando en el inicial no se encuentra el contenido
siguen ocurriendo.
      </p>
      <p>Se recolectaron aproximadamente 650 direcciones
IP de servidores de donde se obtuvo contenido. Estos
dominios fueron obtenidos utilizando un programa
disen~ado para navegar automaticamente por el sitio
de YouTube, accediendo a un video inicial y
accediendo a nuevos videos utilizando el video proximo
indicado por la reproduccion automatica. Capturando
paquetes, se guardaron los mensajes de DNS a los
servidores *.googlevideo.com.</p>
      <p>La mayor a de ellas estan asignadas a Google y una
minor a a nuestro ISP. Sin embargo, las direcciones IP
asignadas a Google solo proveen contenido en caso de
una redireccion. Es decir, Google posee servidores de
cache en nuestro ISP. Mas aun, al hacer traceroutes
hacia las direcciones de Google se descubre que el
tra co va de la red de nuestro ISP a la red de Google
directamente sin otros ISP intermedios.</p>
      <p>
        Se investigaron diversas tecnicas de geolocalizacion
y nalmente se decidio para cada servidor asignar
como su localizacion la misma que un equipo cercano
con bajo RTT. Suponiendo que el unico retardo
existente es el de propagacion, se puede calcular la
distancia entre el equipo y el objetivo. Siendo C
la velocidad de la luz en el vac o, los bits viajan a
aproximadamente 49 C [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ]. Por lo tanto, la distancia
maxima posible entre el equipo y el objetivo es
49 C RT2 T . Se eligio como bajo, un RT T menor o
igual a 10ms, lo que da un error de aproximadamente
670km.
      </p>
      <p>
        Los equipos utilizados para realizar las mediciones
fueron probes del proyecto ATLAS de RIPE [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ].
Los resultados arrojaron servidores en Montevideo,
Buenos Aires, Santiago de Chile, San Pablo, Miami,
Atlanta, Dallas, Kansas, Washington DC, Chicago,
Toronto, Denver, Los Angeles, Palo Alto, Portland,
Madrid, Marsella, Milan, Sof a, Budapest, Bratislava,
Varsovia, Estocolmo, Paris, Amsterdam, Ede (Paises
Bajos), Frankfurt, Hamburgo, Londres y Dublin.
      </p>
      <p>Es probable que se siga intentando encontrar
equipos con menor RTT hacia alguno de los
servidores de forma de obtener un error mas bajo. Por lo
tanto, algunas ubicaciones podr an cambiar. Ademas,
nuevos servidores pueden ser descubiertos al realizar
el experimento nal, luego de concurrida la
investigacion preliminar actual. Las localizaciones
encontradas hasta ahora, pueden ser utilizadas para
geolocalizar los nuevos servidores. Se utilizar an para
concluir si, se encuentran en una localizacion conocida o,
una distinta a las actuales, e intentar encontrar donde
es.
4</p>
    </sec>
    <sec id="sec-3">
      <title>Trabajo Futuro</title>
      <p>Para el futuro, se planea continuar la investigacion
siguiendo los siguientes lineamientos.</p>
      <p>Integrar el sistema de geolocalizacion con el
software de navegacion de manera de geolocalizar los
nuevos servidores al mismo tiempo en el que se
descubren.</p>
      <p>Llevar a cabo un experimento de mayor porte,
consumiendo videos desde varios equipos
simultaneamente. Se estima que tenga una
duracion de aproximadamente una semana, un
numero no menor a cinco usuarios y a distintos
horarios, por ejemplo, algunos por la man~ana, otros
en hora pico, etc. Antes de esto, es necesario
terminar de de nir que atributos de los videos
podr an resultar utiles a la hora de analizar los
resultados. Por ejemplo, cantidad de visitas.
Aplicar tecnicas de aprendizaje automatico para
analizar los datos recolectados, buscando
relaciones entre el contenido y la localizacion del
usuario, buscando resolver las dudas planteadas
en la introduccion.</p>
      <p>Investigar una posible relacion entre los nombres
de domino de los servidores de contenido y su
ubicacion geogra ca.</p>
      <p>Obtener informacion sobre el funcionamiento del
cacheo y redirecciones de YouTube luego de que
un video no se encontro en un servidor.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Cisco</surname>
          </string-name>
          , \
          <article-title>Cisco visual networking index: Forecast and methodology,</article-title>
          <year>2016</year>
          {
          <year>2021</year>
          ,
          <article-title>"</article-title>
          https://www.cisco.com/c/en/us/solutions/
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <given-names>R.</given-names>
            <surname>Torres</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Finamore</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. R.</given-names>
            <surname>Kim</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Mellia</surname>
          </string-name>
          ,
          <string-name>
            <surname>M. M. Munafo</surname>
            , and
            <given-names>S.</given-names>
          </string-name>
          <string-name>
            <surname>Rao</surname>
          </string-name>
          , \
          <article-title>Dissecting Video Server Selection Strategies in the YouTube CDN,"</article-title>
          <source>in 2011 31st International Conference on Distributed Computing Systems, Jun</source>
          .
          <year>2011</year>
          , pp.
          <volume>248</volume>
          {
          <fpage>257</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>P.</given-names>
            <surname>Fiadino</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Schiavone</surname>
          </string-name>
          , and
          <string-name>
            <given-names>P.</given-names>
            <surname>Casas</surname>
          </string-name>
          , \
          <article-title>Vivisecting WhatsApp in Cellular Networks: Servers, Flows, and Quality of Experience," in 7th Workshop on Tra c Monitoring and Analysis (TMA), ser</article-title>
          . Tra c Monitoring and
          <string-name>
            <surname>Analysis</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          <string-name>
            <surname>Steiner</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          <string-name>
            <surname>Barlet-Ros</surname>
            , and
            <given-names>O.</given-names>
          </string-name>
          <string-name>
            <surname>Bonaventure</surname>
          </string-name>
          , Eds., vol. LNCS-
          <volume>9053</volume>
          , Barcelona, Spain, Apr.
          <year>2015</year>
          , pp.
          <volume>49</volume>
          {
          <fpage>63</fpage>
          . [Online]. Available: https://hal.archives-ouvertes.fr/hal-01411179
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>P.</given-names>
            <surname>Fiadino</surname>
          </string-name>
          ,
          <string-name>
            <surname>A. D'Alconzo</surname>
            ,
            <given-names>and P.</given-names>
          </string-name>
          <string-name>
            <surname>Casas</surname>
          </string-name>
          , \
          <article-title>Characterizing web services provisioning via CDNs: The case of Facebook,"</article-title>
          <source>in 2014 International Wireless Communications and Mobile Computing Conference (IWCMC)</source>
          ,
          <year>Aug</year>
          .
          <year>2014</year>
          , pp.
          <volume>310</volume>
          {
          <fpage>315</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <given-names>V. K.</given-names>
            <surname>Adhikari</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Jain</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Chen</surname>
          </string-name>
          , and
          <string-name>
            <given-names>Z. L.</given-names>
            <surname>Zhang</surname>
          </string-name>
          , \
          <article-title>Vivisecting YouTube: An active measurement study,"</article-title>
          <source>in 2012 Proceedings IEEE INFOCOM, Mar</source>
          .
          <year>2012</year>
          , pp.
          <volume>2521</volume>
          {
          <fpage>2525</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <given-names>Selenium</given-names>
            <surname>Browser Automation</surname>
          </string-name>
          , https://www. seleniumhq.org/, [Online; accessed 31-July-2018].
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Browsermob-Proxy</surname>
          </string-name>
          , https://github.com/ lightbody/browsermob-proxy, [Online; accessed 31-July-2018].
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <given-names>E.</given-names>
            <surname>Katz-Bassett</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. P.</given-names>
            <surname>John</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Krishnamurthy</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Wetherall</surname>
          </string-name>
          ,
          <string-name>
            <given-names>T.</given-names>
            <surname>Anderson</surname>
          </string-name>
          , and
          <string-name>
            <given-names>Y.</given-names>
            <surname>Chawathe</surname>
          </string-name>
          , \
          <article-title>Towards IP Geolocation Using Delay and Topology Measurements,"</article-title>
          <source>in Proceedings of the 6th ACM SIGCOMM Conference on Internet Measurement, ser. IMC '06</source>
          . New York, NY, USA: ACM,
          <year>2006</year>
          , pp.
          <volume>71</volume>
          {
          <fpage>84</fpage>
          . [Online]. Available: http://doi.acm.
          <source>org/10</source>
          .1145/1177080.1177090
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <article-title>[9] The RIPE Atlas measurement network</article-title>
          , https:// atlas.ripe.net/, [Online; accessed 31-July-2018].
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>