Sporala red del conocimiento
Universidad de Antioquia

Especialización en Analítica y Ciencia de Datos · 2025

Informe académico del curso manejo de grandes volúmenes de información con Spark, Scala y AWS

Caro Saenz, Carlos Andres · Castro Ochoa, SebastianAsesor: Salazar Sánchez, Maria Bernarda

Este trabajo presenta un análisis descriptivo del curso “Manejo de grandes volúmenes de información con Spark, Scala y AWS”, enfocado en las herramientas fundamentales para la gestión de datos a gran escala. Se exploran los principales paradigmas de procesamiento distribuido, los lenguajes y frameworks más utilizados como PySpark, Scala y scrapy, así como las técnicas comunes para la extracción y transformación de datos. Además, se analizan las ventajas del uso de servicios en la nube para la creación y gestión de clústeres de procesamiento Big Data, con especial énfasis en la integración de soluciones ofrecidas por Amazon Web Services (AWS), incluyendo EC2, S3 y EMR. Este enfoque permite comprender cómo estas tecnologías se complementan para construir soluciones escalables, eficientes y adaptadas a las necesidades actuales del análisis de datos.

Texto completo 14 páginas con texto

Leer la tesis completa Ficha en el repositorio

Contenido