Especialización en Analítica y Ciencia de Datos · 2025
Informe académico del curso manejo de grandes volúmenes de información con Spark, Scala y AWS
Este trabajo presenta un análisis descriptivo del curso “Manejo de grandes volúmenes de información con Spark, Scala y AWS”, enfocado en las herramientas fundamentales para la gestión de datos a gran escala. Se exploran los principales paradigmas de procesamiento distribuido, los lenguajes y frameworks más utilizados como PySpark, Scala y scrapy, así como las técnicas comunes para la extracción y transformación de datos. Además, se analizan las ventajas del uso de servicios en la nube para la creación y gestión de clústeres de procesamiento Big Data, con especial énfasis en la integración de soluciones ofrecidas por Amazon Web Services (AWS), incluyendo EC2, S3 y EMR. Este enfoque permite comprender cómo estas tecnologías se complementan para construir soluciones escalables, eficientes y adaptadas a las necesidades actuales del análisis de datos.
Texto completo 14 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 6
- Introducciónp. 7
- Justificación Académicap. 8
- Descripción Técnicap. 9
- Fundamentos de Big Data y Ecosistema Hadoopp. 9
- ¿Qué es Big Data?p. 9
- HDFS y el procesamiento distribuidop. 9
- Apache Spark como motor de procesamientop. 9
- Ventajas frente a MapReducep. 10
- Transformaciones y acciones en PySparkp. 10
- Lenguaje Scala y su integración con Sparkp. 10
- Características clave de Scalap. 10
- Casos de uso combinando Scala y Sparkp. 11
- Computación en la nube con AWSp. 11
- Conclusionesp. 13
- Referenciasp. 14