Colección Textos Académicos Representaciones de datos, para análisis exploratorio aplicado a ingeniería Mauricio Holguín Londoño Germán Andrés Holguín Londoño Kevin David Ortega Quiñones
Mauricio Holguín Londoño (Pereira, Risaralda, Colombia, 1974) Ingeniero Electricista y Doctor (Ph.D.) en Ingeniería por la Universidad Tecnológica de Pereira. Se desempeña como Profesor Titular de la Facultad de Ingenierías Eléctrica, Electrónica, Física y Ciencias de la Computación y actualmente es Vicerrector de Investigaciones, Innovación y Extensión de la Universidad Tecnológica de Pereira. Es autor de los libros Introducción a la ciencia y análisis de datos con Python: una visión empresarial (2025), Introducción al control de la calidad y Seis Sigma (2024), El ciclo de vida, la gestión de activos y la confiabilidad (2024), Principios y métodos combinatoriales en sistemas automáticos digitales (2021), Pronóstico de vida útil remanente en rodamientos con base en la estimación de la probabilidad de la degradación (2019), Fundamentos teóricos para los autómatas industriales (2010) y Automatismos industriales (2008). Ha publicado artículos en revistas especializadas nacionales e internacionales y es director del grupo de investigación en Gestión de Sistemas Eléctricos, Electrónicos y Automáticos.
mau.hol@utp.edu.co Germán Andrés Holguín Londoño (Pereira, Risaralda, Colombia, 1977) Ingeniero Electricista y Magíster en Ingeniería (M.Sc.) por la Universidad Tecnológica de Pereira. Se desempeña como Profesor Titular de la Facultad de Ingenierías Eléctrica, Electrónica, Física y Ciencias de la Computación de la Universidad Tecnológica de Pereira. Es autor de los libros Introducción a la ciencia y análisis de datos con Python: una visión empresarial (2025), El ciclo de vida, la gestión de activos y la confiabilidad (2024), Principios y métodos combinatoriales en sistemas automáticos digitales (2021) y Manipuladores paralelos: síntesis, análisis y aplicaciones (2018). Ha publicado artículos en revistas especializadas nacionales e internacionales y es miembro del grupo de investigación en Gestión de Sistemas Eléctricos, Electrónicos y Automáticos.
gahol@utp.edu.co Kevin David Ortega Quiñones (Tumaco, Nariño, Colombia 1998) Ingeniero Electricista por la Universidad Tecnológica de Pereira. Se desempeña como Profesor Catedrático Auxiliar adscrito a la Facultad de Ingenierías de la Universidad Tecnológica de Pereira (UTP). Ha publicado artículos en revistas especializadas internacionales y trabajos en memorias de conferencias en las áreas de robótica aplicada y analítica de datos. Pertenece al grupo de investigación GSEEA – Grupo de Sistemas Eléctricos y Electrónicos de Automatización, registrado ante Minciencias. kevin.ortega@utp.edu.co.
Facultad de Ingenierías Colección Textos Académicos
2025
Representaciones de datos, para análisis exploratorio aplicado a ingeniería Mauricio Holguín Londoño Germán Andrés Holguín Londoño Kevin David Ortega Quiñones
Representaciones de datos, para análisis exploratorio aplicado a ingeniería © Mauricio Holguín Londoño © Germán Andrés Holguín Londoño © Kevin David Ortega Quiñones © Universidad Tecnológica de Pereira e-ISBN: 978-628-501-075-0 Universidad Tecnológica de Pereira Vicerrectoría de Investigaciones, Innovación y Extensión Editorial Universidad Tecnológica de Pereira Pereira, Colombia Coordinador editorial Luis Miguel Vargas Valencia luismvargas@utp.edu.co Teléfono (606) 313 7381 Edificio 9, Biblioteca Central Jorge Roa Martínez Cra. 27 No. 10-02 Los Álamos, Pereira, Colombia www.utp.edu.co Diagramación y producción Tomás Flórez Calle Universidad Tecnológica de Pereira Pereira, Risaralda, Colombia.
Holguín Londoño, Mauricio Representaciones de datos, para análisis exploratorio aplicado a ingeniería / Mauricio Holguín Londoño, Germán Andrés Holguín Londoño y Kevin David Ortega Quiñones. -- Pereira : Editorial Universidad Tecnológica de Pereira, 2025. 259 páginas. (Colección Textos académicos). e-ISBN: 978-628-501-075-0 1.Visualización de datos 2. Estadística aplicada 3. Análisis exploratorio de datos 4. Aprendizaje automático
CDD. 519.5
Contenido Capítulo 1 FUNDAMENTOS DE LA REPRESENTACIÓN DE DATOS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 1.1. ¿CÓMO CREAR UN GRÁFICO?. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
1.1.1. Preparación de los datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
1.1.2. Tipos de gráficos y variables. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
1.1.3. Uso del color y énfasis . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
1.2. LA VISUALIZACIÓN Y EL USO DE HERRAMIENTAS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
Capítulo 2 FUNDAMENTOS DE LA REPRESENTACIÓN DE DATOS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 37 2.1. TIPOS DE VARIABLES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40 2.1.1. Variables cualitativas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
2.1.2. Variables cuantitativas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41
2.1.3. Consideraciones a las tipologías de variables. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
2.2. MÉTODOS DE MUESTREO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.2.1. Muestreo aleatorio simple. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.2.2. Muestreo estratificado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
2.2.3. Muestreo Sistemático. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
2.3. PREPROCESAMIENTO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
2.3.1. Formato de los datos y tipo de categorías. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
2.3.2. Eliminación de registros faltantes e imputación de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 51
2.3.3. Detección de valores atípicos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52
2.3.4. Discretización. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
2.3.5. Codificación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
2.3.6. Estandarización de los datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 55
2.3.7. Normalización de los datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
2.4. SESGOS EN LA INTERPRETACIÓN DE DATOS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
2.5. FUENTES DE DATOS ABIERTOS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
Capítulo 3
REPRESENTACIONES DE DATOS PARA ESTADÍSTICA DESCRIPTIVA. . . . . . . . . . . . . . . . . . . . . . . . . . 63
3.1. TABLAS Y DISTRIBUCIONES DE FRECUENCIA . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
3.1.1. Distribuciones de frecuencia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 67
3.1.2. Tipos de distribuciones. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 67
3.2. VISUALIZACIÓN DE DATOS EN ESTADÍSTICA DESCRIPTIVA. . . . . . . . . . . . . . . . . . . . . . . . . . . 72 3.2.1. Histograma. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 72
3.2.2. Polígono de frecuencias. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 74
3.2.3. Diagrama de sectores. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 75 3.2.4. Diagrama de caja y bigotes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
3.2.5. Diagramas de dispersión. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 79
3.3. MEDIDAS DESCRIPTIVAS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
3.3.1. Medidas de posición. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
3.3.2. Medidas de dispersión. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86
3.3.3. Medidas de forma y distribución. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 88
3.3.4. Medidas de concentración. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 90
3.3.5. Medidas de correlación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 94 Capítulo 4
VISUALIZACIONES PARA DISTRIBUCIÓN DE DATOS Y ESTADÍSTICA INFERENCIAL. . . . . . . . . . . . 103
4.1. VISUALIZACIONES PARA DISTRIBUCIÓN DE DATOS . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107
4.2. ESTADÍSTICA INFERENCIAL. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 124 4.2.1. Concepto y aplicación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 124
4.2.2. Tipos de Inferencia: la Estimación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 128
4.2.3. Prueba de hipótesis. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 133
4.2.3.1. Flujo de la prueba de hipótesis. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 133
4.2.3.2. Análisis de varianza (ANOVA). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 138
4.2.4. Modelos de Regresión . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 140
4.2.4.1. Interpretación de los Componentes del Modelo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 140
4.2.4.2. Visualización de P-value . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
4.2.5. Aplicación de visualizaciones en la estadística inferencial. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 142 4.2.6. Toma de decisiones basada en inferencia estadística . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 144
4.2.7. Ejemplos de visualizaciones utilizadas en la estadística inferencial. . . . . . . . . . . . . . . . . . . . . . 146
Capítulo 5
REPRESENTACIONES PARA SERIES DE TIEMPO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 155
5.1. LAS SERIES DE TIEMPO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 157 5.1.1. ¿Qué son las series de tiempo?. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 158
5.1.2. Componentes de una serie de tiempo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 160
5.1.2.1. Tendencia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 160 5.1.2.2. Estacionalidad . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 161 5.1.2.3. Ciclo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 161
5.1.2.4. Ruido. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 162
5.1.2.5. Descomposición de series de tiempo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 163
5.1.3. Tipos de series de tiempo: estacionarias y no estacionarias. . . . . . . . . . . . . . . . . . . . . . . . . . . . 164
5.1.4. Visualización de series de tiempo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 165 5.2. MÉTODOS PARA VISUALIZAR SERIES DE TIEMPO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 169
5.2.1. Gráfico de líneas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 169
5.2.2. Diagrama de dispersión . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 172 5.2.3. Procesamiento y modelado de series temporales . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 174 5.2.3.1. Limpieza de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 174 5.2.3.2. Transformaciones. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 175
5.2.4. Normalización y escalado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 175
5.3. MODELOS DE SERIES DE TIEMPO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 180
5.3.1. Modelos de suavizado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 180
5.3.2. Modelos ARIMA. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 180 5.3.3. Modelos SARIMA. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 181
5.3.4. Modelos GARCH. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 181
5.4. ANÁLISIS Y DESCOMPOSICIÓN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 184
5.4.1. Descomposición STL . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 184
5.4.2. Análisis de autocorrelación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 186
5.5. PREDICCIÓN Y FORECASTING. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 189
5.5.1. Evaluación de Modelos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 189
5.5.2. Modelos de Machine Learning. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 190
5.5.3. Visualización en Forecasting. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 191
Capítulo 6
REPRESENTACIONES PARA APRENDIZAJE AUTOMÁTICO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 199
6.1. PREPROCESAMIENTO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 202 6.2. REGRESIÓN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 203
6.3. CLASIFICACIÓN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 205
6.3.1. Matrices de confusión. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 205
6.3.2. Curvas ROC . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 206
6.4. AGRUPACIÓN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 209
6.4.1. El algoritmo K-Means. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 210
6.4.2. Muestreo por conglomerados. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 210
6.5. TÉCNICAS PARA AGRUPACIÓN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 212
6.5.1. Agrupamiento por categorías . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 212
6.5.1.1. Mapas de calor por interpolación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 212
6.5.1.2. Diagramas de Voronoi para partición espacial . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 213 6.5.2. Agrupamiento con discretización en cuadrículas (2D Binning) . . . . . . . . . . . . . . . . . . . . . . . . . 213
6.5.2.1. Métricas de Distancia: Euclidiana vs. Manhattan. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 213
6.5.3. Agrupamiento espacial/geográfico. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 214
6.5.4. Agrupamiento temporal. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 217
6.5.5. Agrupamiento por atributos específicos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 219
6.5.6. Agrupamiento por similitud visual. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 220
6.5.7. Tablas cruzadas (Crosstabs). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 222
6.6. EJEMPLOS DE COMBINACIONES PRÁCTICAS . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 225 6.7. TIPOS DE AGRUPAMIENTO MULTIVARIADO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 227
6.8. GRÁFICOS PARA MODELOS DE REDES NEURONALES . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 232
6.8.1. Redes completamente conectadas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 232
6.8.2. Redes convolucionales. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 233
6.8.3. Perceptrón multicapa (MLP) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 234
6.8.4. Modelado y aplicaciones según el tipo de problema. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 235
6.8.5. Ajuste eficiente de parámetros (PEFT). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 236
6.9. GRÁFICOS PARA MODELOS DE REDES NEURONALES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 248
6.10. VISUALIZACIONES PARA INTERPRETABILIDAD Y ANÁLISIS ESTRUCTURAL. . . . . . . . . . . 249
Referencias . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 253
Lista de figuras 1.1. Representación visual de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
1.2. Propósitos de la representación visual de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
1.3. Selección entre los tipos de datos y los tipos de gráficos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
1.4. Escalas de color y contrastes en la representación gráfica de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . 27
1.5. Comparación de la expectativa de vida media . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
1.6. Gráfico strip con problemas de solapamiento . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30
1.7. Gráfico swarm que evita el solapamiento. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30
1.8. Diagrama de violín y strip combinados. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30
1.9. Gráfico de violín limpio y efectivo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1.10. Violines para continentes con países desarrollados. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1.11. Análisis detallado para países en desarrollo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1.12. La Pirámide de la Habilidad en Visualización. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
1.13. Dos visualizaciones creadas con los mismos datos y la misma herramienta. . . . . . . . . . . . . . . . . . . . 33
2.1. Sistema de recolección y procesamiento de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
2.2. Ejemplo de gráfico de barras para una variable cualitativa (Estado Civil), mostrando la frecuencia de cada categoría. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41 2.3. Análisis de una variable cuantitativa. El histograma muestra la forma y el centro, mientras que el
diagrama de caja resalta la extensión y los valores atípicos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
2.4. Tipos de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
2.5. Muestreo aleatorio simple. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.6. Muestreo estratificado. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
2.7. Muestreo sistemático . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
2.8. Diagrama conceptual del flujo de preprocesamiento de datos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
2.9. Comparación visual de la estructura de datos en formatos SQL, JSON y CSV . . . . . . . . . . . . . . . . . . 51
2.10. Comparación gráfica de los tres tipos de curtosis. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .53
2.11. Proceso de discretización de una variable continua (Edad) en tres categorías discretas. . . . . . . . . . 54
2.12. Comparación del proceso de Label Encoding y One-Hot Encoding para una variable categórica . . 55
2.13. Sesgo de Recencia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
2.14. Sesgo de Confirmación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
2.15. Sesgo de Estacionalidad. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
2.16. Sesgo de Disponibilidad. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
2.17. Sesgo de Anclaje. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
2.18. Sesgo de Selección . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
2.19. Sesgo de Supervivencia. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
3.1. Secuencia de creación de una tabla de frecuencia . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 66
3.2. Frecuencia no agrupada . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68
3.3. Frecuencia agrupada. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68
3.4. Frecuencia relativa. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68
3.5. Frecuencia acumulativa. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 68
3.6. Diagrama de frecuencia. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 70
3.7. Histograma de palabras más frecuentes. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71
3.8. Histograma con diferente tamaño de Bin. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
3.9. Polígono de frecuencias de especies de Iris. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 74
3.10. Diagrama de sectores. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
3.11. Diagrama de sectores I. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .76
3.12. Diagrama de sectores II. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 77
3.13. Diagrama de caja y bigotes. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 79
3.14. Longitud de sépalo vs Longitud de pétalo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 80
3.15. Representación visual de las medidas descriptivas. El gráfico de densidad muestra el centro (media, mediana), la dispersión (rango intercuartílico), la forma (asimetría) y la presencia de outliers . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 81
3.16. Histograma de frecuencias para la identificación visual de la moda. . . . . . . . . . . . . . . . . . . . . . . . . . . 83
3.17. Representación gráfica de diferentes divisiones por cuantiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 84
3.18. Diagramas de caja de variables con escalas muy diferentes. La información
de la variable con menor rango es casi imperceptible . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85
3.19. Variables normalizadas por rango (Min-Max). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85
3.20. Variables normalizadas con Z-score. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86
3.21. Estimación de la densidad de Kernel (curva) superpuesta a los histogramas para las variable del caso de estudio. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 89
3.22. Curva de Lorenz para la distribución de ingresos .. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 92
3.23. Curvas de Lorenz para tres países con diferentes niveles de desigualdad de ingresos. . . . . . . . . . . . 94
3.24. Relación entre horas de estudio y calificaciones (Correlación de Pearson). . . . . . . . . . . . . . . . . . . . . 97
3.25. Relación entre puesto en la competencia y rendimiento (Correlación de Spearman). . . . . . . . . . . . . 98
3.26. Relación entre satisfacción laboral y productividad (Correlación de Kendall) . . . . . . . . . . . . . . . . . . 100
4.1. Diferencia visual entre la hipótesis alternativa (izquierda), que sugiere una relación, y la hipótesis
nula (derecha), que no muestra un patrón aparente . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 106
4.2. Gráfico de dispersión con línea de regresión lineal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 106
4.3. Ejemplos gráficos de correlación: positiva, negativa y nula. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107 4.4. Diagrama de Stakeholders: diversas partes interesadas que influyen y son afectadas por un
proyecto central. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 108
4.5. Distribución de frecuencia de los tipos de clases. Un gráfico de barras que muestra el recuento de animales en cada categoría. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 109 4.6. Mapa de calor de correlación. Se observa una fuerte relación positiva entre tener pelo (hair) y
producir leche (milk), una característica clave de los mamíferos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 110
4.7. Dispersión de clase animal vs. número de patas. Aunque no hay una
tendencia lineal, se observan agrupaciones claras por clase . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 111
4.8. Ejemplo de un histograma que muestra la distribución de los pesos (datos
sintéticos) de 100 animales, utilizando 7 bins según la Regla de Sturges. . . . . . . . . . . . . . . . . . . . . . 112
4.9. Infografías. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113
4.10. Mapas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113
4.11. Gráficos de área. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113
4.12. Gráficos piramidales. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
4.13. Treemaps. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
4.14. Gráficos de línea. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
4.15. Dendrogramas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 115
4.16. Densidad para todos los pingüinos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 116
4.17. Densidad separada por especie. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 116
4.18. Ridgeline de la longitud del pico por especie . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 117
4.19. Comparación de la longitud del pico entre especies. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 118
4.20. Histograma de todas las longitudes de pico. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 119
4.21. Histograma de temperaturas registradas en incendios forestales. . . . . . . . . . . . . . . . . . . . . . . . . . . 120
4.22. Temperatura promedio mensual en incendios forestales. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 120
4.23. Diagrama de caja del índice de sequía DC en incendios forestales. . . . . . . . . . . . . . . . . . . . . . . . . . . 121 4.24. Relación entre temperatura y área afectada en incendios forestales. . . . . . . . . . . . . . . . . . . . . . . . . 121
4.25. Gráfico de líneas mostrando la evolución temporal de los incendios forestales . . . . . . . . . . . . . . . . 122
4.26. Mapa de calor de correlaciones entre variables ambientales en incendios forestales. . . . . . . . . . . 123
4.27. Proyección lineal de variables ambientales en incendios forestales. . . . . . . . . . . . . . . . . . . . . . . . . . 123
4.28. Tipos de muestras extraídas de una población. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 125
4.29. Distribución de la población de datos aleatorios en el plano de las variables X y Y . . . . . . . . . . . . . . 126
4.30. Comparación de la distribución de frecuencias de la población completa (azul) con la muestra seleccionada (rojo). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 127 4.31. Estimación de la Función de Densidad de Probabilidad de la muestra,
ajustada a una distribución normal esperada. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 127
4.32. Circuito electrónico bajo análisis. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 128
4.33. Regresión lineal sobre las mediciones de tensión y corriente. La baja pendiente demuestra la
ausencia de una relación lineal significativa. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 130
4.34. Muestreo de la corriente de arranque de un motor, mostrando un patrón no lineal característico.. . . 131
4.35. Evaluación del ajuste: función original vs. el modelo polinómico de grado 13, que captura con
precisión la estructura subyacente de los datos.. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 132
4.36. Comparativa que destaca la inadecuación de modelos simples (lineal, bajo grado) frente a la flexibilidad del ajuste polinómico de grado 13. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 133
4.37. Relación entre edad y nivel de ingresos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 135
4.38. Representación del modelo de regresión lineal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 137 4.39. Distribución de datos frente al valor t de la prueba . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 137 4.40. Boxplots de la resistencia a la tracción según la aleación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 140
4.41. Visualización del p-value en una distribución normal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
4.42. Histograma de puntuaciones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 142
4.43. Gráfico de probabilidad normal. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 142 4.44. Comparación de medidas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 143
4.45. Gráfico de dispersión. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 143
4.46. Mapa de calor. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 143
4.47. Comparación de eficacia: Grupo Tratado vs. Grupo Placebo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 144
4.48. Gráfico de control de calidad (Shewhart) para un proceso industrial. . . . . . . . . . . . . . . . . . . . . . . . . 145
4.49. Diagrama de Tornado. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 146
4.50. Intervalos de Confianza. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 146
4.51. Gráfico Q-Q . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 147
4.52. Dispersión con regresión. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 147
4.53. Distribución de calificaciones en ambos grupos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 148
4.54. Comparación de calificaciones mediante diagramas de caja. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 148
4.55. Gráfico Q-Q de los residuos, validando el supuesto de normalidad . . . . . . . . . . . . . . . . . . . . . . . . . . 149
4.56. Medias de los grupos con intervalos de confianza al 95% . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 150
4.57. Regresión lineal con intervalos de confianza . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 151
4.58. Diagrama de tornado aplicado a factores de rendimiento académico. . . . . . . . . . . . . . . . . . . . . . . . 152
5.1. Visualización de una serie de tiempo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 158
5.2. Ejemplos de diferentes patrones en series de tiempo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 159
5.3. Ejemplo de descomposición de una serie de tiempo en sus componentes:
tendencia, estacionalidad y residuo (ruido) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 163
5.4. Comparación visual. A la izquierda, una serie estacionaria (ruido blanco) que oscila alrededor de una media constante. A la derecha, una serie no estacionaria (paseo aleatorio) que no tiene una media fija . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 164
5.5. Visualización de datos temporales. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 165
5.6. Temperatura media mensual (Serie de tiempo). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 167
5.7. Componente de tendencia de la serie de tiempo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 167
5.8. Componente de estacionalidad de la serie de tiempo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 168
5.9. Componente Cíclico de la Serie de Tiempo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 168
5.10. Componente de Ruido de la Serie de Tiempo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 168
5.11. Ventas mensuales para el año 2023. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 170
5.12. Ventas mensuales para los años 2023 y 2024 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 171
5.13. Temperatura y consumo de energía. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 173
5.14. Proceso de preprocesamiento de datos: (arriba) Consumo energético diario original y outliers, (centro) Consumo energético diario después de la transformación logarítmica, (abajo) Consumo
energético diario después de la normalización . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 179
5.15. Serie temporal de pasajeros aéreos (1949–1960), con tendencia, estacionalidad y varianza
crecientes. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 182
5.16. La media móvil de 12 meses filtra la estacionalidad y resalta la tendencia subyacente. . . . . . . . . . . 182
5.17. Pronóstico con ARIMA: captura la tendencia, pero ignora por completo la estacionalidad. . . . . . . . 183
5.18. Pronóstico con SARIMA: captura exitosamente tanto la tendencia como los ciclos estacionales. . 183
5.19. Descomposición STL de la serie AirPassengers, separando la tendencia, la estacionalidad y el residuo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 186
5.20. Función de autocorrelación (ACF) de la serie AirPassengers. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 187
5.21. Función de autocorrelación parcial (PACF) de la serie AirPassengers. . . . . . . . . . . . . . . . . . . . . . . . 188
5.22. Serie de tiempo completa de la demanda energética horaria (2004-2018) . . . . . . . . . . . . . . . . . . . . 192
5.23. Descomposición de la serie en tendencia, estacionalidad y residuo . . . . . . . . . . . . . . . . . . . . . . . . . 193
5.24. Función de autocorrelación (ACF) con rezagos horarios. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 193
5.25. Comparación de los valores reales vs. los predichos por el modelo. . . . . . . . . . . . . . . . . . . . . . . . . . 195
5.26. Importancia de las variables según el modelo LightGBM. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 196
6.1. Comparación de la distribución de clases antes (izquierda) y después (derecha) de aplicar una técnica de balanceo como SMOTE. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 202 6.2. Diagrama de caja. Los puntos individuales son identificados como posibles valores atípicos. . . . . 202
6.3. Mapa de calor de correlaciones. Los colores intensos señalan pares de variables
altamente correlacionadas. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 203
6.4. Visualización de datos de alta dimensión reducidos a dos componentes
principales con PCA, mostrando una mejor separación de las clases . . . . . . . . . . . . . . . . . . . . . . . 203
6.5. Comparación de un modelo bien ajustado (izquierda) y uno mal ajustado (derecha) a través de sus respectivos gráficos de residuales . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 204
6.6. Curva ROC y área bajo la curva (AUC) como métricas de desempeño en clasificación binaria. . . . 207
6.7. Ejemplo de curva ROC obtenida a partir de un modelo de clasificación binaria con AUC cercano a 0.92 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 209 6.8. Visualización del proceso del algoritmo K-Means. Desde los datos iniciales (A), pasando por la asignación de puntos a centroides (B-C), hasta la convergencia final de los clústeres (D). . . . . . . . . 211 6.9. Ejemplo de muestreo por conglomerados: selección de dos clases completas (conglomerados) dentro de la población total. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 211
6.10. Ilustración del método de Ponderación Inversa a la Distancia (IDW) . . . . . . . . . . . . . . . . . . . . . . . . . 212
6.11. Mapa de calor de temperatura resultante de la interpolación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 212
6.12. Construcción de una celda de Voronoi. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 213
6.13. Diagrama de Voronoi completo. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 213
6.14. Comparación visual entre la distancia Euclidiana (línea recta) y la distancia de Manhattan (camino por la cuadrícula). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 214
6.15. Histograma 2D que muestra la frecuencia de puntos en cada celda de la
cuadrícula. El color de cada celda indica cuántos puntos contiene (en este caso, 1). . . . . . . . . . . . . 215
6.16. Visualización de terremotos en el mundo. El color de cada punto indica la magnitud del sismo. . . . 216
6.17. Resultado de aplicar DBSCAN. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 216
6.18. División de una ciudad en regiones de Voronoi según la proximidad a puntos de interés (rojos). . . 216
6.19. Proceso de agrupamiento temporal. A la izquierda, múltiples series de tiempo sin orden. A la derecha, las mismas series agrupadas por similitud en dos clústeres, con su patrón promedio
(centroide) resaltado en negrita . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 217
6.20. Agrupamiento temporal para alimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 218
6.21. Agrupamiento temporal para libros. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 218
6.22. Agrupamiento temporal para electrónica. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 218
6.23. Agrupamiento temporal para ropa. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 218
6.24. Agrupamiento de datos tras reducción de dimensión con PCA en el caso de
Segmentación de Productos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 219
6.25. Mapa de calor de similitud. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 221
6.26. Agrupamiento usando t-SNE. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 221
6.27. Mapa auto organizado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 221
6.28. Mapa de calor de la tabla de contingencia. Se observa visualmente que la
celda (Mujer, Alimentos) tiene la frecuencia más alta. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 223
6.29. Mapa de calor de las contribuciones al estadístico χ2. La celda (Hombre, Electrónica) es la
que más aporta a la asociación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 224
6.30. Mapa perceptual del Análisis de Correspondencias (CA). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 225
6.31. Dispersión con K-Means. Se identifican tres clústeres de movilidad (rojo, azul, verde) con sus
centroides (cruces negras) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 226
6.32. Mapa de calor temporal. Los colores oscuros revelan picos de movilidad en las mañanas y
tardes de los días laborales . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 226
6.33. Diagrama de Voronoi basado en los centroides. Cada color define el área de
servicio de cada clúster de movilidad. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 227
6.34. Comparación de técnicas de agrupamiento en el dataset Iris . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 228
6.35. Mapa de calor de correlaciones. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 230 6.36. Gráfico de dispersión matricial de los indicadores seleccionados. . . . . . . . . . . . . . . . . . . . . . . . . . 230
6.37. Dispersión: Inflación vs Crecimiento del PIB . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 231
6.38. Proyección de los países en los dos primeros componentes principales. . . . . . . . . . . . . . . . . . . . . 231
6.39. Dendrograma jerárquico de países latinoamericanos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 231
6.40. Red completamente conectada con una capa oculta. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 233
6.41. Red convolucional (CNN) simplificada. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 234
6.42. Concepto visual y panorama de las técnicas PEFT. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 236 6.43. Mapa de calor de correlaciones para el dataset de enfermedad cardíaca . . . . . . . . . . . . . . . . . . . . 238
6.44. Curvas de aprendizaje del modelo: precisión (izquierda) y pérdida (derecha). . . . . . . . . . . . . . . . . . 239
6.45. Gráficos de evaluación del clasificador: Matriz de Confusión (izquierda) y Curva ROC (derecha) . 240 6.46. Mapa de calor con Clústering jerárquico . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 241
6.47. Proyección de los datos en los dos primeros componentes principales. . . . . . . . . . . . . . . . . . . . . . 241
6.48. Diagrama de la arquitectura de la red neurona. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 242
6.49. Curvas de precisión y pérdida durante el entrenamiento. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 242
6.50. Matriz de confusión de las predicciones. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 242
6.51. Distribución de worst concave points . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 243
6.52. Gráfico de cresta para comparar distribuciones. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 243
6.53. Visualización 3D de los tres primeros componentes principales. . . . . . . . . . . . . . . . . . . . . . . . . . . . 244
6.54. Distancia euclídea. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 245
6.55. Distancia Cityblock. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 245
6.56. Similitud del Coseno . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 245
6.57. Curvas ROC comparativas para los modelos de clasificación. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 245
6.58. Proyección PCA/t-SNE mostrando clusters y errores residuales. . . . . . . . . . . . . . . . . . . . . . . . . . . 248
6.59. Dendrograma jerárquico de las observaciones de viajes. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 248
6.60. Gráfico de Volcán. Serum_creatinine es un factor de riesgo, mientras que ejection_fraction
es un factor protector. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 249
6.61. Grafo de red de las correlaciones. Los colores representan clústeres de variables relacionadas. . 250 6.62. Los eventos de mortalidad (naranja) se concentran en la zona de baja fracción de eyección,
alta creatinina y mayor edad (puntos grandes). . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 250
6.63. Mapa de calor comparando el rendimiento de tres modelos. El Random Forest destaca con los valores más altos (colores claros) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 251
Lista de tablas
I. MÉTRICAS DE EXPECTATIVA DE VIDA POR CONTINENTE. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
II. FRECUENCIAS DEL EJEMPLO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 70
III. FRECUENCIA DE PALABRAS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71 IV. MEDIDAS DESCRIPTIVAS PARA EL EJEMPLO DE LA SIDERÚRGICA. . . . . . . . . . . . . . . . . . . . . 90 V. INGRESOS DE UNA POBLACIÓN FICTICIA Y PROPORCIONES ACUMULADAS. . . . . . . . . . . . . 91
VI. COEFICIENTES DE GINI CALCULADOS . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 94
VII. CALIFICACIONES POR HORAS DE ESTUDIO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 96
VIII. PUESTO EN COMPETENCIA SEGÚN RENDIMIENTO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 97
IX. SATISFACCIÓN LABORAL Y PRODUCTIVIDAD EN UN GRUPO DE EMPLEADOS . . . . . . . . . . . 99
X. DATOS DEL CONJUNTO DE DATOS ZOO . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 109
XI. GUÍA PARA LA SELECCIÓN DE VISUALIZACIONES DE DATOS. . . . . . . . . . . . . . . . . . . . . . . . . . 115
XII. Mediciones de tensión y corriente . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 129 XIII. DATOS DE EDAD Y NIVEL DE INGRESOS . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134
XIV. DATOS EXPERIMENTALES DE RESISTENCIA A LA TRACCIÓN EN
TRES ALEACIONES METÁLICAS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 139
XV. RESUMEN ESTADÍSTICO DE LA RESISTENCIA POR GRUPO DE ALEACIÓN. . . . . . . . . . . . . . 139
XVI. Tabla ANOVA para la comparación de tres aleaciones metálicas . . . . . . . . . . . . . . . . . . . . . . . . . . . 139
XVII. PRIMERAS CINCO OBSERVACIONES DEL CONJUNTO DE DATOS.
NOTA: EN LA COLUMNA LECTURA, 1 INDICA QUE EL ESTUDIANTE LEE Y 0 QUE NO. . . . . . . 148
XVIII. RESULTADOS DEL MODELO DE REGRESIÓN LINEAL LÚLTIPLE. . . . . . . . . . . . . . . . . . . . . . . . 151
XIX. TEMPERATURA MEDIA MENSUAL: RANGOS. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 166
XX. VENTAS MENSUALES ALEATORIAS PARA EL AÑO 2023. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 170
XXI. VENTAS MENSUALES ALEATORIAS PARA EL AÑO 2024. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 171
XXII. TEMPERATURA Y CONSUMO ENERGÉTICO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 173
XXIII. CONSUMO ENERGÉTICO DIARIO . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 176
XXIV. EJEMPLO DE CÁLCULO DE MÉTRICAS DE ERROR. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 194
XXV. MATRIZ DE CONFUSIÓN DE DOS CLASES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 205
XXVI. MATRIZ DE CONFUSIÓN DEL MODELO. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 208
XXVII. FRECUENCIAS POR INTERVALO . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 215
XXVIII. CONTINGENCIA ENTRE GÉNERO Y PREFERENCIA DE COMPRA. . . . . . . . . . . . . . . . . . . . . . 223
XXIX. RESUMEN DEL DATASET IRIS (PRIMERAS OBSERVACIONES). . . . . . . . . . . . . . . . . . . . . . . . . 228
XXX. CORRELACIONES ENTRE VARIABLES Y LOS OBJETIVOS DE DURACIÓN
Y RENTABILIDAD. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 245
XXXI. COMPARACIÓN DE MODELOS DE CLASIFICACIÓN PARA PREDECIR
LA RENTABILIDAD. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 246
XXXII. COMPARACIÓN DE MODELOS DE REGRESIÓN PARA PREDECIR LA
DURACIÓN DEL VIAJE . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 246
Prefacio Para el Grupo de Investigación en Gestión de Sistemas Eléctricos, Electrónicos y Automáticos de la Facultad de Ingenierías de la Universidad Tecnológica de Pereira, es un gusto presentar a sus estudiantes y a la comunidad académica en general este documento, resultado de la experiencia combinada de los autores, con más de 30 años de labor docente e investigativa en los programas de Ingeniería Eléctrica, Ingeniería Electrónica, Maestría en Ingeniería Eléctrica, y en las áreas de mantenimiento y gestión de activos.
Fundamentos de la representación de datos Capítulo 1
[21] Regresar En la era moderna de la información, el tratamiento de datos se ha convertido en un componente primitivo para la toma de decisiones en prácticamente todos los campos del conocimiento humano: desde la ciencia y la tecnología, hasta los negocios, la política y la inteligencia artificial. Sin embargo, la verdadera comprensión de los datos no radica únicamente en su recolección y procesamiento; va mucho más allá. Implica la capacidad de comunicar de manera efectiva la información oculta que reside en los datos y en los resultados de su análisis. Es aquí donde la preparación y la visualización de datos se posicionan. La visualización de datos es realmente importante en una amplia variedad de contextos. En presentaciones ejecutivas, por ejemplo, los gráficos permiten sintetizar grandes volúmenes de información en formatos accesibles y comprensibles, facilitando la comunicación de ideas, como se observa en la figura 1.1, esta imagen muestra a la izquierda los datos sin procesar (ventas de 2024 y su estado) y, a la derecha, la visualización de esos datos convertidos en un gráfico de barras.
DATOS SIN PROCESAR
Ventas 2024:
Q1: 1234567 Q2: 2345678 Q3: 4567859 Q4: 3456780 Estado De Ventas:
completado, en proceso, pendiente, error
VISUALIZACI´ON DE DATOS
Q1 Q2 Q3 Q4 + Fig. 1.1. Representación visual de datos
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [22] Regresar En el ámbito científico, los gráficos son herramientas indispensables para representar hallazgos en documentos técnicos y artículos académicos. En el análisis de macrodatos (big data), donde la cantidad de información puede ser abrumadora, las visualizaciones permiten identificar patrones, tendencias y anomalías que, de otro modo, podrían pasar desapercibidas.
Lo anterior se ilustra en la figura 1.2, donde se presentan diversas formas de representación visual adaptadas a diferentes tipos de análisis. Por ejemplo, las estructuras moleculares pueden representarse mediante diagramas detallados, mientras que los aspectos de análisis suelen visualizarse como series de tiempo para capturar patrones temporales. En el contexto de macrodatos (big data), los mapas de calor son particularmente útiles para representar la actividad de los usuarios, permitiendo identificar tendencias y comportamientos globales.
Asimismo, el análisis de redes sociales facilita la exploración de conexiones entre individuos o nodos, revelando patrones compartidos y relaciones dentro de una comunidad. En el campo de la inteligencia artificial, la visualización desempeña un papel clave al interpretar resultados y evaluar modelos. Un ejemplo común es el uso de matrices de confusión, que permiten analizar métricas como falsos positivos, falsos negativos y la precisión general del modelo. Además, en los procesos de entrenamiento de modelos de aprendizaje automático, las curvas de aprendizaje constituyen herramientas valiosas para tomar decisiones informadas, ya que muestran cómo evoluciona el rendimiento del modelo a medida que se ajusta a los datos.
Investigación Estructura molecular Espectro de análisis Big Data Mapa de calor - Actividad usuario Análisis de red social Inteligencia artificial Matriz de confusión
85%
82%
Curvas de entrenamiento Fig. 1.2. Propósitos de la representación visual de datos
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [23] Regresar Un gráfico bien diseñado tiene el poder de comunicar ideas complejas de forma rápida y eficaz. Permite a los usuarios identificar relaciones entre variables, detectar tendencias temporales o espaciales y comparar múltiples conjuntos de datos sin necesidad de profundizar en detalles técnicos. Sin embargo, no todas las visualizaciones de datos son igualmente efectivas. Un gráfico mal diseñado puede ser confuso, engañoso e incluso contraproducente, distorsionando la información en lugar de clarificarla. Por ello, es necesario conocer los fundamentos de la visualización de datos para crear figuras claras, precisas y convincentes. Este libro asume que el lector ya tiene un conocimiento básico de estadística y está familiarizado con conceptos como distribuciones, correlaciones y análisis exploratorio de datos. Es importante aclarar que la intención de esta obra no es profundizar en temas teóricos de estadística. Los conceptos fundamentales solo se presentan de forma aislada y concisa con el fin de aclarar y aplicar su relevancia en el diseño y la interpretación de gráficos específicos. El enfoque principal es analizar cómo elegir el tipo de gráfico adecuado según el tipo de análisis que se desea realizar. Se exploran las mejores prácticas para diseñar visualizaciones efectivas, así como los errores comunes que se deben evitar. Además, se proporcionan ejemplos prácticos que ilustran cómo aplicar estos principios en diferentes contextos, desde la comunicación estratégica hasta el análisis técnico. Cuando se pretende crear un gráfico, hay un conjunto de principios a tener en cuenta para su construcción. Estos son:
1. Precisión: los datos representados en la visualización deben ser veraces. Es funda-
mental verificar la calidad de los datos y realizar un adecuado proceso de limpieza y análisis de los mismos, antes de comenzar a trabajar en la visualización.
2. Claridad: el objetivo principal de una visualización de datos es comunicar un men-
saje conciso. El diseño del gráfico debe ser simple y directo, evitando elementos superfluos que puedan distraer al usuario.
3. Eficacia: el tipo de gráfico elegido debe ser el adecuado para el tipo de datos que
se está representando, además debe estar bien acotado, ser intuitivo y destacar la información clave.
4. Estética: la estética es crucial en el proceso de presentación de datos, ya que una
visualización atractiva será más agradable de ver y, sobre todo, más fácil de comprender y retener, facilitando el objetivo de comunicación. En este sentido, es importante considerar las cantidades y proporciones de los elementos en el gráfico, así como los contrastes entre los colores utilizados.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [24] Regresar
1.1.2.
Tipos de gráficos y variables A partir de los resultados de la limpieza y el análisis de los datos, se obtiene información relevante que se desea comunicar a través de gráficos. A partir de ello, se define el mensaje a comunicar en cada gráfico; este debe estar claramente delimitado y diferenciado de los demás. Cada mensaje está asociado a un tipo de conjunto de datos, para los cuales existe un tipo de gráfico que se ajusta mejor, como se muestra en la figura 1.3.
1.1.
¿CÓMO CREAR UN GRÁFICO?
A partir de los cuatro principios anteriores, se puede definir un procedimiento general para la construcción de un gráfico. En términos generales, este procedimiento consiste en preparar los datos y desarrollar el análisis; distinguir los tipos de variables resultantes, el objetivo del gráfico y los tipos de gráficos aplicables; y, finalmente, construir el gráfico de forma que sea estéticamente agradable e intuitivo.
1.1.1.
Preparación de los datos El proceso inicia con la preparación y verificación de los datos. Esto consisteen la aplicación de técnicas de limpieza de datos como la detección y tratamiento de valores atípicos; la eliminación o imputación de valores faltantes; la detección y eliminación de datos duplicados; la normalización de datos; el balanceo de clases; la detección y eliminación de caracteres no deseados; la estandarización de formatos; la aplicación de pruebas estadísticas para la validación de datos; la codificación de variables categóricas; la categorización; la reducción dimensional de los datos, entre otros.
Una vez se dispone de un conjunto de datos estandarizado y limpio, se puede ejecutar el análisis aplicando técnicas de estadística descriptiva o inferencial, con el fin de obtener información útil y relevante alineada con los objetivos del estudio. Estos análisis se llevan a cabo con la finalidad de conocer métricas, distribuciones y proporciones, así como validar hipótesis planteadas sobre la población.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [25] Regresar Desviación Correlación Clasificación Distribución Cambios en el tiempo Magnitud Parte de un todo Espacial Barra divergente Tabla de columna Gráfico de dispersión Línea de tiempo Gráfico de barras Diagrama de tira de puntos Histograma Gráfico de caja Línea Mapa de calor Columnas Gráfico de Marimekko Gráfico de tarta Diagrama de Venn Mapa coroplético Mapa de flujo Fig. 1.3. Selección entre los tipos de datos y los tipos de gráficos La figura también resume los tipos de gráficos más comunes y su uso más apropiado según el tipo de datos y el mensaje que se desea transmitir. Los gráficos de barras son ideales para comparar valores entre diferentes categorías, ya que permiten visualizar de manera clara las diferencias cuantitativas entre grupos. Por otro lado, los gráficos de líneas son excelentes para mostrar tendencias y cambios a lo largo del tiempo, lo que los hace particularmente útiles para representar la evolución de una o más variables en un período determinado. Para representar relaciones entre datos continuos, los gráficos de dispersión muestran la relación entre dos variables, siendo útiles para identificar correlaciones o patrones en los datos.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [26] Regresar Los histogramas representan la distribución de una variable continua, mostrando la frecuencia de los datos dentro de intervalos específicos; mientras que los gráficos de caja (boxplot) son efectivos para visualizar la distribución de los datos, destacando la mediana, los cuartiles, los posibles valores atípicos y permitiendo comparaciones entre variables. Los mapas de calor son herramientas efectivas para representar datos en una matriz, donde los colores indican la intensidad o magnitud de los valores. Los gráficos circulares (de tarta) son adecuados para mostrar proporciones o porcentajes de un todo, resaltando la contribución de cada categoría al total. Los diagramas de Venn son útiles para mostrar relaciones entre conjuntos, especialmente en la intersección de diferentes grupos. En el ámbito geográfico, los mapas coropléticos representan datos mediante el coloreado de regiones según la intensidad de una variable. Finalmente, los mapas de flujo muestran el movimiento o la transferencia de datos entre diferentes ubicaciones o categorías. Los diagramas de Venn son útiles para mostrar relaciones entre conjuntos, especialmente en la intersección de diferentes grupos. En el ámbito geográfico, los mapas coropléticos representan datos geográficos, coloreando áreas según la intensidad de una variable. Finalmente, los mapas de flujo muestran el movimiento o la transferencia de datos entre diferentes ubicaciones o categorías.
El uso adecuado del tipo de gráfico es clave para lograr visualizaciones efectivas e intuitivas. Cada tipo de gráfico —ya sea de barras, líneas, dispersión, área o circular— ofrece distintas formas de representar datos, según la naturaleza y la relación entre las variables. Por ejemplo, los gráficos de barras son ideales para comparar valores entre diferentes categorías, mientras que los gráficos de líneas resultan excelentes para mostrar tendencias y cambios a lo largo del tiempo. Al seleccionar el tipo de gráfico más apropiado, se garantiza que la información sea presentada de manera clara y accesible, facilitando así su comprensión y análisis por parte del público objetivo.
1.1.3.
Uso del color y énfasis Finalmente, con los datos, el objetivo y el tipo de gráfico definidos, se procede a la etapa de construcción visual utilizando alguna herramienta digital. Las plataformas modernas, desde librerías de Python como Matplotlib y Seaborn hasta software especializado como Tableau o Power BI, ofrecen un control detallado sobre cada aspecto del gráfico. Permiten no solo definir el tipo de visualización, sino también personalizar colores, formas, tamaños, etiquetas y escalas. Sin embargo, este poder conlleva una gran responsabilidad: la
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [27] Regresar Fig. 1.4. Escalas de color y contrastes en la representación gráfica de datos El color, en particular, es mucho más que un elemento decorativo; es una estrategia de comunicación increíblemente poderosa. A nivel perceptivo, el cerebro humano procesa el color de forma preatencional, lo que significa que un color bien aplicado puede guiar la mirada del espectador y resaltar un punto de interés incluso antes de que este lea una sola etiqueta. Cada paleta de colores tiene la capacidad de transmitir significados y emociones, y su elección debe ser deliberada. Un diseñador de visualizaciones debe comprender las distintas funciones del color: puede representar magnitudes (de bajo a alto), mostrar intensidades, diferenciar categorías o poner énfasis en un hallazgo clave. La elección adecuada de paletas de colores —a menudo disponibles en librerías especializadas— es esencial para garantizar la coherencia, la accesibilidad (considerando el daltonismo) y la legibilidad, permitiendo que la información sea percibida de manera intuitiva y sin ambigüedades.
Representación del color por datos Categórica Secuencial Bajo Alto Divergencia Atención Alerta herramienta es solo el pincel, mientras que el analista es el artista que debe saber cómo y por qué aplicar cada trazo.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [28] Regresar Para aplicar correctamente el color en la construcción de gráficos, existen varias buenas prácticas que pueden transformar una visualización simple en una herramienta analítica eficaz. Una técnica fundamental es el uso de escalas de color secuenciales (gradientes de Ejemplo 1.1.1:
Para el desarrollo de un primer ejemplo se toma una muestra directamente del repositorio de datos del Banco Mundial [1]. En este se hace un seguimiento de la expectativa de vida para el periodo de 2000-2015, a un grupo de 193 países, así mismo, se registra el continente al que cada país pertenece y el estado de desarrollo económico del mismo. Después de realizar el proceso de limpieza de los datos, se obtiene un conjunto con 2472 registros.
El objetivo de este ejemplo es comparar el comportamiento de la expectativa de vida entre continentes, diferenciando entre países desarrollados y países en desarrollo. La fuente de los datos es un sitio oficial con alto reconocimiento, lo cual garantiza la veracidad de los datos. Con los datos obtenidos, el proceso de limpieza ha sido llevado a cabo con herramientas de software especializadas, de esta forma se válida el primer principio.
Inicialmente, en la tabla I, se presenta un análisis con métricas descriptivas. Los resultados permiten observar diferencias entre continentes y entre el estado de desarrollo de los países.
un solo color) o divergentes (dos colores que se encuentran en un punto medio neutro) para representar la magnitud o la desviación de una variable numérica. Asimismo, deben emplearse colores categóricos distintos y fácilmente distinguibles para diferenciar clases o grupos sin orden inherente. Quizás la técnica más impactante es el uso de contrastes: aplicar un color neutro para la mayor parte de los datos y un color de acento vibrante para resaltar el elemento clave de la narrativa. Estas relaciones, como se presenta en la figura 1.4, demuestran cómo el uso intencionado del color puede transformar una simple representación de datos en una narrativa visual clara y convincente.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [29] Regresar
TABLA I.
MÉTRICAS DE EXPECTATIVA DE VIDA POR CONTINENTE
CONTINENTE
ESTADO
EXPECTATIVA DE VIDA
min max media desviación típica África En desarrollo
39.0
78.0
58.7984
8.1859
Asia Desarrollado
78.1
87.0
81.2291
2.0605
En desarrollo
54.8
84.0
70.4538
5.2232
Europe Desarrollado
69.9
89.0
78.9119
4.1431
En desarrollo
64.6
89.0
75.1776
5.2644
North America En desarrollo
36.3
87.0
73.5253
5.0174
Oceanía Desarrollado
78.5
89.0
81.5750
2.3276
En desarrollo
58.9
79.0
68.6848
4.2443
South America En desarrollo
65.0
85.0
73.4568
3.7296
A continuación, se explora el proceso iterativo para encontrar la mejor visualización. Punto de Partida: Un Diagrama de Barras Un diagrama de barras es un comienzo lógico. Permite comparar fácilmente las medias de expectativa de vida entre los diferentes grupos. Sin embargo, su principal desventaja es que oculta por completo la distribución y la dispersión de los datos. No se puede ver el rango de valores ni la presencia de outliers.
Fig. 1.5. Comparación de la expectativa de vida media
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [30] Regresar Intento 1: Gráfico Strip Para solucionar el problema anterior, un gráfico strip muestra cada punto de dato individual. Ahora se puede ver la distribución, pero surge un nuevo problema: el solapamiento (overplotting). En áreas densas, los puntos se superponen, haciendo imposible saber cuántos hay.
Fig. 1.6. Gráfico strip con problemas de solapamiento Mejora 1: Gráfico Swarm El gráfico swarm resuelve el solapamiento al distribuir los puntos horizontalmente. Ahora cada punto es visible. Sin embargo, aunque es una mejora, la forma general de la distribución puede ser difícil de interpretar rápidamente y el gráfico puede verse desordenado.
Fig. 1.7. Gráfico swarm que evita el solapamiento Intento 2: Combinando Densidad y Puntos Un diagrama de violín muestra la forma de la distribución de los datos (su densidad). Aquí se combina con un gráfico strip. Aunque es muy informativo, la combinación de ambos resulta visualmente saturada y puede dificultar la claridad.
Fig. 1.8. Diagrama de violín y strip combinados
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [31] Regresar La Solución: Solo el Violín Al eliminar los puntos del strip, el diagrama de violín por sí solo emerge como la mejor solución. Muestra la forma de la distribución, el rango de los datos y la ubicación de la mediana. Permite una comparación clara y elegante entre los grupos y la fácil detección de outliers.
Fig. 1.9. Gráfico de violín limpio y efectivo Resultado Final (Facetado) Para la máxima claridad, el gráfico de violín final se separa en dos (faceting). Este primer panel muestra los continentes que tienen tanto países desarrollados como en desarrollo, permitiendo una comparación directa y limpia entre ambos estados dentro de cada continente.
Fig. 1.10. Violines para continentes con países desarrollados Resultado Final (Continuación) Este segundo gráfico se centra exclusivamente en los continentes con países ”En desarrollo”. Al separarlos, se facilita la comparación entre África, Norteamérica y Suramérica sin la distracción visual de las otras categorías. La narrativa visual está completa y el mensaje es inequívoco. Este diseño final cumple con todos los principios de una visualización eficaz. Fig. 1.11. Análisis detallado para países en desarrollo
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [32] Regresar A partir de este procedimiento se logra pasar de representaciones simples (barras, strip, swarm) hacia visualizaciones más informativas y claras (diagramas de violín), asegurando que el gráfico final cumpla con el objetivo planteado.
1.2.
LA VISUALIZACIÓN Y EL USO DE HERRAMIENTAS
Si bien en la actualidad existen herramientas especializadas como Tableau, Power BI o librerías de Python como Matplotlib y Seaborn, es importante destacar que la habilidad en la construcción de gráficos va más allá de dominar una determinada plataforma. La efectividad de una visualización radica en comprender profundamente el mensaje a transmitir, el contexto y la audiencia.
Para ilustrar este punto, podemos pensar en las competencias de un visualizador de datos como una pirámide, donde las herramientas son solo la punta del iceberg. Como muestra la figura 1.12, la base de una visualización exitosa no es la herramienta, sino los Fundamentos: entender el propósito (el qué y el por qué), el contexto de los datos y las necesidades de la audiencia. Sobre esta base se construyen los Principios de Diseño: saber elegir el tipo de gráfico adecuado, usar el color de forma efectiva y componer los elementos para lograr claridad. Finalmente, en la cima, se encuentran las Herramientas, que son simplemente el medio para ejecutar la visión definida en las capas inferiores. Fig. 1.12. La Pirámide de la Habilidad en Visualización La Pir´amide de la Habilidad en Visualizaci´on Fundamentos (El QU´E y El POR QU´E) Entender el prop´osito, el contexto de los datos y las necesidades de la audiencia.
Principios de Dise˜no (El C´OMO) Elegir el gr´afico adecuado, usar el color de forma efectiva y componer los elementos para lograr claridad.
Herramientas (El CON QU´E) El medio para ejecutar la visualzaci´on. (Python, Tableau, Power BI)
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [33] Regresar La herramienta no hace al gráfico.
Para demostrar que la elección de la herramienta es secundaria frente a los principios de diseño, consideremos un simple conjunto de datos sobre las ventas trimestrales de cuatro productos. Con la misma herramienta —ya sea Excel, Python o Tableau— se pueden crear dos visualizaciones con niveles de eficacia radicalmente opuestos.
Producto A
45.0%
Producto B
25.0%
Producto C
20.0%
Producto D
10.0%
Datos de Ventas (A) Un gráfico poco efectivo
0
10
20
30
40
Ventas (en miles de USD) Producto D Producto C Producto B Producto A
10
20
25
45
Ventas por Categoría de Producto, Q3 2025 (B) Un gráfico efectivo Fig. 1.13. Dos visualizaciones creadas con los mismos datos y la misma herramienta La figura 1.13 muestra esta dicotomía.
El gráfico (A) es un ejemplo clásico de mal diseño: el uso de un gráfico circular dificulta la comparación precisa de los segmentos, el efecto tridimensional distorsiona las proporciones y la paleta de colores es arbitraria. El título es vago y no aporta contexto.
El gráfico (B), en cambio, es altamente efectivo. Utiliza un gráfico de barras horizontales, ideal para comparar categorías. Las barras están ordenadas de mayor a menor, lo que facilita la lectura y la identificación de los productos más vendidos. El color se usa de forma estratégica para resaltar la categoría más importante, mientras que las demás se mantienen en un tono neutro. El título es claro, informativo y proporciona el contexto necesario ("Ventas por Categoría de Producto, Q3 2025").
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [34] Regresar Este ejemplo práctico demuestra que la habilidad en la construcción de gráficos no reside en el dominio de una plataforma, sino en la capacidad de aplicar los principios de claridad, eficacia y estética. La visualización de datos se convierte así en una herramienta para la comunicación y la toma de decisiones informadas solo cuando el diseñador entiende profundamente el contexto, el mensaje y al público al que se dirige.
Fundamentos de la recolección y calidad de los datos Capítulo 2
[39] Regresar Las fuentes de recolección de datos son los medios a través de los cuales se obtiene información y datos para el análisis, estudios o investigaciones. Estas fuentes se pueden clasificar en primarias y secundarias. Las fuentes primarias provienen directamente de la recolección de datos de primera mano, como encuestas, entrevistas, interacciones con plataformas y observaciones o experimentos diseñados específicamente para un estudio en particular. Por otro lado, las fuentes secundarias consisten en datos ya existentes, previamente recolectados por otras personas u organizaciones, como informes, bases de datos, registros históricos o publicaciones académicas. La elección de las fuentes de datos depende de los objetivos de la investigación, la disponibilidad de la información y los recursos existentes.
Los datos en su estado bruto, cuando únicamente se ha concluido el proceso de la recolección, contienen errores, valores faltantes, duplicados y ruido que pueden sesgar los resultados y disminuir la precisión de los algoritmos de análisis de datos en los que sean usados. Al limpiar y preparar los datos, se eliminan las inconsistencias y se transforma la información en un formato adecuado para el análisis. Esto incluye diferentes técnicas como la normalización, la estandarización y la codificación de variables, entre otras. Una buena preparación de los datos mejora la eficiencia del entrenamiento de los modelos y facilita la extracción de patrones significativos, lo que a su vez conduce a resultados y gráficos más confiables. [Una forma de visualizar lo anterior se puede observar en la figura 2.1.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [40] Regresar Fig. 2.1. Sistema de recolección y procesamiento de datos
SISTEMA DE RECOLECCIÓN Y PROCESAMIENTO DE DATOS
MÓDULO 1: FUENTES DE RECOLECCIÓN DE DATOS
FUENTES PRIMARIAS
ENCUESTAS
ENTREVISTAS
DATOS CUALITATIVOS
OBSERVACIÓN
DATOS MEDIBLES
FUENTES SECUNDARIAS
BBDD
INFORMES
DATOS PROCESADOS
PUBLICACIONES
JOURNAL
MÓDULO 2: PREPARACIÓN DE DATOS
DATOS BRUTOS
PROCESAMIENTO DE DATOS
NORMALIZACIÓN
x' = (x - min) / (max - min)
ESTANDARIZACIÓN
z = (x - μ) / σ
IMPUTACIÓN
Valores faltantes
CODIFICACIÓN
Categorías → Números A
1
B
2
DATOS LIMPIOS
Mejor eficiencia en entrenamiento Resultados más confiables
REV.01 - DIAGRAMA DE FLUJO DE PROCESAMIENTO DE DATOS
2.1.
TIPOS DE VARIABLES
En los procesos de recolección de datos, se recogen diferentes variables, como edad, género, densidad, peso, volumen, entre otras. Estas variables se pueden clasificar en dos tipos: cualitativas y cuantitativas.
2.1.1.
Variables cualitativas Las variables cualitativas, también conocidas como variables categóricas, representan atributos o características que no tienen un valor numérico, sino que describen cualidades. Estas variables pueden clasificarse en dos tipos principales: nominales, cuando no existe un orden específico entre las categorías (por ejemplo, colores, género o nacionalidad), y ordinales, cuando las categorías siguen un orden lógico o jerárquico (como niveles de satisfacción o grados académicos).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [41] Regresar Este tipo de variables se analiza considerando el rango de valores posibles y la frecuencia con la que ocurren los datos en cada categoría. Un ejemplo de una variable cualitativa es el estado civil de una persona. La figura 2.2 ilustra cómo un gráfico de barras puede representar la frecuencia de cada categoría para esta variable. Fig. 2.2. Ejemplo de gráfico de barras para una variable cualitativa (Estado Civil), mostrando la frecuencia de cada categoría
2.1.2.
Variables cuantitativas Las variables cuantitativas son aquellas que se pueden expresar en forma numérica y tienen un valor real y medible. Pueden ser discretas (valores que se pueden contar) o continuas (cualquier valor dentro de un rango). Con este tipo de variables, se pueden evaluar varias características de su distribución:
Centro: es referente al punto medio o valor promedio de la distribución de la variable cuantitativa. Se puede calcular utilizando medidas de tendencia central como la media, la mediana o la moda.
Extensión: representa la amplitud o rango de valores que abarca la variable cuantitativa. Se calcula restando el valor mínimo del valor máximo, y proporciona información sobre la dispersión de los datos y sobre cuánto varían los valores alrededor del centro. Casado Soltero Divorciado Viudo Estado Civil
0
25
50
75
100
125
150
175
200
Frecuencia (Número de Personas)
180
120
45
25
Distribución de una Variable Cualitativa (Estado Civil)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [42] Regresar Modalidad: se refiere al número de picos distintos en la distribución de la variable cuantitativa. Una distribución puede ser unimodal (un solo pico), bimodal (dos picos) o multimodal (más de dos picos). La modalidad revela la forma en que los datos están agrupados alrededor del centro.
Forma: describe la estructura general de la distribución de la variable cuantitativa. Esto incluye aspectos como la simetría, la asimetría y la curtosis. La forma de la distribución proporciona información sobre cómo se distribuyen los datos y puede ser de utilidad para identificar patrones o características importantes. Valores atípicos (outliers): son valores extremos que se encuentran alejados del resto de los datos en la distribución. Los valores atípicos pueden distorsionar las conclusiones derivadas del análisis de los datos, por lo que es importante identificarlos para comprender mejor la distribución y tomar decisiones adecuadas. La Figura 2.3 muestra cómo un histograma combinado con un diagrama de caja permiten visualizar todas estas características de forma integral y sinóptica.
0
10
20
30
40
50
Frecuencia Forma y Modalidad (Unimodal, asimetría leve) Centro Análisis de una Variable Cuantitativa (Altura en cm) Media: 170.1
140
150
160
170
180
190
200
210
Altura (cm) Valores Atípicos (outliers) Extensión (Rango) Fig. 2.3. Análisis de una variable cuantitativa. El histograma muestra la forma y el centro, mientras que el diagrama de caja resalta la extensión y los valores atípicos
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [43] Regresar
2.1.3.
Consideraciones a las tipologías de variables La comprensión de la tipología de las variables, representada en la figura 2.4, es fundamental al momento de realizar un análisis de datos, ya que esta clasificación determina las técnicas estadísticas y los métodos de visualización más apropiados. Por ejemplo, al trabajar con variables cualitativas, es común utilizar gráficos de barras, diagramas de sectores o gráficos de dispersión para representar la distribución de datos. En cambio, al analizar variables cuantitativas, se pueden emplear histogramas, diagramas de caja o gráficos de líneas para explorar patrones y tendencias en los datos. La selección adecuada del tipo de gráfico es fundamental para una interpretación precisa de los datos y la identificación de patrones o anomalías. Por ejemplo, representar una variable continua con un diagrama de sectores puede llevar a una interpretación errónea de la distribución de los datos, mientras que utilizar un histograma puede proporcionar una visualización más precisa de la distribución de frecuencias. Por lo tanto, conocer la naturaleza de las variables y seleccionar el tipo de gráfico adecuado son pasos esenciales para obtener información significativa a partir de los datos y tomar decisiones informadas en diversos ámbitos, como la investigación científica, el análisis de mercado o la toma de decisiones empresariales.
Naturaleza de los Datos Categóricos Numéricos Nominales Ordinales Discretos Continuos Fig. 2.4. Tipos de datos Además de la tipología, la escala de los datos es otro aspecto. Los datos pueden estar en diferentes escalas, como nominal, ordinal, de intervalo o de razón. Las escalas nominal y
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [44] Regresar Es importante considerar la dimensionalidad de los datos. En muchos casos, los datos tienen múltiples características o variables, lo que puede hacer que el análisis sea complejo, tendiendo a extenderse, siendo propenso a la maldición de la dimensionalidad. Técnicas como el Análisis de Componentes Principales (PCA) y el Análisis de Correspondencias Múltiples (MCA) son útiles para reducir la dimensionalidad y facilitar el agrupamiento al identificar las dimensiones más relevantes.
Aunque el foco de este trabajo no son los métodos de análisis, sino los gráficos de representación, las secciones y los capítulos subsiguientes se desarrollan mostrando tipos de gráficos según tipos de análisis.
Ejemplo 2.1.1:
Se presentan ejemplos de datos categóricos y numéricos para proporcionar información que permita diferenciar la naturaleza de los datos. Datos categóricos
1. Datos nominales:
Enunciado: la nacionalidad de los estudiantes de una universidad es un dato categórico nominal.
Descripción: los datos nominales representan categorías sin un orden intrínseco. Por ejemplo, nacionalidades como mexicana, argentina y colombiana son categorías sin un orden específico.
2. Datos ordinales
Enunciado: el nivel educativo alcanzado, como primaria, secundaria y universidad, es un dato categórico ordinal.
Descripción: los datos ordinales representan categorías con un orden inherente, aunque las diferencias entre las categorías no son necesariamente uniformes. Por ejemplo, los niveles educativos tienen un orden (primaria >secundaria >universidad) pero no hay una medida uniforme de la diferencia entre ellos.
ordinal se utilizan para datos categóricos, mientras que las escalas de intervalo y de razón se aplican a datos numéricos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [45] Regresar Datos numéricos
1. Datos de intervalo:
Enunciado: la temperatura registrada en grados Celsius es un dato numérico de intervalo.
Descripción: los datos de intervalo son numéricos y tienen un orden con diferencias uniformes entre valores, pero no tienen un punto cero verdadero. Por ejemplo, 20°C y 30°C tienen una diferencia de 10°C, pero no existe un cero absoluto en esta escala.
2. Datos de razón:
Enunciado: el ingreso mensual de una persona, medido en dólares, es un dato numérico de razón.
Descripción: los datos de razón son numéricos, tienen un orden, diferencias uniformes entre valores y un punto cero verdadero. Por ejemplo, un ingreso de $2000 es el doble de $1000 y $0 indica ausencia de ingreso.
3. Datos discretos:
Enunciado: el número de hijos en una familia es un dato numérico discreto. Descripción: los datos discretos son numéricos y pueden tomar valores contables. Por ejemplo, una familia puede tener 0, 1, 2, 3, ... hijos.
4. Datos continuos:
Enunciado: el peso de una persona, medido en kilogramos, es un dato numérico continuo.
Descripción: los datos continuos son numéricos y pueden tomar cualquier valor dentro de un rango. Por ejemplo, una persona puede pesar 70.5 kg, 71.2 kg, etc.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [46] Regresar
2.2.1.
Muestreo aleatorio simple Descripción: en este método, cada elemento del conjunto de datos tiene la misma probabilidad de ser seleccionado. Se puede realizar con o sin reemplazo. Ventajas: es fácil de implementar y asegura que cada elemento tenga la misma oportunidad de ser incluido en la muestra.
Desventajas: puede no ser representativo si hay variabilidad significativa en el conjunto de datos.
Ejemplo 2.2.1:
Se tiene una población de 15 estudiantes y se desea seleccionar una muestra de 4 estudiantes utilizando el método de muestreo aleatorio simple. En este método, cada estudiante de la población tiene la misma probabilidad de ser seleccionado, lo que asegura que la muestra sea representativa y no sesgada. La figura 2.5 ilustra la selección de los 4 estudiantes del total de 15. Cada círculo representa a un estudiante y los círculos coloreados en azul indican a los estudiantes que fueron seleccionados aleatoriamente para formar la muestra. Población de Estudiantes Fig. 2.5. Muestreo aleatorio simple
2.2.
MÉTODOS DE MUESTREO
El muestreo es una técnica fundamental en el análisis de datos, que permite seleccionar un subconjunto representativo de un conjunto de datos más grande. Esto es especialmente importante cuando se trabaja con grandes volúmenes de datos, donde analizar cada dato individualmente puede ser impráctico. Existen varios métodos de muestreo que se utilizan, cada uno con sus propias ventajas y desventajas.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [47] Regresar
2.2.2.
Muestreo estratificado Descripción: el conjunto de datos se divide en subgrupos homogéneos (estratos o subpoblaciones) y se toma una muestra aleatoria de cada estrato. Ventajas: asegura que todas las subpoblaciones estén representadas en la muestra, lo que puede aumentar la precisión del análisis.
Desventajas: requiere conocimiento previo sobre la estructura de la población. Ejemplo 2.2.2:
Se tiene una población de 20 estudiantes divididos en 4 grados (5 estudiantes por grado). Se quiere seleccionar una muestra proporcional de cada grado, seleccionando 2 estudiantes de cada uno.
En la figura 2.6, se ilustra este método aplicado a una población de estudiantes dividida en cuatro grados diferentes (Grado 1 a Grado 4). Cada rectángulo en la figura representa uno de los grados. Dentro de cada rectángulo se muestran círculos que representan a los estudiantes y los círculos coloreados en azul indican los estudiantes seleccionados aleatoriamente para formar la muestra estratificada.
Grado 1 Grado 2 Grado 3 Grado 4 Fig. 2.6. Muestreo estratificado Este enfoque asegura que cada estrato esté adecuadamente representado en la muestra final, lo que es importante cuando diferentes estratos pueden tener característicasi
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [48] Regresar significativamente desiguales que podrían afectar los resultados del estudio, pero que se desean tener presentes.
2.2.3.
Muestreo Sistemático Descripción: se selecciona cada k-ésimo elemento del conjunto de datos, donde k es un número fijo.
Ventajas: es fácil de realizar y puede ser más práctico que el muestreo aleatorio simple.
Desventajas: puede introducir sesgos si existe una periodicidad en los datos. Ejemplo 2.2.3:
De una lista de 16 estudiantes, se requiere seleccionar una muestra de 8, seleccionando cada 2 estudiantes.
En la figura 2.7, se presenta un ejemplo visual de este método aplicado a la población de 16 estudiantes. En la figura, cada círculo representa a un estudiante, y los círculos coloreados en azul muestran los estudiantes seleccionados sistemáticamente a intervalos regulares de dos.
Población de estudiantes Fig. 2.7. Muestreo sistemático
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [49] Regresar Datos Crudos
abc
1,23
Procesamiento
Limpieza de Ruido
Imputaci´on de Faltantes
Tratamiento de Outliers
Normalizaci´on
Codificaci´on de Variables Datos Estructurados
(Listos para Modelar) Fig. 2.8. Diagrama conceptual del flujo de preprocesamiento de datos El preprocesamiento es el conjunto de técnicas aplicadas para limpiar, transformar y estructurar los datos brutos antes de utilizarlos en un modelo analítico. Como se ilustra en
2.3.
PREPROCESAMIENTO
En la era del big data, la cantidad de información generada por redes sociales, sensores y transacciones es masiva. Sin embargo, estos datos crudos rara vez son útiles en su estado original. El éxito de tecnologías como el aprendizaje automático y la inteligencia artificial depende fundamentalmente de la calidad de los datos con los que se alimentan. Es aquí donde el preprocesamiento se convierte en una etapa indispensable. la figura 2.8, este proceso actúa como un filtro que convierte datos caóticos y desordenados en un conjunto de datos limpio y coherente. Sin un preprocesamiento adecuado, los resultados de cualquier algoritmo pueden ser inexactos, sesgados o inútiles. Por lo tanto, aplicar estas técnicas es un paso crucial para garantizar la fiabilidad y precisión de cualquier solución basada en datos. A continuación, se describen algunas de las técnicas de preprocesamiento más comunes.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [50] Regresar
2.3.1.
Formato de los datos y tipo de categorías En el análisis de datos, la calidad de la información es solo el punto de partida. Una comprensión profunda del formato estructural en el que residen los datos y la categoría a la que pertenece cada variable es un pilar fundamental. Esta doble perspectiva es crucial, ya que determina las herramientas que podemos usar, las operaciones matemáticas que son válidas y, en última instancia, la fiabilidad de las conclusiones que podemos extraer. Los datos se presentan en una multitud de formatos, cada uno con una arquitectura propia que define cómo se almacena, accede y relaciona la información. Como se ilustra en la figura 2.9, los tres formatos más comunes presentan filosofías de diseño muy distintas: SQL (Relacional): es el paradigma de los datos estructurados. La información se organiza en tablas con filas y columnas estrictamente definidas por un esquema previo. Este formato garantiza una alta integridad y consistencia, siendo ideal para sistemas transaccionales y de registro donde la fiabilidad es crítica. Su rigidez, sin embargo, puede ser una limitación cuando se trabaja con datos heterogéneos o que cambian rápidamente.
JSON (Semi-estructurado): es el estándar de oro para los datos semi-estructurados, muy común en APIs web y aplicaciones modernas. Su estructura jerárquica de pares clave-valor y la capacidad de anidar objetos y listas le otorgan una gran flexibilidad. Esto permite representar entidades complejas, como el perfil de un usuario con múltiples direcciones, en un único documento.
CSV (Plano): es el formato más simple y universal. Representa datos tabulares en un archivo de texto plano, donde cada línea es una fila y las columnas se separan por un delimitador. Su simplicidad es su mayor fortaleza, ya que es compatible con prácticamente cualquier software de análisis, desde hojas de cálculo hasta lenguajes de programación.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [51] Regresar SQL (Relacional) Tabla:
usuarios ID nombre edad
1
’Ana’
28
2
’Luis’
34
JSON (Semi-estructurado) [ { "ID": 1, "nombre": "Ana", "edad": 28 }, { ... } ] CSV (Plano) ID,nombre,edad 1,Ana,28 2,Luis,34 Fig. 2.9. Comparación visual de la estructura de datos en formatos SQL, JSON y CSV Independientemente del formato de almacenamiento, cada columna o atributo representa una variable que debe ser clasificada según su naturaleza. Esta clasificación determina las operaciones matemáticas y las visualizaciones adecuadas para cada una. Categóricos nominales: representan categorías sin un orden lógico. Ejemplo: género, color, ciudad.
Categóricos ordinales: tienen un orden o jerarquía natural. Ejemplo: nivel de satisfacción (bajo, medio, alto), nivel educativo.
Numéricos discretos: valores enteros, generalmente resultado de conteos. Ejemplo: número de hijos, cantidad de productos.
Numéricos continuos: pueden tomar cualquier valor dentro de un rango. Ejemplo: peso, altura, temperatura.
2.3.2.
Eliminación de registros faltantes e imputación de datos En muchos conjuntos de datos es común encontrar valores faltantes, es decir, registros donde una o varias variables no contienen información. Estos valores pueden surgir por errores en la recolección, problemas de transmisión o falta de respuesta en encuestas. Ignorarlos puede llevar a resultados sesgados y afectar la calidad del análisis, por lo que es fundamental tratarlos adecuadamente en la etapa de preprocesamiento.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [52] Regresar Existen dos estrategias principales:
Eliminación de registros faltantes: consiste en descartar filas o columnas que contengan valores incompletos. Este enfoque puede simplificar el análisis, pero también reduce el tamaño del conjunto de datos, lo cual puede ser un problema si la proporción de valores faltantes es alta.
Imputación de datos: en lugar de eliminar, se sustituyen los valores faltantes con estimaciones basadas en la información disponible. Algunos métodos comunes son reemplazar por la media, mediana o moda, o utilizar técnicas más avanzadas como algoritmos de regresión, K-Nearest Neighbors o modelos predictivos. Este enfoque preserva la cantidad de datos disponibles y mantiene la integridad del análisis, permitiendo que los modelos de aprendizaje automático funcionen de manera más efectiva y precisa.
La elección entre eliminar o imputar depende tanto del volumen de datos faltantes como de la necesidad de mantener un conjunto de datos lo más completo posible. Una gestión adecuada de los valores faltantes asegura que los modelos posteriores sean más confiables y precisos.
2.3.3.
Detección de valores atípicos Los valores atípicos (o outliers) son observaciones que se desvían significativamente del resto de los datos. Pueden indicar errores de medición, pero también fenómenos anómalos de gran interés. Su presencia puede distorsionar estadísticas como la media y afectar negativamente el rendimiento de los modelos de aprendizaje automático. Si bien, herramientas como el diagrama de caja y bigotes son excelentes para identificar valores atípicos específicos, es igualmente importante entender la tendencia de una distribución al analizarla. Para esto, se utiliza la curtosis. La curtosis no mide cuántos outliers hay, sino que describe la forma de las colas de una distribución. En esencia, dice si los valores extremos son más o menos probables en comparación con una distribución normal. Al entender la curtosis de los datos, se puede anticipar la naturaleza y frecuencia de los valores atípicos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [53] Regresar Mesoc´urtica (Normal) Pico puntiagudo Colas pesadas (m´as outliers) Pico aplanado Colas ligeras (menos outliers) x f(x) Mesoc´urtica (Curtosis ≈0) Leptoc´urtica (Curtosis > 0) Platic´urtica (Curtosis < 0) Fig. 2.10. Comparación gráfica de los tres tipos de curtosis Mesocúrtica (Curtosis ≈0): del griego meso (en medio, entre), es la forma de la distribución normal. Sus colas son "normales", sirviendo como punto de referencia. Los outliers ocurren con una frecuencia esperada.
Leptocúrtica (Curtosis >0): del griego lepto (delgado). Estas distribuciones son más puntiagudas en el centro y tienen colas más pesadas. Esto significa que la probabilidad de encontrar valores muy alejados de la media es mayor. Una alta curtosis es una señal de que los valores atípicos son una característica intrínseca de los datos y no necesariamente errores.
Platicúrtica (Curtosis <0): del griego platy (ancho). Son distribuciones más aplanadas y con colas más ligeras que la normal. En este caso, los valores extremos son muy poco probables. La presencia de un outlier en una distribución platicúrtica podría ser un fuerte indicio de un error en los datos.
2.3.4.
Discretización La discretización es una técnica de preprocesamiento que transforma variables continuas en variables categóricas. Este proceso, también conocido como binning, consiste en dividir La curtosis se clasifica en tres tipos, tomando como referencia la distribución normal (la campana de Gauss), como se visualiza en la figura 2.10.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [54] Regresar el rango de una variable continua en un número finito de intervalos o "bins", asignando a cada intervalo una etiqueta categórica.
Como se ilustra en la figura 2.11, una variable continua como la edad, que puede tomar cualquier valor, se segmenta mediante puntos de corte para crear categorías ordinales como rangos de edad. La discretización es útil porque puede simplificar los modelos y
2.3.5.
Codificación La codificación es el proceso de convertir variables categóricas en un formato numérico que los algoritmos de aprendizaje automático puedan procesar. Dado que la mayoría de los modelos matemáticos operan con números, esta traducción es un paso indispensable. Sin una codificación adecuada, el modelo podría interpretar incorrectamente las relaciones entre categorías, afectando negativamente su rendimiento.
La elección de la técnica de codificación depende de la naturaleza de la variable (si es nominal u ordinal) y del algoritmo a utilizar. Como se ilustra en la figura 2.12, las dos técnicas más comunes abordan el problema de maneras fundamentalmente distintas: mejorar su interpretabilidad, especialmente cuando las relaciones no son lineales. Además, es un paso esencial para algoritmos de clasificación que requieren variables categóricas. Sin embargo, es crucial elegir adecuadamente los puntos de corte, ya que una mala elección puede causar una pérdida significativa de información.
0
25
50
75
100
Corte 1 Corte 2 Joven Adulto Mayor Joven Adulto Mayor
0
2
4
4
5
2
Conteo Variable Continua (Edad) Variable Discretizada Discretizar Fig. 2.11. Proceso de discretización de una variable continua (Edad) en tres categorías discretas
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [55] Regresar Color Rojo Verde Azul Verde Color Enc
0
1
2
1
Rojo Verde Azul
1
0
0
0
1
0
0
0
1
0
1
0
Variable Original Label Encoding One-Hot Encoding Fig. 2.12. Comparación del proceso de Label Encoding y One-Hot Encoding para una variable categórica
2.3.6.
Estandarización de los datos La estandarización es un método que transforma los datos de forma que tengan una media (µ) igual a cero y una desviación estándar (σ) igual a uno. Este proceso se conoce como normalización Z-score o puntaje estándar.
Label Encoding: asigna un número entero único a cada categoría. Es simple y eficiente, pero introduce una relación de orden artificial (ej. 2 >1 >0) que puede confundir a algunos modelos si la variable es puramente nominal (sin orden). One-Hot Encoding: crea una nueva columna binaria (con valores 0 o 1) para cada categoría. Evita el problema del orden artificial, pero puede generar una gran cantidad de columnas si la variable tiene muchas categorías.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [56] Regresar La estandarización es especialmente importante en algoritmos sensibles a la escala de las variables, como K-Nearest Neighbors o Support Vector Machines, ya que garantiza que todas las características contribuyan de manera equitativa al modelo. Además, a diferencia de la normalización por rango, no depende de los valores mínimo y máximo, lo que la hace más robusta frente a valores atípicos.
La fórmula general de estandarización es:
z = x −µ σ Donde:
x es el valor original, µ es la media de los datos, σ es la desviación estándar, z es el valor estandarizado.
Ejemplo 2.3.1:
Se conocen las calificaciones de cinco estudiantes en un examen (sobre
100 puntos):
Estudiante Calificación A
50
B
65
C
70
D
80
E
95
La media es µ = 72 y la desviación estándar σ = 15.17. Aplicando la fórmula del z-score:
z = Calificación −72
15.17
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [57] Regresar la distribución original de los datos, pero adaptando la escala para facilitar la comparación entre variables.
La normalización es útil en algoritmos que dependen de las magnitudes relativas de los datos, como las redes neuronales o los métodos de distancia (KNN, K-means). Sin embargo, es sensible a los valores atípicos (outliers), ya que estos pueden distorsionar el rango de la transformación.
La fórmula utilizada es:
x′ = x −xmin xmax −xmin Donde:
x es el valor original, x′ es el valor normalizado, xmin y xmax son el valor mínimo y máximo de la variable, respectivamente. Se obtienen los valores estandarizados:
Estudiante Z-score A
-1.45
B
-0.46
C
-0.13
D
0.53
E
1.51
2.3.7.
Normalización de los datos La normalización es una técnica de preprocesamiento que ajusta los valores de una variable numérica para que se encuentren dentro de un rango específico, generalmente entre 0 y 1. Esta técnica, conocida también como Min-Max Scaling, se utiliza cuando se desea preservar
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [58] Regresar Ejemplo 2.3.2:
Se conocen las edades de cinco personas:
Persona Edad (años) A
18
B
25
C
37
D
50
E
62
Aplicando la normalización por rango:
Edad normalizada = Edad −18
62 −18
Los resultados obtenidos son:
Persona Edad normalizada A
0.00
B
0.16
C
0.43
D
0.73
E
1.00
2.4.
SESGOS EN LA INTERPRETACIÓN DE DATOS
La interpretación de datos, aunque busca ser un proceso objetivo, puede estar influenciada por sesgos cognitivos y metodológicos que distorsionan las conclusiones. Reconocer estas "trampas" del pensamiento es fundamental para realizar un análisis riguroso y fiable. A continuación, se presentan los principales sesgos acompañados de su descripción e ilustración conceptual.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [59] Regresar Sesgo de Recencia Tendencia a otorgar mayor peso a los eventos recientes, restando importancia a la información histórica. Sesgo de Recencia Tiempo ¡Lo m´as importante!
Fig. 2.13. Sesgo de Recencia Sesgo de Confirmación Tendencia a buscar, interpretar y recordar información que confirme nuestras creencias o hipótesis preexistentes, ignorando la evidencia contraria. Sesgo de Confirmaci´on Fig. 2.14. Sesgo de Confirmación Sesgo de Estacionalidad Aparece cuando se confunden los ciclos o patrones estacionales con una tendencia a largo plazo, generando proyecciones erróneas.
Sesgo de Estacionalidad Tiempo Ventas Pico Pico Datos Reales Tendencia Percibida Fig. 2.15. Sesgo de Estacionalidad Sesgo de Disponibilidad Tendencia a juzgar la probabilidad de un evento según la facilidad con que se recuerda, influida por emociones o cobertura mediática.
Sesgo de Disponibilidad Percepci´on (Noticias) Raro Com´un Realidad (Estad´ısticas) Raro Com´un Fig. 2.16. Sesgo de Disponibilidad
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [60] Regresar Sesgo de Selección Ocurre cuando la muestra de datos utilizada no representa a toda la población, llevando a conclusiones no generalizables.
Sesgo de Selecci´on Poblaci´on Completa Muestra Sesgada Selecci´on Fig. 2.18. Sesgo de Selección Sesgo de Anclaje Ocurre cuando la primera información recibida actúa como un ”ancla”, influyendo desproporcionadamente en la decisión final.
Sesgo de Anclaje Rango de Decisi´on
1. Primera Informaci´on
Ancla
2. Valor Objetivo
3. Decisi´on Final
Decisi´on Atracci´on del ancla Fig. 2.17. Sesgo de Anclaje Sesgo de Supervivencia Surge al analizar únicamente los casos de éxito o supervivencia, ignorando los fracasos que aportan información crítica.
Sesgo de Supervivencia X Datos Analizados (Supervivientes) Datos Ignorados (Fracasos) Fig. 2.19. Sesgo de Supervivencia
2.5.
FUENTES DE DATOS ABIERTOS
Las fuentes de datos libres son esenciales para investigadores, desarrolladores y ciudadanos interesados en analizar y utilizar información de manera accesible y gratuita. En Colombia y el mundo, existen múltiples plataformas que ofrecen conjuntos de datos abiertos para diversos propósitos, algunas de estas son:
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [61] Regresar UN Data [6], es la base de datos de las Naciones Unidas. Proporciona acceso a una amplia gama de estadísticas internacionales sobre desarrollo, economía, salud, medio ambiente y más, recopiladas de diversas agencias de la ONU.
DATA.GOV [7], es el sitio de datos abiertos del Gobierno de los Estados Unidos, está diseñado para liberar el poder de los datos abiertos gubernamentales para informar las decisiones al público y los responsables de la formulación de políticas, impulsar la innovación y la actividad económica, cumplir las misiones de la agencia y fortalecer la base de un gobierno abierto y transparente.
UC Irvine Machine Learning Repository [8], es una de las bases de datos más reconocidas y ampliamente utilizadas en la comunidad de ciencia de datos y aprendizaje automático. Mantenida por la Universidad Irvine de California, esta colección ofrece una vasta diversidad de conjuntos de datos que abarcan múltiples dominios, como medicina, biología y economía. Estos conjuntos están diseñados para facilitar la investigación, el desarrollo y la evaluación de algoritmos de aprendizaje automático, proporcionando a investigadores y profesionales la oportunidad de comparar y validar sus modelos en un entorno controlado y estandarizado. En Colombia, Datos Abiertos Colombia [2] es la principal plataforma de datos abiertos del país. Esta iniciativa del gobierno colombiano proporciona acceso a una amplia variedad de conjuntos de datos en áreas como salud, educación, transporte y economía. Los datos disponibles pueden ser utilizados para investigaciones académicas, proyectos tecnológicos, y para fomentar la transparencia y participación ciudadana. Kaggle Datasets [3] ofrece una amplia colección de conjuntos de datos abiertos que abarcan diversos campos, desde ciencia de datos hasta inteligencia artificial. Los usuarios pueden descargar, explorar y utilizar estos datos para proyectos de análisis y desarrollo de modelos.
Open Data Portal de la Unión Europea [4], este portal proporciona acceso a datos de diversas instituciones y agencias de la UE, cubriendo temas como economía, medio ambiente y sociedad. Los datos están disponibles en múltiples formatos y son ideales para análisis comparativos y estudios.
World Bank Open Data [5], ofrece acceso a datos económicos y de desarrollo global. Esta plataforma incluye estadísticas sobre desarrollo sostenible, pobreza, salud, educación y más, facilitando el acceso a información crucial para la investigación y el análisis de políticas públicas.
Representaciones de datos para estadística descriptiva Capítulo 3
[65] Regresar
3.1.
TABLAS Y DISTRIBUCIONES DE FRECUENCIA
Entre las herramientas más utilizadas en el análisis exploratorio de datos, se encuentra la tabla de frecuencia. Esta representación tabular, resume la ocurrencia de diferentes valores en un conjunto de datos. Básicamente, una tabla de frecuencia muestra la cantidad de veces que cada valor o categoría aparece en los datos, lo que proporciona una visión rápida y clara de la distribución de los mismos.
La tabla de frecuencia es generalmente implementada cuando se trabaja con datos categóricos o discretos, donde se pueden contar las ocurrencias de cada categoría. Por ejemplo, en encuestas de preferencias de color o en registros de respuestas sí/no, las tablas de frecuencia ayudan a entender qué opciones son más populares o comunes entre los encuestados. Así mismo, en conjuntos de datos numéricos discretos, como las edades de los participantes de un estudio, las tablas de frecuencia pueden mostrar la distribución de las edades en intervalos específicos.
Para crear una tabla de frecuencia se siguen los pasos descritos en la figura 3.1, donde primero se debe identificar la variable de interés y determinar los diferentes valores que esta puede tomar. Luego, se cuenta la cantidad de veces que aparece cada valor en los datos y se organiza esta información en una tabla, generalmente con dos columnas: una para los valores o categorías y otra para las frecuencias correspondientes. Es importante asegurar que todos los valores posibles estén representados en la tabla, incluso si tienen frecuencia cero.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [66] Regresar Además, de las tablas de frecuencia, otra forma común de visualizar la distribución de datos es a través de gráficos. Para datos categóricos, se pueden utilizar gráficos de barras o gráficos circulares, donde la altura o el área de cada barra o sector corresponde a la frecuencia de la categoría. Para datos numéricos, se pueden emplear histogramas, que muestran la distribución de frecuencias de los datos en intervalos. Interpretar una tabla de frecuencia, o un gráfico asociado, implica comprender cómo se distribuyen los datos y qué patrones o tendencias pueden estar presentes. Por ejemplo, si se observa una tabla de frecuencia de género en una muestra de población y se nota que hay una gran disparidad entre la cantidad de hombres y mujeres, esto podría indicar un sesgo en la muestra o en el proceso de recopilación de datos. Del mismo modo, al examinar un histograma de las edades de los participantes de un estudio, se puede identificar si la distribución es simétrica, sesgada hacia la derecha o hacia la izquierda, lo que proporciona información valiosa sobre la población estudiada.
Identificar la variable Determinar posibles valores para la variable Contar la cantidad de veces que aparece cada valor en los datos Crear una tabla con dos columnas (o las necesarias) Columna de categorías Columna de frecuencias Fig. 3.1. Secuencia de creación de una tabla de frecuencia
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [67] Regresar
3.1.1.
Distribuciones de frecuencia Las distribuciones de frecuencia permiten organizar y analizar datos de manera que sea más sencillo identificar patrones y tendencias. Este recurso es especialmente útil en contextos donde se requiere comprender la ocurrencia de eventos discretos, como resultados de encuestas, preferencias de productos o respuestas a preguntas específicas. Por ejemplo, en el análisis de datos demográficos, se puede utilizar una distribución de frecuencia para examinar la distribución de edades en una población, mostrando cuántas personas tienen edades dentro de ciertos rangos específicos.
Interpretar una distribución de frecuencia implica comprender la forma en que se distribuyen los datos y qué patrones pueden estar presentes. Por ejemplo, al examinar un histograma de las calificaciones de un examen, se puede identificar si la mayoría de los estudiantes obtuvieron notas altas, bajas o si la distribución es uniforme. Esta comprensión ayuda a obtener información valiosa sobre la naturaleza de los datos y puede guiar la toma de decisiones en diversas áreas, desde la educación hasta el marketing.
3.1.2.
Tipos de distribuciones Distribuciones de frecuencias no agrupadas: número de observaciones de cada valor de una variable. Se puede utilizar este tipo de distribución de frecuencias para variables categóricas.
En la figura 3.2, se observa el registro del número de personas que prefieren diferentes géneros musicales en una encuesta. Los resultados son los siguientes: 10 personas prefieren rock, 15 personas prefieren pop, 8 personas prefieren jazz y 12 personas prefieren electrónica.
Distribuciones de frecuencia en grupo: número de observaciones de cada intervalo de clase de una variable. Los intervalos de clase se ordenan por grupos de valores de variable. Se puede utilizar este tipo de distribución de frecuencias para variables cuantitativas.
La figura 3.3 representa la cantidad de horas que un grupo de 38 bailarines ensayó para realizar una presentación en la inauguración de los juegos nacionales. Los datos se agruparon en intervalos de horas. Hay 5 bailarines que ensayaron de 0 a 10 horas,
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [68] Regresar Rock Pop Jazz Electrónica Valores
0
2
4
6
8
10
12
14
Frecuencia Distribución de frecuencias no agrupadas Fig. 3.2. Frecuencia no agrupada
0-10
11-20
21-30
31-40
Intervalos de hora
0
2
4
6
8
10
12
14
Frecuencia Distribución de frecuencias agrupadas Fig. 3.3. Frecuencia agrupada Distribuciones de frecuencia relativa: proporción de observaciones de cada valor o intervalo de clase de una variable. Se puede utilizar este tipo de distribución de frecuencias para cualquier tipo de variable cuando se esté más interesado en comparar frecuencias que el número real de observaciones. Pizza Hamburguesas Sushi Tacos Valores
0.00
0.05
0.10
0.15
0.20
0.25
0.30
0.35
Frecuencia Relativa Distribución de frecuencia relativa Fig. 3.4. Frecuencia relativa A B C D Valores (A, B, C, D)
0
20
40
60
80
100
Frecuencia Acumulada (%) Distribución de Frecuencia Acumulada Fig. 3.5. Frecuencia acumulativa La figura 3.4 presenta la distribución relativa de una encuesta realizada para determinar las preferencias de comida en un grupo de personas. Los resultados se muestran como proporciones del total de respuestas. El 20 % de las personas prefieren pizza, el 30 % prefieren hamburguesas, el 15 % prefieren sushi y el 35 % prefieren tacos.
10 bailarines ensayaron de 11 a 20 horas, 8 bailarines ensayaron de 21 a 30 horas y 15
bailarines ensayaron de 31 a 40 horas.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [69] Regresar En la figura 3.5 se muestran los datos recopilados de las edades de un grupo de viajeros, como la cantidad acumulada de viajeros con edades iguales o menores a cierto valor. Hay 10 viajeros con 20 años o menos (A = 22,2 %), 25 viajeros con 25 años o menos (B = 55,6 %), 33 viajeros con 30 años o menos (C = 73.3 %) y 45 viajeros con 35 años o menos (D = 100 %).
Ejemplo 3.1.1:
Para realizar un estudio sobre la composición familiar en una determinada comunidad, se ha recolectado información sobre el número de hijos en cada familia. Como resultados de las encuestas, se obtuvo que 5 familias reportaron no tener hijos, 8 familias reportaron tener 1 hijo, 4 familias indicaron tener 2 hijos, 2 familias indicaron tener 3 hijos y finalmente una familia reportó tener 4 hijos. Con el fin de analizar estos datos de manera organizada, se requiere crear una tabla de frecuencia que muestre la distribución de la cantidad de hijos, siguiendo los pasos expuestos en la figura 3.1. La tabla II resume las frecuencias absolutas para cada valor posible de la variable, mientras que la figura 3.6 presenta el diagrama de frecuencias que permite visualizar la distribución de forma gráfica.
Se identifica que para este caso, la variable de interés es el número de hijos en cada familia.
Para este estudio, se considera que los posibles valores de la variable deben estar entre 0 y 4 hijos.
Se cuenta el número de veces que determinada familia manifestó la cantidad de hijos, desde 0 hasta 4.
Finalmente, se organizan los valores en una tabla, donde la primera columna hace referencia a la categoría, mientras que la segunda hace referencia a la frecuencia con la que se reportó el valor de la variable en estudio.
Distribución de la frecuencia acumulada: es la suma de las frecuencias menor o igual a cada valor o intervalo de clase de una variable. Se puede utilizar este tipo de distribución de frecuencias para variables ordinales o cuantitativas cuando se desea entender con qué frecuencia las observaciones caen por debajo de ciertos valores.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [70] Regresar
TABLA II.
FRECUENCIAS DEL EJEMPLO
Número de hijos Frecuencia
0
5
1
8
2
4
3
2
4
1
0
1
2
3
4
Número de hijos
0
1
2
3
4
5
6
7
8
Frecuencia Histograma de número de hijos en familias Fig. 3.6. Diagrama de frecuencia Ejemplo 3.1.2:
Otra forma fundamental de obtener información sobre la frecuencia de términos es a través del análisis textual. Este enfoque, denominado Procesamiento del Lenguaje Natural (NLP), se centra en examinar la distribución de palabras dentro de un texto específico. Mediante este método, se calcula la frecuencia de ocurrencia de cada palabra en el documento en cuestión.
El análisis textual proporciona tablas de frecuencia que ofrecen una visión detallada de la prevalencia de palabras y su relevancia contextual en el texto analizado. Estas tablas revelan las palabras más frecuentes y su importancia relativa dentro del documento. A continuación, en el algorithm 1 se presenta un ejemplo de cómo se realiza este análisis utilizando un texto que aborda temas relacionados con la gestión del mantenimiento
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [71] Regresar en la industria. Este documento trata sobre la integración de la gestión de activos Algorithm 1 Algoritmo para el Cálculo de Frecuencias de Palabras 1: procedure CALCULARFRECUENCIAS(Texto T) 2:
Tokens ←TOKENIZAR(T) ▷Llama a la función word_tokenize 3:
TextoNLTK ←CREAROBJETOTEXTO(Tokens) ▷Crea un objeto Text de NLTK 4:
Distribucion ←CALCULARFRECUENCIA(TextoNLTK) ▷Llama a FreqDist para contar 5:
ListaComun ←OBTENERMÁSCOMUNES(Distribucion, 10) 6:
Imprimir ListaComun 7: end procedure Los resultados obtenidos se organizan en la tabla III, donde se muestra la frecuencia absoluta de las palabras más utilizadas en el texto. De forma complementaria, en la figura 3.7 se presenta un gráfico de barras que permite visualizar comparativamente la frecuencia de cada término dentro del documento.
TABLA III.
FRECUENCIA DE PALABRAS
Palabra Freq.
de
45
,
27
la
22
en
16
los
16
y
15
el
11
.
9
que
7
gestión
6
de
,
la en los y el
.
que gestión Palabras
0
5
10
15
20
25
30
35
40
45
Frecuencia Frecuencia de palabras Fig. 3.7. Histograma de palabras más frecuentes físicos en los procesos de formación de ingeniería, el ciclo de vida de los activos y la importancia de la estadística y la probabilidad en la gestión del mantenimiento. Además, se menciona la relevancia de estos conceptos en diversos sectores industriales, como la energía, la manufactura y la petrolera.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [72] Regresar
3.2.
VISUALIZACIÓN DE DATOS EN ESTADÍSTICA DES-
CRIPTIVA
Donde N es el número de muestras observadas y k el número óptimo de bins o intervalos. Además, es necesario calcular el ancho de bin(W) identificando los máximos y mínimos del conjunto de datos y se expresa de la siguiente forma:
k = 1 + log2(N)
(3.1)
3.2.1.
Histograma El histograma es una representación gráfica de una distribución de frecuencias, que muestra a través de barras rectangulares la concentración de datos en rangos o intervalos determinados.
La forma más común del histograma, se obtiene mediante la división del rango de datos en clases (bin), las cuales, si bien pueden ser escogidas arbitrariamente por el usuario, también pueden ser calculadas mediante el uso de criterios determinados. Uno de estos criterios es el conocido como la regla de Sturges.
La Regla de Sturges propone que dadas N observaciones, el número k de bins viene dado por:
W = límite superior −límite inferior k
(3.2)
Ejemplo 3.2.1:
Se presenta un ejemplo práctico que utiliza la base de datos iris, la cual se encuentra en Fisher [9], para generar un histograma que representa la distribución de la longitud del sépalo de las tres especies de flores presentes en el conjunto de datos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [73] Regresar Fig. 3.8. Histograma con diferente tamaño de Bin
1
2
3
4
5
6
7
Longitud del sépalo
0
10
20
30
40
50
Frecuencia
1
2
3
4
5
6
7
Longitud del sépalo
0
10
20
30
40
50
Frecuencia
1
2
3
4
5
6
7
Longitud del sépalo
0
5
10
15
20
25
30
Frecuencia Analizando la figura 3.8, se puede observar que:
En el primer histograma (de color verde), se utiliza un número reducido de bins. Esto hace que la distribución se vea uniforme y no permita apreciar detalles sobre la forma real de los datos o su centro.
En el segundo histograma (de color rosa), se incrementa el número de bins utilizando la regla de Sturges; ahora se revela que la distribución parece ser gaussiana, con una leve asimetría positiva en los datos. Este segundo caso permite identificar de manera más precisa dónde se encuentra el centro y la moda de los datos.
Finalmente, en el tercer histograma (amarillo) se utiliza un número aún mayor de bins, y se aprecia que la distribución es bimodal, es decir, tiene dos picos o modas separadas, cada una con su propia asimetría ligeramente opuesta; lo que sugiere la posible presencia de dos subpoblaciones o especies diferentes de flores iris. En resumen, mientras que un histograma con bins muy anchos oculta características importantes, los histogramas con una elección más adecuada de bins permiten visualizar detalles cruciales como la forma, modas, centros y posibles subpoblaciones presentes en los datos. Esto demuestra la importancia de una representación gráfica apropiada de los histogramas y la elección correcta del número de clases, para un análisis correcto de la distribución de los datos.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [74] Regresar
3.2.2.
Polígono de frecuencias.
El polígono de frecuencias es un gráfico lineal que se construye a partir de un histograma de frecuencias. Su objetivo principal es visualizar cómo cambia la frecuencia de una variable a medida que avanza su rango de valores. Este tipo de gráfico se utiliza tanto para variables categóricas como para variables cuantitativas.
El polígono de frecuencias se construye a partir del histograma. Para ello, primero se deben identificar los valores de los puntos medios de cada barra del histograma. Estos puntos medios representan el valor central de cada clase o intervalo. Una vez determinados estos valores, se procede a marcarlos en el eje horizontal. Posteriormente, se trazan líneas rectas que unen los puntos marcados correspondientes a las alturas de las barras del histograma. De esta manera, se forma una línea poligonal que conecta todos los puntos medios, generando así el polígono de frecuencias.
En la figura 3.9 se observa un ejemplo de comparación del ancho de sépalo entre las diferentes especies de flor Iris.
2.0
2.5
3.0
3.5
4.0
Ancho del sépalo
0.0
2.5
5.0
7.5
10.0
12.5
15.0
17.5
Frecuencias Polígono de Frecuencia Setosa Virginica versicolor Fig. 3.9. Polígono de frecuencias de especies de Iris De la figura 3.9 se puede realizar la comparación entre la forma de distribución de las tres variables, permitiendo extraer información sobre cuan similar es el ancho del sépalo de una con otra variable muy fácilmente.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [75] Regresar Por su forma, el polígono de frecuencia tiene ventajas como la fácil comprensión y comparación de diferentes distribuciones de datos. Sin embargo, al utilizar una línea continua, se pierde cierta información sobre la distribución real de los datos, como la forma exacta de las barras del histograma y los valores atípicos pueden llegar a tener un gran impacto en la forma de la línea, distorsionando la representación de la distribución real.
3.2.3.
Diagrama de sectores Un diagrama de sectores es una forma visual de presentar datos, donde un círculo se divide en porciones. Cada porción representa una categoría particular de los datos y el tamaño de estas es proporcional a la magnitud o frecuencia de esa categoría en relación con el total. Por lo tanto, sirven para analizar de manera visual la frecuencia de cada valor. En estadística, este tipo de gráficos se utilizan principalmente para representar variables cualitativas. Antes de comenzar a realizar un diagrama de sectores, se deben tener los datos representados mediante una tabla de frecuencias. Además, se debe realizar un procesamiento de los datos de la siguiente manera:
1. Convertir las frecuencias a grados: dado que este tipo de diagrama es un diagrama
circular, se procede a calcular el ángulo que corresponde a cada sector del diagrama mediante la siguiente ecuación:
αi = fi 360◦ N
(3.3)
donde αi es el ángulo, fi es la frecuencia absoluta y N es el número total de datos.
2. Dibujar el diagrama de sectores: trazar un círculo, comenzando desde un punto de
referencia (usualmente 90◦), dividir el círculo en rebanadas o sectores, usando los ángulos calculados.
3. Etiquetar y dar formato: etiquetar cada sector con la categoría correspondiente. Se
puede incluir las frecuencias relativas o absolutas junto a las etiquetas, aun así, es más común el uso de frecuencias relativas.
A continuación, se muestra el diagrama de sectores correspondiente a la figura 3.10, donde fue presentada la distribución relativa de una encuesta realizada para determinar las preferencias de comida en un grupo de personas.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [76] Regresar Tacos
15.0%
Pizza
20.0%
Hamburguesa
30.0%
Sushi
35.0%
Distribución de frecuencia relativa Fig. 3.10. Diagrama de sectores Si a la encuesta realizada se le añadieran más tipos de comidas, se obtendría un resultado como el de la figura 3.11 Pizza
4.1%
pollo asado
4.1%
lasagna
5.5%
hamburguesa
6.8%
Sushi
8.2%
Tacos
8.2%
Nachos
9.6%
otro
9.6%
Quesadilla
11.0%
Donas
11.0%
Papas fritas
9.6%
Ensalada
12.3%
Distribución de frecuencia relativa (Saturación de Etiquetas) Fig. 3.11. Diagrama de sectores I El diagrama de sectores facilita la visualización y comparación rápida de las proporciones de cada categoría respecto al total de una manera más directa e intuitiva. Esta visualización es efectiva cuando se hace uso de este tipo de diagramas, es exclusiva para pocas categorías.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [77] Regresar Por la cantidad de categorías representadas en la figura 3.11, las rebanadas del pastel se tornan muy pequeñas y es difícil distinguir rápidamente cuáles corresponden a qué variable. Al intentar etiquetar todas las porciones, las etiquetas se superponen y se vuelven ilegibles, dificultando la identificación de las diferentes secciones. Con tantas categorías, la organización lógica de las porciones se pierde, lo que dificulta la comparación visual entre ellas. Lo anterior hace que el gráfico se sature de información y pierda su propósito de comunicar de manera clara y concisa.
Una solución rápida consiste en reorganizar la figura; sin embargo, esta aún se percibe saturada (ver figura 3.12). Una buena representación de datos debe priorizar una visualización clara y sencilla, que comunique la información esencial de forma directa. En este sentido; conviene seleccionar únicamente las variables que aportan valor interpretativo, ya que no todos los datos contribuyen con información significativa al mensaje que se desea transmitir.
Pizza
4.1%
pollo asado
4.1%
lasagna
5.5%
hamburguesa
6.8%
Sushi
8.2%
Tacos
8.2%
Nachos
9.6%
otro
9.6%
Quesadilla
11.0%
Donas
11.0%
Papas fritas
9.6%
Ensalada
12.3%
Distribución de frecuencia relativa (Saturación de Etiquetas) Fig. 3.12. Diagrama de sectores II
3.2.4.
Diagrama de caja y bigotes Los diagramas de caja, también conocidos como "box plots", son herramientas gráficas que destacan por su capacidad de transmitir de manera clara y concisa la ubicación y la variación de los datos numéricos. Una de sus principales fortalezas es la posibilidad de identificar de forma individual aquellas observaciones que se apartan del resto de los
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [78] Regresar
3. Calcular el rango intercuartil (la diferencia entre el cuartil superior e inferior) y
usualmente llamado IQ, por sus siglas en inglés.
4. Calcular los siguientes puntos:
L1 = cuartil in f erior −1, 5 ∗IQ
(3.4)
L2 = cuartil in f erior −3, 0 ∗IQ
(3.5)
U1 = cuartil superior + 1, 5 ∗IQ
(3.6)
U2 = cuartil superior + 3, 0 ∗IQ
(3.7)
5. Trazar una línea desde el cuartil inferior hacia el lado izquierdo, hasta el punto más
pequeño mayor que L1. Asimismo, se traza la línea que va desde el cuartil superior hacia el lado derecho, hasta el punto más grande menor que U1.
6. Los puntos menores que L2 o mayores que U2, se dibujan como círculos. Estos datos
son los atípicos extremos.
En la figura 3.13, se presentan los diagramas de caja o "box plots" construidos utilizando la base de datos Iris de Fisher. Estos gráficos se construyen de manera que permitan comparar la distribución del ancho del sépalo entre las diferentes especies de iris, al igual que se hizo en la figura 3.9 mostrada anteriormente.
Estos diagramas se pueden encontrar en formato horizontal, pero más comúnmente en formato vertical, donde el eje vertical es la variable de respuesta, el eje horizontal es el factor de interés y viceversa para el formato horizontal. Para su construcción se debe:
1. Calcular la mediana y los cuartiles inferior (25 %) y superior (75 %).
2. Trazar un símbolo en la mediana y dibujar un cuadro desde el cuartil inferior hasta
el superior.
datos, a las cuales se les denomina valores atípicos. Estos diagramas permiten visualizar de manera eficiente la dispersión y la simetría de una distribución de datos, convirtiéndose en una herramienta adecuada para el análisis exploratorio de conjuntos de datos numéricos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [79] Regresar Fig. 3.13. Diagrama de caja y bigotes
2.0
2.2
2.4
2.6
2.8
3.0
3.2
3.4
3.6
3.8
4.0
4.2
4.4
4.6
4.8
Ancho del sépalo Setosa
2.0
2.2
2.4
2.6
2.8
3.0
3.2
3.4
3.6
3.8
4.0
4.2
4.4
4.6
4.8
Ancho del sépalo Virginica
2.0
2.2
2.4
2.6
2.8
3.0
3.2
3.4
3.6
3.8
4.0
4.2
4.4
4.6
4.8
Ancho del sépalo versicolor De los gráficos, se puede identificar la asimetría de los datos observando si la mediana está cerca del cuartil inferior (asimetría positiva), como es el caso de la setosa, o cerca del cuartil superior (asimetría negativa) como se observa en la iris versicolor; por último, si la mediana se encuentra aproximadamente en la mitad, los datos son simétricos, como se observa con la iris virginica. A partir del ancho de la caja o rango intercuartílico, se obtiene información sobre la dispersión, entre más estrecha sea la caja menor dispersión van a tener los datos. Además, es muy fácil apreciar los datos atípicos y atípicos extremos, en este caso solo se ven atípicos extremos para dos de las variables.
3.2.5.
Diagramas de dispersión Los diagramas de dispersión usan un conjunto de puntos colocados usando coordenadas cartesianas, correspondientes a los valores de dos variables. Al mostrar una variable en cada eje, se puede detectar si existe una relación o correlación entre ellas. La correlación puede representarse como positiva, negativa o nula, y su fuerza puede variar entre fuerte, débil o nula, dependiendo de la dispersión de los puntos. Esta técnica es utilizada principalmente para observar la relación o correlación en las variables, por lo cual es necesario
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [80] Regresar
2.0
2.3
2.6
2.9
3.2
3.5
3.8
4.1
4.4
4.7
sepal_width
0.0
0.2
0.4
0.6
0.8
1.0
1.2
1.4
1.6
1.8
2.0
2.2
2.4
petal_width species setosa versicolor virginica Fig. 3.14. Longitud de sépalo vs Longitud de pétalo Como se mencionó, existen diferentes tipos de correlación, en la gráfica se pude apreciar que la setosa presenta correlación nula, mientras que la versicolor y la virginica presentan correlación positiva ya que mientras aumenta la longitud del sépalo también la del pétalo. En este tipo de gráfico, también se puede observar los valores atípicos presentes, por ejemplo la setosa y la virginica muestran puntos alejados del cúmulo de puntos, como lo son los datos ubicados en (2.3, 0.3), (2.2, 1.5), (4.4, 0.4), (3.8, 2). determinar que variables se van a graficar, posteriormente realizar una serie de pasos para su representación gráfica, los cuales son:
1. Asignar a cada eje una variable y definir una escala apropiada.
2. Marcar los puntos: por cada par de valores (x, y), marca un punto en el plano
ubicando el valor x en el eje horizontal y el valor y en el eje vertical.
3. A continuación se observa el patrón que generan los puntos y de esta manera se
puede obtener información del gráfico.
A continuación, se analiza un diagrama de dispersión construido con datos de la longitud del pétalo y sépalo de diferentes especies de Iris. Este ejemplo permite observar y estudiar la correlación existente entre estas dos variables.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [81] Regresar
3.3.
MEDIDAS DESCRIPTIVAS
Las medidas descriptivas, o resúmenes estadísticos, son herramientas fundamentales que condensan grandes volúmenes de datos en valores concisos y relevantes. Se utilizan para describir las características clave de un conjunto de datos, como su distribución, tendencia central y dispersión.
Estas medidas se clasifican principalmente en:
Medidas de posición: indican el centro de los datos (ej. media, mediana). Medidas de dispersión: muestran cuán esparcidos están los valores (ej. rango, desviación estándar).
Medidas de forma: describen la simetría y la estructura de la distribución. La figura 3.15 ilustra visualmente cómo estas medidas describen un conjunto de datos sobre los tiempos de falla de un equipo industrial. Este tipo de gráfico permite identificar de un solo vistazo el comportamiento central del equipo, su variabilidad y la presencia de posibles fallas atípicas, facilitando así la toma de decisiones sobre mantenimiento.
25
50
75
100
125
150
175
Tiempo de Falla (horas)
0.000
0.002
0.004
0.006
0.008
0.010
0.012
0.014
Densidad de Frecuencia Centro (Media/Mediana) Dispersión (Rango/IQR) Forma (Asimetría Positiva) Posibles Outliers Resumen Visual de Medidas Descriptivas (Tiempos de Falla) Media: 104.7 Mediana: 104.3
IQR: 40.9
Fig. 3.15. Representación visual de las medidas descriptivas. El gráfico de densidad muestra el centro (media, mediana), la dispersión (rango intercuartílico), la forma (asimetría) y la presencia de outliers
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [82] Regresar Medidas de tendencia central: indican el valor alrededor del cual tienden a agruparse los datos.
• Media: también conocida como promedio, es el centro de gravedad de los datos.
Se distingue entre la media poblacional y la muestral:
Media poblacional, µ = ∑N i=1 xi N
(3.8)
Media muestral, x = ∑n i=1 xi n
(3.9)
Donde:
xi: es el valor de la i-ésima observación.
N: es el número total de datos en la población.
n: es el número de datos en la muestra.
Es importante notar que la media es sensible a valores extremos (outliers).
• Moda: es el valor que aparece con mayor frecuencia en el conjunto de datos.
• Mediana: es el valor que ocupa la posición central una vez que los datos han
sido ordenados de menor a mayor. Su cálculo depende de si el número de datos es par o impar.
3.3.1.
Medidas de posición Las medidas de posición son estadísticas descriptivas fundamentales que permiten resumir un conjunto de datos en valores únicos y representativos. Su objetivo es identificar la ubicación de los datos dentro de una distribución, respondiendo a preguntas clave como: ¿cuál es el valor más común o central? ¿dónde se sitúa un dato específico en comparación con el resto?
En el análisis de datos, trabajar con la totalidad de las observaciones puede ser abrumador e impráctico. Estas medidas actúan como ”puntos de referencia” que simplifican la complejidad de los datos, permitiendo captar sus características esenciales de un solo vistazo.
Comprender estas medidas es el primer paso para interpretar correctamente visualizaciones como histogramas y diagramas de caja, ya que son los pilares estadísticos sobre los que se construyen muchos de los gráficos más informativos. Estas medidas se dividen principalmente en dos grandes grupos, cada uno con un propósito distinto:
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [83] Regresar Para un conjunto con n datos ordenados:
◦Si n es impar, la mediana es el valor en la posición central: Me = x n+1
2
(3.10)
◦Si n es par, la mediana es el promedio de los dos valores centrales: Me = x n
2 + x n
2 +1
2
(3.11)
Donde xk representa el dato en la k-ésima posición. A diferencia de la media, la mediana es robusta frente a valores extremos.
Medidas de posición no centrales: describen la posición de un valor dividiendo el conjunto de datos en partes iguales.
• Mínimo y Máximo: son, respectivamente, el valor más pequeño y el más grande
del conjunto de datos.
• Cuantiles: son valores que dividen una distribución de datos ordenada, en
intervalos con la misma cantidad de observaciones. Los más comunes son: ◦Cuartiles: dividen los datos en cuatro partes iguales. El segundo cuartil (Q2) es siempre la mediana.
◦Deciles: dividen los datos en diez partes iguales.
◦Percentiles: dividen los datos en cien partes iguales. Fig. 3.16. Histograma de frecuencias para la identificación visual de la moda
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [84] Regresar Fig. 3.17. Representación gráfica de diferentes divisiones por cuantiles El análisis de una sola variable es directo, pero al comparar dos o más, las diferencias de escala pueden ocultar información valiosa, como se observa en la figura 3.18. Mediante un histograma como el de la figura 3.16, es muy sencillo identificar la moda, que corresponde a la barra de mayor altura. Medidas como el mínimo y el máximo también son fáciles de ubicar en los extremos del eje. En cambio, la media y la mediana no se pueden determinar de forma inmediata solo con la inspección visual del gráfico. La figura 3.17 ilustra cómo los cuantiles segmentan la distribución. Se aprecia por qué los cuartiles son tan utilizados: ofrecen un resumen claro (dividiendo los datos en cuatro segmentos del 25 %) sin saturar el gráfico, a diferencia de los deciles o percentiles. Además, el segundo cuartil (Q2) identifica explícitamente la mediana de la distribución.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [85] Regresar Fig. 3.18. Diagramas de caja de variables con escalas muy diferentes. La información de la variable con menor rango es casi imperceptible.
Cuando las variables tienen rangos muy distintos, la visualización de la variable con la escala menor queda comprimida e ininteligible. Para solucionar esto, se aplican técnicas de normalización.
Una de estas es la normalización por rango (Min-Max), que reescala los datos para que queden en el intervalo [0, 1], como se ve en la figura 3.19.
Fig. 3.19. Variables normalizadas por rango (Min-Max)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [86] Regresar
3.3.2.
Medidas de dispersión Las medidas de dispersión son estadísticas que cuantifican el grado de variabilidad o esparcimiento de un conjunto de datos. Mientras que las medidas de tendencia central indican dónde se ubica el centro, las medidas de dispersión dicen qué tan juntos o separados están los valores entre sí, principalmente en torno a la media. Una dispersión baja indica que los datos están agrupados, mientras que una dispersión alta señala que están más extendidos.
Varianza: mide la dispersión promediando las diferencias al cuadrado de cada dato con respecto a la media. Elevar al cuadrado las diferencias, asegura que todas las contribuciones sean positivas y magnifica el efecto de los valores más alejados. Otra técnica poderosa es la normalización Z-score, que transforma los datos de modo que la media de cada variable sea 0 y su desviación estándar sea 1. El resultado se muestra en la figura 3.20.
Fig. 3.20. Variables normalizadas con Z-score Como se observa, la normalización Z-score centra ambas distribuciones en el cero (su media original) y permite comparar directamente su dispersión en una escala común, donde el eje representa desviaciones estándar respecto a la media.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [87] Regresar Varianza muestral, S2 = ∑n i=1 (xi −¯x)2 n −1
(3.12)
Varianza poblacional, σ2 = ∑N i=1 (xi −µ)2 N
(3.13)
Donde:
xi: es el valor de cada observación.
¯x: es la media de la muestra.
µ: es la media de la población.
n, N: son los tamaños de la muestra y la población, respectivamente. El principal inconveniente de la varianza es que sus unidades están al cuadrado (ej. m2 si los datos están en metros), lo que dificulta su interpretación directa. Desviación estándar: es la medida de dispersión más utilizada y resuelve el problema de las unidades de la varianza. Se define como la raíz cuadrada de la varianza. Desviación estándar muestral, S = √ S2
(3.14)
Desviación estándar poblacional, σ = √ σ2
(3.15)
Al aplicar la raíz cuadrada, sus unidades vuelven a ser las mismas que las de los datos originales. Por ello, la desviación estándar se interpreta como la distancia típica o promedio de una observación con respecto a la media. Rango: es la medida de dispersión más simple, calculada como la diferencia entre el valor máximo y el mínimo del conjunto de datos.
R = Xm´ax −Xm´ın
(3.16)
Aunque es fácil de calcular, es muy sensible a valores atípicos y no considera cómo se distribuye el resto de los datos, por lo que su uso suele ser complementario. Coeficiente de variación (CV): es una medida de dispersión relativa y adimensional, lo que la hace ideal para comparar la variabilidad entre distintos conjuntos de datos. CV = S | ¯x|
× 100 %
(3.17)
Al expresar la desviación estándar como un porcentaje de la media, el CV permite comparar la dispersión de variables con diferentes unidades o escalas (por ejemplo, la variabilidad del peso en kg vs. la de la altura en cm). Un CV bajo implica poca
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [88] Regresar centro, lo que da una idea de la probabilidad de encontrar valores atípicos. La fórmula del exceso de curtosis para una muestra es:
g2 =
1
n ∑n i=1(xi −¯x)4
1
n ∑n i=1(xi −¯x)2
2 −3
(3.19)
• Simétrica (≈0): los datos se distribuyen de forma equitativa a ambos lados del
centro, como en la distribución normal.
Curtosis: como se analizó en Detección de valores atípicos (ver sección 2.3.3, página ), la curtosis mide la pesadez de las colas y la concentración de los datos en el variabilidad en relación con la media, mientras que un CV alto indica una gran dispersión.
3.3.3.
Medidas de forma y distribución Mientras que las medidas de posición y dispersión informan sobre el centro y la variabilidad de los datos, las medidas de forma describen la geometría de la distribución de frecuencias. Ayudan a entender si los datos se distribuyen de manera simétrica y qué tan concentrados están en el centro y en los extremos (colas) de la distribución. Las dos medidas de forma principales son la asimetría y la curtosis. Coeficiente de asimetría (Sesgo): mide el grado de falta de simetría en una distribución de datos. Se puede cuantificar con la siguiente fórmula, que calcula el promedio de las desviaciones estándar elevadas al cubo:
Asimetría = 1 n n ∑ i=1 xi −¯x s
3
(3.18)
La interpretación de su valor es clave:
• Asimetría positiva (> 0): la distribución tiene una cola más larga a la derecha.
La mayoría de los datos se concentran en la parte izquierda y la media es generalmente mayor que la mediana.
• Asimetría negativa (< 0): la distribución tiene una cola más larga a la izquierda.
La mayoría de los datos se concentran en la parte derecha y la media suele ser menor que la mediana.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [89] Regresar A modo de resumen, el exceso de curtosis (g2) se interpreta de la siguiente manera:
• Leptocúrtica (g2 > 0): colas más pesadas que la distribución normal, indicando
una mayor probabilidad de valores atípicos.
• Mesocúrtica (g2 = 0): curtosis igual a la de una distribución normal.
• Platicúrtica (g2 < 0): colas más ligeras que la normal, lo que sugiere una menor
probabilidad de valores atípicos.
Ejemplo 3.3.1:
A partir de los estadísticos descriptivos previamente obtenidos, se procede al análisis detallado de los datos presentados en la tabla IV y en la figura 3.21. Estos resultados se asocian con el tiempo total de fallas y el número de fallos registrados en una siderúrgica, variables críticas para la evaluación del desempeño y la confiabilidad del sistema productivo.
El estudio conjunto de las medidas de tendencia central y dispersión, junto con la estimación de la densidad mediante núcleos (Kernel Density Estimation), permite caracterizar la distribución probabilística de los datos (tal y como se observan en las figuras), identificar comportamientos no simétricos, posibles valores atípicos y regiones de mayor concentración; proporcionando infomración base cuantitativa para el análisis de patrones de falla y el diseño de estrategias de mantenimiento. Fig. 3.21. Estimación de la densidad de Kernel (curva) superpuesta a los histogramas para las variables del caso de estudio
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [90] Regresar
TABLA IV.
MEDIDAS DESCRIPTIVAS PARA EL EJEMPLO DE LA SIDERÚRGICA.
Medida N° de fallas Tiempo de fallas (min) Media
6.586
179.344
Mediana
4.0
100.0
Desviación estándar
6.835
226.181
Asimetría (g1)
1.433
2.054
Exceso de Curtosis (g2)
1.806
4.712
La tabla IV resume los estadísticos clave. Al analizar estos valores en conjunto con la figura 3.21, se puede extraer conclusiones mucho más ricas: Asimetría: ambas variables tienen una asimetría positiva (1.433 y 2.054). Esto es claramente visible en la figura, donde ambas distribuciones presentan una larga cola hacia la derecha. Esto indica que, aunque la mayoría de las veces hay pocas fallas y duran poco tiempo, existen eventos ocasionales con un número muy alto de fallas o una duración excepcionalmente larga.
Curtosis: ambas tienen un exceso de curtosis positiva (1.806 y 4.712), lo que las clasifica como leptocúrticas. La variable (Tiempo de fallas) tiene un valor de curtosis particularmente alto (4.712), lo que significa que sus colas son muy pesadas. Esto se refleja en la curva angosta y de alto pico del gráfico, y confirma que los eventos de fallas de muy larga duración (valores atípicos) son una característica importante de esta distribución.
Este análisis demuestra cómo las medidas de forma, cuantifican lo que se observa intuitivamente en una visualización, permitiendo describir la distribución de los datos con precisión estadística.
3.3.4.
Medidas de concentración Las medidas de concentración son herramientas estadísticas diseñadas para evaluar qué tan equitativa se distribuye una variable dentro de un conjunto de datos. Su aplicación es fundamental en campos como la economía y la sociología para estudiar la desigualdad de ingresos, o en ingeniería para analizar la distribución de fallas o el uso de recursos en un sistema.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [91] Regresar Curva de Lorenz: es una representación gráfica que compara la distribución acumulada real de una variable (ej. ingresos, producción, etc.) frente a la proporción acumulada de individuos o elementos que la poseen. Se traza junto a una diagonal de 45◦que representa la línea de igualdad perfecta. Cualquier desviación de la curva por debajo de esta diagonal evidencia una concentración; cuanto mayor es la brecha, mayor es la desigualdad.
Índice de Gini: es la medida numérica que cuantifica la desigualdad visualizada en la curva de Lorenz. Se calcula a partir del área entre la línea de igualdad perfecta y la curva de Lorenz. El índice varía entre 0 (igualdad perfecta) y 1 (concentración máxima). Su simplicidad y poder comparativo lo convierten en el estándar para medir la desigualdad.
Estas medidas no solo representan gráficamente la distribución, sino que la cuantifican, facilitando la comparación entre diferentes conjuntos de datos o periodos de tiempo. Ejemplo 3.3.2:
Análisis de desigualdad de ingresos: para ilustrar estos conceptos, se analiza la distribución de ingresos en una población ficticia de ocho individuos.
TABLA V. INGRESOS DE UNA POBLACIÓN FICTICIA Y PROPORCIONES ACUMULADAS.
Individuo Ingreso ($) Prop. Ingreso ( %)
1
500
1.6 %
2
700
3.8 %
3
1000
7.0 %
4
1200
10.8 %
5
2500
18.8 %
6
4000
31.3 %
7
8000
56.3 %
8
12000
100.0 %
Paso 1: construcción de la Curva de Lorenz Para construir la curva, primero se ordenan los datos de menor a mayor ingreso. Luego, se calculan las proporciones acumuladas tanto de individuos como de ingresos. El resultado se grafica en la figura 3.22.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [92] Regresar Fig. 3.22. Curva de Lorenz para la distribución de ingresos donde:
El eje X representa el porcentaje acumulado de la población. El eje Y representa el porcentaje acumulado del ingreso total que ese grupo posee. Como se observa, la curva se descuelga de la diagonal, mostrando visualmente la disparidad: por ejemplo, el 50 % de población con menos ingresos (los primeros 4 individuos) apenas concentra cerca del 15 % del ingreso total. Paso 2: cálculo e Interpretación del Índice de Gini Mientras la curva de Lorenz da una imagen visual, el índice de Gini ofrece un número único para cuantificar esta desigualdad. Se define a partir de las áreas del gráfico: G = Área A Área A + Área B
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [93] Regresar donde A es el área entre la línea de igualdad y la curva de Lorenz, y B es el área bajo la curva de Lorenz.
Para los datos del ejemplo, el cálculo arroja un valor de:
G ≈0.532 Interpretación: un índice de Gini de 0.532 se considera una desigualdad significativa. Para ponerlo en contexto, un valor de 0 representaría una igualdad perfecta (todos ganan lo mismo), mientras que un valor de 1 significaría que una sola persona concentra todos los ingresos. Por lo tanto, este valor permite afirmar numéricamente que la distribución de ingresos en esta población es considerablemente desigual. Ejemplo 3.3.3:
La Curva de Lorenz es una herramienta gráfica fundamental para visualizar la distribución del ingreso (o la riqueza) dentro de una población. Compara la distribución real con un escenario de igualdad perfecta.
La Línea de Igualdad Perfecta (la diagonal de 45°) representa un mundo ideal donde el 10 % de la población posee el 10 % de los ingresos, el 50 % posee el 50 %, etc.
La Curva de Lorenz muestra la realidad: qué porcentaje acumulado de los ingresos posee qué porcentaje acumulado de la población (ordenada de la que menos posee a la que más posee).
Cuanto más se ”aleja” o ”se curva” la Curva de Lorenz de la línea de igualdad, mayor es la desigualdad en esa sociedad.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [94] Regresar
3.3.5.
Medidas de correlación Las medidas de correlación permiten evaluar el grado de asociación y la dirección de la relación entre dos variables aleatorias. Una correlación positiva indica que al aumentar una variable, la otra tiende a aumentar, mientras que una correlación negativa refleja que al Interpretación del Gráfico En la figura 3.23, se comparan tres países ficticios:
País A (Equitativo): su curva está muy cerca de la línea de igualdad. Muestra una distribución de ingresos muy pareja.
País B (Moderado): muestra una desigualdad notable, una situación común en muchas economías reales.
País C (Desigual): su curva está muy alejada de la diagonal, indicando que un pequeño porcentaje de la población acumula una gran parte del ingreso total.
0.0
0.2
0.4
0.6
0.8
1.0
Proporción Acumulada de Población (de más pobre a más rica)
0.0
0.2
0.4
0.6
0.8
1.0
Proporción Acumulada de Ingresos Curvas de Lorenz y Desigualdad de Ingresos Igualdad Perfecta (Gini = 0) País A (Equitativo) - Gini: 0.088 País B (Moderado) - Gini: 0.326 País C (Desigual) - Gini: 0.455 Fig. 3.23. Curvas de Lorenz para tres países con diferentes niveles de desigualdad de ingresos El Coeficiente de Gini es la medida numérica de esta desigualdad (Gini = 0 es igualdad perfecta, Gini = 1 es desigualdad total). Como complemento a la visualización, la tabla VI resume los Coeficientes de Gini calculados para cada país. Estos valores confirman numéricamente lo que las curvas muestran visualmente.
TABLA VI.
COEFICIENTES DE GINI CALCULADOS
País Coeficiente de Gini (Aprox.) País A (Equitativo)
0.088
País B (Moderado)
0.326
País C (Desigual)
0.455
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [95] Regresar aumentar una variable la otra tiende a disminuir. Es importante señalar que la correlación no implica causalidad, sino solo dependencia estadística.
Coeficiente de correlación de Pearson: es la medida de correlación más utilizada cuando ambas variables son cuantitativas y presentan una relación lineal. Su valor oscila entre −1 y 1, donde valores cercanos a 1 indican una fuerte correlación positiva, cercanos a −1 una fuerte correlación negativa y valores cercanos a 0 indican ausencia de correlación lineal.
Su fórmula se define como:
r = ∑(xi −¯x)(yi −¯y)
∑(xi −¯x)2 ∑(yi −¯y)2 donde:
• xi: valores de la primera variable (por ejemplo, horas de estudio).
• yi: valores de la segunda variable (por ejemplo, calificaciones).
• ¯x: media aritmética de los valores xi.
• ¯y: media aritmética de los valores yi.
• ∑: sumatoria sobre todas las observaciones de la muestra.
Para el análisis exploratorio de datos, el coeficiente de correlación de Pearson es una de las herramientas iniciales para identificar patrones de asociación lineal entre variables antes de aplicar modelos más complejos; su interpretación debe realizarse con cautela, considerando tanto el valor numérico del coeficiente como la naturaleza de los datos analizados, ya que una correlación elevada no garantiza una relación funcional ni causal. Por esta razón, el análisis de correlación suele complementarse con representaciones gráficas, como diagramas de dispersión, y con otras técnicas estadísticas que permitan validar y profundizar en la relación observada entre las variables de estudio.
Ejemplo 3.3.4:
Relación entre horas de estudio y calificaciones (Pearson):
En la tabla VII se muestran los datos de un grupo de estudiantes. Se desea analizar si existe relación entre las horas de estudio y las calificaciones.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [96] Regresar
TABLA VII.
CALIFICACIONES POR HORAS DE ESTUDIO
Horas de estudio (xi) Calificación (yi)
2
50
3
55
4
60
5
68
6
72
7
78
8
85
Solución:
1. Calcular medias:
¯x = 2 + 3 + 4 + 5 + 6 + 7 + 8
7
= 5
,
¯y = 50 + 55 + 60 + 68 + 72 + 78 + 85
7
≈66.86
2. Sustituir en la fórmula de Pearson:
r = ∑(xi −¯x)(yi −¯y)
∑(xi −¯x)2 ∑(yi −¯y)2
3. Cálculos intermedios:
∑(xi −¯x)(yi −¯y) = 146 ∑(xi −¯x)2 = 28
,
∑(yi −¯y)2 ≈764.86
4. Resultado:
r ≈
146
√
28 · 764.86
≈0.991 Interpretación: existe una fuerte correlación positiva, lo que confirma que a mayor número de horas de estudio, mejores son las calificaciones. La figura 3.24 visualiza este resultado.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [97] Regresar son) Fig. 3.24. Relación entre horas de estudio y calificaciones (Correlación de Pear Coeficiente de correlación de Spearman: es un coeficiente no paramétrico que mide la correlación entre dos variables ordinales o cuando los datos no cumplen los supuestos de normalidad. Se basa en los rangos de los datos en lugar de los valores originales, por lo que resulta útil para identificar relaciones monótonas (crecientes o decrecientes) sin requerir linealidad estricta.
Su fórmula es:
ρ = 1 −
6 ∑d2
i n(n2 −1) donde di es la diferencia de rangos entre los pares de datos y n el número de observaciones.
Ejemplo 3.3.5:
Relación entre puesto en una competencia y rendimiento (Spearman):
En la tabla VIII se presentan los resultados de una competencia.
TABLA VIII.
PUESTO EN COMPETENCIA SEGÚN RENDIMIENTO
Puesto (xi) Rendimiento (yi)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [98] Regresar Solución:
1. Asignar rangos: en este caso los datos ya están ordenados.
2. Calcular diferencias de rangos di: Ejemplo: para x1 = 1, y1 = 95 ⇒rango 1 en
ambos ⇒d1 = 0. Todos los pares siguen la misma relación decreciente, por lo que:
∑d2 i = 0
3. Sustituir en la fórmula de Spearman:
ρ = 1 −
6 · 0
7(72 −1) = 1 −0 = −1 Interpretación: existe una correlación negativa perfecta: cuanto mejor es el puesto (menor valor), mayor es el rendimiento, como lo muestra la figura 3.25.
1
2
3
4
5
6
7
Puesto en competencia
50
60
70
80
90
100
Rendimiento Correlación de Spearman Datos Línea de tendencia Fig. 3.25. Relación entre puesto en la competencia y rendimiento (Correlación de Spearman) Coeficiente de correlación de Kendall: también es no paramétrico, se centra en el análisis de concordancia y discordancia entre pares de observaciones. Evalúa la fuerza de asociación entre dos variables ordinales o cuando se trabaja con muestras pequeñas y con presencia de empates. Sus valores también oscilan entre −1 y 1, aunque suele ser más conservador que Spearman.i
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [99] Regresar Su fórmula se define como:
τ = (Nc −Nd)
1
2n(n −1) donde Nc es el número de pares concordantes, Nd el número de pares discordantes y n el número de observaciones.
Ejemplo 3.3.6:
Relación entre satisfacción laboral y productividad (Kendall): En la tabla IX se presentan los datos de un grupo de empleados evaluados en satisfacción y productividad.
TABLA IX.
SATISFACCIÓN LABORAL Y PRODUCTIVIDAD EN UN GRUPO DE EMPLEADOS
Satisfacción (xi) Productividad (yi)
5
5
4
4
4
3
3
3
2
2
2
1
1
1
Solución:
1. Número total de pares posibles:
n(n −1)
2
= 7(6)
2
= 21
2. Contar pares concordantes (Nc = 18) y discordantes (Nd = 1).
3. Sustituir en la fórmula:
τ = 18 −1
21
= 17
21 ≈0.81
Interpretación: existe una correlación positiva muy fuerte: los empleados con mayor satisfacción tienden a presentar mayor productividad. Esta resultado se muestra en la figura 3.26.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [100] Regresar
1.0
1.5
2.0
2.5
3.0
3.5
4.0
4.5
5.0
Satisfacción laboral
1
2
3
4
5
Productividad Correlación de Kendall ( ) Datos Línea de tendencia Fig. 3.26. Relación entre satisfacción laboral y productividad (Correlación de Kendall) Estas medidas anteriores proporcionan herramientas para determinar la intensidad y dirección de las relaciones entre variables, siendo fundamentales en el análisis exploratorio de datos y en la construcción de modelos predictivos.
Visualizaciones para distribución de datos y estadística inferencial Capítulo 4
[105] Regresar En este capítulo, se exploran las estrategias fundamentales de la estadística inferencial, ofreciendo un detallado análisis sobre su simbolización y formalización. Se aborda la clasificación de los dos tipos principales de estadística inferencial: la basada en hipótesis y la de regresión. Además, se profundiza en la importancia de la visualización en estadística como una herramienta indispensable para representar datos de manera gráfica, permitiendo identificar patrones, tendencias y relaciones entre variables. En este contexto, se introduce el concepto de análisis inferencial, que va más allá de la simple descripción de datos para adentrarse en la inferencia. Se destacan los componentes esenciales de este análisis, entre ellos la formulación de hipótesis, que puede ser nula, negando la existencia de efecto o relación, o alternativa, afirmándola.
Como parte central, se muetsra la visualización en estadística como una técnica que permite representar datos de manera gráfica para comprender patrones, tendencias y relaciones. A través de gráficos y diagramas, se puede visualizar la distribución de los datos, identificar valores atípicos y explorar la relación entre variables. Uno de los enfoques más interesantes en la visualización estadística es el análisis inferencial. Aquí, se busca ir más allá de la simple descripción de los datos para adentrarse en la inferencia: el proceso de sacar conclusiones sobre una población a partir de una muestra. En relación con el planteamiento de hipótesis, se tienen los siguientes pasos: Paso 1: formular una hipótesis. Todo análisis comienza con una pregunta, la cual se formaliza en una hipótesis. La hipótesis nula (H0) afirma que no hay efecto o relación, mientras que la hipótesis alternativa (H1) sostiene lo contrario. Por ejemplo, al estudiar si
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [106] Regresar la edad se relaciona con los ingresos, la hipótesis nula diría que no hay conexión alguna. Gráficamente, estas dos ideas representan escenarios opuestos, como se ilustra en la figura 4.1.
20
30
40
50
60
70
80
Variable X
20
30
40
50
Variable Y Hipótesis Alternativa (Sí hay una relación)
20
30
40
50
60
70
80
Variable X
10
20
30
40
50
60
Variable Y Hipótesis Nula (No hay relación) Visualización de Hipótesis Estadísticas Fig. 4.1. Diferencia visual entre la hipótesis alternativa (izquierda), que sugiere una relación, y la hipótesis nula (derecha), que no muestra un patrón aparente Paso 2: modelar la relación con regresión. Una vez formulada la hipótesis, se recurre a técnicas como el análisis de regresión para modelar la posible relación entre las variables. El uso de regresión lineal es común en este proceso, como se observa en la figura 4.2. Fig. 4.2. Gráfico de dispersión con línea de regresión lineal
20
30
40
50
60
70
Edad
30000
35000
40000
45000
50000
55000
nivel de ingresos
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [107] Regresar A través de la regresión, se calculan los coeficientes que explican cómo una variable dependiente se vincula con una o más variables independientes. Además, la selección de variables independientes es importante para construir un modelo predictivo sólido. Así mismo, realizar pruebas de significancia es fundamental para evaluar si los efectos observados son estadísticamente válidos o si podrían atribuirse al azar. Paso 3: Inferir a partir de la correlación. El resultado de una regresión a menudo se resume en una correlación, una medida estadística que describe la fuerza y dirección de la relación entre dos variables. Si se descubre una correlación significativa en la muestra, la inferencia permite generalizar esa conclusión a toda la población. La correlación puede ser: Positiva: ambas variables tienden a aumentar juntas.
Negativa: una variable tiende a aumentar mientras la otra disminuye. Nula: no hay una relación aparente.
La figura 4.3 ilustra estos tres escenarios. Este paso de inferencia es crucial, pues permite que los hallazgos de una muestra informen decisiones y estrategias en un contexto mucho más amplio.
0
2
4
6
8
10
Variable 1
0
2
4
6
8
10
12
Variable 2 Correlación Positiva
0
2
4
6
8
10
Variable 1
10
8
6
4
2
0
2
Variable 2 Correlación Negativa
0
2
4
6
8
10
Variable 1
8
6
4
2
0
2
4
6
Variable 2 Correlación Nula Tipos de Correlación Fig. 4.3. Ejemplos gráficos de correlación: positiva, negativa y nula
4.1.
VISUALIZACIONES PARA DISTRIBUCIÓN DE DA-
TOS
Los conjuntos de datos, presentados en tablas o formato numérico, son la materia prima del análisis, pero rara vez revelan sus secretos a simple vista. La visualización es el proceso que
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [108] Regresar Proyecto / Empresa Clientes Empleados Inversores Comunidad Proveedoresl Fig. 4.4. Diagrama de Stakeholders: diversas partes interesadas que influyen y son afectadas por un proyecto central Ejemplo 4.1.1:
Caso de estudio: dataset Zoo.
Para ilustrar la importancia de la visualización, se utiliza el conjunto de datos Zoo disponible en Zoo UCI [10], este contiene 101 animales y sus características. El desafío de los datos crudos: la tabla X muestra una porción de estos datos. Aunque la información es completa, responder preguntas como ¿cuál es el tipo de animal más común? o ¿tener pelo se relaciona con producir leche? requiere un esfuerzo considerable de lectura y conteo.
transforma estos datos crudos en una forma gráfica comprensible, permitiendo identificar patrones, tendencias, distribuciones y anomalías de manera intuitiva. Un buen gráfico no solo comunica un hallazgo, sino que también capta la atención y facilita la comprensión a una amplia audiencia, incluyendo a aquellos sin formación técnica, como los stakeholders o partes interesadas en un proyecto.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [109] Regresar ID animal_name hair feathers eggs milk airborne aquatic predator toothed backbone breathes venomous fins legs tail domestic catsize class_type
0
aardvark
1
0
0
1
0
0
1
1
1
1
0
0
4
0
0
1
1
1
antelope
1
0
0
1
0
0
0
1
1
1
0
0
4
1
0
1
1
2
bass
0
0
1
0
0
1
1
1
1
1
0
1
0
1
0
0
4
3
bear
1
0
0
1
0
0
1
1
1
1
0
0
4
0
0
1
1
4
boar
1
0
0
1
0
0
1
1
1
1
0
0
4
1
0
1
1
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
96
wallaby
1
0
0
1
0
0
0
1
1
1
0
0
2
1
0
1
1
97
wasp
1
0
1
0
1
0
0
0
0
1
1
0
6
0
0
0
6
98
wolf
1
0
0
1
0
0
1
1
1
1
0
0
4
1
0
1
1
99
worm
0
0
1
0
0
0
0
0
0
1
0
0
0
0
0
0
7
100
wren
0
1
1
0
1
0
0
0
1
1
0
0
2
1
0
0
2
TABLA X.
DATOS DEL CONJUNTO DE DATOS ZOO
Análisis visual exploratorio: en lugar de examinar la tabla, se realiza un análisis visual para extraer información relevante de forma rápida.
1. ¿Cómo se distribuyen los animales? La primera pregunta que se puede responder
es cuántos animales hay en cada tipo de clase. Un gráfico de barras es ideal para esto, ya que representa la frecuencia de categorías discretas.
1
2
3
4
5
6
7
Tipo de clase
0
5
10
15
20
25
30
35
40
Frecuencia Distribución de la variable "class_type" Fig. 4.5. Distribución de frecuencia de los tipos de clases. Un gráfico de barras que muestra el recuento de animales en cada categoría La figura 4.5 muestra la distribución de los animales en las siete clases definidas: Clase 1 (Mamíferos), Clase 2 (Aves), Clase 3 (Reptiles), Clase 4 (Peces), Clase 5 (Anfibios), Clase 6 (Insectos) y Clase 7 (Invertebrados, excluyendo insectos). Como se observa en el gráfico, la Clase 1 (mamíferos) es la más numerosa.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [110] Regresar
3. ¿Qué revela una relación específica? El mapa de calor da pistas, pero un gráfico de
dispersión permite investigar una relación específica en detalle. La figura 4.7 relaciona hair feathers eggs milk airborne aquatic predator toothed backbone breathes venomous fins legs tail domestic catsize class_type hair feathers eggs milk airborne aquatic predator toothed backbone breathes venomous fins legs tail domestic catsize class_type
1
-0.43-0.82 0.88 -0.2 -0.47-0.15 0.49 0.19 0.44 -0.1 -0.28 0.390.0490.21 0.46 -0.56
-0.43
1
0.42 -0.41 0.66-0.059-0.1 -0.61 0.23 0.25 -0.15-0.22-0.21 0.290.032-0.14 -0.2
-0.82 0.42
1
-0.94 0.38 0.380.012-0.64-0.34-0.380.0990.16 -0.22-0.22-0.16-0.51 0.66
0.88 -0.41-0.94
1
-0.37-0.36-0.03 0.63 0.38 0.42 -0.24-0.16 0.21 0.21 0.16 0.57 -0.72
-0.2 0.66 0.38 -0.37
1
-0.17 -0.3 -0.59 -0.1 0.290.0085-0.250.0440.00950.063-0.350.023
-0.47-0.0590.38 -0.36-0.17
1
0.380.0530.022-0.640.088 0.6 -0.36-0.035-0.22-0.11 0.33
-0.15 -0.1 0.012-0.03 -0.3 0.38
1
0.130.051-0.26 0.12 0.19 -0.1 0.019-0.31 0.140.061
0.49 -0.61-0.64 0.63 -0.590.0530.13
1
0.58-0.066-0.0620.36 -0.19 0.310.0690.34 -0.47
0.19 0.23 -0.34 0.38 -0.1 0.0220.0510.58
1
0.21 -0.25 0.21 -0.43 0.73 0.1 0.36 -0.83
0.44 0.25 -0.38 0.42 0.29 -0.64-0.26-0.0660.21
1
-0.12-0.62 0.370.0890.12 0.2 -0.52
-0.1 -0.150.099-0.240.00850.0880.12-0.062-0.25-0.12
1 -0.0340.023-0.16-0.0033-0.18 0.32
-0.28-0.22 0.16 -0.16-0.25 0.6 0.19 0.36 0.21 -0.62-0.034 1
-0.61 0.2 -0.0940.0320.099
0.39 -0.21-0.22 0.210.044-0.36 -0.1 -0.19-0.43 0.370.023-0.61
1
-0.350.0740.0690.13
0.0490.29 -0.22 0.210.0095-0.0350.0190.31 0.730.089-0.16 0.2 -0.35
1
0.0230.24 -0.63
0.210.032-0.16 0.160.063-0.22-0.310.069 0.1 0.12-0.0033
-0.0940.0740.023
1
0.02 -0.18
0.46 -0.14-0.51 0.57 -0.35-0.11 0.14 0.34 0.36 0.2 -0.180.0320.0690.24 0.02
1
-0.52
-0.56 -0.2 0.66 -0.720.0230.330.061-0.47-0.83-0.52 0.320.0990.13 -0.63-0.18-0.52
1
Mapa de calor: correlación entre variables
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Fig. 4.6. Mapa de calor de correlación. Se observa una fuerte relación positiva entre tener pelo (hair) y producir leche (milk), una característica clave de los mamíferos
2. ¿Cómo se relacionan las características entre sí? Para obtener una vista panorámica
de las relaciones entre todas las variables, un mapa de calor es una excelente herramienta. La figura 4.6 visualiza la correlación de Pearson entre las características. Los colores cálidos (cercanos a 1) indican una correlación positiva fuerte (ej., milk y hair), mientras que los colores fríos (cercanos a -1) indican una correlación negativa.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [111] Regresar el tipo de clase con el número de patas. El gráfico muestra que no existe una tendencia lineal simple, pero sí revela patrones estructurales: la clase 6 (insectos) siempre tiene 6 patas, y la clase 4 (peces) siempre tiene 0.
Fig. 4.7. Dispersión de clase animal vs. número de patas. Aunque no hay una tendencia lineal, se observan agrupaciones claras por clase
1
2
3
4
5
6
7
Tipo de clase
0
1
2
3
4
5
6
7
8
Número de patas Gráfico de dispersión categórico: tipo de clase vs número de patas Entendiendo la distribución de variables numéricas:
mientras que un gráfico de barras es ideal para categorías, un histograma es la herramienta por excelencia para entender la distribución de una variable numérica continua (ej. peso, altura). Para construirlo, los datos se agrupan en intervalos o "bins". La Regla de Sturges es una fórmula clásica para estimar un número adecuado de bins:
k = 1 + log2(n) donde k es el número de bins y n es el número de observaciones. Para una muestra de
100 animales, k = 1 + log2(100) ≈7.64, sugiriendo 7 u 8 bins. La figura 4.8 muestra un
histograma de un conjunto de datos sintético sobre el peso de los animales, aplicando esta regla.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [112] Regresar
0
50
100
150
200
Peso (kg)
0
10
20
30
40
50
Frecuencia (Nº de animales) Distribución de Pesos de Animales (Datos Sintéticos) Fig. 4.8. Ejemplo de un histograma que muestra la distribución de los pesos (datos sintéticos) de 100 animales, utilizando 7 bins según la Regla de Sturges Los gráficos de barras, mapas de calor y de dispersión son, sin duda, los pilares del análisis visual. Son herramientas esenciales que permiten convertir tablas de datos en conocimiento claro y responder a las primeras preguntas. Sin embargo, su verdadera limitación aparece cuando la complejidad de los datos aumenta. Estos gráficos son excelentes para comparar dos o tres variables, pero ¿cómo se puede visualizar la interacción simultánea de múltiples características o representar datos con estructuras complejas?
En la próxima sección, se explora un conjunto de visualizaciones avanzadas, diseñadas para desenredar estas complejidades y permitir contar historias más completas y profundas con los datos.
Tipos de visualizaciones utilizadas en la distribución de datos: las técnicas de visualización de datos son esenciales para transformar grandes volúmenes de información en gráficos intuitivos y comprensibles. Su objetivo principal es revelar patrones, tendencias y anomalías ocultas en los datos, permitiendo comunicar hallazgos complejos de forma clara y efectiva.
Esta capacidad de convertir números en una historia visual es crucial para la toma de decisiones estratégicas en cualquier industria. A continuación, en las figuras 4.9 a 4.15 se
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [113] Regresar presentan los tipos de visualizaciones más comunes, cada uno diseñado para un propósito específico.
Infografías Combinan imágenes, gráficos y texto para presentar información de una manera visualmente atractiva y fácil de entender. Están diseñadas para que la visualización sea clara y llamativa, y se utilizan ampliamente en diversas industrias para comunicar datos complejos de forma concisa e impactante. Fig. 4.9. Infografías Mapas Son particularmente útiles para mostrar datos con un componente geográfico, como ventas, clientes o distribuciones de población. Los mapas pueden resaltar qué ubicaciones son más importantes para un negocio, proporcionando información sobre estrategias de ventas y eficacia del marketing.
Fig. 4.10. Mapas Gráficos de área (Area charts) Representan los cambios en una o más cantidades a lo largo del tiempo, similares a los gráficos de línea pero con el área entre el eje x y la línea rellenada con color. Esto da una idea del volumen total y son útiles para mostrar tendencias a lo largo del tiempo. Fig. 4.11. Gráficos de área
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [114] Regresar Gráficos piramidales (Pyramid graphs) Son gráficos de forma triangular o piramidal que son fáciles de leer y se utilizan mejor para mostrar jerarquías u órdenes progresivos, como de más a menos importante o de específico a general.
Fig. 4.12. Gráficos piramidales Treemaps Muestran datos jerárquicos utilizando rectángulos anidados, donde los datos se organizan en ramas y subramas. Son compactos y eficientes en espacio, mostrando cantidades para cada categoría y subcategoría mediante el tamaño del área del rectángulo.
Fig. 4.13. Treemaps Gráficos de línea (Line graphs) Son populares para mostrar tendencias a lo largo del tiempo, conectando puntos de datos con líneas rectas. Son útiles para representar tendencias para diferentes categorías durante el mismo período y para comparaciones. Fig. 4.14. Gráficos de línea
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [115] Regresar Dendrogramas Son diagramas en forma de árbol que muestran la disposición de los clústeres obtenidos mediante un proceso de agrupamiento jerárquico. Cada hoja representa un dato individual, y las ramas muestran cómo se van combinando los elementos en grupos más grandes a medida que aumenta la disimilitud entre ellos.
Obs4 Obs5 Obs3 Obs1 Obs2 Observaciones
0
2
4
6
8
10
12
Distancia Dendrograma (Endograma) Fig. 4.15. Dendrogramas Cada uno de estos tipos de visualización sirve a un propósito específico y puede ser elegido en función del tipo de datos presentados y las ideas que se necesitan transmitir. La elección de la visualización es crucial para garantizar que los datos se presenten de una manera que sea fácil de entender y que se pueda actuar sobre ellos. Para seleccionar el gráfico adecuado, primero se define qué mostrar con los datos. Luego, se considera la audiencia y el volumen de la información.
TABLA XI.
GUÍA PARA LA SELECCIÓN DE VISUALIZACIONES DE DATOS
El objetivo es...
Pregunta...
Visualizaciones recomendadas Comparar valores ¿Se desea ver cuál es más grande o más pequeño?
Gráficos de barras, diagramas de caja, diagramas de violín. Mostrar tendencias ¿Cómo ha cambiado algo a lo largo del tiempo?
Gráficos de líneas, gráficos de área.
Ver la distribución ¿Cómo se agrupan o reparten los datos?
Numéricos: Histogramas, gráficos de densidad.
Categóricos: Gráficos de barras.
Analizar la composición ¿Qué partes forman un total? Gráficos circulares (torta), treemaps, gráficos de área apilados.
Explorar relaciones ¿Cómo se influyen dos o más variables entre sí?
Gráficos de dispersión, gráficos de burbujas, mapas de calor.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [116] Regresar Otros factores clave a considerar Audiencia: ¿Quién lo verá? Usar gráficos simples (barras, líneas) para audiencias generales y gráficos más complejos (mapas de calor, diagramas de violín) para públicos especializados.
Volumen de Datos: ¿Cuánta información se tiene? Para grandes volúmenes, los gráficos de densidad o mapas de calor evitan la saturación visual. Para datos pequeños, los gráficos de dispersión o de barras pueden mostrar cada punto con claridad. Ejemplo 4.1.2:
Se analiza la distribución de la longitud del pico (culmen) en un dataset de pingüinos disponible en Palmer Penguins [11], utilizando diferentes gráficos para comparar qué información revela cada uno.
Insight Un insight hace referencia a una conclusión, hallazgo o comprensión profunda que se obtiene a partir del análisis de los datos. En este contexto, los insights ayudan a identificar patrones, tendencias o anomalías que pueden ser útiles para la toma de decisiones.
1. Gráfico de densidad: la vista general y detallada
Un gráfico de densidad suaviza un histograma para mostrar la forma de la distribución de datos numéricos. Es ideal para ver dónde se concentran los valores.
30
35
40
45
50
55
60
65
Longitud del Culmen (mm)
0.00
0.01
0.02
0.03
0.04
0.05
0.06
Densidad Densidad de la Longitud del Culmen en Todos los Pingüinos Fig. 4.16. Densidad para todos los pingüinos
30
35
40
45
50
55
60
Longitud del Culmen (mm)
0.00
0.01
0.02
0.03
0.04
0.05
Densidad Densidad de la Longitud del Culmen por Especie Especie Fig. 4.17. Densidad separada por especie
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [117] Regresar Insight del gráfico general (izquierda): la figura 4.16 muestra dos ”picos” de concentración, sugiriendo que los datos no son uniformes. Podría haber subgrupos ocultos.
Insight del gráfico por especie (derecha): al separar por especie, se confirma los subgrupos. Se observa claramente en la figura 4.17 que cada especie tiene una distribución de longitud de pico distinta y característica.
2. Gráfico Ridgeline: comparación compacta
Este gráfico, también llamado Joyplot, es excelente para comparar la distribución de una variable a través de múltiples categorías, apilándolas de forma compacta y visualmente atractiva.
30
35
40
45
50
55
60
Longitud del Pico (mm) / bill_length_mm Adelie Gentoo Chinstrap Distribución de Longitud del Pico (Ridgeline) Fig. 4.18. Ridgeline de la longitud del pico por especie Insight: el gráfico Ridgeline que se observa en la figura 4.18 mejora la comparación del gráfico de densidad. Muestra de forma muy limpia que la especie Gentoo tiene los picos más largos, mientras que Adelie y Chinstrap tienen rangos más similares, aunque con picos de concentración diferentes.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [118] Regresar
3. Gráfico de barras horizontales: resumen comparativo
A diferencia de los gráficos de distribución, las barras horizontales son perfectas para comparar una métrica específica (como el promedio o el valor máximo) entre categorías.
0
10
20
30
40
50
Longitud del Culmen (mm) Gentoo Chinstrap Adelie Gentoo Longitud del Culmen Chinstrap Longitud del Culmen Adelie Longitud del Culmen Fig. 4.19. Comparación de la longitud del pico entre especies Insight: el gráfico de la figura 4.19 simplifica la comparación a un solo vistazo. Confirma de manera directa que, en promedio, la especie Gentoo tiene la mayor longitud de pico, seguida por Chinstrap y finalmente Adelie. Es menos detallado pero más directo para rankings.
4. Histograma: frecuencia en intervalos
El histograma agrupa los datos en bins o intervalos y muestra la frecuencia de observaciones en cada uno. La línea superpuesta suaviza la distribución, combinando la precisión del histograma con la claridad de un gráfico de densidad. Insight: al igual que el primer gráfico de densidad, el histograma muestra la distribución general y sus dos picos principales, confirmando que la mayoría de las longitudes de pico se agrupan en rangos específicos. Es una de las formas más estándar y honestas de ver la distribución cruda.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [119] Regresar Ejemplo 4.1.3:
Visualización y análisis de incendios forestales.
Para predecir y gestionar el riesgo de incendios forestales, es crucial entender las condiciones ambientales que los propician. Este ejemplo explora un conjunto de datos sobre incendios ocurridos en el noreste de Portugal, disponible en Kaggle Datasets [12]. Este dataset es particularmente rico, ya que combina mediciones meteorológicas directas con una serie de índices especializados del prestigioso Sistema Canadiense de Índice de Clima para Incendios Forestales (FWI). El objetivo de este análisis es usar la visualización de datos para descubrir patrones y relaciones entre estas variables. Las variables clave que se exploran son:
Variables meteorológicas básicas: temperatura (temp), humedad relativa (RH) y velocidad del viento (wind).
Índices del sistema FWI: códigos que miden la humedad del combustible en diferentes capas del suelo (FFMC, DMC, DC), un índice que estima la velocidad de propagación inicial (ISI) y un índice general de riesgo (FWI).
35
40
45
50
55
60
Longitud del Culmen (mm)
0
5
10
15
20
25
30
35
Frecuencia Fig. 4.20. Histograma de todas las longitudes de pico A través de un análisis visual multifacético, que va desde histogramas hasta proyecciones de datos, se busca las condiciones típicas que caracterizan a los incendios en esta región.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [120] Regresar Distribución de la temperatura: en la figura 4.21 se presenta un histograma de la temperatura. Este gráfico permite identificar con qué frecuencia ocurren determinados rangos de temperatura durante los incendios. Se observa que la mayoría de los eventos se concentran en un rango medio, lo que sugiere que los incendios suelen ocurrir bajo condiciones específicas de temperatura.
5
10
15
20
25
30
temp
0
10
20
30
40
5
15
25
35
Frequency Fig. 4.21. Histograma de temperaturas registradas en incendios forestales Temperatura promedio mensual: en la figura 4.22 se representan las temperaturas promedio registradas en cada mes. Este gráfico de barras permite identificar patrones estacionales, evidenciando los meses más cálidos y con mayor probabilidad a la ocurrencia de incendios.
Solución:
apr aug dec feb jan jul jun mar may nov oct sep Mes
0
5
10
15
20
Temperatura (°C) Temperatura Promedio por Mes Fig. 4.22. Temperatura promedio mensual en incendios forestales
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [121] Regresar Distribución del índice DC: la figura 4.23 muestra un diagrama de caja (boxplot) del índice DC (Drought Code), que mide la sequedad del suelo. Se observa una gran dispersión y presencia de valores atípicos, lo que indica que en algunos incendios las condiciones de sequía fueron significativamente más extremas.
300
400
500
600
700
800
900
DC
547.940 ± 247.83
Fig. 4.23. Diagrama de caja del índice de sequía DC en incendios forestales Relación entre temperatura y área afecta: la figura 4.24 presenta un gráfico de dispersión donde se relaciona la temperatura con el área afectada. Aunque la mayoría de los incendios presentan áreas pequeñas independientemente de la temperatura, se aprecian algunos casos extremos de grandes áreas quemadas en temperaturas más elevadas. Esto sugiere que la temperatura puede ser un factor de riesgo importante para la magnitud del incendio.
0.0 - 5.0
5.0 - 10.0
10.0 - 15.0
15.0 - 20.0
20.0 - 25.0
25.0 - 30.0
30.0 - 35.0
5
10
15
20
25
30
temp
0
200
400
600
800
1000
area Fig. 4.24. Relación entre temperatura y área afectada en incendios forestales
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [122] Regresar Evolución temporal: en la figura 4.25 se observa un gráfico de líneas con la evolución de las variables ambientales a lo largo del tiempo. Este tipo de representación es útil para detectar tendencias o patrones recurrentes en los datos. apr aug dec feb jan jul jun mar may nov oct sep Y
DMC
ISI
RH rain X
FFMC
DC temp wind area
0
200
400
600
800
1000
Fig. 4.25. Gráfico de líneas mostrando la evolución temporal de los incendios forestales Correlación entre variables ambientales: la figura 4.26 muestra un mapa de calor de correlaciones entre variables numéricas del dataset, como temperatura, humedad relativa (RH), velocidad del viento y área quemada. Los colores permiten identificar asociaciones lineales: por ejemplo, la temperatura tiende a correlacionarse de manera positiva con el área, mientras que la humedad muestra correlaciones negativas.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [123] Regresar X Y
FFMC DMC
DC
ISI
temp RH wind rain area X Y
FFMC
DMC
DC
ISI
temp RH wind rain area
1.00
0.54
-0.02 -0.05 -0.09
0.01
-0.05
0.09
0.02
0.07
0.06
0.54
1.00
-0.05
0.01
-0.10 -0.02 -0.02
0.06
-0.02
0.03
0.04
-0.02 -0.05
1.00
0.38
0.33
0.53
0.43
-0.30 -0.03
0.06
0.04
-0.05
0.01
0.38
1.00
0.68
0.31
0.47
0.07
-0.11
0.07
0.07
-0.09 -0.10
0.33
0.68
1.00
0.23
0.50
-0.04 -0.20
0.04
0.05
0.01
-0.02
0.53
0.31
0.23
1.00
0.39
-0.13
0.11
0.07
0.01
-0.05 -0.02
0.43
0.47
0.50
0.39
1.00
-0.53 -0.23
0.07
0.10
0.09
0.06
-0.30
0.07
-0.04 -0.13 -0.53
1.00
0.07
0.10
-0.08
0.02
-0.02 -0.03 -0.11 -0.20
0.11
-0.23
0.07
1.00
0.06
0.01
0.07
0.03
0.06
0.07
0.04
0.07
0.07
0.10
0.06
1.00
-0.01
0.06
0.04
0.04
0.07
0.05
0.01
0.10
-0.08
0.01
-0.01
1.00
Mapa de Calor de Correlaciones
0.4
0.2
0.0
0.2
0.4
0.6
0.8
1.0
Fig. 4.26. Mapa de calor de correlaciones entre variables ambientales en incendios forestales Proyección lineal: la figura 4.27 muestra una proyección lineal aplicada al dataset. Esta técnica permite reducir la dimensionalidad de los datos y visualizar cómo se agrupan los incendios según variables clave como ISI, FWI, DMC, RH y DC. Los colores representan distintas agrupaciones de incendios en función de sus características ambientales.
ISI
FFMC
DMC
RH DC
0.0 - 50.0
50.0 - 100.0
100.0 - 150.0
150.0 - 200.0
200.0 - 250.0
250.0 - 300.0
Fig. 4.27. Proyección lineal de variables ambientales en incendios forestales
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [124] Regresar
4.2.
ESTADÍSTICA INFERENCIAL
La estadística inferencial es la disciplina que permite sacar conclusiones y hacer predicciones sobre una gran población a partir del análisis de un subconjunto de datos más pequeño, conocido como muestra. Para que estas inferencias sean válidas, es fundamental que la muestra sea representativa; es decir, que sus características reflejen fielmente las de la población total.
La visualización de datos es un aliado clave en este proceso, ya que ayuda a comprender y comunicar los resultados del análisis de manera mucho más efectiva.
4.2.1.
Concepto y aplicación La principal utilidad de la estadística inferencial es ir más allá de los datos que se ven. Sus aplicaciones más comunes incluyen:
Estimación de parámetros: calcular características de una población (como la media o la varianza) basándose en una muestra.
Pruebas de hipótesis: evaluar si una afirmación sobre la población es estadísticamente significativa o si los resultados observados podrían deberse al azar. El beneficio es claro, permite generalizar hallazgos con mayor precisión y fundamentar la toma de decisiones en evidencia estadística, en lugar de solo en la intuición. Comprender la diferencia entre la población total y la muestra seleccionada es crucial. Como se observa en la figura 4.28, una población contiene todos los elementos de interés, mientras que una muestra es solo una fracción de ella.
El análisis de la figura deja un insight clave: la selección de la muestra lo es todo. Una muestra no representativa puede conducir a conclusiones erróneas, mientras que una muestra representativa (idealmente seleccionada al azar) captura la diversidad de la población y es la piedra angular para hacer inferencias precisas y confiables. Herramientas como los histogramas, también son útiles para comparar visualmente la distribución de la muestra con la de la población y verificar su similitud.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [125] Regresar Muestra Representativa Muestra No representativa Muestra Simple Fig. 4.28. Tipos de muestras extraídas de una población Ejemplo 4.2.1:
La Importancia del Muestreo y la Evaluación de la Distribución Para cualquier análisis estadístico, especialmente si se busca realizar inferencias basadas en desviaciones estándar, es fundamental comprender la distribución de la variable de interés y confirmar su comportamiento (idealmente, una distribución normal). Este proceso se ilustra a continuación mediante el uso de un conjunto de datos multivariado que incluye las variables X e Y.
Exploración de la Población: la figura 4.29 presenta la totalidad de las observaciones de las variables X e Y, cuya densidad en el espacio bidimensional resulta visualmente densa. En escenarios con un gran volumen de datos, el análisis exploratorio de cada observación individual se vuelve impráctico. Por ello, la selección de una muestra
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [126] Regresar representativa se convierte en una etapa crucial para reducir la escala de trabajo sin comprometer la capacidad de realizar inferencias precisas sobre la población completa.
0
20
40
60
80
100
Variable X
0
20
40
60
80
100
Variable Y Aleatoriedad en la selección de muestras group Muestra Fig. 4.29. Distribución de la población de datos aleatorios en el plano de las variables X y Y Comparación de Distribuciones (Población vs. Muestra): la calidad de una muestra se valida por su capacidad para replicar la distribución de la variable de interés en la población. La figura 4.30 compara la distribución de frecuencias de la población total (barras azules) frente a la muestra seleccionada (barras rojas). Se observa que, si bien la muestra no iguala el volumen de la población, su forma distribucional y sus principales métricas (como la tendencia central) se mantienen alineadas. Esta proximidad es la que permite obtener conclusiones relevantes y confiables sin procesar el conjunto completo de datos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [127] Regresar
20
30
40
50
60
70
80
90
Variable de interés
0
50
100
150
200
250
300
Frecuencia Distribución de la variable de interés en población y muestra Población Muestra Fig. 4.30. Comparación de la distribución de frecuencias de la población completa (azul) con la muestra seleccionada (rojo) Ajuste de la Distribución (Normalidad): una vez validada la representatividad de la muestra, el siguiente paso es modelar o ajustar paramétricamente la distribución de la variable de interés. La figura 4.31 presenta una estimación de la Función de Densidad de Probabilidad (PDF) de la muestra, que se ajusta a una distribución normal (o Gaussiana).
10
20
30
40
50
60
70
80
90
Variable de interés
0.000
0.005
0.010
0.015
0.020
0.025
0.030
0.035
Densidad Distribución esperada de muestras aleatorias Fig. 4.31. Estimación de la Función de Densidad de Probabilidad de la muestra, ajustada a una distribución normal esperada
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [128] Regresar Esta visualización de la densidad facilita la comprensión del comportamiento de la muestra y es fundamental para la aplicación de pruebas estadísticas que asumen normalidad.
4.2.2.
Tipos de Inferencia: la Estimación La estimación es un pilar de la estadística inferencial. Su objetivo es calcular un valor aproximado para un parámetro de una población (como la media o la pendiente de una relación) basándose únicamente en los datos de una muestra. Existen dos enfoques principales:
Estimación puntual: proporciona un único valor como la "mejor suposición". Por ejemplo, al calcular la pendiente de una regresión, el número que se obtiene es una estimación puntual.
Estimación por intervalos: en lugar de un solo número, calcula un rango de valores (un intervalo de confianza) que probablemente contiene el verdadero parámetro poblacional. Un intervalo del 95 % de confianza significa que se tiene una alta certeza de que el verdadero valor se encuentra dentro de ese rango.
A continuación, se explora el desafío de la estimación a través de dos casos de estudio. Ejemplo 4.2.2:
Especificación del Modelo (Regresión Lineal vs. No Lineal): este caso demuestra la importancia crítica de seleccionar una forma funcional que capture la naturaleza subyacente de los datos antes de proceder a la estimación de parámetros. Caso 1: Falla de la hipótesis lineal:
el objetivo es modelar la relación entre la tensión (V) y la corriente (I) en el circuito de la figura 4.32, a partir de las mediciones recopiladas en la tabla XII.
− + V I Rd R1 R2 R3 Fig. 4.32. Circuito electrónico bajo análisis
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [129] Regresar TABLA XII. Mediciones de tensión y corriente Medición Tensión (V) Corriente (I) Medición Tensión (V) Corriente (I)
1
9.12
1.01
16
9.77
1.16
2
5.78
0.92
17
8.21
0.83
3
7.43
0.77
18
6.33
1.05
4
6.91
1.20
19
12.10
1.11
5
8.56
0.96
20
13.02
0.92
6
10.23
1.15
21
5.88
1.18
7
13.47
0.84
22
9.94
1.09
8
7.65
1.25
23
6.77
1.01
9
11.34
1.03
24
11.23
0.94
10
6.02
0.89
25
7.11
1.13
11
12.67
1.09
26
12.45
1.05
12
8.90
0.98
27
5.62
0.97
13
11.89
1.08
28
8.33
0.99
14
5.44
1.03
29
13.89
0.86
15
9.77
1.16
30
14.75
1.02
Se postula inicialmente un modelo de regresión lineal simple: I = m · V + b
(4.1)
donde m y b son los coeficientes obtenidos mediante el método de mínimos cuadrados (algoritmo 2).
Algorithm 2 Cálculo de los Parámetros del Modelo de Regresión Lineal 1: Input: Conjunto de datos (Vi, Ii) para i = 1, 2, . . . , n 2: Output: Valores de m y b 3:
4: Paso 1: Calcular las medias de V e I 5: ¯V ←1 n ∑n i=1 Vi 6: ¯I ←1 n ∑n i=1 Ii 7:
8: Paso 2: Calcular la pendiente m 9: numerador ←∑n i=1(Vi −¯V)(Ii −¯I) 10: denominador ←∑n i=1(Vi −¯V)2 11: m ← numerador denominador 12:
13: Paso 3: Calcular la intersección b 14: b ←¯I −m · ¯V 15:
16: Paso 4: Resultado 17: Retornar m y b
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [130] Regresar El resultado del ajuste lineal produce los siguientes coeficientes: m = −0.00413 y b = 1.060 Resultando en la ecuación de la línea de regresión: I = −0.00413 · V + 1.060. La figura 4.33 ilustra la línea de regresión superpuesta a los datos. Visualmente, el modelo no logra capturar ninguna tendencia, lo que se debe a la gran dispersión.
6
8
10
12
14
Tensión (V)
0.8
0.9
1.0
1.1
1.2
Corriente (I) Gráfica de la regresión lineal Datos Regresión lineal: I = -0.00 * V + 1.06 Fig. 4.33. Regresión lineal sobre las mediciones de tensión y corriente. La baja pendiente demuestra la ausencia de una relación lineal significativa. Esta ineficacia se confirma numéricamente. El coeficiente de correlación de Pearson (r) es de -0.09675. Este valor, extremadamente cercano a cero, valida la conclusión visual: existe una ausencia de correlación lineal entre las variables V e I. Coeficiente de Correlación (r) El coeficiente de correlación r es una medida estadística que cuantifica la fuerza y la dirección de la relación lineal entre dos variables. Varía entre -1 y 1. Un valor de r ≈0 indica que no hay una relación lineal medible, lo que sugiere que la forma funcional lineal es inadecuada para la modelización. r = ∑n i=1(Xi −¯X)(Yi −¯Y)
∑n i=1(Xi −¯X)2 ∑n i=1(Yi −¯Y)2 Caso 2: Búsqueda de una forma funcional no lineal:
el fracaso del modelo lineal en el caso anterior obliga a la búsqueda de una forma funcional que respete la física y el
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [131] Regresar patrón de los datos. La figura 4.34 muestra el muestreo de la corriente de arranque de un motor, una serie temporal que exhibe claramente un patrón oscilatorio amortiguado (sinusoidal con decaimiento exponencial).
0
5
10
15
20
25
t
0
2
4
6
8
10
12
I(t) Datos Fig. 4.34. Muestreo de la corriente de arranque de un motor, mostrando un patrón no lineal característico.
Para abordar esta complejidad, se exploran modelos más flexibles. Una opción viable es la regresión polinómica de grado superior. Para este conjunto de datos, se ajustó un polinomio de grado 13, proporcionando una solución de aproximación flexible: y = a0 + a1t + a2t2 + . . . + a13t13
(4.2)
El algoritmo 3 detalla el procedimiento matricial utilizado para estimar estos coeficientes.
Algorithm 3 Ajuste polinómico de grado 13 1: Entrada: Conjunto de datos (ti, Ii) para i = 1, 2, . . . , n 2: Salida: Coeficientes a0, a1, . . . , a13 del polinomio ajustado 3: Inicialización:
4: A ←matriz de diseño con dimensiones n × 14 5: for i = 1 to n do 6:
for j = 0 to 13 do 7:
A[i, j + 1] ←tj i 8:
end for 9: end for 10: Paso 1: Resolver el sistema de ecuaciones normales 11: a ←(ATA)−1ATI 12: Donde a = [a0, a1, . . . , a13]T son los coeficientes del polinomio 13: Donde I = [I1, I2, . . . , In]T son los valores de la variable dependiente
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [132] Regresar 14: Paso 2: Calcular las métricas del modelo 15: Ipred ←Aa ▷Valores predichos por el modelo
16: MSE ←1
n ∑n i=1(Ii −Ipred,i)2 ▷Error Cuadrático Medio 17: R2 ←1 −∑n i=1(Ii−Ipred,i)2 ∑n i=1(Ii−¯I)2 ▷Coeficiente de determinación 18: Salida: Coeficientes a0, a1, . . . , a13, MSE y R2 Este modelo polinómico de alto grado logra un ajuste notablemente superior, como lo evidencian las métricas:
Error Cuadrático Medio (MSE) = 0.68 Coeficiente de Determinación (R2) = 0.88 Un valor de R2 = 0.88 (cercano a la unidad) confirma que el modelo explica una porción significativa de la varianza en los datos, superando ampliamente la hipótesis lineal. Alternativamente, se podría haber utilizado un modelo basado en principios físicos que incorpore la función exponencial y sinusoidal, tal como: y = ae−t + b sin(t) + c
(4.3)
La figura 4.35 presenta una comparación directa entre la función original y el ajuste logrado con el polinomio de grado 13.
0
5
10
15
20
25
t
0
2
4
6
8
10
12
14
I(t) Ajuste del modelo polinómico de grado 13 a los datos Datos con ruido Modelo Polinómico de Grado 13 (MSE=0.68, R^2=0.88) a*e^(-t) + b*sin(t) + c Fig. 4.35. Evaluación del ajuste: función original vs. el modelo polinómico de grado 13, que captura con precisión la estructura subyacente de los datos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [133] Regresar Para ilustrar el contraste, la figura 4.36 muestra cómo modelos de menor complejidad fallan en representar la dinámica de los datos, reforzando la conclusión principal: la correcta selección del modelo (especificación) es el factor determinante para una estimación precisa, y la visualización es una herramienta esencial para la validación inicial de la forma funcional.
0
5
10
15
20
25
t
0
2
4
6
8
10
12
14
I(t) Ajuste de varios modelos y función original a los datos con ruido Datos con ruido Modelo Lineal (MSE=4.70, R^2=0.15) Modelo Polinómico (MSE=4.17, R^2=0.25) Modelo Exponencial (MSE=2.35, R^2=0.58) a*e^(-t) + b*sin(t) + c Fig. 4.36. Comparativa que destaca la inadecuación de modelos simples (lineal, bajo grado) frente a la flexibilidad del ajuste polinómico de grado 13. Para ilustrar el contraste, la figura 4.36 muestra cómo modelos de menor complejidad fallan en representar la dinámica de los datos, reforzando la conclusión principal: la correcta selección del modelo (especificación) es el factor determinante para una estimación precisa, y la visualización es una herramienta esencial para la validación inicial de la forma funcional.
0
5
10
15
20
25
t
0
2
4
6
8
10
12
14
I(t) Ajuste de varios modelos y función original a los datos con ruido Datos con ruido Modelo Lineal (MSE=4.70, R^2=0.15) Modelo Polinómico (MSE=4.17, R^2=0.25) Modelo Exponencial (MSE=2.35, R^2=0.58) a*e^(-t) + b*sin(t) + c Fig. 4.36. Comparativa que destaca la inadecuación de modelos simples (lineal, bajo grado) frente a la flexibilidad del ajuste polinómico de grado 13.
4.2.3.
Prueba de hipótesis La prueba de hipótesis es un procedimiento estadístico que permite evaluar si una afirmación sobre un parámetro poblacional es consistente con los datos observados en una muestra. El objetivo principal es contrastar una hipótesis nula (H0), que representa el estado actual o una suposición de no efecto, contra una hipótesis alternativa (H1), que representa el planteamiento de cambio o efecto. Este proceso es fundamental en la investigación científica y en la ingeniería, pues permite tomar decisiones basadas en evidencia cuantitativa y no únicamente en observaciones subjetivas.
4.2.3.1.
Flujo de la prueba de hipótesis El proceso de prueba de hipótesis sigue una secuencia ordenada de pasos, que aseguran la validez del análisis y la correcta interpretación de los resultados:
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [134] Regresar Recopilación de datos muestrales: en esta etapa se obtienen los datos necesarios para el análisis. La calidad y representatividad de la muestra son aspectos críticos, ya que de ellos depende que los resultados puedan generalizarse a toda la población. En el contexto ingenieril, esto implica medir con precisión las variables de interés, como temperatura, resistencia de materiales o consumo energético. Definición de hipótesis nula y alternativa: una vez recolectados los datos, se formulan las hipótesis. La hipótesis nula (H0) plantea la ausencia de efecto o diferencia, mientras que la hipótesis alternativa (H1) plantea la existencia de un cambio, efecto o relación. Por ejemplo, H0: “la temperatura no afecta la expansión de un material”, frente a H1: “la temperatura sí afecta la expansión de un material”. Ejemplo 4.2.3:
Se desea investigar si existe una relación entre la edad de los individuos y sus niveles de ingresos (ver tabla XIII). Se plantea la hipótesis nula (H0) de que no hay relación entre la edad y el nivel de ingresos, mientras que la hipótesis alternativa (H1) sostiene que sí existe una relación.
TABLA XIII.
DATOS DE EDAD Y NIVEL DE INGRESOS
Edad Nivel de Ingresos
25
35000
30
38000
35
40000
40
42000
45
45000
50
47000
55
49000
60
50000
65
48000
70
45000
Solución:
Planteamiento de hipótesis:
Hipótesis nula (H0): no hay relación entre la edad y el nivel de ingresos. Hipótesis alternativa (H1): existe una relación entre la edad y el nivel de ingresos. Visualización de la posible relación:
• Diagrama de dispersión: el diagrama de dispersión (figura de la izquierda
en 4.37) permite visualizar la relación entre la edad y el nivel de ingresos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [135] Regresar Si la hipótesis nula (H0) es cierta, se espera ver una dispersión aleatoria de puntos en el gráfico, sin ningún patrón claro de cómo el nivel de ingresos cambia con la edad. Por otro lado, si la hipótesis alternativa (H1) es cierta, se podría observar un patrón general en el gráfico donde el nivel de ingresos tiende a aumentar o disminuir con la edad.
• Histograma doble: el histograma doble (figura de la derecha en 4.37) permite
comparar la distribución de ingresos para dos grupos de edad diferentes: aquellos menores o iguales a 50 años y aquellos mayores de 50 años. Si la hipótesis nula (H0) es cierta, se esperaría ver distribuciones de ingresos similares para ambos grupos de edad, sin diferencias significativas en la frecuencia de ingresos. Por otro lado, si la hipótesis alternativa (H1) es cierta, se podría observar diferencias en las distribuciones de ingresos entre los dos grupos de edad, lo que indicaría una posible relación entre la edad y el nivel de ingresos.
30
40
50
60
70
Edad
36000
38000
40000
42000
44000
46000
48000
50000
Nivel de ingresos Diagrama de dispersión
36000 38000 40000 42000 44000 46000 48000 50000
Nivel de ingresos
0.0
0.2
0.4
0.6
0.8
1.0
Frecuencia Histograma doble Edad <= 50 Edad > 50 Fig. 4.37. Relación entre edad y nivel de ingresos Selección de una prueba estadística adecuada: dependiendo del tipo de datos y del objetivo del análisis, se elige la prueba estadística a utilizar. Entre las más comunes se encuentran la prueba t de Student para comparar medias, la prueba de chi-cuadrado para variables categóricas, o la regresión lineal para analizar relaciones entre variables. La elección correcta garantiza que las conclusiones sean válidas.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [136] Regresar Cálculo de la estadística de prueba: se calcula un valor numérico (t, F, z, entre otros) que resume la evidencia en contra de la hipótesis nula. Este valor se obtiene a partir de fórmulas estadísticas específicas y refleja la magnitud de la diferencia u asociación observada en los datos.
Uso de p-values y t-estadísticas: el valor-p (o p-value) indica la probabilidad de obtener los resultados observados (o más extremos) si la hipótesis nula fuera cierta. Un valor-p bajo (generalmente menor a 0.05) proporciona evidencia suficiente para rechazar H0. Las t-estadísticas se utilizan principalmente en el contraste de medias y regresiones, y permiten determinar si un coeficiente o diferencia es estadísticamente significativa.
Interpretación de resultados: finalmente, se interpreta el valor-p y la estadística de prueba para decidir si se rechaza o no la hipótesis nula. Es importante destacar que “rechazar H0” no implica probar que H1 sea verdadera en sentido absoluto, sino que existe suficiente evidencia para preferirla sobre la nula. La interpretación debe realizarse en el contexto del problema y considerando posibles limitaciones del análisis.
Ejemplo 4.2.4:
En ingeniería de materiales, es fundamental entender cómo la temperatura afecta las propiedades físicas. Uno de los aspectos críticos es la expansión térmica, que es la tendencia de los materiales a cambiar de tamaño en respuesta a los cambios de temperatura. Para un material específico utilizado en la construcción de puentes, se ha observado que a medida que aumenta la temperatura, el material se expande. Este comportamiento puede afectar la integridad estructural si no se controla adecuadamente.
Debido a lo anterior, es necesario cuantificar la relación entre la temperatura (variable independiente X) y la expansión lineal del material (variable dependiente Y). Específicamente, se quiere construir un modelo de regresión lineal que permita predecir la expansión del material basándose en la temperatura observada.
Para ello, se han realizado experimentos para medir la expansión del material a diferentes temperaturas. En la figura 4.38, se muestra el modelo de regresión lineal utilizado para estos datos. A partir de la visualización del modelo de regresión aplicado a los datos de expansión térmica y temperatura, se observa un ajuste adecuado de los datos, lo que valida la pertinencia de aplicar una prueba de hipótesis.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [137] Regresar
0
20
40
60
80
100
Temperatura (°C)
0
50
100
150
200
250
Expansión (mm) Relación entre Temperatura y Expansión del Material Datos reales Línea de regresión Fig. 4.38. Representación del modelo de regresión lineal En la figura 4.39, se muestra la distribución de los datos en comparación con el valor t obtenido en la prueba de significancia. Este contraste permite determinar si el coeficiente de regresión es estadísticamente significativo o si la relación observada podría atribuirse al azar.
0
20
40
60
80
Valor t
0.00
0.05
0.10
0.15
0.20
0.25
0.30
0.35
0.40
Densidad de probabilidad Distribución t con colas y estadístico t observado Distribución t Cola derecha Cola izquierda Estadístico t observado Fig. 4.39. Distribución de datos frente al valor t de la prueba
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [138] Regresar
4.2.3.2.
Análisis de varianza (ANOVA) El Análisis de varianza (ANOVA, por sus siglas en inglés) es una técnica estadística utilizada para comparar las medias de tres o más grupos de datos. A diferencia de la prueba t de Student, que permite comparar únicamente dos medias, el ANOVA ofrece un marco más general para estudiar si existen diferencias significativas entre varios grupos al mismo tiempo. Esta herramienta resulta particularmente útil en estudios experimentales, donde se busca evaluar el efecto de diferentes tratamientos, condiciones o factores sobre una variable de interés.
Introducción al ANOVA y relación con prueba de hipótesis: el ANOVA se basa en la misma lógica que las pruebas de hipótesis: se plantea una hipótesis nula (H0) que sostiene que todas las medias de los grupos son iguales, frente a una hipótesis alternativa (H1) que plantea que al menos una de ellas difiere. El análisis se fundamenta en descomponer la variabilidad total de los datos en dos componentes: la variabilidad entre grupos, que refleja diferencias atribuibles a los tratamientos, y la variabilidad dentro de los grupos, que refleja la variabilidad natural o aleatoria. Aplicaciones para comparación de múltiples grupos: en ingeniería y ciencias aplicadas, el ANOVA se utiliza para contrastar la efectividad de diferentes métodos, materiales o procesos. Por ejemplo, un ingeniero puede comparar la resistencia a la tracción de tres tipos de aleaciones metálicas sometidas a las mismas condiciones de prueba. Si el ANOVA indica que existen diferencias significativas entre las medias de resistencia, el investigador podrá identificar qué aleación ofrece un mejor desempeño y tomar decisiones informadas en el diseño de estructuras. Asimismo, el ANOVA se emplea en control de calidad, pruebas de nuevos fármacos, agricultura, entre muchos otros ámbitos donde la comparación simultánea de grupos es esencial. Ejemplo 4.2.5:
Supóngase que un ingeniero desea comparar la resistencia a la tracción de tres tipos de aleaciones metálicas: A, B y C. El objetivo es determinar si existen diferencias estadísticamente significativas entre las medias de los tres grupos. La hipótesis nula (H0) plantea que todas las medias son iguales, mientras que la hipótesis alternativa (H1) sostiene que al menos una de ellas difiere. Datos experimentales: en la tabla XIV se presentan los valores de resistencia a la tracción (en MPa) obtenidos para cada una de las aleaciones. Cada grupo contiene cinco observaciones tomadas bajo condiciones experimentales controladas.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [139] Regresar
TABLA XIV.
DATOS EXPERIMENTALES DE RESISTENCIA A LA TRACCIÓN EN TRES ALEACIONES
METÁLICAS
Aleación Resistencia (MPa) A
50, 55, 52, 53, 51
B
60, 62, 61, 63, 59
C
65, 67, 70, 66, 68
Estadísticos descriptivos: la tabla XV resume los principales estadísticos de cada grupo. Se observa que la aleación A presenta una media de 52.2 MPa, la B de 61.0 MPa y la C de 67.2 MPa. Las desviaciones estándar son relativamente pequeñas en todos los grupos, lo cual indica una baja dispersión de los datos en torno a la media.
TABLA XV.
RESUMEN ESTADÍSTICO DE LA RESISTENCIA POR GRUPO DE ALEACIÓN
Aleación Media Desviación estándar n A
52.2
1.92
5
B
61.0
1.58
5
C
67.2
1.92
5
Resultados del ANOVA: la tabla XVI muestra la descomposición de la variabilidad total en dos componentes: entre grupos y dentro de los grupos (residual). El estadístico F = 125.76 y el valor p < 0.0001 indican que se rechaza la hipótesis nula. Esto significa que existen diferencias estadísticamente significativas en la resistencia promedio de al menos una de las aleaciones.
TABLA XVI. Tabla ANOVA para la comparación de tres aleaciones metálicas Fuente de variación Suma de cuadrados gl F p-valor Aleación
456.93
2
125.76
< 0.0001 Residual
32.67
12
-
-
Total
489.60
14
-
-
Visualización: la figura 4.40 presenta los boxplots de cada aleación. Se aprecia claramente que las distribuciones de B y C están desplazadas hacia valores superiores de resistencia en comparación con A. Además, los rangos intercuartílicos son estrechos, lo que confirma la consistencia de las mediciones en cada grupo.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [140] Regresar A B C Aleacion
50.0
52.5
55.0
57.5
60.0
62.5
65.0
67.5
70.0
Resistencia (MPa) Comparación de resistencias según aleación (ANOVA) Fig. 4.40. Boxplots de la resistencia a la tracción según la aleación Interpretación: con base en los resultados de la tabla XVI y la representación gráfica de la figura 4.40, se concluye que la resistencia a la tracción difiere significativamente entre las tres aleaciones. En particular, la aleación C muestra la mayor media, seguida de la B y finalmente la A. Por tanto, el ingeniero puede seleccionar la aleación C como la más resistente para aplicaciones donde esta propiedad sea crítica.
4.2.4.
Modelos de Regresión Un modelo de regresión es una de las herramientas más poderosas en estadística, ya que permite cuantificar la relación matemática entre una variable de interés (dependiente) y una o más variables que la influyen (independientes). Su propósito principal es doble: estimar los parámetros que definen esa relación y predecir el comportamiento futuro de la variable dependiente.
4.2.4.1.
Interpretación de los Componentes del Modelo La correcta interpretación de un modelo de regresión requiere analizar sus tres componentes estadísticos principales:
Coeficientes (Estimadores): cuantifican la relación entre cada variable independiente y la variable dependiente. Indican tanto la magnitud como la dirección del efec-
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [141] Regresar to. Un coeficiente positivo, por ejemplo, sugiere que un incremento en la variable independiente está asociado con un incremento en la dependiente. Errores Estándar: miden la precisión con la que se ha estimado cada coeficiente. Representan la variabilidad esperada del coeficiente si el muestreo se repitiera. Un error estándar pequeño indica que la estimación del coeficiente es precisa y confiable. Valores p (P-values): evalúan la significancia estadística de cada coeficiente. Indican la probabilidad de obtener un coeficiente tan extremo (o más) como el observado, bajo el supuesto de que la hipótesis nula (que el coeficiente es cero, es decir, no hay efecto) es verdadera. Un valor p pequeño (usualmente <0.05) sugiere que el resultado observado es estadísticamente significativo y es poco probable que se deba al azar.
4.2.4.2.
Visualización de P-value El p-value (o factor P) es la probabilidad de obtener los resultados (o unos más extremos) si en realidad no existiera ningún efecto (es decir, si la hipótesis nula fuera cierta). Por convención, se emplea un nivel de significancia, llamado alfa (α), usualmente de 0.05. La regla es simple: si el p-value <α (0.05), el resultado es estadísticamente significativo. Esto significa que es muy poco probable que el efecto observado sea por azar, por lo que se rechaza la hipótesis nula. La figura 4.41 ilustra este concepto en una curva de distribución normal.
−1.96
1.96
Regi´on de Aceptaci´on de H0 (P > 0.05) Regi´on de Rechazo (P < 0.05) Regi´on de Rechazo (P < 0.05) z-score Probabilidad Fig. 4.41. Visualización del p-value en una distribución normal
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [142] Regresar
4.2.5.
Aplicación de visualizaciones en la estadística inferencial El uso de visualizaciones apropiadas facilita la comprensión de la distribución de los datos, la identificación de tendencias, la detección de valores atípicos y la evaluación de la validez de las suposiciones estadísticas. Entre las representaciones más utilizadas se encuentran: Histogramas y distribuciones de frecuencia Permiten representar la frecuencia de valores en intervalos, facilitando la identificación de la forma, dispersión y sesgos de los datos, como en la distribución de las puntuaciones de un examen para ver si sigue una curva normal.
30
40
50
60
70
80
90
100
110
Puntuación
0
20
40
60
80
100
120
140
160
Frecuencia Distribución de las Puntuaciones del Examen Fig. 4.42. Histograma de puntuaciones Gráficos de probabilidad Comparan la distribución de una muestra con una distribución teórica conocida (como la normal) para evaluar visualmente si los datos se ajustan a ella y detectar posibles desviaciones, sesgos o errores de muestreo.
140
160
180
200
Estatura
0.00
0.01
0.02
0.03
0.04
0.05
Frecuencia Distribución de Estaturas: Muestra vs Distribución Teórica Normal Muestra Fig. 4.43. Gráfico de probabilidad normal
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [143] Regresar Diagramas de caja (Boxplots) Resumen la dispersión de los datos mostrando la mediana, los cuartiles y los valores atípicos. Son muy eficaces para comparar rápidamente las distribuciones de múltiples grupos o condiciones.
Grupo 1 Grupo 2 Grupo 3
20
40
60
80
100
Medidas Comparación de Medidas entre Grupos Fig. 4.44. Comparación de medidas Gráficos de dispersión Permiten visualizar la relación entre dos variables para detectar patrones, tendencias y correlaciones (positivas, negativas o nulas), como la asociación entre tiempo de estudio y rendimiento académico.
3.0
3.5
4.0
4.5
5.0
5.5
6.0
6.5
7.0
Tiempo de Estudio
60
70
80
90
100
Rendimiento Académico Relación entre Tiempo de Estudio y Rendimiento Académico
3.2
4.0
4.8
5.6
6.4
Fig. 4.45. Gráfico de dispersión Mapas de calor (Heatmaps) Representan los valores de una matriz de datos mediante colores, facilitando la identificación intuitiva de patrones y correlaciones entre múltiples variables a la vez.
0
1
2
3
4
5
6
7
8
9
Variables
0
1
2
3
4
5
6
7
8
9
Variables
0.11
0.94
0.59
0.14
0.72
0.62
0.86
0.82
0.17
0.38
0.54
0.08
0.21
0.80
0.84
0.96
0.84
0.62
0.40
0.94
0.21
0.03
0.84
0.45
0.38
0.58
0.16
0.76
0.69
0.25
0.47
0.72
0.22
0.02
0.29
0.27
0.94
0.24
0.63
0.02
0.31
0.91
0.64
0.99
0.97
0.83
0.27
0.23
1.00
0.03
0.26
0.78
0.29
0.56
0.26
0.00
0.34
0.61
0.96
0.94
0.61
0.98
0.53
0.26
0.24
0.98
0.96
0.03
0.41
0.45
0.40
0.56
0.42
0.74
0.87
0.81
0.38
0.93
0.60
0.40
0.06
0.75
0.89
0.74
0.82
0.42
0.04
0.31
0.75
0.70
0.97
0.49
0.61
0.41
0.58
0.49
0.42
0.60
0.95
0.65
Mapa de Calor de la Relación entre Múltiples Variables
0.2
0.4
0.6
0.8
Fig. 4.46. Mapa de calor
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [144] Regresar En conclusión, las visualizaciones en estadística inferencial no solo permiten comunicar resultados de forma clara, sino que también constituyen una herramienta analítica fundamental para interpretar patrones, validar supuestos y tomar decisiones basadas en datos.
4.2.6.
Toma de decisiones basada en inferencia estadística La toma de decisiones basada en inferencia estadística es esencial en diversos campos, desde la medicina hasta los negocios. Este proceso implica utilizar datos muestrales para realizar afirmaciones sobre una población más amplia, considerando siempre la incertidumbre inherente a los datos. En este contexto, las visualizaciones son herramientas clave que permiten comprender la información, evaluar la confiabilidad de las conclusiones y comunicar los resultados de manera clara.
Ejemplo 4.2.6:
Caso de Estudio 1: viabilidad de un nuevo fármaco Una empresa farmacéutica desarrolla un nuevo medicamento. Durante las pruebas clínicas, se recopilan datos sobre su eficacia en una muestra de pacientes. El objetivo es usar la inferencia estadística para decidir si el fármaco es lo suficientemente efectivo para ser comercializado.
Fig. 4.47. Comparación de eficacia: Grupo Tratado vs. Grupo Placebo
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [145] Regresar Para ello, se compara un grupo de pacientes que recibió el medicamento (grupo tratado) con otro que recibió un placebo (grupo placebo). Una visualización ideal para esta comparación es un gráfico de densidad, que permite ver la distribución de la eficacia en ambos grupos.
En la figura 4.47 se observan las distribuciones de eficacia. La curva del Grupo tratado muestra una diferencia clara, desplazándose hacia valores superiores, mientras que el Grupo placebo permanece centrado en torno a cero. La mínima superposición entre las curvas confirma la efectividad del tratamiento y permite descartar que las diferencias se deban al azar.
Este análisis tiene implicaciones prácticas directas para la empresa, que puede tomar una decisión informada sobre la viabilidad del medicamento, considerando no solo la eficacia clínica, sino también costos, marketing y monitoreo de seguridad. Ejemplo 4.2.7:
Caso de Estudio 2: monitoreo de procesos y control de calidad En entornos industriales, las inferencias estadísticas son cruciales para garantizar la calidad. Un gráfico de control permite monitorear un proceso en tiempo real para detectar desviaciones significativas que podrían indicar un problema.
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
Número de Muestra (Tiempo)
6
8
10
12
14
16
18
Valor de la Medición ¡Proceso fuera de control!
Gráfico de Control de Calidad (Shewhart) Mediciones del Proceso Línea Central (Media) Límite de Control Superior (LCS) Límite de Control Inferior (LCI) Fig. 4.48. Gráfico de control de calidad (Shewhart) para un proceso industrial
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [146] Regresar El gráfico de control de la figura 4.48 muestra que la mayoría de las mediciones son estables. Sin embargo, el punto anotado cae por fuera del Límite de control superior, una señal estadística clara de que el proceso se ha desviado de su comportamiento Intervalos de confianza en gráficos de barras Muestra la media o proporción de una categoría junto con su intervalo de confianza (usualmente al 95 %). Es clave para comparar grupos: si los intervalos de confianza se superponen, no suele haber una diferencia estadísticamente significativa entre ellos.
Tratamiento A Tratamiento B
0
10
20
30
40
50
Media Medias con intervalos de confianza al 95% Fig. 4.50. Intervalos de Confianza normal. Esto permite al equipo de calidad tomar una decisión inmediata para investigar la causa y aplicar medidas correctivas, previniendo fallos mayores.
4.2.7.
Ejemplos de visualizaciones utilizadas en la estadística inferencial Diagrama de tornado Facilita la comparación de la magnitud de diferentes variables o la eficacia entre grupos. Las barras horizontales, ordenadas de mayor a menor, permiten identificar rápidamente los factores más influyentes y a menudo incluyen intervalos de confianza.
Fig. 4.49. Diagrama de Tornado
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [147] Regresar Gráfico Q-Q (Quantile-Quantile) Herramienta visual para verificar si un conjunto de datos sigue una distribución teórica específica (como la normal). Si los puntos se alinean estrechamente con la línea diagonal de referencia, se asume que los datos se ajustan a dicha distribución.
2
1
0
1
2
Theoretical Quantiles
2
1
0
1
2
Sample Quantiles Gráfico Q-Q para comprobar normalidad Fig. 4.51. Gráfico Q-Q Dispersión con regresión e intervalos de confianza Visualiza la relación entre dos variables, añade una línea de regresión para mostrar la tendencia y bandas de confianza para indicar la incertidumbre de esa tendencia. Permite evaluar la fuerza y significancia de la relación. Fig. 4.52. Dispersión con regresión Ejemplo 4.2.8:
Ejemplo integral de aplicación de la estadística inferencial Se plantea un caso práctico en el que una empresa educativa desea evaluar el impacto de un nuevo programa de estudio en el rendimiento académico de los estudiantes. El objetivo es determinar si el programa mejora significativamente las calificaciones y analizar qué factores influyen en los resultados obtenidos. Planteamiento del problema:
la empresa aplicó el programa piloto a un grupo de 60 estudiantes (Nuevo), mientras que otros 60 siguieron con el plan tradicional (Tradicional).
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [148] Regresar Se recopilaron datos de las calificaciones finales, horas de estudio semanales y hábitos de lectura (ver tabla XVII). La hipótesis de investigación es: H0 : µnuevo = µtradicional (No existen diferencias significativas en las calificaciones medias).
H1 : µnuevo > µtradicional (El programa nuevo mejora significativamente las calificaciones).
TABLA XVII.
PRIMERAS CINCO OBSERVACIONES DEL CONJUNTO DE DATOS. NOTA: EN LA COLUMNA
LECTURA, 1 INDICA QUE EL ESTUDIANTE LEE Y 0 QUE NO
grupo calificación horas_estudio lectura Tradicional
3.248
12.373
1
Tradicional
2.931
7.272
1
Tradicional
3.324
14.208
0
Tradicional
3.762
5.794
1
Tradicional
2.883
11.761
0
...
...
...
...
Paso 1: análisis descriptivo y visual Inicialmente, se visualizan los datos para explorar la distribución de las calificaciones. Los histogramas (figura 4.53) y diagramas de caja (figura 4.54) sugieren que el grupo del programa nuevo tiende a tener calificaciones más altas y una distribución similar al grupo tradicional.
2.0
2.5
3.0
3.5
4.0
4.5
Calificación
0.0
2.5
5.0
7.5
10.0
12.5
15.0
17.5
Frecuencia Distribución de calificaciones en ambos grupos grupo Tradicional Nuevo Fig. 4.53. Distribución de calificaciones en ambos grupos Tradicional Nuevo grupo
2.0
2.5
3.0
3.5
4.0
4.5
calificacion Comparación de calificaciones mediante diagramas de caja Fig. 4.54. Comparación de calificaciones mediante diagramas de caja
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [149] Regresar Verificación de supuestos:
antes de aplicar pruebas paramétricas, se verifica la normalidad de los datos mediante un gráfico Q-Q (Figura 4.55). Los puntos se alinean razonablemente bien con la línea diagonal, validando el supuesto de normalidad.
2
1
0
1
2
Theoretical Quantiles
2.0
2.5
3.0
3.5
4.0
4.5
Sample Quantiles Q-Q Plot de las calificaciones Fig. 4.55. Gráfico Q-Q de los residuos, validando el supuesto de normalidad Paso 2: prueba de hipótesis (Prueba t de Student) Para comparar formalmente las medias de los dos grupos, se utiliza una prueba t para muestras independientes. La fórmula del estadístico t es: t = ( ¯x1 −¯x2) −(µ1 −µ2)
s2
1
n1 + s2
2
n2 donde ¯x es la media de la muestra, s2 la varianza y n el tamaño de la muestra. Cálculo y resultados:
con los datos generados, las medias de los grupos son ¯xnuevo = 3.45 y ¯xtradicional = 2.98. Al aplicar la prueba, se obtiene un estadístico t = 4.51 con 118 grados de libertad. Este valor se traduce en un valor p extremadamente bajo: p-valor ≈1.4 × 10−5
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [150] Regresar Interpretación:
dado que el p-valor (1.4 × 10−5) es significativamente menor que el nivel de significancia estándar (α = 0.05), se rechaza la hipótesis nula (H0). La evidencia estadística es fuerte para concluir que el nuevo programa educativo tiene un efecto positivo y significativo en las calificaciones de los estudiantes. La figura 4.56 visualiza esta diferencia, mostrando que los intervalos de confianza al 95 % para las medias de ambos grupos no se superponen.
Tradicional Nuevo grupo
0.0
0.5
1.0
1.5
2.0
2.5
3.0
3.5
calificacion Medias de los grupos con intervalos de confianza al 95% Fig. 4.56. Medias de los grupos con intervalos de confianza al 95 % Paso 3: análisis de regresión múltiple Para profundizar en los factores que explican las calificaciones, se ajusta un modelo de regresión lineal múltiple con la forma:
Calificación = β0 + β1 · Gruponuevo + β2 · HorasEstudio + β3 · Lectura + ϵ La tabla XVIII resume los coeficientes del modelo ajustado.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [151] Regresar
TABLA XVIII.
RESULTADOS DEL MODELO DE REGRESIÓN LINEAL LÚLTIPLE
Variable Coeficiente (β) Error Est.
t-valor P >|t| Intercepto (β0)
1.855
0.250
7.42
<0.001 Grupo[Nuevo] (β1)
0.467
0.103
4.51
<0.001 Horas de Estudio (β2)
0.111
0.024
4.62
<0.001 Lectura (β3)
0.052
0.104
0.50
0.617
Interpretación del modelo.
Los resultados de la regresión confirman y cuantifican los efectos:
El coeficiente para Grupo[Nuevo] es 0.467 y su p-valor es <0.001. Esto significa que, manteniendo constantes las otras variables, pertenecer al programa nuevo se asocia con un aumento promedio de 0.467 puntos en la calificación, y este efecto es estadísticamente significativo.
El coeficiente para Horas de Estudio también es positivo y significativo (p <0.001). El hábito de Lectura, en este modelo, no muestra un efecto estadísticamente significativo (p = 0.617).
La figura 4.57 visualiza la relación positiva entre las horas de estudio y la calificación.
5.0
7.5
10.0
12.5
15.0
17.5
20.0
horas_estudio
2.0
2.5
3.0
3.5
4.0
4.5
calificacion Regresión con intervalos de confianza Fig. 4.57. Regresión lineal con intervalos de confianza
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [152] Regresar Paso 4: Análisis de sensibilidad Finalmente, un diagrama de tornado (figura 4.58) permite visualizar la sensibilidad de la calificación a los distintos factores. Confirma que el grupo y las horas de estudio son las variables con mayor impacto en los resultados.
0.0
0.2
0.4
0.6
Impacto estimado horas_estudio lectura grupo_dummy Variables Diagrama de Tornado: efectos sobre la calificación Fig. 4.58. Diagrama de tornado aplicado a factores de rendimiento académico Conclusiones del Caso El caso demuestra cómo la estadística inferencial, combinada con visualizaciones adecuadas, permite pasar de una simple observación a una conclusión robusta. Los análisis confirman con un alto grado de confianza estadística (p <0.001) que el nuevo programa educativo mejora significativamente el rendimiento académico. Además, el modelo de regresión cuantifica este impacto y resalta la importancia de las horas de estudio como un factor clave del éxito estudiantil.
Representaciones para series de tiempo Capítulo 5
[157] Regresar Este capítulo se centra en el análisis de la visualización de series de tiempo, un aspecto necesario en la ciencia de datos. Su visualización adecuada es importante para la interpretación correcta de datos temporales y para la toma de decisiones basada en patrones y tendencias identificados en estos datos. Se exploran las diferentes técnicas y métodos para visualizar series de tiempo, así como las mejores prácticas para garantizar una representación clara de estos datos.
5.1.
LAS SERIES DE TIEMPO
El análisis de series de tiempo implica el estudio de datos recogidos a intervalos regulares a lo largo del tiempo. Este tipo de análisis es fundamental en diversos campos, desde la economía y la climatología hasta la ingeniería y las ciencias sociales. En la economía, por ejemplo, las series de tiempo sirven para analizar indicadores económicos como el PIB, la inflación y el desempleo, permitiendo a los economistas prever ciclos económicos y tendencias del mercado. En la climatología, las series de tiempo ayudan a estudiar patrones climáticos a largo plazo, como las tendencias de calentamiento global o las fluctuaciones estacionales de temperatura y precipitación. En la ingeniería, se utilizan para monitorear y prever el rendimiento de sistemas y procesos, como la carga eléctrica en una red de distribución. En las ciencias sociales, se emplean para analizar datos demográficos, comportamientos de los consumidores y otros fenómenos sociales a lo largo del tiempo.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [158] Regresar Las series de tiempo permiten no solo entender el comportamiento histórico de los datos, sino también predecir futuros valores y tendencias. Esta capacidad predictiva es invaluable, ya que facilita la toma de decisiones informadas en una variedad de contextos. Por ejemplo, los gobiernos pueden utilizar predicciones basadas en series de tiempo para planificar políticas económicas y sociales, las empresas pueden anticipar la demanda de sus productos y ajustar sus estrategias de producción y marketing, y los científicos pueden prever cambios ambientales y diseñar intervenciones para mitigar sus impactos. La figura 5.1 presenta una representación gráfica de una serie de tiempo, mostrando cómo varían los datos a lo largo del tiempo. En esta figura, se puede observar claramente la tendencia general de la serie, lo cual es fundamental para realizar análisis predictivos.
2000
2010
2020
2030
2040
2050
Tiempo
0
10
20
30
40
50
60
Valor Original Tendencia Fig. 5.1. Visualización de una serie de tiempo
5.1.1.
¿Qué son las series de tiempo?
Una serie de tiempo es una secuencia de puntos de datos, típicamente consistentes en mediciones sucesivas tomadas a intervalos uniformes. Estos datos pueden ser de naturaleza diversa, como valores económicos, temperaturas o volúmenes de tráfico. Más que clasificarlas en tipos rígidos, es más útil analizar las series de tiempo descomponiéndolas en sus ”componentes fundamentales”:
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [159] Regresar Tendencia (Trend): el movimiento de largo plazo de la serie. Indica si, en general, los datos aumentan, disminuyen o se mantienen constantes en el tiempo. Estacionalidad (Seasonality): fluctuaciones periódicas y predecibles que ocurren en un lapso de tiempo fijo, como patrones diarios, semanales o anuales. Ruido (Noise): las variaciones aleatorias e irregulares que no pueden ser explicadas por la tendencia o la estacionalidad.
Una distinción clave es si una serie es estacionaria (sus propiedades estadísticas como la media y la varianza no cambian con el tiempo) o no estacionaria (generalmente debido a una tendencia). La figura 5.2 muestra ejemplos de estos diferentes patrones.
0
2
4
6
8
10
1.0
0.5
0.0
0.5
1.0
0
20
40
60
80
100
0
1
0
20
40
60
80
100
7
8
9
10
11
12
13
1960
1980
2000
2020
2040
106
2 × 106
3 × 106
Fig. 5.2. Ejemplos de diferentes patrones en series de tiempo Análisis de los gráficos de la figura 5.2 Arriba a la izquierda: serie con estacionalidad y ruido. Esta gráfica muestra un patrón ondulatorio regular (la estacionalidad) oculto bajo fluctuaciones aleatorias (el ruido). Al no tener una inclinación general hacia arriba o abajo, se considera una serie estacionaria.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [160] Regresar Arriba a la derecha: serie binaria. Este es un tipo especial de serie donde los datos solo pueden tomar dos valores (0 o 1). Es útil para modelar eventos o estados, como el encendido/apagado de una máquina o la presencia/ausencia de una señal. Abajo a la izquierda: carta de control. Esta es una aplicación de las series de tiempo en control de calidad. Se gráfica una medición a lo largo del tiempo para monitorear si un proceso es estable (estacionario). Las líneas rojas son los límites de control; si un punto los cruza, indica una anomalía en el proceso.
Abajo a la derecha: serie con tendencia. Este es un ejemplo clásico de una serie no estacionaria, ya que muestra una clara tendencia ascendente a largo plazo (en este caso, el crecimiento de la población). La escala logarítmica en el eje Y ayuda a visualizar un crecimiento que es exponencial.
5.1.2.
Componentes de una serie de tiempo Para comprender y analizar adecuadamente una serie de tiempo, es necesario descomponerla en sus componentes subyacentes. Estas componentes permiten identificar y modelar patrones repetitivos, fluctuaciones y cambios en los datos a lo largo del tiempo. Es necesario explorar las principales componentes de una serie de tiempo: la tendencia, la estacionalidad, el ciclo y el ruido.
5.1.2.1.
Tendencia La tendencia es el componente que refleja la dirección general del movimiento de la serie de tiempo a largo plazo. Este componente puede ser ascendente, descendente o estable, y representa el comportamiento a gran escala de los datos, dejando de lado las fluctuaciones más pequeñas.
Matemáticamente, la tendencia de una serie de tiempo Tt se puede modelar como: Tt = α + βt donde:
α es el intercepto.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [161] Regresar β es la pendiente de la línea de tendencia.
Un ejemplo común es el crecimiento de la población en una ciudad, que tiende a aumentar con el tiempo, reflejando una tendencia ascendente.
5.1.2.2.
Estacionalidad La estacionalidad se refiere a patrones que se repiten a intervalos regulares a lo largo del tiempo, como días, meses o estaciones del año. Este componente es particularmente importante en series de tiempo relacionadas con el clima, las ventas minoristas o la agricultura, donde ciertos periodos del año tienen un comportamiento predecible. Matemáticamente, la estacionalidad de una serie de tiempo St se puede modelar como: St = A cos 2πt P + ϕ
donde:
A es la amplitud de la estacionalidad.
P es el período de la estacionalidad.
ϕ es la fase de la estacionalidad.
Un ejemplo claro de estacionalidad se puede observar en las ventas de productos durante la temporada navideña, que tienden a aumentar cada diciembre, mostrando un patrón estacional anual.
5.1.2.3.
Ciclo El componente cíclico representa fluctuaciones de más largo plazo que la estacionalidad, pero que no ocurren en intervalos regulares. Estos ciclos están usualmente asociados con fenómenos económicos o naturales, como periodos de recesión y expansión económica, o variaciones climáticas prolongadas.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [162] Regresar Ct = B · sin πt
60
donde B es la amplitud del ciclo.
Además, el ciclo puede estar influenciado por factores exógenos o endógenos, que determinan su forma y persistencia:
Factores exógenos: aquellos que se originan fuera del sistema económico o del proceso generador de la serie temporal, como crisis financieras internacionales o cambios climáticos globales.
Factores endógenos: aquellos que provienen del propio sistema económico o del proceso generador de la serie, como variaciones en la inversión, el consumo o la producción interna.
Un ejemplo típico de componente cíclico es el ciclo económico de expansión y recesión que se presenta en las economías mundiales cada cierto número de años.
5.1.2.4.
Ruido El ruido es el componente residual de una serie de tiempo, representando las fluctuaciones aleatorias que no pueden ser explicadas por la tendencia, la estacionalidad o los ciclos. Este componente captura la variabilidad impredecible de los datos y es crucial para el modelado, ya que cualquier buen modelo debe minimizar la cantidad de ruido. El ruido se asume generalmente como un proceso estocástico con media cero y varianza constante (ruido blanco):
et ∼N(0, σ2) donde:
et es el término de error o residuo.
σ2 es la varianza del ruido.
El ruido es inevitable en cualquier serie de tiempo, y su correcta identificación y modelado es clave para mejorar la precisión de las previsiones.
Matemáticamente, el ciclo de una serie de tiempo Ct puede representarse como:
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [163] Regresar
5.1.2.5.
Descomposición de series de tiempo La descomposición de una serie de tiempo es el proceso de separar estos componentes (tendencia, estacionalidad, ciclo y ruido) para analizarlos individualmente. Existen métodos tanto aditivos como multiplicativos para descomponer una serie de tiempo, dependiendo de la naturaleza de los datos.
En el caso aditivo:
yt = Tt + St + Ct + et Y en el caso multiplicativo:
yt = Tt × St × Ct × et La figura 5.3 muestra un ejemplo práctico de una descomposición multiplicativa aplicada a datos de pasajeros de aerolíneas, donde se pueden apreciar claramente los cuatro componentes por separado.
200
400
600
Observada Pasajeros
200
300
400
Tendencia
0.8
0.9
1.0
1.1
1.2
Estacionalidad
1950
1952
1954
1956
1958
1960
0.00
0.25
0.50
0.75
1.00
Residuo (Ruido) Descomposición de una Serie de Tiempo Fig. 5.3. Ejemplo de descomposición de una serie de tiempo en sus componentes: tendencia, estacionalidad y residuo (ruido)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [164] Regresar
5.1.3.
Tipos de series de tiempo: estacionarias y no estacionarias Las series de tiempo pueden clasificarse en dos tipos principales: estacionarias y no estacionarias. Esta distinción es crucial para determinar las técnicas de análisis y predicción que se deben aplicar. Una serie estacionaria es aquella cuyas propiedades estadísticas (como la media y la varianza) permanecen constantes a lo largo del tiempo, mientras que una serie no estacionaria muestra cambios en estas propiedades, como tendencias o estacionalidad.
La figura 5.4 muestra la diferencia visual fundamental entre ambos tipos.
0
25
50
75
100
125
150
175
200
Tiempo
2
1
0
1
2
Valor Serie Estacionaria (Ruido Blanco) Media = -0.04
0
25
50
75
100
125
150
175
200
Tiempo
0.0
2.5
5.0
7.5
10.0
12.5
15.0
17.5
Serie No Estacionaria (Paseo Aleatorio) Comparación Visual de Series de Tiempo Fig. 5.4. Comparación visual. A la izquierda, una serie estacionaria (ruido blanco) que oscila alrededor de una media constante. A la derecha, una serie no estacionaria (paseo aleatorio) que no tiene una media fija Para analizar series no estacionarias, a menudo es necesario aplicar transformaciones que las estabilicen y las conviertan en estacionarias. Algunas técnicas comunes son: Diferenciación: elimina la tendencia restando cada valor con el valor previo. Yt = Xt −Xt−1
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [165] Regresar Transformación logarítmica: suele utilizarse para estabilizar una varianza que aumenta con el tiempo.
Yt = log(Xt)
5.1.4.
Visualización de series de tiempo La correcta visualización de series temporales es crucial para interpretar de manera precisa y eficiente los datos a lo largo del tiempo. Las visualizaciones gráficas como gráficos de líneas, de dispersión y de barras son esenciales ya que permiten identificar claramente patrones, tendencias y estacionalidades que podrían no ser obvias en los datos sin procesar Una buena visualización no solo muestra la evolución de los datos de manera intuitiva, sino que también resalta relaciones importantes y proporciona una comprensión más profunda de cómo y por qué los datos cambian. Sin una representación visual clara y bien diseñada, se pueden pasar por alto detalles significativos o interpretar incorrectamente la información, lo que puede llevar a conclusiones erróneas o decisiones mal informadas. Una forma de construir una serie de tiempo se basa en el siguiente diagrama de la figura: Ejemplo 5.1.1:
Se considera una serie de tiempo que representa la temperatura media mensual de una ciudad durante 10 años. La tendencia podría mostrar un aumento gradual de las temperaturas debido al cambio climático. La estacionalidad revelaría las variaciones típicas de las estaciones, con picos en verano y valles en invierno. Un ciclo podría estar presente debido a patrones climáticos a largo plazo como El Niño o La Niña. Finalmente, el ruido capturaría las variaciones diarias impredecibles en las temperaturas.
Preparación Visualización Configuración
1. Preparar
los Datos
2. Preprocesar
los Datos
3. Elegir
Técnica de Visualización
4. Método de
Visualización 4a. Gráfico de Líneas 4b. Diagrama de Dispersión 4c. Gráfico de Barras
5. Configurar
el Gráfico Fig. 5.5. Visualización de datos temporales
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [166] Regresar
TABLA XIX.
TEMPERATURA MEDIA MENSUAL: RANGOS
Componente Mínimo (°C) Máximo (°C) Media (°C) Desviación estándar (°C) Tendencia
20.0
26.0
23.0
1.73
Estacionalidad
-10.0
10.0
0.0
7.07
Ciclo
-5.0
5.0
0.0
3.54
Ruido
-5.59
5.94
0.02
2.04
Temperatura Total
12.82
36.38
23.0
7.77
Teniendo en cuenta los datos presentados en la tabla XIX, se se procede a detallar los componentes de la serie de tiempo:
Tendencia: la tendencia se modela mediante una función lineal, que captura un incremento gradual en la temperatura debido al cambio climático: T(t) = 0.02 × t Estacionalidad: la estacionalidad refleja las variaciones cíclicas anuales, con picos en verano y valles en invierno. Se utiliza una función sinusoidal para modelar este comportamiento:
S(t) = 10 × sin 2πt
12
Ciclo: el ciclo representa patrones a largo plazo como El Niño o La Niña. Se modela un ciclo con una frecuencia más baja que la estacionalidad: C(t) = 5 × sin 2πt
120
Ruido: el ruido captura las variaciones aleatorias impredecibles en la temperatura. Se modela como ruido blanco:
R(t) = np.random.normal(0, 1, size) Para este ejemplo, la serie de tiempo se compone de 1200 puntos, correspondientes a
10 años de datos mensuales. Para comprender mejor el comportamiento de la tempe-
ratura media mensual, es necesario descomponerla en sus componentes: tendencia, estacionalidad, ciclo y ruido.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [167] Regresar Finalmente, la serie de tiempo completa se obtiene sumando todos estos componentes: Y(t) = T(t) + S(t) + C(t) + R(t) La serie de tiempo generada se puede descomponer en sus componentes fundamentales: tendencia, estacionalidad, ciclo y ruido, lo que permite analizar cada uno de estos aspectos de manera individual.
La figura 5.6 muestra la serie de tiempo completa correspondiente a la temperatura media mensual registrada durante un período de 10 años. Se puede observar cómo la temperatura varía a lo largo del tiempo, con patrones que reflejan tanto tendencias a largo plazo como fluctuaciones periódicas y variaciones aleatorias. La combinación de estos elementos da lugar a la compleja estructura de la serie de tiempo observada, donde se pueden identificar ciertos picos y valles que podrían estar relacionados con cambios estacionales y fenómenos climáticos específicos.
En la figura 5.7 se presenta el componente de tendencia extraído de la serie de tiempo. La tendencia muestra un aumento gradual de la temperatura a lo largo de los 10 años, lo cual podría estar asociado con fenómenos como el cambio climático. La tendencia se modela mediante una ecuación lineal de la forma Tt = α + βt, donde α representa el valor inicial (20 °C) y β es la pendiente, indicando un aumento constante de 0.05 °C por mes. Esta tendencia refleja un cambio a largo plazo en la temperatura media mensual.
2010
2011
2012
2013
2014
2015
2016
2017
2018
2019
2020
Fecha
5
10
15
20
25
30
35
40
Temperatura (°C) Temperatura Fig. 5.6. Temperatura media mensual (Serie de tiempo)
2010
2011
2012
2013
2014
2015
2016
2017
2018
2019
18
20
22
24
26
28
Temperatura (°C) Fig. 5.7. Componente de tendencia de la serie de tiempo La figura 5.8 muestra el componente estacional de la serie de tiempo, que capta las fluctuaciones periódicas que se repiten anualmente. La estacionalidad se modela mediante una función sinusoidal de la forma St = A · sin 2πt
12
, donde A es la amplitud,
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [168] Regresar En la figura 5.9 se presenta el componente cíclico de la serie de tiempo. A diferencia de la estacionalidad, el ciclo capta fluctuaciones a más largo plazo que no siguen un patrón anual regular, como los efectos de fenómenos climáticos como El Niño o La Niña. El ciclo se modela mediante una función de menor frecuencia, Ct = B · cos πt
60
,
donde B es la amplitud que refleja la variabilidad cíclica (5 °C). Este componente destaca las variaciones cíclicas que ocurren en un plazo de varios años.
2010
2011
2012
2013
2014
2015
2016
2017
2018
2019
10.0
7.5
5.0
2.5
0.0
2.5
5.0
7.5
10.0
Temperatura (°C) Fig. 5.8. Componente de estacionalidad de la serie de tiempo
2010
2011
2012
2013
2014
2015
2016
2017
2018
2019
18
20
22
24
26
28
Temperatura (°C) Fig. 5.9. Componente Cíclico de la Serie de Tiempo
2010
2011
2012
2013
2014
2015
2016
2017
2018
2019
3
2
1
0
1
2
3
4
Temperatura (°C) Fig. 5.10. Componente de Ruido de la Serie de Tiempo Finalmente, la figura 5.10 muestra el componente de ruido, que representa las fluctuaciones aleatorias e impredecibles en la serie de tiempo. El ruido se modela como un representando la magnitud de las variaciones estacionales (10 °C). Este componente refleja los ciclos anuales de temperatura, con picos en los meses de verano y valles en los meses de invierno, típicos de los patrones climáticos estacionales.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [169] Regresar proceso estocástico con media cero y varianza constante, et ∼N(0, σ2). Este componente captura las variaciones que no pueden explicarse por la tendencia, la estacionalidad o el ciclo, y se manifiesta como pequeñas desviaciones alrededor de la serie de tiempo observada.
5.2.
MÉTODOS PARA VISUALIZAR SERIES DE TIEMPO
Para visualizar series de tiempo y analizar datos temporales de manera efectiva, es fundamental considerar los diversos métodos disponibles. Cada método ofrece una perspectiva única sobre los patrones y tendencias subyacentes en los datos. Por ejemplo, un gráfico de líneas permite identificar cambios continuos a lo largo del tiempo, mientras que un diagrama de dispersión puede resaltar relaciones entre variables en momentos específicos. Además, la elección del método adecuado no solo facilita la comprensión de los datos, sino que también es crucial para comunicar los hallazgos de manera clara y precisa. En este sentido, entender las fortalezas y limitaciones de cada técnica de visualización es esencial para realizar un análisis y obtener conclusiones significativas.
5.2.1.
Gráfico de líneas El gráfico de líneas representa puntos de datos a lo largo de un eje temporal y conecta estos puntos mediante una línea continua. Es eficaz para mostrar la evolución de una variable en el tiempo, permitiendo una visualización clara de las tendencias y patrones. Ventajas:
Observación de tendencias: permite identificar si los datos muestran una tendencia al alza, a la baja o si se mantienen estables.
Detección de patrones temporales: ayuda a reconocer ciclos estacionales o patrones recurrentes.
Comparación de series: facilita la comparación entre varias series de datos. Ejemplo 5.2.1:
Un análisis de ventas mensuales a lo largo de un año, puede mostrar claramente las fluctuaciones estacionales y cualquier tendencia de crecimiento o decrecimiento. Para
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [170] Regresar
TABLA XX.
VENTAS MENSUALES ALEATORIAS PARA EL AÑO 2023
Mes Ventas Enero
1200
Febrero
1350
Marzo
1450
Abril
1600
Mayo
1500
Junio
1700
Julio
1550
Agosto
1400
Septiembre
1650
Octubre
1750
Noviembre
1800
Diciembre
1900
En la figura 5.11, se muestra el gráfico de líneas que representa los datos de ventas mensuales para el año 2023, extraídos de la tabla XX. Cada punto en el gráfico refleja las ventas registradas para cada mes del año, y los puntos están conectados por una línea para visualizar la evolución de las ventas a lo largo del año. Enero Febrero Marzo Abril Mayo Junio Julio Agosto Septiembre Octubre Noviembre Diciembre Mes
1200
1300
1400
1500
1600
1700
1800
1900
Ventas Fig. 5.11. Ventas mensuales para el año 2023 proporcionar una comparación más detallada, se analizarán las ventas de dos años consecutivos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [171] Regresar Para comparar, a continuación se presentan los datos de ventas del año 2024: Fig. 5.12. Ventas mensuales para los años 2023 y 2024
TABLA XXI.
VENTAS MENSUALES ALEATORIAS PARA EL AÑO 2024
Mes Ventas Enero
1250
Febrero
1400
Marzo
1500
Abril
1650
Mayo
1550
Junio
1750
Julio
1600
Agosto
1450
Septiembre
1700
Octubre
1800
Noviembre
1850
Diciembre
1950
En la figura 5.12, se presenta el gráfico de líneas que ilustra la comparación entre las ventas mensuales de los años 2023 y 2024. Este gráfico permite visualizar las diferencias y similitudes en el comportamiento de las ventas a lo largo de los meses de ambos años. Los datos correspondientes al año 2024, que se muestran en detalle en la tabla XXI, están representados en el gráfico junto con los datos del año 2023. Enero Febrero Marzo Abril Mayo Junio Julio Agosto Septiembre Octubre Noviembre Diciembre Mes
1200
1300
1400
1500
1600
1700
1800
1900
Ventas Comparación de Ventas Mensuales: 2023 vs 2024
2023
2024
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [172] Regresar Ventajas:
Comparando ambos gráficos, se puede observar cómo las ventas han variado entre
2023 y 2024. Los picos y caídas en las ventas de cada mes se vuelven evidentes, así
como las diferencias en las tendencias generales entre los dos años.
5.2.2.
Diagrama de dispersión El diagrama de dispersión es una herramienta gráfica que permite visualizar la relación entre dos variables en una serie de tiempo. A través de este tipo de gráfico, es posible representar cada par de datos como un punto en un plano bidimensional, donde el eje X suele corresponder a una variable independiente y el eje Y a la variable dependiente. Este método es especialmente útil para explorar posibles correlaciones entre diferentes series temporales o variables, proporcionando una manera intuitiva de detectar patrones, tendencias y posibles relaciones causales; se siguen los siguientes pasos:
1. Definición de las variables: se denota la primera variable como X (variable indepen-
diente) y la segunda variable como Y (variable dependiente).
2. Recopilación de datos: se recopila un conjunto de pares de datos (xi, yi), donde cada
xi es un valor de la variable X y cada yi es el valor correspondiente de Y.
3. Graficación de los datos: para cada par (xi, yi), se dibuja un punto en un plano
cartesiano, con xi en el eje horizontal y yi en el eje vertical.
4. Análisis visual de la relación: se observa la disposición de los puntos para identificar
patrones:
Correlación positiva: si los puntos muestran una tendencia ascendente, Y aumenta a medida que X aumenta.
Correlación negativa: si los puntos muestran una tendencia descendente, Y disminuye a medida que X aumenta.
Sin correlación: si los puntos están dispersos sin un patrón claro, no hay una correlación significativa entre X y Y.
Exploración de correlaciones: permite visualizar la relación entre dos variables y ayuda a identificar correlaciones.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [173] Regresar Detección de anomalías: facilita la identificación de puntos atípicos que se desvían significativamente de la tendencia general.
Ejemplo 5.2.2:
Para analizar la relación entre la temperatura y el consumo de energía, se tiene los datos de la tabla XXII que permiten generar una serie temporal de datos que abarca desde el año 1998 hasta el año 2023. Estos datos incluyen la temperatura diaria y el consumo de energía en una ciudad. A través de un diagrama de dispersión, se busca revelar si un aumento o disminución en la temperatura está asociado con un mayor consumo energético.
TABLA XXII.
TEMPERATURA Y CONSUMO ENERGÉTICO
Fecha Temperatura (°C) Consumo (kWh)
1998-01-01
18.528105
254.565041
1998-01-02
15.806932
204.421466
1998-01-03
16.970711
205.573787
1998-01-04
19.501638
254.574476
1998-01-05
18.761585
228.978201
La temperatura sigue un patrón estacional que simula un ciclo anual, y se ha añadido ruido aleatorio para reflejar la variabilidad diaria. El consumo de energía también sigue un patrón estacional, influenciado por la temperatura, con un aumento en los días más fríos y calurosos (ver figura 5.13).
0
5
10
15
20
25
30
Temperatura (°C)
150
200
250
300
350
400
Consumo (kWh) Fig. 5.13. Temperatura y consumo de energía
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [174] Regresar Manejo de valores faltantes: los valores faltantes pueden ser imputados usando métodos como la interpolación lineal o técnicas basadas en modelos. Por ejemplo, para una serie temporal Yt, si un valor está faltando en el tiempo t, puede ser estimado como:
ˆYt = Yt−1 + Yt+1
2
donde ˆYt es la estimación del valor faltante.
Eliminación de outliers: los outliers pueden ser identificados y tratados mediante métodos estadísticos como el rango intercuartílico (IQR). Un punto se considera un outlier si:
Yt < Q1 −1.5 × IQR o Yt > Q3 + 1.5 × IQR donde Q1 y Q3 son el primer y tercer cuartil, respectivamente, y IQR = Q3 −Q1. Corrección de errores: los errores pueden ser corregidos utilizando técnicas de suavizamiento o ajustes basados en modelos previos.
La figura 5.13 muestra una tendencia lineal que, al ser un componente de la serie temporal, podría servir para realizar predicciones. Se observa que el aumento en el consumo energético está asociado con un incremento en la temperatura. Este hallazgo sugiere la necesidad de explorar variables adicionales, como el tiempo, para analizar cómo esta tendencia evoluciona a lo largo del período de estudio. Aunque no se evidencia claramente una serie temporal en el análisis actual, es posible agrupar los datos para examinar con mayor detalle el patrón de tendencia ascendente.
5.2.3.
Procesamiento y modelado de series temporales El preprocesamiento de datos es un paso estructural en el análisis de series temporales, ya que prepara los datos para una modelización efectiva. Esta etapa, permite explorar las técnicas de preprocesamiento que incluyen la limpieza de datos, las transformaciones y la normalización.
5.2.3.1.
Limpieza de datos La limpieza de datos involucra varios aspectos:
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [175] Regresar
5.2.3.2.
Transformaciones Las transformaciones ayudan a estabilizar la varianza y hacer que los datos sean más estacionarios:
Transformaciones logarítmicas: la transformación logarítmica puede estabilizar la varianza de una serie temporal. Para una serie Yt, la transformación logarítmica es: Y′ t = log(Yt) Diferencias temporales: la diferenciación se utiliza para eliminar tendencias y estacionalidades. La diferencia de primer orden se define como: ∆Yt = Yt −Yt−1
5.2.4.
Normalización y escalado La normalización y el escalado aseguran que las variables tengan la misma escala. aplicar esta transformación.
Escalado (Estandarización - Z-score): El escalado estandariza los datos para tener una media de 0 y una desviación estándar de 1:
Y′ t = Yt −µ σ donde µ es la media y σ es la desviación estándar de la serie temporal. Normalización (Min-Max Scaling): La normalización se realiza para transformar los datos a un rango específico, típicamente [0, 1]. La fórmula utilizada es: Y′ t = Yt −m´ın(Y) m´ax(Y) −m´ın(Y) Advertencia: Dado que esta técnica depende directamente de los valores m´ın(Y) y m´ax(Y), la normalización es altamente sensible a los outliers. Por ello, es crucial asegurar que los valores atípicos hayan sido tratados adecuadamente (como se explicó en la sección Limpieza de datos (ver sección 5.2.3.1, página )) antes de
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [176] Regresar Ejemplo 5.2.3:
Antes de realizar cualquier preprocesamiento, es importante examinar los datos iniciales observados en la tabla XXIII que muestra un consumo energético diario. La tabla contiene valores faltantes y outliers que deben ser tratados.
TABLA XXIII.
CONSUMO ENERGÉTICO DIARIO
Día Consumo (kWh)
1
35.0
2
37.2
3
4
40.1
5
50.5
6
52.1
7
100.0
8
39.8
9
10
37.0
11
36.8
12
37.5
En la tabla XXIII, algunos valores están faltantes y hay un valor que claramente parece un outlier.
Manejo de valores faltantes: los valores faltantes en los días 3 y 9 deben ser imputados. Se usará la interpolación lineal para estimar estos valores. La interpolación lineal entre dos valores conocidos Yt−1 y Yt+1 para un valor faltante en t se calcula como: ˆYt = Yt−1 + Yt+1
2
Aplicando esta técnica:
- Para el día 3:
ˆY3 = 37.2 + 40.1
2
= 38.65
- Para el día 9:
ˆY9 = 37.0 + 36.8
2
= 36.9
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [177] Regresar Eliminación de Outliers: el valor en el día 7, que es 100.0 kWh, parece ser un outlier. Se usará el rango intercuartílico para identificar outliers. Primero se calcula Q1, Q3 y IQR para los valores conocidos.
- Q1 = 36.8
- Q3 = 50.5
- IQR = Q3 −Q1 = 50.5 −36.8 = 13.7
Un punto se considera un outlier si:
Yt < Q1 −1.5 × IQR o Yt > Q3 + 1.5 × IQR Calculando los límites:
Q1 −1.5 × IQR = 36.8 −20.55 = 16.25
Q3 + 1.5 × IQR = 50.5 + 20.55 = 71.05
Dado que 100.0 kWh >71.05 kWh, el valor en el día 7 es un outlier y se recomienda eliminarlo o ajustarlo.
Las transformaciones pueden ayudar a estabilizar la varianza de los datos. Transformaciones logarítmicas: para estabilizar la varianza, aplicamos la transformación logarítmica a los datos:
Y′ t = log(Yt) Por ejemplo, para el valor de consumo en el día 4, transformamos: Y′
4 = log(40.1) ≈3.60
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [178] Regresar Escalado: se estandarizan los datos para que tengan una media de 0 y una desviación estándar de 1:
Y′ t = Yt −µ σ Donde µ es la media y σ es la desviación estándar. Suponiendo que µ = 41.0 y σ = 5.0. El escalado para el día 4 es:
Y′
4 = 40.1 −41.0
5.0
= −0.18 La figura 5.14 ilustra el proceso de preprocesamiento de datos en una serie temporal de consumo energético diario. Esta visualización abarca varias etapas clave: datos originales, imputación de valores faltantes, eliminación de outliers, transformación logarítmica y normalización.
Diferencias temporales: para eliminar tendencias, se calcula la diferencia de primer orden:
∆Yt = Yt −Yt−1 Para el día 4, la diferencia con el día 3 es:
∆Y4 = 40.1 −38.65 = 1.45 Finalmente, se normaliza y se escalan los datos para que estén en una escala comparable.
Normalización: se normalizan los datos para que estén en el rango [0, 1]: Y′ t = Yt −m´ın(Y) m´ax(Y) −m´ın(Y) Con m´ın(Y) = 35.0 y m´ax(Y) = 52.1. La normalización para el día 4 es: Y′
4 = 40.1 −35.0
52.1 −35.0 ≈0.32
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [179] Regresar Datos originales y Outliers: la primera subgráfica muestra los datos originales de consumo energético diario. Se destacan los valores de consumo en azul y los outliers (identificados con una X roja) que se encuentran fuera del rango intercuartílico (IQR). Estos puntos distorsionan el análisis y deben ser tratados antes de aplicar transformaciones.
Transformación logarítmica: la segunda subgráfica presenta los datos después de ser limpiados (sin el outlier) y de aplicar la transformación logarítmica. Esta técnica es útil para estabilizar la varianza y reducir el impacto de fluctuaciones. Normalización: la tercera subgráfica muestra los datos limpios y normalizados en un rango de [0, 1]. La normalización asegura que todas las variables tengan la misma escala.
40
60
80
100
Consumo (kWh) Consumo energético diario (original y outliers) Consumo Original Outlier
3.6
3.7
3.8
3.9
Log(Consumo) Consumo energético diario (logarítmico) Consumo Logarítmico
1
2
3
4
5
6
7
8
9
10
11
12
Día
0.0
0.2
0.4
0.6
0.8
1.0
Consumo Normalizado Consumo energético diario (normalizado) Consumo Normalizado Fig. 5.14. Proceso de preprocesamiento de datos: (arriba) Consumo energético diario original y outliers, (centro) Consumo energético diario después de la transformación logarítmica, (abajo) Consumo energético diario después de la normalización
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [180] Regresar
5.3.
MODELOS DE SERIES DE TIEMPO
Una vez que una serie temporal ha sido preparada y analizada, se pueden aplicar diversos modelos para su análisis y pronóstico. Estos modelos van desde técnicas simples de suavizado hasta formulaciones complejas capaces de capturar tendencias y ciclos estacionales.
5.3.1.
Modelos de suavizado El objetivo de estos métodos es atenuar las fluctuaciones de corto plazo (ruido) para revelar patrones subyacentes, como la tendencia.
Media móvil: esta técnica promedia los valores dentro de una ventana de tiempo deslizante para suavizar la serie. La media móvil de k períodos se define como: MAt = 1 k k−1 ∑ i=0 Yt−i Suavizamiento exponencial: asigna pesos que decrecen exponencialmente a las observaciones pasadas, dando más importancia a los datos más recientes. El suavizamiento exponencial simple se define como:
St = αYt + (1 −α)St−1 donde α (0 < α < 1) es el parámetro de suavizamiento.
5.3.2.
Modelos ARIMA ARIMA (AutoRegressive Integrated Moving Average): es un modelo muy versátil que combina tres componentes para modelar series estacionarias y no estacionarias. Se denota como ARIMA(p, d, q), donde:
• p es el orden de la parte AutoRegresiva (AR).
• d es el número de diferenciaciones para hacer la serie estacionaria (Integrada).
• q es el orden de la parte de Madia Móvil (MA, del inglés Moving Average).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [181] Regresar La ecuación general de ARIMA se expresa de forma compacta como: ϕ(B)(1 −B)dYt = θ(B)εt donde ϕ(B) y θ(B) son los polinomios de los operadores autorregresivos y de media móvil, respectivamente; (1 −B)d representa las d diferenciaciones y εt es el ruido blanco.
5.3.3.
Modelos SARIMA SARIMA (Seasonal ARIMA): es una potente extensión del modelo ARIMA que está diseñada específicamente para manejar la estacionalidad. Se denota formalmente como SARIMA(p, d, q)(P, D, Q, s), donde P, D, Q son los parámetros estacionales y s es el período de la estacionalidad (ej. s = 12 para datos mensuales). Su ecuación general es:
ϕp(B)ΦP(Bs)(1 −B)d(1 −Bs)DYt = θq(B)ΘQ(Bs)εt donde Φ(Bs) y Θ(Bs) son los polinomios de los operadores estacionales.
5.3.4.
Modelos GARCH GARCH (Generalized Autoregressive Conditional Heteroskedasticity): a diferencia de los modelos anteriores que modelan el valor medio de la serie, GARCH se especializa en modelar su volatilidad variable en el tiempo. Es fundamental en finanzas para analizar series donde los períodos de alta variabilidad tienden a agruparse. La formulación del modelo GARCH(p, q) es:
σ2 t = ω + q ∑ i=1 αiε2 t−i + p ∑ j=1 βjσ2 t−j donde σ2 t es la varianza condicional, ε2 t−i son los errores al cuadrado (volatilidad pasada) y σ2 t−j es la varianza condicional pasada.
Ejemplo 5.3.1:
Pronóstico de pasajeros aéreos: el objetivo de este ejemplo es comparar el desempeño de los modelos ARIMA y SARIMA en el pronóstico de una serie temporal clásica, demostrando por qué es crucial modelar la estacionalidad para ob-
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [182] Regresar
1950
1952
1954
1956
1958
1960
Año
100
200
300
400
500
600
Número de pasajeros Serie temporal de pasajeros aéreos (1949 1960) Pasajeros Fig. 5.15. Serie temporal de pasajeros aéreos (1949–1960), con tendencia, estacionalidad y varianza crecientes Para confirmar la tendencia, se aplica una media móvil de 12 meses (figura 5.16). Esta técnica suaviza los picos estacionales y expone claramente la trayectoria ascendente de la serie.
1950
1952
1954
1956
1958
1960
Año
100
200
300
400
500
600
Número de pasajeros Serie y media móvil Serie original Media móvil (12 meses) Fig. 5.16. La media móvil de 12 meses filtra la estacionalidad y resalta la tendencia subyacente tener predicciones precisas. Para este, se hace uso del dataset AirPassengers [13] que contiene el número mensual de pasajeros de aerolíneas (1949-1960). Análisis Exploratorio de la Serie El primer paso es siempre visualizar los datos. La figura 5.15 revela tres características clave de la serie: una tendencia creciente a largo plazo, una fuerte estacionalidad anual (picos en verano) y una varianza creciente (las fluctuaciones son mayores a medida que pasa el tiempo).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [183] Regresar Modelado y pronóstico Modelo 1: ARIMA.
Un modelo ARIMA(p, d, q) está diseñado para capturar la estructura de autocorrelación y la tendencia, pero no es funcional para los patrones estacionales. La figura 5.17 muestra que el pronóstico ARIMA sigue correctamente la tendencia general, pero falla por completo en predecir los ciclos anuales, produciendo una simple línea ascendente.
1950
1952
1954
1956
1958
1960
1962
1964
100
200
300
400
500
600
Pronóstico con ARIMA Serie original Pronóstico ARIMA Fig. 5.17. Pronóstico con ARIMA: captura la tendencia, pero ignora por completo la estacionalidad Modelo 2: SARIMA.
El modelo SARIMA, al incluir componentes estacionales, está diseñado para este tipo de datos. El resultado en la figura 5.18 es notablemente superior. El pronóstico no solo sigue la tendencia creciente, sino que también reproduce con gran precisión los picos y valles estacionales esperados.
1950
1952
1954
1956
1958
1960
1962
1964
100
200
300
400
500
600
700
Pronóstico con SARIMA (estacionalidad) Serie original Pronóstico SARIMA Fig. 5.18. Pronóstico con SARIMA: captura exitosamente tanto la tendencia como los ciclos estacionales
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [184] Regresar análisis real, el siguiente paso sería diagnosticar los residuos del modelo SARIMA para asegurar que no queden patrones sin explicar.
5.4.
ANÁLISIS Y DESCOMPOSICIÓN
El análisis y la descomposición de series temporales permiten descomponer una serie en sus componentes fundamentales y entender mejor la estructura subyacente de los datos.
5.4.1.
Descomposición STL La descomposición STL (Seasonal and Trend decomposition using Loess) es una técnica flexible que utiliza suavizamiento local (Loess) para descomponer una serie temporal en sus componentes:
Tendencia (T): estimada usando un suavizamiento local que permite flexibilidad en la captura de cambios en la tendencia.
Estacionalidad (S): capturada a través de la descomposición local de las series temporales.
Residual (R): calculado como:
Rt = Yt −Tt −St La descomposición STL se realiza mediante un enfoque iterativo que ajusta la tendencia y la estacionalidad para minimizar el residual.
Conclusión Este análisis comparativo demuestra que la elección del modelo es fundamental. Mientras que el modelo ARIMA es una herramienta robusta para series no estacionales, es insuficiente cuando existen patrones cíclicos claros. El modelo SARIMA, en cambio, brilla en este escenario, produciendo pronósticos significativamente más precisos y realistas al modelar explícitamente tanto la tendencia como la estacionalidad. En un
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [185] Regresar
5.4.2.
Análisis de autocorrelación El análisis de autocorrelación ayuda a entender las relaciones temporales en la serie: Función de Autocorrelación (ACF): mide la correlación entre una serie temporal y versiones rezagadas de sí misma. La función de autocorrelación se define como: ρk = Cov(Yt, Yt−k) Var(Yt) donde ρk es la autocorrelación en el rezago k.
Función de autocorrelación parcial (PACF): mide la correlación entre una serie temporal y versiones rezagadas, eliminando el efecto de las autocorrelaciones intermedias. Se define como:
ϕk = ACF(k) − k−1 ∑ j=1 ϕjACF(k −j) Ejemplo 5.4.1:
Descomposición y autocorrelación en la serie AirPassengers. Antes de aplicar un modelo de pronóstico, es fundamental realizar un análisis diagnóstico para entender la estructura subyacente de los datos. Este ejemplo ilustra cómo la descomposición de una serie y el análisis de su autocorrelación permiten entender los datos e identificar sus patrones de tendencia, estacionalidad y dependencia temporal. Se utiliza nuevamente el dataset AirPassengers [13] (1949-1960), un caso de estudio ideal porque combina de forma muy clara una tendencia creciente, ciclos estacionales anuales y ruido residual.
Descomposición de la Serie La primera técnica es descomponer la serie en sus componentes principales. La descomposición STL (Seasonal and Trend decomposition using Loess), mostrada en la figura 5.19, permite aislar y visualizar cada patrón de forma independiente: Tendencia: el segundo panel revela un crecimiento sostenido y casi lineal en la demanda de vuelos a lo largo de los años.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [186] Regresar
250
500
Pasajeros (Observado)
250
500
Trend Tendencia
100
0
100
Season Estacionalidad
1950
1952
1954
1956
1958
1960
10
0
10
Resid Residuo Fig. 5.19. Descomposición STL de la serie AirPassengers, separando la tendencia, la estacionalidad y el residuo Análisis de autocorrelación A continuación, se utiliza las funciones de autocorrelación para cuantificar la dependencia temporal de la serie.
Estacionalidad: el tercero panel aísla perfectamente los picos recurrentes cada 12 meses, confirmando la fuerte estacionalidad anual (mayor demanda en los meses de verano).
Residual: el último panel muestra las variaciones aleatorias que no son explicadas por la tendencia ni la estacionalidad. Idealmente, este componente debería parecer ruido blanco.
Esta separación es crucial, pues confirma que cualquier modelo que se elija deberá ser capaz de manejar tanto una tendencia como un componente estacional.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [187] Regresar Función de autocorrelación (ACF): mide la correlación total de la serie consigo misma en diferentes retardos (lags). Responde a la pregunta: ¿cómo se relaciona el valor de hoy con el de ayer, el de hace dos días, etc., incluyendo todas las influencias indirectas?
Función de autocorrelación parcial (PACF): mide la correlación directa entre la serie y un retardo, eliminando el efecto de las correlaciones intermedias. La figura 5.20 es extremadamente informativa. Se observan dos patrones clave:
1. Decaimiento lento: las correlaciones se mantienen muy altas y decrecen muy
lentamente. Este es el signo clásico de una serie no estacionaria, principalmente debido a la fuerte tendencia que vimos en la descomposición.
2. Patrón ondulatorio: la curva tiene una forma de onda con picos significativos
(fuera del área sombreada de confianza) en los retardos 12, 24, 36, etc. Esta es la firma inconfundible de una estacionalidad anual (período s = 12).
0
5
10
15
20
25
30
35
40
Retrasos (Lags)
1.00
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Autocorrelation Función de Autocorrelación (ACF) Fig. 5.20. Función de autocorrelación (ACF) de la serie AirPassengers
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [188] Regresar
0
5
10
15
20
25
30
35
40
Retrasos (Lags)
1.00
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Partial Autocorrelation Función de Autocorrelación Parcial (PACF) Fig. 5.21. Función de autocorrelación parcial (PACF) de la serie AirPassengers Conclusión del Diagnóstico La descomposición STL y el análisis de autocorrelación da un diagnóstico claro: la serie de pasajeros es no estacionaria, está dominada por una tendencia creciente y una marcada estacionalidad anual, y presenta una fuerte dependencia autorregresiva. Este diagnóstico justifica plenamente por qué un modelo como SARIMA es la elección adecuada, ya que está diseñado precisamente para manejar todas estas características. La figura 5.21 ayuda a identificar la estructura autorregresiva directa. El patrón más destacado es:
1. Pico significativo en el retardo 1: existe un pico muy fuerte y estadísticamente
significativo en el primer retardo, lo que sugiere una fuerte dependencia del valor de un mes con respecto al mes inmediatamente anterior.
2. Corte abrupto: después del segundo retardo, los demás picos caen rápidamente
dentro del intervalo de confianza. Este corte después de uno o dos picos iniciales es característico de un proceso autorregresivo (AR).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [189] Regresar Los gráficos ACF y PACF son las herramientas que guían para seleccionar los órdenes específicos (p, d, q) y (P, D, Q) del modelo.
5.5.
PREDICCIÓN Y FORECASTING
El forecasting consiste en proyectar valores futuros a partir de patrones históricos en una serie temporal. Su objetivo no es solo predecir, sino también entender la dinámica de la serie, evaluar la incertidumbre y apoyar la toma de decisiones. Existen enfoques clásicos (ARIMA, SARIMA, suavizamiento) y enfoques modernos basados en machine learning, que permiten modelar relaciones más complejas. Además, la visualización de datos (gráficas de la serie original, comparaciones de pronóstico vs. real, curvas de error) es fundamental para interpretar resultados y validar modelos.
5.5.1.
Evaluación de Modelos Para medir la precisión de un modelo de forecasting se utilizan diversas métricas de error. Cada una ofrece información distinta sobre la calidad de las predicciones: MAE (Error Absoluto Medio):
MAE = 1
n n ∑ t=1 |Yt −ˆYt| Representa el promedio de las diferencias absolutas entre valores reales y predichos. Es fácil de interpretar: mide, en promedio, cuánto se desvía el modelo de los datos observados en las mismas unidades de la serie.
RMSE (Raíz del Error Cuadrático Medio):
RMSE =
1
n n ∑ t=1 (Yt −ˆYt)2 Penaliza más los errores grandes, ya que eleva las diferencias al cuadrado antes de promediarlas. Es útil cuando los errores grandes son más costosos o críticos en la aplicación.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [190] Regresar
5.5.2.
Modelos de Machine Learning En el forecasting moderno se aplican modelos de aprendizaje automático que permiten capturar relaciones no lineales, interacciones complejas y patrones de largo plazo. A diferencia de los modelos clásicos (ARIMA, SARIMA), estos no suponen estacionariedad estricta ni dependen solo de rezagos de la serie, sino que pueden incorporar múltiples variables exógenas (clima, calendario, economía, etc.). Algunos modelos representativos son:
Random Forest: basado en la agregación de múltiples árboles de decisión, cada uno entrenado sobre subconjuntos aleatorios de datos y variables. Es robusto frente al ruido y maneja relaciones no lineales. En forecasting, puede usarse para predecir valores futuros incorporando tanto rezagos de la serie como variables adicionales. XGBoost y LightGBM: son algoritmos de boosting que entrenan árboles de decisión de manera secuencial, corrigiendo los errores de los árboles anteriores. Suelen superar a Random Forest en precisión y velocidad, siendo muy efectivos en competiciones de predicción. Son útiles para forecasting con datos tabulares y múltiples variables externas.
Redes Neuronales Recurrentes (RNN), LSTM y GRU: las RNN están diseñadas para manejar datos secuenciales. Sin embargo, sufren de problemas de gradientes al modelar dependencias largas. Las variantes LSTM (Long Short-Term Memory) y GRU (Gated Recurrent Units) superan esta limitación, permitiendo capturar dependencias MAPE (Error Porcentual Absoluto Medio):
MAPE = 100
n n ∑ t=1
Yt −ˆYt Yt
Expresa el error como un porcentaje respecto a los valores reales. Permite interpretar el error relativo (ejemplo: un MAPE del 5 % significa que, en promedio, las predicciones se desvían un 5 % del valor real). Sin embargo, puede ser problemático si hay valores reales cercanos a cero.
Estas métricas se complementan: mientras el MAE refleja el error medio en magnitud, el RMSE enfatiza los errores grandes y el MAPE facilita comparaciones en términos relativos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [191] Regresar de corto y largo plazo, lo que las hace muy efectivas en forecasting de series temporales con fuerte estructura secuencial.
Support Vector Regression (SVR): extiende las máquinas de soporte vectorial a problemas de regresión. Utilizando funciones kernel, permite modelar relaciones no lineales en los datos. Es útil en forecasting cuando las series presentan patrones complejos y no lineales.
5.5.3.
Visualización en Forecasting La visualización es una herramienta indispensable en forecasting, tanto para análisis exploratorio como para validar modelos. Algunas técnicas incluyen: Gráficas de la serie original: muestran tendencias, estacionalidad y outliers. Comparación predicción vs. real: superponer las predicciones sobre la serie real permite evaluar visualmente la calidad del modelo.
Curvas de error: ilustran la evolución del error a lo largo del tiempo. Intervalos de confianza: representan la incertidumbre del pronóstico, mostrando no solo el valor esperado sino también los posibles rangos de variación. Importancia de variables (en ML): en modelos como Random Forest o XGBoost, ayuda a interpretar qué factores externos influyen más en la predicción. Las métricas (MAE, RMSE, MAPE) permiten cuantificar el error bajo diferentes perspectivas, mientras que los modelos de Machine Learning amplían la capacidad de capturar patrones no lineales y complejos. La visualización complementa el análisis, brindando una validación intuitiva y facilitando la comunicación de los resultados a audiencias técnicas y no técnicas.
Ejemplo 5.5.1:
Forecasting de demanda energética con Machine Learning: Para ilustrar los conceptos de forecasting, métricas de evaluación y visualización, se desarrolla un ejemplo práctico. El objetivo es predecir la demanda de energía horaria utilizando un conjunto de datos público.
Problema: una compañía eléctrica necesita anticipar la demanda de energía con la mayor precisión posible para optimizar la generación y distribución, evitando sobrecostos o desabastecimientos.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [192] Regresar Dataset: se utiliza el dataset ”Hourly Energy Consumption” de American Electric Power (AEP), disponible en Kaggle Dataset [14]. Este contiene registros horarios del consumo de energía en Megawatts (MW) desde 2004 hasta 2018.
Análisis exploratorio y visualización inicial El primer paso es siempre entender los datos. La visualización es la principal herramienta en esta fase.
Gráfica de la serie original: se visualiza la serie completa para identificar patrones a gran escala. En la demanda energética, se espera ver una tendencia creciente a lo largo de los años y una estacionalidad anual muy marcada (picos en verano por el aire acondicionado y en invierno por la calefacción).
2006
2008
2010
2012
2014
2016
2018
Año
10000
12000
14000
16000
18000
20000
22000
24000
26000
Consumo (MW) Demanda Energética Horaria (20042018) Fig. 5.22. Serie de tiempo completa de la demanda energética horaria (2004-2018) La gráfica observada en la figura 5.22 muestra los megavatios (MW) consumidos por hora a lo largo de varios años. Se observa una tendencia general ascendente y ciclos repetitivos anuales, que confirman la estacionalidad del consumo. También se pueden detectar puntos atípicos (outliers) que podrían corresponder a eventos extremos o errores en los datos.
Análisis de estacionalidad y autocorrelación: para entender los patrones repetitivos, se pueden usar dos visualizaciones clave:
1. Gráfica de descomposición: separa la serie en sus componentes principales:
tendencia, estacionalidad y residuo.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [193] Regresar
2. Gráfica de autocorrelación (ACF): muestra cómo se correlaciona la serie con
sus valores pasados (rezagos o lags). Un pico en el rezago 24, indicaría una fuerte correlación diaria.
10000
15000
20000
25000
Observado
14400
14500
14600
14700
14800
Tendencia
5000
2500
0
2500
5000
7500
Estacionalidad 201501 201504 201507 201510 201601 201604 201607 201610 201701 Datetime
1000
500
0
500
Residuo Descomposición de la Serie Temporal (20152016) Fig. 5.23. Descomposición de la serie en tendencia, estacionalidad y residuo La figura 5.23 muestra que la descomposición revela claramente: (1) una tendencia creciente y suave, (2) un patrón estacional anual consistente y (3) un residuo que parece aleatorio, indicando que se ha capturado bien los patrones principales.
0
25
50
75
100
125
150
175
Rezagos (Lags) en horas
1.00
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Autocorrelación Función de Autocorrelación (ACF) para 7 días Fig. 5.24. Función de autocorrelación (ACF) con rezagos horarios
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [194] Regresar de una hora está muy relacionado con el de la misma hora del día anterior y de la semana anterior.
Preparación de datos y modelado A diferencia de los modelos estadísticos clásicos, los modelos de Machine Learning no usan el tiempo como un índice, sino como una característica (feature). Por ello, se crean variables a partir de la fecha y hora:
Hora del día (0-23), día de la semana (1-7), día del mes (1-31), mes del año (1-12), año.
Se dividen los datos en un conjunto de entrenamiento (2004-2016) y uno de prueba (2017-2018). Para este ejemplo, se elige LightGBM, un modelo de boosting rápido y preciso.
Evaluación del modelo y matemática básica Una vez entrenado el modelo, se hacen predicciones sobre el conjunto de prueba y se calculan las métricas de error. Se supone que se tienen los siguientes 4 puntos de datos:
TABLA XXIV.
EJEMPLO DE CÁLCULO DE MÉTRICAS DE ERROR
Hora Real (Yt) Predicho ( ˆYt) Error Abs.
Error Cuad.
Error % Abs.
1
1500 MW
1550 MW
50
2500
3.33 %
2
1620 MW
1600 MW
20
400
1.23 %
3
1750 MW
1710 MW
40
1600
2.28 %
4
1680 MW
1740 MW
60
3600
3.57 %
Suma
170
8100
10.41 %
El gráfico ACF de la figura 5.24 confirma una fuerte correlación con los rezagos 24 (diaria), 48, etc., y también con el rezago 168 (semanal). Esto dice que el consumo
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [195] Regresar
MAE: MAE = 1
4(170) = 42.5 MW. En promedio, las predicciones se desvían 42.5 MW.
RMSE: RMSE =
1
4(8100) = √
2025 = 45.0 MW. Penaliza más los errores
grandes.
MAPE: MAPE =
1
4(10.41 %) = 2.60 %. En promedio, el error es del 2.60 % respecto al valor real.
Visualización de resultados y conclusiones Comparación de la predicción vs. real: es la gráfica más importante para evaluar un modelo de forecasting.
20180301 20180302 20180303 20180304 20180305 20180306 20180307 20180308 Fecha
12000
13000
14000
15000
16000
17000
Consumo (MW) Comparación de Predicción vs. Valor Real (1ra Semana de Marzo 2018) Valor Real Predicción (LightGBM) Fig. 5.25. Comparación de los valores reales vs. los predichos por el modelo En la figura 5.25 la línea azul representa el consumo real y la naranja, las predicciones. Visualmente, el modelo sigue la dinámica de la serie de manera precisa, capturando tanto los picos diarios como las variaciones semanales. Importancia de las variables: permite ver qué variables fueron más útiles para la predicción.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [196] Regresar
0
200
400
600
800
1000
1200
Importancia (Ganancia en Splits) dia_del_año hora año dia_del_mes dia_semana mes trimestre Variable Importancia de las Variables en el Modelo LightGBM Fig. 5.26. Importancia de las variables según el modelo LightGBM El gráfico de barras de la figura 5.26 ordena las variables por su contribución al modelo. Se observa que la hora del día es el predictor más importante, seguido por el mes, año y el "día de la semana".
Finalmente, ¿qué visualizaciones se adaptan mejor?
No existe una única visualización; un buen análisis de forecasting se basa en un conjunto complementario de gráficos.
Para el análisis exploratorio: las gráficas de serie original (figura 5.22), descomposición (figura 5.23) y autocorrelación (ACF) (figura 5.24) son fundamentales. Para la evaluación del modelo: la comparación predicción vs. real (figura 5.25) es la herramienta más directa y poderosa.
Para la interpretabilidad: la gráfica de importancia de variables (figura 5.26) es crucial para entender el porqué de las predicciones.
Representaciones para aprendizaje automático Capítulo 6
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [201] Regresar En la era actual, la inteligencia artificial y en particular, el aprendizaje automático no solo ha emergido como una herramienta poderosa en aplicaciones de ingeniería, sino también como un pilar en diversos campos, ampliando las funcionalidades de los sistemas existentes. Su capacidad para analizar grandes conjuntos de datos y extraer patrones complejos ha revolucionado industrias que van desde la salud hasta el comercio electrónico. Sin embargo, la verdadera comprensión de los resultados del aprendizaje automático está ligada a la visualización de datos. La visualización eficaz no solo facilita la comunicación de ideas complejas, sino que también permite la detección de patrones sutiles que podrían pasar desapercibidos de otra manera. Desde diagramas de dispersión hasta mapas de calor, las herramientas de visualización transforman los datos crudos en información procesable, lo que impulsa la toma de decisiones informada y la innovación continua en el ámbito del aprendizaje automático.
A través del aprendizaje automático, es posible abordar diferentes problemas como por ejemplo regresión, clasificación y agrupamiento entre los más clásicos. Así mismo, enfrenta diversos desafíos y uno de los más prominentes es la evaluación y comprensión de los datos y la eficacia de los modelos.
La visualización traduce las métricas abstractas en una comprensión práctica. Una alta precisión puede ser engañosa, pero una matriz de confusión revela fallos en clases minoritarias. Un error bajo puede ocultar un sesgo sistemático que solo un gráfico de residuales detecta. Y la calidad de un agrupamiento se valida visualmente con un diagrama de dispersión.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [202] Regresar Por ello, los gráficos no son meras herramientas de presentación, sino un componente indispensable para el diagnóstico, la depuración y la validación de cualquier modelo de aprendizaje automático.
6.1.
PREPROCESAMIENTO
En el aprendizaje automático, los modelos son tan buenos como los datos que los alimentan. El preprocesamiento es el arte de limpiar, transformar y esculpir los datos crudos para convertirlos en una base de alta calidad para el modelado. Este proceso, combinado con una visualización inteligente, nos permite entender la estructura de la información y tomar decisiones informadas antes de entrenar cualquier algoritmo. A continuación, se presentan tres pasos visuales clave en esta etapa. Paso 1: ¿Están las clases balanceadas? El primer paso es revisar la distribución de las etiquetas. Un desbalance severo (una clase con muchas más muestras que otras) puede hacer que el modelo se vuelva perezoso y sesgado hacia la clase mayoritaria. Visualizar esto ayuda a decidir si se necesita aplicar técnicas de balanceo como SMOTE para crear un conjunto de datos más equitativo.
0
1
2
Clase
0
100
200
300
400
500
600
700
800
Número de Muestras Antes del Balanceo (Desbalanceado)
0
1
2
Clase
0
100
200
300
400
500
600
700
800
Número de Muestras Después del Balanceo (SMOTE) Fig. 6.1. Comparación de la distribución de clases antes (izquierda) y después (derecha) de aplicar una técnica de balanceo como
SMOTE
Paso 2: ¿Hay valores atípicos (outliers)?
Los outliers son datos que se desvían drásticamente del resto. Pueden distorsionar el entrenamiento del modelo, especialmente en algoritmos sensibles a la escala. El diagrama de caja (boxplot) es la herramienta ideal para detectarlos visualmente, mostrando los puntos que caen fuera de los rangos esperados (los "bigotes").
1
20
40
60
80
100
120
Edad Boxplot de edades Fig. 6.2. Diagrama de caja. Los puntos individuales son identificados como posibles valores atípicos
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [203] Regresar Paso 3: ¿Existen variables redundantes?
En datasets con muchas variables, es común encontrar redundancia. Un mapa de calor de correlación permite identificar variables que están fuertemente relacionadas entre sí, lo que podría causar problemas de multicolinealidad. Esto guía para decidir si se debe eliminar alguna de ellas.
Ingresos Gastos Ahorros Deuda Ingresos Gastos Ahorros Deuda
1.00
0.11
0.08
-0.06
0.11
1.00
0.06
0.08
0.08
0.06
1.00
0.13
-0.06
0.08
0.13
1.00
Mapa de calor de correlaciones
0.0
0.2
0.4
0.6
0.8
1.0
Fig. 6.3. Mapa de calor de correlaciones. Los colores intensos señalan pares de variables altamente correlacionadas Técnica Avanzada: PCA Además de eliminar variables, se pueden usar técnicas como el Análisis de Componentes Principales (PCA) para reducir la dimensionalidad. PCA transforma las variables originales en un nuevo conjunto de componentes no correlacionadas, permitiendo visualizar la estructura de datos complejos en 2D o 3D y a menudo mejorando la separación entre clases.
6
4
2
0
2
4
6
Componente Principal 1
6
4
2
0
2
4
Componente Principal 2 Visualización de Datos con PCA (2 Componentes) Clase
0
1
2
Fig. 6.4. Visualización de datos de alta dimensión reducidos a dos componentes principales con PCA, mostrando una mejor separación de las clases
6.2.
REGRESIÓN
La regresión, en sus diversas formas como la regresión lineal, polinómica o de árboles de decisión, permite modelar la relación entre una variable dependiente y una o más variables independientes, lo que facilita la predicción de valores numéricos. Sin embargo, comprender la calidad y la validez de un modelo de regresión es esencial, y ahí es donde entra en juego la visualización de datos. Gráficos como diagramas de
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [204] Regresar dispersión, curvas de regresión y gráficos residuales proporcionan una representación visual de cómo se ajusta el modelo a los datos y si se cumplen las suposiciones subyacentes, como la linealidad y la homocedasticidad. Estas visualizaciones no solo permiten identificar patrones y tendencias en los datos, sino que también ayudan a diagnosticar posibles problemas en el modelo, como la presencia de valores atípicos o la falta de ajuste. Estas visualizaciones no solo permiten identificar patrones, sino que también ayudan a diagnosticar problemas en el modelo. La herramienta más importante para este diagnóstico es el gráfico de residuales, que grafica los errores del modelo. La figura 6.5 ilustra cómo un gráfico de residuales alerta sobre un mal ajuste. En un modelo correcto (izquierda), los errores se distribuyen aleatoriamente alrededor de cero. En un modelo incorrecto (derecha), los errores forman un patrón claro, indicando que el modelo no ha capturado la verdadera relación en los datos.
0
2
4
6
8
10
Variable Independiente
5
10
15
20
25
Variable Dependiente 1A: Modelo Bien Ajustado (Lineal) Datos Ajuste Lineal
0
2
4
6
8
10
Variable Independiente
2
0
2
4
6
8
10
12
14
Variable Dependiente 2A: Modelo Mal Ajustado (No Lineal) Datos Ajuste Lineal
5.0
7.5
10.0
12.5
15.0
17.5
20.0
22.5
25.0
Valores Predichos
4
2
0
2
4
Residuales (Error) 1B: Gráfico Residual (Ideal)
4.275
4.280
4.285
4.290
4.295
4.300
4.305
4.310
4.315
Valores Predichos
7.5
5.0
2.5
0.0
2.5
5.0
7.5
Residuales (Error) 2B: Gráfico Residual (con Patrón) Diagnóstico de Modelos de Regresión Mediante Residuales Fig. 6.5. Comparación de un modelo bien ajustado (izquierda) y uno mal ajustado (derecha) a través de sus respectivos gráficos de residuales
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [205] Regresar
6.3.
CLASIFICACIÓN
La tarea de clasificación consiste en asignar a una entrada una etiqueta basado en sus características, aquí es donde las matrices de confusión juegan un papel crucial. Estas matrices proporcionan una visión detallada de cómo un modelo clasifica las instancias de datos, revelando errores como falsos positivos, falsos negativos, verdaderos positivos y verdaderos negativos. Sin embargo, su interpretación puede ser complicada, especialmente en contextos con clases desequilibradas o con múltiples clases, por lo cual se recurre a otro modelo como las curvas ROC.
6.3.1.
Matrices de confusión La matriz de confusión tiene filas que representan las etiquetas predichas y columnas que representan las etiquetas reales por el modelo, como se presenta en la tabla XXV. Cada celda de la matriz contiene el recuento de las instancias clasificadas según esa combinación de etiquetas verdaderas y predichas. Esto permite calcular diversas métricas de evaluación, como la precisión, el recall, la tasa de falsos positivos y la tasa de falsos negativos, que son útiles para comprender la calidad y el desempeño del modelo en la tarea de clasificación.
TABLA XXV.
MATRIZ DE CONFUSIÓN DE DOS CLASES
Clase Real Positivo Clase Real Negativo Clase Predicha Positiva Verdadero Positivo (VP) Falso Positivo (FP) Clase Predicha Negativa Falso Negativo (FN) Verdadero Negativo (VN) En diversas aplicaciones, a partir de los resultados de las matrices de confusión se calculan métricas, así:
Precisión: mide la proporción de instancias positivas identificadas correctamente entre todas las instancias que el modelo clasificó como positivas. Para problemas de clasificación de varias clases, P se promedia entre las clases.
P = VP VP + FP
(6.1)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [206] Regresar R = VP VP + FN
(6.2)
F1 Score: es una medida de prueba de precisión. Es la media armónica de “precision” y “Recall”.
F1score = 2 ∗precision ∗recall precision + recall
(6.3)
Exactitud: mide la proporción de instancias, tanto positivas como negativas, que fueron clasificadas correctamente.
A = VP + VF VP + VF + VN + FN
(6.4)
En el proceso de entrenamiento es común utilizar series de tiempo para graficar cada una de las métricas descritas anteriormente y, a partir de su comportamiento, decidir cuando detener el proceso.
La matriz de confusión es extendible a problemas de múltiples clases.
6.3.2.
Curvas ROC Las curvas ROC (Receiver Operating Characteristic) son una herramienta fundamental para evaluar el rendimiento de modelos de clasificación, especialmente en problemas binarios. Estas curvas representan gráficamente la relación entre la tasa de verdaderos positivos (TPR o Recall (R)) y la tasa de falsos positivos (FPR) a medida que varía el umbral de decisión del clasificador.
En el eje x se ubica la tasa de falsos positivos (FPR) y en el eje y el Recall (R). Cada punto de la curva corresponde a un valor específico del umbral de probabilidad utilizado por el modelo para decidir entre clases positivas y negativas. Una curva más cercana a la esquina superior izquierda del gráfico indica un mejor desempeño del clasificador, ya que refleja una alta tasa de verdaderos positivos y una baja tasa de falsos positivos. Recall: mide la proporción de instancias positivas que fueron identificadas correctamente entre todas las instancias positivas reales.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [207] Regresar Las métricas asociadas a la curva ROC se definen como:
TPR = R =
VP VP + FN
(6.5)
FPR =
FP FP + VN
(6.6)
donde:
TPR (True Positive Rate o Recall): proporción de positivos correctamente identificados. FPR (False Positive Rate): proporción de negativos que fueron clasificados incorrectamente como positivos.
Un indicador asociado a la curva ROC es el Área bajo la curva (AUC, por sus siglas en inglés). El AUC resume en un único valor la capacidad del modelo para discriminar entre clases. Un valor de AUC = 0.5 indica un modelo sin capacidad discriminatoria (equivalente a clasificar al azar), mientras que un AUC = 1 refleja un modelo con una discriminación perfecta entre las clases.
En la figura 6.6, se ejemplifica la representación gráfica de una curva ROC junto con el área bajo la curva, lo que permite comparar el rendimiento de distintos clasificadores. Cuanto mayor sea el AUC, mejor será el desempeño del modelo en la tarea de clasificación.
0.0
0.2
0.4
0.6
0.8
1.0
Tasa de Falsos Positivos (FPR)
0.0
0.2
0.4
0.6
0.8
1.0
Tasa de Verdaderos Positivos (TPR) Curva ROC Curva ROC (AUC = 0.91) Clasificación aleatoria Fig. 6.6. Curva ROC y área bajo la curva (AUC) como métricas de desempeño en clasificación binaria
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [208] Regresar Ejemplo 6.3.1:
Ejemplo de evaluación con curva ROC y AUC: Supóngase un conjunto de datos donde se busca clasificar si un paciente tiene una enfermedad (Positivo) o no (Negativo), utilizando un modelo de regresión logística. Tras entrenar el modelo con un conjunto de datos simulados, se obtuvieron las siguientes métricas de clasificación:
Verdaderos Positivos (VP) = 40 Falsos Negativos (FN) = 10 Falsos Positivos (FP) = 5 Verdaderos Negativos (VN) = 45 La matriz de confusión correspondiente es:
TABLA XXVI.
MATRIZ DE CONFUSIÓN DEL MODELO
Clase Real Positivo Negativo Clase Predicha Positiva
40 (VP)
5 (FP)
Clase Predicha Negativa
10 (FN)
45 (VN)
A partir de esta información se calculan las métricas básicas: R = VP VP + FN =
40
40 + 10 = 0.80
P = VP VP + FP =
40
40 + 5 ≈0.89
A = VP + VN VP + FP + FN + VN =
40 + 45
40 + 5 + 10 + 45 = 85
100 = 0.85
F1 = 2 · P · R P + R = 2 · 0.89 · 0.80
0.89 + 0.80 ≈0.84
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [209] Regresar
FPR =
FP FP + VN =
5
5 + 45 = 0.10
Trazando la curva ROC, se analiza el rendimiento del modelo al variar el umbral de decisión. En este ejemplo, se obtuvo un área bajo la curva de:
AUC ≈0.92
lo que indica que el modelo tiene una excelente capacidad para discriminar entre pacientes enfermos y sanos.
En la figura 6.7 se muestra la curva ROC junto con el valor de AUC.
0.0
0.2
0.4
0.6
0.8
1.0
Tasa de falsos positivos (FPR)
0.0
0.2
0.4
0.6
0.8
1.0
Recall (R) Curva ROC ROC curve (AUC = 0.92) Fig. 6.7. Ejemplo de curva ROC obtenida a partir de un modelo de clasificación binaria con AUC cercano a 0.92
6.4.
AGRUPACIÓN
En Machine Learning, el agrupamiento o clustering es una técnica de aprendizaje no supervisado fundamental para encontrar estructuras y patrones ocultos en datos complejos. Su objetivo es dividir un conjunto de datos en grupos (clústeres) donde las instancias dentro de un mismo grupo son muy similares entre sí, y muy diferentes de las de otros grupos.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [210] Regresar La visualización de datos es esencial tanto para explorar los datos antes de agruparlos como para validar e interpretar los clústeres resultantes.
6.4.1.
El algoritmo K-Means Uno de los algoritmos de agrupamiento más conocidos es K-Means. Su objetivo es dividir los datos en K clústeres, donde cada punto pertenece al clúster cuyo centroide (el punto central del grupo) está más cerca. El algoritmo funciona de manera iterativa para encontrar las mejores posiciones para estos centroides.
La figura 6.8 ilustra visualmente cómo opera el algoritmo K-Means: partiendo de datos sin etiquetar, asigna puntos a los centroides más cercanos y luego actualiza la posición de estos hasta que los grupos son estables.
6.4.2.
Muestreo por conglomerados Es importante no confundir el agrupamiento como técnica de Machine Learning con el muestreo por conglomerados, que es un método estadístico para seleccionar muestras. En este método, la población ya está dividida en grupos naturales (conglomerados). Descripción: se divide la población en conglomerados, y luego se seleccionan aleatoriamente uno o más conglomerados completos para formar la muestra. Ventajas: es eficiente y económico, especialmente si los conglomerados están geográficamente dispersos.
Desventajas: la muestra puede ser menos precisa si los conglomerados no son homogéneos entre sí.
Ejemplo 6.4.1:
Muestreo por conglomerados: Supóngase una población de 15 estudiantes divididos en 5 clases (conglomerados). En lugar de seleccionar estudiantes al azar de toda la población, se eligen aleatoriamente 2 clases completas. Todos los estudiantes de esas clases forman la muestra. La figura 6.9 ilustra este proceso.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [211] Regresar
4
3
2
1
0
1
2
3
4
Característica 1
0
2
4
6
8
10
Característica 2 A) Datos sin Agrupar
4
3
2
1
0
1
2
3
4
Característica 1
0
2
4
6
8
10
Característica 2 B) Inicialización de Centroides Centroides Iniciales
4
3
2
1
0
1
2
3
4
Característica 1
0
2
4
6
8
10
Característica 2 Los puntos se colorean según el centroide más cercano.
C) 1ª Iteración: Asignación de puntos
4
3
2
1
0
1
2
3
4
Característica 1
0
2
4
6
8
10
Característica 2 D) Resultado Final (Convergencia) Centroides Finales Proceso del Algoritmo K-Means Fig. 6.8. Visualización del proceso del algoritmo K-Means. Desde los datos iniciales (A), pasando por la asignación de puntos a centroides (B-C), hasta la convergencia final de los clústeres (D) Clase 1 Clase 2 Clase 3 Clase 4 Clase 5 Fig. 6.9. Ejemplo de muestreo por conglomerados: selección de dos clases completas (conglomerados) dentro de la población total
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [212] Regresar
6.5.
TÉCNICAS PARA AGRUPACIÓN
El análisis de datos espaciales es fundamental para identificar patrones y estructuras en conjuntos de datos que tienen un componente geográfico. Estas técnicas permiten visualizar y entender cómo se distribuyen los valores en un espacio físico. A continuación, se exploran dos métodos clave: los mapas de calor para interpolación y los diagramas de Voronoi para partición del espacio.
6.5.1.
Agrupamiento por categorías
6.5.1.1.
Mapas de calor por interpolación Un mapa de calor (Heatmap) es una herramienta excelente para visualizar la densidad o interpolar valores en un área geográfica. Una técnica común para calcular el valor de un punto desconocido es la Ponderación Inversa a la Distancia (IDW), donde los puntos de datos más cercanos tienen una mayor influencia.
La figura 6.10 ilustra este concepto. Para determinar la temperatura de la celda C, se promedian las temperaturas de los puntos de medición cercanos (P1 y P2), pero dándole más peso al punto más cercano (P1).
Aplicando este método a toda una cuadrícula, es posible generar un mapa de calor completo como el de la figura 6.11, que muestra la distribución de temperaturas en el área. C´alculo para la Celda C:
La temperatura en C es un promedio ponderado de P1 y P2. Como d1 < d2, P1 tiene m´as influencia.
P1(30◦C) P2(20◦C) C (2,2) d1 ≈1.41 d2 ≈2.24 Fig. 6.10. Ilustración del método de Ponderación Inversa a la Distancia (IDW)
0
1
2
3
4
X
0
1
2
3
4
Y
26.13
22
24
26
28
Temperatura (°C) Fig. 6.11. Mapa de calor de temperatura resultante de la interpolación
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [213] Regresar
6.5.1.2.
Diagramas de Voronoi para partición espacial Un Diagrama de Voronoi divide un espacio en regiones basadas en la proximidad a un conjunto de puntos de datos (llamados "sitios"). Cada región contiene todos los puntos del espacio que están más cerca de su sitio que de cualquier otro. Es como trazar las ”zonas de influencia” de cada punto.
La figura 6.12 muestra cómo se construye una de estas regiones. La línea fronteriza entre dos sitios, P1 y P2, es precisamente la línea donde cualquier punto está a la misma distancia de ambos.
Esta técnica es muy útil en logística (¿cuál es el almacén más cercano?), biología (territorios celulares) o urbanismo. La figura 6.13 muestra un diagrama completo para un conjunto de puntos.
P1 P2 P3 P4 P5 Cualquier punto en la regi´on azul est´a m´as cerca de P1 que de cualquier otro punto rojo.
Fig. 6.12. Construcción de una celda de Voronoi
0
2
4
6
8
10
X
0
2
4
6
8
10
Y Fig. 6.13. Diagrama de Voronoi completo
6.5.2.
Agrupamiento con discretización en cuadrículas (2D Binning) La discretización, o binning, es una técnica de preprocesamiento que consiste en dividir un espacio de datos continuos en una cuadrícula de intervalos o "bins". Esto simplifica los datos y permite analizar la frecuencia o densidad de puntos en cada región, siendo un paso común para crear mapas de calor.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [214] Regresar
6.5.2.1.
Métricas de Distancia: Euclidiana vs. Manhattan Antes de agrupar, es fundamental entender cómo se mide la "distancia". Las dos métricas más comunes son:
Distancia Euclidiana: la distancia en línea recta entre dos puntos (”como vuela un pájaro”).
Distancia de Manhattan: la distancia sumando los movimientos en los ejes, como moverse por las calles de una ciudad (”caminando por las manzanas”). La figura 6.14 ilustra claramente esta diferencia.
P1 P2 |5 −1| = 4 |4 −1| = 3 Distancia de Manhattan d = 4 + 3 = 7 Distancia Euclidiana d = √
42 + 32 = 5
Fig. 6.14. Comparación visual entre la distancia Euclidiana (línea recta) y la distancia de Manhattan (camino por la cuadrícula) Ejemplo 6.5.1:
Se tienen los siguientes puntos: (2, 3), (4, 5), (5, 1), (1, 4), (7, 2). Se discretiza el espacio en una cuadrícula y se cuenta cuántos puntos caen en cada celda. Paso 1: Definir la cuadrícula.
Se define una cuadrícula con intervalos de tamaño 2 para los ejes X e Y.
Paso 2: Asignar puntos y contar frecuencias.
Se asigna cada punto a la celda de la cuadrícula que le corresponde y se cuenta el número de puntos por celda. Las frecuencias obtenidas para cada intervalo de la cuadrícula se detallan en la tabla XXVII.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [215] Regresar
TABLA XXVII.
FRECUENCIAS POR INTERVALO
Intervalo en X Intervalo en Y Frecuencia [0, 2) [4, 6)
1
[2, 4) [2, 4)
1
[4, 6) [0, 2)
1
[4, 6) [4, 6)
1
[6, 8) [2, 4)
1
Paso 3: Visualizar las frecuencias.
En lugar de solo graficar los puntos, un histograma 2D o mapa de calor de frecuencias es mucho más informativo. Cada celda de la cuadrícula se colorea según el número de puntos que contiene, como se muestra en la figura 6.15.
0
2
4
6
8
Eje X
0
2
4
6
Eje Y
1
1
1
1
1
Histograma 2D (Gráfico de Cuadrícula de Frecuencias) Puntos Originales
0.0
0.2
0.4
0.6
0.8
1.0
Frecuencia de Puntos por Celda Fig. 6.15. Histograma 2D que muestra la frecuencia de puntos en cada celda de la cuadrícula. El color de cada celda indica cuántos puntos contiene (en este caso, 1)
6.5.3.
Agrupamiento espacial/geográfico El agrupamiento espacial se enfoca en identificar patrones basados en la ubicación geográfica de los datos. El objetivo es encontrar ”clústeres” o áreas con alta concentración de eventos, así como analizar las ”zonas de influencia” de puntos específicos. Estas técnicas son cruciales en epidemiología, planificación urbana o análisis de mercado.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [216] Regresar Gráficos de dispersión geográficos Esta técnica superpone puntos de datos en un mapa usando sus coordenadas (latitud y longitud). Es la forma más directa de visualizar la distribución espacial de los eventos. El color o tamaño de los puntos puede representar otras variables, como la magnitud de un terremoto, para añadir más contexto. Fig. 6.16. Visualización de terremotos en el mundo. El color de cada punto indica la magnitud del sismo Agrupamiento por densidad
(DBSCAN)
A diferencia de solo visualizar puntos, algoritmos como DBSCAN identifican automáticamente los clústeres, basados en qué tan densamente agrupados están los puntos. Es muy potente porque puede encontrar grupos de formas irregulares y también clasifica los puntos aislados como ”ruido” (puntos negros).
4
2
0
2
4
Coordenada X
4
2
0
2
4
Coordenada Y Agrupamiento Espacial con DBSCAN Clúster 1 Clúster 2 Clúster 3 Ruido Fig. 6.17. Resultado de aplicar DBSCAN Diagramas de Voronoi Geográficos Un diagrama de Voronoi divide un mapa en ”zonas de influencia”. Cada región contiene todos los puntos que están más cerca de un ”sitio” (ej. un hospital, una tienda) que de cualquier otro. Es una herramienta excelente para análisis de áreas de servicio y planificación logística.
5
0
5
10
15
20
25
5
0
5
10
15
20
25
Fig. 6.18. División de una ciudad en regiones de Voronoi según la proximidad a puntos de interés (rojos)
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [217] Regresar
6.5.4.
Agrupamiento temporal El agrupamiento temporal es una técnica que permite encontrar patrones en datos que evolucionan con el tiempo. A diferencia de otros métodos, su objetivo no es agrupar puntos individuales, sino agrupar series de tiempo completas que se comportan de manera similar. Por ejemplo, se puede agrupar productos cuyas ventas aumentan en verano, o clientes con patrones de consumo parecidos a lo largo del año. El proceso consiste en tomar un gran número de series temporales, aplicar un algoritmo que mida la similitud de sus ”formas” y asignarlas a clústeres. La figura 6.19 ilustra este concepto: se parte de un conjunto de series caóticas y se termina con grupos bien definidos, cada uno con un patrón de comportamiento característico (su centroide). Ene Feb Mar Abr May Jun Jul Ago Sep Oct Nov Dic Mes
0
2
4
6
8
10
Ventas A) Conjunto de Series Temporales Sin Agrupar Ene Feb Mar Abr May Jun Jul Ago Sep Oct Nov Dic Mes
0
2
4
6
8
10
Ventas B) Series Agrupadas por Patrón Similar Centroide Clúster 1 Centroide Clúster 2 Fig. 6.19. Proceso de agrupamiento temporal. A la izquierda, múltiples series de tiempo sin orden. A la derecha, las mismas series agrupadas por similitud en dos clústeres, con su patrón promedio (centroide) resaltado en negrita Ejemplo 6.5.2:
Patrones de venta anuales: para ver esto en acción, se analizan los datos de ventas de una tienda minorista para identificar tendencias temporales por categoría de producto. El objetivo es descubrir si ciertas categorías tienen picos de venta en diferentes momentos del año. Las siguientes figuras muestran el resultado de aplicar esta técnica a cuatro categorías distintas.
En la figura 6.20 se observa cómo las ventas de alimentos se agrupan en distintos periodos del año. Cada clúster (color) refleja la concentración de ventas en determinados
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [218] Regresar meses, evidenciando un fuerte componente estacional, posiblemente relacionado con festividades.
La figura 6.21 muestra que las ventas de libros presentan clústeres bien definidos en momentos puntuales del año, que podrían asociarse a ferias del libro o periodos académicos.
2023-01
2023-03
2023-05
2023-07
2023-09
2023-11
2024-01
Fecha
0
20
40
60
80
100
Ventas Agrupamiento Temporal para Alimentos Cluster 1 Cluster 2 Cluster 3 Cluster 4 Fig. 6.20. Agrupamiento temporal para alimentos
2023-01
2023-03
2023-05
2023-07
2023-09
2023-11
2024-01
Fecha
0
20
40
60
80
100
Ventas Agrupamiento Temporal para Libros Cluster 1 Cluster 2 Cluster 3 Cluster 4 Fig. 6.21. Agrupamiento temporal para libros En la figura 6.22 se aprecia que las ventas de productos electrónicos se concentran en la segunda mitad del año, probablemente por promociones estacionales y lanzamientos tecnológicos.
Finalmente, la figura 6.23 refleja que las ventas de ropa muestran picos marcados que coinciden con los cambios de temporada, resaltando el impacto de la estacionalidad de la moda.
2023-01
2023-03
2023-05
2023-07
2023-09
2023-11
2024-01
Fecha
0
20
40
60
80
100
Ventas Agrupamiento Temporal para Electrónica Cluster 1 Cluster 2 Cluster 3 Cluster 4 Fig. 6.22. Agrupamiento temporal para electrónica
2023-01
2023-03
2023-05
2023-07
2023-09
2023-11
2024-01
Fecha
0
20
40
60
80
100
Ventas Agrupamiento Temporal para Ropa Cluster 1 Cluster 2 Cluster 3 Cluster 4 Fig. 6.23. Agrupamiento temporal para ropa
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [219] Regresar
6.5.5.
Agrupamiento por atributos específicos El agrupamiento por atributos consiste en segmentar los datos en grupos homogéneos basándose en sus características o ”atributos” (ej. precio, tamaño, categoría). La complejidad surge cuando los datos presentan una alta dimensionalidad (muchos atributos), haciendo imposible su visualización directa. En estos casos, se requiere aplicar una técnica de reducción de dimensión previa al análisis de clústeres. Ejemplo 6.5.3:
Segmentación de Productos y Reducción de Dimensión: una empresa de comercio electrónico quiere entender mejor su catálogo. Tiene datos de cientos de productos con atributos como precio, volumen de ventas, peso y calificación de clientes. Dado que los datos son multidimensionales, se utiliza el Análisis de Componentes Principales (PCA) para hacerlos visualizables.
Análisis de Componentes Principales (PCA) Es una técnica que transforma un conjunto de variables correlacionadas en un nuevo conjunto de variables no correlacionadas (componentes principales), conservando la mayor cantidad de información posible. Esto permite proyectar datos complejos en un espacio 2D o 3D para su visualización.
Al aplicar PCA, seguido de un algoritmo de agrupamiento como K-Means, la empresa logra identificar segmentos claros, tal como se observa en la figura 6.24.
40
20
0
20
40
PCA1
40
20
0
20
40
PCA2
Cluster Plot Cluster
0
1
2
3
40
20
0
20
40
PCA1
40
20
0
20
40
PCA2
Gráfico Elipsoidal Cluster
0
1
2
3
Fig. 6.24. Agrupamiento de datos tras reducción de dimensión con PCA en el caso de Segmentación de Productos
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [220] Regresar El resultado del agrupamiento se visualiza a través de dos componentes principales:
1. Cluster Plot (figura 6.24 izquierda): los datos, proyectados en un espacio 2D
(Componente 1 vs. Componente 2), son coloreados según la asignación de clúster realizada por K-Means. Esto revela la separación espacial de los segmentos.
2. Gráfico Elipsoidal (figura 6.24 derecha): se dibujan elipses alrededor de cada
clúster para visualizar su dispersión (varianza) y orientación. Elipses pequeñas y redondas indican clústeres densos con baja correlación entre los nuevos componentes.
Este análisis visual identifica cuatro segmentos de productos distintos que permiten una interpretación estratégica:
Clúster 0 (Morado): productos de nicho, con pocas ventas pero quizás de alto margen.
Clúster 3 (Amarillo): productos masivos, con precios competitivos y alto volumen de ventas.
Este proceso facilita a la empresa tomar decisiones informadas para diseñar estrategias de marketing personalizadas, optimizar el inventario y ajustar los precios para cada segmento de producto.
6.5.6.
Agrupamiento por similitud visual El agrupamiento por similitud visual se enfoca en técnicas de reducción de dimensionalidad que permiten ”mapear” datos complejos y de alta dimensión en un espacio 2D. El principio es simple: los datos que son similares en su espacio original se colocan juntos en el mapa visual, y los que son diferentes se separan. Esto revela la ”forma” y los clústeres ocultos en los datos.
Para ilustrarlo, se analiza un conjunto de datos de pacientes, cada uno con múltiples variables clínicas (edad, presión, IMC, etc.), usando tres técnicas populares.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [221] Regresar Mapas de calor de similitud Esta técnica visualiza una matriz donde cada celda representa la similitud (o distancia) entre dos pacientes, como se ilustra en la figura 6.25. Se calcula la similitud entre cada par de pacientes y se asigna un color. Los ”bloques” cuadrados de colores cálidos que aparecen en la diagonal revelan clústeres de pacientes con perfiles clínicos muy parecidos. Mapa de Calor de Similitud (Coseno)
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Fig. 6.25. Mapa de calor de similitud Proyección con t-SNE t-SNE (t-Distributed Stochastic Neighbor Embedding) es una de las técnicas más potentes para la visualización exploratoria. Como se observa en la figura 6.26, reduce la dimensionalidad de los datos de una manera que preserva las estructuras locales, resultando en agrupaciones visuales muy claras. Es excelente para identificar la presencia de subgrupos distintos.
20
10
0
10
20
30
Componente t-SNE 1
10
5
0
5
10
15
20
25
Componente t-SNE 2 Agrupamiento por Similitud Visual usando t-SNE Clúster
0
1
2
Fig. 6.26. Agrupamiento usando t-SNE Mapas auto organizados (SOM) Un SOM proyecta los datos de alta dimensión sobre una cuadrícula 2D, como un mapa, tal como se muestra en la figura 6.27. Cada celda de la cuadrícula representa un perfil de paciente. Los pacientes con perfiles similares se mapean en la misma celda o en celdas adyacentes. Los colores del mapa muestran la distancia entre perfiles, ayudando a visualizar las fronteras entre los clústeres.
0
2
4
6
8
0
2
4
6
8
2
3
2
0
3
0
1
0
2
3
1
2
3
2
3
1
2
2
2
2
1
2
1
2
0
3
1
2
3
0
1
2
0
1
1
3
0
0
0
2
1
2
0
1
0
1
0
0
3
2
2
0
0
3
1
3
0
0
1
1
0
0
0
2
0
2
1
0
0
1
1
0
1
0
3
3
3
1
3
0
1
2
3
1
2
1
2
0
2
2
0
3
1
0
1
3
2
2
1
3
3
2
0
1
1
1
3
2
0
2
2
3
1
2
0
1
2
0
1
3
2
1
2
2
1
0
0
1
0
0
0
2
1
3
3
0
0
1
2
1
2
1
3
3
2
1
3
2
3
2
0
3
2
2
3
0
2
3
1
0
1
2
2
1
0
0
3
0
2
1
3
2
2
0
3
2
3
1
1
1
1
0
2
2
3
1
2
1
0
1
2
1
2
2
1
0
0
0
3
2
3
2
3
3
3
1
0
1
0
2
3
0
3
2
3
3
1
0
0
3
0
0
3
2
3
0
3
3
0
2
0
3
1
3
3
0
2
3
2
0
1
3
1
0
1
3
1
3
3
0
3
1
3
3
1
2
3
3
2
3
3
1
0
3
1
3
3
3
1
1
1
0
2
1
1
1
1
2
3
1
0
2
0
3
2
1
2
2
0
1
0
2
0
0
3
Mapa Autoorganizado (SOM)
0.2
0.3
0.4
0.5
0.6
0.7
0.8
0.9
1.0
Distancia (Similitud) Fig. 6.27. Mapa auto organizado
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [222] Regresar Como se observa en el gráfico de t-SNE (figura 6.26), estas técnicas permiten a los investigadores identificar visualmente subpoblaciones (ej. un grupo con alto IMC y glucosa, otro con presión controlada, etc.), facilitando la segmentación de pacientes para diseñar intervenciones médicas más específicas. Otras técnicas similares y muy potentes incluyen UMAP y MDS.
6.5.7.
Tablas cruzadas (Crosstabs) Las tablas cruzadas, o tablas de contingencia, son una herramienta fundamental para analizar la relación entre dos o más variables categóricas. Estas permiten resumir datos en una matriz de frecuencias, y a partir de ahí, se puede aplicar una serie de técnicas para descubrir y visualizar patrones de asociación.
El proceso típicamente sigue estos pasos:
1. Resumir los datos en una tabla de contingencia.
2. Probar la asociación con una prueba estadística como la de Chi-cuadrado (χ2).
3. Medir la fuerza de la asociación con métricas como la V de Cramér.
4. Visualizar la relación con un Análisis de Correspondencias (CA).
Ejemplo 6.5.4:
Análisis de preferencias de compra por género Suponga una encuesta a consumidores donde se registran Género y Preferencia de compra. La tabla de contingencia obtenida es la tabla XXVIII. Para una interpretación visual inmediata, la figura 6.28 muestra estos mismos datos como un mapa de calor.
TABLA XXVIII.
CONTINGENCIA ENTRE GÉNERO Y PREFERENCIA DE COMPRA
Género Ropa Electrónica Alimentos Hombre
20
35
25
Mujer
40
20
60
Otro
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [223] Regresar Ropa Electrónica Alimentos Preferencia de Compra Hombre Mujer Otro Género
20
35
25
40
20
60
30
25
40
Mapa de Calor de la Tabla de Contingencia
20
25
30
35
40
45
50
55
60
Fig. 6.28. Mapa de calor de la tabla de contingencia. Se observa visualmente que la celda (Mujer, Alimentos) tiene la frecuencia más alta
1. Cálculo de las frecuencias esperadas.
Sea N = 295 el total de observaciones, Ri las sumas por fila (Hombre=80, Mujer=120, Otro=95) y Cj las sumas por columna (Ropa=90, Electrónica=80, Alimentos=125). Las frecuencias esperadas se calculan como Eij = Ri Cj N
.
La matriz de valores esperados (aprox.) es: E ≈
24.4068
21.6949
33.8983
36.6102
32.5424
50.8475
28.9831
25.7627
40.2542
2. Estadístico χ2
evalúa si existe relación entre el género y la preferencia de compra. El estadístico se calcula como:
χ2 = r ∑ i=1 c ∑ j=1 (Oij −Eij)2 Eij
,
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [224] Regresar donde Oij representa la frecuencia observada en la celda i, j de la tabla, y Eij la frecuencia esperada bajo la hipótesis de independencia. Ropa Electrónica Alimentos Hombre
0.796
8.300
2.348
Mujer
0.083
4.776
1.703
Otro
0.114
0.047
0.002
Sumando todas las contribuciones:
χ2 ≈18.142.
Los grados de libertad son (r −1)(c −1) = (3 −1)(3 −1) = 4. El p-valor asociado (usando la distribución χ2) es:
p ≈0.00116, como p < 0.05, hay evidencia de asociación entre género y preferencia de compra. La figura 6.29 visualiza qué celdas contribuyen más a este resultado. Ropa Electrónica Alimentos Preferencia de Compra Hombre Mujer Otro Género
0.796
8.300
2.348
0.083
4.776
1.703
0.114
0.047
0.002
Mapa de Calor de Contribuciones a
2
1
2
3
4
5
6
7
8
Fig. 6.29. Mapa de calor de las contribuciones al estadístico χ2. La celda (Hombre, Electrónica) es la que más aporta a la asociación
3. Cálculo de la V de Crámer.
La V de Crámer se obtiene como V =
χ2 N(k −1),
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [225] Regresar donde k = m´ın(#filas, #columnas) = 3. Sustituyendo: V ≈
18.142
295 · 2 ≈0.175.
Este valor indica una asociación débil a moderada. Interpretación final con análisis de correspondencias. La prueba χ2 dice que hay una relación y la V de Crámer que es moderada. Ahora, el análisis de correspondencias (CA) en la figura 6.30 muestra cuál es esa relación.
0.4
0.3
0.2
0.1
0.0
0.1
0.2
Dimensión 1
0.010
0.005
0.000
0.005
0.010
0.015
0.020
Dimensión 2 Hombre Mujer Otro Ropa Electrónica Alimentos Mapa perceptual - Análisis de Correspondencias (CA) Filas (Género) Columnas (Preferencia) Fig. 6.30. Mapa perceptual del Análisis de Correspondencias (CA) En la figura se observa claramente la afinidad entre Mujer y Alimentos, y entre Hombre y Electrónica, explicando la naturaleza de la asociación encontrada.
6.6.
EJEMPLOS DE COMBINACIONES PRÁCTICAS
Las técnicas de agrupación a menudo se combinan para contar una historia más completa a partir de los datos. En lugar de analizar el espacio, el tiempo y los atributos por separado, su integración permite obtener una comprensión mucho más profunda.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [226] Regresar Ejemplo 6.6.1:
Caso de estudio: análisis de movilidad urbana Un equipo de análisis urbano quiere estudiar los patrones de movilidad en una ciudad usando datos de ubicación de apps móviles. El objetivo es responder tres preguntas clave: dónde se concentra la gente, cuándo hay más actividad y cuáles son las zonas de influencia de esos puntos calientes. Paso 1: Identificar dónde (análisis espacial) Primero, se aplica el algoritmo K- Means a las coordenadas geográficas (latitud y longitud) de los datos. Esto permite encontrar los centros de mayor actividad de forma automática. El gráfico de dispersión resultante colorea cada punto según el clúster al que pertenece, revelando las principales zonas de concentración de la ciudad, como centros comerciales o estaciones de transporte.
2
4
6
8
10
x
2
3
4
5
6
7
y Dispersión con K-means (ubicaciones)
0
1
2
Centroides Fig. 6.31. Dispersión con K-Means. Se identifican tres clústeres de movilidad (rojo, azul, verde) con sus centroides (cruces negras) Paso 2: Descubrir cuándo (análisis temporal) Una vez que se sabe dónde, se quiere saber cuándo. Un mapa de calor temporal es perfecto para esto. Agrupa los datos por día de la semana y hora del día. Las celdas más oscuras indican los momentos de mayor actividad, permitiendo identificar patrones como las horas pico de la mañana y la tarde durante la semana laboral.
0
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
Hora del día
1
2
3
4
5
6
7
Día de la semana Mapa de calor temporal de movilidad (día vs hora)
0
1
2
3
4
5
6
Frecuencia Fig. 6.32. Mapa de calor temporal. Los colores oscuros revelan picos de movilidad en las mañanas y tardes de los días laborales
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [227] Regresar Paso 3: Definir Zonas de Influencia (Análisis Combinado) Finalmente, se combinan los resultados. Se utilizan los centroides (los centros de los clústeres) encontrados en el Paso 1 como ”semillas” para crear un Diagrama de Voronoi. Esto divide el mapa de la ciudad en regiones, donde cada región representa el área de influencia más cercana a cada centro de movilidad.
2
3
4
5
6
7
8
9
2
3
4
5
6
Diagrama de Voronoi con clusters espaciales Fig. 6.33. Diagrama de Voronoi basado en los centroides. Cada color define el área de servicio de cada clúster de movilidad Este enfoque combinado ofrece una herramienta poderosa para la toma de decisiones en gestión urbana. Al integrar el análisis espacial, temporal y de densidad, los responsables de la planificación pueden diseñar estrategias más eficientes para el transporte, la seguridad y el desarrollo urbano.
6.7.
TIPOS DE AGRUPAMIENTO MULTIVARIADO
El agrupamiento multivariado es una técnica clave para encontrar patrones en datos donde cada observación tiene múltiples variables (ej. un cliente descrito por su edad, gastos y frecuencia de compra). El objetivo es clasificar los datos en grupos homogéneos. Existen varias ”familias” de métodos para lograrlo: Agrupamiento jerárquico: construye una jerarquía de clústeres, ideal para cuando no se sabe el número de grupos y se quiere explorar las relaciones entre ellos. El resultado se visualiza en un dendrograma. Agrupamiento particional (ej. K-Means): divide los datos en un número k de clústeres predefinido. Es rápido y eficiente, buscando grupos esféricos y compactos. Modelos basados en distribución (ej. GMM): asume que los datos son una mezcla de varias distribuciones de probabilidad (generalmente gaussianas). Es más flexible que K-Means y puede encontrar clústeres elípticos.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [228] Regresar Ejemplo 6.7.1:
Ejemplo comparativo con el Dataset Iris Para la validación de las técnicas de agrupamiento, se utiliza el dataset Iris (disponible en Fisher [9]). Este conjunto de datos contiene 150 observaciones de 3 especies distintas (Setosa, Versicolor, Virginica), descritas por 4 variables morfológicas (ver tabla XXIX). El objetivo principal es evaluar la capacidad de los algoritmos de agrupamiento para ”redescubrir” estas tres especies por sí solos mediante un proceso de clasificación no supervisada.
TABLA XXIX.
RESUMEN DEL DATASET IRIS (PRIMERAS OBSERVACIONES)
ID Sepal Length (cm) Sepal Width (cm) Petal Length (cm) Petal Width (cm) Target Especie
0
5.1
3.5
1.4
0.2
0
Setosa
1
4.9
3.0
1.4
0.2
0
Setosa
2
4.7
3.2
1.3
0.2
0
Setosa
3
4.6
3.1
1.5
0.2
0
Setosa
4
5.0
3.6
1.4
0.2
0
Setosa
4.5
5.0
5.5
6.0
6.5
7.0
7.5
8.0
sepal length (cm)
1
2
3
4
5
6
7
petal length (cm) A) Datos Reales (Especies) setosa versicolor virginica
4.5
5.0
5.5
6.0
6.5
7.0
7.5
8.0
sepal length (cm)
1
2
3
4
5
6
7
petal length (cm) B) Resultado de K-Means Centroides
4.5
5.0
5.5
6.0
6.5
7.0
7.5
8.0
sepal length (cm)
1
2
3
4
5
6
7
petal length (cm) C) Resultado de GMM
56
51
85
138
127
70
149
71
61
97
74
91
63
78
73
58
54
76
75
65
52
50
86
133
83
72
126
123
146
134
87
68
119
142
101
113
121
114
90
55
84
66
96
95
88
99
94
106
81
80
69
89
53
59
79
64
92
82
67
62
93
57
98
60
135
109
131
117
122
105
118
129
125
102
130
107
145
141
139
112
147
110
77
132
128
104
108
137
116
103
111
148
136
115
100
143
120
124
144
140
48
10
36
16
31
20
185
15
14
33
32
21
19
46
44
26
23
43
170
40
28
27
397
49
374
388
42
13
22
41
30
29
11
24
47326
349
25
451
12
35
sepal length (cm)
0
5
10
15
20
25
30
petal length (cm) D) Dendrograma Jerárquico (Ward) Comparación de Técnicas de Agrupamiento Multivariado en el Dataset Iris Fig. 6.34. Comparación de técnicas de agrupamiento en el dataset Iris
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [229] Regresar La figura 6.34 muestra un resumen visual de los resultados. El panel ”Datos Reales” es la referencia o ”verdad absoluta”, y los otros paneles muestran qué tan bien cada algoritmo se aproxima a ella.
Análisis de los Resultados:
Datos reales (arriba a la izquierda): se observa que la especie Setosa (morado) está muy bien separada, mientras que Versicolor y Virginica (verde y amarillo) se solapan ligeramente.
K-Means (arriba a la derecha): el algoritmo separa perfectamente a Setosa, pero su naturaleza de buscar clústeres esféricos hace que divida la zona de solapamiento de las otras dos especies con una frontera más rígida.
GMM (abajo a la izquierda): el modelo de mezcla gaussiana, al poder formar elipses, se adapta un poco mejor a la forma superpuesta de Versicolor y Virginica, capturando su distribución de una manera más natural.
Dendrograma (abajo a la derecha): el agrupamiento jerárquico muestra la estructura. Se ve claramente que el primer gran corte separa al grupo de Setosa (en azul) del resto. Luego, un segundo corte divide a las otras dos especies (en naranja y verde).
Ejemplo 6.7.2:
Análisis económico de países latinoamericanos: para ilustrar cómo las herramientas de visualización ayudan a entender datos multivariados, se realizará un análisis exploratorio de los indicadores macroeconómicos de once países latinoamericanos. El objetivo es identificar patrones, relaciones y agrupamientos entre los países usando sus datos de inflación, PIB, desempleo, etc. Los datos para este análisis fueron obtenidos de un conjunto disponible en Kaggle [15].
Paso 1: Entender las relaciones entre las variables.
Antes de agrupar los países, primero se debe entender cómo se relacionan los indicadores económicos entre sí.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [230] Regresar Visión general con un mapa de calor: Un mapa de calor de correlaciones (ver figura 6.35) es el punto de partida ideal. Representa la fuerza de la relación lineal entre cada par de variables mediante colores. Permite obtener una vista panorámica de la estructura de los datos. En este caso, se observa que el PIB per cápita tiene una fuerte correlación positiva con el PIB total.
Inflation (CPI %) GDP (Current USD) GDP per Capita (Current USD) Unemployment Rate (%) GDP Growth (% Annual) Inflation (CPI %) GDP (Current USD) GDP per Capita (Current USD) Unemployment Rate (%) GDP Growth (% Annual)
1.00
-0.04
0.44
0.22
0.02
-0.04
1.00
0.31
0.52
-0.11
0.44
0.31
1.00
0.42
-0.11
0.22
0.52
0.42
1.00
-0.29
0.02
-0.11
-0.11
-0.29
1.00
Mapa de calor de correlaciones
0.2
0.0
0.2
0.4
0.6
0.8
1.0
Fig. 6.35. Mapa de calor de correlaciones Análisis detallado con un Pairplot: para profundizar, un gráfico de dispersión matricial (pairplot) (ver figura 6.36) muestra todos los diagramas de dispersión posibles entre pares de variables. Esto no solo confirma las correlaciones del mapa de calor, sino que también revela la forma de las relaciones (lineales o no), la distribución de cada variable (en la diagonal) y la presencia de valores atípicos.
0
2
4
6
8
10
12
Inflation (CPI %)
0
1
2
3
4
5
6
GDP (Current USD) 1e11
5000
10000
15000
20000
GDP per Capita (Current USD)
2.5
5.0
7.5
10.0
12.5
15.0
Unemployment Rate (%)
0
5
10
15
Inflation (CPI %)
10
5
0
5
10
GDP Growth (% Annual)
0
2
4
6
8
GDP (Current USD) 1e11
0
10000
20000
GDP per Capita (Current USD)
0
5
10
15
20
Unemployment Rate (%)
20
10
0
10
20
GDP Growth (% Annual) country_name Argentina Bolivia Chile Colombia Ecuador Paraguay Uruguay Fig. 6.36. Gráfico de dispersión matricial de los indicadores seleccionados
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [231] Regresar Paso 2: Identificar agrupamientos y patrones entre los países. Ahora que se entienden las variables, se puede explorar cómo se agrupan los países. Vista 2D: dispersión y contornos: Un diagrama de dispersión simple (ver figura 6.37), como el de Inflación vs. Crecimiento del PIB, da una primera idea de los agrupamientos. Venezuela aparece como un claro valor atípico. Un diagrama de contorno superpuesto muestra las ”zonas de densidad”, confirmando que la mayoría de los países se concentran en un clúster con inflación y crecimiento moderados.
0
2
4
6
8
10
12
Inflación (%)
10
5
0
5
10
Crecimiento PIB (%) Dispersión: Inflación vs Crecimiento del PIB Argentina Bolivia Chile Colombia Ecuador Paraguay Uruguay Fig. 6.37. Dispersión: Inflación vs Crecimiento del PIB Visión multivariada con PCA: Para visualizar las similitudes usando todos los indicadores a la vez, se usa el Análisis de Componentes Principales (PCA) (ver figura 6.38). Esta técnica reduce la dimensionalidad de los datos a dos componentes que capturan la mayor parte de la información. El gráfico resultante muestra qué países tienen perfiles económicos similares (los que están cerca) y cuáles son diferentes (los que están lejos).
2
1
0
1
2
Componente 1 (59.0% varianza)
2.0
1.5
1.0
0.5
0.0
0.5
1.0
1.5
Componente 2 (23.0% varianza) PCA: Proyección de países en 2D País Argentina Bolivia Chile Colombia Ecuador Paraguay Uruguay Fig. 6.38. Proyección de los países en los dos primeros componentes principales Estructura jerárquica con un dendrograma:
Finalmente, el agrupamiento jerárquico permite visualizar la estructura de similitud completa entre los países. El dendrograma resultante es un ”árbol genealógico” económico: los países que se unen en la parte inferior del árbol son los más similares, mientras que los que se unen en la parte superior son los más diferentes. Confirma visualmente los grupos sugeridos por el PCA.
Ecuador Bolivia Paraguay Colombia Chile Argentina Uruguay Países
0
1
2
3
4
5
Distancia Dendrograma de países latinoamericanos Fig. 6.39. Dendrograma jerárquico de países latinoamericanos
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [232] Regresar
6.8.
GRÁFICOS PARA MODELOS DE REDES NEURONA-
LES
En el dominio del aprendizaje automático, las redes neuronales han surgido como uno de los pilares más prominentes y versátiles. Estos modelos están inspirados en el funcionamiento del cerebro humano, donde neuronas interconectadas procesan y transmiten información. Las redes neuronales artificiales están compuestas por capas de nodos, cada uno de los cuales realiza operaciones matemáticas simples pero poderosas. La representación de estos modelos es fundamental para comprender su arquitectura y su capacidad para aprender y generalizar a partir de los datos. Gráficos de arquitectura, como diagramas de flujo de datos o diagramas de capas, ayudan a visualizar la estructura de la red, incluyendo el número de capas, el tipo de neuronas en cada capa y las conexiones entre ellas.
6.8.1.
Redes completamente conectadas Las redes completamente conectadas (Fully Connected Networks o Dense Networks) son aquellas en las que cada neurona de una capa está conectada con todas las neuronas de la capa siguiente.
Este tipo de redes son ampliamente utilizadas en problemas de clasificación y regresión, especialmente cuando los datos no poseen una estructura espacial o secuencial evidente. Su representación gráfica generalmente incluye varias capas densas conectadas entre sí, donde cada línea representa una conexión sináptica.
Ventajas: sencillas de implementar y comprender, flexibles para distintos tipos de datos tabulares.
Desventajas: gran número de parámetros, lo que puede llevar a sobreajuste. La figura 6.40 presenta el diagrama canónico de una Red Completamente Conectada (FCN) de tres capas (entrada, oculta y salida). Visualmente, se destaca la conectividad densa, donde cada nodo de una capa está conectado sin excepción a todos los nodos de la capa subsiguiente.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [233] Regresar \begin{algorithm}[H] from tensorflow.keras.models import Sequential from tensorflow.keras.layers import Dense model = Sequential([ Dense(64, activation=’relu’, input_shape=(100,)), Dense(32, activation=’relu’), Dense(1, activation=’sigmoid’) ]) model.summary() Entrada Oculta Salida Fig. 6.40. Red completamente conectada con una capa oculta
6.8.2.
Redes convolucionales Las redes convolucionales (Convolutional Neural Networks o CNNs) están diseñadas para procesar datos con estructura espacial, como imágenes o señales. En lugar de conectar cada neurona con todas las entradas, utilizan filtros (kernels) que recorren la entrada en ventanas locales, detectando patrones como bordes, texturas o formas. Este enfoque reduce drásticamente el número de parámetros y mejora la capacidad de generalización en problemas de visión por computadora. Ventajas: eficientes en problemas de imágenes, detectan automáticamente características jerárquicas.
Desventajas: requieren mayor conocimiento de diseño (tamaño de filtros, pooling, etc.).
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [234] Regresar El diagrama que se presenta en la figura 6.41 ilustra la arquitectura canónica de una Red Convolucional (CNN). La visualización muestra la secuencia de procesamiento, que inicia con la imagen de entrada y progresa a través de capas alternas de convolución (aplicación de filtros) y pooling (reducción de la dimensionalidad espacial), finalizando con capas densas para la clasificación.
from tensorflow.keras.models import Sequential from tensorflow.keras.layers import Conv2D, MaxPooling2D, Flatten, Dense model = Sequential([ Conv2D(32, (3,3), activation=’relu’, input_shape=(64,64,3)), MaxPooling2D(pool_size=(2,2)), Flatten(), Dense(64, activation=’relu’), Dense(10, activation=’softmax’) ]) model.summary() Imagen de entrada Filtros Pooling Flatten Capa densa Salida Fig. 6.41. Red convolucional (CNN) simplificada
6.8.3.
Perceptrón multicapa (MLP) El Perceptrón Multicapa (MLP) es un tipo de red neuronal artificial clásica y fundamental, muy adecuada para problemas de clasificación y análisis predictivo. Un MLP se compone de al menos tres tipos de capas de neuronas:
Una capa de entrada, que recibe las variables o características iniciales del problema. Una o más capas ocultas, donde las neuronas procesan la información mediante funciones de activación.
Una capa de salida, que produce el resultado final del modelo (los valores predichos).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [235] Regresar Clasificación: las redes completamente conectadas o convolucionales suelen emplear una capa de salida con función de activación softmax, que asigna probabilidades a cada clase. Por ejemplo, identificar si una imagen corresponde a un perro, un gato o un ave.
El MLP aprende de los datos de entrada y salida a través de un algoritmo de entrenamiento llamado retropropagación del error (back-propagation).
El proceso dentro de una neurona j se puede describir en dos pasos. Primero, se calcula la suma ponderada de las entradas Xi con sus respectivos pesos Wij, conocida como la activación neta Aj:
Aj(X, W) = n ∑ i=0 (Xi · Wij)
(6.7)
Luego, esta activación pasa a través de una función de activación no lineal para producir la salida de la neurona, Oj. Para problemas de clasificación binaria, es común usar la función sigmoide:
Oj(X, W) = σ(Aj) =
1
1 + e−Aj(X,W)
(6.8)
Esta estructura de múltiples capas y funciones no lineales permite al MLP aprender relaciones complejas y no lineales en los datos, lo que lo convierte en una herramienta poderosa para tareas de clasificación.
6.8.4.
Modelado y aplicaciones según el tipo de problema El modelado de redes neuronales depende en gran medida del objetivo del análisis de datos:
Regresión: en este caso, la capa de salida suele tener una única neurona con activación lineal (f (x) = x), lo que permite predecir valores continuos, como el precio de una vivienda o la temperatura del día siguiente.
Detección de correlaciones: aunque las redes no calculan directamente coeficientes de correlación, pueden modelar relaciones no lineales complejas entre variables.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [236] Regresar En la práctica, se combinan análisis previos (como correlaciones de Pearson, Spearman o Kendall) con redes neuronales para seleccionar variables relevantes y reducir redundancias.
6.8.5.
Ajuste eficiente de parámetros (PEFT) Realizar un ajuste fino (fine-tuning) en grandes modelos preentrenados (LLMs), como GPT o BERT, puede ser un proceso que consume muchos recursos, tanto en tiempo de cómputo como en memoria, debido a la enorme cantidad de parámetros entrenables. Para solucionar este desafío, han surgido las técnicas de Ajuste Eficiente de Parámetros (PEFT). PEFT es un conjunto de métodos diseñados para adaptar grandes modelos preentrenados modificando solo un pequeño subconjunto de sus parámetros, mientras la gran mayoría del modelo permanece ”congelada” (sin actualizar). La figura 6.42 ilustra este concepto en dos partes. A la izquierda, muestra el flujo del proceso: un LLM Preentrenado con sus pesos congelados se transforma en un LLM Ajustado al añadirle un pequeño conjunto de Pesos Nuevos, que son los únicos que se entrenan. A la derecha, la figura agrupa las Técnicas Populares de PEFT en sus categorías principales: Aditivas, de Reparametrización y Selectivas. El Concepto PEFT LLM Preentrenado (Pesos Congelados) ↓ LLM Ajustado (PEFT) (Congelado + Pesos Nuevos) T´ecnicas Populares Aditivas Adapters Prefix/Prompt Tuning Reparametrizaci´on LoRA Selectivas BitFit Fig. 6.42. Concepto visual y panorama de las técnicas PEFT Ventajas del enfoque PEFT:
el uso de PEFT ofrece beneficios significativos en la práctica: Eficiencia computacional: reduce drásticamente el tiempo de entrenamiento y los requisitos de hardware (memoria y procesamiento).
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [237] Regresar Dependencia de la tarea: algunos métodos de PEFT pueden no generalizar bien a todos los tipos de tareas existentes.
Complejidad de implementación: requiere modificaciones en la arquitectura, como la incorporación de módulos adaptadores o embeddings específicos. Ajuste de prefijos (Prefix Tuning): añade ”prefijos” o tokens aprendibles a la entrada del modelo, permitiendo un ajuste eficiente sin modificar los pesos del modelo central.
Ajuste de prompts (Prompt Tuning): similar al anterior, pero optimiza los embeddings de los prompts de entrada en lugar de modificar los pesos del modelo. BitFit: una técnica ultra-ligera que propone ajustar únicamente los términos de sesgo (bias terms) del modelo.
Consideraciones y desventajas:
a pesar de sus ventajas, PEFT presenta algunas contrapartidas:
Capacidad limitada: dado que solo se ajusta un subconjunto de parámetros, el rendimiento en algunas tareas puede ser ligeramente inferior al de un ajuste fino completo.
Adaptadores (Adapters): consiste en insertar pequeñas capas neuronales adicionales entre las capas existentes del modelo (ej. transformadores). Solo estas nuevas capas se entrenan.
LoRA (Low-Rank Adaptation): introduce una descomposición de bajo rango (lowrank) en las matrices de actualización de pesos, reduciendo drásticamente el número de parámetros entrenables.
Menor costo de almacenamiento: dado que solo se actualiza una fracción de los parámetros, es factible almacenar múltiples versiones del modelo adaptadas a tareas específicas con un costo de almacenamiento mínimo.
Despliegue rápido: permite una adaptación ágil a nuevas tareas sin necesidad de reentrenar el modelo completo.
Mejor generalización: al restringir la cantidad de parámetros que se actualizan, se puede limitar el sobreajuste (overfitting).
Técnicas populares de PEFT:
existen varias técnicas comunes para implementar PEFT:
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [238] Regresar
6.9.
GRÁFICOS PARA MODELOS DE REDES NEURONA-
LES
Las redes neuronales son modelos potentes, pero a menudo se consideran ”cajas negras”. Para abrirlas y entender su funcionamiento, la visualización de datos es indispensable. En lugar de enfocarse en diagramas de arquitectura estáticos, se utilizan gráficos de datos para explorar la información de entrada, diagnosticar el proceso de entrenamiento y evaluar el rendimiento final del modelo. Ejemplo 6.9.1:
Caso de Estudio: Predicción de Enfermedad Cardíaca Se utilizará un conjunto de datos público del UCI Machine Learning Repository [16], este dataset contiene 14 atributos clínicos (edad, sexo, presión arterial, colesterol, etc.) para predecir si un paciente tiene o no una enfermedad cardíaca. Este es un problema de clasificación binaria.
Paso 1: Análisis Exploratorio de Datos (EDA) Antes de entrenar cualquier modelo, se deben entender los datos. age sex cp trestbps chol fbs restecg thalach exang oldpeak slope ca target thal_2 thal_fixed thal_normal thal_reversible age sex cp trestbps chol fbs restecg thalach exang oldpeak slope ca target thal_2 thal_fixed thal_normal thal_reversible
1.00 -0.09 0.08
0.30
0.19
0.14
0.15 -0.39 0.09
0.20
0.15
0.37
0.20
0.02
0.06 -0.13 0.10
-0.09 1.00
0.01 -0.06 -0.20 0.05
0.04 -0.07 0.14
0.12
0.03
0.10
0.17 -0.08 0.14 -0.38 0.32
0.08
0.01
1.00 -0.06 0.12 -0.09 0.08 -0.26 0.34
0.18
0.19
0.19
0.38 -0.12 0.05 -0.25 0.27
0.30 -0.06 -0.06 1.00
0.12
0.20
0.14 -0.06 0.06
0.19
0.11
0.11
0.13 -0.01 0.07 -0.15 0.10
0.19 -0.20 0.12
0.12
1.00 -0.00 0.17
0.02
0.05
0.03
0.01
0.10
0.08 -0.01 -0.09 -0.00 0.06
0.14
0.05 -0.09 0.20 -0.00 1.00
0.06 -0.03 -0.01 0.03
0.04
0.17
0.10 -0.02 0.09 -0.07 0.02
0.15
0.04
0.08
0.14
0.17
0.06
1.00 -0.07 0.09
0.12
0.14
0.12
0.13 -0.06 0.04 -0.02 0.01
-0.39 -0.07 -0.26 -0.06 0.02 -0.03 -0.07 1.00 -0.38 -0.34 -0.36 -0.27 -0.39 0.06 -0.15 0.27 -0.19
0.09
0.14
0.34
0.06
0.05 -0.01 0.09 -0.38 1.00
0.28
0.25
0.14
0.36 -0.04 0.06 -0.31 0.30
0.20
0.12
0.18
0.19
0.03
0.03
0.12 -0.34 0.28
1.00
0.57
0.30
0.48 -0.05 0.10 -0.33 0.30
0.15
0.03
0.19
0.11
0.01
0.04
0.14 -0.36 0.25
0.57
1.00
0.10
0.36 -0.06 0.19 -0.29 0.22
0.37
0.10
0.19
0.11
0.10
0.17
0.12 -0.27 0.14
0.30
0.10
1.00
0.48
0.02
0.09 -0.26 0.21
0.20
0.17
0.38
0.13
0.08
0.10
0.13 -0.39 0.36
0.48
0.36
0.48
1.00 -0.04 0.13 -0.46 0.42
0.02 -0.08 -0.12 -0.01 -0.01 -0.02 -0.06 0.06 -0.04 -0.05 -0.06 0.02 -0.04 1.00 -0.01 -0.06 -0.05
0.06
0.14
0.05
0.07 -0.09 0.09
0.04 -0.15 0.06
0.10
0.19
0.09
0.13 -0.01 1.00 -0.28 -0.20
-0.13 -0.38 -0.25 -0.15 -0.00 -0.07 -0.02 0.27 -0.31 -0.33 -0.29 -0.26 -0.46 -0.06 -0.28 1.00 -0.87
0.10
0.32
0.27
0.10
0.06
0.02
0.01 -0.19 0.30
0.30
0.22
0.21
0.42 -0.05 -0.20 -0.87 1.00
Mapa de Calor de Correlaciones - Enfermedad Cardíaca
0.75
0.50
0.25
0.00
0.25
0.50
0.75
1.00
Fig. 6.43. Mapa de calor de correlaciones para el dataset de enfermedad cardíaca
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [239] Regresar Análisis de correlaciones: un mapa de calor muestra qué variables están más relacionadas con el objetivo (target). En la figura 6.43, se observa que el dolor de pecho (cp), la depresión del ST (oldpeak) y el número de vasos principales (ca) son predictores importantes.
Análisis de distribuciones: un pairplot da una visión completa de las relaciones y distribuciones entre las variables más importantes, separadas por la clase objetivo (pacientes sanos vs. enfermos).
Paso 2: Entrenamiento del modelo y diagnóstico del aprendizaje Se construye y se entrena una red neuronal simple (MLP). La visualización más importante durante el entrenamiento son las curvas de pérdida y precisión. Estas dicen si el modelo está aprendiendo correctamente o si está sobre ajustando (memorizando) los datos de entrenamiento.
En la figura 6.44, las curvas de entrenamiento y validación siguen una trayectoria similar, lo que indica un buen proceso de aprendizaje sin sobreajuste severo. Paso 3: Evaluación visual del rendimiento del modelo Una vez entrenado, se evalúa el rendimiento del clasificador con herramientas visuales estándar en la investigación. Matriz de confusión: dice exactamente cuántas predicciones correctas e incorrectas hizo el modelo para cada clase.
0
20
40
60
80
100
Época
0.70
0.75
0.80
0.85
0.90
0.95
Precisión Curva de Precisión del Modelo Precisión (Entrenamiento) Precisión (Validación)
0
20
40
60
80
100
Época
0.1
0.2
0.3
0.4
0.5
0.6
Pérdida (Loss) Curva de Pérdida del Modelo Pérdida (Entrenamiento) Pérdida (Validación) Fig. 6.44. Curvas de aprendizaje del modelo: precisión (izquierda) y pérdida (derecha)
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [240] Regresar Curva ROC: muestra la capacidad del modelo para distinguir entre las clases. Un área bajo la curva (AUC) cercana a 1.0 indica un excelente rendimiento. La figura 6.45 muestra que el modelo tiene un buen poder predictivo, con un AUC de 0.91 y una alta precisión en la clasificación de ambas clases. Curva ROC: muestra la capacidad del modelo para distinguir entre las clases. Un área bajo la curva (AUC) cercana a 1.0 indica un excelente rendimiento. La figura 6.45 muestra que el modelo tiene un buen poder predictivo, con un AUC de 0.91 y una alta precisión en la clasificación de ambas clases. Sano (0) Enfermo (1) Clase Predicha Sano (0) Enfermo (1) Clase Real
37
7
6
11
Matriz de Confusión
0.0
0.2
0.4
0.6
0.8
1.0
Tasa de Falsos Positivos (FPR)
0.0
0.2
0.4
0.6
0.8
1.0
Tasa de Verdaderos Positivos (TPR) Curva ROC Curva ROC (AUC = 0.88)
10
15
20
25
30
35
Fig. 6.45. Gráficos de evaluación del clasificador: Matriz de Confusión (izquierda) y Curva ROC (derecha) Ejemplo 6.9.2:
Clasificación de diagnóstico médico con redes neuronales: para aterrizar los conceptos de redes neuronales, métricas y visualización, se aborda un problema de clasificación binaria: predecir si un tumor de mama es benigno o maligno a partir de características numéricas de la biopsia.
Problema: desarrollar un modelo de red neuronal que asista en el diagnóstico médico, clasificando tumores con alta precisión a partir de datos clínicos. Dataset: se hara uso del dataset Wisconsin Breast Cancer (Diagnostic), disponible en Kaggle [17]. Contiene 30 características numéricas calculadas a partir de imágenes digitalizadas de una aspiración con aguja fina (FNA) de una masa mamaria.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [241] Regresar
1. Análisis exploratorio y estructura de los datos
Antes de construir cualquier modelo, es crucial entender la estructura de los datos. Se inicia con un análisis de correlación y se complementa con técnicas de reducción de dimensionalidad para visualizar la separabilidad de las clases. Correlación jerárquica Más allá de un simple mapa de calor, esta técnica no solo muestra las correlaciones, sino que también reordena las variables para agrupar aquellas con patrones similares (ver figura 6.46). Los dendrogramas en los márgenes, revelan la estructura interna del dataset, mostrando grupos de variables interrelacionadas (como radio, perímetro y área).
mean concave points worst concave points worst compactness worst concavity mean compactness mean concavity mean perimeter mean radius mean area worst perimeter worst radius worst area area error radius error perimeter error mean texture worst texture texture error smoothness error symmetry error fractal dimension error concave points error compactness error concavity error mean smoothness worst smoothness mean symmetry worst symmetry mean fractal dimension worst fractal dimension mean concave points worst concave points worst compactness worst concavity mean compactness mean concavity mean perimeter mean radius mean area worst perimeter worst radius worst area area error radius error perimeter error mean texture worst texture texture error smoothness error symmetry error fractal dimension error concave points error compactness error concavity error mean smoothness worst smoothness mean symmetry worst symmetry mean fractal dimension worst fractal dimension
0.2
0.0
0.2
0.4
0.6
0.8
1.0
Mapa de Correlación con Clústering Jerárquico Fig. 6.46. Mapa de calor con Clústering jerárquico Visualización de separabilidad
(PCA)
Dado que es imposible visualizar un espacio de 30 dimensiones, el Análisis de Componentes Principales (PCA) lo reduce a dos. El gráfico de la figura 6.47 proyecta cada tumor en este nuevo espacio, revelando que los tumores benignos (azul) y malignos (naranja) forman cúmulos bien definidos. Esto sugiere que un modelo podrá aprender a distinguirlos eficazmente.
5
0
5
10
15
Primer Componente Principal (PC1)
6
4
2
0
2
4
6
8
Segundo Componente Principal (PC2) Visualización de Datos con PCA (Conjunto de Prueba) Benigno Maligno Fig. 6.47. Proyección de los datos en los dos primeros componentes principales
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [242] Regresar
2. Diseño y evaluación del modelo
Se diseña una Red Neuronal Completamente Conectada y se evalúa su proceso de aprendizaje y su rendimiento final. Arquitectura del Modelo Se diseña una red (ver figura 6.48) con una capa de entrada de 30 neuronas (una por cada característica), dos capas ocultas (16 y 8 neuronas) que procesan la información, y una capa de salida para la clasificación binaria (maligno o benigno). Fig. 6.48. Diagrama de la arquitectura de la red neuronal Diagnóstico del entrenamiento Las curvas de aprendizaje son vitales para verificar que el modelo aprende correctamente. La figura 6.49 muestra cómo la precisión aumenta y el error (pérdida) disminuye de forma estable tanto en los datos de entrenamiento como en los de validación, indicando un buen ajuste sin sobreaprendizaje.
0
20
40
60
80
100
Épocas
0.5
0.6
0.7
0.8
0.9
1.0
Precisión Evolución de la Precisión Precisión (entrenamiento) Precisión (validación)
0
20
40
60
80
100
Épocas
0.0
0.1
0.2
0.3
0.4
0.5
0.6
0.7
Pérdida (Loss) Evolución de la Pérdida Pérdida (entrenamiento) Pérdida (validación) Curvas de Aprendizaje del Modelo Fig. 6.49. Curvas de precisión y pérdida durante el entrenamiento Evaluación del rendimiento La matriz de confusión que se observa en la figura 6.50 es el ”informe de resultados” final del modelo. Desglosa los aciertos y errores. En este caso, muestra una alta tasa de acierto, con muy pocos falsos positivos y falsos negativos, confirmando el excelente rendimiento del clasificador en el conjunto de prueba.
Maligno Benigno Diagnóstico Predicho Maligno Benigno Diagnóstico Real
61
3
0
107
Matriz de Confusión
0
20
40
60
80
100
Fig. 6.50. Matriz de confusión de las predicciones
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [243] Regresar
3. Interpretación y análisis de características clave
Para comprender qué impulsa las decisiones del modelo, se analiza cómo se distribuyen las características más influyentes entre las dos clases. Distribución de "worst concave points" por Diagnóstico Análisis de características (Violín) Un gráfico de violín (ver figura 6.51) combina un diagrama de caja con la densidad de los datos. Demuestra una diferencia drástica en la característica worst concave points: los tumores malignos (M) presentan valores consistentemente más altos. Alternativa visual (Cresta) Un gráfico de cresta (Ridgeline Plot) (ver figura 6.52) presenta la misma información de densidad de una forma elegante, permitiendo una comparación clara de las distribuciones y resaltando la notable separación entre los valores de los tumores benignos (B) y malignos (M).
Benigno Maligno Diagnóstico
0.00
0.05
0.10
0.15
0.20
0.25
0.30
Valor de la Característica Fig. 6.51. Distribución de worst concave points
0.05
0.00
0.05
0.10
0.15
0.20
0.25
0.30
Valor de worst concave points Distribución de "worst concave points" por Diagnóstico Benigno Maligno Fig. 6.52. Gráfico de cresta para comparar distribuciones Perspectiva adicional (PCA en 3D): para una perspectiva diferente, se puede extender el PCA a tres componentes. Visualizar los datos en un gráfico de dispersión 3D (ver figura 6.53) a veces revela estructuras que no son evidentes en 2D, mostrando la profundidad y la clara separación entre las dos clases de tumores.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [244] Regresar
5
0
5
10
15
PC1
6
4
2
0
2
4
6
8
PC2
4
2
0
2
4
6
8
PC3 Visualización de Datos con PCA en 3D Diagnóstico Benigno Maligno Fig. 6.53. Visualización 3D de los tres primeros componentes principales Conclusión La construcción exitosa de un modelo de clasificación no se basa en una sola métrica, sino en una narrativa visual completa que guía el proceso desde la exploración hasta la interpretación. Es la sinergia de estas visualizaciones la que permite no solo construir un modelo preciso, sino también comprenderlo, validarlo y confiar en sus resultados. Ejemplo 6.9.3:
Flujo de trabajo de modelado para movilidad urbana: mientras que el ejemplo anterior se centró en un análisis profundo de un único problema de clasificación, este caso práctico ilustra un flujo de trabajo completo que aborda simultáneamente tareas de clasificación y regresión. El objetivo es demostrar cómo se combinan el análisis de correlación, las métricas de distancia y múltiples técnicas de visualización para seleccionar y validar los mejores modelos en un contexto de movilidad urbana.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [245] Regresar Se generó un conjunto de datos sintético de 2000 observaciones y 11 atributos, inspirado en viajes. Los objetivos del análisis son dos:
1. Clasificación: predecir si un viaje es rentable (Sí/No).
2. Regresión: predecir la duración del viaje en minutos.
Paso 1: Análisis exploratorio de datos Análisis de correlación.
El primer paso es entender qué variables se relacionan con los objetivos. La tabla XXX muestra las correlaciones de Pearson, Spearman y Kendall. Se observa que la temperatura y la hora son las variables más influyentes en la duración del viaje. Para la rentabilidad, destacan variables latentes como feat_1, feat_6 y feat_8, lo que sugiere relaciones más complejas.
TABLA XXX.
CORRELACIONES ENTRE VARIABLES Y LOS OBJETIVOS DE DURACIÓN Y RENTABILIDAD
Variable Pearson (Dur) Spearman (Dur) Kendall (Dur) Pearson (Rent) Spearman (Rent) Kendall (Rent) feat_1
0.082
0.069
0.046
-0.427
-0.437
-0.357
feat_3
0.043
0.031
0.020
-0.297
-0.291
-0.238
feat_6
-0.048
-0.043
-0.029
0.384
0.393
0.321
feat_8
-0.042
-0.024
-0.016
0.335
0.313
0.255
hour
-0.243
-0.234
-0.159
0.000
0.001
0.001
temp
0.319
0.314
0.212
0.008
0.007
0.006
Clustering exploratorio con métricas de distancia.
Antes de modelar, se aplicaron técnicas de agrupamiento no supervisado para ver si los datos forman grupos naturales. Se probaron tres métricas de distancia (figuras 6.54 a 6.56) para visualizar la estructura de los datos desde diferentes perspectivas: geométrica (Euclídea), robusta a outliers (Cityblock) y de orientación (Coseno). Estas métricas de distancia se utilizan en el espacio latente generado por la red para medir similitudes entre representaciones internas de los datos, lo que es especialmente relevante en tareas de clustering y recuperación de información.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [246] Regresar Fig. 6.54. Distancia euclídea Fig. 6.55. Distancia Cityblock Fig. 6.56. Similitud del Coseno Paso 2: Modelado supervisado y comparación de resultados Resultados de clasificación.
Se entrenaron cuatro modelos para predecir la rentabilidad. La tabla XXXI muestra que el Support Vector Classifier (SVC) obtuvo el mejor rendimiento general, con el AUC más alto (0.910) y un excelente recall (0.916), indicando que es muy bueno para identificar los viajes rentables.
TABLA XXXI.
COMPARACIÓN DE MODELOS DE CLASIFICACIÓN PARA PREDECIR LA RENTABILIDAD
Modelo Accuracy Precision Recall F1
AUC
Logistic Regression
0.762
0.729
0.799
0.762
0.839
Random Forest
0.834
0.793
0.883
0.836
0.906
SVC
0.844
0.791
0.916
0.849
0.910
MLP
0.814
0.797
0.820
0.808
0.898
Resultados de regresión.
Para predecir la duración del viaje, la Support Vector Regression (SVR) fue el modelo más preciso, logrando el menor Error Cuadrático Medio (RMSE) y Error Absoluto Medio (MAE), como se detalla en la tabla XXXII.
TABLA XXXII.
COMPARACIÓN DE MODELOS DE REGRESIÓN PARA PREDECIR LA DURACIÓN DEL VIAJE
Modelo
RMSE
MAE
R2 Linear Regression
9.434
7.601
0.129
Random Forest Regr.
9.811
7.908
0.058
SVR
9.432
7.563
0.129
MLPRegressor
10.239
8.057
-0.026
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [247] Regresar Paso 3: Interpretación profunda a través de visualizaciones Las métricas numéricas indican qué modelo es mejor, pero las visualizaciones ayudan a entender el porqué.
Las Curvas ROC (figura 6.57) confirman visualmente la superioridad del SVC en la tarea de clasificación, mostrando que su curva abarca la mayor área. La proyección PCA/t-SNE (figura 6.58) revela la estructura de los datos y permite visualizar en qué áreas del espacio de características los modelos cometen más errores.
El dendrograma jerárquico (figura 6.59) complementa el análisis de clústeres, mostrando cómo se agrupan los viajes de forma anidada.
0.0
0.2
0.4
0.6
0.8
1.0
FPR
0.0
0.2
0.4
0.6
0.8
1.0
TPR (Recall) ROC Curves LogisticRegression (AUC=0.84) RandomForest (AUC=0.91)
SVC (AUC=0.91)
MLP (AUC=0.90)
Fig. 6.57. Curvas ROC comparativas para los modelos de clasificación
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [248] Regresar
3
2
1
0
1
2
PCA 1
4
2
0
2
4
PCA 2
PCA
coloreado por |residual|
5
10
15
20
25
30
|Residual|
60
40
20
0
20
40
60
t-SNE 1
40
30
20
10
0
10
20
30
40
t-SNE 2 t-SNE coloreado por |residual|
5
10
15
20
25
30
|Residual| Proyección PCA/t-SNE mostrando clusters de viajes y errores del modelo Fig. 6.58. Proyección PCA/t-SNE mostrando clusters y errores residuales
(5)
(15)
(7)
(4)
(5)
(11)
(2)
(8)
(7)
(6)
(7)
(3)
0
2
4
6
8
10
12
14
16
Dendrograma (muestra 80 obs) Fig. 6.59. Dendrograma jerárquico de las observaciones de viajes Conclusión Este ejemplo integral demuestra que un análisis robusto combina métricas cuantitativas con herramientas visuales. El análisis de correlación inicial da una guia en la selección de variables. Las tablas de resultados permitieron elegir los modelos con mejor rendimiento: SVC para clasificación y SVR para regresión. Finalmente, las visualizaciones avanzadas como las curvas ROC y las proyecciones PCA/t-SNE fueron esenciales para validar los hallazgos y obtener una comprensión más profunda de la estructura de los datos y el comportamiento de los modelos.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [249] Regresar
6.10.
VISUALIZACIONES PARA INTERPRETABILIDAD
Y ANÁLISIS ESTRUCTURAL
Más allá de evaluar si un modelo es preciso, las visualizaciones avanzadas permiten entender el por qué de sus decisiones y la estructura inherente de los datos. Estas técnicas, comunes en publicaciones científicas, añaden una capa de profundidad y credibilidad al análisis, pasando de la simple predicción a la generación de conocimiento. Ejemplo 6.10.1:
Caso de estudio: identificación de biomarcadores en insuficiencia cardíaca Para ilustrar el poder de estas visualizaciones, se hará uso del dataset Heart Failure Prediction [18] de Kaggle. El objetivo es identificar los factores clínicos más significativos asociados a la mortalidad y entender sus interrelaciones. Paso 1: Identificar los biomarcadores más significativos Análisis de significancia con gráfico de Volcán El gráfico de volcán es una herramienta de la bioestadística que visualiza la significancia estadística (eje Y) frente a la magnitud de la diferencia entre dos grupos (eje X). Se usa para identificar al instante qué biomarcadores distinguen mejor a los pacientes que fallecieron de los que sobrevivieron. Los puntos en las esquinas superiores son los predictores más potentes.
1.00
0.75
0.50
0.25
0.00
0.25
0.50
Diferencia de Medias (Log2 Fold Change)
0
5
10
15
20
Significancia Estadística (-Log10 P-valor) Umbral de significancia (p=0.05) Asociado a Mortalidad Asociado a Supervivencia age ejection_fraction serum_creatinine time Gráfico de Volcán: Identificación de Biomarcadores de Riesgo y Protección Fig. 6.60. Gráfico de Volcán. Serum_creatinine es un factor de riesgo, mientras que ejection_fraction es un factor protector
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [250] Regresar Paso 2: Entender la estructura de las relaciones Análisis estructural con grafo de correlación Mientras un mapa de calor solo muestra la fuerza de las correlaciones, un grafo de red visualiza la estructura de estas relaciones. Cada variable es un nodo y el grosor de las líneas indica la fuerza de su correlación. Los colores revelan ”comunidades” de variables, mostrando un clúster principal que conecta la edad, la creatinina y la fracción de eyección.
age anaemia creatinine_phosphokinase diabetes ejection_fraction high_blood_pressure platelets serum_creatinine serum_sodium sex smoking time Cada color representa una "familia" de variables fuertemente interconectadas. El grosor de las líneas indica la fuerza de la correlación. Grafo de Correlaciones: Estructura de Biomarcadores Clínicos Fig. 6.61. Grafo de red de las correlaciones. Los colores representan clústeres de variables relacionadas Paso 3: Analizar la interacción entre factores clave Análisis de Interacciones Multivariables Un gráfico de dispersión multivariable es ideal para profundizar en la interacción entre los mejores predictores. Aquí, se relacionan la ejection_fraction (eje Y) y la serum_creatinine (eje X), mientras que el tamaño de cada punto representa la edad del paciente y el color indica el desenlace (mortalidad o supervivencia).
2
4
6
8
Creatinina Sérica (mg/dL)
20
30
40
50
60
70
80
Fracción de Eyección (%) Relación entre Fracción de Eyección, Creatinina y Edad Diagnóstico y Edad Sobrevive Fallece
40
50
60
70
Fig. 6.62. Los eventos de mortalidad (naranja) se concentran en la zona de baja fracción de eyección, alta creatinina y mayor edad (puntos grandes)
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [251] Regresar Paso 4: Seleccionar el mejor modelo predictivo Benchmark de modelos con Heatmap Finalmente, para seleccionar el mejor modelo de clasificación, se comparan varios algoritmos a través de múltiples métricas. Un mapa de calor es una forma efectiva y visualmente densa de presentar estos resultados. El objetivo es identificar el modelo que presenta consistentemente los mejores valores en las métricas más importantes.
Accuracy Precision Recall F1-Score
AUC
Regresión Logística Random Forest
SVC
Modelo
0.833
0.792
0.655
0.717
0.864
0.811
0.750
0.621
0.679
0.886
0.789
0.727
0.552
0.627
0.856
Benchmark de Modelos de Clasificación
0.60
0.65
0.70
0.75
0.80
0.85
Puntuación de la Métrica Fig. 6.63. Mapa de calor comparando el rendimiento de tres modelos. El Random Forest destaca con los valores más altos (colores claros) Conclusión del caso de estudio Este flujo de trabajo demuestra cómo un conjunto de visualizaciones avanzadas construye una narrativa analítica completa. Se pasó de identificar los biomarcadores individuales más significativos con el gráfico de volcán, a entender su estructura de interconexiones con el grafo de red. Luego, se profundizó en la interacción de los factores de riesgo clave con el gráfico multivariable y, finalmente, se seleccionó el modelo predictivo de mayor rendimiento con el heatmap comparativo. Este enfoque, que combina múltiples perspectivas visuales, es fundamental para extraer conocimiento profundo y confiable de los datos.
[253] Regresar Referencias [1] B. Mundial, “Esperanza de vida al nacer, total (años),” Banco Mundial, 2024, consultado el [Fecha de consulta]. [Online]. Available: https://datos.bancomundial. org/indicador/SP.DYN.LE00.IN 18 [2] D. N. de Planeación (DNP), “Portal de datos abiertos de colombia,” Departamento Nacional de Planeación (DNP), 2024. [Online]. Available: https://www.datos.gov.co/ [3] Kaggle, “Datasets,” Kaggle, 2024. [Online]. Available: https://www.kaggle.com/ datasets [4] E. Union, “European union open data portal,” European Union, 2024. [Online]. Available: https://data.europa.eu/euodp/en/data [5] B. Mundial, “Datos del banco mundial,” Banco Mundial, 2024. [Online]. Available: https://data.worldbank.org/ [6] N. Unidas, “Undata: A world of information,” Naciones Unidas, 2024. [Online]. Available: https://data.un.org/default.aspx [7] U. G. S. Administration, “Data.gov,” U.S. General Services Administration, 2024. [Online]. Available: https://data.gov/ [8] I. U. University of California, “Uci machine learning repository,” University of California, Irvine (UCI), 2024. [Online]. Available: https://archive.ics.uci.edu/ datasets [9] R. A. Fisher, R. Duda, P. Hart, and D. Stork, “Iris data set,” UCI Machine Learning Repository, 2024, consultado el [Fecha de consulta]. [Online]. Available: https://archive.ics.uci.edu/dataset/53/iris 54, 201 [10] R. S. Forsyth, “Zoo data set,” UCI Machine Learning Repository, 1990. [Online]. Available: https://archive.ics.uci.edu/dataset/111/zoo
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [254] Regresar [11] A. M. Horst, K. B. Gorman, and A. L. Hill, “Palmer penguins: Palmer archipelago (antarctica) penguin data,” GitHub, 2020. [Online]. Available: https://github.com/allisonhorst/palmerpenguins [12] B. V. M, “Forest fire dataset,” Kaggle, 2024. [Online]. Available: https://www.kaggle. com/datasets/balavashan/forest-fire-dataset [13] J. Brownlee, “Airline passengers dataset,” GitHub, 2024. [Online]. Available: https:// raw.githubusercontent.com/jbrownlee/Datasets/master/airline-passengers.csv [14] robikscube, “Hourly energy consumption,” Kaggle, 2024. [Online]. Available: https://www.kaggle.com/datasets/robikscube/hourly-energy-consumption 166 [15] T.
Sharma, “Global economic indicators (2010-2025),” Kaggle,
2025.
[Online].
Available:
https://www.kaggle.com/datasets/tanishksharma9905/ global-economic-indicators-20102025 [16] R. Detrano, G. Janosi, P. Anhang et al., “Heart disease data set,” UCI Machine Learning Repository, 2024. [Online]. Available: https://archive.ics.uci.edu/dataset/ 45/heart+disease [17] W. Wolberg, N. Street, and O. Mangasarian, “Breast cancer wisconsin (diagnostic) data set,” UCI Machine Learning Repository and Kaggle, 1995. [Online]. Available: https://www.kaggle.com/datasets/uciml/breast-cancer-wisconsin-data [18] A. Ahmad, “Heart failure clinical data,” Kaggle, 2020. [Online]. Available: https://www.kaggle.com/datasets/andrewmvd/heart-failure-clinical-data [19] M. Modarres and K. Groth, Reliability and risk analysis, 2nd ed. CRC Press, Taylor and Francis Group, 2023, iSBN: 9781000864137.
[20] D. J. Smith, Reliability, maintainability and risk: Practical methods for engineers, 10th ed. Elsevier, Butterworth-Heineman, 2022, iSBN 9780323912617. [21] J. E. Breneman, C. Sahay, and E. E. Lewis, Introduction to reliability engineering. John Wiley; Sons, Inc., 2022, iSBN: 978-1-119-64056-1.
[22] O. P. D. T. and A. Kleyner, Practical Reliability Engineering, 5th ed. Wiley, 2017, iSBN:
9781119961277.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [255] Regresar [23] J. D. Campbell, A. k. Jardine, and J. McGlynn, Asset management excellence: Optimizing equipment life cycle decisions, 2nd ed. CRC Press, 2019, iSBN: 978-0-8493-0324-1. [24] E. Brandley, Reliability Engineering: A life cycle approach, 2nd ed. CRC Press, 2022, iSBN: 9781032353371.
[25] A. Lester, Project Management, Planning and Control: Managing Engineering, Construction and Manufacturing Projects to PMI, APM and BSI Standards. Elsevier Science, 2017.
[Online]. Available: https://books.google.com.co/books?id=17_kDAAAQBAJ [26] B. Khandelwal, Project Planning and Control with PERT & CPM. Laxmi Publications Pvt Limited, 2002. [Online]. Available: https://books.google.com.co/books?id= wtwMj_wnvgEC [27] G. Yang, Life Cycle Reliability Engineering.
Wiley, 2007. [Online]. Available:
https://books.google.com.co/books?id=EDUDeA2sV0wC [28] B. S. Dhillon, Engineering maintenance a modern approach, 1st ed. CRC Press, 2002, iSBN 9780367342098.
[29] D. C. Montgomery and G. C. Runger, Applied statistics and probability for engineers. John wiley & sons, 2020, iSBN: 978-1-119-40036-3.
[30] R. Mobley, An Introduction to Predictive Maintenance, ser. Plant Engineering. Elsevier Science, 2002. [Online]. Available: https://books.google.com.co/books?id= SjqXzxpAzSQC [31] J. Levitt, The handbook of maintenance management. Industrial Press Inc., 2009.
[32] B. Epstein and I. Weissman, Mathematical models for Systems Reliability. CRC Press, 2008, iSBN: 9780367387327.
[33] P. O’Connor and A. Kleyner, Practical reliability engineering. John Wiley & Sons, 2012, iSBN:9780470979822.
[34] M. Ben-Daya, S. O. Duffuaa, A. Raouf, J. Knezevic, and D. Ait-Kadi, Handbook of maintenance management and engineering.
Springer, 2009, vol. 7.
[35] D. Palmer, Maintenance planning and scheduling handbook. McGraw-Hill New York,
2006.
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [256] Regresar [38] G. Lawler, Introduction to Stochastic Processes, ser. Chapman & Hall/CRC Probability Series.
CRC Press, 2018. [Online]. Available: https://books.google.com.co/books? id=eiGeDwAAQBAJ [39] B. Dhillon, Applied Reliability and Quality: Fundamentals, Methods and Procedures, ser. Springer Series in Reliability Engineering.
Springer London, 2007. [Online].
Available: https://books.google.com.co/books?id=_gb2zwEACAAJ [40] UNE, UNE-EN 13306:2018: Maintenance - Maintenance terminology. UNE - Normalización española, 2018.
[41] G. Hutchins, ISO 31000: 2018 enterprise risk management. Greg Hutchins, 2018.
[42] T. A. Stolarski, Tribology in Machine Design. Butterworth-Heinemann, 2000, iSBN
978-0-08-051967-8.
[43] T. Wilkens, “Fundamentals of scheduling and resource leveling,” Strategic Management Journal, vol. 17, no. 3, pp. 4–10, 2006.
[44] P. L. Meyer, Probabilidad y aplicaciones estadísticas. Buenos Aires: Addison-Wesley Iberoamericana, 1992.
[45] M. R. Spiegel, Probabilidad y estadística, 3rd ed., ser. Schaum. Mexico, D.F.: McGraw- Hill Interamericana, 2010.
[46] W. Li, Risk Assessment of Power Systems : Models, Methods, and Applications., 2nd ed., ser. IEEE Press Series on Power and Energy Systems Series. John Wiley and Sons, Ltd, 2014.
[47] I. of Asset Management, B. S. I. Staff, and B. S. Institution, Asset Management: Part 2: Guidelines for the Application of PAS 55-1: PAS 55-2:2008, ser. Asset Management. British Standards Institution, 2008. [Online]. Available: https://books.google.com.co/ books?id=NJ2jPAAACAAJ [36] R. N. Allan et al., Reliability evaluation of power systems. Springer Science & Business Media, 2013.
[37] S. Zaderenko, Sistemas de programación por camino crítico: PERT, CPM, Man scheduling, RAMPS, PRISM y otros métodos de elaboración y control de programas. Librería Mitre,
1968. [Online]. Available: https://books.google.com.co/books?id=aB1XxgEACAAJ
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [257] Regresar [48] IEEE, “Ieee guide for electric power distribution reliability indices,” IEEE Std 1366- 2012 (Revision of IEEE Std 1366-2003), pp. 1–43, 2012.
[49] CREG,
“Resolución
15
de 2018,” Feb
2018.
[Online].
Available: https://gestornormativo.creg.gov.co/gestor/entorno/docs/resolucion_creg_ 0015_2018.htm [50] D. Wikoff, S. Isenhour, B. Weil, and D. Kowert, Leader’s Guide to ISO 55001: Asset Management System Requirements, ser. Leadership for Asset Management Excellence Series.
CreateSpace Independent Publishing Platform, 2015. [Online]. Available: https://books.google.com.co/books?id=ZX0OswEACAAJ [51] J. Clements, R. Baker, and J. Gido, Successful Project Management. Cengage South-Western, 2022. [Online]. Available: https://books.google.com.co/books?id= I-JGzwEACAAJ [52] F. LOPEZ, PROYECTOS CON LINEAMIENTOS DEL PMI., ser. Ciencias empresariales. Administración.
Ecoe Ediciones, 2017. [Online]. Available: https://books.google. com.co/books?id=yXs5DwAAQBAJ [53] P. Institute, A Guide to the Project Management Body of Knowledge (PMBOK® Guide)
– Seventh Edition and The Standard for Project Management (ARABIC), ser. PMBOK®
Guide.
Project Management Institute, 2021. [Online]. Available: https://books. google.com.co/books?id=Z5BFEAAAQBAJ [54] M. ˇCepin, Assessment of power system reliability: methods and applications. Springer Science & Business Media, 2011.
[55] M. S. Alvarez-Alvarado, D. L. Donaldson, A. A. Recalde, H. H. Noriega, Z. A. Khan, W. Velasquez, and C. D. Rodriguez-Gallegos, “Power system reliability and maintenance evolution: A critical review and future perspectives,” IEEE Access, vol. 10, pp. 51 922–51 950, 2022.
[56] M. Durivage, Practical Engineering, Process, and Reliability Statistics. ASQ Quality Press,
2014. [Online]. Available: https://books.google.com.co/books?id=9y9uCQAAQBAJ
[57] W. Q. Meeker, L. A. Escobar, and F. G. Pascual, Statistical methods for reliability data. John Wiley & Sons, 2022.
[58] A. Jardine and A. Tsang, Maintenance, Replacement, and Reliability: Theory and Applications.
CRC Press, 2021. [Online]. Available: https://books.google.com.co/ books?id=MkA6EAAAQBAJ
Representaciones de datos, para análisis exploratorio aplicado a ingeniería [258] Regresar [62] S. Duffuaa and A. Raouf, Planning and Control of Maintenance Systems: Modelling and Analysis.
Springer International Publishing,
2016.
[Online].
Available:
https://books.google.com.co/books?id=39IkvgAACAAJ [63] J. Deshpande and S. Purohit, Lifetime Data: Statistical Models And Methods (Second Edition), ser. Series On Quality, Reliability And Engineering Statistics. World Scientific Publishing Company, 2015. [Online]. Available: https://books.google.com. co/books?id=CH5IDQAAQBAJ [64] A. Papoulis and S. Pillai, Probability, Random Variables, and Stochastic Processes, ser. McGraw-Hill electrical and electronic engineering series. McGraw-Hill, 2002.
[Online]. Available: https://books.google.com.co/books?id=YYwQAQAAIAAJ [65] R.
Stapelberg, Handbook of Reliability, Availability, Maintainability and Safety in Engineering Design.
Springer London,
2016.
[Online].
Available:
https:
//books.google.com.co/books?id=gkdlvgAACAAJ [66] R. MISHRA and K. PATHAK, MAINTENANCE ENGINEERING AND MANAGE-
MENT.
PHI Learning, 2012. [Online]. Available: https://books.google.com.co/ books?id=2LltCdmrvuIC [67] T. Agustiady and E. Cudney, Total Productive Maintenance: Strategies and Implementation Guide, ser. Systems innovation book series.
CRC Press, 2023. [Online]. Available:
https://books.google.com.co/books?id=w8gW0AEACAAJ [68] R. Anderson and L. Neri, Reliability-Centered Maintenance: Management and Engineering Methods.
Springer Netherlands, 2012. [Online]. Available: https://books.google. com.co/books?id=IkL8CAAAQBAJ [69] R. Rai, S. Chaturvedi, and N. Bolia, Repairable Systems Reliability Analysis: A Comprehensive Framework, ser. Performability Engineering Series. Wiley, 2020.
[Online]. Available: https://books.google.com.co/books?id=edL8DwAAQBAJ [59] B. Ayyub and R. McCuen, Probability, Statistics, and Reliability for Engineers and Scientists.
CRC Press, 2016. [Online]. Available: https://books.google.com.co/ books?id=j0HOBQAAQBAJ [60] H. Pham, Handbook of Reliability Engineering. Springer London, 2014. [Online].
Available: https://books.google.com.co/books?id=FfUAswEACAAJ [61] M. Ben-Daya, S. Duffuaa, A. Raouf, J. Knezevic, and D. Ait-Kadi, Handbook of Maintenance Management and Engineering. Springer London, 2014. [Online]. Available: https://books.google.com.co/books?id=5kwLogEACAAJ
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [259] Regresar [70] M. d. C. Torres Jiménez, “Curvas funcionales de lorenz,” Revista Electrónica de Investigación y Evaluación Educativa (RELIEVE), vol. 17, no. 1, pp. 1–17, 2011. [Online]. Available: https://dialnet.unirioja.es/servlet/articulo?codigo=3642240 [71] S. Choudhury, B. Narayanan, M. Moret, V. Hatzimanikatis, and L. Miskovic, “Generative machine learning produces kinetic models that accurately characterize intracellular metabolic states,” Nature Catalysis, vol. 7, no. 10, pp. 1086–1098, 2024. [72] M. Shukla, “Interpreting time series forecasts with lime and shap: A case study on the air passengers dataset,” arXiv, no. 2508.12253, 2025.
[73] A. Anupam and I. A. Lawal, “Forecasting air passenger travel: A case study of norwegian aviation industry,” Journal of Forecasting, vol. 43, no. 3, pp. 661–672, 2023. [74] N. L. Ma, “Forecasting passenger flows using data analytics,” in Advances in Artificial Intelligence: From Theory to Practice (IEA/AIE 2017). Springer, Cham, 2017, pp. 211–220. [75] B. R. Md. Abu Saleh, H.M. Rasel, “From data to decisions: Leveraging ml for improved river discharge forecasting in bangladesh,” Watershed Ecology and the Environment,
2024.
[76] K. Zhang, Y. Jiang, D. Liu, and H. Song, “Spatio-temporal data mining for aviation delay prediction,” arXiv, 2021.
Mauricio Holguín Londoño - Germán Andrés Holguín Londoño - Kevin David Ortega Quiñones [261] Regresar La Editorial de la Universidad Tecnológica de Pereira tiene como política la divulgación del saber científico, técnico y humanístico para fomentar la cultura escrita a través de libros y revistas científicas especializadas.
Las colecciones de este proyecto son: Trabajos de Investigación, Ensayos, Textos Académicos y Tesis Laureadas.
Este libro pertenece a la colección Textos académicos
Facultad de Ingenierías
ISBN: 978-628-501-075-0
Universidad Tecnológica de Pereira El libro Representaciones de datos para análisis exploratorio aplicado a ingeniería es una obra orientada al fortalecimiento de las competencias analíticas y estadísticas en la formación profesional en ingeniería. Mediante un enfoque progresivo, integra fundamentos teóricos de la estadística con herramientas prácticas de visualización para apoyar la toma de decisiones basada en datos.
El texto aborda los principios de la representación gráfica, la calidad y el preprocesamiento de la información, así como las principales técnicas de la estadística descriptiva e inferencial. Incluye el análisis de series de tiempo, su modelado y predicción, y la aplicación de visualizaciones en procesos de forecasting. Además, incorpora representaciones orientadas al aprendizaje automático, abarcando regresión, clasificación, agrupamiento y herramientas para la evaluación e interpretabilidad de modelos. Por su estructura clara y enfoque aplicado, el libro se consolida como una guía académica para estudiantes, docentes e investigadores interesados en el análisis y la comunicación efectiva de datos en ingeniería.
Cita: Holguín Londoño, Mauricio, Holguín Londoño, Germán Andrés, Ortega Quiñones, Kevin David (2026), Representaciones de datos, para análisis exploratorio aplicado a ingeniería, Universidad Tecnológica de Pereira, p. N. https://hdl.handle.net/11059/16692