Maestría en Ciencia de Datos · 2025
Muzca – Rhythm Representation Studies
Este trabajo presenta un enfoque basado en aprendizaje profundo para predecir representaciones rítmicas explicables directamente a partir de archivos de audio (.WAV). La representación utilizada, denominada Densidad de Inicio Ponderada por Frecuencia (FWOD), permite sintetizar la densidad rítmica de un compás en un vector unidimensional de 16 valores. En una fase inicial, se validó la utilidad de FWOD como descriptor rítmico mediante la aplicación de modelos de clasificación sobre datos simbólicos (archivos MIDI), logrando una precisión del 90,5% y superando trabajos previos de vanguardia. Este resultado sirvió como base para la segunda fase del proyecto, centrada en la predicción del vector FWOD a partir de audio real mediante modelos convolucionales (CNN) entrenados en espectrogramas de Mel. El conjunto de datos final se construyó a partir de la correspondencia entre los archivos .MIDI y .WAV del conjunto de datos MIDI Groove de Magenta, ajustado y alineado para facilitar la comparación entre ambas representaciones. Se exploraron la arquitectura, la regularización y las variantes de conjunto, alcanzando un MAE mínimo de 0,1836 con un R² estimado de 0,70. Los resultados confirman la viabilidad de FWOD como puente entre la señal acústica y el análisis rítmico computacional, abriendo nuevas posibilidades para el desarrollo de marcos explicables de clasificación musical centrados en la percusión (Choi et al., 2017; Gómez-Marín et al., 2024).
Texto completo 41 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 6
- Contexto y antecedentesp. 7
- Árbol del problemap. 8
- Problema Centralp. 9
- Dificultad en el análisis de patrones musicalesp. 9
- Clasificación ineficiente de patrones musicalesp. 9
- Limitaciones en la generación de músicap. 9
- Naturaleza multidimensional de los sonidos musicalesp. 9
- Limitaciones de las representaciones actualesp. 10
- Falta de validación de nuevas representacionesp. 10
- Relación con el proyecto Muzcap. 10
- Objetivosp. 11
- Objetivo Generalp. 11
- Objetivos Específicosp. 11
- Metodologíap. 11
- Fases del procesop. 13
- Comprensión del Problemap. 13
- Análisis de los Datosp. 13
- Preparación de los Datosp. 14
- Construcción del dataset experimentalp. 15
- Modeladop. 15
- Evaluaciónp. 16
- Roles y Dinámica del Equipop. 16
- Fundamentos de Representación y Percepción Rítmicap. 16
- Representación Musicalp. 17
- Simplificación rítmica y percepciónp. 17
- Frequency-Weighted Onset Density (FWOD)p. 17
- Clasificación y Generación de Ritmosp. 18
- Clasificación de ritmos desde MIDI usando FWODp. 18
- Rhythm Spacep. 19
- Estado del artep. 19
- Propuestap. 20
- Viabilidad y selección del dataset experimentalp. 21
- Predicción de ritmo desde audio realp. 21
- Tratamiento y preparación del datasetp. 21
- Generación del mel_fwod_dataset.npzp. 22
- División del datasetp. 23
- Modelado de FWOD desde espectrogramas Melp. 24
- Métricas de evaluaciónp. 24
- Estrategias evaluadasp. 24
- Validación y aprendizajep. 27
- Limitacionesp. 28
- Dependencia de la Calidad y Variedad del Datasetp. 29
- Desbalance en la Distribución de Clasesp. 29
- Limitaciones técnicas de los modelosp. 29
- Conclusiones y trabajo futurop. 30
- Conclusiones generalesp. 30
- Perspectivas del framework FWODp. 30
- Líneas de trabajo futurop. 31
- Referenciasp. 32
- Anexosp. 34
- Anexo A. Resultados detallados del alcance inicial: MIDI → FWOD → Clasificaciónp. 34
- Modelos evaluadosp. 34
- Configuraciones del datasetp. 34
- Cuadro resumen de resultados (Accuracy)p. 34
- Principales hallazgosp. 35
- Figuras y métricas adicionalesp. 35
- Anexo B. Rhythm Space: Resultados detalladosp. 37
- Tratamiento del datasetp. 37
- Modelos implementadosp. 37
- Principales resultadosp. 38
- Anexo C. Resultados comparativos de los modelos CNN aplicados a audio realp. 39