Maestrías de la Facultad de Ingeniería · 2024
Identificación y relacionamiento de elementos comunes en testimonios escritos de víctimas del conflicto armado en Colombia usando inteligencia artificial
RESUMEN : Tras más de 60 años de violencia en Colombia, originada por la lucha política entre el Estado y diferentes actores, se cuenta con una amplia fuente de testimonios escritos de las víctimas. Realizar un análisis tradicional de este acervo supone una gran inversión en términos de tiempo y recursos, por lo que este trabajo de investigación pretende plantear la aplicación de un método en el que, a través de un conjunto de técnicas de machine learning, en las que intervienen principalmente el procesamiento de lenguaje natural, la minería de textos y la similitud de documentos, permita establecer un relacionamiento entre los testimonios de las víctimas, encontrando en ellos elementos comunes, para tratar de comprender temas como el entendimiento y la configuración de la guerra y sus formas, así como la representación y participación de actores y eventos.
Texto completo 80 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 11
- Abstractp. 12
- Introducciónp. 13
- 1 Justificaciónp. 15
- 2 Planteamiento del problemap. 17
- 3 Objetivosp. 21
- 3.1 Objetivo generalp. 21
- 3.2 Objetivos específicosp. 21
- 4 Marco teóricop. 22
- 5 Metodologíap. 30
- 5.1 Fase 1: consolidación del corpus testimonialp. 31
- 5.2 Fase 2: preprocesamiento y limpiezap. 34
- 5.2.1 Definición del entorno y marco de desarrollop. 34
- 5.2.2 Instalación e importación de dependencias y libreríasp. 35
- 5.2.3 Carga del corpusp. 37
- 5.2.4 Funciones de preprocesamientop. 38
- 5.3 Fase 3: definición de dimensionesp. 43
- 5.4 Fase 4: desarrollo y aplicación del algoritmop. 46
- 5.4.1 Relacionesp. 48
- 5.4.2 Similitudp. 50
- 5.5 Fase 5: presentación de resultadosp. 52
- 6 Resultadosp. 54
- 7 Conclusionesp. 70
- 8 Recomendacionesp. 73
- Referenciasp. 75
- Anexosp. 80
- relacionamiento de testimoniosp. 35
- Tabla 2 Cantidad de palabras por dimensiónp. 58
- Tabla 3 Tabla del corpus preprocesadop. 60
- Tabla 4 Comparativo de palabras entre corpus inicial preprocesado y filtradop. 63
- Tabla 5 Distancia entre documentos del corpusp. 65
- Tabla 6 Agrupación de testimonios por similitudp. 66
- Figura 1 Relacionamiento de elementos comunes en tres testimonios (T) de víctimasp. 20
- automático de testimoniosp. 30
- Figura 3 Sección Pódcast del micrositio del Centro Nacional de Memoria Históricap. 33
- lenguaje naturalp. 37
- Figura 5 Código para la carga de documentos de texto que consolida el corpusp. 38
- Figura 6 Función en Python para aplicar un corrector ortográficop. 39
- Figura 7 Función en Python para lematizar palabrasp. 40
- Figura 8 Función en Python para eliminar caracteres de varios espacios simultáneosp. 40
- caracteres especialesp. 41
- Figura 10 Función en Python para eliminación de stopwordsp. 42
- de textop. 43
- Figura 12 Función en Python que carga las dimensionesp. 44
- Figura 13 Código que presenta un resumen de las dimensiones cargadasp. 46
- Figura 14 Código en Python que realiza el preprocesamiento y limpieza del corpusp. 46
- corpusp. 47
- Figura 16 Función que unifica datos y cuenta frecuencias en un dataframep. 48
- Figura 17 Función en Python que codifica los elementos de un testimoniop. 50
- Figura 18 Algoritmo de técnica TD-IDFp. 51
- Figura 19 Distancia de Coseno. Función que calcula la similitud entre documentosp. 52
- Figura 20 Análisis de similitud a grupos o clústeres de documentosp. 52
- Figura 21 Código que grafica en un dendograma jerárquico los clústeres de documentosp. 52
- representación de relacionesp. 53
- Figura 23 Presentación en dataframe del corpus inicial de testimoniosp. 55
- Figura 24 Resumen de palabras vacías o stopwordsp. 55
- Figura 25 Lista de palabras stopwordsp. 56
- Figura 26 Módulo de consulta de stopwordsp. 56
- Figura 27 Detalle de la consulta del stopwordp. 56
- Figura 28 Módulo de ingreso de stopwordsp. 57
- Figura 29 Módulo de consulta de stopwords con elementos actualizadosp. 57
- Figura 30 Cantidad de palabras por dimensiónp. 58
- Figura 31 Módulo de consulta de palabras por dimensión: Afectaciónp. 59
- Figura 32 Detalle de la consulta por palabra en dimensionesp. 59
- Figura 33 Módulo de ingreso de palabra a dimensiónp. 60
- Figura 34 Resumen del corpus preprocesadop. 60
- Figura 35 Comparativo de corpus inicial y preprocesadop. 61
- Figura 36 Fragmento de dataframe de palabras por dimensiónp. 62
- Figura 37 Dataset de palabras por dimensiónp. 62
- Figura 38 Distribución de frecuencia de palabras por dimensiónp. 63
- Figura 39 Tamaño del corpus, palabras por documentop. 64
- Figura 40 TF-IDF de corpus normalizadop. 64
- Figura 41 Dendograma de clústeres jerárquicop. 66
- Figura 42 Detalle de relaciones de nivel 3 entre la dimensión Violencia de dos documentosp. 67
- Figura 43 Detalle de la relación entre la dimensión Afectación y el elemento Violenciap. 67
- Figura 44 Detalle de la relación entre el documento Sintético.txt y la dimensión Afectaciónp. 68
- Figura 45 Representación gráfica de las relaciones de documentos, dimensiones y términosp. 69
- documentop. 51