METODOLOGÍA PARA LA CONSTRUCCIÓN Y ETIQUETADO
SIMULTÁNEO DE BASES DE DATOS MASIVAS PARA EL
ENTRENAMIENTO DE CNNs.
Sara Morales Acevedo Proyecto de grado presentado como requisito parcial para aspirar al título de Ingeniera Electricista Director Germán Andrés Holguín Londoño Grupo de Investigación en Gestión de Sistemas Eléctricos, Electrónicos y Automáticos.
UNIVERSIDAD TECNOLÓGICA DE PEREIRA
PROGRAMA DE INGENIERÍA ELÉCTRICA
PEREIRA
2026
Nota de Aceptación Firma del Presidente del jurado Firma del jurado 1 – Evaluador Firma del jurado 2 – Evaluador Firma del jurado 3 – Director Pereira, 9 de Junio de 2026
Este trabajo está dedicado a Dios, mis padres, mi hermana y familiares.
Agradezco a mi familia, especialmente a mi mamá y mi papá, que me han apoyado de forma incondicional; gracias por su paciencia, comprensión y ayuda. También doy las gracias al grupo de Investigación en Gestión de Sistemas Eléctricos, Electrónicos y Automáticos, a mi director, el profesor Germán A. Holguín Londoño; su guía, consejos y apoyo han sido fundamentales durante el desarrollo de este trabajo. Sus aportes me han ayudado a crecer como persona y como profesional. Además, quiero agradecer a todos los compañeros que a lo largo de la carrera me han dado palabras de aliento y han sido un apoyo para mantener el ánimo y la motivación durante el desarrollo de este trabajo y proyecto de vida.
Por último, agradezco al programa de Ingeniería Eléctrica por la formación académica y humana recibida durante estos años.
CONTENIDO
pág.
1. INTRODUCCIÓN
11
1.1. Definición del problema . . . . . . . . . . . . . . . . . . . . . . . . . . .
11
1.2. Justificación . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
13
1.3. Objetivos
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
14
1.3.1.
Objetivo general
. . . . . . . . . . . . . . . . . . . . . . . . . .
14
1.3.2.
Objetivos específicos
. . . . . . . . . . . . . . . . . . . . . . . .
14
2. ESTADO DEL ARTE
16
2.1. Generación sintética y aumento de datos . . . . . . . . . . . . . . . . .
16
2.2. Simulación, motores 3D y realidad aumentada . . . . . . . . . . . . . .
18
2.3. Etiquetado automático, modelos fundamentales y aprendizaje con super-
visión parcial
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
20
2.4. Brecha de dominio entre datos sintéticos y reales . . . . . . . . . . . . .
21
2.5. Posicionamiento de la metodología propuesta . . . . . . . . . . . . . . .
22
3. MARCO TEÓRICO
24
3.1. Procesamiento digital de imágenes . . . . . . . . . . . . . . . . . . . . .
3.1.1.
Umbralización . . . . . . . . . . . . . . . . . . . . . . . . . . . .
25
3.1.2.
Morfología matemática . . . . . . . . . . . . . . . . . . . . . . .
26
3.1.3.
Componentes conexas y regiones de interés . . . . . . . . . . . .
26
3.2. Síntesis de datos etiquetados . . . . . . . . . . . . . . . . . . . . . . . .
28
3.2.1.
Normalización fotométrica . . . . . . . . . . . . . . . . . . . . .
29
3.3. Aprendizaje profundo y redes neuronales convolucionales . . . . . . . .
30
3.3.1.
Segmentación semántica . . . . . . . . . . . . . . . . . . . . . .
31
3.3.2.
Arquitecturas convolucionales para segmentación
. . . . . . . .
32
3.4. Transferencia entre dominio sintético y dominio real . . . . . . . . . . .
33
3.5. Métricas de evaluación para segmentación
. . . . . . . . . . . . . . . .
34
4. SÍNTESIS DE DATOS ETIQUETADOS
37
4.1. Protocolo de adquisición de datos . . . . . . . . . . . . . . . . . . . . .
39
4.1.1.
Adquisición del objeto de interés . . . . . . . . . . . . . . . . . .
39
4.1.2.
Adquisición de fondos . . . . . . . . . . . . . . . . . . . . . . . .
41
4.1.3.
Adquisición de la base de datos real de referencia
. . . . . . . .
42
4.2. Procesamiento de imágenes para extracción del ROI . . . . . . . . . . .
44
4.2.1.
Umbralización adaptativa
. . . . . . . . . . . . . . . . . . . . .
44
4.2.2.
Análisis de componentes conectadas . . . . . . . . . . . . . . . .
4.2.3.
Refinamiento del cuadro delimitador
. . . . . . . . . . . . . . .
48
4.2.4.
Obtención de contorno y silueta . . . . . . . . . . . . . . . . . .
49
4.2.5.
Extracción de ROI . . . . . . . . . . . . . . . . . . . . . . . . .
49
4.3. Generación masiva de datos sintéticos . . . . . . . . . . . . . . . . . . .
50
5. DISEÑO EXPERIMENTAL
53
5.1. Definición de los conjuntos de datos . . . . . . . . . . . . . . . . . . . .
53
5.2. Definición de los modelos . . . . . . . . . . . . . . . . . . . . . . . . . .
55
5.3. Escenarios de evaluación . . . . . . . . . . . . . . . . . . . . . . . . . .
56
5.4. Comparación principal del experimento . . . . . . . . . . . . . . . . . .
58
5.5. Métricas de evaluación . . . . . . . . . . . . . . . . . . . . . . . . . . .
59
5.6. Criterios de interpretación de los resultados
. . . . . . . . . . . . . . .
61
5.7. Consideraciones metodológicas . . . . . . . . . . . . . . . . . . . . . . .
62
5.8. Resumen del diseño experimental . . . . . . . . . . . . . . . . . . . . .
63
6. RESULTADOS
65
6.1. Validación del procesamiento digital de imágenes . . . . . . . . . . . . .
65
6.2. Síntesis de una imagen . . . . . . . . . . . . . . . . . . . . . . . . . . .
69
6.3. Captura de la base de datos real . . . . . . . . . . . . . . . . . . . . . .
71
6.4. Selección de arquitectura CNN. . . . . . . . . . . . . . . . . . . . . . .
6.5. Resultados experimentales . . . . . . . . . . . . . . . . . . . . . . . . .
73
6.5.1.
Entrenamiento del modelo MS sintético . . . . . . . . . . . . . .
74
6.5.2.
Entrenamiento del modelo MR real . . . . . . . . . . . . . . . .
78
7. CONCLUSIONES Y RECOMENDACIONES
82
7.1. Conclusiones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
82
7.2. Recomendaciones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
84
7.2.1.
Estudio de ablación . . . . . . . . . . . . . . . . . . . . . . . . .
85
7.2.2.
Preentrenamiento con imágenes sintéticas y ajuste fino con imágenes reales
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
87
BIBLIOGRAFÍA
LISTA DE TABLAS
1.
Escenarios experimentales. . . . . . . . . . . . . . . . . . . . . . . . . .
57
2.
Criterios para interpretar los resultados experimentales. . . . . . . . . .
61
3.
Comparación de tiempos de generación . . . . . . . . . . . . . . . . . .
72
4.
Desempeño de los modelos en los escenarios experimentales.
. . . . . .
LISTA DE FIGURAS
1.
Diagrama de flujo de la metodología
. . . . . . . . . . . . . . . . . . .
37
2.
Vista frontal del lightbox implementado.
. . . . . . . . . . . . . . . . .
40
3.
Ejemplos de objeto de interés capturado. . . . . . . . . . . . . . . . . .
41
4.
Ejemplos de fondos arbitrarios capturados. . . . . . . . . . . . . . . . .
41
5.
Ejemplos para una aplicación de detección de granos de café.
. . . . .
42
6.
Captura de base de datos real. Imagen completa.
. . . . . . . . . . . .
43
7.
Herramienta para etiquetado manual. . . . . . . . . . . . . . . . . . . .
43
8.
Preprocesamiento y umbralización . . . . . . . . . . . . . . . . . . . . .
67
9.
Análisis de componentes conexas
. . . . . . . . . . . . . . . . . . . . .
68
10.
Refinamiento del contorno . . . . . . . . . . . . . . . . . . . . . . . . .
68
11.
Salida del proceso.
. . . . . . . . . . . . . . . . . . . . . . . . . . . . .
69
12.
Composición sintética de las imágenes. . . . . . . . . . . . . . . . . . .
70
13.
Ejemplos de imágenes sintéticas generadas. . . . . . . . . . . . . . . . .
70
14.
Ejemplos de imágenes reales. . . . . . . . . . . . . . . . . . . . . . . . .
71
15.
IoU clase balota en validación de MS. . . . . . . . . . . . . . . . . . . .
75
16.
Función de perdida en validación de MS. . . . . . . . . . . . . . . . . .
75
17.
Taza de aprendizaje para validación de MS.
. . . . . . . . . . . . . . .
18.
Exactitud media en validación de MS.
. . . . . . . . . . . . . . . . . .
77
19.
Matriz de confusión para el escenario ES−S . . . . . . . . . . . . . . . .
77
20.
IoU clase balota en validación de MR. . . . . . . . . . . . . . . . . . . .
78
21.
Taza de aprendizaje para validación de Mr. . . . . . . . . . . . . . . . .
79
22.
Función de perdida en validación de Mr. . . . . . . . . . . . . . . . . .
80
23.
Exactitud media en validación de Mr. . . . . . . . . . . . . . . . . . . .
80
24.
Matriz de confusión para el modelo MR en el escenario ER−R.
. . . . .
INTRODUCCIÓN
La inteligencia artificial (IA) se ha convertido en una tecnología presente en una amplia gama de aplicaciones, desde la medicina y la educación hasta la industria de manufactura y los servicios. Este avance ha sido impulsado, en gran medida, por el desarrollo de algoritmos de aprendizaje supervisado, los cuales permiten abordar problemas fundamentales como clasificación y regresión.
En particular, el aprendizaje profundo y las redes neuronales convolucionales (CNN, por sus siglas en inglés) han demostrado que su desempeño en tareas complejas de visión por computador depende críticamente de la disponibilidad de datos etiquetados de alta calidad [1,2]. Esta dependencia ha motivado el desarrollo de nuevas técnicas y enfoques orientados a optimizar, expandir y mejorar los conjuntos de datos disponibles. En este contexto, este trabajo propone una metodología para la construcción de bases de datos masivas a partir de objetos reales, los cuales se integran en un conjunto de fondos arbitrarios también reales. Esto permite generar, de manera simultánea, imágenes sintéticas con sus respectivas máscaras de segmentación y etiquetas asociadas. El enfoque propuesto garantiza una precisión del 100 % en la ubicación de las etiquetas y reduce drásticamente el tiempo requerido para la construcción del conjunto de datos, lo cual facilita el entrenamiento de modelos robustos en escenarios con disponibilidad limitada de datos.
1.1
Definición del problema El uso de las CNN ha demostrado ser altamente efectivo en tareas como la detección, localización y segmentación de objetos. Las CNN constituyen una herramienta funda-
mental en el desarrollo de aplicaciones como los vehículos autónomos, el diagnóstico médico asistido por computador y la automatización industrial. Sin embargo, uno de los principales desafíos que persiste es la necesidad de contar con grandes volúmenes de datos etiquetados para el entrenamiento de estos modelos [3,4]. El proceso de etiquetado manual de imágenes es una tarea exigente que consume tiempo y recursos, ya que requiere la intervención de expertos humanos para identificar y delimitar con precisión los objetos de interés. Esta limitación afecta directamente la escalabilidad de proyectos que requieren bases de datos masivas para entrenar modelos robustos, particularmente cuando se trabaja con clases de objetos no contempladas en modelos preentrenados públicamente disponibles, como DeepLab [3], AlexNet [5] o
VGG16 [6].
Estrategias como la síntesis de datos [7,8] y el aprendizaje semisupervisado [9] ofrecen soluciones parciales, por lo que desarrollar metodologías de etiquetado automático sigue siendo una necesidad crítica en dominios especializados.
Ejemplos de esta necesidad se observan en la segmentación precisa de tejidos en imágenes médicas [10] y en la detección de defectos en piezas manufacturadas [4]. En estos casos, la capacidad de generalización y adaptación del modelo depende directamente de la diversidad y representatividad de la base de datos utilizada para su entrenamiento. Por tanto, es esencial contar con metodologías que permitan generar bases de datos etiquetadas capaces de capturar una amplia variedad de condiciones, tales como iluminación, ángulos de observación, contextos y perspectivas presentes en entornos reales.
1.2
Justificación En sectores como la agricultura de precisión, la logística autónoma y la inspección industrial, la adaptación rápida de modelos de visión por computador a clases específicas de objetos se ha vuelto crucial. Si bien existen modelos preentrenados, estos suelen estar limitados a objetos genéricos, tales como personas, vehículos o animales, por lo que resultan inadecuados para dominios especializados que involucran objetos particulares, como defectos en piezas industriales o características específicas de determinados cultivos. Para abordar este desafío, se propone una metodología orientada a superar uno de los principales obstáculos en el desarrollo de sistemas inteligentes avanzados: el proceso costoso y lento de creación y etiquetado de bases de datos de gran escala, o masivas [11]. En este contexto, se requiere una metodología que permita expandir de manera ágil bases de datos existentes, reduciendo significativamente la inversión de recursos económicos y humanos asociada a dicha tarea.
En este sentido, una solución semiautomatizada resulta especialmente pertinente, ya que permite desplazar la intervención humana desde el etiquetado manual exhaustivo de cada imagen hacia una etapa inicial de ajuste y supervisión del proceso de segmentación. Esta característica resulta especialmente relevante en dominios especializados, donde el cambio de una clase de objeto a otra puede exigir adaptaciones específicas debido a variaciones en forma, textura, color, iluminación, condiciones de captura o apariencia visual. Así, la intervención humana se concentra en la adecuación del proceso al objeto de interés, mientras que la generación posterior de datos puede realizarse de manera automática.
Aunque las soluciones basadas plenamente en modelos generativos han mostrado avances importantes, todavía presentan limitaciones asociadas con la generación de contenidos
inconsistentes, la necesidad de validación humana y la brecha entre simulación y realidad (simulation-to-reality gap). En contraste, una metodología semiautomatizada basada en objetos reales y fondos reales puede ofrecer una alternativa más controlada para la expansión de conjuntos de datos, al permitir la generación masiva de imágenes sintéticas con sus respectivas etiquetas, máscaras de segmentación y regiones de interés para tareas de localización, con una intervención humana limitada a la etapa inicial de ajuste.
1.3
Objetivos
1.3.1
Objetivo general Desarrollar una metodología de construcción y etiquetado simultáneo de conjuntos de datos masivos orientados al entrenamiento eficiente de redes neuronales convolucionales en tareas de segmentación y localización de objetos en entornos específicos.
1.3.2
Objetivos específicos
1. Establecer un protocolo de adquisición de imágenes en ambiente controlado que
garantice condiciones uniformes de iluminación y fondo, para la obtención de un conjunto de datos “semilla” de objetos específicos y no disponibles en repositorios públicos.
2. Desarrollar algoritmos basados en procesamiento de imágenes y visión por compu-
tador para la segmentación y generación automática de máscaras y Regiones de Interés (ROI, por sus siglas en inglés) sobre el conjunto de datos semilla.
3. Desarrollar un método para la generación de bases de datos masivas que simule
condiciones no controladas, implementando técnicas de aumento sintético (Data
Augmentation).
4. Comparar el desempeño de un modelo de redes neuronales convolucional entrenado
con una base de datos convencional, contra uno entrenado con una base de datos generada con la metodología propuesta.
ESTADO DEL ARTE
El desarrollo reciente de aplicaciones de visión por computador ha mostrado que el desempeño de los modelos de aprendizaje profundo no depende únicamente de la arquitectura utilizada, sino también de la calidad, diversidad y disponibilidad de los datos empleados para su entrenamiento. En particular, las redes neuronales convolucionales requieren conjuntos de datos suficientemente representativos y correctamente etiquetados para aprender características visuales que puedan generalizarse a condiciones reales de operación [1,2]. Esta situación ha impulsado un cambio de enfoque hacia metodologías centradas en los datos, en las cuales la generación, curaduría, ampliación y etiquetado de bases de datos se convierten en componentes fundamentales del desarrollo de sistemas inteligentes.
En tareas de segmentación y localización de objetos, el etiquetado manual continúa siendo una de las principales limitaciones. La delimitación precisa de máscaras, contornos o regiones de interés requiere tiempo, criterio experto y revisión cuidadosa, especialmente cuando los objetos pertenecen a dominios especializados o no están suficientemente representados en bases de datos públicas. Por esta razón, diferentes líneas de investigación han buscado reducir la dependencia del etiquetado manual mediante el uso de datos sintéticos, motores de simulación, realidad aumentada, modelos generativos, modelos fundamentales de segmentación y estrategias de aprendizaje con supervisión parcial.
2.1
Generación sintética y aumento de datos El aumento de datos ha sido una estrategia ampliamente utilizada para incrementar la variabilidad de los conjuntos de entrenamiento. Inicialmente, este proceso se basó en
transformaciones geométricas y fotométricas simples, tales como rotaciones, traslaciones, cambios de escala, inversión horizontal, ajuste de brillo, contraste o saturación. Estas técnicas permiten mejorar la robustez de los modelos ante variaciones moderadas de captura; sin embargo, su capacidad de expansión está limitada por la información contenida en las imágenes originales. En consecuencia, cuando la base real inicial es pequeña o poco diversa, las transformaciones convencionales pueden no ser suficientes para representar adecuadamente el dominio de aplicación.
Una alternativa más flexible corresponde a la generación de imágenes sintéticas. En este enfoque, las nuevas muestras no se obtienen únicamente mediante modificaciones de imágenes existentes, sino mediante la construcción artificial de escenas, objetos o combinaciones de objetos y fondos. La literatura reporta que esta estrategia puede ser útil para ampliar conjuntos de entrenamiento, reducir el costo de adquisición de datos y cubrir condiciones de operación difíciles de capturar de forma manual [7,8]. No obstante, su utilidad depende de que las imágenes generadas conserven características relevantes del dominio real y de que las etiquetas asociadas sean consistentes con el contenido visual.
Una línea particular de síntesis que resulta especialmente relevante para este trabajo es la composición por recorte e inserción, en la cual objetos reales segmentados se insertan sobre fondos variados para construir nuevas escenas de entrenamiento con etiquetas simultáneas [12,13]. Este enfoque conserva la apariencia real del objeto a la vez que controla la posición de inserción, lo que garantiza la consistencia geométrica entre la imagen compuesta y su etiqueta asociada.
Dentro de esta línea, los modelos generativos han mostrado resultados importantes en la síntesis de imágenes visualmente realistas. Las redes generativas antagónicas [14] permiten aprender una distribución de datos y generar nuevas muestras a partir de
ella, mientras que los modelos de difusión [15, 16] han demostrado gran capacidad para producir escenas complejas y variadas. En aplicaciones de agricultura, medicina e inspección visual, estos métodos se han utilizado para complementar bases de datos reales y mejorar el desempeño de modelos de clasificación o segmentación [7,17–19]. Sin embargo, los enfoques plenamente generativos presentan limitaciones relevantes para tareas que requieren etiquetas precisas. Aunque pueden producir imágenes con alto realismo perceptual, no siempre garantizan coherencia geométrica, consistencia semántica ni correspondencia exacta entre la imagen generada y su máscara de segmentación. Además, con frecuencia requieren un entrenamiento previo costoso, hardware especializado y procesos posteriores de validación o etiquetado. Por tanto, aunque los modelos generativos son una alternativa poderosa para expandir datos, su uso en segmentación supervisada puede verse limitado cuando se requiere una relación exacta entre imagen y etiqueta.
2.2
Simulación, motores 3D y realidad aumentada Otra línea de trabajo consiste en generar datos mediante simuladores, motores gráficos y modelos tridimensionales. En estos enfoques, los objetos y escenarios se modelan computacionalmente, lo que permite controlar variables como iluminación, perspectiva, posición, escala, textura y condiciones de cámara. Una ventaja importante de esta estrategia es que las etiquetas pueden generarse de manera automática y síncrona con la imagen, ya que el sistema conoce la geometría de la escena en el momento de la renderización. Esto permite obtener máscaras, cuadros delimitadores y mapas semánticos con precisión de píxel.
El uso de herramientas como Blender, Unity, motores de renderizado y plataformas
de simulación industrial ha permitido construir bases de datos sintéticas para tareas de inspección, detección y segmentación. En contextos industriales, por ejemplo, la integración entre modelos CAD y motores de renderizado permite generar defectos sintéticos y escenarios controlados para entrenar modelos de visión artificial [2]. De manera similar, plataformas de alta fidelidad como NVIDIA Omniverse han sido empleadas para generar datos sintéticos con etiquetado automático en aplicaciones especializadas [18]. Una técnica complementaria que ha mostrado ser efectiva en este contexto es la domain randomization, en la cual los parámetros de renderizado se varían aleatoriamente durante la generación de datos para mejorar la robustez del modelo ante cambios en el dominio real [20].
A pesar de sus ventajas, los métodos basados en simulación 3D presentan una barrera de entrada considerable. Su implementación requiere modelos tridimensionales precisos, texturas adecuadas, conocimiento del motor gráfico y recursos computacionales suficientes. Además, incluso cuando la geometría del objeto está bien representada, puede persistir una brecha entre el dominio sintético y el dominio real, conocida como simulation-to-reality gap [20]. Esta brecha puede originarse en diferencias de iluminación, ruido de cámara, materiales, sombras, o variaciones no modeladas del entorno físico. Por esta razón, el realismo geométrico no siempre garantiza que el modelo entrenado con datos simulados tenga un desempeño adecuado sobre imágenes reales. La realidad aumentada ha surgido como una alternativa intermedia, al permitir insertar objetos virtuales en escenas reales capturadas por cámara. Esta estrategia aprovecha fondos, ruido visual e iluminación del mundo real, mientras mantiene cierto control sobre la ubicación y apariencia de los objetos sintéticos [21]. No obstante, su aplicación también depende de la disponibilidad de modelos 3D y puede limitarse a ciertos tipos de anotaciones, como cuadros delimitadores, si no se dispone de una segmentación precisa
del objeto virtual insertado.
2.3
Etiquetado automático, modelos fundamentales y aprendizaje con supervisión parcial Además de la generación sintética de datos, otra línea de investigación busca reducir el esfuerzo de etiquetado mediante métodos automáticos o semiautomáticos. En este contexto, los modelos fundamentales de segmentación, como el Segment Anything Model (SAM), han introducido nuevas posibilidades para segmentar objetos en diferentes dominios mediante puntos, cajas o instrucciones visuales, sin requerir entrenamiento específico para cada clase [22]. Estos modelos son especialmente atractivos porque pueden acelerar la generación de máscaras iniciales y disminuir la carga del anotador humano. Sin embargo, el uso de modelos fundamentales no elimina completamente la necesidad de supervisión. En objetos con bordes difusos, bajo contraste, o con texturas complejas, las máscaras generadas pueden requerir corrección manual. Además, cuando se trabaja en dominios especializados, la calidad de la segmentación puede depender del tipo de prompt, de la apariencia del objeto y de la similitud con los datos utilizados durante el entrenamiento original del modelo. Por esta razón, estos métodos resultan útiles como herramientas de asistencia, pero no necesariamente garantizan etiquetado masivo completamente automático y confiable.
El aprendizaje semisupervisado constituye otra alternativa para aprovechar grandes cantidades de datos no etiquetados a partir de un conjunto reducido de muestras anotadas. En estos enfoques, el modelo utiliza datos etiquetados para generar pseudoetiquetas o para propagar información hacia muestras no anotadas, tal como se propone en métodos como FixMatch [23], que combina consistencia y confianza para asignar pseudoetiquetas
confiables [9,11,24]. De forma complementaria, el aprendizaje activo busca seleccionar las muestras más informativas o inciertas para que sean etiquetadas por un experto, reduciendo así el número total de anotaciones necesarias [25]. Estas estrategias permiten disminuir la carga manual, pero siguen dependiendo de una base real inicial y de procesos iterativos de entrenamiento, selección y validación.
En conjunto, los métodos de etiquetado automático, aprendizaje semisupervisado y aprendizaje activo contribuyen a reducir el esfuerzo humano, pero no resuelven por completo el problema de construir bases de datos masivas con etiquetas geométricamente exactas desde el momento de generación. En muchos casos, el etiquetado sigue siendo posterior a la captura de la imagen, lo que introduce la posibilidad de errores, inconsistencias o dependencia de revisión humana.
2.4
Brecha de dominio entre datos sintéticos y reales Uno de los aspectos más importantes en la evaluación de datos sintéticos es la capacidad de transferencia hacia el dominio real. Un conjunto sintético puede producir buenos resultados cuando el modelo se evalúa sobre imágenes similares a las generadas, pero esto no implica necesariamente que sea útil en condiciones reales de operación. Por esta razón, la validación de metodologías de síntesis debe incluir escenarios de evaluación cruzada, en los cuales el modelo entrenado con imágenes sintéticas sea probado sobre imágenes reales no vistas.
La brecha de dominio puede aparecer por diferencias en la distribución de colores, iluminación, sombras, ruido, textura, resolución, perspectiva o composición de la escena. Desde una perspectiva teórica, Ben-David et al. [26] formalizaron esta noción demostrando que el error de un modelo en el dominio objetivo depende tanto de su
desempeño en el dominio fuente como de la distancia entre ambas distribuciones. En tareas de segmentación, esta brecha es especialmente crítica, porque el modelo debe aprender tanto la apariencia global del objeto como sus bordes y relaciones espaciales con el fondo. Por tanto, la utilidad de una base sintética no debe medirse únicamente por su realismo visual, sino por su capacidad para inducir modelos que mantengan un desempeño aceptable en el dominio real.
Estrategias como la domain randomization [20] y la adaptación de dominio no supervisada [27,28] han sido propuestas para reducir esta brecha, bien sea diversificando las condiciones de generación de los datos sintéticos, o bien alineando las distribuciones de características entre los dominios sintético y real durante el entrenamiento. La literatura evidencia que no existe una única solución universal para cerrar esta brecha. Los modelos generativos pueden mejorar el realismo, pero no siempre garantizan etiquetas exactas; los motores 3D permiten etiquetado síncrono, pero requieren modelado especializado; los métodos semisupervisados aprovechan datos reales, pero dependen de etiquetas iniciales; y los modelos fundamentales aceleran la segmentación, pero pueden requerir validación humana. En este contexto, resulta pertinente explorar metodologías que combinen elementos de control, realismo y automatización, reduciendo al mismo tiempo la dependencia de modelos 3D complejos y de etiquetado manual exhaustivo.
2.5
Posicionamiento de la metodología propuesta A partir de la revisión anterior, se identifica una oportunidad metodológica en la generación de bases de datos sintéticas construidas a partir de objetos reales y fondos reales, con etiquetado simultáneo durante el proceso de composición. Este enfoque se relaciona directamente con trabajos previos de composición por inserción de objetos, como el propuesto por Dwibedi et al. [12] y extendido por Ghiasi et al. [13], pero difiere
de ellos en que no se asume la disponibilidad de una base de objetos segmentados previamente: la segmentación se realiza automáticamente como parte de la metodología propuesta, y está orientada específicamente a objetos de dominio especializado no contemplados en bases de datos públicas.
A diferencia de los enfoques puramente generativos, este tipo de metodología conserva la apariencia del objeto real capturado en condiciones controladas. A diferencia de los motores 3D, no requiere modelar geométricamente cada objeto. Y, a diferencia del etiquetado manual convencional, permite generar automáticamente las máscaras y anotaciones a partir de la posición conocida de la región de interés dentro de la imagen compuesta.
La metodología propuesta en este trabajo se ubica en esta línea intermedia. Su propósito no es generar objetos artificiales desde cero, sino extraer regiones de interés de objetos reales, insertarlas sobre fondos representativos del entorno de aplicación y producir simultáneamente las etiquetas correspondientes. Este enfoque busca reducir el esfuerzo humano a una etapa inicial de adquisición controlada y parametrización del procesamiento de imágenes, para luego permitir la generación masiva de datos etiquetados de forma automática.
De esta manera, el aporte de este proyecto se relaciona con tres necesidades identificadas en el estado del arte: la reducción del costo de etiquetado manual, la generación de bases de datos masivas para dominios especializados y la evaluación explícita de la transferencia entre datos sintéticos y datos reales. En consecuencia, la metodología propuesta no se plantea únicamente como una técnica de aumento de datos, sino como un procedimiento completo de construcción y etiquetado simultáneo de bases de datos orientadas al entrenamiento de redes neuronales convolucionales en tareas de segmentación y localización.
MARCO TEÓRICO
El desarrollo de la metodología propuesta requiere integrar fundamentos de procesamiento digital de imágenes y aprendizaje profundo. El primer grupo de conceptos permite comprender cómo se extraen regiones de interés a partir de imágenes controladas, cómo se generan máscaras binarias y cómo se construyen imágenes sintéticas etiquetadas. El segundo grupo permite justificar el uso de redes neuronales convolucionales para tareas de segmentación semántica y establecer las métricas necesarias para evaluar si el conocimiento aprendido a partir de datos sintéticos puede transferirse al dominio real.
3.1
Procesamiento digital de imágenes El procesamiento digital de imágenes comprende el conjunto de técnicas utilizadas para transformar, analizar o extraer información de una imagen mediante procedimientos computacionales [29]. En el contexto de este trabajo, estas técnicas son fundamentales para aislar el objeto de interés, obtener su máscara de segmentación y preparar las regiones de interés que posteriormente serán insertadas sobre fondos representativos del entorno de aplicación.
Una imagen digital puede representarse como una función bidimensional discreta I(x, y), donde x y y indican la posición espacial del píxel y I representa su intensidad o valor de color. En imágenes en escala de grises, cada píxel se describe mediante un único valor de intensidad. En imágenes a color, cada píxel se representa mediante varios canales, por ejemplo, en el espacio RGB o BGR. La elección del espacio de color es relevante porque determina la forma en que la información cromática y luminosa queda disponible para los algoritmos de segmentación.
En esta metodología, el procesamiento digital de imágenes cumple una función principalmente geométrica y semántica: separar el objeto de interés del fondo controlado y producir una representación binaria de su silueta. Esta representación binaria es posteriormente utilizada como máscara de segmentación y como soporte para calcular regiones de interés y cuadros delimitadores.
3.1.1
Umbralización La umbralización es una técnica básica de segmentación que permite separar regiones de una imagen a partir de sus valores de intensidad. En su forma general, una imagen en escala de grises I(x, y) se transforma en una imagen binaria B(x, y) mediante un umbral T:
B(x, y) =
1,
I(x, y) ≥T,
0,
I(x, y) < T.
(1)
El valor 1 suele asociarse con el objeto o primer plano, mientras que el valor 0 corresponde al fondo. Cuando las intensidades del objeto y del fondo se encuentran claramente separadas, puede utilizarse un umbral global. En particular, el método de Otsu selecciona automáticamente el umbral que maximiza la separación estadística entre dos clases de píxeles, por lo cual resulta adecuado en escenas con alto contraste entre objeto y fondo [30].
No obstante, en imágenes con iluminación no uniforme, texturas marcadas, sombras o bajo contraste, un único umbral global puede no ser suficiente. En estos casos, pueden emplearse métodos locales o adaptativos, en los cuales el umbral depende de las características de una vecindad alrededor de cada píxel [29]. Por tanto, la selección del método de umbralización debe entenderse como una decisión dependiente de la
aplicación y de las condiciones de adquisición.
3.1.2
Morfología matemática La morfología matemática proporciona herramientas para modificar y analizar estructuras geométricas presentes en imágenes binarias [29]. Sus operaciones se definen a partir de un elemento estructurante, el cual actúa como una vecindad que recorre la imagen para modificar la forma de los objetos.
Las operaciones básicas son la erosión y la dilatación. La erosión reduce las regiones de primer plano y puede eliminar detalles pequeños o ruido aislado. La dilatación expande las regiones de primer plano y puede cerrar discontinuidades pequeñas en los bordes. A partir de estas operaciones se definen procesos compuestos como la apertura y el cierre. La apertura, formada por una erosión seguida de una dilatación, permite eliminar componentes pequeñas. El cierre, formado por una dilatación seguida de una erosión, permite rellenar huecos o unir regiones cercanas.
En el contexto de este proyecto, las operaciones morfológicas son relevantes porque permiten refinar máscaras binarias, mejorar la continuidad de los contornos y corregir imperfecciones producidas durante la segmentación inicial. Su uso contribuye a obtener siluetas más consistentes para la extracción de regiones de interés.
3.1.3
Componentes conexas y regiones de interés Después de obtener una imagen binaria, es necesario identificar qué regiones pertenecen realmente al objeto de interés. El análisis de componentes conexas permite agrupar píxeles de primer plano que se encuentran conectados espacialmente. Dos píxeles pueden considerarse conectados bajo una vecindad de 4 elementos o de 8 elementos. La
conectividad de 8 vecinos incluye relaciones horizontales, verticales y diagonales, lo cual resulta conveniente para objetos con bordes curvos o formas compactas. A cada componente conexa se le pueden asociar descriptores geométricos, como área, centroide, dimensiones y cuadro delimitador. Estos descriptores permiten filtrar ruido, seleccionar la componente principal y construir una región de interés, conocida como ROI por sus siglas en inglés. En este trabajo, la ROI corresponde a la porción de la imagen que contiene el objeto segmentado y su máscara asociada. Entre los algoritmos más eficientes para el etiquetado de componentes conexas se encuentran SAUF (Scan Array Union Find), BBDT (Block-Based Decision Trees) y Spaghetti; una revisión detallada del estado del arte en estos métodos puede consultarse en He et al. [31]. El algoritmo BBDT, propuesto por Grana et al. [32], opera sobre bloques de píxeles y utiliza árboles de decisión para reducir significativamente el número de condiciones evaluadas durante el proceso de etiquetado, lo que lo hace especialmente eficiente en imágenes de alta resolución. Spaghetti, descrito por Bolelli et al. [33], extiende este enfoque mediante grafos acíclicos dirigidos, logrando aún mayor eficiencia en imágenes binarias densas.
El cuadro delimitador de una ROI puede definirse mediante las coordenadas extremas de los píxeles pertenecientes al objeto:
xm´ın = m´ın(x), xm´ax = m´ax(x),
(2)
ym´ın = m´ın(y), ym´ax = m´ax(y).
(3)
A partir de estos valores se obtienen el ancho w y el alto h del cuadro delimitador: w = xm´ax −xm´ın, h = ym´ax −ym´ın.
(4)
Esta información es fundamental para generar etiquetas de localización, máscaras de segmentación y anotaciones normalizadas en formatos utilizados por modelos de aprendizaje profundo.
3.2
Síntesis de datos etiquetados La síntesis de datos etiquetados consiste en generar nuevas imágenes de entrenamiento a partir de la combinación controlada de elementos visuales. En este trabajo, la síntesis se basa en la inserción de ROIs extraídas de objetos reales sobre fondos reales o representativos del entorno de aplicación, siguiendo el principio de composición por recorte e inserción introducido por Dwibedi et al. [12]. La ventaja principal de este enfoque es que la posición, la escala y la máscara del objeto insertado se conocen durante el proceso de composición. Por tanto, la imagen y su etiqueta se generan simultáneamente.
Sea F(x, y) una imagen de fondo y sea R(x, y) una ROI con canal alfa α(x, y), donde α = 1 representa los píxeles del objeto y α = 0 representa los píxeles transparentes. La composición de la imagen sintética IS(x, y) puede expresarse como [34]: IS(x, y) = α(x, y)R(x, y) + [1 −α(x, y)] F(x, y).
(5)
Esta formulación muestra que la máscara del objeto no se estima después de gene-
rar la imagen, sino que se conserva directamente a partir del canal alfa de la ROI. En consecuencia, la etiqueta resultante es geométricamente consistente con el objeto insertado.
3.2.1
Normalización fotométrica Una dificultad común en la composición sintética es la diferencia visual entre el objeto insertado y el fondo. Si la ROI y el fondo presentan condiciones de iluminación muy diferentes, el modelo puede aprender patrones artificiales asociados a la composición, en lugar de aprender las características propias del objeto. Para reducir este efecto, puede aplicarse una normalización fotométrica que ajuste la luminancia de la ROI antes de insertarla en el fondo.
Una estrategia simple consiste en igualar la intensidad media de la ROI con la intensidad media del fondo. Si µROI representa la intensidad media del objeto y µF la intensidad media del fondo, puede definirse un factor de ajuste como:
k = µF µROI + ϵ,
(6)
donde ϵ es una constante pequeña que evita divisiones por cero. La ROI ajustada se obtiene entonces como:
R′(x, y) = kR(x, y).
(7)
Este ajuste no reproduce completamente todos los fenómenos físicos de iluminación, como sombras, reflejos o temperatura de color; sin embargo, reduce discrepancias globales de brillo y mejora la coherencia visual de la imagen compuesta. Un método alternativo y más completo para reducir la discrepancia fotométrica entre
la ROI y el fondo es la correspondencia de histogramas, conocida como histogram matching. A diferencia del ajuste basado únicamente en la luminancia media, este procedimiento transforma la distribución de intensidades de la ROI para que se aproxime a la distribución de intensidades del fondo, de manera análoga a la transferencia de color entre imágenes descrita por Reinhard et al. [35]. Para ello, se comparan las funciones de distribución acumulada de ambas imágenes y se define una transformación que reasigna los niveles de intensidad de la ROI de tal manera que su histograma resultante sea estadísticamente más parecido al histograma del fondo.
Esta estrategia puede ser útil cuando la diferencia entre el objeto insertado y el fondo no se limita al brillo promedio, sino que involucra variaciones de contraste, distribución tonal o saturación. En una implementación práctica, la correspondencia de histogramas puede aplicarse sobre la imagen en escala de grises o sobre canales específicos de un espacio de color, como RGB, BGR, HSV o HLS. Sin embargo, debe utilizarse con precaución, ya que una adaptación excesiva puede alterar características cromáticas propias del objeto de interés y afectar la información visual que el modelo debe aprender. Por tanto, el histogram matching constituye una alternativa más robusta que la normalización por media, pero requiere evaluar cuidadosamente su impacto sobre la apariencia del objeto y sobre el desempeño final del modelo de segmentación.
3.3
Aprendizaje profundo y redes neuronales convolucionales El aprendizaje profundo es una rama del aprendizaje automático que permite construir modelos capaces de aprender representaciones jerárquicas a partir de los datos [36]. En visión por computador, las redes neuronales convolucionales han sido ampliamente utilizadas debido a su capacidad para extraer características espaciales de imágenes.
Una red neuronal convolucional procesa una imagen mediante filtros o núcleos de convolución que recorren espacialmente la entrada y producen mapas de características. La operación de convolución discreta puede expresarse como:
S(i, j) = (I ∗K)(i, j) = X m X n I(i −m, j −n)K(m, n),
(8)
donde I es la imagen de entrada, K es el núcleo de convolución y S es el mapa de activación resultante. A través de múltiples capas, la red aprende representaciones progresivamente más abstractas, desde bordes y texturas simples hasta formas y estructuras semánticas más complejas.
Las redes convolucionales presentan tres propiedades relevantes para el análisis de imágenes. Primero, las conexiones locales permiten detectar patrones en regiones pequeñas de la imagen. Segundo, el intercambio de parámetros reduce el número de pesos entrenables, ya que un mismo filtro se aplica en diferentes posiciones. Tercero, la equivarianza traslacional permite que la activación asociada a un patrón se desplace de manera coherente cuando el objeto cambia de posición en la imagen [36].
3.3.1
Segmentación semántica La segmentación semántica es una tarea de visión por computador en la cual se asigna una clase a cada píxel de la imagen. A diferencia de la clasificación, que produce una etiqueta global, o de la detección, que estima cuadros delimitadores, la segmentación semántica genera una máscara densa que describe la ubicación espacial de cada clase. La formulación moderna de este problema se consolidó con el trabajo de Long et al. [37], quienes propusieron las redes totalmente convolucionales (FCN) como primera arquitectura de extremo a extremo para producir mapas de segmentación a resolución completa. Arqui-
tecturas posteriores como U-Net [38] popularizaron el esquema codificador-decodificador con conexiones de salto, que permite recuperar detalles espaciales finos durante la reconstrucción de la máscara.
Formalmente, dado un conjunto de clases C y una imagen I, el modelo de segmentación busca aprender una función:
fθ : I →Y,
(9)
donde Y (x, y) ∈C representa la clase asignada al píxel ubicado en la posición (x, y) y θ corresponde a los parámetros entrenables del modelo.
En este trabajo, la segmentación semántica se emplea para diferenciar el objeto de interés respecto al fondo. Por tanto, el problema puede formularse como una segmentación binaria, en la cual cada píxel pertenece a una de dos clases: objeto o fondo. Esta formulación permite evaluar de manera directa la calidad de las máscaras generadas por el modelo.
3.3.2
Arquitecturas convolucionales para segmentación Las arquitecturas modernas de segmentación semántica suelen combinar un extractor de características con módulos de reconstrucción espacial. El extractor, también llamado backbone, reduce progresivamente la resolución espacial mientras incrementa la profundidad de las características. Posteriormente, el decodificador recupera información espacial para producir una máscara con resolución compatible con la imagen de entrada. DeepLabV3+ es una arquitectura ampliamente utilizada en segmentación semántica porque combina extracción multiescala de características con un decodificador capaz de refinar los bordes de los objetos [39]. Su módulo Atrous Spatial Pyramid Pooling
permite analizar la imagen con diferentes tasas de dilatación, capturando información contextual a varias escalas [40]. Además, puede utilizar redes como ResNet-50 como extractor de características, aprovechando pesos preentrenados en bases de datos de gran escala como ImageNet [41,42].
Esta estructura resulta adecuada para la metodología propuesta, ya que el objeto de interés puede aparecer en diferentes posiciones y escalas dentro de la imagen sintética o real. Por tanto, la capacidad multiescala del modelo contribuye a mejorar la segmentación en escenarios con variaciones de tamaño aparente y ubicación espacial.
3.4
Transferencia entre dominio sintético y dominio real Cuando un modelo se entrena con imágenes sintéticas y se evalúa sobre imágenes reales, su desempeño depende de la similitud entre ambos dominios. El dominio sintético está determinado por la forma en que se generan las imágenes, los fondos utilizados, la variabilidad de las ROIs, las transformaciones aplicadas y la coherencia fotométrica de la composición. El dominio real, por su parte, incluye variaciones propias del proceso de captura, como ruido, iluminación, sombras, enfoque, perspectiva y condiciones ambientales.
La diferencia entre ambos dominios se conoce como brecha de dominio o domain gap. En aplicaciones basadas en simulación también se denomina brecha entre simulación y realidad, o simulation-to-reality gap. La existencia de esta brecha está fundamentada teóricamente en el trabajo de Ben-David et al. [26], quienes demostraron que el error esperado en el dominio objetivo está acotado por el error en el dominio fuente más una medida de la discrepancia entre las distribuciones de ambos dominios. Esta brecha es relevante porque un modelo puede alcanzar un desempeño alto sobre imágenes
sintéticas y, aun así, fallar sobre imágenes reales si las características aprendidas no son transferibles.
Distintos enfoques han sido propuestos para reducir el domain gap. La domain randomization [20] busca cerrar la brecha desde el lado de la generación, haciendo que el dominio sintético sea suficientemente variado como para incluir las condiciones del dominio real. Los métodos de adaptación de dominio no supervisada, revisados por Wilson y Cook [28], actúan en cambio durante el entrenamiento del modelo, alineando las representaciones de características entre los dos dominios; el trabajo seminal de Ganin y Lempitsky [27] formalizó este principio mediante la retropropagación adversarial de gradientes. Por esta razón, la utilidad de una base de datos sintética no debe evaluarse únicamente dentro del dominio sintético. Es necesario medir si el modelo entrenado con datos sintéticos mantiene un desempeño adecuado cuando se prueba sobre datos reales no vistos. En este trabajo, dicha transferencia se analiza mediante escenarios experimentales cruzados entre los conjuntos sintético y real.
3.5
Métricas de evaluación para segmentación La evaluación de modelos de segmentación requiere métricas que comparen la máscara predicha con la máscara de referencia. Para una clase determinada, los resultados pueden describirse a partir de verdaderos positivos (TP), falsos positivos (FP), falsos negativos (FN) y verdaderos negativos (TN). En segmentación, estos valores se calculan a nivel de píxel.
La intersección sobre la unión, conocida como IoU o índice de Jaccard [43], mide el
solapamiento entre la región predicha y la región real:
IoU = TP TP + FP + FN .
(10)
Un valor de IoU = 1 indica coincidencia perfecta entre la máscara predicha y la máscara de referencia, mientras que un valor de IoU = 0 indica ausencia de solapamiento. Esta métrica fue adoptada como estándar de evaluación en el reto Pascal VOC [44], donde su promedio entre clases, la mean Intersection over Union, se convirtió en la referencia canónica del campo:
mIoU = 1 C C X c=1 IoUc,
(11)
donde C representa el número total de clases.
El coeficiente Dice [45] también mide el solapamiento entre dos regiones, pero pondera dos veces los verdaderos positivos:
Dice = 2TP 2TP + FP + FN .
(12)
La exactitud de píxel, o pixel accuracy, corresponde a la proporción de píxeles correctamente clasificados:
Pixel Accuracy = TP + TN TP + TN + FP + FN .
(13)
Aunque esta métrica es intuitiva, debe interpretarse con precaución cuando existe desbalance entre clases. En problemas donde el fondo ocupa la mayor parte de la imagen, un valor alto de exactitud puede estar dominado por la correcta clasificación del fondo y no necesariamente reflejar una segmentación precisa del objeto.
Finalmente, la precisión, la sensibilidad y el F1-score permiten analizar errores de comisión y omisión:
Precision = TP TP + FP ,
(14)
Recall = TP TP + FN ,
(15)
F1 = 2 Precision · Recall Precision + Recall.
(16)
Estas métricas permiten evaluar de forma complementaria la calidad de la segmentación. En el contexto de esta tesis, las métricas de solapamiento, especialmente IoU y mIoU, son las más relevantes para determinar si las máscaras predichas por el modelo coinciden espacialmente con las máscaras de referencia y si el aprendizaje obtenido a partir de datos sintéticos se transfiere adecuadamente hacia el dominio real.
SÍNTESIS DE DATOS ETIQUETADOS
La metodología central desarrollada para cumplir con los objetivos de este proyecto se ilustra en la Figura 1. El objetivo final de crear una base de datos de imágenes aumentadas y etiquetadas se alcanza mediante una estructura de etapas secuenciales. Figura 1. Diagrama de flujo de la metodología El proceso comienza a partir de dos bases de datos: una denominada “Imágenes Controladas” y otra denominada “Fondos”. La primera contiene imágenes semilla del objeto de interés en múltiples posiciones, estados o variaciones. La segunda contiene escenas de fondo correspondientes a un entorno relevante, en el cual el objeto debe ser detectado por
la aplicación de aprendizaje profundo. Las imágenes resultantes se obtienen mediante la composición aleatoria de estos dos conjuntos de imágenes.
Cada imagen de la base de datos “Imágenes Controladas” debe segmentarse para aislar con precisión el objeto de interés, incluyendo contorno y silueta, y eliminando los elementos del fondo que lo rodean. Es decir, de cada imagen se debe extraer el objeto mediante la generación de una región de interés. El resultado de este proceso es una base de datos intermedia denominada “ROIs”. Esta etapa consta de varios procedimientos de procesamiento digital de imágenes, los cuales deben ser sintonizados para cada aplicación.
La sintonización se realiza por aplicación, no por imagen. Esto hace que la metodología sea semiautomatizada, ya que, por el momento, sigue siendo muy difícil generalizar este proceso para cualquier tipo de objeto y escenario. Sin embargo, una vez sintonizado el sistema, este funciona sin intervención humana hasta producir la base de datos resultante, denominada en la Figura 1 como “Base de datos sintética”, junto con su respectivo archivo de etiquetas en un formato estandarizado.
La metodología se divide en tres partes principales, las cuales coinciden con los objetivos específicos 1, 2 y 3 propuestos en la sección 1.3. La primera parte corresponde al protocolo para la adquisición de las imágenes de las bases de datos “Imágenes Controladas” y “Fondos”. Ver sección 4.1. La segunda parte corresponde al procesamiento digital de imágenes para la segmentación de las regiones de interés y la generación de la base de datos “ROIs”. En la Figura 1, las etapas involucradas en esta segunda parte están representadas con fondo azul. Ver sección 4.2. La tercera parte corresponde a la composición aleatoria para la generación de la base de datos de salida, denominada “Base de datos sintética”, y de su respectivo archivo de etiquetas en texto plano. Ver sección 4.3.
4.1
Protocolo de adquisición de datos Los datos son fundamentales para crear modelos robustos capaces de realizar estimaciones y tomar decisiones útiles. De acuerdo con el objetivo específico 1 de este trabajo, se establece un protocolo para la captura de las imágenes semilla que se utilizará en la metodología para sintetizar la base de datos masiva etiquetada que se desea generar. Para tal fin se capturan independientemente el objeto de interés y el fondo del entorno relevante donde se usará la aplicación. Por último, se captura una base de datos real, con el único objetivo de evaluar el desempeño de la metodología.
4.1.1
Adquisición del objeto de interés Para garantizar la fidelidad de las imágenes y facilitar la segmentación automática, se diseñó un entorno de captura controlado que minimiza las variables externas. La idea principal es crear una base de datos semilla, que contenga imágenes del objeto o los objetos deseados en la detección, en múltiples posiciones.
Para tal fin, se utiliza un pequeño estudio fotográfico, conocido en las ciencias y las artes de la fotografía como lightbox. Este es un dispositivo optomecánico de ambiente controlado compuesto por un armazón cerrado de paredes difusoras y traslucidas, cuya función es la dispersión omnidireccional de la radiación lumínica para la supresión de sombras duras, gradientes de contraste extremos y reflejos especulares en la captura de imágenes de objetos tridimensionales. La Figura 2 muestra el dispositivo utilizado que tiene tres caras difusoras y además cuenta con fondos de colores intercambiables (rojo, blanco, azul, negro). El color del fondo se selecciona para que se genere un alto contraste con el objeto.
Figura 2. Vista frontal del lightbox implementado.
El lightbox se configura de acuerdo con:
Iluminación : Se emplea luz difusa proveniente de lámparas ambientales en una habitación donde estas son la única fuente de luz, evitando así el uso de fuentes de luces puntuales o tipo flash. Esta configuración previene la aparición de reflejos especulares que podrían deformar la firma espectral del objeto de interés. Perspectiva : Se establece un ángulo de captura cenital (90◦). El dispositivo se posicionó paralelamente al plano del fondo, que en este caso coincide con el piso del lightbox, para asegurar que la morfología del objeto no sufra distorsiones significativas de perspectiva.
Robustez : Se deben realizar tomas en N posiciones a cada uno de los objetos de interés disponibles.
Para este caso particular, el dispositivo de captura utilizado fue un teléfono móvil Honor X6s, configurado a 50 MPx (para maximizar la resolución de detalles), con medición de punto (para evaluar la iluminación crítica del sujeto), ISO 100 (para garantizar el menor ruido digital posible), velocidad del obturador de 0.8 s (para compensar la entrada
Figura 3. Ejemplos de objeto de interés capturado. Dos balotas y dos granos de café. de luz debido al ISO bajo), sin compensación de la exposición (manteniendo el valor neutro), con enfoque automático estático AF-S (para asegurar la nitidez en un punto fijo) y con balance de blancos activo (para una representación natural del color). Esta estandarización de parámetros garantiza que todas las imágenes capturadas mantengan una total uniformidad en iluminación, enfoque y calidad visual. La Figura 3 muestra tres ejemplos de objetos capturados en el lightbox implementado.
4.1.2
Adquisición de fondos Figura 4. Ejemplos de fondos arbitrarios capturados.
Complementariamente, se debe capturar un banco de imágenes de fondos en diversas condiciones ambientales. Estos fondos representan escenarios no controlados que incluyen
variabilidad de iluminación y patrones como se observa en la Figura 4. Los fondos deben tener una resolución estandarizada, manteniendo su relación de aspecto para evitar deformaciones.
Para la selección de los fondos el diseñador deberá escoger arbitrariamente escenas que pertenezcan al entorno relevante de la aplicación a desarrollar. Por ejemplo, la Figura 5 muestra el fondo relevante que estaría asociado a una aplicación de detección de granos de café, como los mostrados en la Figura 3. En este caso el fondo corresponde a la banda transportadora donde la aplicación de detección operará.
Figura 5. Ejemplos de fondos arbitrarios seleccionados para una aplicación de detección de granos de café.
4.1.3
Adquisición de la base de datos real de referencia Para validar el desempeño del sistema de generación sintética, se requiere crear una base de datos de referencia etiquetada manualmente.
Para tal fin, se toman M fotografías de las balotas en N posiciones diferentes en los mismos escenarios relevantes utilizados en la sección 4.1.2. Cada imagen es procesada mediante una herramienta de etiquetado manual, donde una persona delimita el contorno exacto de la balota dibujando puntos alrededor de esta. Dichos puntos se van uniendo para formar un círculo o una esfera, de acuerdo con la cantidad de puntos dibujados sobre la balota; esto es, si se tienen entre 2 y 4 puntos se genera un círculo, pero si son más de 4 puntos se genera una esfera. La Figura 7 muestra estos casos.
Figura 6. Captura de base de datos real. Imagen completa.
Figura 7. Herramienta para etiquetado manual. Acercamiento al objeto de interés marcado.
Este conjunto de datos se genera con el objetivo de realizar la comparación entre las métricas obtenidas con y sin la metodología y la posterior validación de la factibilidad de uso de la metodología planteada en este trabajo.
4.2
Procesamiento de imágenes para extracción del ROI Las imágenes de la base de datos “Imágenes controladas”, adquiridas como se describió en la sección 4.1, se recopilan en un directorio común para su procesamiento por lotes. Este enfoque permite una automatización eficiente del flujo de trabajo. Las imágenes originalmente pueden ser de alta resolución, por lo que se escalan únicamente para la gestión de visualización sin comprometer la resolución original con la que se procesan. Las imágenes se convierten a escala de grises para optimizar la aplicación de algoritmos de segmentación subsecuentes. Esta transformación reduce la complejidad computacional mientras mantiene la información de intensidad necesaria para diferenciar objeto de fondo. La metodología general de extracción del ROI comprende cinco etapas, así: Umbralización adaptativa Separación Fondo-Objetos. Ver sección 4.2.1. Análisis de componentes conexas Identificación de objetos individuales. Ver sección 4.2.2.
Refinamiento del cuadro delimitador Ubicación de las cuatro esquinas. Ver sección 4.2.3.
Obtención de contorno y silueta Segmentación precisa del objeto. Ver sección 4.2.4. Extracción de ROI Extracción de la región de interés. Ver sección 4.2.5.
4.2.1
Umbralización adaptativa La umbralización se emplea como una estrategia inicial para abordar la tarea de separación entre el objeto de interés y el fondo de la imagen. En lugar de asumir un valor de umbral fijo definido manualmente para todas las imágenes, se utiliza una
aproximación basada en la distribución de intensidades de los píxeles. De esta manera, el umbral se selecciona a partir de las características estadísticas de la imagen, lo que permite obtener una máscara binaria en la cual los píxeles son clasificados, de forma aproximada, como pertenecientes al objeto o al fondo. Este resultado no necesariamente representa una segmentación perfecta, debido a la presencia de ruido, sombras, reflejos o variaciones de iluminación; sin embargo, constituye una aproximación suficientemente útil para iniciar etapas posteriores de análisis.
La elección del método de umbralización depende directamente de las características de la imagen y de los requerimientos de la aplicación. Cuando existe una diferencia clara entre las intensidades del fondo y del objeto, un método global puede ser adecuado, pues un único valor de umbral permite separar ambas regiones de manera efectiva. En cambio, si la imagen presenta iluminación no uniforme, bajo contraste, texturas complejas o variaciones locales significativas, resulta conveniente emplear métodos locales o adaptativos, capaces de estimar el umbral en función del entorno de cada región de la imagen. Por tanto, la selección del método no debe entenderse como una decisión universal, sino como una elección asociada al tipo de escena, a la calidad de la adquisición y al grado de precisión requerido en la segmentación.
En el caso de las imágenes mostradas en la Figura 3, se utilizaron métodos de umbralización diferentes de acuerdo con las características visuales de cada objeto. Para las balotas se empleó el método de Otsu, debido a que la diferencia entre las intensidades del objeto y del fondo permite estimar un umbral global representativo de la imagen. Por otro lado, para los granos de café se utilizó el método de umbralización local, ya que estos presentan variaciones locales de iluminación, textura y contraste que dificultan una separación adecuada mediante un único umbral global. En ambos casos, la máscara binaria obtenida sirve como entrada para el análisis posterior de componentes conexas.
4.2.2
Análisis de componentes conectadas Una vez obtenida la máscara binaria del objeto de interés, se aplica un análisis de componentes conectadas con el fin de identificar regiones de píxeles pertenecientes al primer plano y extraer de ellas descriptores geométricos básicos. Este procedimiento asigna una etiqueta entera a cada región conectada de la imagen binaria y permite caracterizar cada componente mediante propiedades como el área, la posición del cuadro delimitador, sus dimensiones y la ubicación del centroide.
El análisis de componentes conectadas se realiza sobre una imagen binaria, en la cual los píxeles de primer plano representan las regiones candidatas del objeto y los píxeles de fondo corresponden al resto de la imagen. En este contexto, dos píxeles pueden considerarse conectados bajo una vecindad de 4 o de 8 elementos. En la conectividad de 4 vecinos solo se consideran las relaciones horizontales y verticales, mientras que en la conectividad de 8 vecinos también se incluyen las relaciones diagonales. Para las aplicaciones desarrolladas en este trabajo se utilizó conectividad de 8 vecinos, debido a que los objetos analizados presentan bordes curvos y regiones en las que la continuidad diagonal puede ser relevante.
Entre los algoritmos disponibles para el etiquetado de componentes conectadas se encuentran SAUF (Scan Array Union Find), BBDT (Block-Based Decision Trees) y Spaghetti. El método SAUF se basa en un recorrido secuencial de la imagen y en estructuras de unión–búsqueda para resolver equivalencias entre etiquetas. El método BBDT opera sobre bloques de píxeles y utiliza árboles de decisión para reducir el número de condiciones evaluadas durante el proceso de etiquetado. Por su parte, Spaghetti corresponde a una estrategia optimizada para el etiquetado eficiente de componentes, especialmente útil en imágenes binarias de alta resolución o en aplicaciones donde el
costo computacional es un criterio importante.
En el caso particular del algoritmo BBDT, el procesamiento puede describirse a partir de bloques de 2 × 2. Sea X el bloque actual y sean {P, Q, R, S} algunos de los bloques vecinos previamente procesados. La relación fundamental es la conectividad entre bloques, denotada por ▷◁, la cual puede expresarse como:
X ▷◁Y ⇔∃x ∈X ∩F, ∃y ∈Y ∩F | x ∈N(y),
(17)
donde F representa el conjunto de píxeles de primer plano y N(y) corresponde a la vecindad del píxel y. Esta relación indica que dos bloques están conectados si existe al menos un píxel de primer plano en cada bloque y dichos píxeles son vecinos bajo el criterio de conectividad seleccionado.
La selección del procedimiento de componentes conectadas depende de las propiedades de la imagen, de la calidad de la máscara binaria y de los requerimientos computacionales de la aplicación. Cuando la máscara es limpia, los objetos se encuentran bien separados y el nivel de ruido es bajo, el etiquetado directo de componentes conectadas suele ser suficiente para identificar cada región. En cambio, cuando los objetos presentan bordes incompletos, huecos internos, textura significativa, ruido, sombras, variaciones de iluminación o contacto entre regiones, es necesario incorporar etapas previas de segmentación y posprocesamiento. Entre estas etapas pueden incluirse operaciones morfológicas, detección de bordes, relleno de regiones, transformada de distancia o métodos de separación como relleno por inundación.
En aplicaciones donde el interés principal es medir objetos individuales relativamente compactos, como partículas, granos, células, monedas o balotas, el análisis de componentes conectadas permite filtrar regiones con base en criterios de área, posición,
relación de aspecto, centroide o dimensiones del cuadro delimitador. Por otra parte, cuando el interés está en la frontera del objeto y no únicamente en la región ocupada, puede ser conveniente complementar el análisis con métodos basados en contornos. Asimismo, en escenarios con objetos traslapados o en contacto, el etiquetado directo puede subestimar el número real de objetos, por lo cual resulta conveniente incorporar estrategias adicionales de separación antes de realizar la caracterización geométrica. En la aplicación de balotas se utilizó explícitamente el algoritmo BBDT (Block-Based Decision Trees) para el etiquetado de componentes conectadas. Posteriormente, se tomó la componente de mayor área como la región principal de interés. Esta estrategia resultó adecuada debido a que las balotas presentan una geometría compacta, bordes relativamente definidos y una separación clara respecto al fondo. En contraste, en la aplicación de granos, el uso directo del etiquetado de componentes conectadas sobre una máscara preliminar no produjo una segmentación suficientemente robusta, debido a la textura del material, las variaciones de iluminación y la irregularidad de los bordes. Por esta razón, se optó por una etapa previa de detección de bordes mediante Canny seguida de relleno por inundación, con el fin de obtener una máscara binaria más consistente antes de realizar la caracterización mediante componentes conectadas. De esta manera, aunque ambas aplicaciones emplean el análisis de componentes conectadas como mecanismo de caracterización geométrica, la estrategia de generación de la máscara binaria se ajustó a las condiciones particulares de cada escena.
4.2.3
Refinamiento del cuadro delimitador Tras la identificación de la componente conexa principal, se observa que el objeto no queda completamente contenido dentro del cuadro delimitador inicial. Se implementa un proceso de refinamiento en dos etapas:
Expansión proporcional: el cuadro delimitador inicial se expande proporcionalmente basándose en un porcentaje de la dimensión menor de la imagen. Esta expansión garantiza la inclusión completa del objeto y sus características cercanas. Integración de componentes secundarias: se analizan todas las componentes conexas adicionales cuyos centroides se encuentran dentro del cuadro expandido. Aquellas componentes que superan un umbral de tamaño mínimo, se incorporan a la máscara final. Este enfoque captura detalles importantes del objeto que inicialmente fueron omitidos, mejorando significativamente la precisión de la segmentación.
4.2.4
Obtención de contorno y silueta Utilizando la máscara refinada obtenida, se genera un nuevo cuadro delimitador ajustado a los bordes exactos del objeto. Este cuadro optimizado define una región de interés (ROI, por sus siglas en inglés) que contiene exclusivamente el objeto con el mínimo fondo residual. Para mejorar la calidad visual de la silueta, se aplican operaciones morfológicas, como apertura (erosión seguida de dilatación) que elimina ruido pequeño y desconecta regiones débilmente conectadas, y como cierre (dilatación seguida de erosión) que rellena pequeños huecos en el interior del objeto. Estas operaciones preservan la forma característica del objeto mientras suavizan irregularidades introducidas por ruido o imperfecciones de captura.
4.2.5
Extracción de ROI En esta fase final de segmentación, se extrae el objeto utilizando el contorno y la silueta refinados, eliminando completamente el fondo. El resultado se almacena con un canal alfa (transparencia RGBA), permitiendo:
Preservación de la forma: El canal alfa codifica la máscara de segmentación. Integración flexible: Las ROIs transparentes pueden ser insertadas en diversos fondos sin artefactos.
Normalización espacial: Todas las ROIs se recortan centradas para estandarizar el tamaño de entrada para procesos posteriores.
4.3
Generación masiva de datos sintéticos El proceso de composición sintética busca generar imágenes artificiales mediante la inserción controlada de regiones de interés (ROI) en fondos variados. Antes de la inserción, cada ROI se escala aleatoriamente en un rango comprendido entre un porcentaje mínimo y máximo de su tamaño original. Esta variación permite simular cambios en el tamaño aparente del objeto, asociados principalmente con diferentes distancias de captura. Una fuente importante de sesgo en los datos sintéticos es la discrepancia fotométrica entre la ROI, capturada originalmente bajo ciertas condiciones de iluminación, y el fondo en el cual se inserta. Para reducir esta diferencia, se implementa un procedimiento de normalización fotométrica basado en la igualación de la luminancia media. En primer lugar, tanto la ROI como el fondo se convierten a escala de grises; posteriormente, se calcula la intensidad media de cada uno y se estima un factor de ajuste dado por la ecuación (18):
factor = µfondo µROI + ϵ
(18)
donde µfondo y µROI representan las intensidades medias del fondo y de la ROI, respectivamente, y ϵ = 1 × 10−6 evita una posible división por cero. Finalmente, este factor se aplica a cada canal de color de la ROI, en el espacio BGR, con el fin de aproximar
su nivel global de brillo al del fondo. Este ajuste contribuye a mejorar la coherencia visual de la imagen compuesta, aunque no corrige completamente otras diferencias de iluminación, como sombras, contraste, saturación o temperatura de color. En aplicaciones donde el color constituye una característica discriminante relevante, como ocurre en el análisis de café, el espacio de color BGR puede presentar limitaciones para las etapas posteriores de procesamiento. En este espacio, la información asociada al color y a la intensidad luminosa se encuentra distribuida de manera conjunta en los tres canales, lo cual hace que variaciones de iluminación, sombras, reflejos o cambios de exposición afecten directamente la representación cromática de la imagen. Por esta razón, se consideró conveniente transformar las imágenes al espacio HLS, en el cual el tono dominante del color (Hue), la luminosidad (Lightness) y la saturación (Saturation) se representan de forma más diferenciada. En la aplicación desarrollada para café, esta transformación permitió trabajar con criterios cromáticos más robustos que los obtenidos directamente en BGR, mejorando la percepción visual de las imágenes sintéticas y evitando que los algoritmos de aprendizaje profundo terminen sólo aprendiendo de la diferencia cromática del ROI con el fondo.
Para cada imagen sintética generada se producen automáticamente, máscaras de segmentación binarias que marcan exactamente dónde fue colocada la ROI en la imagen final. Esta máscara se obtiene directamente del canal alfa redimensionado, garantizando alineación. Al mismo tiempo se generan las etiquetas y se almacenan en un archivo de texto plano, por imagen, con anotaciones en el formato estandarizado YO- LO que permite que las etiquetas sean independientes de la resolución de la imagen, (clase, x_centro, y_centro, ancho_normalizado, alto_normalizado) donde: clase: Identificador de la categoría, derivado del directorio de ROI.
x_centro, y_centro: Coordenadas del centroide del objeto, normalizadas en el intervalo [0, 1].
ancho_normalizado, alto_normalizado: Dimensiones del cuadro delimitador, normalizadas respecto al tamaño de la imagen.
Dada la naturaleza computacional intensiva de generar miles de imágenes sintéticas, la implementación se realiza multi-proceso, de manera que cada proceso carga una ROI específica e itera sobre todos los fondos disponibles mientras realiza la composición, realiza el ajuste de brillo y generación de anotaciones para finalmente guardar la imagen, máscara y etiqueta.
La metodología integrada presentada en esta sección aborda completamente los objetivos 1, 2 y 3. El objetivo 1 se alcanza mediante un protocolo de adquisición de las bases de datos requeridas explicado en la sección 4.1. El objetivo 2 se alcanza mediante un proceso robusto de segmentación que automatiza la extracción de ROIs, despues de hacer una sintonización particular a la aplicación, proceso que es explicado en la sección 4.2. El objetivo 3 se materializa en un sistema de síntesis masiva que genera miles de imágenes de entrenamiento variadas, con etiquetas automáticas y realismo visual mejorado, explicado en detalle en la sección 4.3. Juntos, estos procesos proporcionan los datos de entrenamiento necesarios para entrenar algoritmos de aprendizaje profundo.
DISEÑO EXPERIMENTAL
Con el propósito de evaluar la utilidad de las imágenes sintéticas generadas para el entrenamiento de modelos de aprendizaje profundo, se diseñó un experimento orientado a determinar si dichas imágenes permiten entrenar una red neuronal capaz de generalizar hacia datos reales. En particular, se busca establecer si un modelo entrenado con imágenes sintéticas puede alcanzar un desempeño competitivo cuando es evaluado sobre imágenes reales, las cuales representan el dominio de aplicación final del sistema. La tarea considerada corresponde a un problema de segmentación semántica, en el cual cada píxel de una imagen debe ser clasificado dentro de una de las clases definidas para el problema. En este contexto, la utilidad de las imágenes sintéticas no se evalúa únicamente a partir del desempeño obtenido sobre imágenes del mismo dominio sintético, sino principalmente a partir de la capacidad del modelo para transferir el conocimiento aprendido hacia el dominio real.
5.1
Definición de los conjuntos de datos Sea DS el conjunto de imágenes sintéticas generadas para el entrenamiento del modelo, compuesto por un total de 52 767 imágenes. Asimismo, sea DR el conjunto de imágenes reales disponibles, compuesto por 1000 imágenes adquiridas en condiciones reales de operación. Formalmente, estos conjuntos se definen como:
DS = {(xS i , yS i )}NS i=1,
(19)
DR = {(xR i , yR i )}NR i=1,
(20)
donde xS i representa la i-ésima imagen sintética, yS i su correspondiente máscara de segmentación, xR i representa la i-ésima imagen real y yR i su máscara de segmentación asociada. Además, se tiene que:
NS = 52 767,
(21)
NR = 1000.
(22)
Cada conjunto de datos se divide en subconjuntos de entrenamiento y prueba siguiendo una proporción 70 %–30 %. Por tanto, el conjunto sintético se particiona como: DS = Dtrain S ∪Dtest S
,
(23)
Dtrain S ∩Dtest S = ∅,
(24)
donde Dtrain S contiene el 70 % de las imágenes sintéticas y Dtest S contiene el 30 % restante.
De manera equivalente, el conjunto real se divide como: DR = Dtrain R ∪Dtest R ,
(25)
Dtrain R ∩Dtest R = ∅.
(26)
En términos de cardinalidad, los subconjuntos quedan definidos como: |Dtrain S | = 36 400,
(27)
|Dtest S | = 15 600,
(28)
|Dtrain R | = 700,
(29)
|Dtest R | = 300.
(30)
Esta partición permite evaluar el desempeño de los modelos tanto en el mismo dominio en el cual fueron entrenados como en un dominio diferente. En consecuencia, el diseño experimental permite analizar la existencia de una posible brecha de dominio entre las imágenes sintéticas y las imágenes reales.
5.2
Definición de los modelos Para garantizar una comparación controlada, se utiliza la misma arquitectura de red neuronal profunda en todos los experimentos. La selección de esta arquitectura será explicada en la sección 6.4. Asimismo, se mantienen constantes los hiperparámetros principales, el criterio de pérdida, el optimizador, el número de épocas de entrenamiento, las estrategias de aumento de datos, el tamaño de lote y los criterios de parada, siempre que estos sean aplicables.
Sea fθ una red neuronal profunda para segmentación semántica, donde θ representa el conjunto de parámetros entrenables del modelo. A partir de esta arquitectura se definen dos modelos principales:
MS = fθS,
(31)
MR = fθR.
(32)
El modelo MS corresponde a la red entrenada exclusivamente con imágenes sintéticas, es decir:
θS = arg m´ın θ L(fθ(x), y), (x, y) ∈Dtrain S
,
(33)
mientras que el modelo MR corresponde a la misma arquitectura entrenada exclusiva-
mente con imágenes reales:
θR = arg m´ın θ L(fθ(x), y), (x, y) ∈Dtrain R
.
(34)
En las expresiones anteriores, L representa la función de pérdida empleada durante el entrenamiento. Esta función puede corresponder, por ejemplo, a la entropía cruzada categórica, a la pérdida Dice o a una combinación de ambas, dependiendo de la formulación específica del problema de segmentación.
5.3
Escenarios de evaluación Una vez entrenados los modelos MS y MR, se evalúan sobre los conjuntos de prueba sintético y real. Esto da lugar a cuatro escenarios experimentales: S-S, S-R, R-R y R-S. Ver Tabla 1. Estos escenarios permiten analizar tanto el desempeño intra-dominio como la transferencia entre dominios.
Matemáticamente, los cuatro escenarios se expresan como:
ES−S = Φ(MS, Dtest S
),
(35)
ES−R = Φ(MS, Dtest R ),
(36)
ER−R = Φ(MR, Dtest R ),
(37)
ER−S = Φ(MR, Dtest S
),
(38)
donde Φ(·) representa el conjunto de métricas de evaluación utilizadas para cuantificar el desempeño del modelo de segmentación semántica.
Tabla 1: Escenarios experimentales. Escenario Modelo Conjunto de prueba Propósito S-S MS Dtest S Evaluar el desempeño del modelo sintético sobre imágenes sintéticas no vistas durante el entrenamiento.
S-R MS Dtest R Evaluar la capacidad de transferencia del modelo entrenado con imágenes sintéticas hacia el dominio real.
R-R MR Dtest R Establecer una línea base de desempeño en el dominio real usando entrenamiento con imágenes reales.
R-S MR Dtest S Evaluar la transferencia inversa desde el dominio real hacia el dominio sintético.
El escenario S-S permite verificar si el modelo MS aprende adecuadamente a partir de las imágenes sintéticas. Sin embargo, este resultado no es suficiente para afirmar que las imágenes sintéticas son útiles en el dominio real, ya que un alto desempeño en S-S podría indicar únicamente que el modelo se ajusta correctamente a las características del dominio sintético.
Por esta razón, el escenario S-R constituye la prueba principal del diseño experimental. En este caso, el modelo entrenado con imágenes sintéticas se evalúa sobre imágenes reales no vistas. Si el desempeño obtenido en S-R es cercano al desempeño obtenido en R-R, se puede inferir que las imágenes sintéticas contienen información visual, geométrica y semántica relevante para la tarea de segmentación en el dominio real. Por su parte, el escenario R-R se emplea como línea base de referencia, ya que representa
el desempeño esperado cuando el modelo es entrenado y evaluado dentro del dominio real. Finalmente, el escenario R-S permite analizar la transferencia inversa, es decir, la capacidad del modelo entrenado con imágenes reales para segmentar imágenes sintéticas. Este escenario puede contribuir a caracterizar la similitud o discrepancia entre ambos dominios.
5.4
Comparación principal del experimento La comparación central del diseño experimental se establece entre los escenarios S-R y R-R. Esta comparación permite responder si el entrenamiento con imágenes sintéticas puede aproximarse al desempeño alcanzado por un modelo entrenado con imágenes reales. En términos generales, se analiza la diferencia:
∆real = ER−R −ES−R,
(39)
donde ∆real representa la diferencia de desempeño entre el modelo entrenado con imágenes reales y el modelo entrenado con imágenes sintéticas, ambos evaluados sobre el conjunto real de prueba.
Una diferencia pequeña entre ER−R y ES−R indicaría que las imágenes sintéticas son útiles para entrenar un modelo capaz de generalizar al dominio real. Por el contrario, una diferencia considerable sugeriría la presencia de una brecha de dominio significativa entre las imágenes sintéticas y las imágenes reales.
Asimismo, la comparación entre S-S y S-R permite estimar la degradación del desempeño
del modelo sintético al pasar del dominio sintético al dominio real: ∆S = ES−S −ES−R.
(40)
Si ∆S es elevado, esto indicaría que el modelo entrenado con imágenes sintéticas presenta un buen desempeño dentro del dominio sintético, pero una baja capacidad de transferencia hacia el dominio real. En consecuencia, este resultado evidenciaría que las imágenes sintéticas no reproducen adecuadamente algunas características relevantes de las imágenes reales.
De forma análoga, la comparación entre R-R y R-S permite analizar la degradación del desempeño del modelo real al ser evaluado sobre imágenes sintéticas: ∆R = ER−R −ER−S.
(41)
Esta comparación permite estudiar la transferencia inversa y aporta información sobre el grado de similitud entre ambos dominios.
5.5
Métricas de evaluación Dado que la tarea corresponde a segmentación semántica, se utilizan métricas específicas para evaluar la calidad de las máscaras predichas por los modelos. En particular, se consideran las siguientes métricas:
Intersección sobre unión por clase, (IoU, por sus siglas en inglés). Intersección sobre unión media, (mIoU).
Coeficiente Dice.
Exactitud a nivel de píxel, conocida como pixel accuracy. Precisión, sensibilidad y F1-score por clase.
La métrica IoU para una clase c se define como:
IoUc = TPc TPc + FPc + FNc
,
(42)
donde TPc corresponde a los verdaderos positivos de la clase c, FPc a los falsos positivos y FNc a los falsos negativos.
La métrica mIoU se obtiene promediando la IoU sobre todas las clases: mIoU = 1 C C X c=1 IoUc,
(43)
donde C representa el número total de clases semánticas. El coeficiente Dice para una clase c se define como: Dicec = 2TPc 2TPc + FPc + FNc
.
(44)
Estas métricas permiten evaluar la calidad de la segmentación desde diferentes perspectivas. En particular, la mIoU y el coeficiente Dice son especialmente relevantes en problemas de segmentación, ya que consideran el solapamiento entre la máscara predicha y la máscara de referencia. Por su parte, la exactitud a nivel de píxel debe interpretarse con precaución, especialmente cuando existe desbalance entre clases, debido a que puede estar dominada por las clases mayoritarias, como el fondo de la imagen.
5.6
Criterios de interpretación de los resultados La utilidad de las imágenes sintéticas se determinará a partir de la comparación entre los escenarios experimentales. En particular, se considerarán los siguientes criterios de interpretación:
Tabla 2: Criterios para interpretar los resultados experimentales. Resultado observado Interpretación Alto desempeño en S-S y alto desempeño en S-R Las imágenes sintéticas permiten entrenar un modelo que generaliza adecuadamente hacia el dominio real.
Alto desempeño en S-S y bajo desempeño en S-R El modelo aprende el dominio sintético, pero existe una brecha de dominio significativa respecto al dominio real.
Desempeño en S-R cercano al desempeño en R-R Las imágenes sintéticas son útiles para entrenar modelos competitivos frente a modelos entrenados con datos reales.
Desempeño en R-R alto y desempeño en R-S bajo Las imágenes reales y sintéticas presentan diferencias visuales o semánticas relevantes. Los dominios no son realmente transferibles. Bajo desempeño en S-R y alto desempeño en R-R Las imágenes sintéticas no representan suficientemente las características del dominio real.
De acuerdo con estos criterios, las imágenes sintéticas se considerarán útiles si el modelo MS alcanza un desempeño aceptable sobre el conjunto Dtest R , es decir, si el resultado del escenario S-R es suficientemente cercano al obtenido en el escenario R-R. Esta comparación es fundamental, dado que el objetivo final del modelo no es segmentar imágenes sintéticas, sino operar adecuadamente sobre imágenes reales.
5.7
Consideraciones metodológicas Para que la comparación entre modelos sea justa y las conclusiones derivadas sean válidas, todos los experimentos deben realizarse bajo condiciones controladas. En particular, se deben conservar constantes los siguientes elementos:
La arquitectura de la red neuronal.
La función de pérdida.
El optimizador y sus hiperparámetros.
El número máximo de épocas de entrenamiento.
El tamaño de lote.
Las transformaciones de preprocesamiento aplicadas a las imágenes. Las estrategias de aumento de datos, si son utilizadas.
El criterio de selección del mejor modelo.
Las métricas de evaluación.
Además, es importante que las imágenes del conjunto de prueba no sean utilizadas durante el entrenamiento, la validación ni el ajuste de hiperparámetros. Esto garantiza que las métricas reportadas correspondan a una estimación no sesgada del desempeño del modelo sobre datos no vistos.
También debe tenerse en cuenta que existe una diferencia considerable en el número de imágenes disponibles en cada dominio. El modelo MS se entrena con 36 400 imágenes sintéticas, mientras que el modelo MR se entrena con 700 imágenes reales. Dicha diferencia también refleja una condición práctica frecuente: la disponibilidad de grandes volúmenes de datos sintéticos frente a la dificultad de obtener y etiquetar grandes
cantidades de imágenes reales.
Las métricas deben reportarse como el promedio de múltiples ejecuciones para reducir el sesgo inducido por la partición de los datos y por la inicialización de pesos en los modelos. Los resultados pueden reportarse como el promedio y la desviación estándar de las métricas obtenidas:
¯m = 1 K K X k=1 mk,
(45)
σm = v u u t
1
K −1 K X k=1 (mk −¯m)2,
(46)
donde K representa el número total de ejecuciones experimentales, mk la métrica obtenida en la k-ésima ejecución, ¯m el valor promedio y σm la desviación estándar.
5.8
Resumen del diseño experimental En resumen, el diseño experimental propuesto permite evaluar la utilidad de las imágenes sintéticas desde dos perspectivas complementarias. En primer lugar, la evaluación S-S permite determinar si el modelo entrenado con imágenes sintéticas aprende correctamente las características del dominio sintético. En segundo lugar, la evaluación S-R permite establecer si dicho aprendizaje se transfiere adecuadamente al dominio real, lo cual constituye la prueba principal de utilidad de las imágenes sintéticas. De esta manera, las imágenes sintéticas se considerarán útiles si se cumple al menos una de las siguientes condiciones:
1. Si el modelo entrenado exclusivamente con imágenes sintéticas alcanza un desem-
peño aceptable sobre imágenes reales.
2. Si dicho desempeño es cercano al obtenido por el modelo entrenado con imágenes
reales.
RESULTADOS
La metodología propuesta en la sección 4 e ilustrada en la Figura 1 y el procedimiento experimental descrito en la sección 5 fueron implementados en el lenguaje de programación Python™. Para el procesamiento digital de imágenes se utilizó el módulo cv2 de la librería OpenCV [46], accesible desde Python mediante el paquete opencv-python [47], disponible libremente en el repositorio PyPI [48]. Por otro lado, el diseño, desarrollo y entrenamiento de las redes neuronales convolucionales se llevó a cabo utilizando la librería de aprendizaje profundo PyTorch [49].
El entrenamiento y los experimentos se ejecutaron en una estación de trabajo Hewlett Packard HP Z8 G4 con CPU Intel Core i5, 16 GB de RAM, y GPU NVIDIA Quadro RTX 4000 de 8 GB de VRAM.
La sección 6.1 muestra los resultados de validar el procedimiento de procesamiento digital de imágenes. La sección 6.2 muestra el proceso de síntesis de una imagen. La sección 6.3 muestra los resultados de la captura de la base de datos real. La sección 6.4 explica la selección de arquitectura de red neuronal convolucional profunda, y la sección 6.5 resume los principales resultados cuantitativos del experimento.
6.1
Validación del procesamiento digital de imágenes Como se describió en la sección 4.1.1 se generó una base de datos controlada con imágenes de balotas numeradas de 0 a 30 y de 01 a 09, para un total de 40 balotas diferentes. Cada balota se capturó en N posiciones diferentes obteniendo un total de M imágenes. A este conjunto de imágenes se les aplicó el método de procesamiento digital, ver sección 4.2, observando que se aísla satisfactoriamente el objeto de interés
del fondo seleccionado. Es decir, se crea efectivamente la base de datos denominada “ROIs” explicada en la sección 4.2.5.
Como se mencionó en la sección 4.2, cada objeto de interés y escena requiere una parametrización diferente. La configuración específica utilizada para esta base de datos de balotas es:
1. N = 40 posiciones por balota.
2. M = 40 × 40 = 1600 imágenes semilla.
3. Fondos: 33.
4. Resolución de captura: 4K (3072 × 4096)
5. Relación de aspecto: 3:4, Modo retrato (Portrait).
6. Escalado para visualización: 100 %. Esto es, sin escalamiento directo. En vez de
mostrar en pantalla directamente, se guardan a disco y se deja la visualización a software externo.
7. Conversión a escala de grises: Estándar ITU-R BT.601 [50].
8. Umbralización adaptativa: Método probabilístico de Otsu [30].
9. Componentes conexas: BBDT.
10. Cuadro delimitador:
Expansión proporcional: 3 %.
Componentes secundarias: Nuevamente BBDT con umbral mínimo del 0.01 %
11. Contorno y silueta: Sin operación morfológica.
12. Escalamiento del ROI final: Aleatorio entre [60 %, 100 %]
13. Normalización fotométrica: Media en escala de grises aplicada por igual al espacio
de color BGR.
En la Figura 8 se presentan las primeras etapas del procesamiento. La Figura 8 (a) es la imagen original tal cual esta almacenada en la base de datos. La Figura 8 (b) muestra la conversión a escala de grises y la Figura 8 (c) muestra la aplicación del método Otsu para umbralización.
(a) Imagen original (b) Escala de grises (c) Umbralización Figura 8. Preprocesamiento y umbralización El método de Otsu funciona especialmente bien en este caso porque se decidió utilizar como fondo de la balota una tela de color uniforme, azul en este caso. Otsu encuentra rápidamente el valor de umbral que se debe aplicar para separar la estructura blanca de la balota. Sin embargo, en este punto las marcaciones encima de la balota también parecerían parte del fondo. Esto puede pasar no sólo en este caso, sino también en cualquier caso donde el objeto contenga marcaciones o texturas que sean de un color por debajo del umbral de Otsu. Esto adicionalmente al ruido natural del proceso. Por esta razón la metodología propuesta implementa un análisis de componentes conexas, explicado en la sección 4.2.2. La Figura 9 muestra el resultado de esta etapa. La Figura 9 (a) muestra la selección de la componente conexa de mayor área en la imagen como el objeto principal, y se aprovecha para realizar filtrado de ruido. La Figura 9 (b) muestra la primera aproximación de la región de interés utilizando esta componente conexa. Este resultado también revela que algunas regiones del objeto pueden quedar por fuera de la región delimitada debido a las características geométricas particulares de cada objeto. Esta es la razón por la cual se incluyó en la metodología una etapa de
refinamiento, explicada en la sección 4.2.3.
(a) Componente conexa filtrada (b) ROI aproximado Figura 9. Análisis de componentes conexas La Figura 10 muestra la etapa de refinamiento. Primero se expande el ROI inicial, Figura 10 (a) y se ejecuta de nuevo la umbralización, Figura 10 (b), para incluir las partes que inicialmente quedaron excluidas.
(a) Expansión de ROI.
(b) Segunda umbralización.
Figura 10. Refinamiento del contorno Las últimas dos etapas del proceso permiten generar la base de datos intermedia denominada “ROIs”. Estas etapas fueron descritas en las secciones 4.2.4 y 4.2.5 respectivamente. La figura 11 muestra los resultados del proceso. La Figura 11 (a) muestra la ROI definitiva incluyendo la mascara de segmentación del objeto. La Figura 11 (b) muestra la
silueta del objeto en forma de mascara binaria, que es la que se utiliza como etiqueta final de posición para la imagen definitiva. La Figura 11 (c) muestra la segmentación final del objeto, que técnicamente se conoce como el dintorno de la imagen. (a) ROI definitiva.
(b) Silueta.
(c) Dintorno.
Figura 11. Salida del proceso.
6.2
Síntesis de una imagen Se utilizaron 33 fondos que al combinarse con las 1600 imágenes ROI de balotas generan un total de 52 767 imágenes. Para obtener cada una de ellas, se toma un ROI y un fondo, y se ubica el ROI en una posición aleatoria del fondo utilizando el escalamiento seleccionado, que en este caso es aleatorio gaussiano entre el 60 % y el 100 % del tamaño original. Luego se corrige la luminancia media del ROI para que se iguale a la luminancia media del fondo, en un proceso denominado normalización fotométrica y explicado en detalle en la sección 4.3. La Figura 12 muestra el proceso de composición sintética de una imagen. La Figura 12 (a) muestra un ROI ubicado aleatoriamente sobre uno de los fondos utilizando algún factor de escalamiento aleatorio en el rango determinado. La Figura 12 (b) muestra la misma escena después de aplicar la normalización fotométrica. El resultado es una base de datos masiva y sintética donde las imágenes guardan coherencia perceptual con el fondo donde fueron ubicadas, y como desde el momento de composición se conocen las coordenadas donde está ubicado el ROI, entonces la base de
(a) Composición inicial.
(b) Normalización fotométrica.
Figura 12. Composición sintética de las imágenes. datos tiene 100 % de confiabilidad en las etiquetas almacenadas. La Figura 13 muestra 3 ejemplos del resultado final de la composición sintética. (a) Ejemplo 1.
(b) Ejemplo 2.
(c) Ejemplo 3.
Figura 13. Ejemplos de imágenes sintéticas generadas. La generación de 52 767 imágenes tomó aproximadamente 40 horas, esto es 2394.3315 segundos, con un promedio de 0.045 segundos por imagen 4K corriendo en la Z8.
6.3
Captura de la base de datos real Con el fin de poder evaluar la utilidad real de la base de datos resultado de la síntesis, es necesario crear otra base de datos con imágenes reales. Debido a la dificultad de crear dicha base, se decidió capturar únicamente 1000 imágenes.
La Figura 14 muestra 3 ejemplos de imágenes reales. Nótese el parecido perceptual general que existe con aquellas generadas sintéticamente y mostradas en la Figura 13. (a) Ejemplo 1.
(b) Ejemplo 2.
(c) Ejemplo 3.
Figura 14. Ejemplos de imágenes reales.
El esfuerzo para la captura y etiquetado de esta base de datos es significativo. En el procedimiento ejecutado en nuestro laboratorio, la captura tomó aproximadamente
15 días hábiles. Sin embargo, para poder generalizar un poco este valor y utilizarlo
en comparaciones justas, se tomaron mediciones de tiempo de captura individual a conjuntos de 30 imágenes con al menos 4 personas diferentes. En promedio la captura y etiquetado de cada imagen tomó 200 segundos.
Esto es, para capturar y etiquetar 1000 imágenes, el tiempo promedio sería de 200 000 segundos ×(1/3600) × (1/8) = 6.94 ≈7 días-persona. Estos son días hábiles con jornada de 8 horas por persona, sin descanso alguno. En la práctica esto no es realista. Por lo que el estimativo se redujo a 6 horas laborales efectivas diarias por persona, para un total promedio de 9.26 días-persona. Este valor se puede entender como que una persona
toma 10 días hábiles en generar las 1000 imágenes etiquetadas, o que se requieren 10 personas trabajando simultáneamente con equipos de captura individuales, para realizar el trabajo en 1 día.
Como se mencionó en la sección 1.1, una de las motivaciones más grandes de este trabajo es la reducción significativa del esfuerzo en la creación de una base de datos útil para entrenamiento. La tabla 3 muestra una comparación justa entre la generación de una base de datos sintética contra la captura de una base de datos real. Tabla 3: Comparación de tiempos de generación Captura y Etiquetado [imágenes] Tiempo [s] Tiempo [días-persona]
1 real
200
1 sintética
0.045
1000 reales
200 × 103
10
1000 sintéticas
45
0.002
52 767 reales
10.4 × 106
520
52 767 sintéticas
2.394 × 103
0.11
Un resultado significativo en este trabajo es que la base de datos de 52 767 imágenes, hubiese tomado 520 días-persona en capturarse (es decir, dos años calendario, ya que los días-persona son días hábiles), mientras la metodología propuesta puede realizar la misma tarea sintetizando las imágenes en aproximadamente 40 minutos después de configurada la etapa de procesamiento, que suele tardar otras 4 horas. En la práctica es cambiar dos años-persona, por un día-persona.
6.4
Selección de arquitectura CNN.
Para la tarea de segmentación de la balota de lotería, se implementó una arquitectura DeepLabV3+ [39], considerada estado del arte en visión por computador para la tarea
de segmentación semántica. Esta red utiliza como extractor de características (backbone) una red ResNet-50 [41] preentrenada con el dataset ImageNet [42]. Esta elección permite aprovechar el conocimiento previo de formas y texturas, acelerando la convergencia en el nuevo dominio de las balotas. La arquitectura DeepLabV3+ incorpora un módulo de Atrous Spatial Pyramid Pooling (ASPP) [40], el cual aplica convoluciones con diferentes tasas de dilatación para capturar información multiescala del objeto, garantizando que la forma de la balota se robusta a las variaciones de tamaño. La configuración utilizada para la CNN fue:
Arquitectura de la red neuronal: DeepLabV3+ Función de pérdida: Binary Cross-entropy + Dice. Optimizador: AdamW.
Máximo número de épocas: 100.
Parada temprana: 25 épocas sin mejora.
Tamaño de lote: 8.
Tasa de aprendizaje: Decaimiento polinomial PolyLR. Aumento de datos: Ninguno.
Selección del mejor modelo: Máximo mIoU.
Métricas de desempeño: mIoU.
6.5
Resultados experimentales Para validar la efectividad de la generación sintética como reemplazo del etiquetado manual, se diseñó una matriz de pruebas cruzadas, para las cuales se entrena el modelo descrito por lo cual se hace necesario redimensionar las imágenes a 384x384 píxeles para
mantener la consistencia para la red neuronal.
La matriz de pruebas se construye a partir de la ejecución de los cuatro escenarios fundamentales para medir la brecha entre simulación y realidad (simulation-to-reality gap). La tabla 4 se presenta los resultados obtenidos al correr los escenarios. Tabla 4: Desempeño de los modelos en los escenarios experimentales. Métrica S–S R–R R–S S–R IoU balota
0.9825
0.9079
0.8997
0.9210
IoU fondo
0.9998
0.9981
0.9986
0.9984
mIoU
0.9912
0.9530
0.9491
0.9597
Pixel accuracy
0.9998
0.9982
0.9986
0.9984
Precision
0.9874
0.9160
0.9556
0.9875
Sensibilidad
0.9951
0.9903
0.9389
0.9318
F1-Score
0.9912
0.9517
0.9472
0.9589
dice
0.9912
0.9517
0.9472
0.9589
mAP
0.9999
0.9877
0.9877
0.9508
6.5.1
Entrenamiento del modelo MS sintético La Figura 15 muestra la evolución del índice de Intersección sobre Unión (IoU) para la clase balota durante el entrenamiento del modelo MS sintético. Esta curva evidencia la rapidez con la que el modelo logra asimilar las características morfológicas de las imágenes sintéticas, estabilizándose progresivamente a medida que el entrenamiento avanza hasta alcanzar los valores reportados en la tabla de desempeño. En sintonía con la mejora del IoU, la Figura 16 detalla el comportamiento de la función de pérdida durante la etapa de validación del mismo entrenamiento. Como es deseable, la gráfica presenta una tendencia decreciente, reflejando que el modelo
Figura 15. Evolución de IoU para la clase balota en el conjunto de validación durante el entrenamiento del modelo MS.
ajusta eficientemente sus pesos para minimizar el error combinado de la Entropía Cruzada Binaria y el coeficiente Dice. Las variaciones o ligeros repuntes en esta curva son indicativos de los ajustes dinámicos de la red frente a lotes de datos más desafiantes. Pre-train Train Figura 16. Evolución de la función de pérdida en el conjunto de validación durante el entrenamiento del modelo MS.
Un factor determinante para lograr la convergencia estable mostrada en las métricas anteriores es la estrategia de optimización aplicada. La Figura 17 expone la tasa de aprendizaje empleada durante el entrenamiento del modelo con el conjunto sintético. El uso de una estrategia de decaimiento polinomial permite que el algoritmo dé pasos de actualización grandes en las primeras épocas para escapar de mínimos locales y, gradualmente, realice ajustes más conservadores hacia el final del proceso, asegurando así una sintonización óptima de los pesos sin inducir inestabilidad. Pre-train Train Figura 17. Tasa de aprendizaje empleada durante el entrenamiento del modelo MS con el conjunto sintético.
Para complementar la evaluación del proceso sintético, la Figura 18 exhibe la evolución de la exactitud media (Mean Accuracy) en el conjunto de validación. Dado que las escenas generadas se componen predominantemente de fondo, esta métrica suele alcanzar valores muy altos de forma temprana; sin embargo, su seguimiento constante es vital para confirmar que el modelo no ha colapsado prediciendo una única clase y que el balance general de clasificación a nivel de píxel se mantiene robusto durante todo el ciclo de aprendizaje. Finalmente la Figura 19 presenta la matriz de confusión obtenida
Pre-train Train Figura 18. Evolución de la exactitud media en validación para el entrenamiento del modelo MS con el conjunto sintético.
al evaluar el modelo entrenado con datos sintéticos sobre el conjunto de prueba sintético. En ella se puede observar la proporción de píxeles correctamente clasificados tanto para la clase balota como para el fondo, así como las tasas de falsos positivos y falsos negativos, lo cual permite comprender qué tanto el modelo logra discriminar el objeto de interés en entornos y variaciones no vistas previamente durante el entrenamiento. Figura 19. Matriz de confusión para el modelo MS en el escenario ES−S.
6.5.2
Entrenamiento del modelo MR real De la misma manera que en la sección 6.5.1, se presenta la evolución por épocas que tuvo el modelo durante la validación utilizando el conjunto de datos Dtest S . La Figura 20 ilustra la evolución del IoU para la clase balota en el escenario (ER−R), la cual presenta mas variaciónes dada la limitación en los datos.
Figura 20. Evolución del IoU para la clase balota en el conjunto de validación durante el entrenamiento del modelo MR.
Al igual que en el caso sintético, la optimización del modelo real requiere una gestión cuidadosa del tamaño de paso del gradiente. La Figura 21 describe la planificación de la tasa de aprendizaje utilizada en este segundo entrenamiento. Adaptar esta tasa a valores considerablemente bajos es un paso crítico durante el ajuste fino, ya que actualizaciones abruptas podrían degradar o destruir las características que la arquitectura DeepLabV3+ heredó de su preentrenamiento inicial. El impacto de esta estrategia de optimización y de la liberación de los pesos sobre el error general del modelo se puede examinar en la Figura 22. Esta gráfica rastrea la evolución de la pérdida en validación para
Figura 21. Tasa de aprendizaje empleada durante el entrenamiento del modelo MR con el conjunto real.
el entrenamiento con el limitado conjunto real. La morfología de esta curva ayuda a verificar empíricamente en qué época el modelo alcanzó su máxima capacidad de generalización antes de que el mecanismo de detención temprana interviniera, evitando un escenario de sobreajuste crítico sobre las únicas 700 imágenes de entrenamiento disponibles. La estabilidad general de la clasificación en el dominio real queda ratificada en la Figura 23, la cual documenta el crecimiento de la exactitud media. Aunque es una métrica estadísticamente susceptible al desbalance volumétrico entre el objeto y el fondo, su consolidación positiva a la par del IoU confirma que el sistema es capaz de diferenciar la balota del entorno sin penalizar el desempeño global. Para establecer una base de comparación justa frente a la aproximación tradicional, la Figura 24 ilustra la matriz de confusión correspondiente al modelo de referencia entrenado directamente con imágenes reales, evaluado sobre su respectivo conjunto de prueba. Comparar esta matriz con la del modelo sintético es clave para determinar si la distribución de errores y aciertos mantiene un comportamiento numéricamente
Figura 22. Evolución de la función de pérdida en el conjunto de validación durante el entrenamiento del modelo Mr.
Figura 23. Evolución de la exactitud media en validación para el entrenamiento del modelo Mr con el conjunto sintético.
consistente entre ambos dominios, validando así la utilidad de las imágenes generadas artificialmente para tareas de segmentación fina.
Figura 24. Matriz de confusión para el modelo MR en el escenario ER−R. Finalmente, para materializar y comprender cualitativamente las capacidades de segmentación adquiridas, la Figura expone algunos ejemplos visuales de las predicciones arrojadas por el modelo sobre el conjunto de prueba. Contrastar la silueta predicha directamente sobre las imágenes reales permite validar si el sistema preserva de manera fidedigna los contornos y continuidades espaciales de las balotas.
CONCLUSIONES Y RECOMENDACIONES
7.1
Conclusiones Los resultados obtenidos permiten concluir que la metodología propuesta para la construcción y etiquetado simultáneo de bases de datos sintéticas es útil para el entrenamiento de redes neuronales convolucionales en tareas de segmentación semántica. Esta afirmación se deriva principalmente del escenario S–R, en el cual el modelo entrenado exclusivamente con imágenes sintéticas fue evaluado sobre imágenes reales no vistas. En dicho escenario se obtuvo un IoU para la clase balota de 0.9210, una mIoU de 0.9597, una exactitud de píxel de 0.9984 y un mAP de 0.9508. Estos valores evidencian que la información visual, geométrica y semántica incorporada en la base de datos sintética fue suficiente para que el modelo generalizara adecuadamente hacia el dominio real. La hipótesis de que una base de datos sintética puede ser utilizada para entrenar un modelo aplicable en el dominio real queda respaldada por la comparación entre los escenarios S–R y R–R. El modelo entrenado con datos sintéticos y evaluado sobre datos reales alcanzó una mIoU de 0.9597, superior a la mIoU de 0.9530 obtenida por el modelo entrenado y evaluado con datos reales. De forma similar, el IoU de la clase balota fue mayor en S–R (0.9210) que en R–R (0.9079). Aunque el mAP fue ligeramente mayor en R–R (0.9877) que en S–R (0.9508), la diferencia es reducida y no contradice la capacidad de transferencia observada en las métricas de solapamiento. Por tanto, los datos sintéticos no sólo permitieron entrenar un modelo funcional en el dominio real, sino que alcanzaron un desempeño competitivo frente al entrenamiento realizado con una base real limitada.
El desempeño obtenido en el escenario S–S, con una mIoU de 0.9912 y un IoU de la clase
balota de 0.9825, confirma que el modelo aprende adecuadamente las características del dominio sintético. No obstante, este resultado por sí solo no sería suficiente para validar la utilidad de la metodología. La conclusión relevante surge al observar que la degradación al pasar del dominio sintético al dominio real fue moderada: la mIoU disminuyó de 0.9912 en S–S a 0.9597 en S–R. Esta diferencia indica que existe una brecha de dominio, pero que dicha brecha no impide la transferencia efectiva del aprendizaje hacia imágenes reales.
La comparación inversa, correspondiente al escenario R–S, también aporta evidencia sobre la cercanía entre los dominios. El modelo entrenado con imágenes reales y evaluado sobre imágenes sintéticas obtuvo una mIoU de 0.9491 y un IoU de la clase balota de 0.8997, valores muy próximos a los obtenidos en S–R. Esto sugiere que la metodología de composición sintética logró generar imágenes con características suficientemente consistentes con las imágenes reales de referencia, al menos para la aplicación evaluada. Desde el punto de vista operativo, la metodología representa una reducción significativa del esfuerzo requerido para construir bases de datos etiquetadas. La generación de
52 767 imágenes sintéticas tomó aproximadamente 40 minutos de procesamiento, con un
promedio de 0.045 segundos por imagen. En contraste, la captura y etiquetado manual de una base real equivalente se estimó en aproximadamente 520 días-persona. Además, debido a que las coordenadas de inserción del objeto y su máscara se conocen desde el momento de la composición, las etiquetas generadas presentan consistencia geométrica directa con la imagen sintetizada, evitando errores asociados al etiquetado manual. En consecuencia, el método propuesto constituye una alternativa viable para la generación masiva de datos etiquetados en dominios especializados donde la adquisición y anotación manual de imágenes reales resulta costosa, lenta o difícil de escalar. Los resultados muestran que, bajo condiciones de adquisición controlada del objeto, selección adecuada
de fondos y parametrización apropiada del procesamiento digital de imágenes, una base sintética puede ser utilizada para entrenar modelos con capacidad efectiva de operación sobre datos reales.
Finalmente, debe señalarse que el alcance de esta conclusión está limitado a las condiciones experimentales evaluadas, particularmente al caso de segmentación de balotas sobre fondos relevantes para la aplicación. La metodología requiere una etapa inicial de ajuste por aplicación y su desempeño puede variar en objetos con bordes difusos, bajo contraste, alta variabilidad morfológica o condiciones de iluminación más complejas. No obstante, los resultados obtenidos justifican su uso como herramienta para sustituir parcialmente el etiquetado manual y, especialmente, como estrategia para asistir y complementar el entrenamiento de modelos cuando se dispone de bases reales pequeñas o costosas de ampliar.
7.2
Recomendaciones A partir de los resultados obtenidos, las recomendaciones para trabajo futuro se orientan en dos direcciones complementarias. En primer lugar, se propone profundizar en la validación interna de la metodología, con el fin de identificar el aporte específico de cada una de sus etapas y fortalecer la robustez del proceso de generación sintética. En segundo lugar, se plantea ampliar el horizonte de utilización del método, no sólo como una alternativa para reemplazar parcialmente el etiquetado manual, sino también como una estrategia para asistir y complementar el entrenamiento de modelos cuando se dispone de bases de datos reales limitadas.
En este sentido, las recomendaciones propuestas buscan avanzar desde la demostración experimental de utilidad hacia una metodología más generalizable, controlada y adaptable
a diferentes dominios de aplicación. Para ello, se consideran dos líneas principales de trabajo futuro: el desarrollo de un estudio de ablación y la evaluación de esquemas de preentrenamiento con imágenes sintéticas seguido de ajuste fino con imágenes reales.
7.2.1
Estudio de ablación Como trabajo futuro, se recomienda realizar un estudio de ablación orientado a cuantificar el aporte individual de cada etapa de la metodología propuesta sobre el desempeño final del modelo de segmentación. Aunque los resultados obtenidos evidencian que la base de datos sintética permite entrenar un modelo con capacidad de generalización hacia el dominio real, aún es necesario determinar cuáles componentes del proceso tienen mayor influencia en dicha transferencia y cuáles pueden ser simplificados, ajustados o reemplazados sin afectar significativamente el desempeño.
El estudio de ablación consistiría en entrenar y evaluar múltiples variantes del sistema, eliminando o modificando una etapa específica de la metodología mientras se mantienen constantes la arquitectura de red, los hiperparámetros de entrenamiento, la partición de los datos, el número de épocas, la función de pérdida y las métricas de evaluación. De esta manera, las diferencias observadas en métricas como IoU, mIoU, pixel accuracy y mAP podrían atribuirse principalmente a la etapa intervenida. En particular, se propone analizar las siguientes componentes:
1. Refinamiento del ROI: evaluar el efecto de omitir la expansión del cuadro
delimitador y la integración de componentes secundarias. Esta prueba permitiría determinar si el refinamiento contribuye de manera significativa a mejorar la precisión de las máscaras y, por tanto, el aprendizaje de los bordes del objeto.
2. Normalización fotométrica: comparar el desempeño del modelo entrenado
con imágenes sintéticas generadas con y sin ajuste de luminancia entre la ROI y el fondo. Esta comparación permitiría estimar la importancia de reducir la discrepancia fotométrica entre el objeto insertado y el escenario de fondo.
3. Variabilidad de fondos: entrenar modelos con diferentes cantidades de fondos,
por ejemplo 8, 16 y 32, con el fin de establecer hasta qué punto la diversidad del entorno sintético mejora la generalización hacia imágenes reales.
4. Escalamiento aleatorio del objeto: evaluar rangos de escala diferentes para
la inserción de las ROIs, con el propósito de determinar si la variabilidad en el tamaño aparente del objeto contribuye a la robustez del modelo frente a cambios de distancia o perspectiva.
5. Cantidad de imágenes sintéticas: entrenar modelos con subconjuntos de la
base sintética, por ejemplo 5000, 10 000, 25 000 y 52 000 imágenes, para analizar la relación entre el tamaño de la base de datos generada y el desempeño alcanzado en el dominio real.
6. Aumento geométrico: comparar bases sintéticas con y sin rotaciones u otras
transformaciones geométricas, con el fin de establecer si estas transformaciones aportan variabilidad útil o si introducen ejemplos poco representativos del dominio real.
La evaluación principal de cada variante debe realizarse sobre el escenario S–R, debido a que este mide directamente la capacidad del modelo entrenado con imágenes sintéticas para operar sobre imágenes reales. Adicionalmente, se recomienda reportar los escenarios S–S, R–R y R–S, ya que estos permiten distinguir entre aprendizaje intra-dominio, transferencia hacia el dominio real y similitud inversa entre las distribuciones sintética y real.
Formalmente, para cada variante ablacionada Ai se puede definir un modelo M Ai S entrenado con una base sintética modificada DAi S . Su desempeño sobre el dominio real estaría dado por:
EAi S−R = Φ(M Ai S , Dtest R ),
(47)
donde Φ(·) representa el conjunto de métricas de evaluación. El impacto de la ablación puede cuantificarse mediante la diferencia respecto al modelo completo: ∆Ai = ECompleto S−R −EAi S−R.
(48)
Un valor alto de ∆Ai indicaría que la etapa eliminada o modificada cumple un papel importante en la capacidad de transferencia hacia el dominio real. Por el contrario, un valor bajo sugeriría que dicha etapa tiene un efecto marginal o que puede ser simplificada sin comprometer significativamente el desempeño.
Este estudio permitiría fortalecer la validez experimental de la metodología, al pasar de una evaluación global del sistema a una comprensión más detallada de sus componentes. Además, proporcionaría criterios técnicos para optimizar futuras implementaciones, reducir tiempos de generación, disminuir la complejidad de parametrización y priorizar aquellas etapas que realmente contribuyen a mejorar la utilidad de las bases de datos sintéticas en aplicaciones reales.
7.2.2
Preentrenamiento con imágenes sintéticas y ajuste fino con imágenes reales Aunque la comparación entre MS y MR permite evaluar la transferencia directa entre dominios, también es relevante analizar si las imágenes sintéticas pueden ser útiles como
etapa de preentrenamiento. En muchos escenarios prácticos, los datos sintéticos no necesariamente reemplazan a los datos reales, sino que pueden complementar su uso, especialmente cuando el número de imágenes reales disponibles es limitado. Para evaluar esta posibilidad, se propone entrenar un tercer modelo, denominado MS→R, mediante una estrategia de preentrenamiento con imágenes sintéticas y posterior ajuste fino con imágenes reales. En primer lugar, el modelo se entrena sobre Dtrain S :
θS = arg m´ın θ L(fθ(x), y), (x, y) ∈Dtrain S
.
(49)
Posteriormente, los parámetros obtenidos se utilizan como inicialización para un proceso de ajuste fino sobre el conjunto real de entrenamiento:
θS→R = arg m´ın θ L(fθ(x), y), (x, y) ∈Dtrain R
,
(50)
donde la optimización se inicializa a partir de los parámetros θS. El modelo resultante se define como:
MS→R = fθS→R.
(51)
Este modelo se evalúa sobre el conjunto real de prueba:
ES→R = Φ(MS→R, Dtest R ).
(52)
La comparación entre ES→R y ER−R permite determinar si el preentrenamiento con imágenes sintéticas mejora el desempeño respecto al entrenamiento realizado únicamente
con imágenes reales. En este caso, las imágenes sintéticas se considerarían útiles si: ES→R > ER−R.
(53)
Este resultado indicaría que las imágenes sintéticas aportan información relevante para la inicialización del modelo y mejoran su capacidad de generalización cuando posteriormente se ajusta con datos reales.
BIBLIOGRAFÍA
[1] DANG, L. Minh, et al. An efficient zero-labeling segmentation approach for pest monitoring on smartphone-based images. En: European Journal of Agronomy, tomo 160, 2024, pág. 127331. 1, 2 [2] NANDAKUMAR, Nishanth y EBERHARDT, Jörg. Overview of Synthetic Data Generation for Computer Vision in Industry. En: 2023 8th International Conference on Mechanical Engineering and Robotics Research (ICMERR). IEEE, 2023, págs. 31–35. 1, 2, 2.2 [3] ADNAN, Myasar Mundher, et al. Automatic image annotation based on deep learning models: a systematic review and future challenges. En: IEEE Access, tomo 9, 2021, págs. 50253–50264. 1.1 [4] NOVOZÁMSKÝ, Adam, et al. Automated Object Labeling for CNN-Based Image Segmentation. En: 2020 IEEE International Conference on Image Processing (ICIP). IEEE, 2020, págs. 2036–2040. 1.1 [5] KANCHANADEVI, K. y SANDHIA, G. K. A Neural Style Transfer Network for Image Augmentation of Corn Leaves using Convoluvational Neural Netwok. En: 2023 International Conference on Integrated Intelligence and Communication Systems (ICIICS). IEEE, 2023, págs. 1–5. El título publicado por IEEE Xplore contiene las erratas tipográficas “Convoluvational” y “Netwok”; se reproduce textualmente. 1.1 [6] SINGH, Himanshu; TEWARI, Utkarsh y USHASUKHANYA, S. Tomato Crop Disease Classification using Convolution Neural Network and Transfer Learning. En: 2023 International Conference on Networking and Communications (ICNWC). IEEE, 2023, págs. 1–6. 1.1
[7] MUMUNI, Alhassan y MUMUNI, Fuseini. Data augmentation: A comprehensive survey of modern approaches.
En: Array, tomo 16, 2022, pág. 100258. ISSN
2590-0056. 1.1, 2.1
[8] CHANG, Hsin-Yu, et al. A Survey of Data Synthesis Approaches. En: arXiv preprint arXiv:240703672, 2024. 1.1, 2.1 [9] VAN ENGELEN, Jesper E. y HOOS, Holger H. A Survey on Semi-Supervised Learning. En: Machine Learning, tomo 109, No 2, 2020, págs. 373–440. 1.1, 2.3 [10] CORTES, F., et al.
Tool for Semi-Automatic Segmentation and Labeling of Regions of Interest on Mid-Lateral Oblique Screen-Film Mammograms. En: 2023 Global Medical Engineering Physics Exchanges/Pacific Health Care Engineering (GMEPE/PAHCE). IEEE, 2023, págs. 1–6. Paper ID 122EBs en el programa oficial GMEPE/PAHCE 2023 (https://gmepe.org/P7ProgramOverview.htm). 1.1 [11] DE OLIVEIRA, Willian Dihanster G.; PENATTI, Otávio A. B. y BERTON, Lilian. A comparison of graph-based semi-supervised learning for data augmentation. En: 2020 33rd SIBGRAPI Conference on Graphics, Patterns and Images (SIBGRAPI). IEEE, 2020, págs. 264–271. 1.2, 2.3 [12] DWIBEDI, Debidatta; MISRA, Ishan y HEBERT, Martial. Cut, Paste and Learn: Surprisingly Easy Synthesis for Instance Detection. En: Proceedings of the IEEE International Conference on Computer Vision (ICCV), 2017, págs. 1301–1310. 2.1,
2.5, 3.2
[13] GHIASI, Golnaz, et al. Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021, págs. 2918–2928. 2.1, 2.5
[14] GOODFELLOW, Ian J., et al. Generative Adversarial Nets. En: Advances in Neural Information Processing Systems 27 (NeurIPS 2014), tomo 27. Curran Associates, Inc., 2014, págs. 2672–2680. URL https://proceedings.neurips.cc/paper_f iles/paper/2014/hash/5ca3e9b122f61f8f06494c97b1afccf3-Abstract.html.
2.1
[15] HO, Jonathan; JAIN, Ajay y ABBEEL, Pieter. Denoising Diffusion Probabilistic Models. En: Advances in Neural Information Processing Systems 33 (NeurIPS 2020), tomo 33. Curran Associates, Inc., 2020, págs. 6840–6851. URL https: //proceedings.neurips.cc/paper/2020/hash/4c5bcfec8584af0d967f1ab1017 9ca4b-Abstract.html. 2.1 [16] ROMBACH, Robin, et al. High-Resolution Image Synthesis with Latent Diffusion Models. En: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022, págs. 10684–10695. 2.1 [17] FAWAKHERJI, Mulham, et al. Shape and style GAN-based multispectral data augmentation for crop/weed segmentation in precision farming. En: Crop Protection, tomo 184, 2024, pág. 106848. 2.1 [18] HYDOCK, Kenneth, et al. Generation of synthetic data for medical decision support applications. En: 2023 IEEE Applied Imagery Pattern Recognition Workshop (AIPR). IEEE, 2023, págs. 1–7. 2.1, 2.2 [19] HONG, Sungkook, et al. Massive-Scale construction dataset synthesis through Stable Diffusion for Machine learning training. En: Advanced Engineering Informatics, tomo 62, 2024, pág. 102866. 2.1
[20] TOBIN, Josh, et al. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. En: 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2017, págs. 23–30. 2.2, 2.4, 3.4 [21] VASILEIADIS, Alexandros K. y NIKOLAIDIS, Nikos. Generation of Annotated Data for Human-Centric Computer Vision Tasks Using Augmented Reality. En: 2025 33rd European Signal Processing Conference (EUSIPCO). IEEE, 2025, págs. 785– 789. URL https://eusipco2025.org/wp-content/uploads/pdfs/0000785.pdf.
2.2
[22] KIRILLOV, Alexander, et al. Segment Anything. En: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2023, págs. 4015–4026. URL https://arxiv.org/abs/2304.02643. 2.3 [23] SOHN, Kihyuk, et al.
FixMatch: Simplifying Semi-Supervised Learning with Consistency and Confidence.
En: Advances in Neural Information Processing Systems 33 (NeurIPS 2020), tomo 33, 2020, págs. 596–608. URL https://procee dings.neurips.cc/paper/2020/hash/06964dce9addb1c5cb5d6e3d9838f733-A bstract.html. 2.3 [24] DE OLIVEIRA, Willian Dihanster Gomes y BERTON, Lilian. A comparative study of pre-processing algorithms for fair classification in few labeled data context. En: AI and Ethics, tomo 5, No 3, 2025, págs. 2881–2901. 2.3 [25] WANG, Yuemin y STAVNESS, Ian. Dynamic-budget superpixel active learning for semantic segmentation. En: Frontiers in Artificial Intelligence, tomo 7, 2025, pág.
1498956. 2.3
[26] BEN-DAVID, Shai, et al. A Theory of Learning from Different Domains. En: Machine Learning, tomo 79, No 1–2, 2010, págs. 151–175. 2.4, 3.4
[27] GANIN, Yaroslav y LEMPITSKY, Victor. Unsupervised Domain Adaptation by Backpropagation. En: Proceedings of the 32nd International Conference on Machine Learning (ICML). PMLR, 2015, págs. 1180–1189. URL https://proceedings.ml r.press/v37/ganin15.html. 2.4, 3.4 [28] WILSON, Garrett y COOK, Diane J. A Survey of Unsupervised Deep Domain Adaptation. En: ACM Transactions on Intelligent Systems and Technology, tomo 11, No 5, 2020, págs. 1–46. 2.4, 3.4 [29] GONZALEZ, Rafael C. y WOODS, Richard E. Digital Image Processing. 3a edición. Pearson Education, Upper Saddle River, NJ, USA, 2011. ISBN 9780133002324.
3.1, 3.1.1, 3.1.2
[30] OTSU, Nobuyuki. A Threshold Selection Method from Gray-Level Histograms. En: IEEE Transactions on Systems, Man, and Cybernetics, tomo 9, No 1, 1979, págs. 62–66. 3.1.1, 8 [31] HE, Lifeng, et al. The Connected-Component Labeling Problem: A Review of State-of-the-Art Algorithms. En: Pattern Recognition, tomo 70, 2017, págs. 25–43.
3.1.3
[32] GRANA, Costantino; BORGHESANI, Daniele y CUCCHIARA, Rita. Optimized Block-Based Connected Components Labeling with Decision Trees. En: IEEE Transactions on Image Processing, tomo 19, No 6, 2010, págs. 1596–1609. 3.1.3 [33] BOLELLI, Federico, et al. Spaghetti Labeling: Directed Acyclic Graphs for Block- Based Connected Components Labeling. En: IEEE Transactions on Image Processing, tomo 29, 2019, págs. 1999–2012. 3.1.3
[34] PORTER, Thomas y DUFF, Tom. Compositing Digital Images. En: Proceedings of the 11th Annual Conference on Computer Graphics and Interactive Techniques (SIGGRAPH ’84). ACM, 1984, págs. 253–259. 3.2 [35] REINHARD, Erik, et al. Color Transfer Between Images. En: IEEE Computer Graphics and Applications, tomo 21, No 5, 2001, págs. 34–41. 3.2.1 [36] GOODFELLOW, Ian; BENGIO, Yoshua y COURVILLE, Aaron. Deep Learning. MIT Press, Cambridge, MA, USA, 2016. ISBN 9780262035613. http://www.deep learningbook.org. 3.3, 3.3 [37] LONG, Jonathan; SHELHAMER, Evan y DARRELL, Trevor. Fully Convolutional Networks for Semantic Segmentation. En: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2015, págs. 3431–3440. 3.3.1 [38] RONNEBERGER, Olaf; FISCHER, Philipp y BROX, Thomas. U-Net: Convolutional Networks for Biomedical Image Segmentation. En: International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI), Lecture Notes in Computer Science, tomo 9351. Springer, 2015, págs. 234–241. 3.3.1 [39] CHEN, Liang-Chieh, et al. Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation. En: Proceedings of the European Conference on Computer Vision (ECCV), 2018, págs. 801–818. 3.3.2, 6.4 [40] CHEN, Liang-Chieh, et al. Rethinking Atrous Convolution for Semantic Image Segmentation. En: arXiv preprint arXiv:170605587, 2017. 3.3.2, 6.4 [41] HE, Kaiming, et al. Deep Residual Learning for Image Recognition. En: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016, págs. 770–778. 3.3.2, 6.4
[42] RUSSAKOVSKY, Olga, et al. ImageNet Large Scale Visual Recognition Challenge. En: International Journal of Computer Vision, tomo 115, No 3, 2015, págs. 211–252.
3.3.2, 6.4
[43] JACCARD, Paul. The Distribution of the Flora in the Alpine Zone. En: New Phytologist, tomo 11, No 2, 1912, págs. 37–50. 3.5 [44] EVERINGHAM, Mark, et al. The Pascal Visual Object Classes (VOC) Challenge. En: International Journal of Computer Vision, tomo 88, No 2, 2010, págs. 303–338.
3.5
[45] DICE, Lee R. Measures of the Amount of Ecologic Association Between Species. En: Ecology, tomo 26, No 3, 1945, págs. 297–302. 3.5 [46] BRADSKI, G. The OpenCV Library. En: Dr Dobb’s Journal of Software Tools,
2000. 6
[47] OPENCV TEAM. opencv-python: Wrapper package for OpenCV python bindings (software). Software disponible en https://pypi.org/project/opencv-python/,
2024. Accedido: 5 de junio de 2026. 6
[48] PYTHON SOFTWARE FOUNDATION. PyPI – The Python Package Index (sitio web). https://pypi.org/, 2024. Accedido: 5 de junio de 2026. 6 [49] PASZKE, Adam, et al. PyTorch: An Imperative Style, High-Performance Deep Learning Library. En: Advances in Neural Information Processing Systems 32 (NeurIPS 2019). Curran Associates, Inc., 2019, págs. 8026–8037. URL https: //papers.nips.cc/paper/9015-pytorch-an-imperative-style-high-perfo rmance-deep-learning-library. 6
[50] INTERNATIONAL TELECOMMUNICATION UNION. Studio encoding parameters of digital television for standard 4:3 and wide screen 16:9 aspect ratios. Recommendation ITU-R BT.601-7, ITU-R, Geneva, Switzerland, 2011.
URL
https://www.itu.int/rec/R-REC-BT.601-7-201103-I/en. 7
Cita: Morales-Acevedo, Sara (2026), Metodología para la construcción y etiquetado simultáneo de bases de datos masivas para el entrenamiento de CNNs, Universidad Tecnológica de Pereira, p. N. https://hdl.handle.net/11059/16891