Universidad de La Salle Universidad de La Salle Ciencia Unisalle Ciencia Unisalle Maestría en Gestión de la Información Documental Departamento de Estudios de Información
2023
Modelo de Big Data para la gestión documental en el área de Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA certificación Centro Agroecológico y Empresarial - SENA María Fernanda Méndez Cuellar Universidad de La Salle, Bogotá, mmendez09@unisalle.edu.co Manuel Augusto Vélez Felacio Universidad de La Salle, Bogotá, mavelez06@unisalle.edu.co Follow this and additional works at: https://ciencia.lasalle.edu.co/ maest_gestion_informacion_documental Part of the Archival Science Commons Citación recomendada Citación recomendada Méndez Cuellar, M., & Vélez Felacio, M. A. (2023). Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA. Retrieved from https://ciencia.lasalle.edu.co/maest_gestion_informacion_documental/33 This Tesis de maestría is brought to you for free and open access by the Departamento de Estudios de Información at Ciencia Unisalle. It has been accepted for inclusion in Maestría en Gestión de la Información Documental by an authorized administrator of Ciencia Unisalle. For more information, please contact ciencia@lasalle.edu.co.
Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA
María Fernanda Méndez Cuéllar Manuel Augusto Vélez Felacio
Tutor: John Agustín Riaño Díaz
Escuela de Humanidades y Estudios Sociales
Maestría en Gestión de la Información Documental
2023
Notas de autor
Este trabajo fue realizado con el apoyo de los profesores del programa de Maestría en Gestión de Información Documental de la Escuela de Humanidades y Estudios Sociales.
Cualquier inquietud respecto a este documento de investigación debe ser remitida al programa Maestría en Gestión de Información Documental de la Universidad de La Salle, Bogotá D.C., Colombia.
Agradecimientos
Damos gracias a Dios a la vida por poder alcanzar un peldaño más en la consecución de nuestras metas profesionales. Personal y laboralmente ha sido un periodo de arduo trabajo y sacrificios, Sin embargo, con la luz de su divina majestad hemos vislumbrado el camino y superado todos los obstáculos para poder culminar y presentar esta monografía de grado Es inevitable no sentir emoción al recordar el sacrificio, compañía y apoyo de nuestras familias, dado que, desde el primer momento, nos ha dado su fuerza y amor para afrontar todos y cada uno de los retos propuesto en esta maestría; Han sido el faro que guía nuestra esperanza, para vivir paso a paso cada uno de nuestros anhelos por alcanzar aquello que nos hemos propuesto, que no es más que ser unos profesionales con ética y valores.
Por último, un agradecimiento a todo el cuerpo de docentes y en especial, a nuestro tutor John Agustín Riaño Díaz y a la profesora Dra. Yamely Margarita Almarza Franco, quienes nos orientaron con su conocimiento y sabiduría en todo nuestro proceso de aprendizaje y de crecimiento profesional. Ellos han sido nuestra guía en el camino para alcanzar la meta y culminar nuestra formación superior para alcanzar el anhelado título de maestría en Gestión de la Información Documental de nuestra prestigiosa Universidad de la Salle.
Dedicatoria
Dios y familiares.
A Dios por concedernos la bendición y la gracia de la salud para poder afrontar y culminar este proceso de aprendizaje, por enviar a su santo espíritu para iluminar nuestras mentes y confortarnos en los momentos más difíciles.
A nuestras familias por ser ellas el motor que nos ha dado fortaleza para no desfallecer en los movimientos más álgidos en este camino recorrido y porque ellos son nuestra razón de ser y alcanzar cada día una nueva meta.
Tabla de Contenido
Resumen ........................................................................................................................................ 10 Abstract ......................................................................................................................................... 11 INTRODUCCIÓN ........................................................................................................................ 12 CAPITULO I: PROBLEMA DE INVESTIGACIÓN .................................................................. 13
1.1
Descripción del problema............................................................................................... 13 1.2 Objetivos ............................................................................................................................. 18 Objetivo General .................................................................................................................... 18 Objetivos Específicos ............................................................................................................ 18
1.3
Justificación de la investigación ..................................................................................... 18 CAPITULO II: MARCO TEÓRICO ............................................................................................ 21 2.1 Antecedentes de investigación ............................................................................................ 21 2.2 Estado del arte ..................................................................................................................... 27 2.3 Categorías Conceptuales ..................................................................................................... 38 2.4 Contexto Institucional ......................................................................................................... 45 CAPITULO III: MARCO METODOLÓGICO ............................................................................ 52 3.1 Enfoque ............................................................................................................................... 52 3.2 Tipo de investigación .......................................................................................................... 53 3.3 Método ................................................................................................................................ 53
3.4 Técnicas ............................................................................................................................... 55 3.5 Instrumentos ........................................................................................................................ 57 3.5.2 Cuestionario ..................................................................................................................... 58 3.6 Fases de la investigación ..................................................................................................... 59 CAPITULO IV: ANÁLISIS Y DISCUSIÓN DE RESULTADOS .............................................. 62 4.1. Matriz de Análisis .............................................................................................................. 62 4.2 Cuestionario ........................................................................................................................ 79
CAPITULO V: REQUERIMIENTOS FUNCIONALES DEL MODELO DE BIG DATA PARA
LA GESTIÓN DOCUMENTAL .................................................................................................. 97 5.1 Para el modelo de Big Data para la gestión documental ................................................... 100 5.2 Para el modelo de Big Data para la gestión documental en el CAE ................................. 102 5.3 Modelo de Big Data para la gestión documental en el área de certificación .................... 104 CONCLUSIONES ...................................................................................................................... 110 RECOMENDACIONES ............................................................................................................. 114 REFERENCIAS .......................................................................................................................... 117 ANEXOS .................................................................................................................................... 126 Anexo 1: Matriz de análisis ..................................................................................................... 126 Anexo 2: Cuestionario ............................................................................................................. 128 Anexo 3: Carta de autorización ............................................................................................... 134 Anexo 4: Consentimiento informado ...................................................................................... 136
Tabla de Figuras
Figura 1 Bodega de datos - Esquema de estrella .......................................................................... 31 Figura 2 Proceso de extracción, transformación y carga (ETL) ................................................... 32 Figura 3 Herramientas de extracción de datos .............................................................................. 37 Figura 4 Organigrama del SENA .................................................................................................. 47 Figura 5 Estructura orgánico-funcional de CAE .......................................................................... 51 Figura 6 Fases de investigación .................................................................................................... 61 Figura 7 Modelo ETL ................................................................................................................... 63 Figura 8 Ecosistema Hadoop ........................................................................................................ 77 Figura 9 Modelo de estructuración de datos ................................................................................. 78
Tabla de gráficos
Gráfico 1: Primera pregunta .......................................................................................................... 80 Gráfico 2: Segunda pregunta ........................................................................................................ 82 Gráfico 3: Tercera pregunta .......................................................................................................... 84 Gráfico 4: Cuarta pregunta ............................................................................................................ 85 Gráfico 5: Quinta pregunta ........................................................................................................... 86 Gráfico 6: Sexta pregunta ............................................................................................................. 88 Gráfico 7: Séptima pregunta ......................................................................................................... 89 Gráfico 8: Octava pregunta ........................................................................................................... 91 Gráfico 9: Novena pregunta .......................................................................................................... 93 Gráfico 10: Decima pregunta ........................................................................................................ 95 Gráfico 11: requerimientos funcionales del modelo de Big Data para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial – SENA .................................... 109
Tabla de tablas
Tabla 1Matriz comparativa de modelos de arquitectura Big Data ............................................... 66
Resumen
Se plantea la necesidad de controlar la creación y uso de los documentos físicos y electrónicos para preservar la memoria documental del área de certificación del Centro Agroecológico y Empresarial. El objetivo es proponer un modelo de Big Data para la gestión documental que permita recoger toda esa información dentro de los repositorios; organizarla, organizarla y analizarla con el fin de evitar que loa información termine perdiéndose, lo que ocasiona graves problemas a la Institución en la expedición de certificaciones y en la desaparición de acervo documental importante para poder medir la cantidad de solicitudes, sexo, edades y programas a los que pertenecen. Por lo anterior, es necesario caracterizar los modelos de Big Data que aporten a la gestión documental valor agregado para los procesos de identificación de la información y su utilización. Es necesario hacer un diagnóstico el uso actual de la Big data en la gestión documental del área de certificación del Centro Agroecológico y Empresarial – SENA para determinar cuáles son las falencias en este aspecto y así poder diseñar los requerimientos funcionales del modelo, mediante herramientas que sean apropiadas para el desarrollo de la búsqueda de información en el Big Data.
Palabras claves Requerimientos funcionales, análisis de datos, servicios de información, Centro Agroecológico y Empresarial, Servicio Nacional de Aprendizaje.
Abstract
There is a need to control the creation and use of physical and electronic documents to preserve the documentary memory of the certification area of the Agroecology and Business Center. The objective is to propose a Big Data model for document management that allows collecting all this information within the repositories; organize it, organize it and analyze it in order to prevent the information from being lost, causing serious problems for the institution in the issuance of certifications and the disappearance of important documentary heritage to measure the number of applications, gender, age and programs to which they belong. Therefore, it is necessary to characterize the Big Data models that provide added value to document management for the processes of information identification and its use. It is necessary to make a diagnosis of the current use of Big Data in the document management of the certification area of the Agroecological and Business Center - SENA to determine what are the shortcomings in this aspect and thus be able to design the functional requirements of the model, through tools that are appropriate for the development of the search for information in Big Data.
Keywords Functional requirements, data análisis, information services, Centro Agroecológico y Empresarial, Servicio Nacional de Aprendizaje
INTRODUCCIÓN
La presente investigación analiza las necesidades pata analizar y almacenar grandes cantidades de información en el área de certificación del Centro Agroecológico y Empresarial (CAE) a través de la utilización de herramientas de Big Data, es necesario que las herramientas que permitirán la extracción, recuperación, y análisis de los datos y transformación en información útil para el desarrollo de las actividades, no solo del área en mención, sino también de todo el Centro, cuenten con características que permitan la interoperabilidad e interacción con los usuarios que serán los encargados de su manejo y que los resultados de los procesos apunten a la recuperación de información que permita la continuación y mejora de los procesos de atención a los aprendices, permitiéndoles acceder a la información requerida.
Actualmente el CAE desconoce el estado actual del almacenamiento y análisis de su información de sus aprendices y egresados. La información que se encuentra en dispersa en variedad de sistemas de información, decir, presentan datos estructurados, semi estructurados y no estructurados, lo cual afecta los procesos y procedimientos del área de certificación al no contar con la información adecuada para mantener las relaciones con otras áreas (autoevaluación y currículo). Diversos aspectos relacionados con el procesamiento, tratamiento y análisis de información se ven retrasados y obstaculizados por la falta de integración de los sistemas para dar respuesta oportuna.
El desarrollo de esta investigación se da el fin de proponer un modelo de Big Data para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial - SENA, que oriente los procesos y procedimientos realizados en cada una de las áreas a partir de la integración de múltiples fuentes de datos.
CAPITULO I: PROBLEMA DE INVESTIGACIÓN
1.1 Descripción del problema
A pesar de la inversión institucional y del interés por potenciar el control, organización y clasificación de los documentos en los sistemas de gestión documental, mediante el uso de nuevas tecnologías, existen todavía una gran cantidad de datos que no han sido catalogados y depurados, que pueden ser de utilidad a los gestores documentales como el Sistemas de Gestión de Documentos Electrónicos de Archivo (SGDEA), para satisfacer la necesidad de gestionar la información que se encuentra en el Big Data. Según Vargas Guzmán, W. et al. (2021) “las entidades del Estado están obligadas a disponer de su información, así como a desarrollar programas tecnológicos que les permitan recuperarla, identificarla, soportarla, almacenarla y protegerla.” (p. 3).
Lo anterior da a entender que, es necesario de hacer grandes inversiones en tecnología para conectarlos con la realidad del presente tecnológico que nos presenta grandes retos en materia de búsqueda y utilización de nuevas formas de gestión de la información. Por lo tanto, es esencial que no se improvise a la hora de aprovechar las oportunidades que ofrecen las herramientas que permiten la extracción efectiva de los datos que se encuentran dispersos en el Big Data. Por otro lado, (Moyano, 2015) afirma que un proyecto de servicios Big data requiere una estrategia que marque y defina los datos a gestionar, el objetivo de su almacenaje y la finalidad de su procesamiento. Estos servicios precisan de potentes infraestructuras que permitan el desarrollo de servicios acordes con la masa de datos e información tratada y por incrementar. (p. 50) También se debe tener en cuenta que, como lo indica García Juan, L. et al. (2017) “Vivimos en una sociedad donde el grado de penetración de la tecnología en todas las áreas va en aumento. Hoy
no entenderíamos nuestra vida sin un móvil, sin las redes sociales” (p. 5). La archivística convencional está paso a paso, no solo a la organización y la preservación del documento en formato papel o electrónico, sino también a las redes sociales, los correos electrónicos, los mensajes de texto, etc. y ahora a la recuperación, análisis y organización de los millones de datos que estas tecnologías generan cada segundo. Las entidades públicas y privadas generan también una gran cantidad de información institucional que debe ser recuperada sacándole el mayor beneficio posible para la identificación de necesidades internas y externas y la mejora de los servicios.
Para Rodríguez, (2016), la importancia del Big Data no solo es utilizada por los profesionales de la información, sino que también es aprovechada por gerentes y encargados de los procesos de negocio en las organizaciones parara sus procesos de negocio y poder entender los gustos y necesidades de los usuarios. El crecimiento exponencial de la información en todos sus formatos ha dado como resultado que las formas tradicionales de tratamiento de la información de paso a una analítica que sea manejada con nuevas y poderosas herramientas de búsqueda y procesamiento de la información. (p. 12). El concepto de Big Data entra en escena por la evolución natural de estos sistemas, es ahí donde los archivos deben incursionar por medio de este medio para el análisis de datos estructurados y no estructurados que puedan ser almacenados y utilizados dentro de una entidad u organización.
Dado lo anterior, existe herramientas como por ejemplo Apache Hadoop que permite el almacenamiento de grandes cantidades de datos o Apache Storm que procesa flujos constantes de datos, entre otras, que pueden servir para implementar un modelo de búsqueda, análisis y almacenamiento de datos disponible en la web, que permitirá a las áreas de gestión documental
acceder información relevante para la toma de decisiones con respecto a sus servicios y a la atención de sus usuarios. Perfetti, (2017), como se citó en Vargas Guzmán, W. et al. (2020) afirma, Por esto, es imperativo que las entidades implementen un gestor documental o sistema de gestión de documentos electrónicos de archivo (SGDEA), que es un software encargado de controlar y organizar los documentos electrónicos, tanto las evidencias de la ejecución de las actividades del negocio como los documentos de valor informativo”. (p. 6) En este sentido, un gestor documental permite el acceso, consulta y disponibilidad de la información que, aunado a la recopilación de datos en la Big Data, posibilita el acceso a información relevante para la toma de decisiones y la preservación de los documentos, lo cual permite que esta pueda ser aprovechada por una organización o entidad. La integración de datos es importante a la hora de centralizar una gran cantidad de información con una amplia variedad de temáticas que presentan vacíos en la información, duplicidad e inconsistencias y para las que se deben utilizar herramientas que permitan diferenciar una gran cantidad de requerimientos de calidad, disponibilidad, validez, extensión y formato. (López et ál., 2004, p. 12). La preocupación sobre la gran cantidad de datos que se procesan con la certificación de aprendices en el área de certificación del Centro Agroecológico y Empresarial - SENA y la necesidad de recopilarlos y gestionarlos adecuadamente, hace necesario contar con una herramienta que permita hacer minería de datos para la recuperación de la información para evitar la pérdida de la memoria institucional y de información relevante sobre los aprendices y sobre su nivel de formación. Es importante que se pueda integrar un modelo tecnológico que facilite esa transformación y que permita el manejo eficiente de la información que se genera en otras sedes y programas que el SENA tiene a nivel nacional; todo ese conocimiento adquirido durante años es
de gran importancia para potenciar modelos educativos similares que sean asequibles y permitan un mayor desarrollo de las comunidades.
Es importante tener en cuenta que la utilización de herramientas convencionales de explotación de la información como lo son los motores de búsqueda que permiten acceder datos almacenados en servidores web, tiene sus limitaciones a la hora de hacer una búsqueda efectiva y recopilación de información. Por eso existen herramientas como Apache Hadoop, Cloudera o Snowflake, entre otros, que permiten el almacenamiento de grandes volúmenes de datos; así como el análisis y procesamientos de estos en el entorno del Big Data; otra herramienta eficiente y que puede ser de utilidad para nuestro caso es Apache Storm, que procesa los grandes flujos de información, sobre todo en las redes sociales, lo que permitiría extraer la información de internet. Se hace necesario que las áreas de gestión documental puedan aprovechar la información que está a la espera de ser explotada y que le daría un nuevo impulso a la búsqueda de conocimiento en un mundo donde la desinformación y distorsión de la realidad, del pasado presente y futuro, problemática que nos atañe a los profesionales de la información, es por eso que es importante que mediante iniciativas como la que plasmamos en esta monografía, puedan servir de ejemplo y de toma de decisiones para la implementación de un modelo de Big Data y la utilización de sus herramientas que permitan la recuperación, explotación y análisis de la información que pueda ser susceptible de ser utilizada por una entidad o empresa.
Según Palma Villalón, M. (2015) “con la llegada del Big Data y el Content Data, los gestores de documentos deberán asumir la gran responsabilidad de definir qué datos, información o documentos electrónicos se clasificarán, conservarán, eliminarán o preservarán como registros digitales desde esta perspectiva” (p. 5), es decir, los profesionales de la información debemos dar el paso hacia la divulgación e implementación del Big Data como una solución a la problemática
que hoy por hoy aqueja a las a os archivos documentales en el manejo de los grandes volúmenes de información. La información que no se aprovecha es una pérdida de oportunidades y de conocimiento que está a la mano de quien quiera explotarla y utilizarla. Para un país como el nuestro, que tiene un sistema de archivos respetable, que se queda corta a la hora de explotar los datos que se encuentran en el Big Data. Lo anterior supone un reto para los profesionales de la información, que ya deben de pensar en los formatos análogos y buscar nuevas alternativas, más globales y que permitan el acceso a la información. La apuesta por mejorar los procesos archivísticos sintetiza la necesidad que desde instituciones como el SENA se manifiesta para la toma de decisiones con el potencial que tiene la información que se encuentra en el Big Data. Por otro lado, como lo afirma Moyano, J. (2015):
Crear un portal de transparencia o sistema de gestión documental puede hacerse con mayor o menor éxito, en el caso de proyectos Big Data más de la mitad de sus desarrollos fracasan, debido sobre todo a la falta de comunicación entre los directores y sus desarrolladores. (p. 54) Esto nos indica que es posible que se encuentren obstáculos a la hora de implementar un proyecto de Big Data encaminado a, en el caso Centro Agroecológico y Empresarial – SENA, la recuperación de la información relevante para las certificaciones en el área de gestión documental que si no se tiene el apoyo de la alta gerencia y si no se toman todas las medidas para que no hayan errores en la implementación y puesta en marcha de un desarrollo basado en herramientas para la utilización del Big Data, se puede incurrir en que se deba comenzar desde cero. Esto implicaría sobre costos y una posible pérdida de información valiosa.
Pregunta de investigación
¿Cuál es el modelo de Big Data apropiado para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial - SENA?
1.2 Objetivos
Objetivo General Proponer un modelo de Big Data para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial - SENA Objetivos Específicos
• Caracterizar los modelos de Big Data para la gestión documental del área de certificación
del Centro Agroecológico y Empresarial
• Diagnosticar el uso actual de la Big data en la gestión documental del área de certificación
del Centro Agroecológico y Empresarial – SENA
• Diseñar los requerimientos funcionales del modelo de Big Data para la gestión documental
en el área de certificación del Centro Agroecológico y Empresarial – SENA
1.3 Justificación de la investigación
Una de las preocupaciones de la gestión de información documental actualmente desde el punto de vista del almacenamiento es que las entidades carecen de los recursos para invertir en infraestructura de seguridad o no ven el verdadero valor de almacenar la información, lo que puede generar perdida de información histórica por deterioro o perdida de los documentos, control sobre los documentos, veracidad de la información del área de certificación del Centro Agroecológico y Empresarial. La contribución de la presenta investigación a la gestión de información documental se basa en la correcta administración y gestión de documentos, fundamentada en los principios de
la teoría archivística (a saber, orden original y procedencia). Centralizar el análisis de información en estos principios permite asegurar la transparencia, la eficacia, la eficiencia, la facilidad de consulta y la integridad, como eje transversal de las tecnologías de información en pro del cumplimiento de los procedimientos archivísticos para el correcto almacenamiento de los documentos.
En el sector publico los sistemas de gestión de documentos electrónicos de archivo aportan en la validación de los aportes significativos del Big Data para satisfacer las necesidades de gestión de información integrante el análisis y la interoperabilidad de las evidencias. Puesto que el volumen exponencial de la información y el crecimiento de datos generados en las entidades públicas, se puede considerar que los archivos, independientemente de su soporte, son parte fundamental de toda la entidad, puesto que almacenan la memoria de la organización. Por consiguiente, el Centro Agroecológico y Empresarial está obligado a disponer de su información, así como a desarrollar programas tecnológicos que les permitan recuperarla, identificarla, soportarla, almacenarla y protegerla.
De acuerdo con lo anterior, se identifica la necesidad de administrar adecuadamente grandes volúmenes de datos en el proceso de certificación de aprendices en cada una de las modalidades de formación. Al consultar fuentes primarias, se encontró que el desarrollo de herramientas tecnológicas es una preocupación cotidiana del área. Aunque las tecnologías diseñan programas o herramientas, necesitan trabajo colaborativo para ejecutar este tipo de labores, en este caso, la gestión documental. En este orden de ideas, se considera necesario que la gestión documental se incorpore a la tecnología del Big data, de una forma que permita a estos procesar, identificar, almacenar, analizar y describir enormes cantidades de datos (estructurados, no estructurados y semiestructurados). La tecnología es vital para el correcto funcionamiento e implementación de la
herramienta, ya que además de recuperar y analizar la información, permitirá realizar una correcta gestión documental, donde prime la preservación y el almacenamiento de los documentos que hacen parte de una organización.
Un manejo adecuado de la información y los documentos que la contienen permite que la entidad, tenga los elementos necesarios para enfrentarse a los grandes retos de los actuales mercados globalizados a fin de ser sostenibles y competitivas, para dar respuesta a las necesidades de sus grupos de valor. Un modelo de Big Data es un sistema de información en constante evolución y crecimiento que atiende a la complejidad de la modernidad e involucra la generación de valor para las organizaciones y las personas, es decir, es un proceso informativo en desarrollo y evolución constante del cual se espera obtener un rendimiento productivo acorde con la era digital y del conocimiento en la cual se encuentra ubicada la sociedad moderna. Dado lo anterior, este tipo de investigaciones se justifica porque es necesario conocer a nivel global que elementos e ideas se han establecido como parte de nuevos contextos entre la gestión documental y la Big data, con el fin de establecer lineamientos para la aplicación del Big Data en gestión documental para el área de certificación. El objetivo más importante en la entidad es generar cultura frente a la gestión documental y el manejo adecuado de la información, ya que esta es el área que realmente requiere un cambio estratégico. El desarrollo de las habilidades en el procesamiento de información apoya el proceso de captura de la data y las relaciones directas con los objetivos de la entidad que fueron propuestos en la construcción del negocio.
CAPITULO II: MARCO TEÓRICO
2.1 Antecedentes de investigación
Los antecedentes tomaron como base investigaciones producidas en los últimos 5 años sobre temas relacionados con Big Data, unidades de información, sistemas de gestión documental, análisis métrico, gestión por procesos ante la necesidad de obtener un mayor grado de conocimiento sobre el concepto de Big Data y su relación con el ámbito de la gestión documental. Al respecto se pueden ubicar investigaciones en Colombia, Perú, España, Chile, Ecuador, dirigidas a identificar el trabajo que a nivel institucional se desarrolla para la aplicación de un modelo de Big Data y sistemas de gestión documental. Lo cual define el Big Data como la integración de paradigmas y enfoques a partir del tratamiento de datos con buenos tiempos de respuesta, que van asociados a las necesidades de los recursos físicos de elevado alcance y costo. Ante esto Taborda Ramírez & Arboleda Taborda (2021) señalan en su investigación “Propuesta de Roadmap Tecnológico para Data UdeA, a partir de la valoración de su uso por parte de los usuarios. Modalidad Consultoría”, plantea como objetivo principal de esta investigación “Proponer un Roadmap a partir de la valoración de Data UdeA, desde la perspectiva de los usuarios en los ámbitos de uso, calidad e impacto de la información que proporcione un incremento en la utilización de los datos en la gestión universitaria y proyección estratégica de la herramienta”, cito como principal referente teórico Bartling y Friesike (2014), que define el concepto de “sombrilla” en la ciencia abierta. El diseño metodológico se centró en la consultoría, y se desarrolló basado en un alcance descriptivo explicativo a través de un enfoque mixto, las técnicas de investigación implementadas fueron la encuesta y la entrevista semiestructurada, para aplicar un cuestionario como instrumento de recolección de información.
Los resultados permiten evidenciar que la implementación del ejercicio de vigilancia tecnológica y prospectiva estratégica para la Data UdeA, como una herramienta que aporta las mayores ventajas competitivas en comparación con plataformas que cumplen funciones simulares, la evidencia se logra a partir del análisis de una brecha tecnológica entre Data UdeA y otras instituciones educativas a nivel local y nacional.
Una de las principales conclusiones con relación al Ministerio de Tecnologías de la Información y las Comunicaciones de Colombia (MinTIC), se da por el ciclo de los datos, el cual no es suficiente para las instituciones en el desarrollo de las plataformas y gestión de datos universitarios. Como principal aporte a esta investigación se da en el avanzado crecimiento de las tecnologías de Big data e inteligencia artificial por el monitoreo en avances, tendencias y aplicaciones en la gestión de datos que se utilizan en la toma de decisiones de las organizaciones con el fin de lograr un direccionamiento estratégico adecuado.
Para complementar la implementación del Big data en unidades de información la autora Almora Castro (2018), en su investigación “Análisis y usos del Big data aplicado en la Universidad Nacional “San Luis Gonzaga” de ICA: caso facultad de Ingeniería de sistemas” que determino como objetivo general “Entender con mayor amplitud al Big Data como nueva tecnología para grandes volúmenes de datos, que herramientas están relacionadas con él, así como el alcance de los datos para que sean aprovechados correctamente”. Cito como principales referentes teóricos a Rojas García (2016), propone un modelo de negocios basado en Big Data que facilite la integración de los datos; y Hernández Leal (2016), propone la aplicación de técnicas de análisis de datos y administración de Big Data ambientales. Esta investigación es transversal y un diseño basado en un nivel es exploratorio se tendrá para el mismo un diseño no experimental.
Las principales conclusiones, la comunidad en general cuenta con grandes rasgos conocimiento sobre Big Data, sin embargo, las herramientas y aplicaciones que se implementan para el manejo de grandes cantidades de información es muy poco. Tomo como grandes aportes para esta investigación porque establece el modelo de Big Data para gestionar los datos almacenados en un dispositivo a través de una capa abstracta en el dispositivo físicos; lo permite visualizar el manejo de los recursos de datos e implementar arquitectura de datos, lo cual influye en la reducción de los costos computacionales y la reutilización de los datos. La capa de aplicaciones y la capa física se encuentran en el modelo de Big Data. Los autores Borja Suarez & Malagón Cárdenas (2017) en su investigación “Diseño del sistema de gestión de documentos electrónicos de archivo. Estudio de caso: Baker McKenzie” definen como objetivo general “Proponer el diseño del sistema de gestión de documentos electrónicos de archivo para la oficina en Bogotá de la multinacional de servicios jurídicos Baker McKenzie, a partir del conocimiento, análisis de las necesidades y requerimientos de información documental electrónica; con el propósito de establecer la ruta a seguir que le permita a la Firma mejorar la gestión de los documentos electrónicos utilizados en cumplimiento del objeto de sus negocios. Cita como principales referentes teóricos a Nelson Javier Pulido quien afirma que, “los modelos que mayor desarrollo han alcanzado y que son referencia para el diseño de otros modelos”. (Pulido, 2011; p. 45) También, Records Continuum (Australia), parte del principio de continuidad del documento, en donde como lo define José Ramón Cruz “no existen etapas separadas en la vida de los documentos, como enfatiza en el ciclo de vida, sino que es una continuidad y, en consecuencia, la gestión de los documentos debe ser contemplada como un proceso continuado”. (Cruz, 2006; p.
21)
Su principal conclusión fue “La importancia de la aplicación de los principios archivísticos en la gestión de documentos electrónicos disminuye la pérdida de la memoria institucional dado el crecimiento de documentos electrónicos en todo tipo de empresas” (Cruz, 2006; p. 21). Esta investigación es muy relevante para la nuestra ya que cada vez existe un mundo más globalizado, la información debe ser veraz, oportuna y estar disponible a un clic para la toma de decisiones, esto se logra con el cumplimiento de estándares internacionales y la implementación de las mejores prácticas en el manejo de la información a través de un modelo de Big Data. El autor Vaca Albán (2017) en su investigación “El uso de Big data y su incidencia en la calidad de los servicios académicos de la Universidad Técnica de Ambato” define como objetivo general “Establecer la incidencia del Big Data en la determinación de la calidad de los servicios académicos de la Universidad Técnica de Ambato”. Cita como principales referentes teóricos Kozinets, (2002), para quien el funcionamiento de los sistemas de información son producto de los datos y Osorio Rivera (2008), define sistema de gestión de bases de datos. El diseño metodológico se centró en una investigación cuantitativa porque utiliza parámetros de medición de las opiniones en Big Data, a través de una modalidad de investigación bibliográfica y de campo, basada en el tipo de investigación exploratoria, descriptiva, explicativa y correlacional. Como principal conclusión que toda la información contenida en el Big Data no es clasificable de forma manual, debido a la gran cantidad de información de diferente tipo por parte de la comunidad estudiantil, desde miles de opiniones válidas, serias y constructivas, hasta miles de opiniones subjetivas, irónicas, sarcásticas, mal intencionadas disfrazadas de comentarios. La implementación del modelo de Big data que se busca para esta investigación enmarca que la gran cantidad de información que se genera a diario en las redes sociales como fuente de información permiten el mejoramiento continuo con base en críticas constructivas, en donde las decisiones
erróneas principalmente se dan por el enorme volumen de información, al no poder ser clasificado de manera correcta al requerir de gran numero de personal especializado, esto genera mayor disponibilidad de tiempo y mas costos, lo que produce información no confiable. La autora Hernández Leal (2016), en su investigación “Aplicación de técnicas de análisis de datos y administración de Big Data ambientales”, determina como objetivo general “Proponer y validar un modelo de administración y análisis de datos ambientales (meteorológicos e hidrometeorológicos) generados por estaciones de monitoreo ambiental, a través de la utilización de Big Data y de técnicas de inteligencia artificial, para mejorar la toma de decisiones y la generación de alertas tempranas por medio de la predicción de comportamientos”. Cita como principales referentes a Adell & Guersenzvaig, (2013), define el termino Big Data, George, Haas, & Pentland, (2014), describe las diferentes tipologías de datos y Talburt & Zhou, (2015), determina las dimensiones de Big Data. El análisis de resultados de la investigación permite realizar un análisis de datos relevante en la toma de decisiones o para entendimiento de los fenómenos que se presentan en las tipologías de datos en los modelos por capas.
Como conclusión principal se presenta, un enfoque de Big data desde las tecnologías de grandes oportunidades, nuevos retos de adaptación y reutilización de los dominios de datos, como materia de investigación y discusión. A pesar de que las aplicaciones generalmente no cubren las 4V (volumen, veracidad, variedad y velocidad), el enfoque Big Data relaciona facetas de las nuevas características de los datos que se generan permanentemente. El principal aporte de esta investigación para la nuestra es la versatilidad del tratamiento de datos a partir del Big data con un enfoque interoperable de diferentes tecnologías: almacenamiento, análisis y visualización de grandes volúmenes; como resultado de diferentes fuentes de información que no pueden ser tratadas tradicionalmente.
El autor chileno Villalobos Luengo (2016), en su investigación “Análisis de archivos Logs semiestructurados de ambientes Web ustecnologías Big-Data”, presenta como objetivo general “diseñar e implementar métodos extensibles de procesamiento de información semiestructurada, proveniente de la integración de múltiples logs de ambiente web, con el fin de obtener conocimiento relevante para la organización”. Referencia como principal teórico a John Gantz (2012), que orienta los lineamientos universales del Big Data. Esta investigación concluyo que es linealmente escalable a partir del conjunto de pruebas escalabilidad. Es decir, el rendimiento que dan los métodos desarrollados es proporcionales con los números de los nodos que involucran al clúster de procesamiento, cuando el clúster esta conformado por 4 nodos y se agrega el doble se dobla el rendimiento. Para nuestra investigación establece la importancia del uso de estas tecnologías entrega la flexibilidad de no preocuparse por la estructura que poseen los archivos, sino por el proceso de análisis, es decir, la cantidad de nodos de procesamiento es menos flexible que la capacidad de la tecnología. Las investigaciones antes mencionadas, se puede evidenciar que la gestión de los datos debe entenderse como una maquinaria donde se introducen datos, se explotan y transforman y, como consecuencia de estos procesos a los que son sometidos, se extraen indicadores para una adecuada toma de decisiones. Todas las tesis mencionadas anteriormente evidencian la evolución en la implementación del Big data, que muestra la importancia de integrar gestión documental con tecnologías de la información y comunicación con ayuda de la automatización de procesos,de una forma que permita a estos procesar, identificar, almacenar, analizar y describir enormes cantidades de datos (estructurados, no estructurados y semiestructurados).
Ahora bien, “la importancia del Big data radica no solo en la facilidad de manejo del volumen de datos, sino en la variedad de estos”. (Duque-Jaramillo y Villa Enciso, 2017, p. 5) Por
consiguiente, esta tecnología es vital para el correcto funcionamiento e implementación de la herramienta, ya que además de recuperar y analizar la información, permitirá realizar una correcta gestión documental, donde prime la preservación y el almacenamiento de los documentos que hacen parte de una organización.
2.2 Estado del arte
Este estado del arte es el resultado de la revisión de artículos científicos, de las bases de datos Scopus, Web of Science, entre otras, especializadas con el problema de investigación, para analizar la información desde sus fortalezas, y aportes a otras investigaciones, así mismo, se evidencio que alrededor del 80% de las publicaciones son en idioma inglés, en las publicaciones de los últimos 10 años. Sin embargo, también se ha visto referencias y artículos relacionados en España, donde se puede ver el interés y el estudio sobre este tema.
También, se ha realizado una clasificación a través de una línea cronológica de los artículos científicos consultados afines con el tema de Big Data y que dan una idea de cómo ha evolucionado este concepto. En este compendio, de igual manera se hallan los artículos relacionados con el diseño de los modelos de almacenamiento y análisis de datos, asimismo, los artículos relacionados con el análisis de grandes cantidades de datos.
Según Diebold, F. (2012), el termino Big Data (grandes datos) fue acuñado en la década de los 90 por John Mashey y otros en Silicon Graphics, quienes hicieron un trabajo sobre este tema que jamás fue publicado y que no tubo relevancia académica. Posteriormente se hacen referencias académicas por parte de Weiss e Indurkhya (1998) en informática, Diebold (2000) en estadística/econometría (p. 2).
Sin embargo, como lo refiere Kulshrestha, S. (2015), en 1997, dos científicos de la NASA, Michael Cox y David Ellsworth, utilizaron el término Big Data en su artículo "Applicationcontrolled demand paging for out-of-core visualization" (p. 1). Mientras explicaban el problema que tenían con los gráficos por ordenador, afirmaban que "proporciona un reto interesante para los sistemas informáticos: los conjuntos de datos suelen ser bastante grandes, lo que pone a prueba la de la memoria principal, el disco local e incluso el disco remoto. Llamamos a esto el problema de los Big Data (grandes datos)".
Los dos artículos dan una referencia de dos momentos y contextos en los cuales se definió lo que es Big Data y la importancia de poder explotar esa gran cantidad de datos que proceden, como lo afirma Becerra, J. (2018) de “billones de whatsapps, correos electrónicos, contenidos en Facebook y Twitter, búsquedas en Google y videos en Youtube se generan por la navegación en internet, las comunicaciones del internet de las cosas, las comunicaciones entre máquinas, industrias, estaciones meteorológicas, etc.” (p. 41).
Laney, D. (2001) define “la gestión de datos en tres dimensiones: volumen, velocidad y variedad”, donde “las organizaciones de TI deben recopilar varios enfoques para tener a su disposición para hacer frente a cada uno de ellos”. (p. 1). Se pude afirmar que en Big Data se conjugan estas características que le dan a los datos una medida e importancia a la hora de analizar la información extraída, así como el valor que esta pueda tener par la toma de decisiones y la escalabilidad del negocio.
El uso intensivo del Big Data se hace mayoritariamente en compañías digitales donde es crítico el análisis para poder tocar al ‘cliente virtual’. Estas compañías han conseguido ventajas competitivas que les ha situado en posiciones dominantes en el mercado, el caso de Amazon es un ejemplo. Este tipo de empresa, con organizaciones generalmente más horizontales y
multidisciplinares, favorecen la adaptación y flexibilidad necesarias para el cambio y adopción de iniciativas multifuncionales. Porque si pensamos en el ROI, un proyecto Big Data debe ser multifuncional, desde marketing hasta finanzas, si no, se caerá en una iniciativa en silo costosa y poco eficaz. No existe un problema tecnológico, la tecnología está. Es más bien un problema de transformación digital y restructuración de las organizaciones.
El aumento en el volumen de datos manejados en el mundo digital se evidencia a partir del año 2005, esto da paso al nacimiento de la Web 2.0 y cuyo contenido es proporcionado por sus propios usuarios en lugar de por los prestadores de servicios. Para el año 2008 se procesaron aproximadamente 9,57 zetabytes de información en las CPUs a nivel mundial y que a partir de ese momento se producirán 14,7 exabytes de información nueva cada año. En 2014 el uso de Internet a través de dispositivos móviles supera por primera vez al de los ordenadores personales y el análisis de grandes volúmenes de datos se convierte en una prioridad para el sector de las tecnologías de la información y la comunicación (Hernández, A, 2020, p. 44). Lo anterior es importantes, porque si debemos pensar en la utilización de herramientas para la búsqueda y procesamiento de datos en el Big Data, para el caso de los archivos, es necesario tener en cuenta que ya no se habla de los archivos tradicionales, sino que se debe tener en cuenta el manejo que se le debe dar a las nuevas tecnologías y el impacto que esto genera para gestión documental que ya no se puede limitar a los formatos tradicionales sino que también tiene girar en función de otros modelos de información.
El autor Gartner (2019), autor colaborativo de varios artículos, con un índice de citación alto, identifico tres tendencias que describen la capacidad de la gestión de la información para transformar los procesos de negocio en los próximos años:
Para el año 2020, la información se utilizará para reinventar, automatizar o eliminar el 80% de los procesos de negocio y productos de la década actual. El desarrollo del internet de las cosas proporcionará nuevos tipos de datos en tiempo real que suministran información a la cadena de valor y mayor facilidad a la automatización de los procesos con decisiones programadas, que genera grandes cantidades de datos para análisis a partir de la tecnología Big Data.
En 2027, más del 30% de las empresas accederán a un amplio Big Data a través de intermediarios de servicios de datos que añadirán contexto a las decisiones de negocio. El negocio digital cada vez más exigirá tiempo real. Para poder anticiparse, las organizaciones deberán saber que pasa dentro y fuera, y la información actual no es suficiente. Se necesita el contexto para soportar las exigencias del negocio digital. Un contexto muy disperso y voluminoso, distribuido en cientos de miles de web, dispositivos y medios sociales. En 2027, más del 20% de las evaluaciones que los clientes realicen sobre los productos aprovecharán el internet de las cosas. (p. 105).
Duque-Méndez, N. D., Orozco-Alzate, M., & Vélez, J. J. (2014), autores más representativos en el tema de modelos de almacenamiento afirman que “el desarrollo de un modelo conceptual para la creación de una bodega de datos no estructurados, que sigue un esquema en estrella y con el fin de aplicar análisis OLAP (On-Line Analytical Processing) para determinar algunos patrones y descubrir relaciones entre las variables.” (p. 95). Se habla de esquema de estrella se habla de un modelo que permite el análisis de datos, donde se representa mediante una tabla de hechos que representa las métricas de un evento especifico, es decir que mide una actividad, magnitudes, tiempos, temperatura cantidades, existencias, costos, etc., este modelo sirve
para Procesamiento Analítico en Línea (Online Analytical Processing, OLAP) permite extraer datos fácilmente para su consulta y almacenamiento en múltiples fuentes de datos. Figura 1 Bodega de datos - Esquema de estrella
Nota. Bodega de Datos [Imagen], por Corporación Universitaria del Minuto de Dios El Bagre Antioquia 2011, https://clasespress.wordpress.com/2011/03/13/bodega-de-datos/
Los artículos publicados en las bases de datos de Duque-Méndez, N. D., Orozco-Alzate, M., & Vélez, J. J. (2014), explican su modelo a partir de la extracción de datos para el análisis, los cuales son revisados por gráficas, a partir del comportamiento de las variables por periodos de tiempos diversos (días, años, entre otros). El proceso ETL es resaltado por los autores al momento de desarrollar un proyecto desde el tratamiento y el análisis de los datos, con el fin de validar las fuentes de datos.
La extracción de datos permite su recopilación y posterior depuración y análisis, para carga estos en almacenes de datos de destino mediante el proceso de ETL (Extracción, transformación y carga) que permite la canalización de la información, la transformación de los datos se lleva a cabo
a través de operaciones de filtrado, ordenación, agregación, combinación de datos, limpieza de datos, des duplicación y validación de datos. (Microsoft, 2022) Figura 2 Proceso de extracción, transformación y carga (ETL)
Nota. Proceso de extracción, transformación y carga (ETL) [Imagen], por Microsoft 2022, https://learn.microsoft.com/es-es/azure/architecture/data-guide/relational-data/etl
El tercer grupo, relacionan artículos que mencionan la aplicación de técnicas de ingeniera artificial, para el análisis de grandes cantidades de datos en unidades de información. Se debe estar en constante cambio, un ejemplo de esto es lo dicho por Villa, Y (2017), donde afirma que, debido a los cambios sociales y tecnológicos, es necesario que los archivos a través del Big Datas y la minería de datos obtengan datos estadísticos que ayuden en la mejora de procesos en las entidades, con potencial en el valor de la información. La información se ha convertido en un activo valioso para las empresas, porque atreves de esta, pueden mejorar los procesos, la administración y estar un paso adelante hacia los clientes o la competencia. Para las entidades públicas, la información contenida en el Big Data se convierte en una herramienta que permite una mayor eficiencia en el Estado de cara a la ciudadanía.
La utilización del Big Data en el entorno de las de los archivos es importante porque es posible utilizar la información recuperada de los “grandes conjuntos de datos digitales que requieren de sistemas informáticos para su captura, almacenamiento, búsqueda, manipulación y visualización” (Adell & Guersenzvaig, 2013). En este caso la utilización de la información que se encuentra almacenada en las bases de datos de los archivos en las fases del ciclo vital de los documentos y la que se pueda obtener de otras instancias, puede impulsar la mejora en los servicios que se le ofrecen a los archivos a sus usuarios, para potenciar una efectiva atención a sus necesidades y de igual manera en la mejora en los servicios que se prestan. La explotación de los datos y su información, se constituyen en un elemento de gran importancia para mantener vigentes a los archivos como fuente viva e la información.
En el repositorio de la Universidad Nacional de Colombia, uno de los trabajos de grados con mayor influencia es “Aplicación de técnicas de análisis de datos y administración de Big Data ambientales”, publicado en el año 2016, presenta los conceptos de un “modelo para la administración y análisis de datos ambientales con el uso de algunas tecnologías Big Data, que permita facilitar el tratamiento de estos datos, su almacenamiento, aplicar diferentes tipos de análisis y extraer información relevante de apoyo a la toma de decisiones y en general a la comprensión de los datos propios del dominio” (Hernández Leal, 2016, p. 9). Es importante para nuestro presente y futuro el manejo de los recursos naturales de manera responsable. La tecnología juega un papel importante en la transformación en sostenibilidad ambiental para utilizar información recopilada que permite tener la opinión de los ciudadanos sobre el cambio climático a través del análisis de patrones de comportamiento y prevención de catástrofes, como inundaciones, sequias, tormentas tropicales, deforestación, etc., con el análisis que se pueda extraer de los datos del Big Data (Alló, María, 2014, p. 22). La previsión de desastres
naturales y el constante aumento en la temperatura hacen que herramienta como Big Data, se vuelvan importantes para científicos, investigadores y ambientalistas. La búsqueda en repositorios institucionales de universidades internacionales dio como resultado el de la Universidad Nacional “San Luis Gonzaga De ICA”, el trabajo de grado más relacionado y con mayor índice de citación es “Análisis y usos del Big data aplicado En la universidad nacional “San Luis Gonzaga” de ICA: caso facultad de Ingeniería de sistemas”, publicado en el año 2018, en el cual se “busca entender con mayor amplitud al Big Data como nueva tecnología para grandes volúmenes de datos, que herramientas están relacionadas con él, así como el alcance de los datos para que sean aprovechados correctamente.” (Almora Castro, 2018,
p. 15).
Las universidades cada vez visualizan la importancia de utilizar la información que se genera en sus aulas, esta les puede servir para que los nuevos alumnos puedan utilizarla como referente de investigación. La organización en la estructuración de la información en las universidades permitiría que se puedan analizar los comportamientos dentro de los centros de enseñanza, las necesidades educativas de los estudiantes, sus gustos, para proporcionar información relevante para mejorar la educación. Las universidades proporcionan una importante cantidad de información de carácter educativo, investigativo y científico, que no solo sirve a los intereses de las universidades, sino que también son fuente de conocimiento para la sociedad, de ahí la importancia de la recuperación y utilización de esa información con las herramientas que proporciona el Big Data.
Es importante también conocer la herramienta que hacen posible la recopilación y análisis de datos desde el Big Data, estas herramientas constituyen la base para la utilización efectiva de los datos y por lo tanto de la información. Existen muchas herramientas que realizan múltiples
actividades, las más relevantes son en su conjunto, según lo recogido en el documento Estado del Arte y Tendencias Big Data y Business Analytics (2021) de la junta de Andalucía: o Infraestructura de base: Apache Hadoop.
o Procesamiento: Apache Spark y otras herramientas de procesamiento de flujos. o Análisis: Elastic Stack, Apache Tez, Hive e Impala.
o Consulta de información: herramientas de consulta SQL.
o Ingesta: Sqoop, Flume, Beats y Logstash.
Esta estructura es llamada ecosistema de Hadoop, porque cada una de estas herramientas tiene un rol especifico y se complementa con las demás, lo cual permite que los procesos y consulta sean mucho más rápidos y fáciles.
Estas aplicaciones permiten recopilar, analizar y filtrar aquella información que pueda ser utilizada, según las necesidades de los usuarios. Estas herramientas nacen por la necesidad de encontrar una solución a la recuperación de los datos que se encuentran en el Big Data y que pueden ser utilizados, no solo por las grandes empresas para sus modelos de negocio, sino también para la educación, la ciencia y la cultura, que brinda mayor accesibilidad al conocimiento y a la formación. Sin embargo, se debe tener un amplio conocimiento de su utilización y de cómo sacarle el mejor partido a cada una, por ende, es necesario tener conocimiento en sistemas y programación. La identificación e integración de datos y documentos es esencial desde su creación mediante una estrategia correcta, respaldada por directrices internas que hagan viable su puesta en marcha y sean efectivas en el tiempo.
Sin embargo, el Big Data por sí solo no puede constituir exclusivamente en presentar nuevos portales aislados con funcionalidades variadas de búsqueda o descargas de datos e
información. Se requiere la identificación e integración de datos y documentos mediante directrices internas que hagan viable su puesta en marcha y sean efectivas en el tiempo. Por otro lado, debe ser un modelo planificado, coordinado y ser evolutivo para aprovechar al máximo los recursos, para formar niveles de acceso apropiados. La transmisión de los datos y documentos deben estar sustentados en la interoperabilidad, por los que se debe crear un equipo multidisciplinar que coordine, impulse y ejecute el modelo de gestión de documentos. El equipo humano deberá desarrollar un marco lo suficientemente amplio y a la vez preciso que permita el control total de los recursos de información, lo cual establece las acciones oportunas desde la creación de los documentos y la gestión por los sistemas internos hasta su publicación en los correspondientes portales de transparencia, servicios RISP o incluso como fuente de datos para servicios Big Data (Moyano, J, 2015, p. 56).
Para el control total de la información que se extraiga del Big Data, se debe tener en cuenta que este tiene unas características que definen la planificación y la interoperabilidad. La complejidad de los datos, su volumen y velocidad son algunos de los principales retos que se deben tener en cuenta para la estructuración de un modelo de gestión de documentos que permita la integración, organización y preservación de la información que se extraiga del Big Data. Según, Pan. et al. (2022), Big Data se define por sus características de 5-v que son Volumen, Velocidad, Veracidad, Variedad y Valor de los cuales dependen casi todos los modelos de datos. Esto lo convierte en un problema, debido a que al ser más variados y de estructura compleja tiene problemas de indexación, clasificación, búsqueda, análisis y visualización son los principales desafíos de las organizaciones actuales por estar formados de datos estructurados (Hojas d calculo, Bases de datos, formularios web, etc.) y semiestructurados (Archivos
comprimidos, XML y otros lenguajes de marcado, etc.) y no estructurados (Documentos de oficina en archivos de texto, imágenes, PDF, datos de redes sociales (Facebook y Twitter) o YouTube). Figura 3 Herramientas de extracción de datos
Nota. Proceso de extracción, transformación y carga (ETL) [Imagen], por Microsoft 2022, https://learn.microsoft.com/eses/azure/architecture/data-guide/relational-data/etl
Según Moyano, (2015) la práctica de la gestión documental va dirigida hacia un marco mucho más dinámico donde la interoperabilidad y la explotación de documentos van a potenciar nuevos entornos de uso de estos. Evitar silos aislados de profesionales, datos o portales es el gran reto para conseguir que el trabajo y los documentos se transmitan a ciudadanos y empresas de manera fluida, estable y lógica.
Lo anteriormente dicho es relevante en un mundo que cada vez se apropia de la información y genera información. Las instituciones educativas, las entidades públicas y privadas, las personas
y ahora la inteligencia artificial (IA), crean información, de ahí la importancia de la Big Data como repositorio de una cantidad increíble de datos que pueden ser aprovechados por todos.
2.3 Categorías Conceptuales
El presente apartado comprende una reflexión de los conceptos que sirven de referentes para establecer el análisis para la aplicación de un modelo de Big Data para la gestión documental: estudio de caso Centro Agroecológico y Empresarial del Servicio Nacional de Aprendizaje (SENA) – Área de certificación. Dicho esto, se abordan elementos relacionados al Big Data y la gestión documental.
Big Data Los constantes cambios tecnológicos, nuevas tendencias sociales, culturales y la forma en la que operan los mercados en un ambiente globalizado, han evidenciado que muchas entidades no están preparadas para enfrentar un mundo tan rico en información. Sin embargo, la tecnología avanza a pasos agigantados y cada vez es más fácil acceder a ella, y de hecho muchas organizaciones ya han adoptado el Big data como una estrategia adecuada de administración de la información.
De acuerdo con Gartner, citado por Arévalo (2016) Big Data se refiere al “al volumen, variedad y velocidad de datos estructurados y no estructurados que se vierten a través de redes en los procesadores y dispositivos de almacenamiento, así como la conversión de dichos datos para el asesoramiento empresarial”. (p. 2) Sin embargo, se comprende que el Big Data y la forma en que las organizaciones gestionan y obtienen la información, está para transformar la forma en que el mundo utiliza la información de los negocios para tomar mejores decisiones y acciones de negocios estratégicas, ya que el acto
de acceder y almacenar grandes cantidades de información para la analítica ha existido desde hace mucho tiempo.
La implementación del Big Data en los diferentes entornos permite considerar 2 dimensiones: variabilidad, para esta dimensión los datos se presentan en todo tipo de formatos: desde datos numéricos estructurados en bases de datos tradicionales hasta documentos de texto no estructurados, correos electrónicos, vídeos, audios, datos de teletipo y transacciones financieras. Además de las crecientes velocidades y variedades de datos, los flujos de datos son impredecibles, cambian a menudo y varían mucho. Es un reto, pero las empresas necesitan saber cuándo algo está de moda en los medios sociales, y cómo gestionar los picos de carga de datos diarios, estacionales y desencadenados por eventos. Veracidad, con relación a la calidad de los datos, debido a que los datos provienen de tantas fuentes diferentes, es difícil vincular, comparar, limpiar y transformar los datos a través de los sistemas. Las empresas necesitan conectar y correlacionar las relaciones, las jerarquías y los múltiples vínculos de datos. De lo contrario, sus datos pueden salirse de control rápidamente.
Con lo anterior, se sustenta que el Big Data es fundamental porque este no gira en torno a la cantidad de datos que tienes, sino en lo que haces con ellos. Se pueden tomar datos de cualquier fuente y analizarlos para encontrar respuestas que permitan: reducir los costos, reducir el tiempo, desarrollar nuevos productos y optimizar las ofertas, y tomar decisiones inteligentes. Cuando se combinan grandes datos con análisis de alta potencia, se pueden realizar tareas relacionadas con los negocios como: determinar las causas de origen de fallos, problemas y defectos casi en tiempo real; generar cupones en el punto de venta basados en los hábitos de compra del cliente; recalcular portafolios de riesgo completos en minutos y detecte el comportamiento fraudulento antes de que afecte a su organización.
A nivel de unidades de información la estrategia de Big data es un plan diseñado para ayudarle a supervisar y mejorar la forma en que adquiere, almacena, gestiona, comparte y utiliza los datos dentro y fuera de la unidad. Una estrategia de modelo de Big data establece el escenario para el éxito de la toma de decisiones en medio de una abundancia de datos. Cuando se desarrolla una estrategia, es importante considerar las metas e iniciativas de servicios y tecnología existentes y futuras.
Para el caso del área de certificación del Centro Agroecológico – SENA, lo anteriormente dicho es relevante, ya que es necesario que se pueda gestionar de manera eficiente la información que se genera en las consultas que realiza cada aprendiz y que puede ser utilizada para extraer datos sobre los aprendices que utilizan las herramientas de solicitud de certificación y así generar procesos de mejora en la consulta y puede servir también para proporcionar datos estadísticos sobre los estudiantes; como por ejemplo, tema de consulta, utilización de la herramienta de consulta, cantidad de usuarios que hacen consulta, número de descarga por aprendiz, entre otras. Asimismo, la importancia estratégica que para el futuro de la gestión documental pueden tener los datos abiertos y, especialmente, los datos abiertos vinculados Hernández-Pérez T, (2018). Estos datos tienen la particularidad que no son accesibles a los usuarios, que requiere para su consulta herramientas especializadas para su lectura, no lo hace fácil reutilizar este tipo de datos mediante procesos automatizados (Universidad de Manizales, 2018, p. 60). En el ámbito de las organizaciones el Big data es entendido como la gestión y el almacenamiento masivo de datos, es una tendencia por explotar hoy. Para ello es necesario comprender todas las posibilidades que ofrece el Big Data y las dinámicas internas del negocio, así como las fuentes de datos de las que se puede extraer información que permite formular mejores
preguntas y tomar decisiones acertadas mediante el proceso de gestión de datos en la empresa parala toma de decisiones del business intelligence (Fernández, E. et al, 2017, p. 50). Gestión documental La Gestión Documental, se dio principalmente después de la segunda guerra mundial, en parte por la necesidad de manejar de una forma organizada y manejar el gran volumen de información producida después de la guerra, derivada de igual forma de la necesidad de tener disponible la información de los hechos ocurridos, difundir esa información y salvaguardarla. Lo cual, además desencadena en la producción desenfrenada de documentos de todo tipo, no solo por las necesidades anteriormente mencionadas sino también por los cambios en la economía, la industria, la forma de hacer negocios entre empresas y entre países y el surgimiento de la tecnología computacional.
Autores como Roberge (1993) sentaron las bases para su definición y aplicación, el cual agrega elementos tales como la teoría de sistemas, la eficacia y la rentabilidad; este autor define el sistema de Gestión Documental como “el conjunto de las operaciones y de las técnicas relativas a la concepción, el desarrollo, la implantación y la evaluación de los sistemas administrativos necesarios desde la creación de los documentos hasta su destrucción o transferencia al archivo permanente”.
También, Ponjuan (2003) afirma que “la Gestión Documental es el proceso mediante el cual las organizaciones de cualquier índole desarrollan diferentes funciones y procedimientos para optimizar el tratamiento de documentos de cualquier índole”. Esto fundamentada en definiciones como señala Cruz Mundet “la gestión de documentos es el conjunto de tareas y procedimientos orientados a lograr una mayor eficacia y economía en la explotación de los documentos por parte
de las administraciones”, Mundet, 1995 y Ponjuan (2003) quien cito a Diamond “En realidad la gestión de documentos se refiere al control de estos desde su creación hasta su destrucción”. (p.
6).
Según la Ley 594 de 2000, denominada Ley General de Archivos, la gestión documental está definida como el “conjunto de actividades administrativas y técnicas tendientes a la planificación, manejo y organización de la documentación producida y recibida por las entidades, desde su origen hasta su destino final, con el objeto de facilitar su utilización y conservación” (Congreso de la República, 2000, p. 2).
En Colombia la Función Pública (2022), define la gestión documental como “El conjunto de actividades administrativas y técnicas tendientes a la planificación, manejo y organización de la documentación producida y recibida por las entidades, desde su origen hasta su destino final con el objeto de facilitar su utilización y conservación” (párr. 1), para dar cumplimiento a través de están actividades por medio de la implementación de los Instrumentos Archivísticos implementados en el Departamento Administrativo de Función Pública, en cumplimiento de la Ley 594 de 2000 "Ley General de Archivos" y demás disposiciones emitidas por el Archivo General de la Nación – AGN.
A partir del análisis de las anteriores definiciones de gestión documental, podemos establecer que ha evolucionado, se fundamenta en los principios y prácticas archivísticas, como el resultado de su evolución y elementos de otras disciplinas como la administración. Como punto de encuentro en todas las definiciones es el concepto del ciclo de vida de los documentos y coinciden en que la gestión documental es un proceso en sí mismo, fundamentado en principios de economía y eficacia, tal como lo indica el mapa de procesos de la entidad.
La gestión documental es entonces, una herramienta administrativa para el manejo de los documentos durante todas las fases del ciclo de vida de estos en organizaciones de cualquier índole, fundamentada en principios de economía y eficiencia, con el fin de proporcionar información adecuada y oportuna tanto a usuarios internos como externos de la organización, para lo cual requiere del desarrollo de procesos y actividades técnicas propias de la archivística y el manejo de la información. En Colombia, la gestión documental se desarrolla en todas las actividades donde se requiere el manejo de documentación con valor importante. La gestión documental en Colombia supera una optimización de procesos y una correcta administración de la información. Se puede decir que ha contribuido a la transparencia en la gestión pública y privada, la conservación del patrimonio documental y cultural, y la protección del medio ambiente por medio de lineamientos de digitalización y preservación de la información.
La gestión documental y el Big Data, se relacionan principalmente en la satisfacción de necesidades existentes en la gestión documental con el análisis y la interpretación de datos estructurados, semiestructurados y no estructurados, esta tecnología es vital para el correcto funcionamiento e implementación de la herramienta, ya que además de recuperar y analizar la información, permitirá realizar una correcta gestión documental, donde prime la preservación y el almacenamiento de los documentos que hacen parte de una organización. Para un sistema de gestión de documentos que contiene todos los datos y la información de una entidad, de acuerdo con su estructura funcional y los servicios que presta al ciudadano, y su función básica siempre será el almacenamiento, procesamiento y recuperación de información. (Colmenares, 2016, p. 12) Política Publica de Gestión Documental La implementación de una política pública de gestión documental está orientada y sustentada en el marco normativo vigente en materia archivística, de conformidad con la Política de Archivos
de 2015 del Archivo General de la Nación: “La política de Gestión Documental en el Estado Colombiano, acorde con el Artículo 2.8.2.5.6. del Decreto 1080 de 2015, debe ser entendida como el conjunto de directrices establecidas por una entidad para tener un marco conceptual claro para la gestión información en cualquier soporte, la cual toma como base la implementación metodológica en la creación, uso, mantenimiento, retención, acceso y preservación de datos e información, independiente de su soporte y medio de creación, un programa de gestión de información y documentos, una adecuada articulación y coordinación entre las áreas de tecnología, la oficina de Archivo, las oficinas de planeación y los productores de la información. Esta política debe estar ajustada a la normativa que regula la entidad, alineada con el plan estratégico, el plan de acción y el Plan Institucional de Archivos – PINAR y deberá estar documentada e informada a todo nivel de la entidad.
La articulación entre un modelo de Big data, la gestión documental y la política pública de gestión documental, se da con el fin de lograr una adecuada gestión de los documentos electrónicos de archivo (expedientes mixtos, híbridos y digitales), a través de los lineamientos relacionados con su autenticidad, integridad, inalterabilidad, fiabilidad, disponibilidad, conservación y preservación a largo plazo. Las herramientas archivísticas, la analítica de datos y el adecuado manejo de los documentos y la información contribuyen con la conservación, la trazabilidad y la recuperación de información que mejora la eficiencia, eficacia y efectividad administrativa que garantiza con ello la satisfacción de nuestros usuarios internos y externos, de forma articulada con todas las políticas de gestión y desempeño de la entidad.
El desarrollo de una política pública en la organización de la información mediante estas tecnologías permite un manejo local para brindar información clave, clara y oportuna a la ciudadanía, en un tiempo de respuesta remoto, lo que demuestra que estas tecnologías traen
grandes beneficios a la hora de conservar la información (Beltrán, 2005, p. 8). A través, de un modelo de Big data para la integración de datos y la fusión o implementación de estas herramientas son consideradas totalmente viables, como una combinación de tecnologías que debe ser desarrollada por un grupo de colaboradores expertos que hagan de esta una herramienta innovadora para responder a las necesidades descritas en este documento.
2.4 Contexto Institucional
Según Decreto 3123 de 1969 denominado "Por el cual se reorganiza el Servicio Nacional de Aprendizaje (SENA)" el Servicio Nacional de Aprendizaje (SENA), creado por el Decreto 118 de 1957, es un establecimiento público con personería jurídica, patrimonio independiente y autonomía administrativa, adscrito al Ministerio del Trabajo, encargado de cumplir la política social del Gobierno en el ámbito de la promoción y de la formación profesional de los recursos humanos del país y la función que le corresponde al Estado de invertir en el desarrollo social y técnico de los trabajadores colombianos, ofrecido y ejecutado la Formación Profesional Integral gratuita, para la incorporación y el desarrollo de las personas en actividades productivas que contribuyan al desarrollo social, económico y tecnológico del país. (SENA, 2022, p. 10). El Servicio Nacional de Aprendizaje (2022), se define como:
Ofrece formación gratuita a millones de colombianos que se benefician con programas técnicos, tecnológicos y complementarios que, enfocados en el desarrollo económico, científico y social del país, entran a fortalecer las actividades productivas de las empresas y de la industria, para obtener mejor competitividad y mayores resultados en los diferentes mercados. (párr. 1)
Autorizada por el Estado para invertir en infraestructura necesaria para mejorar el desarrollo social y técnico de los trabajadores en las diferentes regiones, a través de formación profesional integral que logra incorporarse con las metas del Gobierno Nacional, mediante el cubrimiento de las necesidades específicas de recurso humano en las empresas. Por medio de la vinculación al mercado laboral bien sea como empleado o subempleado-, con grandes oportunidades para el desarrollo empresarial, comunitario y tecnológico. (párr. 2).
La misión del SENA se focaliza en el cumplimiento de las funciones correspondientes al estado en temas de desarrollo social y técnico de los trabajadores colombianos, que invierte, ofrece y ejecuta de la formación profesional integral, a través de actividades productivas que aportan significativamente al desarrollo social, económico y tecnológico del país. (Ley 119/1994). Para el año 2022 el SENA en su visión institucional se afianza como una entidad referente en la formación para el trabajo que forma personas integras, que integra la empleabilidad, el emprendimiento y la equidad en todo el país, para brindar oportunidad que den respuesta a las necesidades sociales y productivas del país. Los objetivos institucionales definidos en la ley 119 de 1994, en su artículo cuatro, los más relevantes para nuestra investigación, son:
1. Organizar, desarrollar, administrar y ejecutar programas de formación profesional integral,
en coordinación y en función de las necesidades sociales y del sector productivo.
2. Velar porque en los contenidos de los programas de formación profesional se mantenga la
unidad técnica.
3. Crear y administrar un sistema de información sobre oferta y demanda laboral.
4. Expedir títulos y certificados de los programas y cursos que imparta o valide, dentro de los
campos propios de la formación profesional integral, en los niveles que las disposiciones legales le autoricen.
Estructura organizacional De acuerdo con las normas y apartes vigentes de la Ley 119 de 1994 y el Decreto 249 de 2004 (Modificado parcialmente por el Decreto 2520 de 2013), la “Estructura Formal” que tiene actualmente el SENA para el desarrollo de sus funciones, es la siguiente: Figura 4 Organigrama del SENA
Fuente: Servicio Nacional de Aprendizaje, 2022, https://www.sena.edu.co/es-co/sena/Paginas/estructuraorganizacional.aspx
El SENA tiene 33 regionales, conformadas de la siguiente manera: Amazonas, Antioquia, Arauca, Atlántico, Bolívar, Boyacá, Caldas, Caquetá, Casanare, Cauca, Cesar, Choco,
Cundinamarca, Córdoba, Dirección General, Distrito Capital, Guainía, Guajira, Guaviare, Huila, Magdalena, Meta, Nariño, Norte de Santander, Putumayo, Quindío, Risaralda, San Andrés, Santander, Sucre, Tolima, Valle, Vaupés y Vichada. Eu objetivo de cada una de estas regionales, es brindar formación técnica y tecnológica a los colombianos interesados en formarse para el trabajo y para aquellos que desean crear empresa. El Centro Agroecológico y Empresarial, ubicado en Fusagasugá, pertenece a la Regional Cundinamarca, los centros de esta región ofrecen formación en actividad física, redes, cosmetología, panadería, contabilidad, finanzas, sistemas, recursos humanos, archivo, alimentos y sector agroempresarial, entre otros. Política Institucional de Administración de Archivos y Gestión Documental El SENA (2019), en su política define:
Está compuesta por un conjunto de directrices y estándares que le permite a las partes interesadas tener claridad de cómo gestionar adecuadamente la información recibida y producida independientemente de su soporte, a partir de estrategias a corto, mediano y largo plazo en cada uno de los ocho (8) procesos de la gestión documental: planeación, producción, gestión y trámite, organización, transferencia, disposición, preservación y valoración conservación que evidencia el cumplimiento del ciclo vital de los documentos. (p. 5).
Con el fin de salvaguardar el patrimonio documental, por cuanto “garantiza la trazabilidad de la gestión, el desarrollo de las funciones, como la seguridad y protección de datos que permitan el control de la difusión y transmisión de información con calidad, para fomentar la transparencia, la rendición de cuentas y el control social ciudadano.” (Servicio Nacional de Aprendizaje, 2019,
p. 4).
A partir de los lineamientos generales de esta política se puede establecer que los procesos de gestión documental del SENA son los encargados de identificar, definir e implementar las mejores prácticas en torno a los procesos archivísticos y de gestión documental relacionadas con: La elaboración de documentos de archivo, trámite y gestión de estos, a través de los aplicativos y herramientas tecnológicas con que cuenta la entidad, los procesos técnicos de organización documental como son la clasificación, ordenación y descripción, se realizarán cumpliendo con los principios archivísticos de procedencia y orden original, con el fin de mejorar la gestión administrativa, el cual garantiza el acceso a la información de manera ágil y eficiente. (Servicio Nacional de Aprendizaje, 2019, p. 7). La conservación total de los documentos misionales a largo plazo se ha definidos a partir de los espacios técnicos y tecnológicos, con base en la conservación y preservación. Para la disposición final de los documentos de archivo, sin tomar en cuenta su soporte y medio de creación se tomarán las decisiones según lo estipulado en las Tablas de Retención Documental (TRD), es decir, conservación, digitalización, microfilmación o eliminación. Área de Certificación Es el área encargada de revisar y convalidar el cumplimiento en su totalidad de los requisitos de formación para certificar a cada uno de los aprendices en todas las modalidades de formación, existen dos tipos de certificados: el certificado de estudios y certificados de competencias laborales.
Certificado de Estudios: El certificado de estudios se otorga a los aprendices que han completados los cursos presenciales o virtuales de manera satisfactoria y está disponible cinco días después de finalizado el curso.
Certificado de Competencias Laborales: Los certificados de competencias laborales verifica y certifica que la persona que solicita la certificación cumple con las habilidades, destrezas y conocimientos para realizar una labor o función de las que por Ley se pueden certificar de esta forma. Esta certificación la realiza un organismo certificador y se hace a petición del empleado o empleador.
Centro Agroecológico y Empresarial Ofrece programas de formación para el trabajo a partir de capación técnica, tecnológica y complementaria, que responde a las necesidades más sentidas de empresarios y mercados laborales locales, las cuales atienden diferentes sectores económicos como: agroindustria, ambiental, tecnologías de la información y la comunicación, gastronomía, agropecuario, comercio y ventas, cosmetología, actividad física, construcción y servicios administrativos. Para el año 2030 el Centro Agroecológico y Empresarial de Fusagasugá, focaliza su visión en ser un referente a nivel latinoamericano de formación integral para el trabajo, que aporta principalmente en las áreas de seguridad alimentaria, agricultura sostenible, turismo rural y educación inclusiva y equitativa que da respuesta a los objetivos de desarrollo sostenible.
Figura 5 Estructura orgánico-funcional de CAE
Fuente: Elaboración propia
CAPITULO III: MARCO METODOLÓGICO
3.1 Enfoque
El enfoque metodológico establecido para esta investigación es mixto según lo definido por Salgado (2004) citado por Blanco, N.; Pirela, J. (2016), quien cataloga la modalidad multimétodo como enfoque mixto, ya que hace referencia básicamente al empleo conjunto de la investigación cuantitativa y la cualitativa sólo como posibles elecciones que tiene el investigador, más que posiciones epistemológicas para abordar un objeto de estudio, por lo cual debe ser visto desde un punto de vista pragmático, como un enfoque integrado o multimodal. El diseño mixto se utiliza, por su parte, cuando un problema particular se estudia desde un enfoque de investigación principal al que se le integran, de manera secundaria, estrategias provenientes de otro enfoque. Este diseño se hace operativo a través de la estrategia de la combinación de métodos (Morgan, 1998). Por último, el diseño múltiple, el cual requiere por parte del investigador un trabajo con técnicas y procedimientos provenientes de ambos enfoques, tanto del cualitativo como del cuantitativo durante todo el proceso de investigación; desde la idea o planteamiento del problema, hasta el análisis de los datos e interpretación de los resultados, que pasa por la mayor parte de las fases o momentos en la labor investigativa; este diseño se hace operativo a través de la estrategia técnica de la triangulación. El carácter mixto de esta investigación tiene como finalidad representar de manera fidedigna el resultado de los datos obtenidos de la información obtenida, analizada y depurada a través de los instrumentos de recolección. Esto permite obtener un panorama más amplio de las fortalezas y debilidades del objeto de estudio.
3.2 Tipo de investigación
La tipología de la investigación se relaciona directamente con el enfoque mixto, es por esto que se va a desarrollar una investigación descriptiva, los estudios descriptivos cualitativos y cuantitativos comprenden una valiosa aproximación metodológica en y por sí mismos. Como lo define Hernández R., Fernández, C., & Baptista, M.., (2014), Se buscan especificar las propiedades, las características y los perfiles de personas, grupos, comunidades, procesos, objetos o cualquier otro fenómeno que se someta a un análisis. Es decir, únicamente pretenden medir o recoger información de manera independiente o conjunta sobre los conceptos o las variables a las que se refieren, esto es, su objetivo no es indicar cómo se relacionan éstas. (p. 92) Esta investigación articula los elementos conceptuales, técnicos, procedimentales y tecnológicos de un modelo de Big data para la gestión documental y el contexto actual del área de certificación del Centro Agroecológico y Empresarial para proponer los lineamientos del modelo de Big data en el área, ya que, reúne información cuantificable que puede usarse para hacer inferencias estadísticas del análisis de datos e información del área, con el fin de definir y medir con mayor precisión la importancia del servicio.
3.3 Método
Para esta investigación se utilizaron dos métodos de investigación, Creswell (2008) argumenta que la investigación mixta permite integrar, en un mismo estudio, metodologías cuantitativas y cualitativas, con el propósito de que exista mayor comprensión acerca del objeto de estudio. Aspecto que, en el caso de los diseños mixtos, puede ser una fuente de explicación a
su surgimiento y al reiterado uso en ciencias que tienen relación directa con los comportamientos sociales.
El método de investigación de estudio de caso, de acuerdo con Pirela, Pulido & Mancipe, citado por Montoya Barbosa (2022), el método analítico se define como “El método analítico tiene como principal característica el análisis de cada una de las partes que configuran un todo, es decir, el objeto de estudio. Analiza entonces la causa, los fragmentos, el ambiente y sus efectos de forma tal que va de lo general a lo particular… Básicamente, se puede decir que el objetivo de este método es el conocimiento de todos los elementos que intervienen con el objeto de estudio. De esta forma establece las relaciones existentes entre las partes y sus relaciones intrínsecas y extrínsecas con respecto al total”. (p.87) Es decir, el análisis es la observación y examen de un hecho en particular. Es necesario conocer la naturaleza del fenómeno y objeto que se estudia para comprender su esencia. Este método nos permite conocer más del objeto de estudio, con lo cual se puede: explicar, hacer analogías, comprender mejor su comportamiento y establecer nuevas teorías. El método de estudio de caso que acorde con Timmons y Cairns, citado por Chávez López (2022), “los estudios de caso permiten analizar una gran variedad de fenómenos, desde situaciones o eventos inusuales hasta interacciones complejas” (p. 57), a su vez, buscan dar respuesta a los planteamientos de los problemas de investigación. Que entrelaza el tipo de investigación descriptiva y el método de estudio de caso Martínez (2006), define este como, “las investigaciones realizadas a través del método de estudio de caso pueden ser: descriptivas, si lo que se pretende es identificar y describir los distintos factores que ejercen influencia en el fenómeno estudiado” (p.171).
Por medio del análisis y el estudio de caso de la problemática frente a la gestión documental en el área de certificación del centro, en el que se propondrá un modelo de Big Data para garantizar su gestión y respuesta oportuna a los grupos de valor. En consecuencia, usar esta combinación de técnicas para los procesos que busca la organización y sistematización de la información en este caso, el método analítico y el estudio de caso, para lo cual se definieron criterios previos para obtener el resultado de la descripción de la realidad de la gestión documental del área de certificación. Dado lo anterior, es necesario contar con la información necesaria que permita determinar las causales y las necesidades en el área de gestión documental con respecto a los documentos que serán procesados para utilizarlos como fuente de información y consulta, para esto se debe contar con las herramientas apropiadas para el análisis de datos, a partir de las necesidades y particularidades del área materia de estudio.
3.4 Técnicas
Para Sabino (2011), las técnicas e instrumentos son los recursos de que puede valerse el investigador para acercarse a los problemas y fenómenos, y extraer de ellos la información: formularios de papel, aparatos mecánicos y electrónicos que se utilizan para recoger datos o información, sobre un problema o fenómeno determinado. Igualmente, Arias (2012) explica que son las distintas formas o maneras de obtener la información, el mismo autor señala que los instrumentos son medios materiales que se emplean para recoger y almacenar datos. Para interpretar lo anterior, las técnicas e instrumentos de recolección de datos son un conjunto de herramientas y procedimientos disponibles para un investigador cualquiera y que le permiten obtener datos e información. Se aplicará entonces, un de análisis de contenido, el cual refiere a una técnica de estudio sistemático de discursos en sentido amplio, que incluye aspectos objetivos como subjetivos e intersubjetivos. Una de las más clásicas definiciones del análisis de
contenido, y en la cual se hace referencia al aspecto cuantitativo, es la a que Berelson se refiere como “la descripción objetiva, sistemática y cuantitativa del contenido manifiesto de la comunicación” (Citado en Abarca, et al.,2013, p.194). Los otros dos elementos de la definición de Berelson “cuantificable” y “manifiesto” han sido ampliamente discutidos por ser ciertamente restrictivos. Mientras que Ruiz y Ispizúa (1989) explican que en esta técnica en la que la lectura puede ser utilizada como instrumento de recolección de información, “… debe de realizarse de modo científico, es decir, de manera sistemática, objetiva y replicable y válida.” (Citado en Abarca, et al.,2013, p.195).
Para Cea D’Ancona existen dos tipos genéricos de análisis de contenido: el “clásico” desprendido del análisis dominante cuantitativo, en donde se da énfasis al análisis reflexivo de los documentos, es decir, que busca comprender los significados latentes (Citado en Abarca, et al.,2013, p.198). El análisis de contenido se basa en la lectura (textual o visual) como instrumento de recogida de información, lectura que a diferencia de la lectura común debe realizarse a través del método científico, es decir, debe ser, sistemática, objetiva, replicable, y valida. En este sentido, el tipo de análisis que se utilizará es el de tipo clásico, dominante cuantitativa, donde se ponderará la información analizada resultante, un valor tangible y unos resultados que nos permitan escoger el modelo más apropiado para ser implementado y que permita hacer un procesamiento más efectivo de la información que se recopila y se produce.
Como método en investigaciones cualitativas, la encuesta analiza las interacciones y comunicaciones entre las personas o entre las instituciones que conforman una población, independientemente de la cantidad de sujetos que presenten características similares; es decir, estudia la diversidad y no la frecuencia (Fink, 2003 en Jansen, 2012). Wester (1995 en Jansen, 2012) la denomina “encuesta cualitativa”.
Se le conoce también como método interrogativo o de opinión, se efectúa con un propósito específico: consiste en obtener información de los sujetos en estudio, proporcionada por ellos mismos, sobre opiniones, actitudes o sugerencias, mediante una serie de preguntas preestablecidas y que están de acuerdo con el tema y objetivos medir. Se tiene que considerar este método siempre que se necesite recolectar información de personas que se encuentran en ubicaciones dispersas, si se tiene una gran cantidad de personas involucradas en el grupo de estudio, si se desea medir la opinión general sobre un tema específico. Este método permite limitar las respuestas, ya que se puede incluir preguntas de selección simple o múltiple, además preguntas abiertas o cerradas. La encuesta es una técnica de investigación empleada en estudios cuantitativos y cualitativos. En los estudios cuantitativos, Groves, Fowler, Couper, Lepkowski, Singer, & Tourangeau (2004) la definen como “[...] un método sistemático para la recopilación de información de [una muestra de] los entes, con el fin de construir descriptores cuantitativos de los atributos de la población general de la cual los entes son miembros” (p. 4). La encuesta es uno de los métodos más utilizado y puede ser clasificado por su tipo de recolección de datos, como: encuestas por correo electrónico, vía telefónica y entrevista a personas. En los métodos más nuevos de recolección de datos, la información se ingresa directamente a la computadora ya sea por un entrevistador adiestrado o por la misma persona entrevistada. Si no hay un correcto diseño de la encuesta se puede obtener bajos niveles de cooperación y para remediar esto, puede ser enfocada sobre un tema en particular.
3.5 Instrumentos
Para el desarrollo de este trabajo se utilizarán dos instrumentos de recolección de información.
3.5.1 Matriz de análisis
Este instrumento de análisis permite comparar características especiales de cada una de las normas de descripción, que permite un cotejo de estructuras, áreas de información principal, áreas de información descriptiva y contenido de cada una de ellas. Para dar una comprensión más profunda al, mismo se utiliza el concepto de Hurtado de Barrera (2000), quien afirma sobre la matriz de análisis lo siguiente:
Las matrices de análisis son instrumentos diseñados para extraer información, por lo regular no tan evidente, ya sea de un documento de una situación real. La matriz de análisis proporciona criterios para reagrupar los indicios de un evento en nuevas sinergias que permiten descubrir en ese evento aspectos inexplorados (p. 459).
De esta manera, y para ser más precisos, los logros que se buscan con este instrumento o las aplicaciones que se pueden alcanzar, están determinados por los informes sobre los datos existentes, que permitan la extracción, análisis y visualización de la información ya organizada y su aplicación y/o utilización en diferentes procesos dentro del área o que sean transversales a otras actividades en el Centro Agroecológico y Empresarial.
3.5.2 Cuestionario
Este instrumento consiste en aplicar a un universo definido de individuos una serie de preguntas o ítems sobre un determinado problema de investigación del que deseamos conocer algo” (Sierra, 1994, p. 194), puede tratar sobre: un programa, una forma de entrevista o un instrumento de medición. Aunque el cuestionario usualmente es un procedimiento escrito para recabar datos, es posible aplicarlo verbalmente.
Para Malhotra (1997), que para diseñar un cuestionario es necesario, en primer lugar, tener clara la información que se requiere en la investigación, así como: seleccionar el tipo de cuestionario a aplicar, cuál es el contenido de las preguntas a realizar, motivar al respondiente, estructurar, redactar, ordenar y disponer adecuadamente los reactivos o ítems. Es decir, que la información aportada por cada individuo varía desde el punto de vista, también, de su rol dentro del área donde se realiza la investigación. Sin embargo, este tipo de información tan variada permite tener unas variables más amplias sobre las preguntas. Para poder realizar las preguntas, es necesario que los criterios de en los que se basa la investigación estén acordes con las necesidades y expectativas de cada uno de los encuestados.
3.6 Fases de la investigación
Para poder tener información que proporcione al investigador un margen de conocimiento por medio de la recopilación de datos de campo sobe le tema de investigación, es necesario que se organicen por etapas las actividades desde la recolección de la información, su análisis hasta su utilización permita tener un panorama más amplio para el avance tema de investigación y su culminación. Según Monje Álvarez, C. (2011), “la pretensión explicativa es característica de los estudios cuantitativos, de donde se deriva la predicción, la manipulación técnica y el control sobre los acontecimientos o hechos, preferencialmente del mundo natural. La formulación del problema de investigación también evidencia diferencias de enfoque y metodológicas en tanto la pregunta se oriente al establecimiento de relaciones causales y funcionales o relaciones de sentido, como corresponde en el último caso al interés cualitativo”. (p. 15) Fase 1: Estructuración del tema: Los modelos de Big data como eje fundamental hacia la problemática identificada en la investigación que busca desarrollar, se definen los
objetivos para exponer una propuesta para la implementación de un modelo de Big data, que permita el análisis y acceso a la información.
Fase 2: Profundización de los elementos teóricos: Se realizo el análisis de los modelos de Big data a partir de la matriz de análisis que compara 3 modelos. Fase 3: Establecimiento de la metodología: Se emplea la metodología con enfoque mixto, por medio de una investigación descriptiva.
Fase 4: Diseño, validación y aplicación del instrumento: Se diseño un cuestionario el cual se socializará con administrativos, operativos y directivos. Se enviará por medio de correo electrónico a los funcionarios seleccionados. Se recopilará la información y se hará una reducción de datos mediante la depuración de la información. Fase 5: Análisis de la información recopilada por los instrumentos: En el análisis de la información se tendrán en cuenta los datos obtenidos a través de las diversas categorías identificadas por medio de la matriz de análisis y las respuestas del cuestionario, instrumentos que se eligieron para el desarrollo del trabajo.
Fase 6: Construcción de la propuesta: Con la ejecución de la fase 5, donde se identifican las necesidades para realizar la propuesta denominada, “Requerimientos funcionales del modelo de Big data para la gestión documental”
Mediante esta metodología se pretende que los datos recopilados sirvan para el avance y la consolidación de la presente monografía y que sirva de referente para la búsqueda de la mejor herramienta de recolección, análisis y utilización de la información que se encuentra en la Big Data.
Figura 6 Fases de investigación
Nota: La imagen anterior describe las fases de investigación. Elaboración propia
Fase 1:
Estructuración del tema Fase 2:
Profundización de los elementos teóricos Fase 3:
Establecimiento de la metodología Fase 4: Diseño, validación y aplicación del instrumento Fase 5: Análisis de la información recopilada por los instrumentos Fase 6:
Construcción de la propuesta
CAPITULO IV: ANÁLISIS Y DISCUSIÓN DE RESULTADOS
Se realizó el análisis de los resultados por medio de la aplicación de los instrumentos de recolección de información definidos en el marco metodológico, de igual forma se desarrolló el objetivo general con sus objetivos específicos que se establecieron proponer un modelo de Big Data para la gestión documental.
De igual manera, este análisis responde a la necesidad de implementar unas herramientas que permitan la búsqueda de información en el Big Data que corresponde a la información creada y procesada en el ejercicio de las funciones del Área de certificación y su transversalidad a todo el Centro Agroecológico y Empresarial del Servicio Nacional de Aprendizaje (SENA). A continuación, se expone el análisis mencionado:
4.1. Matriz de Análisis
El instrumento responde al objetivo de la caracterización de los modelos de Big Data más adecuados para la gestión de los documentos, ya que se hace un comparativo de los planteamientos que se hacen con respecto a las arquitecturas y componentes que definen que características deben tener la herramienta con la que se podrá hacer la extracción, transformación y transporte de los datos y aprovechar la información relevante para el funcionamiento del área.
Figura 7 Modelo ETL
Fuente: Elaboración propia El enfoque propuesto por los tres autores es similar y se compagina, porque mientras Krishnan Kris nos indica el origen de los datos o fuentes de información que pueden ser recolectados de páginas web, redes sociales, máquina a máquina (M2M), transacciones, biometría o generados por el ser humano. Estos datos pueden ser estructurados en una primera fase por medio de metadatos, para obtener información de los datos recopilados, para describir el contenido, calidad, formato, disponibilidad, cantidad, entre otras características. El siguiente paso es la transformación que se realiza por medio de las reglas del negocio. Según Microsoft (2003), “En Master Data Services, una regla de negocio es una regla que se usa para garantizar la calidad y la precisión de los datos maestros. Puede usar una regla de negocios para actualizar datos automáticamente, enviar mensajes de correo electrónico, o iniciar un proceso de negocio o un flujo de trabajo” (párr. 1), que finaliza con la extracción de datos y su análisis, esto permite a las empresas controlar y administrar el registro y la entrada de datos y metadatos. Bob Marcus (2020), muestra la necesidad de una arquitectura de datos para su extracción, almacenamiento y transformación para que puedan ser consultados, por esto lo divide en siete
niveles: fuentes de datos externos, secuencia y procesamiento ETL, fundación altamente escalable, bases de datos operacionales y de analítica, análisis e interfaces de bases de datos, aplicaciones e interfaces de usuario. (p. 23).
Para Camargo, J. J. et al. (2014) “La primera etapa en el modelo de Krishnan Krish es llamado “recolección de datos”; en Bob Marcus se tiene como “fuentes de datos externas”, pero la tarea a desarrollar es muy similar, por no decir, que igual. Las actividades propuestas por Krishnan en la etapa “carga de datos” y “transformación de datos” son cubiertas de forma similar en la arquitectura de Bob Marcus, en algo llamado “secuencia y procesamiento ETL”. Microsoft divide los procesos en cuatro componentes: Fuentes de datos, transformación de datos (que se divide en cuatro subetapas: colección, agregación, congruencia y minería de datos); infraestructura de Big Data y uso de los datos
.
“La arquitectura que presenta Krishnan muestra cuatro etapas, mientras que Microsoft muestra cuatro componentes (Tabla 3). Las tareas desarrolladas en la etapa uno son las mismas que se hacen en “fuente de datos” de la arquitectura presentada por Microsoft. En el modelo de Krishnan, las actividades de la etapa dos y tres son muy similares a las actividades desarrolladas en la etapa llamada “transformación de datos”, de la arquitectura de Microsoft. Mientras que la extracción de datos (Krishnan), en Microsoft es llamado “infraestructura de Big Data”, las dos con actividades similares” Camargo, J. J. et al. (2014).
La arquitectura que presenta Marcus tiene siete niveles y la Microsoft, cuatro componentes. En la comparación de las arquitecturas presentadas por Marcus y Microsoft, se encuentra que las funciones son similares en cada etapa o paso, pero, en cada modelo con nombres diferentes.
Lo anterior indica que las arquitecturas presentadas guardan similitudes, sin embargo, también se diferencian en la cantidad de etapas, niveles o componentes y en las definiciones de cada uno de estos. No obstante, los modelos presentados sirven como guía para la construcción de una metodología para la implementación de una herramienta que tenga una o varias de las características ya descritas.
Es decir que, como lo afirma Serrat Morros, R. (2013), “los datos recibidos pueden procesarse, analizarse y/o visualizarse tantas veces como haga falta y lo requiera el caso de uso específico” (p. 17).
Tabla 1 Matriz comparativa de modelos de arquitectura Big Data
Logo
Herramienta Apache Kafka Apache Nifi Google Dataflow Microsoft Azure Data Factory Apache Cassandra Hadoop HDFS MongoDB Apache Hadoop Apache Hive Cloudera Navigator Características Plataforma de streaming y código abierto Maneja flujos de datos en tiempo real a gran escala.
Ceado por LinkedIn.
Se convirtió en un proyecto de la Apache Software Foundation.
Herramienta de código abierto Un servicio de procesamiento de datos en tiempo real y por lotes ofrecido por Google Cloud.
Servicio en la nube proporcionado por Microsoft Azure Altamente escalable.
Alto rendimiento.
Manejar grandes volúmenes de datos.
Plataforma de almacenamiento distribuido que forma parte del ecosistema de Hadoop.
Diseñado para manejar grandes volúmenes de datos.
Base de datos NoSQL popular que puede escalar horizontalmente y manejar grandes cantidades de datos.
Plataforma que permite el almacenamiento y procesamiento distribuido de grandes volúmenes de datos en clústeres de computadoras.
Utiliza el sistema de archivos distribuido HDFS y el modelo de programación MapReduce para procesar datos en paralelo.
Procesamiento y consulta de datos Proporcionar una interfaz y un lenguaje de consulta similar a SQL Es una solución de gestión de datos y gobernanza diseñada para entornos de Big Data, Proporciona capacidades avanzadas de seguimiento, auditoría, búsqueda y gobernanza de datos en un clúster Hadoop.
Logo
Ingesta de Datos Recopila y transporta datos desde diversas fuentes en tiempo real como, por ejemplo, registros de servidores, clics de usuarios, eventos de sensores, registros de aplicaciones, etc. También realiza el procesamiento en tiempo real de flujos de datos, transformándolos y enriqueciéndolos en tiempo real. No es un sistema de Permite la su captura y procesamiento s de datos en tiempo real a medida que fluyen desde la fuente hasta su incorporación en entornos de almacenamien to y análisis Es más conocido por su capacidad de procesamiento y análisis de datos en tiempo real y por lotes, también puede utilizarse para la ingestión de datos en Google Cloud Platform
(GCP),
también puede ser una opción para llevar a cabo este proceso.
Logo
Almacenamien to almacenamiento primario, sin embargo, puede actuar como un almacén de registros de eventos que capturan cambios en los datos.
Gestiona grandes cantidades de datos a medida que se agregan más recursos.
Permite la disponibilidad de datos inclusive si algunos servidores fallan. Es ideal para aplicaciones que generan y almacenan una gran cantidad de datos.
Almacenar grandes volúmenes de datos de manera eficiente en un clúster de servidores dividiendo los datos en bloques fijos de
128 MB o 256
MB por defecto.
Es ideal para el almacenamiento de datos en formato de documentos
JSON (BSON,
Binary JSON,).
En lugar de tablas con esquemas rígidos, también almacena datos en documentos que pueden tener estructuras variables y anidadas.
Almacena grandes volúmenes de datos por bloques, distribuyendo y replicando estos bloques en múltiples nodos del clúster para garantizar disponibilidad y tolerancia a fallos.
Procesamiento
Un servicio de procesamiento de datos en tiempo real y por lotes ofrecido por Google Cloud.
Puede ser utilizado para ingestión, transformación y análisis de datos.
Realiza operaciones que permiten la transformación y análisis en conjuntos de datos grandes y complejos, permitiendo un manejo de la información más amplia y
Logo
Análisis
Permite la modificación o cambio de la estructura, el formato o el contenido de los datos, preparándolos para su posterior uso, análisis o presentación.
Puede ser utilizado análisis de datos, permitiendo examinar grandes cantidades de datos.
fácil de manejar.
Se utiliza en aplicaciones de análisis que requieren la capacidad de manejar y consultar grandes volúmenes de datos en tiempo real.
Transformació n
Puede ser utilizado para la transformación de datos, permitiendo transferir o convertir los datos de un formato o estructura a otro.
Puede ser utilizado para la transformación de datos, permitiendo transferir o convertir los datos de un formato o estructura a otro.
Logo
Almacenamien to a Largo Plazo
Por su tolerancia a fallos que garantiza que los datos estén disponibles incluso si algunos servidores o nodos fallan y su esquema flexible que permite que se puedan realizar cambios que no requieran un tiempo de inactividad y se pueden realizar sin afectar el rendimiento.
Po sus características de disponibilidad, tolerancia a fallos y procesamiento, esenciales para el procesamiento y análisis eficientes de datos es una herramienta útil para el almacenamiento a largo plazo.
Gestión de Metadatos
Proporciona capacidades de gestión de metadatos y gobernanza en el entorno de Cloudera, permitiendo la búsqueda, clasificación y auditoría de los activos de datos en un clúster Hadoop.
Logo
Seguridad
Apache Ranger es un marco de seguridad que proporciona control de acceso basado en políticas para ecosistemas de Big Data como Hadoop, Hive, HBase, etc.
Permite definir políticas de acceso a nivel de columna y fila, lo que proporciona un mayor nivel de granularidad en el acceso a los datos.
Escalabilidad Una plataforma de transmisión de datos en tiempo real que permite la ingestión, el almacenamiento y el procesamiento de flujos de datos a gran escala. Es altamente escalable y se utiliza comúnmente para la transmisión de eventos en tiempo real.
Es adecuado para la escalabilidad horizontal, lo que significa que se pueden agregar más servidores a medida que aumentan los volúmenes de datos y el tráfico.
Gracias a su arquitectura distribuida permite agregar más nodos al clúster para aumentar la capacidad y el rendimiento.
Logo
Consulta
Permite que los usuarios analicen y consulten los datos utilizando el lenguaje SQL familiar, Facilitando la interacción con conjuntos de datos masivos en un entorno distribuido que permite la flexibilidad para la ubicación de datos en diferentes sistemas de gestión de bases de datos (DBMS) de una red.
Logo
Automatizació n
Permite la adquisición de datos desde fuentes como bases de datos, sensores, redes sociales, registros de servidores, entre otros, también puede emplearse para aplicar transformacio nes, limpieza, normalización y enriquecimien to de datos.
Pueden identificar patrones, tendencias y anomalías en los datos sin necesidad de intervención manual constante.
Fuente: Elaboración propia
En la tabla se puede apreciar las similitudes en las arquitecturas Apache Kafka, Apache Nifi, Google Dataflow, Microsoft Azure Data Factory, Apache Cassandra, Hadoop HDFS, MongoDB, Apache Hadoop Apache Hive y Cloudera Navigator, sin embargo, se considera que la arquitectura ofrecida por el Ecosistema Hadoop en sus componentes Apache Kafka, Apache Nifi, Apache Cassandra, Apache Hadoop, Apache Hive. Esto da a entender que el Ecosistema Hadoop ofrece un mayor paquete de posibilidades para implementar una herramienta que facilite la Ingesta, procesamiento, escalabilidad, análisis y automatización, almacenamiento, almacenamiento a largo plazo, Seguridad y consulta de las fuentes obtenidas de la estructuración de los datos recopilados. Otra característica necesaria son los metadatos o estructuración de los datos por medio de la descripción de sus particularidades, es decir, para aplicar el concepto de metadatos, permite que estos sean identificados en su contenido y propiedades para este objetivo se muestra la utilidad de Cloudera Navigator. La norma UNE-ISO 23081-1: 2008 indica que los metadatos representan la “información estructurada o semi estructurada que posibilita la creación, registro, clasificación, acceso, conservación y disposición de los documentos a lo largo del tiempo” (p. 6). Esta estructuración es la fase final en la fase de transformación de los datos en el modelo ETL (Export, transform and Load), extracción, transformación y transporte. Este proceso es esencial, porque es el que permite de la extracción de datos con diferentes características. Como lo indica o Duque Méndez, N. et al. (2017), “Los datos pueden estar representados en diferentes formas de almacenamiento, como por ejemplo archivos planos y repositorios de datos estructurados (bases de datos)” (p. 100).
Vega et al., 2015, como se citó en Carrillo Álvarez (2016) considera necesario contar con una infraestructura que el almacenamiento mediante “un paquete de almacenamiento de datos o
software de base de datos, servidores, almacenamiento y redes utilizados en apoyo de las funciones de transformación de datos y de almacenamiento de datos según sea necesario”. (p. 77). Dicho anteriormente es necesario que el Centro Agroecológico y Empresarial – SENA, disponga de toda una infraestructura software y hardware capaz de procesar y almacenar las grandes cantidades de datos que se generan en cada uno de sus procesos. Sin la implementación de dicha infraestructura, el proceso de estructuración de datos se haría más complejo y costoso pues tendrían que recurrir a agentes externos que les provean, no solo la extracción, transformación, transporte y su estructuración, sino también el almacenamiento.
En cuanto a la extracción misma de los datos, cabe resaltar que esto hace parte de las necesidades del usuario y de la información que se pueda disponer para este proceso. También cabe resaltar que la seguridad de los datos, en su fase de extracción es importante, es decir, que estos datos no puedan estar manipulados, infectados o que sus características originales hayan sido alteradas y que la información extraída pueda ser almacenada con todos los niveles de seguridad tanto para su preservación como para su consulta y uso.
Los autores tiene diferencia en cuanto a conceptos, sin embargo, los planteamientos aportados por cada uno, sintetiza en las distintas maneras de interpretar la misma arquitectura de Big data para el análisis de datos y la obtención de información estructurada que permita una mejor toma de decisiones, no solo en el área involucrada, sino también a nivel institucional, ya que una propuesta como la que se plantea en esta tesis, permitirá que se pueda replicar la experiencia que se pueda obtener, implementado este modelo a nivel institucional.
Se realizó una comparación de los términos de cada uno de los autores, lo que permitió visualizar y conjugar la teoría de Krishnan Kris y Bob Marcus con el modelo planteado por Microsoft, que
permitió establecer que se necesita de un modelo que permita la búsqueda y adquisición de fuentes de datos, su procesamiento y almacenamiento con herramientas como como las del sistema Hadoop, ya que es útil para el tratamiento, procesamiento y almacenamiento de datos y es de código abierto (open source), lo que permite su utilización de manera libre. Figura 8 Ecosistema Hadoop
Fuente: Mondragon Unibertsitatea, 2015, https://es.slideshare.net/uzurutuza/taller-big-datasesioni De igual manera se hizo un comparativo entre Busisness Intelligence (Inteligencia de Negocios) Tradicional que permite a las empresas tomar decisiones con base en la información obtenida de la estructuración de los datos y el Busisness Data Lake que es un repositorio que permite el almacenamiento de grandes cantidades de datos en su formato original. Esta comparación permite determinar cuál de los dos sistemas es el más adecuado en la búsqueda y almacenamiento de los datos y el beneficio que se puede sacar la entidad o empresa que necesite obtener fuentes e información que le permitan anticiparse a las necesidades de los
clientes y a la mejora de los procesos dentro de cada área y que sea un valor agregado, que permite ahorro de tiempo y dinero.
Figura 9 Modelo de estructuración de datos
Fuente: Opuntia Brava, 2019, https://opuntiabrava.ult.edu.cu/index.php/opuntiabrava/article/view/968/1280#info Se identificó que cada modelo tiene unas arquitecturas que se podría combinar, para permitir un mejor manejo en la herramienta que se vaya a implementar.
• Para la primera fase de la implantación se debe hacer la recolección de datos, que es el
primer paso por realizar para buscar tendencias dentro de los datos, es decir, diferentes tipos de formatos que puedan ser analizados.
• Después se necesita hacer la carga de los datos, en este proceso se puede, como se observa
en la imagen se puede utilizar Hadoop que permite el procesamiento en tiempo real. Esta herramienta aporta a la estructuración de los datos, lo cual permite que estos se puedan utilizar eficientemente.
• En la tercera fase de transformación de los datos, es decir, el cambio de formato a otro que
se pueda leer y utilizar. En esta fase se debe contar con metadatos que permitan la identificación de los datos recopilados desde este proceso, y por último se debe, según lo indica la tabla comparativa, extraer los datos para el análisis y visualización de la información.
4.2 Cuestionario
La indagación de distintas fuentes de consulta nos permitió reconocer el uso que se da al almacenamiento de la información del área de certificación del Centro Agroecológico y Empresarial en la actualidad, se optó por enviar el enlace del cuestionario mediante correo electrónico institucional a veinte (20) funcionarios lideres de área del centro con previa autorización por parte de la subdirección del centro por medio de la carta de autorización (ver anexo 3). El cuestionario (Ver Anexo 2) que se aplicó es de tipología estructurada porque toda la información que se recolecto se presenta de forma explícita y estandarizada, se dividió en 10 preguntas de selección múltiple, planeadas para tener en cuenta: Propósito del cuestionario, debe estar relacionado con los objetivos y el problema de investigación, pero éste, cómo instrumento, no necesariamente está obligado a cubrir la totalidad de los objetivos del estudio, que es caracterizar los modelos de Big Data para la gestión documental en la administración de grandes volúmenes de datos y su transformación en fuentes de información.
Población a la que va dirigido, es importante delimitar la población objeto de estudio para extraer la muestra representativa, configurar un censo y proyectar el nivel de recursos económicos y materiales necesarios para concretar el estudio.
Elaboración del cuestionario, debe considerarse en primer lugar cuál es su objetivo, que a su vez tendría que estar en consonancia con los objetivos específicos de la investigación. Las preguntas redactadas en los cuestionarios deben representar fielmente el contenido de lo investigado y ser comprendidas por los encuestados en una primera lectura.
Gráfico 1: Primera pregunta ¿El CAE compra alguno de los siguientes servicios de Cloud Computing usados a través de internet?
Nota: El gráfico presenta las respuestas obtenidas para la pregunta 1 del cuestionario El gráfico anterior evidencia que, la mayoría de las personas encuestadas consideran que el Email es el servicio de Cloud Computing más utilizado en el CAE, con un 85.7% de las respuestas, esto se debe al uso principal de Cloud Computing que se da a través del correo electrónico como servicio de computación en la nube tiene varias ventajas, incluida una mayor flexibilidad, ya que el correo electrónico ya no está vinculado a un dispositivo cliente específico. Estas son algunas características clave del correo electrónico como servicio de computación en la nube:
• Escalabilidad: uno de los principales beneficios de la computación en la nube es la
capacidad de aumentar los recursos asignados a una solución de forma dinámica. Esto significa que un servicio de correo electrónico basado en la nube no estará tecnológicamente restringido a una cierta cantidad de cuentas o espacio de almacenamiento.
• Servicios adicionales: las soluciones de correo electrónico basadas en la nube a menudo
ofrecen servicios adicionales más allá del correo electrónico, como los que ofrece Beservices con Microsoft Exchange.
• Accesibilidad: se puede acceder al correo electrónico basado en la nube desde cualquier
dispositivo con un navegador compatible, lo que lo hace más accesible que las soluciones de correo electrónico tradicionales que requieren software o clientes específicos.
• Seguridad: algunos argumentan que los servicios de correo electrónico basados en la nube
no son seguros porque los mensajes se almacenan en un servidor que alberga muchos clientes diferentes. Sin embargo, la mayoría de los proveedores de la nube ofrecen medidas de seguridad para protegerse contra piratas informáticos y otras amenazas. En general, los servicios de correo electrónico basados en la nube se han transformado de simples sistemas de mensajería a suites de trabajo completas, que ofrecen escalabilidad, accesibilidad y servicios adicionales más allá del correo electrónico. El correo electrónico y la información que contiene, incluidos archivos adjuntos, imágenes, videos, etcétera, forman parte de los datos que están guardados dentro del grupo de información que la era del Big data considera desorganizada, lo cual provoca que esté expuesta a ser duplicada, triplicada y guardada varias veces, en distintas versiones, exactamente como se ha explicado arriba. Una forma muy útil de ser parte de la solución que busca la era del Big data consiste en
contratar planes o paquetes que te permitan sincronizar toda la información contenida en tu correo electrónico para que esta se comience a almacenar en la nube de forma organizada. El almacenamiento en ficheros es considerado el segundo servicio más utilizado con un 28.6%, en tercer lugar, se encuentra el software Office, las aplicaciones informáticas financieras o contables y las aplicaciones informáticas para gestionar información sobre clientes, representan el 14.3% de las respuestas y sin respuestas se ubican el servidos Hosting y capacidad de computación para ejecutar el software usado por la empresa.
Gráfico 2: Segunda pregunta ¿El CAE compra algún servicio de Cloud Computing? Entregado desde:
Nota: El gráfico representa las respuestas obtenidas a la pregunta 2 De acuerdo con las respuestas presentadas los funcionarios, al segundo cuestionamiento, evidencia que la mayoría de los servicios de Cloud Computing del centro son entregados a través de servidores reservados exclusivamente para el CAE, este se evidencia con 57.1% de las respuestas, donde los servicios compartidos de Cloud Computing, también son de gran influencia en el funcionamiento del sistema evidenciado en el 42.9% de las respuestas.
Los resultados se muestran en el análisis de la información a partir de los beneficios de tener un servidor en la nube que se ocupe de sus necesidades informáticas supera con creces la necesidad de mantener su propio servidor local. Sin embargo, pasar de estos métodos fuera de línea a uno en línea requiere un cambio en la forma en que la entidad ve los datos. Esta renovación de la vista de los datos viene de la mano con la adopción de Big Data como un aspecto esencial del sistema de gestión de datos de la compañía.
Cloud computing es la disponibilidad bajo demanda de recursos de computación como servicios a través de Internet, lo que permite tener intercomunicados todos los centros a nivel nacional. Los servicios de cloud computing son todas las infraestructuras, las plataformas, las tecnologías o los sistemas de software a los que acceden los usuarios a través de Internet sin tener que descargar software adicional, adicionalmente estos se basan en el concepto de compartir recursos informáticos, software e información bajo demanda por Internet. El Servicios Nacional de Aprendizaje busca llegar a integrar los siguientes tres tipos de modelos de servicio de cloud computing:
• Infraestructura como servicio (IaaS): ofrece servicios de computación y almacenamiento.
• Plataforma como servicio (PaaS): proporciona un entorno de desarrollo y despliegue para
crear aplicaciones en la nube.
• Software como servicio (SaaS): facilita aplicaciones como servicios.
Los servicios que se utilizan en el CAE incluyen CRM y ERPs, bases de datos, almacenaje y transferencia de archivos, y servicios de correo y calendario.
Gráfico 3: Tercera pregunta ¿Durante 2022, el CAE implemento o desarrollo algún modelo de Big Data? ¿El CAE implemento un modelo de Big Data en alguno de los siguientes procesos?
Nota: El gráfico anterior muestra las respuestas obtenidas a la pregunta 3 En relación con el tercer planteamiento la gráfica evidencia, que la mayoría de los sujetos encuestados reconoce, que los datos por geolocalización a partir del uso de dispositivos son un modelo de Big Data, con un 57.1% de las respuestas, cabe aclarar que no se realizó ninguna explicación o conceptualización a los encuestados sobre que es un modelo de Big Data, su funcionalidad y requisitos, las respuestas aquí obtenidas son de sus conocimientos previos. El 42.9% de los encuestados no logra evidenciar la implementación de un modelo de Big Data a partir de: datos generados a partir de medios sociales, datos a partir de sensores o dispositivos inteligentes y otras fuentes de Big Data no especificadas en el cuestionario.
Las respuestas con mayor porcentaje, el análisis de información se da a través de los datos de geolocalización se refieren a la información sobre la ubicación física de un dispositivo, como una computadora o un teléfono móvil. Estos datos se pueden obtener de varias maneras, incluso a través de direcciones IP o coordenadas GPS. Los datos de geolocalización se pueden utilizar para una variedad de propósitos, como proporcionar servicios basados en la ubicación o personalizar el
contenido. Es importante tener en cuenta que la recopilación y el uso de datos de geolocalización plantean problemas de privacidad. Los usuarios deben ser conscientes de cómo se recopilan y utilizan sus datos de ubicación, y las empresas deben usar las herramientas de geolocalización de manera responsable.
Gráfico 4: Cuarta pregunta ¿El CAE usó alguno de los siguientes métodos para el análisis de grandes fuentes de datos (Big Data)?
Nota: La gráfica anterior muestra las respuestas obtenidas a la pregunta 3 Para el sexto cuestionamiento, se analizó la gráfica, se evidencia que la mayoría de los encuestados considera que el método de análisis de información que más se utiliza en el centro es el procesamiento del lenguaje natural, generación de lenguaje natural o reconocimiento de voz PLN, con un 57.1% de las respuestas, en donde el 42.9% de los encuestados consideran que el análisis de información se da a través del aprendizaje automático o Machine learning. El mayor porcentaje de las respuestas el análisis de información se da a través del procesamiento de lenguaje natural, como una rama de la informática y la inteligencia artificial que se ocupa de dar a las computadoras la capacidad de comprender textos y palabras habladas de la misma manera que los seres humanos. El PLN se utiliza para analizar, interpretar y generar
lenguaje natural, lo que permite al centro extraer información útil de grandes cantidades de datos no estructurados. La generación del lenguaje natural, por medio del es el uso de la programación de inteligencia artificial (IA) para producir narrativa escrita o hablada a partir de un conjunto de datos en los procesos de certificación. La GLN está relacionada con la lingüística computacional, el procesamiento del lenguaje natural (NLP) y la comprensión del lenguaje natural (NLU). La investigación en GLN se enfoca en construir programas de computadora que brinden puntos de datos con contexto. El sofisticado software NLG tiene la capacidad de extraer grandes cantidades de datos numéricos, identificar patrones y compartir esa información de una manera que sea fácil de entender en los procesos de registro y control, visitas de pares y certificación.
Gráfico 5: Quinta pregunta Si el CAE no realizó análisis de Big Data, indique si fue por alguno (s) de los siguientes:
Nota: La gráfica anterior muestra las respuestas obtenidas a la pregunta 5 Por la formulación del quinto planteamiento, los datos recolectados muestran que, se identifica que el 57.1% de los encuestados consideran que el Centro Agroecológico y Empresarial no realizo un análisis de Big Data principalmente porque el coste parece demasiado elevado comparado con los beneficios, el 28.6% considera que no se adelantó este proceso porque la infraestructura TIC es insuficiente, no es la prioridad en sus procesos y dificultades para cumplir
con las leyes de privacidad, y el 14.3% por falta de los recursos humanos, fuentes insuficientes de Big Data, consideran que el análisis de Big Data no es útil y otros factores. El mayor resultado para el análisis de Big Data en los procesos de examinar grandes cantidades de datos para descubrir patrones ocultos, correlaciones, tendencias de mercado y otra información útil que puede ayudar a las organizaciones a tomar decisiones comerciales informadas. Implica recopilar datos de una variedad de fuentes, incluidos datos estructurados y no estructurados, y analizarlos a partir de herramientas de análisis avanzadas, como modelos predictivos, algoritmos estadísticos y análisis hipotéticos impulsados por sistemas de análisis. Las fuentes de datos utilizadas para el análisis de Big data pueden no encajar en las bases de datos tradicionales y pueden incluir comentarios compartidos públicamente en redes sociales y sitios web, dispositivos electrónicos y aplicaciones personales, cuestionarios, compras de productos y registros electrónicos. Los grandes datos se almacenan con mayor frecuencia en bases de datos informáticas y se analizan mediante un software diseñado específicamente para manejar conjuntos de datos grandes y complejos. Los beneficios del análisis de Big data incluyen la gestión de riesgos, la eficiencia operativa, los conocimientos de los clientes y el desarrollo de productos. El análisis de Big data se puede realizar a través de varias herramientas, como Hadoop, que es un marco de código abierto para almacenar y procesar grandes conjuntos de datos.
Gráfico 6: Sexta pregunta ¿El CAE cuenta con la gobernanza de datos necesaria para prosperar?
Nota: la gráfica anterior demuestra las respuestas obtenidas a la pregunta 6 El análisis de los resultados, le mostro al equipo que el 71.4% de los encuestados que el CAE cuenta con la gobernanza de datos necesaria para prosperar y el 28.6% no lo considera así, esto se puede dar por dos variables: los funcionarios encuestados no tienen claro el concepto de gobernanza de datos, es decir, por esto consideran que si centro si implementa dicho proceso, o la segunda variable el que el 28.6% de los encuestados no conocen a fondo todos los procesos y procedimiento desarrollados en el centro.
Sin embargo, se recomienda orientar una capacitación a todos los funcionarios en la cual se exponga la implementación de la gobernanza de datos, la cual se refiere a la gestión de los datos de una organización, desde su adquisición hasta su eliminación, para su uso. Es un enfoque riguroso para gestionar los datos durante su ciclo de vida. La gobernanza de datos empresariales abarca las políticas y procedimientos que se implementan para garantizar que los datos de una organización sean precisos y que se manejen correctamente al ingresan, almacenan, manejan,
acceden y eliminan. Algunas de las responsabilidades de gobernanza incluyen establecer políticas definidas, procedimientos sólidos y tecnologías adecuadas.
Las iniciativas de gobierno de datos mejoran la calidad de los datos al asignar un equipo responsable de la precisión, integridad, consistencia, puntualidad, validez y singularidad de los datos. Estas iniciativas pueden tener como objetivo lograr una serie de objetivos que incluyen ofrecer una mejor visibilidad a los clientes internos y externos (como la gestión de la cadena de suministro). En resumen, la gobernanza de datos es un enfoque riguroso para gestionar los datos durante su ciclo de vida. Incluye todas las medidas adoptadas para garantizar que los datos sean seguros, privados y precisos. Las iniciativas de gobierno de datos mejoran la calidad de los datos al asignar un equipo responsable.
Gráfico 7: Séptima pregunta ¿Qué nivel de importancia tendría para usted, los siguientes aspectos para obtener una analítica de datos masivos que brinde un mejor apoyo en la gestión de sus procesos?
Nota: La gráfica anterior evidencia las respuestas obtenidas a la pregunta 7 El séptimo cuestionamiento explora el conocimiento en, analítica de datos masivos tenido en cuenta los siguientes aspectos: incluir más fuentes de datos externos, incluir más fuentes de
datos internos, retirar algunas fuentes de datos, carga automatizada e integración de los datos dentro de un flujo de procesos, para posterior análisis y toma de decisiones, y análisis de la información y generación de conocimiento, para toma de decisiones. Donde se evidencia que según sus conocimientos el mayor porcentaje de analítica de datos masivos se da a través de la carga automatizada e integración de los datos dentro de un flujo de procesos, si se logra integrar este proceso con el análisis de Big data se puede brindar un mejor soporte en la gestión de los procesos académicos, a partir de:
• Administrar recursos de manera más efectiva: el análisis de Big Data puede proporcionar
información detallada para la asignación y el uso de recursos, lo que lleva a un aumento en los ingresos y procesos comerciales más efectivos.
• Gestión de residuos: con el análisis de datos, las empresas pueden idear estrategias
eficientes de gestión de residuos, lo que lleva a una reducción del desperdicio de recursos y un aumento de las ganancias.
• Aumento de la productividad: el análisis de Big Data puede desempeñar un papel vital en
la contratación y gestión de recursos humanos, lo que lleva a un aumento de la productividad.
• Prevención de actividades fraudulentas: el análisis de Big Data se puede utilizar para
detectar actividades fraudulentas y evitar que sucedan.
• Descubrir patrones y correlaciones ocultos: el análisis de Big data puede ayudar a descubrir
patrones ocultos, correlaciones, tendencias del mercado y preferencias de los clientes que pueden ayudar a las organizaciones a tomar decisiones comerciales informadas.
• Brindar
recomendaciones específicas:
el análisis prescriptivo proporciona recomendaciones específicas sobre lo que se debe hacer mejor
• Mejorar la toma de decisiones: el análisis de Big data se puede utilizar para una mejor toma
de decisiones, lo que lleva a mejores resultados comerciales.
Este resultado evidencia la carencia de un procesos y procedimiento para analizar correctamente los datos producidos a diario en el centro, adicionalmente la falta de capacitación a los funcionarios de los procesos que se pueden agilizar a través de una herramienta poderosa que puede ayudar al centro a optimizar sus procesos comerciales y mantenerse competitivas.
Gráfico 8: Octava pregunta Basado en su conocimiento y de acuerdo con el proceso de negocio que gestiona, determine el nivel de impacto de los siguientes beneficios empresariales derivados del uso y análisis de mayores fuentes de datos internas y externas.
Nota: la gráfica anterior evidencia las respuestas obtenidas para la pregunta 8 Este planteamiento permitió establecer que, la mayoría de los funcionarios consideran que el impacto del uso y análisis de mayores fuentes de datos internas y externas se da principalmente a través del desarrollo de nuevos productos y servicios, y mejora de la competitividad, sin dejar de lado la mejora de la experiencia del cliente y aumento de índices de ingreso y permanencia de clientes, todo esto basado en los conocimiento y experiencias obtenidas durante el tiempo que han
laborado en el centro. Se recomienda brindar capacitaciones a los funcionarios con el fin de integrar y mejorar los procesos y procedimiento que se llevan a cabo en cada área basados en el uso y análisis de fuentes mayores de datos internos y externos puede proporcionar varios beneficios empresariales, según los siguientes resultados de búsqueda:
• Obtener información valiosa: El análisis de datos permite a las empresas obtener
información valiosa al tiempo que ahorran tiempo y esfuerzo. Los datos pueden ayudar a las empresas a comprender mejor a sus clientes, mejorar sus campañas publicitarias, personalizar su contenido y mejorar sus resultados
• Reducción de costes: La analítica de datos puede ayudar a reducir costes en las
empresas.
• Toma de decisiones: La analítica de datos puede ayudar en la toma de decisiones
empresariales
• Innovación: La analítica de datos puede fomentar la innovación en las empresas
• Fidelización de clientes: La analítica de datos puede ayudar a fidelizar clientes.
• Mayor eficiencia: El análisis de datos puede aumentar la eficiencia empresarial
• Personalización: El análisis de datos puede ayudar a personalizar el contenido y las
ofertas para los clientes
• Entender patrones de comportamiento: El análisis de datos puede ayudar a entender los
patrones de comportamiento de los clientes.
• Ahorro de tiempo: El análisis de datos puede ayudar a ahorrar tiempo en las empresas.
• Revelar nuevos conocimientos: El análisis de datos puede revelar nuevos
conocimientos empresariales.
Gráfico 9: Novena pregunta ¿Utiliza el centro alguna de las siguientes medidas de seguridad TIC?
Nota: La gráfica anterior representa los resultados obtenidos de la pregunta 9 De acuerdo con los resultados obtenidos, es necesario realizar un validación de los sistemas de seguridad de información en el centro, con autenticación de doble control, correos electrónicos, mensajes de texto, un 57.1% de los encuestados respondieron que las medidas de seguridad más utilizadas en el centro son mantener el software actualizado, que incluya el sistema operativo, control de acceso a la red (gestión del acceso de dispositivos y usuarios a la red de la empresa) y evaluación de riesgos TIC, es decir, evaluación periódica de la probabilidad y consecuencias de incidentes de seguridad TIC. Un 42.9% de los funcionarios encuestados consideran que las medidas de seguridad a través de VPN, Test de seguridad y copias de seguridad El mayor porcentaje a través de la autenticación mediante contraseña fuerte, es decir, con una longitud mínima de 8 valores alfanuméricos, cambiándose periódicamente; control de acceso a la red (gestión del acceso de dispositivos y usuarios a la red de la empresa) y evaluación de riesgos TIC, es decir, evaluación periódica de la probabilidad y consecuencias de incidentes de seguridad
TIC. La seguridad TIC es la responsable de implantar las medidas de seguridad necesarias para procurar la protección de la información a través de diferentes dispositivos y sistemas informáticos. A continuación, se presentan algunas medidas de seguridad TIC que se pueden tomar para mejorar la protección de los datos académicos:
• Limitar el acceso a determinados ficheros solo a un círculo cerrado de usuario
• Establecer diferentes roles que permitan la consulta, modificación o borrado de archivos
según el nivel de acceso
• Controlar los accesos de cada usuario
• Activar el antivirus
• Actualizar tanto el software como el hardware
• Vigilar las contraseñas
• Realizar copias de seguridad
• Usar contraseñas seguras
• Proteger el correo electrónico con filtros antispam y antiphishing
Además, es importante formar a los usuarios en medidas de seguridad TIC para evitar riesgos en la empresa. También se pueden establecer medidas físicas, como controles de acceso al emplazamiento y mantenimiento del nivel de humedad óptimo, para proteger los dispositivos y sistemas informáticos. En general, la gestión de la seguridad TIC se encarga de que se realicen todos los procedimientos y normas establecidas para prevenir ante ataques y fortalecer la seguridad TIC de la entidad.
Gráfico 10: Decima pregunta ¿Qué técnicas de machine learning han implementado?
Nota: El gráfico anterior evidencia los resultados a la pregunta 10 La pregunta decima muestra que entre los encuestados el 42.9% reconocen que el Centro técnicas de machine learning pero en contraste el otro 42.9% consideran que si se han implementado técnicas a través del aprendizaje supervisado, lo que se puede dar porque las capacitaciones e implementación de los servicios se brindan segmentados por áreas, lo cual genera un reproceso al no estar articuladas todas las áreas con el fin de garantizar la prestación del servicio. Pero también el 14.3% de los encuestado clasifica la implementación de machine learning a través de un aprendizaje reforzado, lo que se da por la necesidad de implementar y desarrollar los procesos y procedimientos lo cual lleva al funcionario a realizar un aprendizaje autónomo y externo.
En relación con los resultados obtenidos anteriormente se hace la recomendación al centro la implementación de una técnica de machine learning desde un campo de la inteligencia artificial (IA) con capacitación para todos los funcionarios con el fin de garantizar la veracidad y efectividad de los procesos que se centra en el uso de datos y algoritmos para imitar la forma en que los
humanos aprenden. Implica construir modelos basados en datos de muestra, conocidos como datos de entrenamiento, para hacer predicciones o tomar decisiones sin estar programado explícitamente para hacerlo. Los algoritmos de aprendizaje automático se utilizan en una amplia variedad de aplicaciones, como en medicina, filtrado de correo electrónico, reconocimiento de voz, agricultura y visión artificial.
Hay dos tipos principales de aprendizaje automático: aprendizaje supervisado y aprendizaje no supervisado. El aprendizaje supervisado implica entrenar un modelo con datos etiquetados, donde se conoce el resultado correcto, para hacer predicciones sobre datos nuevos sin etiquetar. El aprendizaje no supervisado implica entrenar un modelo en datos no etiquetados para identificar patrones y relaciones dentro de los datos.
CAPITULO V: REQUERIMIENTOS FUNCIONALES DEL MODELO DE BIG
DATA PARA LA GESTIÓN DOCUMENTAL
La denominación de gestión documental y la relevancia que esta tiene en cualquier tipo de organizaciones, en especial para la en el área de certificación del Centro Agroecológico y Empresarial – SENA. La gestión documental es conocida como “el conjunto de actividades administrativas y técnicas tendientes a la planificación, manejo y organización de la documentación producida y recibida por las entidades, desde su origen hasta su destino final, con el objeto de facilitar su utilización y conservación” (AGN, 2000), mediante la coordinación y el control en la generación, recepción, organización, almacenamiento, preservación, conservación, disposición y acceso a la documentación e información requerida por las personas a quienes les será útil.
A medida que una entidad u organización genera documentación e información interna y externa en diferentes formatos es necesario gestionarla, de lo contrario se presentaran problemas tales como la producción sin control, incremento en versiones, duplicidad o perdida de información, aumento en número de copias innecesarias y desperdicio de insumos, entre otros. De acuerdo con lo anterior, se identifica la necesidad de administrar adecuadamente grandes volúmenes de datos. Al consultar fuentes primarias, se encontró que el desarrollo de herramientas tecnológicas es una preocupación cotidiana en cada sector de la educación y el desarrollo social. Aunque las tecnologías diseñan programas o herramientas, necesitan trabajo colaborativo para ejecutar este tipo de labores, en este caso, la gestión documental. En este orden de ideas, se considera necesario que en los procesos documentales se incorpore la tecnología del Big data, de una forma que permita a estos procesar, identificar, almacenar, analizar y describir enormes cantidades de datos (estructurados, no estructurados y
semiestructurados). El objetivo de este capítulo es evidenciar los requisitos funcionales a partir Big data como una solución para el análisis, la transformación, la recuperación y la conservación de la información a partir de la interpretación de las evidencias encontradas. Según el Documento Conpes 3920, Política Nacional de Explotación de Datos (Big data), en Colombia “desde hace aproximadamente veinte años se identificó la necesidad de emplear las Tecnologías de la Información y las Comunicaciones para aumentar la eficiencia en el desarrollo de los procesos y la gestión académica” (Departamento Nacional de Planeación, 2018, p. 3). Esto se debe a que las reglas para la gestión de documentos electrónicos y la conformación de expedientes fueron definidas recientemente por el Archivo General de la Nación mediante el Acuerdo 003 de 2015.
Un aspecto esencial en el diseño o rediseño de un modelo de Biga Data para la gestión documental es la determinación de requisitos. En la metodología DIRKS, Designing and Implementing Record keeping Systems adoptada por los Australian National, Archives se asume en la tercera etapa, “Identificación de Requisitos Funcionales del modelo de Big Data para la Gestión Documental”. No obstante, elaborar requisitos es una práctica que proviene del ámbito de la ingeniería de software, en específico de la ingeniería de requisitos, y se orienta a “la aplicación de métodos de análisis de requisitos que establecen una relación entre la necesidad de informatización de procesos y el proyecto de software que atenderá tales necesidades”. Tanto desde el dominio de la ingeniería de requisitos como desde el de la gestión documental se han dado a conocer disímiles definiciones y clasificaciones de requisito. El Institute of Electrical and Electronics Engineers ofrece una definición general: A) Condición o capacidad demandada por un usuario para resolver un problema o alcanzar un objetivo; B) Condición o capacidad que debe satisfacer o contener un sistema o un componente de este para satisfacer un
contrato, estándar o especificación u otro documento formalmente establecido, y C) Representación documentada de una condición o capacidad, como se definió en A y B. En el ámbito de la gestión documental, InterPARES define requisito como “una restricción, demanda, condición, necesidad o parámetro que debe ser identificado o satisfecho usualmente dentro de un marco de tiempo o como un prerrequisito”. Para el desarrollo de esta propuesta se tuvieron en cuenta dos tipos de requisitos, que al decir de Phol, Somerville, y Young, han sido los más utilizados: funcionales y no funcionales. Se consideraron requisitos funcionales las condiciones y pautas de comportamiento que el sistema debe cumplir para garantizar su funcionalidad, así como la calidad de la información que se genera y mantiene como evidencia y memoria de las transacciones y actividades propias de la institución. Se consideraron requisitos no funcionales los atributos que establecen restricciones al sistema.
Se puede afirmar que el primer paso para un correcto uso del Big data en la gestión documental es la centralización e ingesta de información. Ahora bien, “la importancia del Big data radica no solo en la facilidad de manejo del volumen de datos (como el nombre Big data podría hacer presuponer), sino en la variedad de estos” (Duque-Jaramillo y Villa-Enciso, 2017, p. 5). Por consiguiente, esta tecnología es vital para el correcto funcionamiento e implementación de la herramienta, ya que además de recuperar y analizar la información, permitirá realizar una correcta gestión documental, donde prime la preservación y el almacén.
El uso del Big data en la archivística es muy importante, dado que un sistema de gestión de documentos electrónicos contiene todos los datos y la información de una organización, de acuerdo con su estructura funcional y los servicios que presta al ciudadano, y su función básica siempre será el almacenamiento, procesamiento y recuperación de información (Colmenares, 2016, p. 12) los documentos que hacen parte de una organización. Ahora bien, el objetivo más
importante en las organizaciones es generar cultura frente a la gestión documental y el manejo adecuado de la información, ya que esta es el área que realmente requiere un cambio estratégico. Para la construcción de un negocio se desarrolla una guía para el procesamiento de la información que se involucra en el desarrollo de las habilidades, validan la pertinencia no solo la captura de la data, además se tienen en cuenta las relaciones con los objetivos propuestos. Las técnicas del Big data son una nueva oportunidad de negocio para quienes buscan generar oportunidades, retos y nuevas propuestas en esta área. El Big data permite el almacenamiento de grandes cantidades de datos con cinco criterios: volumen, variedad, velocidad, veracidad y valor, que optimizan los procesos, garantizan la veracidad de la información y facilitan el acceso a ella. El primer paso para un correcto uso del Big data en la gestión documental es la centralización e ingesta de información. La integración de datos y la fusión o implementación de estas herramientas son consideradas totalmente viables en el CAE, como una combinación de tecnologías que debe ser desarrollada por un grupo de colaboradores expertos que hagan de esta una herramienta innovadora para responder a las necesidades descritas en este documento. Estos requerimientos proporcionan la base para diseñar una solución que cumpla con las necesidades específicas del centro, mejore la eficiencia operativa y garantice la integridad y seguridad de los datos.
5.1 Para el modelo de Big Data para la gestión documental
Ingestión de datos:
• El sistema debe ser capaz de recibir y procesar documentos en diversos formatos,
como archivos PDF, documentos de Microsoft Word, imágenes escaneadas, etc.
• Debe permitir la carga de documentos de manera manual o automática a través de
integraciones con sistemas externos.
Almacenamiento escalable:
• El sistema debe contar con una arquitectura de almacenamiento escalable que pueda
manejar grandes volúmenes de documentos y metadatos asociados. Indexación y búsqueda eficiente:
• Se requiere una funcionalidad de indexación que permita etiquetar y categorizar
documentos según metadatos específicos.
• El sistema debe ofrecer capacidades de búsqueda avanzada que permitan a los usuarios
buscar documentos por palabras clave, fechas, categorías, y otros criterios relevantes. Gestión de versiones:
• Debe ser posible gestionar múltiples versiones de un mismo documento y rastrear los
cambios realizados en cada versión.
Control de acceso y seguridad:
• El sistema debe contar con un sistema de autenticación y autorización robusto para
garantizar que solo usuarios autorizados tengan acceso a los documentos.
• Debe ser posible establecer diferentes niveles de permisos y roles para los usuarios,
asegurando que solo vean la información que tienen permitido ver. Flujo de trabajo y colaboración:
• Debe ser posible definir flujos de trabajo que guíen el proceso de revisión, aprobación
y colaboración en los documentos.
• El sistema debe permitir comentarios y anotaciones en los documentos para facilitar la
colaboración entre usuarios.
Integración con herramientas externas:
• Debe ser posible integrar el sistema de gestión documental con otras herramientas
utilizadas en la organización, como sistemas de correo electrónico, CRM o ERP. Auditoría y registro de actividades:
• El sistema debe ser capaz de registrar y auditar las acciones realizadas por los usuarios,
incluyendo la creación, modificación y eliminación de documentos. Automatización de procesos:
• Se requiere la posibilidad de automatizar ciertos procesos, como la generación
automática de informes a partir de los documentos almacenados. Respaldo y recuperación:
• Debe existir un mecanismo de respaldo regular para asegurar la disponibilidad y
recuperación de los documentos en caso de fallos.
Cumplimiento normativo:
• El sistema debe cumplir con los estándares y regulaciones de seguridad y privacidad de
datos relevantes para la industria y la ubicación geográfica.
5.2 Para el modelo de Big Data para la gestión documental en el CAE
1. Gestión de Documentos Educativos: El sistema debe ser capaz de gestionar documentos
educativos, como planes de estudio, apuntes de clases, material didáctico y presentaciones.
2. Integración con Plataformas de Aprendizaje: Debe ser posible integrar el sistema de
gestión documental con plataformas de aprendizaje en línea, como sistemas de gestión del aprendizaje (LMS), para facilitar la distribución de materiales a estudiantes y docentes.
3. Categorización y Etiquetado: Se requiere una función de categorización y etiquetado para
organizar los documentos según asignaturas, niveles educativos, temas, etc.
4. Control de Versiones y Revisiones: El sistema debe permitir el control de versiones de los
documentos, de manera que los cambios realizados en los materiales puedan ser rastreados y revertidos si es necesario.
5. Acceso por Roles: Debe ser posible establecer diferentes niveles de acceso y permisos para
estudiantes, docentes y administradores, garantizando que solo tengan acceso a los documentos relevantes para su rol.
6. Recopilación de Trabajos de Estudiantes: El sistema debe permitir a los estudiantes enviar
y almacenar trabajos y proyectos directamente desde sus cuentas de usuario.
7. Colaboración en Línea: Debe ser posible permitir la colaboración en línea entre docentes
y estudiantes en los documentos, incluyendo comentarios y anotaciones.
8. Seguimiento de Progreso: El sistema debe ser capaz de realizar un seguimiento del
progreso de los estudiantes en función de los documentos accedidos y las interacciones con los materiales.
9. Auditoría y Registro de Actividades: Se requiere un registro detallado de las acciones
realizadas por los usuarios en relación con los documentos, para fines de auditoría y seguridad.
10. Automatización de Procesos Administrativos: El sistema debe ser capaz de automatizar
ciertos procesos administrativos, como la creación de horarios, la generación de informes de evaluación y la programación de eventos.
11. Integración con Herramientas de Evaluación: Debe ser posible integrar el sistema con
herramientas de evaluación, como sistemas de calificación electrónica, para registrar y gestionar resultados de exámenes y evaluaciones.
12. Respaldo y Recuperación de Datos: Se requiere un sistema de respaldo regular para
garantizar la disponibilidad y recuperación de documentos en caso de pérdida de datos.
13. Cumplimiento Normativo Educativo: El sistema debe cumplir con las regulaciones y
estándares de privacidad y seguridad de datos específicos de la educación.
5.3 Modelo de Big Data para la gestión documental en el área de certificación
Almacenamiento escalable:
• El sistema debe tener la capacidad de almacenar una gran cantidad de documentos de
certificación de estudiantes, incluyendo diplomas, títulos y certificados. Indexación y búsqueda eficiente:
• Se requiere una función de indexación que permita buscar y recuperar documentos de
certificación basados en nombres de estudiantes, números de identificación u otros metadatos relevantes.
Gestión de versiones y autenticidad:
• El sistema debe ser capaz de gestionar diferentes versiones de los documentos de
certificación y asegurar su autenticidad para prevenir falsificaciones. Acceso controlado y seguridad:
• Se deben implementar controles de acceso estrictos para garantizar que solo personal
autorizado pueda acceder y modificar los documentos de certificación. Registro de emisión y entrega:
• El sistema debe registrar de manera detallada cuándo se emitió y entregó cada
documento de certificación a los estudiantes.
Generación automatizada de documentos:
• Se requiere la capacidad de generar documentos de certificación automáticamente,
incluyendo la inclusión de información personalizada de cada estudiante. Flujo de trabajo de certificación:
• El sistema debe permitir establecer flujos de trabajo para la aprobación y firma
electrónica de los documentos de certificación por parte de autoridades relevantes. Notificaciones y alertas:
• Debe ser posible configurar notificaciones automáticas para informar a los estudiantes
y al personal sobre la emisión y disponibilidad de los documentos de certificación. Integración con sistemas externos:
• El sistema debe ser capaz de integrarse con sistemas de información estudiantil y bases
de datos de la institución para obtener y actualizar datos de estudiantes. Cumplimiento legal y normativo:
• El sistema debe cumplir con regulaciones y estándares legales en cuanto a la emisión y
manejo de documentos de certificación, incluyendo requisitos de firma electrónica. Respaldo y recuperación de datos:
• Se debe implementar un sistema de respaldo regular para asegurar la disponibilidad y
recuperación de los documentos de certificación en caso de fallos. Generación de informes y estadísticas:
• El sistema debe ser capaz de generar informes y estadísticas relacionadas con la emisión
y entrega de documentos de certificación.
Seguimiento de plazos y vencimientos:
• El sistema debe alertar al personal sobre plazos y vencimientos de certificaciones para
asegurar que los documentos se emitan y entreguen a tiempo.
Estos requerimientos funcionales forman una base sólida para implementar un modelo de Big Data efectivo para la gestión documental en el CAE, este ofrece oportunidades sin precedentes para comprender y predecir patrones de comportamiento estudiantil, tendencias de inscripción, eficacia de programas académicos y otras variables clave. Mediante el análisis de estos datos masivos, el CAE puede tomar decisiones fundamentadas y adaptar su oferta educativa a las necesidades cambiantes de los aprendices y del entorno. Lo cual apoya la toma de decisiones desde las direcciones a partir de las siguientes variables:
Claridad y dirección: Los requerimientos funcionales definen de manera precisa y detallada qué se espera lograr con el modelo de Big Data. Establecen una dirección clara para el desarrollo y ayudan a evitar malentendidos entre los miembros del equipo y los stakeholders.
Alineación con objetivos: Los requerimientos funcionales permiten alinear el modelo de Big Data con los objetivos estratégicos de la institución educativa. Esto asegura que el modelo sea una solución que realmente aborde las necesidades y desafíos específicos de la institución.
Personalización y adaptación: Cada institución educativa puede tener procesos y requisitos únicos. Los requerimientos funcionales aseguran que el modelo se adapte y se personalice para satisfacer estas necesidades específicas.
Reducción de riesgos: Al documentar y analizar en profundidad los requerimientos, se pueden identificar posibles obstáculos y problemas antes de que se conviertan en problemas reales. Esto ayuda a reducir los riesgos de implementación y facilita la planificación de mitigaciones.
Eficiencia en el desarrollo: Los requerimientos funcionales proporcionan una guía clara para el desarrollo del modelo de Big Data. Esto ayuda a los equipos a trabajar de manera más eficiente al saber exactamente qué se espera y cómo deben diseñar y construir la solución.
Comunicación efectiva: Los requerimientos funcionales son una herramienta de comunicación esencial entre diferentes partes interesadas, como el equipo de desarrollo, los usuarios finales y los líderes de la institución. Ayudan a evitar malentendidos y a asegurar que todos tengan la misma visión.
Validación y aprobación: Los requerimientos funcionales proporcionan una base para la validación y aprobación por parte de los stakeholders clave. Esto garantiza que la solución propuesta cumpla con las expectativas y requisitos establecidos. Evaluación de soluciones externas: Si la institución considera la posibilidad de adquirir soluciones externas, los requerimientos funcionales actúan como criterios para evaluar si una solución comercial o externa cumple con sus necesidades.
Facilitación del diseño técnico: Los requerimientos funcionales son la base sobre la cual se construye el diseño técnico del modelo de Big Data. Ayudan a definir la arquitectura, las tecnologías y las integraciones necesarias.
Medición del éxito: Los requerimientos funcionales establecen métricas y objetivos claros que permiten evaluar si el modelo de Big Data está cumpliendo con sus propósitos y si está teniendo un impacto positivo en la institución educativa.
Los requerimientos funcionales son esenciales para el éxito de cualquier modelo de Big Data, especialmente en el contexto de la gestión documental en una institución educativa. Proporcionan una base sólida para el diseño, desarrollo, implementación y evaluación de la solución, asegurando
que esta se ajuste perfectamente a las necesidades y objetivos de la institución. Ayudan a identificar las características y funcionalidades clave que deben estar presentes en la solución. En el contexto de la gestión documental, esto podría incluir funciones como la indexación y búsqueda eficiente de documentos, la gestión de versiones, el acceso controlado a los documentos y la generación automatizada de informes.
Para el siguiente grafico las convenciones son las siguientes:
Modelo de Big Data para la gestión documental Modelo de Big Data para la gestión documental en el CAE Modelo de Big Data para la gestión documental en el área de certificación Toma de decisiones
Indexación y búsqueda eficiente Gestión de versiones Control de acceso y seguridad Flujo de trabajo y colaboración Integración con herramientas externas Auditoría y registro de actividades Automatización de procesos Respaldo y recuperación Cumplimiento normativo Ingestión de datos Almacenamiento escalable Gestión de Documentos Educativos Integración con Plataformas de Aprendizaje Categorización y Etiquetado Control de Versiones y Revisiones Acceso por Roles Recopilación de Trabajos de Estudiantes Colaboración en Línea Seguimiento de Progreso Auditoría y Registro de Actividades Automatización de Procesos Administrativos Integración con Herramientas de Evaluación Respaldo y Recuperación de Datos Cumplimiento Normativo Educativo Almacenami ento escalable Indexación y búsqueda eficiente Gestión de versiones y autenticidad Acceso controlado y seguridad Registro de emisión y entrega Generación automatizad a de documentos Flujo de trabajo de certificación Notificacion es y alertas Integración con sistemas externos Cumplimien to legal y normativo Respaldo y recuperació n de datos Generación de informes y estadísticas Seguimiento de plazos y vencimiento s Claridad y dirección Alineación con objetivos Personalización y adaptación Reducción de riesgos Eficiencia en el desarrollo Comunicación efectiva Validación y aprobación Evaluación de soluciones externas Facilitación del diseño técnico Medición del éxito Requerimientos funcionales del modelo de Big Data Gráfico 11: requerimientos funcionales del modelo de Big Data para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial – SENA
CONCLUSIONES
Para concluir el Centro Agroecológico y Empresarial, un corto periodo de tiempo debe realizar una evaluación interna de las condiciones de infraestructura tecnológica, con el fin de confirmar o repensar una solución de análisis de información tipo Cloud, a partir del crecimiento acelerado de la capacidad de almacenamiento y procesamiento requerido por la entidad, sin limitaciones por infraestructura de soporte. Las necesidades del centro de agregar valor a los datos hacen aumentar las necesidades de tecnologías Cloud o de computación en la nube, para lo cual se muestran tecnologías de computación elástica, un sistema de computación similar al uso eficiente de electricidad. El servicio se da o no, a partir de la demanda de uso de un determinado recurso (hora valle o picos de uso). El sistema de computación elástico permite adaptar el uso de los recursos computacionales que dependen del aluvión de datos, su tamaño, tipo, velocidad de estos, para dar una respuesta más efectiva.
Se construyó un modelo de requerimientos funcionales para la implementación de un modelo de Big Data, que desde la perspectiva de esta investigación son esenciales para el diseño y la implementación exitosa de cualquier solución de Big Data, y en este caso, son fundamentales para optimizar la gestión documental en el área de certificación. Definir los requerimientos funcionales implica entender a fondo los objetivos y necesidades de la gestión documental en el área de certificación. Esto asegura que se desarrollen soluciones que estén directamente alineadas con los objetivos del Centro Agroecológico y Empresarial. La claridad en los objetivos ayuda a evitar desviaciones y garantiza que los esfuerzos y recursos se concentren en aspectos verdaderamente importantes.
Los requerimientos funcionales se derivan de las necesidades de los usuarios finales. Al involucrar a los usuarios y comprender sus requisitos, se puede diseñar una solución de gestión documental que sea intuitiva, eficiente y efectiva. Esto mejora la adopción del sistema y la satisfacción del usuario, lo que es crucial para el éxito a largo plazo a partir de un modelo de Big Data bien diseñado debe ser escalable y flexible para manejar el crecimiento futuro de los datos y los cambios en las necesidades empresariales. Los requerimientos funcionales ayudan a definir los umbrales de escalabilidad, los requisitos de almacenamiento y la capacidad de adaptarse a nuevas tecnologías y demandas. Para contestar a la pregunta de investigación sobre el modelo de Big Data más apropiado para para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial – SENA, es Ecosistema Hadoop, específicamente, los componentes: Apache Kafka (ingesta, almacenamiento, procesamiento y escalabilidad); Apache Nifi (ingesta, análisis y automatización); Apache Cassandra (almacenamiento y almacenamiento a largo plazo); Apache Hadoop (almacenamiento y escalabilidad); Apache Hive (Seguridad y consulta) y para la gestión de metadatos Cloudera Navigator, por ser estructuras que poseen modelos sencillos y de código abierto, esto a partir de los modelos de arquitectura que se evaluaron anteriormente para poder acercarse a un paquete de herramientas que puedan ser asequibles y que permitan el procesamiento y almacenamiento de la información. En consecuencia, en esta monografía, ya se han cumplido con los tres objetivos, a saber: ✓ Caracterizar los modelos de Big Data para la gestión documental del área de certificación del Centro Agroecológico y Empresarial: Se pudieron identificar diferentes modelos de arquitectura que permitieron definir las herramientas que se deben utilizar en el entorno Big Data para la transformación de los datos extraídos
de las fuentes de información en documentos que puedan ser consultados por los usuarios.
✓ Diagnosticar el uso actual de la Big data en la gestión documental del área de certificación del Centro Agroecológico y Empresarial – SENA: Se determinó que no se sabe a ciencia cierta que es Big Data y cual es su importancia para la continuación del negocio y la estructuración de la información, de igual manera se evidenció la necesidad de implementar un modelo que permita la extracción de información de los repositorios en donde se ha acumulado una gran cantidad de dato, todos ellos sin una estructura definida y en una variedad de formatos. En un entorno de Big Data, la integración con sistemas existentes es esencial. Los requerimientos funcionales permiten identificar los puntos de integración necesarios con otros sistemas o bases de datos en el Centro Agroecológico y Empresarial. Esto garantiza que la gestión documental esté alineada con el flujo de trabajo general y evita la fragmentación de datos y procesos. ✓ Diseñar los requerimientos funcionales del modelo de Big Data para la gestión documental en el área de certificación del Centro Agroecológico y Empresarial – SENA: los requerimientos funcionales ayudan a establecer requisitos de seguridad y a gestionar los riesgos asociados con la gestión documental en términos de confidencialidad, integridad y disponibilidad de los datos. Esto es especialmente importante en el contexto de certificaciones, donde la precisión y la seguridad son cruciales. La definición clara de requerimientos funcionales permite identificar oportunidades para automatizar y optimizar los procesos de gestión documental.
Esto puede reducir la carga de trabajo manual, minimizar los errores y acelerar los tiempos de respuesta, mejorando así la eficiencia general de la operación.
RECOMENDACIONES
Luego de conocer el estado del almacenamiento y análisis de grandes cantidades de información, se recomienda aplicar las siguientes opciones de mejora, según sea el caso. Se recomienda ampliar la identificación de las necesidades de la institución para completar el plan estratégico del modelo de Big Data, para tener en cuenta los diferentes enfoques, se recomienda utilizar Big Data primero en las áreas que producen mayor información, como certificación, contratación, contabilidad, articulación con la media para llegar el máximo rendimiento a su aplicación y comprobar si los resultados obtenidos son los esperados, a través de la optimización de todos los sistemas, para garantizar que el modelo de Big Data se utilice de manera efectiva y optimizar todos los sistemas.
Seleccionar la infraestructura correcta en función de sus necesidades es importante para garantizar que Big Data, se utilice de manera efectiva, es importante comenzar con los datos existentes en la base de datos de la empresa, para construir a partir de ahí. Lo relevante es identificar las nuevas fuentes de datos y priorizarlas, el objetivo prioritario es generar valor para la institución y aportar nuevo conocimiento en las áreas, por ello, es clave que se aprenda y se incorporan datos en el modelo y en los análisis; contar con un presupuesto asignado, que debe seguirse y controlares, se debe contar con el personal especializado ya se por áreas o ampliar las funciones al equipo de tecnología quienes sean los encargados de cumplir con el timing del modelo. En el caso de la tecnología integrar las fuentes de información tanto internas como externas que faciliten la estructura y el análisis de los datos, también ayuda a tomar decisiones adecuadas. Sin embargo, aún quedan retos muy importantes que solventar en la gestión de los datos y en concreto en las estrategias de Big Data en la regional.
Para implementar un modelo de Big Data, a través de una solución Cloud ofrecidas como servicios por compañías como Amazon, Microsoft, IBM entre otras. Las principales características definidas por Sabater Picañol (2013) son:
Se paga un costo de alquiler de infraestructura. (Se paga lo que se usa) Alta escalabilidad, puede crecer el número de nodos de forma sencilla. Alta Disponibilidad “Las soluciones cloud están indicadas especialmente en casos en los que el análisis de información sea muy puntual (necesitas analizar varios terabytes de datos, pero sólo lo harás una vez), en caso de uso continuo saldría bastante costoso.” (Sabater Picañol, 2013, p. 10). “Dependiendo del tipo de información que se analiza puede ser sensible o puede no ser legal subir esos datos a un servicio externo a la empresa, dependiendo de la ley de protección de datos vigente del país.” (Sabater Picañol, 2013, p. 18).
El uso de datos para tomar decisiones objetivas es importante para garantizar que las decisiones tomadas se basen en información precisa, enlazado al gobierno de datos para garantizar que los datos se administren de manera efectiva y sean de alta calidad, fundamentado en que el objetivo del Big Data no es la tecnología, sino el negocio que permite generar y mejorar. Por ello, es importante identificar la oportunidad de negocio antes de implementar Big Data y contar con herramientas que proporcionen elementos como:
La extracción de datos que permite la recuperación de datos de distinto tipo y de gran cantidad de fuentes, que proporciona una mayor cantidad de información útil recuperada.
La recolección de datos de distintas fuentes con el fin de obtener una mayor cantidad de datos procesados.
La carga de datos que permita visualizar los datos ya organizados y que puedan ser interpretados fácilmente.
La transformación de datos que cambia el formato, para posibilitar que estos puedan ser leídos por diferentes aplicaciones sin perder sus características. Niveles de seguridad óptimos que eviten la descarga de datos dañinos o maliciosos y que pueden poner en peligro las bases informáticas del área. De igual manera es necesario que se tenga en cuenta el machine learning (aprendizaje automático) que involucra a la IA (inteligencia artificial), cuyo campo de acción es más eficiente, dado que esta clase de tecnología permite que la máquina que realizara los procesos “aprenda” a realizar las tareas que se les indican por medio de datos específicos y algoritmos que permiten la solución de problemas complejos como el reconocimiento de términos lingüísticos y de escritura, búsqueda de datos, etc.
A futuros investigadores de la Unisalle sobre el tema de Big data o analítica de datos, se recomienda que para el desarrollo del trabajo principalmente se analicen los diferentes métodos de implementación y adopción de las tecnologías de Big data con el fin de optimizar las estrategias académicas, que caracteriza aspectos como: cual es la solución con relación a la capacidad de la infraestructura, conocimientos y habilidades del equipo de tecnologías, tiempos en la implementación, mesa de ayuda, comportamiento del mercado, comunidad de usuarios, costo y beneficio del licenciamiento, escalabilidad y curva de aprendizaje.
REFERENCIAS
Alló, María (2014). Mooc Sostenibilidad y Big Data. Módulo1, Sostenibilidad Ambiental en la Era del Big Data.
Almora Castro, N. C. (2018). Análisis y usos del Big data aplicado en la Universidad Nacional “San Luis Gonzaga” de ICA: caso facultad de Ingeniería de sistemas. [Proyecto de Tesis, Universidad Nacional “San Luis Gonzaga de
ICA”].
Repositorio
UNICA.
https://repositorio.unica.edu.pe/bitstream/handle/20.500.13028/3095/An%C3%A1lisis%2 0y%20usos%20del%20Big%20data%20aplicado%20en%20la%20universidad%20nacion al%20%E2%80%9CSan%20Luis%20Gonzaga%E2%80%9D%20de%20Ica%20caso%20 Facultad%20de%20Ingenier%C3%ADa%20de%20Sistemas.pdf?sequence=1&isAllowed =y Alonso Arévalo J. & Vázquez Vázquez M (2016). Big Data: la próxima "gran cosa" en la gestión de la información. https://bid.ub.edu/es/36/alonso.htm Andalucía Conectada (2021), Estado del Arte y Tendencias – Big Data y Business Analytics. Anguera, M. (1986), La Investigación cualitativa. file:///C:/Users/jpmm2/Downloads/461- Texto%20del%20art%C3%ADculo-883-1-10-20130619.pdf Arévalo, J. A., & Vázquez, M. V. (2016). Big data: La próxima “gran cosa” en la gestión de la información. BiD, 36(juny), 2014–2016. https://doi.org/10.1344/BiD2016.36.2 Becerra, J., Cotino-Hueso, L., León, I. P., Sánchez-Acevedo, M. E., Torres-Ávila, J., & Velandia- Vega, J. (2018). Marco teórico y aproximación jurídica al big data: algoritmos, inteligencia artificial y transformación digital. En J. Becerra, L. Cotino-Hueso, I. P. León, M. E. Sánchez-Acevedo, J. Torres-Ávila, & J. Velandia-Vega. (2018). Derecho y big data.
Bogotá:
Editorial Universidad Católica de Colombia.
https://repository.ucatolica.edu.co/handle/10983/22997 Borja Suarez, J. % Malagón Cárdenas, M. (2017). Diseño del sistema de gestión de documentos electrónicos de archivo. Estudio de caso: Baker McKenzie. [Tesis de Maestría, Universidad de la Salle].
Repositorio Universidad de la Salle.
https://ciencia.lasalle.edu.co/cgi/viewcontent.cgi?article=1034&context=maest_gestion_d ocumental Calderón, F. et al (2022). Aplicación de técnicas de Business Intelligence y Big Data Analytics en entornos de aprendizaje virtual. Revista Ciencias Pedagógicas e Innovación Vol. IX N°2 diciembre 2021, (enero – mayo 2022) pp. 07-19 http://dx.doi.org/10.26423/rcpi.v9i2.463 Carrillo Álvarez, F. (2016). Plan de implementación de tecnologías Big data para la Optimización de estrategias comerciales y de segmentación. [Tesis de Maestría, Universidad Autónoma de Bucaramanga].
Repositorio Universidad Autónoma de Bucaramanga.
https://repository.unab.edu.co/bitstream/handle/20.500.12749/3369/2016_Tesis_Francisc o_Carrillo_Alvarez.pdf?sequence=1&isAllowed=y Chávez López, M. I. (2022). Lineamientos para la implementación de la política pública sobre documento electrónico en la Gobernación de Sucre. [Tesis de Maestría, Universidad de La Salle].
Repositorio Institucional Universidad de La Salle.
https://ciencia.lasalle.edu.co/cgi/viewcontent.cgi?article=1093&context=maest_gestion_d ocumental Colmenares, J. F. (2016). Implementación de Big data en las organizaciones como estrategia de aprovechamiento de la información para incorporar a la cadena de valor del negocio [Tesis de grado, Universidad Militar Nueva Granada]. Repositorio Institucional Universidad
Militar Nueva Granada.
https://repository.unimilitar.edu.co/bitstream/handle/10654/14411/Rodr%EDguezColmen aresJuanFernando2016.pdf;jsessionid=E31A0BA33DF74215BDA7FB65626238C5?sequ ence=1 Congreso de la República de Colombia. (2000, 14 de julio). Ley 594. Por medio de la cual se dicta la Ley General de Archivos y se dictan otras disposiciones. Diario Oficial 44093. http://www.secretariasenado.gov.co/senado/basedoc/ley_0594_2000.html Cruz Mundet, J. (2006). La gestión de documentos en las organizaciones. Madrid, España: Ediciones Pirámide.
Diebold, Francis X., On the Origin(s) and Development of the Term 'Big Data' (September 21,
2012).
PIER
Working Paper No.
12-037,
Available at
SSRN:
https://ssrn.com/abstract=2152421 or http://dx.doi.org/10.2139/ssrn.2152421Dynamic.
(2020).
Historia del Big Data.
https://www.dynamicgc.es/historia-del-bigdata/#:~:text=y%20aplicaci%C3%B3n%20actual.,Nacimiento%20del%20t%C3%A9rmin o,los%20t%C3%A9rminos%20que%20actualmente%20conocemos.
Duque-Jaramillo, J. y Villa-Enciso, E. (2017). Big data: desarrollo, avance y aplicación en las organizaciones de la era de la información.
Revista
CEA,
2(4),
27-45.
https://doi.org/10.22430/24223182.169 Fu, Chao. et al (2021). Big data intelligence for smart educational management systems. 1 Jan. 2021: 2881 – 2890. https://content.iospress.com/articles/journal-of-intelligent-and-fuzzysystems/ifs189328 Función Pública (2022). Gestión Documental. https://www.funcionpublica.gov.co/gestiondocumental
Galvan, F (2011). Bodega de Datos. Corporación Universitaria del Minuto de Dios El Bagre Antioquia. https://clasespress.wordpress.com/2011/03/13/bodega-de-datos/ Guerrero López, F.A. & Rodríguez Pinilla, J. E. (2013). Diseño y desarrollo de una guía para la implementación de un ambiente Big data en la Universidad Católica de Colombia. [Trabajo de Grado, Universidad Católica de Colombia]. Repositorio Universidad Católica de Colombia.
https://repository.ucatolica.edu.co/bitstream/10983/1320/1/DISE%C3%91O%20Y%20D
ESARROLLO%20DE%20UNA%20GU%C3%8DA%20PARA%20LA%20IMPLEMEN
TACI%C3%93N%20DE%20UN%20AMBIENTE%20BIG%20DATA%20EN%20LA%
20UNIVERSIDAD%20CAT%C3%93LICA%20DE%20COLOMBIA.pdf Gutiérrez Borja, D. & Barandica Escorcia, J. (2020). Toma de decisiones en la empresa TENARIS de la ciudad de Cartagena de Indias – Departamento de Bolívar. [Trabajo de Grado, Universidad De La Costa]. Repositorio Institucional Universidad de la Costa. https://repositorio.cuc.edu.co/bitstream/handle/11323/7138/TOMA%20DE%20DECISIO
NES%20EN%20LA%20EMPRESA%20TENARIS%20DE%20LA%20CIUDAD%20DE
%20CARTAGENA%20DE%20INDIAS%20-
%20DEPARTAMENTO%20DE%20BOLIVAR.pdf?sequence=1&isAllowed=y Hernández Leal, E. (2016). Aplicación de técnicas de análisis de datos y administración de Big Data ambientales. [Trabajo de Investigación, Universidad Nacional de Colombia]. Repositorio Universidad Nacional de Colombia.
https://repositorio.unal.edu.co/bitstream/handle/unal/57998/1090175695.2016.pdf?sequen ce=1&isAllowed=yhttps://observatorio.andaluciaconectada.es/?wpdmdl=5130
Hernández, R., Fernández, C., & Baptista, M. (2014). Metodología de la investigación. McGraw- Hill / Interamericana Editores, S.A. de C.V. http://observatorio.epacartagena.gov.co/wpcontent/uploads/2017/08/metodologiade-la-investigacion-sexta-edicion.compressed.pdf Howson, C. (2008). Successfull Business Intelligence Secrets to making BI a Killer APP. USA: Osborne/McGraw-Hill Kinicki y Kreitner. (2003). Comportamiento organizacional. México. McGraw Hill / Interamericana de España.
Kulshrestha, Sanatan, Big Data in Military Information & Intelligence (January 22, 2016). IndraStra Global, 2016, Available at SSRN: https://ssrn.com/abstract=2765008 Laney, D. (2001) 3D Data Management: Controlling Data Volume, Velocity and Variety. META Group Research Note, 6. https://pdfcoffee.com/ad949-3d-data-management-controllingdata-volume-velocity-and-varietypdf-pdf-free.html López, F. et al. (2004). IDEZar: Procesos, herramientas y modelos urbanos aplicados a la integración de datos municipales procedentes de fuentes heterogéneas. Universidad de Zaragoza.
https://www.idee.es/resources/presentaciones/JIDEE06/ARTICULOS_JIDEE2006/articul o25.pdf Maraden, R & Yarisca Bernanda, D & Tannandy, D & Fernandes Andry, J. (2022). Big data and academic libraries:
is it big for something or big for nothing?
https://www.researchgate.net/publication/348191587_Big_data_and_academic_libraries_ is_it_big_for_something_or_big_for_nothing Martín Hernández, A. (2019). Breve historia del Big Data. Culturas, Archivamos No. 47. Pág. 44. https://publicaciones.acal.es/archivamos/article/view/512/449
Martín González, Y., & Travieso Rodríguez, C. (2019). Datos abiertos: nuevas perspectivas y desafíos para los servicios de referencia de las bibliotecas públicas. In Bibliotecas públicas: Profesionales para todos los públicos. IX Congreso Nacional de Bibliotecas Públicas (pp. 82–91).
Martínez, P. (2006). El método de estudio de caso: estrategia metodológica de la investigación científica.
Pensamiento & Gestión,
20,
165–193.
http://www.redalyc.org/articulo.oa?id=64602005 Microsoft. (2023). Reglas de negocios (Master Data Services). https://learn.microsoft.com/eses/sql/master-data-services/business-rules-master-data-services?view=sql-server-ver16 Monje Álvarez, C. (2011). Metodología de la Investigación Cuantitativa y Cualitativa, Guía didáctica.
https://www.uv.mx/rmipe/files/2017/02/Guia-didactica-metodologia-de-lainvestigacion.pdf Montoya Barbosa L. P. (2022). Modelo teórico para realizar diagnóstico a los archivos físicos y electrónicos producidos en Colombia: análisis comparativo. [Tesis de Maestría, Universidad de La Salle]. Repositorio institucional Universidad de La Salle. https://ciencia.lasalle.edu.co/cgi/viewcontent.cgi?article=1086&context=maest_gestion_d ocumental Naeem, M. et al. (2022). Tendencias y Perspectivas de Futuro Desafíos en Big Data. En: Pan, JS., Balas, VE, Chen, CM. (eds) Avances en análisis y aplicaciones de datos inteligentes. Smart Innovation, Systems and Technologies, vol
253.
Springer, Singapur.
https://doi.org/10.1007/978-981-16-5036-9_30
Palma Villalón, M. (S.F). Los Retos de la Gestión de los Datos, Información y Documentos (records management) en la Transformación.
https://obtienearchivo.bcn.cl/obtienearchivo?id=documentos/10221.1/61354/1/rm_transfo rmaciondigital_mvpalma_docuformacion.pdf Pérez Serrano, G. (2004). Modelos de Investigación Cualitativa en Investigación Social y Animación social, Aplicaciones práctica.
https://books.google.es/books?hl=es&lr=&id=iiaMN5VQBnwC&oi=fnd&pg=PA11&dq =modelos+cualitativos&ots=GfMsDQBD9v&sig=jMC0rSgbXpPZpeuzawFyrKqfd_E#v =onepage&q=modelos%20cualitativos&f=false Pirela, J., Pulido, N. J., & Mancipe, E. (2015). Componentes y dimensiones de la investigación formativa en ciencias de la información. Enl@ce: Revista Venezolana de Información, Tecnología y Conocimiento, 12(3), 48–70.
http://produccioncientificaluz.org/index.php/enlace/article/view/20627/20536 Ponjuan Dante, G. (2003). Gestión documental, de información y del conocimiento... puntos de contacto y diferencias. Ciencias de la Información. 34(3).
https://biblat.unam.mx/hevila/Cienciasdelainformacion/2003/vol34/no3/7.pdf Roberge, M. (1993). La gestion dels documents administratius. Barcelona. Diputación de Barcelona.
Rodríguez Colmenares, J. F. (2016). Implementación de Big data en las organizaciones como estrategia de aprovechamiento de la información para Incorporarla a la cadena de valor del negocio. [Trabajo de Grado de Especialización, Universidad Militar Nueva Granada].
Repositorio Universidad Militar Nueva Granada.
https://repository.unimilitar.edu.co/bitstream/handle/10654/14411/Rodr%EDguezColmen aresJuanFernando2016.pdf;jsessionid=84F0034769936B7A65A20AFC2E202C23?seque nce=1 Rodríguez, E. y otros. (2013). El proceso de toma de decisiones y la eficacia organizativa en empresas privadas del norte de Chile. Chile: revista de ingeniera de Chile. Salinas M.
y Rodríguez H.
(2011).
Toma de decisiones.
España.
http://dearade.udea.edu.co/aula/pluginfile.php/1150/mod_resource/content/1/Competenci a_Toma_de_Decisiones.pdf Sánchez Flores, F. A. (2019). Fundamentos epistémicos de la investigación cualitativa y cuantitativa: consensos y disensos. Revista Digital de Investigación en Docencia Universitaria, 13(1), 102-122. doi: https://doi.org/10.19083/ridu.2019.644 Servicio Nacional de Aprendizaje (2022). Quienes somos. https://www.sena.edu.co/esco/sena/Paginas/quienesSomos.aspx Servicio Nacional de Aprendizaje (2019). Política de administración de archivos y gestión documental.
https://www.sena.edu.co/esco/transparencia/Documents/politica_gestion_formato_siga_revision_final_2020.pdf Taborda Ramírez, Y. & Arboleda Taborda, A. (2021). Propuesta de Roadmap Tecnológico para Data UdeA, a partir de la valoración de su uso por parte de los usuarios. Modalidad Consultoría. [Tesis de Maestría, Universidad de Antioquia]. Repositorio Universidad de Antioquia.
https://bibliotecadigital.udea.edu.co/bitstream/10495/23671/1/TabordaYulieth_Arboleda Yesenia_2021_PropuestaRoadmapTecnol%C3%B3gico.pdf
Universia mx.
(2022).
¿Cómo utilizan las universidades el Big Data?
https://www.universia.net/mx/actualidad/orientacion-academica/como-utilizanuniversidades-big-data-1161248.html Universidad de Antioquia. (2020). Webinar: Aplicaciones del Big Data en Bibliotecas Universitarias, https://www.youtube.com/watch?v=owEUCHCascs University of Oklahoma. (2022). PROJECT HIGHLIGHT: BIZZY CHAT BOT, Univaersity Libraries. https://libraries.ou.edu/content/project-highlight-bizzy-chat-bot Vaca Albán, R. (2017). El uso de Big data y su incidencia en la calidad de los Servicios académicos de la universidad técnica de Ambato. [Trabajo de investigación, Universidad Técnica de Ambato].
Repositorio Universidad Técnica de Ambato.
https://repositorio.uta.edu.ec/bitstream/123456789/25796/1/Tesis_%20t1265mbd.pdf Varela-Orol, C., & Ameneiros Rodríguez, R. (2018). La protección de datos personales en las bibliotecas universitarias españolas en el entorno digital. Revista General de Información y Documentación, 28(2), 685–702. https://doi.org/10.5209/rgid.62844 Vagas Guzmán, W. et al. (2020). Importancia del Big Data en un gestor documental para las entidades públicas de Colombia. [Artículos de investigación]. Corporación Universitaria Minuto de Dios. https://www.proquest.com/docview/2480794318 Villalobos Luengo, C. (2016). Análisis de archivos Logs semi-estructurados de ambientes Web usando tecnologías Big-Data. [Tesis de Maestría, Universidad de Chile]. Repositorio Universidad de Chile. https://repositorio.uchile.cl/bitstream/handle/2250/140417/Analisisde-archivos-Logs-semi-estructurados-de-ambientes-Web-usando-tecnologias-Big- Data.pdf?sequence=1&isAllowed=y
Zetterlund, B. Big Data, and libraries: getting the most from your library data. https://www.axiell.co.uk/getting-the-most-from-your-library-data/
ANEXOS
Anexo 1: Matriz de análisis
(página sin texto)
Anexo 2: Cuestionario Cuestionario sobre el análisis y almacenamiento de la información en CAE La información que se solicita a continuación será utilizada únicamente parafines académicos en la elaboración del proyecto titulado " Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial – SENA” Según Hernández Sampieri, 2014, se deben establecer formas inclusivas que permitan al investigador descubrir múltiples visiones de un tema e interactuar con los participantes de la encuesta. Se debe definir el papel que se debe tomar a la hora de ser sensible, genuino y abierto con el encuestado, para llegar casi a hacerse amigo sin olvidar que debe tener en cuenta debe mantener una perspectiva interna y otra externa para el desarrollo y éxito de la encuesta. Objetivo Diagnosticar el uso actual de la Big data en la gestión documental del área de certificación del Centro Agroecológico y Empresarial.
1. ¿El CAE compra alguno de los siguientes servicios de Cloud Computing usados a
través de Internet?
a) E-mail (como un servicio de Cloud Computing)
b) Software Office (p. e.: procesadores de texto, hojas de cálculo... como un servicio
de Cloud Computing)
c) Servidor (Hosting) de bases de datos de la empresa (como un servicio de Cloud
Computing)
d) Almacenamiento de ficheros (como un servicio de Cloud Computing)
e) Aplicaciones informáticas financieras o contables (como un servicio de Cloud
Computing)
f) Aplicaciones informáticas para gestionar información sobre clientes (Customer
Relationship Management - CRM, como un servicio de Cloud Computing)
g) Capacidad de computación para ejecutar el software usado por la empresa (como
un servicio de Cloud Computing)
2. ¿El CAE compra algún servicio de Cloud Computing entregado desde:
a) Servidores compartidos
b) Servidores reservados exclusivamente para su empresa
3. ¿Durante 2022, el CAE implemento o desarrollo algún modelo de Big Data? ¿El CAE
implemento un modelo de Big Data en alguno de los siguientes procesos?
a) Datos a partir de sensores o dispositivos inteligentes (p. e.: comunicaciones -M2M-
sensores digitales, etiquetas de identificación por Radio Frecuencia RFID*, etc.) en el contexto de Big Data
b) Datos por geolocalización a partir del uso de dispositivos portátiles (p. e.:
dispositivos portátiles que usan redes telefónicas móviles, conexiones sin cable o GPS) en el contexto de Big Data
c) Datos generados a partir de medios sociales (p e.: redes sociales, blogs, sitios web
que comparten contenido multimedia...) en el contexto de Big Data
d) Otras fuentes de Big Data no especificadas anteriormente, datos de índices
bursátiles, datos de transacciones, otros datos de páginas web abiertas.
4. ¿El CAE usó alguno de los siguientes métodos para el análisis de grandes fuentes de
datos (Big Data)?
a) Aprendizaje Automático o Machine Learning
b) Procesamiento del lenguaje natural (PLN), generación de lenguaje natural (GLN)
o reconocimiento de voz PLN, GLN y reconocimiento de voz es la capacidad de un programa de ordenador de entender el lenguaje humano tal como se habla, para convertir los datos en una representación del lenguaje natural, o para identificar palabras o frases del lenguaje hablado y convertirlas en un formato legible para la máquina.
c) Otros métodos de análisis de Big Data
5. Si el CAE no realizó análisis de Big Data, indique si fue por alguno(s) de los siguientes
factores:
a) El coste parece demasiado elevado comparado con los beneficios
b) Los recursos humanos, el conocimiento o los perfiles del personal son insuficientes
c) Fuentes insuficientes de Big Data, ya sea dentro o fuera de su empresa, que serían
necesarias para realizar el análisis
d) Infraestructuras TIC insuficientes
e) Dificultades para cumplir con las leyes de privacidad
f) No es una prioridad para la empresa
g) Calidad insuficiente en las fuentes de Big Data
h) El análisis de Big Data no es útil para la empresa
i) Otros factores
6. ¿El CAE cuenta con la gobernanza de datos necesaria para prosperar?
a) Si
b) No
7. ¿Qué nivel de importancia tendría para usted, los siguientes aspectos para obtener
una analítica de datos masivos que brinde un mejor apoyo en la gestión de su proceso?1
1 Al contestar tenga en cuenta la siguiente escala: 1. Nada importante 2. Un poco importante 3. Muy importante
4. Extremadamente importante
8. Basado en su conocimiento y de acuerdo con el proceso de negocio que gestiona,
determine el nivel de impacto de los siguientes beneficios empresariales derivados del uso y análisis de mayores fuentes de datos internas y externas.2
9. ¿Utiliza el centro alguna de las siguientes medidas de seguridad TIC? (Marque más
de una respuesta)
a) Autenticación mediante contraseña fuerte, es decir, con una longitud mínima de 8
valores alfanuméricos, cambiándose periódicamente
b) Mantener el software actualizado, que incluya el sistema operativo
c) Identificación de usuario y autenticación mediante elementos biométricos
implementados por la empresa (p. e.: huellas dactilares, voz, cara...)
d) Técnicas de encriptación de datos, documentos o correos electrónicos
2 Al contestar tenga en cuenta la siguiente escala: 1. Nada importante 2. Un poco importante 3. Muy importante
4. Extremadamente importante
e) Copia de seguridad (backup) de datos en una ubicación separada (incluida la copia
de seguridad en la nube)
f) Control de acceso a la red (gestión del acceso de dispositivos y usuarios a la red de
la empresa)
g) Red Privada Virtual (VPN de las siglas en inglés Virtual Private Network; extiende
una red privada a través de una red pública para permitir el intercambio seguro de datos a través de la red pública)
h) Mantenimiento de archivos de registro (log) para el análisis después de incidentes
de seguridad
i) Evaluación de riesgos TIC, es decir, evaluación periódica de la probabilidad y
consecuencias de incidentes de seguridad TIC
j) Test de seguridad TIC (p. e.: realizar pruebas de penetración, probar el sistema de
alerta de seguridad, revisar las medidas de seguridad, probar los sistemas de copias de seguridad)
10. ¿Qué técnicas de machine learning has implementado?
a. Aprendizaje Supervisado
b. Aprendizaje No Supervisado
c. Aprendizaje Reforzado
d. No se ha implementado ninguna técnica
Los niveles o estados de uso de las herramientas se determinan por el nivel académico de cada uno de los encuestados, su nivel de capacitación, su nivel de capacitación en herramientas informáticas, la actualización que reciben de los conocimientos adquiridos y el cargo o rol dentro de la universidad y el tipo de herramientas que han utilizado.
Anexo 3: Carta de autorización Carta de autorización de los autores para realizar cuestionario
Fusagasugá (Cundinamarca), abril 01 de 2023.
Señores Centro Agroecológico y Empresarial Servicios Nacional de Aprendizaje Cuidad
Estimados Señores:
Nosotros María Fernanda Méndez Cuellar, identificada con C.C. No.1.069.757.409 de Fusagasugá y Manuel Augusto Vélez Felacio, identificado con C.C. No 79.485.806 de Bogotá, autores de la tesis y/o trabajo de grado titulado “Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA” presentado y aprobado en el año 2022 como requisito para optar al título de la Maestría en Gestión de la Información, Universidad de la Salle; solicitamos autorización al Centro Agroecológico y Empresarial para que con fines académicos, realice una encuesta (cuestionario) conformado por 10 preguntas de selección múltiple a veinte (20) lideres de áreas, objetivamente al área de certificación del centro, con el fin de establecer si el centro cuenta un modelo de Big Data o a través de que sistema de información se analizan grandes cantidades de datos.
De conformidad con lo establecido en el artículo 30 de la Ley 23 de 1982 y el artículo 11 de la Decisión Andina 351 de 1993, “Los derechos morales sobre el trabajo son propiedad de los autores”, los cuales son irrenunciables, imprescriptibles, inembargables e inalienables.
Cordialmente,
María Fernanda Méndez Cuellar
Manuel Augusto Vélez Felacio C.C. 1.069.757.409
C.C 79.485.806
Anexo 4: Consentimiento informado El propósito de este protocolo es informarle sobre el proyecto de investigación y solicitarle su consentimiento. De aceptar, el investigador se quedará con una copia firmada de este documento, mientras usted poseerá otra copia también firmada.
La presente investigación se titula “Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA”. Este proyecto es dirigido por John Agustín Riaño Diaz, director de la Escuela de Humanidades y Estudios Sociales, Universidad de La Salle.
Para ello, se le solicita participar dando respuesta a un cuestionario que le tomará 20 minutos de su tiempo. Su participación en la investigación es completamente voluntaria y usted puede decidir interrumpirla en cualquier momento, sin que ello le genere ningún perjuicio. Asimismo, participar en esta encuesta no le generará ningún perjuicio administrativo. Si tuviera alguna consulta sobre la investigación, puede formularla cuando lo estime conveniente. Su identidad será tratada de manera anónima, es decir, el investigador no conocerá la identidad de quién completó la encuesta. Asimismo, su información será analizada de manera conjunta con la respuesta de sus compañeros y servirá para la elaboración del trabajo de grado. Si desea, podrá escribir al correo mmendez09@unisalle.edu.co – mavelez06@unisalle.educo para extenderle el artículo completo. Asimismo, para consultas sobre aspectos éticos, puede comunicarse con el Comité de Ética de la Investigación de la universidad. Si está de acuerdo con los puntos anteriores, complete sus datos a continuación: Nombre:
Fecha:
Correo Electrónico Firma del participante Firma del investigador
Cita: Méndez Cuellar, María Fernanda, Vélez Felacio, Manuel Augusto (2023), Modelo de Big Data para la gestión documental en el área de certificación Centro Agroecológico y Empresarial - SENA, Universidad de La Salle, p. N. https://hdl.handle.net/20.500.14625/34436