Sporala red del conocimiento
Página 1 de 9Estimación de un modelo de ecuaciones estructurales para informalidad …
p. 1

ESTIMACI ´ON DE UN MODELO DE ECUACIONES ESTRUCTURALES

PARA INFORMALIDAD LABORAL

Mariam Pinto Heydler y C´esar Augusto Lara Santana * mariam.pintoh@konradlorenz.edu.co,cesara.laras@konradlorenz.edu.co Resumen La modelaci´on de variables y fen´omenos con un alto nivel de abstracci´on e inmaterialidad exige aplicar m´etodos matem´aticos y estad´ısticos innovadores. Dentro de la Econom´ıa, el concepto de informalidad laboral es un ejemplo de variables que presentan dificultad para su medici´on adecuada, dado que corresponde a un concepto intangible que depende de m´ultiples opciones de medici´on y en consecuencia, su modelamiento se hace sensible a riesgos de sesgo por definici´on y recolecci´on. Para subsanarlo, se propone el empleo de un Modelo de Ecuaciones Estructurales (MEE) (del ingl´es: Structural Equation Model) con el fin de identificar sus relaciones con otras variables de tipo social y econ´omico, haciendo uso de microdatos recolectados mediante operaciones muestrales oficiales de Colombia.

1.

Introducci´on Este trabajo ilustra los resultados de la estimaci´on mediante un modelo que permite comprender el comportamiento de la informalidad laboral bajo un enfoque multivariado haciendo uso de microdatos medidos a nivel de n´ucleo familiar. En primera instancia, se abordan tanto la conceptualizaci´on propia de los t´erminos econ´omicos a modelar como igualmente los objetos matem´aticos necesarios para desarrollar la investigaci´on.

En un segundo apartado, se profundizar´a en la metodolog´ıa estad´ıstica de tratamiento de datos necesarios para este estudio, correspondiente a las tablas relacionadas con informalidad laboral establecidas en la Gran Encuesta Integrada de Hogares (GEIH) del Departamento Administrativo Nacional de Estad´ıstica de Colombia (DANE).

La parte central del documento corresponde a la estimaci´on de un SEM que permita identificar el comportamiento de la *Doctora en Ciencias Economicas Universidad Nacional Colombia e Investigadora - Grupo de An´alisis de Bienestar - Facultad de Ciencias Economicas, Universidad Nacional de Colombia.

Matem´atico - Fundaci´on Universitaria Konrad Lorenz, Economista - Universidad Nacional de Colombia.

variable objetivo Informalidad Laboral en funci´on de la interacci´on de m´ultiples variables ex´ogenas, todas ellas medidas a un nivel de granularidad de unidad familiar. El documento concluye con la comparaci´on de las diferentes medidas estad´ısticas de bondad de ajuste con el fin de validar la consistencia de la estimaci´on. Cabe anotar que el proceso de tratamiento de datos y modelaci´on se realizan con los paquetes TSA, lavaan, astsa y xts del lenguaje R. El c´odigo de lenguaje se encontrar´a disponible en el repositorio de trabajo colaborativo https://posit.cloud/ content/6974116 Es importante resaltar que para el entendimiento pleno del art´ıculo, se sugiere tener dominio en los conceptos de Probabilidad, Estad´ıstica Matem´atica, ´Algebra Lineal y M´etodos de Regresi´on.

2.

Antecedentes El modelamiento de algunas variables tiene un atributo com´un entre diferentes ´areas del conocimiento, la cual consiste en tener como objetos de estudio, variables que no pueden ser observadas de manera precisa. Por ejemplo, en las ciencias comportamentales, medir la inteligencia humana no puede hacerse de manera precisa pues no es un valor que se obtiene mediante un instrumento f´ısico tangible. Por el contrario, se requiere un dise˜no metodol´ogico incluso para medirlo (definir el m´etodo de medici´on, construir un indicador num´erico, elaborar una herramienta de medici´on -encuesta-, controlar el estado de ´animo del encuestado, etc). As´ı, diferentes escuelas acad´emicas podr´an definir cuantas variables o indicadores de inteligencia, todas igualmente v´alidas a pesar que no existe medici´on f´ısica exacta para la inteligencia.

Para ello, en la estad´ıstica aplicada se hace referencia al concepto de variable latente, la cual no es directamente observable mediante medios f´ısicos exactos del entorno de estudio[PS15] y por tanto su medici´on puede presentar m´ultiples elementos de imprecisi´on en su medici´on, dejando abierto el riesgo de usar valores con alto grado de imprecisi´on, heterogeneidad e incompatibilidad.

Esto difiere al concepto de variable observada, cuya medici´on puede obtenerse de forma exacta a trav´es de la

p. 2

Pask´ın Matem´atico Vol. 7 No 1 (2025) 14-22.

15

observaci´on y experimentaci´on para obtener mediciones directas. Los valores obtenidos pueden tomar valores discretos o continuos [LAZ10] los cuales pueden ser modelados mediante una distribuci´on de probabilidad. Tambi´en es conocida en las disciplinas sociales como constructo. Como ejemplo puntual se puede mencionar el concepto cl´ınico de presi´on arterial en el marco de una prueba de poligraf´ıa. Para obtener un valor exacto de este indicador, se emplea un instrumento m´edico llamado tensi´ometro, cuya escala de medici´on es el “mmHg” 1. Es decir, la medici´on de una variable de car´acter cl´ınico, en su mayor´ıa, es realizada con instrumentos universalmente aceptados, cuyo uso est´a parametrizado y controlado, de tal forma que la medici´on de la variable sea un valor que minimiza problemas de imprecisi´on o incluso, la ausencia de datos.

Definici´on 2.1 (Informalidad Laboral). Es una variable latente que busca medir la inmersi´on al mercado laboral dentro del marco regulatorio definido para la vinculaci´on de personas en condici´on de trabajar. De acuerdo a las definiciones de [DANdE23a] y [OIpeT22], una persona ocupada (vinculada en alguna actividad econ´omica) se considera en situaci´on de informalidad laboral si se satisface al menos uno de los siguientes criterios: 1) no se encuentra vinculada al sistema de seguridad social en calidad de aportante (es subsidiado),

2) la unidad productiva donde trabaja no cuenta con registros

contables formales o 3) la unidad productiva donde trabaja no cuenta con registro mercantil ante una c´amara de comercio.

3.

Objetos matem´aticos A continuaci´on se definir´an los principales conceptos matem´aticos necesarios para abordar el modelamiento mediante

MEE:

Definici´on 3.1 (Modelo de Ecuaciones Estructurales - MEE 2). Es un conjunto compuesto por m ecuaciones y k variables, cuyo objetivo es identificar el grado de relaci´on entre subconjuntos de estas variables dependiendo de su clasificaci´on por tipo de medici´on (variables latentes vs. variables observadas) o por origen de la variable (ex´ogena vs. end´ogena)3, dependiendo de la especificaci´on funcional del modelo. [JMIL21]. Por ejemplo, para un modelo que predice nivel de estr´es de una persona (variable latente end´ogena) se puede construir in 1(mmHg: mil´ımetros de mercurio: es la unidad de medida correspondiente a los tensi´ometros que significa la altura alcanzada por una muestra de mercurio contenida en un tubo presurizado luego de haberse impreso fuerza en un extremo. Es la medida aceptada a nivel mundial para medir la presi´on arterial) 2Este concepto podr´ıa encontrarse en la literatura estad´ıstica como Modelo o Sistema de Ecuaciones Estructurales. Como ejemplo, se recomienda ver [MTEPea16] 3(Ex´ogeno: indica que es una variable (observable o latente) ηi que no est´a definida dentro del modelo, es decir, no tiene otras variables que expliquen su comportamiento. An´alogamente, una variable end´ogena (observable o latente) ξi corresponde a una variable que tiene al menos una variable dentro del modelo que tiene una relaci´on causal sobre ella, es decir puede expresarse de la forma ξi = f(ηi,xi).

MEE usando m´ultiples mediciones bioqu´ımicas y electr´onicas (variables observadas ex´ogenas). No obstante, la misma variable nivel de estr´es puede ser usada en otro MEE atendiendo otro tipo de investigaci´on como una variable latente ex´ogena. Tal es el caso de los modelos utilizados en psicolog´ıa que buscan medir el grado de riesgo psico-social en un entorno laboral.

Para efectos del presente art´ıculo, las variables latentes consideradas en el modelo ser´an tratadas como end´ogenas y las variables observadas como ex´ogenas.

Los siete componentes que brindan la especificaci´on funcional de un MEE son los siguientes:

i = 1,2,...,m ecuaciones.

j = 1,2,...,k variables ξi,ηi: variable latente definida en la i-´esima ecuaci´on. xi,yi,...: variable observable o variable indicadora definida en la i-´esima ecuaci´on.

βij: par´ametro de la ecuaci´on estructural que mide el cambio de la j-´esima variable latente sobre la variable end´ogena (latente u observable) en la i-´esima ecuaci´on. δij: par´ametro de la ecuaci´on estructural que mide el cambio de una variable ex´ogena (observable) sobre una variable end´ogena (latente u observable) en la i-´esima ecuaci´on.

ζi: componente aleatorio de la ecuaci´on.

Por ejemplo, al hacer una adaptaci´on a la representaci´on de [KB89], se puede plantear el siguiente MEE: Consideremos que nos interesa modelar el nivel de consolidaci´on democr´atica (ηt) de un pa´ıs en 1960 y 1965 {t1 = 1960,t2 = 1965}, la cual ser´a la variable objetivo en funci´on de la variable observable llamada Producto Interno Bruto - PIB (xt). A su vez, nos interesa ver si otra variable latente (nivel de industrializaci´on de una econom´ıa) definida como ξt tiene incidencia sobre el nivel de estabilidad democr´atica en t, es decir en η1,η2. Por lo anterior, el MEE con variables latentes para este ejemplo se podr´ıa modelar mediante las siguientes ecuaciones:

η1 = δ11ξ1 +ζ1,

(1)

η2 = δ21η1 +β22x2 +ζ2,

(2)

donde η1 := nivel de estabilidad democr´atica en 1960, ξ1 := nivel de industrializaci´on en 1960, η2 := nivel de estabilidad democr´atica en 1965, ζ1,ζ2 := efectos aleatorios de las ecuaciones (1) y (2), respectivamente. En otras palabras, este modelo busca validar si el nivel de estabilidad de la econom´ıa en 1965 depende no solo de sus condiciones de industrializaci´on e ingreso ese mismo a˜no, sino tambi´en el efecto intertemporal de la estabilidad democr´atica estimada en 1960. Para facilitar la comprensi´on del modelo, se puede representar la interacci´on entre las variables mediante un diagrama de trayectorias como se ilustra en la figura 1:

p. 3

Estimaci´on de un Modelo de Ecuaciones Estructurales para Informalidad Laboral - Mariam Pinto y C´esar Lara Figura 1: Ejemplo de Diagrama de Trayectoria Definici´on 3.2 (Matriz de Covarianzas). Corresponde al conjunto finito de (k x k) varianzas y covarianzas de las variables consideradas en el modelo. Se denota como Σ a la matriz de varianzas de la poblaci´on, S la matriz muestral y Σ(θ) a la matriz de covarianzas estimada en el modelo. La estimaci´on de la matriz de varianzas depende de los par´ametros θ, los cuales se obtienen mediante la inferencia estad´ıstica usando los estimadores muestrales {β,δ,ξ}.

Por ejemplo, consideremos el siguiente vector de variables y = (y1,y2,y3). Entonces, haciendo uso de la notaci´on de [MG08], la matriz de varianzas y covarianzas se representa como Σ = E(y′y) =   σ2(y1) σ(y1,y2) σ(y1,y2) σ(y2,y1) σ2(y2) σ(y2,y3) σ(y3,y1) σ(y3,y2) σ2(y3)  , donde σ2(yi) es la varianza de cada variable y σ(yi,yj) con j̸ = i, ∀i ∈N, ∀j ∈N representa la covarianza entre ambas variables. Sean ε1,ε2 dos vectores aleatorios con E(ε1),E(ε2) = 0, var(ε1) = σ2(ε1);var(ε2) = σ2(ε2),σ2(ε1),σ2(ε2) ∈R, podemos plantear el siguiente MEE:

y2 = β1y1 +ε2,

(3)

y3 = β2y1 +ε3.

(4)

En part´ıcular, la estimaci´on de la matriz S para el modelo en (3) y (4) puede sintetizarse como:

S =   σ2 (y1) β1σ2 (y1) β 2

1 σ2 (y1)+σ2 (ε2)

β2σ2 (y1) β1β2σ2 (y1) β 2

2 σ2 (y1)+σ2 (ε3)

  Definici´on 3.3 (Diagrama de Trayectoria). Es una representaci´on gr´afica que busca modelar los elementos constitutivos de una ecuaci´on estructural y las posibles relaciones entre las variables latentes y observables [KB89]. Los componentes primarios de este diagrama tienen una correspondencia con lo definido en [LCS20] (ver la Figura 2):

Tr´ıangulo: constante del sistema de ecuaciones. Rect´angulo: variable observable o xi,yi,.... Ovoide: variable latente o ξi,ηi:.

C´ırculo: componente aleatorio o ζi.

Figura 2: Componentes de un Sistema de Ecuaciones Estructurales-MEE Flecha recta: relaci´on de causalidad desde una variable a otra.

Flecha curva: covarianza entre dos componentes del

MEE.

Definici´on 3.4 (Funci´on de M´axima Verosimilitud.). Ecuaci´on que permite maximizar la probilidad de estimar los coeficientes asociados a un modelo de ecuaciones estructurales basado a una muestra espec´ıfica. De acuerdo con [KSEaHM03], esta funci´on se puede estimar como:

logL = −1 2(n−1)  log|Σ(θ)|+tr SΣ(θ)−1 +c,

(5)

donde L es la funci´on de verosimilitud, n el tama˜no de la muestra, θ es el vector de par´ametros a estimar en el modelo, Σ(θ) es la matriz de covarianzas estimada a partir del modelo, S la matriz de covarianzas obtenida de la muestra, tr es la traza de la matriz y c ∈R una constante producto de la transformaci´on logaritmo a la funci´on L inicial. Aplicando m´ultiples operaciones algebraicas para simplificar la ecuaci´on (5)4, se puede obtener el m´aximo valor posible de la funci´on anterior respecto a la variable θ mediante la siguiente funci´on:

FML = log|Σ(θ)|−log|S|+tr SΣ(θ)−1 −(p+q)

(6)

donde p es el n´umero de variables ex´ogenas y q el n´umero de variables end´ogenas [JL21].

Definici´on 3.5 (Medidas de bondad de ajuste). Los MEE hacen parte de los m´etodos de modelamiento estad´ıstico que permiten estimar un valor esperado sobre las variables objetivo del modelo, con lo cual se puede establecer el grado de precisi´on del modelo.

Esta eficacia de los modelos de ecuaciones estructurales se miden con varios indicadores que, en esencia, parten del mismo estimador estad´ıstico conocido como el estimador de la 4Para mayor detalle del proceso de simplificaci´on algebraica para derivar la Funci´on de Verosimilitud inicial, se recomienda referirse al art´ıculo de Sik- Yum Lee, Xin-Yuan Song, John C. K. Lee en [SYLea03]

p. 4

Pask´ın Matem´atico Vol. 7 No 1 (2025) 14-22.

17

prueba Chi-Cuadrado. Como se expresa en [?Frankfurt], este estad´ıstico se puede estimar con la siguiente ecuaci´on: χ2(d f) = (N −1)F[S,Σ( ˆθ)],

(7)

donde d f = s −t son los grados de libertad del modelo, s es el n´umero de vectores no redundantes o no repetidos en S y t n´umero de par´ametros total a ser estimado. Por construcci´on del estimador χ2(d f), la hip´otesis nula de la prueba hip´otesis sobre la bondad de ajuste del modelo corresponde a que la diferencia entre las entradas de la matriz de covarianzas estimada por el modelo Σ( ˆθ) respecto a la poblacional Σ es estad´ısticamente cero. Como se referencia en [RHH23], valores altos de este estad´ıstico implica un mal ajuste del modelo. Es importante aclarar que las medidas de bondad de ajuste para un MEE tomando como referencia el concepto de modelo base, el cual consiste a un modelo donde no se contemplan covarianzas o trayectorias de casualidad entre las variable, y en consecuencia, no hay variables end´ogenas. Lo ´unico que se modela es la varianza de cada variable, de la cual se obtiene una matriz de covarianza muestral S de referencia. Tomando en cuenta el valor de la prueba chi-cuadrado, a continuaci´on se enuncian algunos de los principales estad´ısticos de prueba utilizados para determinar el ajuste del modelo: RMSEA (Root Mean Square Error of Aproximation- Ra´ız Cuadrada del Error de Aproximaci´on.) Este estad´ıstico de prueba mide en t´erminos absolutos la bondad de ajuste del modelo. La ventaja de este indicador consiste en que reduce la escala de la ecuaci´on (6). Basado en [YXaYY19], el RMSEA puede estimarse con la siguiente ecuaci´on:

RMSEA =

r χb d f(N −1).

(8)

Es inmediato considerar que al ser un transformaci´on mon´otona del estad´ıstico de prueba χb con la funci´on ra´ız cuadrada, a menores valores de RMSEA mejor bondad de ajuste del modelo.

CFI (Comparative Fit Index - ´Indice comparativo de Ajuste): Este ´ındice compara la diferencia entre la especificaci´on del modelo establecida en el modelamiento versus el modelo base, a trav´es del siguiente cociente: CFI = χb −χm χb

.

(9)

Como esta es la estimaci´on de un cambio relativo respecto al modelo base, este coeficiente oscila en el intervalo [0,1]. Adicionalmente, a diferencia del estad´ıstico de prueba χ2(d f), un CFI alto o se interpreta como un buen ajuste.

´Indice Tucker Lewis (TLI) o ´Indice de Ajuste No- Normalizado (NNFI). Al igual que el CFI, corresponde a una medida de bondad de ajuste incremental en la que se puede ver que tanto mejora la especificaci´on del modelo respecto respecto al modelo nulo. Su ecuaci´on es la siguiente [SCaIE15]:

TLI =

χ2 b/vb  − χ2 t /vt  χ2 b/vb  −1 = (Fb/vb)−(Ft/vt) (Fb/vb)−(1/(n−1))

(10)

Donde χ2 b: estad´ıstico chi-cuadrado para el modelo base; χ2 t estad´ıstico chi-cuadrado para el modelo estimado; F es valor aproximado de la funci´on FML definido en la secci´on anterior y v sus respectivos grados de libertad del estad´ıstico de prueba.

Heur´ısticamente, se ha identificado una amplia literatura que determinado valores cr´ıticos en donde puede considerarse que los modelos tienen una buena bondad de ajuste. Estos criterios se resumen en la Tabla 1: 5 Indicador Valores ´Optimos χ2 2,0−5,0

RMSEA

≤0,05(´optimo)/≤0,10(bueno)

CFI

≥0,95(´optimo)/≥0,90(bueno)

TLI

≥0,95(bueno) Cuadro 1: Valores ´optimos para medidas de bondad de ajuste. Definici´on 3.6 (Prueba de Esfericidad de Barlett). Sea R una matriz de correlaciones lineales. Sea p el rango R y H0 una hip´otesis nula, la cual afirma que la matriz poblacional de correlaciones lineales sea la matriz identidad de orden p [RW22].

Sea T el estad´ıstico de prueba definido como: T = −log(det(R))(N −1−(2p+5)/6)

(11)

entonces, T ∼χg, con g : p(p–1)

2

grados de libertad

4.

Los Datos Para obtener una medici´on aproximada consistente sobre la informalidad y su relaci´on con otras variables econ´omicas, se considera adecuado usar los microdatos anonimizados de la Gran Encuesta Integrada de Hogares (GEIH) producida por el DANE. La ventaja de usar los propios datos del DANE permite contrastar si la definici´on de informalidad establecida por esta entidad se materializa en hechos concretos de la din´amica econ´omica. Las caracter´ısticas de los datos a procesar son: Tipo de Registro: Datos de corte transversal. Tablas de Origen: Ocupados y Caracterizaci´on del Hogar.

Ventana de selecci´on: Enero/2022 - Mayo/2023. 5Para mayor detalle, ser recomienda revisar [HDaCJea08] en la bibliograf´ıa.

p. 5

Estimaci´on de un Modelo de Ecuaciones Estructurales para Informalidad Laboral - Mariam Pinto y C´esar Lara Unidad de Observaci´on: DIRECTORIO (Unidad familiar).

´Indice de referencia de observaci´on i = 1,2,3,...,N. Esquema de agregaci´on: La unidad de agregaci´on original es una llave compuesta

DIRECTORIO-

ORDEN(individuo), por lo cual se totaliza informaci´on en t´erminos de la unidad familiar.

Tama˜no de Muestra N: 263.396 unidades familiares.

5.

Estimaci´on del modelo El objetivo de alcanzar el mejor modelo se obtiene mediante la identificaci´on de las relaciones entre las variables ex´ogenas con la la variable end´ogena. As´ı, se propone la siguiente metodolog´ıa para encontrar dichas variables y relaciones:

1. Identificar posibles variables indicadoras u observables:

De las ocho tablas constitutivas del la GEIH, se tienen

603 campos que miden los atributos de educaci´on, ingre-

sos, vivienda, migraci´on, ocupaci´on de las unidades familiarias muestreadas en la GEIH. Luego de revisar cada una, se seleccionan las siguientes variables como campos relevantes para explicar el concepto de informalidad laboral, los cuales se sintetizan en la tabla 2: 6: Variable Descripci´on de Variable P6100 Tipo de vinculaci´on a Seguridad Social P3042 M´aximo grado de escolaridad en la familia P6040 Edad alcanzada por la Cabeza de Hogar P6426 Antig¨uedad en la empresa o negocio

INGLABO

Ingresos percibidos por el individuo Cuadro 2: Variables de insumo. Gran Encuesta Integrada de Hogares

2. An´alisis de comportamiento estacional:

Con el fin de identificar tendencias en las variables definidas, se agregaron como Series de Tiempo con frecuencia semanal (T = 73). Se obtuvo la descomposici´on estacional aditiva de los totales de cada variable. Basado en lo anterior, se observ´o que la media muestral de cada serie mantiene rangos muy cerrados y que el comportamiento estacional observado obedece a condiciones propias de la operaci´on estad´ıstica.

Como se ilustra en la Figura 3, el n´umero de personas vinculadas con el r´egimen contibutivo emula el comportamiento estacional del tama˜no de muestra encuestada, que en tiempos regulares oscila entre 2.600 - 3.400 registros y cada 4 semanas aumenta en el rango de 5.600 - 6.400 registros.

6Para mayor detalle de los los c´odigos constitutivos del Diccionario de Datos de la GEIH, se recomienda consultar [DANdE23b] Figura 3: Serie de Tiempo del n´umero de observaciones encuestada en Figura 4: Descomposici´on estacional para la serie de tiempo Edad M´axima de Cabeza de Hogar Por otro lado, como se observa en la Figura 4, la descomposci´on estacional aditiva de las series definidas, no evidencia cambios abruptos de tendencia. Por ejemplo en la variable ECHi, se observa que a pesar de tener una tendencia creciente, el rango o Ran(ECHi) = [49,2−50,0], lo cual puede entenderse como estable. Por lo anterior, se considera adecuado tratar el cuerpo de datos como corte transversal, confirmando que la aproximaci´on mediante t´ecnicas de series de tiempo no es adecuada.

3. An´alsis Factorial. Se propone realizar un an´alisis de fac-

torial con las variables que han quedado seleccionadas en la agregaci´on de informaci´on:

x1 (x1_edad) Edad alcanzada por quien ejerza la cabeza del hogar.

x2 (x2_escol) M´aximo grado de escolaridad alcanzado por la cabeza del hogar.

x3 (x3_num_subs) N´umero de personas en r´egimen subsidiado por hogar.

x4 (x4_tamano_hogar) Tama˜no del hogar (N´umero de personas en el hogar).

p. 6

Pask´ın Matem´atico Vol. 7 No 1 (2025) 14-22.

19

x5 (x5_ant_emp) Antig¨uedad promedio en negocio o empresa.

x6 (x6_ing_labor) logaritmo natural del ingreso laboral mensual. 7 Se identifica que las variables tienen correlaciones cruzadas positivas de baja magnitud (ver Figura 5), a excepci´on de la pareja (x3,x4) cuya correlaci´on ˆr(x3,x4) = 0,87, la cual permite inferir que la informalidad (vinculaci´on al Sistema de Seguridad Social en calidad de subsidiado) est´a altamente relacionado con la proporci´on de personas sujetas al r´egimen subsidiado en un hogar. Adicionalmente, teniendo en cuenta que el p-valor asociado al estad´ıstico de prueba de esfericidad de Barlett cay´o en zona de rechazo (2,202791x10−35), se puede afirmar que las variables son objeto de aplicarles un an´alisis de reducci´on de factores [NIoSaT21] ya que se rechaza la hipotesis nula que la matriz de covarianza poblacional sea la matriz unitaria.

Al aplicar el m´etodo de An´alisis Factorial sobre la muestra en consideraci´on, se obtuvieron las siguientes combinaciones lineales de los Factores (F1,F2,F3): F1 = 0,35x1 +0,11x2 +0,89x3 +0,94x4 +0,21x6, (12) F2 = 0,26x1 +0,99x2 +0,19x3 +0,15x4 +0,47x6, (13) F3 = 0,23x1 +0,99x2 +0,99x5 +0,12x6,

(14)

Tipo de Proporci´on F1 F2 F3 Varianza

0.310

0.224

0.176

Varianza (Acum)

0.310

0.534

0.710

Cuadro 3: Resultados del An´alisis Factorial Producto de la estimaci´on de an´alisis factorial anterior, se observa que la proposici´on de tres variables latentes (obtenidas como combinaciones lineales entre las variables indicadoras) podr´ıa capturar el 71,0% de la variabilidad total del modelo (Ver Tabla 3).

De las ecuaciones, se puede inferir:

El Factor 1 corresponde a variables asociadas a informalidad (x3_num_subs

-

(n´umero de personas en r´egimen subsidiado) y x4_tamano_hogar - (n´umero de personas en el hogar), con lo cual puede representarse a trav´es de una variable latente η1 como constructor de informalidad demogr´afica.

El Factor

2

tiene pesos m´as altos asociados a x2_escol -Escolaridad y la variable x6_ing_labo Ingreso, con lo cual puede considerarse como una variable latente η2 de informalidad econ´omica.

7Se hace transformaci´on por logaritmo natural en la medida que el m´etodo de An´alisis Factorial es sensible a variables con escalas d´ısimiles entre si. Figura 5: Correlaciones lineales entre variables El Factor 3 η3 incorpora la temporalidad, en la medida que el mayor valor absoluto de una variable sobre el indicador corresponde a la variable de x4_ant_emp.

4. Proposici´on de un Sistema de Ecuaciones Estructurales:

En funci´on a lo observado en el anterior t´ıtulo, se propone un MEE con variables latentes (ηi), las cuales se definen como η1: informalidad demogr´afica; η2: informalidad econ´omica y η3: factor temporal. Cada uno de estos factores son expresados en funci´on de las variables observables x1,i = {1,2,3,4,5,6} e incluyendo sus diferentes componentes aleatorios (ζi).

Para modelar el comportamiento de las variables latentes mencionadas, se propone trabajarlo mediante dos alternativas de modelos: 1) Modelo b´asico: el cual corresponde a una sola variable latente como combinaci´on lineal de las variables observables. 2) Modelo ampliado cuya especificaci´on funcional reconoce la existencia de tres componentes latentes de la informalidad. Ambos modelos se ilustran a continuaci´on:

Modelo B´asico:

ω =

6

∑ i=1 α1ixi +ζ5.

(15)

Modelo Ampliado:

η1 = δ11x3 +δ12x4 +ζ1,

(16)

η2 = δ21x2 +δ22x6 +ζ2,

(17)

η3 = δ31x1 +δ32x5 +ζ3,

(18)

γ = a1η1 +a2η2 +a3η3 +ζ4

(19)

p. 7

Estimaci´on de un Modelo de Ecuaciones Estructurales para Informalidad Laboral - Mariam Pinto y C´esar Lara Figura 6: Diagrama de Trayectoria para Modelo B´asico Figura 7: Diagrama de Trayectoria para Modelo Ampliado

5. Coeficientes obtenidos:

Mediante la estimaci´on la ambos sistemas de ecuaciones estructurales con variables latentes, se observan dos situaciones particulares en t´erminos de la estimaci´on de coeficientes (ver salidas de modelos en R. Figura 8 y Figura 9): Por un lado, tanto en el modelo b´asico como en el modelo ampliado, las variables con coeficiente (estandarizado - columna Std.all) en valor absoluto m´as alto son las asociadas al tama˜no del hogar y n´umero de personas en el r´egimen subsidado. Por ejemplo, para el Modelo B´asico, un cambio de 1 desviaci´on est´andar en el n´umero de personas vinculadas en r´egimen subsidiado incide en un cambio de 0.948 desviaciones est´andar en la variable latente ω.

Por otro lado, se evidencian signos contrarios a los esperados respecto a los coeficientes de x2_escol y x6_ing_labor (0.309 y 0.319 respectivamente) pues se obtuvieron coeficientes positivos a pesar que el an´alisis econ´omico relacionar´ıa estas variables de forma negativa con la variable latente construida. En otras palabras, la l´ogica econ´omica permite sostener la hip´otesis que a mayor grado de escolaridad se logra una mayor grado de remuneraci´on salarial que es m´as probable en una vinculaci´on formal, es decir, a mayor grado de escolaridad, menor informalidad.

No obstante, la estimaci´on de correlaciones lineales par- Figura 8: Coeficientes Modelo B´asico Figura 9: Coeficientes Modelo Ampliado ciales entre estas variables permite inferir que las relaciones, aunque sean d´ebiles, son positivas, con lo cual se generan resultados s´olidos que invitan a reflexionar sobre las condiciones o factores ex´ogenos sobre estas variables que permiten obtener resultados contrarios a la l´ogica econ´omica.

6.

Evaluaci´on de los modelos Los resultados de la estimaci´on para ambos modelos permite afirmar que el Modelo Ampliado presenta mejores medidas de bondad de ajuste, tal como se presenta en la Tabla 4: Retomando los criterios heur´ısticos identificados en investigaciones previas, el Modelo Ampliado cuenta con un CFI de 0.982, el cual puede ser considerado como ´optimo, mientras que el modelo b´asico obtiene un valor CFI inferior al bueno

(0.873).

Por otro lado, indicador RMSEA, el cual mide la participaci´on del componente aleatorio sobre la variabilidad del modelo, permite inferir que el modelo ampliado tiene un grado muy bajo en error cuadr´atico (0.081), mientras que el modelo b´asico tiene un efecto de error mayor al doble del modelo ampliado (0.196).

p. 8

Pask´ın Matem´atico Vol. 7 No 1 (2025) 14-22.

21

Concepto Modelo B´asico Modelo Ampliado

CFI

0.873

0.982

TLI

0.729

0.954

AIC

7574817.227

7493774.601

RMSEA

0.196

0.081

Cuadro 4: Comparaci´on de medidas de bondad de ajuste.

7.

Conclusiones La aplicaci´on de un MEE brinda mejores resultados en t´erminos de bondad de ajuste e interpretabilidad de los resultados para modelar un fen´omeno a trav´es de mediciones latentes. Adicionalmente, descomponer la medici´on de variables latentes a trav´es de varias combinaciones lineales permite diferenciar los efectos de variabilidad identificados mediante t´ecnicas de reducci´on de dimensiones como el An´alisis Factorial.

No obstante, se observan datos en el desempe˜no de los modelos que es adecuado manejarlos con prudencia: Inicialmente, para tama˜nos de muestra grande (en este caso la GEIH), tiene a rechazarse la prueba de que la matriz de covarianza estimada por el modelo es similar a la poblacional, lo cual deja a consideraci´on reflexionar si los resultados de coeficientes son adecuados para analizar el modelo.

Por otro lado, se parte de la consideraci´on que las variables tienen correlaci´on baja y por ende, en un escenario reduccionista, se excluyen de la estimaci´on. No obstante, la inclusi´on de mayores correlaciones entre variables regresoras implicar´ıa problemas de sobreespecificaci´on del modelo y en consecuencia no poder generar la estimaci´on adecuada.

* Acerca de la investigaci´on: Este art´ıculo es producto

de la Pr´actica Profesional bajo modalidad investigativa desarrollada por los autores para el periodo 2023-2, en el marco del cooperaci´on acad´emica interinstitucional ente el Centro de Investigaciones en Matem´aticas e Ingenier´ıas de la Fundaci´on Universitaria Konrad Lorenz y el Grupo de An´alisis de Bienestar de la Facultad de Ciencias Econ´omicas de la Universidad Nacional de Colombia.

Referencias [KB89] Kenneth Bollen, Structural Equations with Latent Variables (1989), 1-150. Wiley Series in Probability and Mathematical Statistics.

[LCS20] Laura Castro-Schilo, Structural Equations Models A favorite amongst those who use them...

wonder why?,

2020.

https://towardsdatascience.com/ structural-equations-models-3d8578952f87.

[DANdE23a] Departamento Administrativo Nacional de Estad´ıstica, Bolet´ın T´ecnico - Informalidad Laboral en Colombia. Trimestre Noviembre 2022-Enero 2023 (2023). https: //www.dane.gov.co/files/investigaciones/ boletines/ech/ech_informalidad/bol_geih_ informalidad_nov22_ene23.pdf.

[DANdE23b]

,

Diccionario de Datos,

2023.

https:

//microdatos.dane.gov.co/index.php/ catalog/771/data-dictionary.

[MTEPea16] Mar´ıa Teresa Escobedo Portillo et al., Modelos de ecuaciones estructurales: Caracter´ısticas, fases, construcci´on, aplicaci´on y resultados, Ciencia y Trabajo - Universidad Aut´onoma de Ciudad Ju´arez, Chihuahua, M´exico

18 (2016), no. 55. http://dx.doi.org/10.4067/

S0718-24492016000100004.

[MG08] Marin Guenov, Covariance Structural Models of the Relationship between the Design and Customer Domains, Journal of Engineering Design 19 (2008), no. 1, 75-95. https: //sci-hub.se/10.1080/09544820701213378.

[HDaCJea08] Hooper D. and Coughlan J. et al., Structural Equation Modelling: Guidelines for Determining Model Fit, Vol. 6, 2008. https://core.ac.uk/download/pdf/ 297019805.pdf.

[RHH23] Rick H. Hoyle, Handbook of Structural Equation Modelling, 2nd Edition, The Guildford Press, 2023.

[JMIL21] Juan Miguel Iglesias Labraca, Modelos de Ecuaciones Estructurales, Trabajo de Grado en Matem´aticas - Universidad de Almer´ıa (2021). https://repositorio.ual.es/ handle/10835/13177.

[SYLea03] Sik-Yum Lee et al., Maximum Likelihood Estimation of Nonlinear Structural Equation Models with Ignorable Missing Data, Journal of Educational and Behavioral Statistics 28 (2003), no. 2. https://www.jstor.org/stable/3701258. [JL21] Johnny Lin, Introduction to Structural Equation Modelling (SEM) in R with LAVAAN, Advanced research computing

- Statistical methods and Data Analysis, 2021. https://

stats.oarc.ucla.edu/r/seminars/rsem.

[EM19] Ed Merkle, Introductory Structural Equation Modeling,

2019.

https://pj.freefaculty.org/guides/ crmda_workshops/sem/sem-1/sem-1.pdf.

[Myu03] I. J. Myung, Maximum likelihood estimation, Journal of mathematical Psychology 47 (2003), no. 1. https://web. pdx.edu/˜newsomj/semclass/ho_ML.pdf.

[NIoSaT21] National Institute of Standards and Technology, 1.3.5.7. Bartlett’s Test, 2021. https://www.itl.nist.gov/ div898/handbook/eda/section3/eda357.htm.

[OIpeT22] Organizaci´on Internacional para el Trabajo, Econom´ıa informal en Am´erica Latina y el Caribe,

2022.

https://www.ilo.org/wcmsp5/groups/ public/---americas/---ro-lima/documents/ publication/wcms_867497.pdf.

[SCaIE15] Sengul C. and Irkel E., Comparison of Model Fit Indices Used in Structural Equation Modeling Under Multivariate Normality, Vol. 14, 2015.

[KSEaHM03] Karin Schermelleh-Engel and Helfried Moosbrugger, Evaluating the Fit of Structural Equation Models: Tests of Significance and Descriptive Goodness-of-Fit Measures, Methods of Psychological Research Online 8 (2003), no. 2. https://www.stats.ox.ac.uk/˜snijders/ mpr_Schermelleh.pdf.

[PS15] Peter Spirtes, Latent Structure and Causal Variables, International Encyclopedia of the Social and Behavioral Sciences 2 (2015), 394-397. https://doi.org/10.1016/ B978-0-08-097086-8.42136-7.

[RW22] Rick Wicklin, On Bartlett’s sphericity test for correlation,

2022.

https://blogs.sas.com/content/iml/ 2022/04/27/bartletts-sphericity-test.

html.

[YXaYY19] Yan X. and Yanyun Y., RMSEA, CFI, and TLI in structural equation modeling with ordered categorical data: The story they tell depends on the estimation methods, Behavior Research Methods volume 51 (2019). https://doi.org/ 10.3758/s13428-018-1055-2.

p. 9

Estimaci´on de un Modelo de Ecuaciones Estructurales para Informalidad Laboral - Mariam Pinto y C´esar Lara [LAZ10] Luis Achaerandio Zuazo, Iniciaci´on a la Pr´actica de Investigaci´on, Instituto de Investigaciones Jur´ıdicas - Universidad Rafael Land´ıvar Guatemala, 2010.

Acerca de los autores: Este art´ıculo es producto de la Pr´actica Profesional bajo modalidad investigativa desarrollada por los autores para el periodo 2023-2, en el marco del cooperaci´on acad´emica interinstitucional ente el Centro de Investigaciones en Matem´aticas e Ingenier´ıas de la Fundaci´on Universitaria Konrad Lorenz y el Grupo de An´alisis de Bienestar de la Facultad de Ciencias Econ´omicas de la Universidad Nacional de Colombia.

Cita: Pinto Heydler, Mariam, Lara Santana, Cesar Augusto (2025), Estimación de un modelo de ecuaciones estructurales para informalidad laboral, Fundación Universitaria Konrad Lorenz, p. N. https://repositorio.konradlorenz.edu.co/handle/001/6484