PROCESOS EVOLUTIVOS E INVARIANTES FILOGEN´ETICOS
Hern´andez Sol´ıs, Jos´e Fabi´an * jose.hernandezsolis@ucr.ac.cr ”No hay ninguna diferencia fundamental entre el hombre y los animales en su capacidad de sentir placer y dolor, felicidad y miseria.”
——————————————————————————– Charles Darwin Introducci´on La filogen´etica es una rama de la biolog´ıa que estudia las relaciones evolutivas entre diversas especies u otros grupos de organismos. En este art´ıculo, se explorar´an los invariantes filogen´eticos, los cuales son relaciones algebraicas que son respetadas por las distribuciones de nucle´otidos de un determinado modelo evolutivo de varias especies. Los procesos evolutivos pueden ser estudiados a partir de la teor´ıa de grafos, para lo cual se establece la definici´on de un ´arbol filogen´etico; el cual es un ´arbol binario1 que posee una biyecci´on φ entre el conjunto de hojas y el conjunto de las especies que se desea estudiar.
Los v´ertices de un ´arbol filogen´etico representan a los organismos, especies o genes en estudio. Las hojas, representan las especies actuales o las secuencias de genes observadas. Los v´ertices internos de un ´arbol filogen´etico, representan los ancestros comunes hipot´eticos. Las aristas conectan los v´ertices y representan las relaciones evolutivas entre ellos. La longitud de las aristas puede reflejar el tiempo evolutivo o la cantidad de cambio gen´etico que ha ocurrido. A los ´arboles filogen´eticos se les asigna un nodo base llamado ra´ız, el cual representa al ancestro m´as reciente que es com´un entre todas las especies. Otra definici´on importante que se debe analizar es la topolog´ıa del ´arbol filogen´etico, la cual se refiere a la estructura y disposici´on de las ramas entre los v´ertices del ´arbol, sin tener en cuenta la longitud de las ramas ni los datos cuantitativos asociados a ellas. El enfoque algebraico de este proyecto consiste en determinar m´etodos algebraicos que ayuden a describir algunos invariantes filogen´eticos, para esto vamos a utilizar [CF10] como referencia complementaria.
*Universidad de Costa Rica
1. Un grafo cuyos v´ertices internos tienen grado 3.
2. Cambio de Adenina a Guanina
3. Cambio de Adenina a Timina
4. Se elimina uno o m´as nucle´otidos de una cadena de ADN
1.
Modelos Evolutivos En una secuencia de ADN existen cambios constantes por ejemplo las transmisiones2, transiciones3, supleciones4, a pesar de provenir de un mismo gen; es decir que las secuencias de ADN no son id´enticas entre s´ı. Es por ese motivo que para este art´ıculo, se parte de un alineamiento de las secuencias de ADN para determinar cuales partes del genoma se corresponden mutuamente.
Especie Secuencia Homo sapiens
ATAACTGAGCGAGGAGATAG
Pan troglodytes
ATGACTGAGCGAGGAGATAG
Mus musculus
ATGACTGGGCGAGGAGATAG
Canis lupus familiaris
ATGACTGAGCGAGAAGATAG
Tabla 1.2 Alineamiento de las cadenas de ADN de las especies Homo sapiens (Humano), Pan troglodytes (Chimpanc´e), Mus musculus (Rat´on) y Canis lupus familiaris (Perro). El objetivo es que a partir del alineamiento dado, se pueda determinar el ´arbol binario correspondiente. Para eso, resulta conveniente considerar ´unicamente la mutaci´on de nucle´otidos, esto para no considerar procesos de supresi´on e inserci´on (agregar o eliminar nucle´otidos de la cadena respectivamente).
Para hacer una representaci´on del proceso de evoluci´on entre especies se va a brindar un modelo estad´ıstico bajo las siguientes hip´otesis expuestas en [CF10] en la p´agina 1025: (i) La evoluci´on de una especie asociada a un v´ertice del ´arbol s´olo depende de la especie representada en el nodo inmediatamente superior.
(ii) Las mutaciones ocurren de manera aleatoria y la probabilidad de que se produzca una mutaci´on es siempre positiva.
(iii) Las distintas posiciones de la cadena de ADN evolucionan de forma independiente y bajo las mismas probabilidades de mutaci´on.
Ejemplo 1.1: Considere el alineamiento presentado en la Tabla 1, la probabilidad de obtener el alineamiento presentado var´ıa en funci´on del ´arbol filogen´etico que relaciona las especies.
Procesos Evolutivos e Invariantes Filogen´eticos Ancestro Com´un Ancestro de Humanos y Chimpanc´es Homo sapiens(Humano) Pan troglodytes(Chimpanc´e) Ancestro de Ratones y Perros Mus musculus(Rat´on) Canis lupus familiaris(Perro) Figura 1: ´Arbol Filogen´etico 1 Ancestro Com´un Ancestro de Chimpanc´es y Ratones Pan troglodytes(Chimpanc´e) Mus musculus(Rat´on) Ancestro de Humanos y Perros Homo sapiens(Humano) Canis lupus familiaris(Perro) Figura 2: ´Arbol Filogen´etico 2 Ancestro Com´un Ancestro de Humanos y Ratones Homo sapiens(Humano) Mus musculus(Rat´on) Ancestro de Chimpanc´es y Perros Pan troglodytes(Chimpanc´e) Canis lupus familiaris(Perro) Figura 3: ´Arbol Filogen´etico 3 Ancestro Com´un Ancestro de Humanos y Perros Homo sapiens(Humano) Canis lupus familiaris(Perro) Ancestro de Chimpanc´es y Ratones Pan troglodytes(Chimpanc´e) Mus musculus(Rat´on) Figura 4: ´Arbol Filogen´etico 4 Por la hip´otesis (iii) basta modelar la posici´on de uno de los ´arboles.
Seg´un lo mencionado en la p´agina 1026 de [CF10], a cada v´ertice i se le asigna una variable aleatoria discreta Xi que toma valores en el conjunto de los cuatro nucle´otidos, representado por {A,C,G,T}. Cada columna del alineamiento se considera una observaci´on del vector aleatorio X = (X1,X2,X3). Por lo tanto, las variables aleatorias Xi en las hojas del ´arbol se denominan observadas. En cambio, las variables aleatorias en los nodos internos se denominan ocultas, ya que no podemos observarlas directamente. Definici´on 1.1 [Variedad Algebraica]: Una variedad algebraica es un conjunto de soluciones de un sistema de ecuaciones polinomiales sobre un campo (cuerpo). Definici´on 1.2 [Probabilidad Condicional] Sea (Ω,A ,P) un espacio de probabilidad arbitrario y A ∈A un suceso de tal forma que P(A) > 0, para dado otro suceso B ∈A , se define la probabilidad condicional de B dado A como: P(A | B) = P(A∩B) P(B) , En otras palabras, es la probabilidad de que ocurra el suceso A dado que se sabe que el suceso B ya ocurri´o. Ejemplo 1.2: La probabilidad entre estados, representado por P1|n−1(yn,tn|y1,t1;...;yn−1,tn−1) es la probabilidad de que el proceso est´e en el estado yn en el tiempo tn, dado que ha pasado por la secuencia completa de estados y tiempos (y1,t1),...(yn−1,tn−1).
Ejemplo 1.3: P1|1(yn,tn|y1,t1;...;yn−1,tn−1) es la probabilidad de que el proceso est´e en el estado yn est´e en el tiempo tn, dado ´unicamente por el estado inmediatamente anterior (yn−1,tn−1).
Pask´ın Matem´atico Vol. 7 No 2 (2025) 01-08.
3
Esto nos lleva a introducir lo que es un proceso de Markov. Definici´on 1.3 [Proceso de Markov] Un proceso de Markov es un proceso estoc´astico tal de que para secuencia de n tiempos, t1 < ... < tn, se satisface que:
P1|n−1(yn,tn|y1,t1;...;yn−1,tn−1) = P1|1(yn,tn|y1,t1;...;yn−1,tn−1), Podemos definir un proceso de Markov en un ´arbol filogen´etico T, como una sucesi´on de valores aleatorios {Xv}v v´ertice tal que para toda arista e, e : u −→v, Xv es condicionalmente independiente a cualquier variable Xw. (w̸ = u y no es descendiente de v) dado Xu. Definici´on 1.3. [Matriz de Markov] Una Matriz de Markov para un proceso de Markov de n estado es una matriz n×n cuyas entradas son probabilidades no negativas, tal que la suma de las entradas de las filas (columnas) es 1. Definici´on 1.4 [Modelo de Sustituci´on de Nucle´otidos]: Un modelo de sustituci´on de nucle´otidos es el encargado de modelar los cambios en las secuencias de ADN a lo largo de un ´arbol filogen´etico. Se representa mediante matrices de Markov 4 × 4, las cuales describen las probabilidades de sustituci´on de un nucle´otido y en un nodo ancestral (v´ertice padre) por un nucle´otido x en un nodo descendiente (v´ertice hijo).
El modelo incorpora una distribuci´on estacionaria π := (πA,πC,πG,πT), que define las frecuencias esperadas de los nucle´otidos en la ra´ız del ´arbol. En un ´arbol con v´ertices V y aristas E, cada arista e ∈E tiene asociada una matriz de transici´on Se, dada por:
Se = P(A|A,e) P(C|A,e) P(G|A,e) P(T|A,e) P(A|C,e) P(C|C,e) P(G|C,e) P(T|C,e) P(A|G,e) P(C|G,e) P(G|G,e) P(T|G,e) P(A|T,e) P(C|T,e) P(G|T,e) P(T|T,e) .
Cada entrada P(x|y,e) de Se representa la probabilidad condicional de que el nucle´otido y en el v´ertice padre sea sustituido por el nucle´otido x en el v´ertice hijo, condicionado al tiempo de evoluci´on o al modelo empleado en la arista e. Seg´un la estructura de la matriz y la distribuci´on π, se producir´an m´as o menos sustituciones en la arista e, y variar´a la distancia evolutiva. Se puede aproximar la cantidad de sustituciones ocurridas por nucle´otido en la rama e por −ln(det(Se))
4
. Ver [CF10].
Definici´on 1.5 [Modelo Basado en un Grupo]: Un modelo basado en un grupo, relativo a un grupo abeliano finito G es un modelo de substituci´on en el que las matrices S pueden definirse en t´ermino de una funci´on f : G −→R tal que S(g,h) = f(g−h); para todo g,h ∈G.
Ejemplo 1.4: El modelo Kimura 3-Par´ametros (K81) es un modelo que pasa por la existencia de una tasa de transici´on (α) para las sustituciones entre purinas y entre pirimidinas y dos tasas de transversi´on (β1 y β2) para las sustituciones entre purinas y pirimidinas.
Este modelo puede ser asociado con el grupo de Klein de la siguiente manera:
{A,C,G,T} ←→Z/2Z×Z/2Z A ←→(0,0) C ←→(0,1) G ←→(1,0) T ←→(1,1) Al asignar la funci´on a una matriz podemos considerar: f(0,0) = a f(0,1) = b f(1,0) = c f(1,1) = d Esto se puede realizar a otros modelos de substituci´on de nucle´otidos, pero primero veamos otros ejemplos: Ejemplos de Modelos de Substituci´on de Nucle´otidos En el punto anterior, se introdujo el modelo Kimura 3-Par´ametros (K81), que considera tres tasas de sustituci´on distintas:
α: tasa de transici´on entre purinas (A ↔G) y pirimidinas (C ↔T).
β: tasa de transversi´on entre una purina (A ↔C) y una pirimidina (G ↔T).
γ: tasa de transversi´on entre la otra combinaci´on de purina (A ↔T) y pirimidina (G ↔C).
Sin embargo, se pueden definir otros modelos de sustituci´on seg´un el grado de complejidad y los supuestos biol´ogicos. A continuaci´on se desglosan algunos de ellos: Modelo Kimura 2-Par´ametros (K80): Este modelo evolutivo parte de suponer la existencia de una diferencia entre tasas de transiciones (substituci´on entre purinas o pirimidinas) y transversiones (substituci´on entre purina y pirimidina). Este modelo introduce dos par´ametros, una tasa para transiciones (α) y otra para transversiones (β). Modelo Jukes-Cantor (JC69): En este modelo todas las sustituciones de nucle´otidos tienen la misma tasa. Adem´as, las frecuencias de los nucle´otidos son iguales (25% A, C, G, y T).
Procesos Evolutivos e Invariantes Filogen´eticos Podemos ahora, generar una versi´on algebraica de estos modelos utilizando las matrices de Markov de los procesos previos. Para m´as facilidad denotemos:
Se := a b c d e f g h j k l m n o p q e El modelo Kimura 3-Par´ametros pasa por definir subbloques sim´etricos en la matriz, es decir: Se := a b c d b a d c c d a b d c b a e adem´as de considerar π = 1 4(1,1,1,1) (Vamos a denotar a este tipo de matrices como una matriz K81) Podemos reducir este modelo al modelo Kimura 2-par´ametros considerando b = d, as´ı mismo podemos el modelo algebraico de Jukes- Cantor considerando b = d = c.
Lema 1.1 Las matrices de modelos K81 son diagonalizables.
Demostraci´on: En efecto, las matrices Si del modelo K81 son sim´etricas, por el teorema espectral, la matriz es diagonalizable.
Definici´on 1.3. Sea T un ´arbol filogen´etico tal que muestra la evoluci´on de 3 especies posicionadas en las hojas X1,X2,X3 respectivamente. Se define la probabilidad de observar a x,y y z en las hojas X1, X2 y X3 como:
pxyz := P(X1 = x; X2 = y; X3 = z | T), Si consideramos un proceso de Markov sobre el ´arbol de la figura 1, podemos inferir que pxyz est´a dado por las entradas de las matrices de Markov de dicho proceso. pxyz := ∑ α,β∈N πα ·S1(α,x)·S2(α,β)·S3(β,y)·S4(β,z) donde N = {A,C,G,T}.
2.
Splits y Topolog´ıas Definici´on 2.1 [Etiquetas]: Sea T un ´arbol filogen´etico. Llamamos etiquetas a los elementos asociados a las hojas del ´arbol T. El conjunto de todas las etiquetas se denota por X, y lo llamamos el conjunto de etiquetas del ´arbol T. Cada etiqueta representa un elemento ´unico del conjunto X, como una especie, un gen o un objeto de estudio. Ejemplo 2.1: El conjunto de etiquetas de los ´arbol filogen´etico 4 (figura 4) es:
X = {Pan Troglodytes, Mus musculus, Homo sapiens, Canis lupus familiaris}, Esto nos lleva a la siguiente definici´on: Definici´on 2.2 [Split]: Sea X un conjunto de etiquetas. Un split de X es una bipartici´on X1|X2 de X, es decir que existen X1,X2 ⊂X, tal que X1 ∪X2 = X y X1 ∩X2 = /0. Adem´as, decimos que el Split es trivial si X1 o X2 son singletones. Denotamos por Σ(T) al conjunto de Splits inducidos por el ´arbol T.
Pero esto genera la siguiente pregunta: ¿C´omo un ´arbol filogen´etico induce un Split?
La respuesta pasa por considerar un ´arbol filogen´etico T con X como el conjunto de etiquetas asociado a sus hojas. Cada arista del ´arbol T define un split X1 | X2 al eliminar esa arista y particionar las hojas en dos subconjuntos disjuntos, X1 y X2, que corresponden a los nodos alcanzables (los nodos que se pueden visitar desde un punto espec´ıfico siguiendo las aristas del ´arbol sin cruzar una arista eliminada) desde cada uno de los componentes conexos del ´arbol resultante. En otras palabras:
(i) Si se elimina una arista e del ´arbol T, se obtienen dos componentes conexas disjuntas T1 y T2.
(ii) X1 es el conjunto de etiquetas (hojas) asociadas a los nodos en T1, y X2 es el conjunto de etiquetas asociadas a los nodos en T2.
De esta manera, el conjunto Σ(T) contiene todos los splits no triviales inducidos por las aristas internas del ´arbol T, excluyendo los splits triviales, ya que estos se corresponden con aristas incidentes a hojas.
Definici´on 2.3 [Compatibilidad de Splits]: Decimos que un par de Splits X1|X2, X′ 1|X′
2 es compatible si al menos uno
de los siguientes conjuntos es vac´ıo:
X1 ∩X′
1
; X1 ∩X′
2
; X2 ∩X′
1
; X2 ∩X′
2 .
Teorema 2.1 [Teorema de Equivalencia de Splits]: Un conjunto Σ de splits de X es compatible si y solo si existe un ´arbol con Σ(T) = Σ. Adem´as, T est´a determinado por Σ. Definici´on
2.4
[Isomorfismo de ´Arboles]:
Sean T = (V,A) y K = (V ′,A′) ´arboles. Un isomorfismo de ´arboles, es un isomorfismo de grafos φ :V(T) −→V(T ′) tal que Vi, Vj son adyacentes en T si y solo si φ(Vi), φ(Vj) son adyacentes en K. Adem´as, decimos que los ´arboles T y K son isomorfos si tienen el mismo conjunto de etiquetas y existe un isomorfismo de ´arboles φ que preserva las etiquetas A(v) = A′(φ(v)).
Pask´ın Matem´atico Vol. 7 No 2 (2025) 01-08.
5
Definici´on 2.5 [Topolog´ıa]:
La topolog´ıa de un ´arbol filogen´etico es la clase m´odulo isomorfismo. En biolog´ıa, la topolog´ıa de un ´arbol filogen´etico representa la estructura subyacente de relaciones entre especies o grupos. Dado que diferentes m´etodos pueden etiquetar los v´ertices de los ´arboles o asociar distintas m´etricas, la topolog´ıa se refiere a la estructura del ´arbol abstracta, ignorando detalles de etiquetado y orden.
Ejemplo 2.2: Los ´arboles filogen´eticos 1,2,3 y 4 tienen 3 topolog´ıas distintas. En particular, la cantidad de topolog´ıas de un ´arbol filogen´etico de n hojas es (2n−5)!! Teorema 2.2 (Buneman, [Bun71]) Sea un conjunto X de cardinalidad n y S una familia de 2n −3 biparticiones de X. Decimos que las biparticiones de X son compatibles dos a dos, si y solamente si existe un ´arbol sin ra´ız T (con sus hojas etiquetadas sobre X) tal que Σ(T) = S.
3.
Invariantes Filogen´eticos Definici´on 3.1 Sea M un modelo de substituci´on con d par´ametros libres sobre una topolog´ıa de un ´arbol T. Podemos asociar la siguiente aplicaci´on polinomial ϕM T , (env´ıa los valores del proceso de Markov del ´arbol, a un polinomio). ϕM T : Rd −→R4n (π,{Me}e arista) 7 −→P = (pAA...A, pAA...C,..., pTT...T) El conjunto Im(ϕM T ) categoriza y recolecta las distribuciones proveniente de las secuencias generadas por ciertos par´ametros sobre la topolog´ıa de un ´arbol T [CF10]. Definici´on 3.2 [Variedad Algebraica]: Una variedad algebraica es un conjunto de soluciones de un sistema de ecuaciones polinomiales sobre un campo (cuerpo). Ejemplo 3.1 Una variedad algebraica sobre R2 es: V = {(x,y) ∈R2 | x2 +y2 = 1} x y En efecto, estos puntos satisfacen la ecuaci´on polin´omica x2 +y2 = 1.
Definici´on 3.3: Definimos V (T) a la menor variedad que contiene a Im(ϕM T ).
Se define como variedad filogen´etica a la variedad algebraica V (T) = Im(ϕM T ).
Teorema 3.1 [Chevalley] El conjunto Im(ϕM T ) NO es una variedad algebraica, sin embargo, es un conjunto denso dentro de la menor variedad algebraica que lo contiene. Proposici´on 3.1: Si W ⊆kn un subconjunto, el conjunto I (W) definido por:
I (W) := {p ∈k[x1,x2,...,xn] : p(a) = 0; ∀a ∈W} es un W[x]-Ideal.
Demostraci´on:
Sea f,g ∈I (W). Note que para todo a ∈W, f(a) + g(a) = 0. As´ı, f + g ∈I (W). Adem´as, si tomamos k(x) ∈W[x], k(x) · f(X) para todo a ∈W, k(a)· f(a) = k(a)·0 = 0. As´ı k · f ∈I (W). Este ideal es finitamente generado (en efecto, por el teorema de la base de Hilbert) y adem´as I (W) = I (W). Definici´on 3.4 [Ideal Filogen´etico]: Llamamos ideal filogen´etico al ideal I (Im(ϕM T )), por simplificaci´on, vamos a denotarlo por I ∗. Los elementos de este ideal reciben el nombre de invariantes filogen´eticos [DK09]. Definici´on 3.5 [Invariante del Modelo- Topolog´ıa]: Sea f un invariante filogen´etico. Decimos que f es un invariante del modelo, si f es un invariante filogen´etico para toda topolog´ıa de ´arbol T. Decimos que f es un invariante de topolog´ıa si existe T ′̸ = T, de tal modo que f ∈I (Im(ϕM T )) pero f /∈I (Im(ϕM T ′)).
4.
Invariantes del Modelo K81 Para esta secci´on, debemos considerar a T como un ´arbol de 4 hojas para abordar los invariantes del modelo K81. Definici´on 4.1 [Flattening]: Sea p ∈R44 y A|B un split de las hojas del ´arbol T. Considere los valores aleatorios XA = {Xx}x∈A y XB = {Xy}y∈B. Definimos el flattening del vector p con respecto al split A|B como la matriz 4|A| × 4|B| cuyas entradas son las distribuciones conjuntas de XA, XB, lo representamos como:
flat12|34(p) = pAAAA pAAAC
...
pAATT pACAA pACAC
...
pACTT
...
...
...
...
pTTAA pTTAC
...
pTTTT De igual forma se puede definir flat13|24 y flat14|23. El flattening es resultado directo de considerar un isomorfismo de entre R4 ⊗R4 ⊗R4 ⊗R4 ⋍M16(R)
Procesos Evolutivos e Invariantes Filogen´eticos Definici´on 4.2 [Matriz de Hadamard]: Sea S una K81matriz. Se puede realizar un cambio de base en la matriz M, de tal modo que obtenemos la matriz H =
1
1
1
1
1
1
−1 −1
1
−1
1
−1
1
−1 −1
1
Es claro que esta matriz es sim´etrica. Adem´as, satisface H−1 = 1 4H. Por otra parte, decimos que una matriz M es una transformada de Hadamard para la matriz M si M = H−1 ·M ·H.
Denotemos a B′ como la base de autovectores de la matriz de Hadamard:
B′ =
1
1
1
1
1
1
−1 −1 ,
1
−1
1
−1 ,
1
−1 −1
1
Definici´on
4.3
[Coordenadas de Fourier]:
Dado un vector p ∈R4, denotamos pB = (pA, pC, pG, pT) y a P′ B = (p′ A, p′ C, p′ G, p′ T) a los vectores con coordenadas en las bases B y B′ respectivamente. Llamamos coordenadas de Fourier a las nuevas coordenadas obtenidas. Teorema 4.2 [Hendy-Penny]: En coordenadas de Fourier los modelos basados en grupos est´an parametrizados por monomios en t´erminos de par´ametros de Fourier. Definici´on 4.4 [Flattening tensorial]: Definimos el flattening tensorial del vector p con respecto al split i j|kl al flattening de p expresado en coordenadas de Fourier. Es decir, flatij|kl(p) = flati j|kl((H−1 ⊗H−1 ⊗H−1 ⊗H−1)p) Teorema 4.1: [CF10] Si p ∈R44 proviene de un proceso de Markov de la topolog´ıa T12|34 en que la distribuci´on de la ra´ız y las matrices de transici´on son suficiente gen´ericas, entonces:
rank(flat12|34(p)) = 4 rank(flat13|24(p)) = rank(flat14|23(p)) = 16 Teorema 4.2: Sea p ∈im(ϕS T), es decir p = ϕ(S1,...,S5), donde Sk son K81-matrices asociadas a la arista ek del ´arbol T = Tij|kl, representado en la siguiente figura. Si los autovalores de MK est´an dados por (mk A,mk C,mk G,mk T), entonces:
px1x2x3x4 =
1
256·m1 x1m2 x2m5 x1+x2m3 x3m4 x4, x1 +x2 = x3 +x4
0,
x1 +x2̸ = x3 +x4 Donde xi + xj es la operaci´on (suma) de nucle´otidos como grupo, tal como se expresa en la definici´on 1.5. e1 e2 e3 e4 e5 M1 M2 M3 M4 M5 ∖ ∼ Figura 4.1 Proceso de Markov sobre T12|34 Seg´un, lo mencionado en [CF10] este teorema fue utilizado por Sturmfels y Sullivant para brindar una colecci´on de invariantes para el modelo K81.
Se invita al lector a visualizar la colecci´on de invariantes calculados en [SS05].
Conclusiones Los ´arboles filogen´eticos son una herramienta fundamental en la biolog´ıa, que permite entender las relaciones evolutivas entre especies y secuencias gen´eticas. A trav´es de estos ´arboles, es posible modelar los procesos de evoluci´on y particionar las distribuciones de datos en una estructura algebraica, que en este caso, se traduce en ´algebra conmutativa. Los ´arboles, especialmente los ´arboles filogen´eticos, proporcionan una estructura natural para definir transiciones entre estados o nodos. Estos nodos pueden ser considerados como los diferentes estados de una cadena de Markov. Al considerar un ´arbol filogen´etico, cada nodo puede representar un estado espec´ıfico en la cadena de Markov, y las transiciones entre nodos est´an determinadas por las conexiones (aristas) en el ´arbol Fig.5. En este caso, las probabilidades de transici´on entre nodos dependen de la estructura del ´arbol y de los pesos asociados a las aristas.
El estudio de los invariantes filogen´eticos nos permite entender la estructura algebraica subyacente en las distribuciones de secuencias generadas por modelos de sustituci´on sobre ´arboles filogen´eticos. A trav´es de la funci´on polinomial ϕM T , asociada al modelo y a la topolog´ıa del ´arbol, se genera un conjunto denso en una variedad algebraica denotada por V (T), conocida como la variedad filogen´etica, la cual es igual a im(ϕM T ).
Por otra parte, es posible demostrar como corolario del teorema 4.2 que V (T) es una variedad t´orica (ver anexo), es decir que posee un toro algebraico encajado como un abierto de Zariski denso. Esto es ´util ya que al ser un abierto denso, el toro algebraico captura casi todas las propiedades de la variedad, ya que incluye todos los puntos generales, excepto
Pask´ın Matem´atico Vol. 7 No 2 (2025) 01-08.
7
Reino Fungi Ascomycota Saccharomyces cerevisiae(Levadura) Penicillium(Moho) Basidiomycota Agaricus bisporus(Champi˜n´on) Lentinula edodes(Shiitake) Figura 5: Ejemplo de un ´Arbol Filogen´etico de Especies de Hongos posiblemente los aislados.
Una de las propiedades clave es que I , el ideal asociado a la variedad filogen´etica, organiza de manera sistem´atica las relaciones polinomiales entre las distribuciones de las secuencias. Los elementos de este ideal, denominados invariantes filogen´eticos, pueden clasificarse seg´un su dependencia exclusiva del modelo o de la topolog´ıa. Esto ofrece un marco poderoso para analizar y comparar modelos evolutivos. Las herramientas abarcadas en este art´ıculo no solo permiten comprender la estructura algebraica, sino que tambi´en nos da una intuici´on bastante elemental para desarrollar algunos m´etodos para la reconstrucci´on filogen´etica, consolidando la relevancia de los invariantes filogen´eticos. Se invita al lector a explorar de manera m´as profunda en [CF10]. Anexo Esta secci´on est´a destinada a clarificar y ejemplificar el concepto de variedad t´orica, ya que algunos t´erminos pueden resultar dif´ıciles de entender, especialmente para aquellos que no est´an familiarizados con las aplicaciones matem´aticas en geometr´ıa algebraica.
Por lo tanto, se busca desglosar estos conceptos en explicaciones m´as accesibles, proporcionando un marco comprensible para su an´alisis y utilizaci´on.
Variedades T´oricas *Los resultados que se expondr´an a continuaci´on, son v´alidos para cualquier campo K, sin embargo haremos el estudio bajo los n´umeros complejos C. Esta secci´on estar´a basado en la referencia [Gui16].
Adem´as, denotaremos C[X] al anillo C[x1,...,xn]. Definici´on 5.1.1 [Espacio Af´ın sobre C] Definimos el espacio af´ın sobre C de dimensi´on n al conjunto: An = {(x1,...xn) : xi ∈C} Definici´on 5.1.2 [Conjunto Algebraico en An] Un conjunto algebraico en An es de la forma:
V(P) = {a ∈An : p(a) = 0 ,∀p ∈P} ⊆An Definici´on 5.1.3 [Topolog´ıa de Zariski en An] La Topolog´ıa de Zariski en An es una topolog´ıa cuyos conjuntos cerrados son los conjuntos algebraicos.
Decimos que un conjunto U es un abierto de Zariski si existe P tal que U = An −V(P).
An V(P) V(S) Cerrado de Zariski V(T) U = An −V(S) (Abierto de Zariski) Figura 6.Bosquejo topolog´ıa de Zariski en An Definici´on 5.1.4 [Grupo Algebraico] Un grupo algebraico es un grupo que es una variedad algebraica y que las siguientes operaciones de grupo son morfimos de variedades algebraicas.
G×G →G G →G (g1,g2) 7→g1g2 g 7→g−1 Definici´on 5.1.5 [Toro Algebraico] Considere el grupo algebraico (K∗)n. Decimos que T es un toro algebraico de dimensi´on n si T ≃(K∗)n como grupos algebraicos. Esta propiedad es ´util, ya que bajo la topolog´ıa de Zariski las estructuras algebraicas mantienen sus propiedades algebraicas y son dotadas de una estructura continua. Definici´on 5.1.6 [Anillo Integralmente cerrado] Decimos que un anillo es integralmente cerrado si todos sus ideales maximales son ideales primos.
Ejemplo 5.1.1 Todo dominio de ideales principales es integralmente cerrado.
Definici´on 5.1.7 [Variedades normales] Decimos que una variedad V af´ın es normal si su anillo de coordenadas k[V] es integralmente cerrado.
Procesos Evolutivos e Invariantes Filogen´eticos Adem´as, decimos que una variedad algebraica X es normal si para todo x ∈X, existe un vecindario af´ın normal. As´ı, finalmente, podemos definir lo que es una variedad t´orica.
Definici´on 5.1.8 [Variedad T´orica] Una variedad t´orica es una variedad algebraica normal que contiene un toro algebraico T n, abierto y denso (bajo la topolog´ıa de Zariski), que satisface que la acci´on de grupos de T n en s´ı mismo se extiende a una acci´on algebraica T n ×X →X Veamos algunos ejemplos de variedades t´oricas: Ejemplo 5.1.2 Considere Nn ⊂Zn y defina C[Nn] = C[χe1,...,χen] donde {ei : i ∈[n]} es la base can´onica de Zn. Esta es una variedad t´orica de dimensi´on n pues T n = spec(Nn) = Cn.
Ejemplo 5.1.3 Considere ⟨2,3⟩= {0,2,3,...}, el conjunto C[⟨2,3⟩] = C[t2,t3] = C[x,y]/(x3 −y2) es una variedad t´orica de dimensi´on
1,
donde T n = spec(C[⟨2,3⟩]) = V(x3 −y2).
Ejemplo 5.1.4 El conjunto X = C2 es una variedad t´orica, pues T 2 ≃{(x1,x2) ∈C2 : x1̸ = 0 ;x2̸ = 0} ⊂C2 es un abierto de Zariski. Adem´as, T 2 ⟲X est´a dada por: T 2 ×X →X (t1,t2),(x1,x2) 7→(t1x1,t2x2) Estos ejemplos pueden ser explorados con m´as detalle en las diapositivas 63 y 64 de [Mic24]. Finalmente, en la referencia [CF10] se menciona que el teorema 4.2 permite demostrar que V (T) = im(ϕM T ) es una variedad t´orica.
Referencias [Bun71] Peter Buneman. “The recovery of trees from measures of dissimilarity”. En: Mathematics in the Archaeological and Historical Sciences (1971), p´ags. 387-395.
[Kim81] Motoo Kimura. “Estimation of evolutionary distances between homologous nucleotide sequences.” En: Proceedings of the National Academy of Sciences 78.1 (1981), p´ags. 454-458. [HP89] Michael D Hendy y David Penny. “A framework for the quantitative study of evolutionary trees”. En: Systematic zoology 38.4 (1989), p´ags. 297-309.
[Ful93] William Fulton. “Introduction to Toric Varieties”. En: (1993).
[SS05] Bernd Sturmfels y Seth Sullivant. “Toric ideals of phylogenetic invariants”. En: Journal of Computational Biology 12.4 (2005), p´ags. 457-481. [DK09] Jan Draisma y Jochen Kuttler. “On the ideals of equivariant tree models”. En: Mathematische Annalen 344.3 (2009), p´ags. 619-644.
[CF10] Marta Casanellas Rius y Jes´us Fern´andez S´anchez. “Reconstrucci´on filogen´etica usando geometr´ıa algebraica”. En: Arbor: ciencia pensamiento y cultura 186.746 (2010), p´ags. 1023-1033. [Ant13] Diego Ruiz Antol´ın. “Geometr´ıa T´orica”. En: (2013), p´ags. 37-46.
[Cas14] Marta Casanellas. “El modelo evolutivo de Kimura: un enlace entre el ´algebra, la estad´ıstica y la biolog´ıa”. En: La Gaceta de la RSME (2014), p´ags. 1-17.
[Gui16] Martha Bernal Guill´e. “Ida y vuelta de Algebras a Variedades: el ejemplo de variedades t´oricas”. En:
(2016).
[Mic24] Paola Comparin Michela Artebani. “Introducci´on a las variedades t´oricas”. En: Universidad de La Frontera, Lican Ray , Chile (2024).
Agradecimientos Agradezco a la Escuela EMALCA de Geometr´ıa Algebraica Aplicada en Colombia y a la Fundaci´on Universitaria Konrad Lorenz, por permitirme ser parte de esta oportunidad. Tambi´en, agradezco a Marina Garrote L´opez por la charla brindada en la semana 1 de la EMALCA, la cual inspira a la realizaci´on de este art´ıculo.
Agradezco a Dylan Andrey M´endez Rodr´ıguez por ayudarme con la estructura de citaci´on de este art´ıculo. Acerca del Autor: Jos´e Fabi´an Hern´andez Sol´ıs es estudiante de cuarto a˜no de la carrera de Matem´atica en la Universidad de Costa Rica. Sus principales hobbies son el f´utbol, la lectura, las pel´ıculas y jugar videojuegos. Es apasionado de la pol´ıtica nacional e internacional, as´ı como a la locuci´on y a la presentaci´on.
Cita: Hernández Solís, José Fabián (2025), Procesos evolutivos e invariantes filogenéticos, Fundación Universitaria Konrad Lorenz, p. N. https://repositorio.konradlorenz.edu.co/handle/001/6716