La longitud de rama es el número esperado de sustituciones por sitio y punto temporal. Cada linaje evoluciona de forma independiente desde el ancestro.
Pega una secuencia proteica, fija una longitud de rama y un número de puntos temporales, y este simulador de mutaciones hace evolucionar varios linajes independientes desde ese ancestro bajo un modelo de sustitución real. Cada sustitución nueva se marca en rojo en la línea temporal, el bloque de resultados las resume, y el enlace que compartes reproduce la ejecución con exactitud.
El simulador usa el modelo de Markov de tiempo continuo que hay detrás de la filogenética moderna. A partir de las tasas de intercambio y las frecuencias de equilibrio de aminoácidos del modelo elegido construye la matriz de tasas Q, la escala para que una unidad de longitud de rama equivalga a una sustitución esperada por sitio, y calcula la matriz de transición P = exp(Qt) para la longitud de rama t que fijaste. En cada punto temporal, cada sitio de cada linaje sortea su siguiente residuo según la fila de P que corresponde a su residuo actual. El tiempo se acumula una longitud de rama por punto, así que cinco puntos con 0,1 abarcan una distancia total de 0,5 sustituciones por sitio desde el ancestro.
El ancestro está arriba. Debajo, cada punto temporal muestra una fila por linaje con las sustituciones ocurridas en ese paso en rojo negrita, las diferencias anteriores respecto al ancestro en rojo atenuado, y las etiquetas de mutación tras la fila, de modo que I3V significa que la isoleucina de la posición 3 pasó a valina. El bloque de resultados cuenta las sustituciones totales y por linaje, imprime el número esperado por secuencia, que es la longitud de rama total multiplicada por la longitud de la secuencia, el número de secuencias finales únicas, la distancia media por pares entre linajes como diferencias por sitio, y la identidad de las secuencias finales con el ancestro. Copiar informe pone los números y las secuencias finales en el portapapeles.
La secuencia de ejemplo es la cadena A de la insulina, de 21 residuos. Con los valores predeterminados, longitud de rama 0,1, cinco puntos temporales y cinco linajes, la distancia total es 0,5 por sitio, así que el recuento esperado es de 10,5 sustituciones por linaje. Las ejecuciones se sitúan alrededor de ese valor, y la identidad con el ancestro acaba cerca del 60 al 70 por ciento en lugar del 50, porque un sitio que cambia dos veces sigue contando como una diferencia y algunos sitios revierten. Con longitud de rama 1 los linajes divergen tanto que casi todas las posiciones difieren del ancestro, el régimen en el que la señal filogenética se satura.
Las secuencias se recortan a 2000 residuos, las líneas de cabecera FASTA se eliminan y solo evolucionan los veinte aminoácidos estándar. No hay inserciones, deleciones, variación de tasa entre sitios ni selección más allá de la opción de sitios conservados: la salida ilustra la sustitución neutral, no predice cómo evoluciona una proteína concreta.
JTT (Jones, Taylor y Thornton, 1992) y WAG (Whelan y Goldman, 2001), dos modelos empíricos de aminoácidos estimados a partir de grandes conjuntos de alineamientos de proteínas reales, más un modelo uniforme en el que cada aminoácido tiene la misma probabilidad de cambiar a cualquier otro. Los modelos empíricos hacen mucho más probables los cambios conservadores, como isoleucina a valina, que, por ejemplo, triptófano a glicina.
La longitud de rama es la distancia evolutiva medida en sustituciones esperadas por sitio, la unidad que se usa en los árboles filogenéticos. Con 0,1 se espera que cada sitio cambie aproximadamente una vez de cada diez por punto temporal, así que una proteína de 100 residuos acumula unas 10 sustituciones por punto, menos cuando un sitio cambia y vuelve a cambiar.
Cada sitio sortea su nuevo residuo al azar según las probabilidades del modelo, así que dos ejecuciones nunca coinciden. Ejecutar de nuevo genera una simulación fresca; el enlace para compartir lleva la semilla, y al abrirlo se reproduce exactamente la misma línea temporal.
La parte de posiciones, promediada sobre todos los linajes, en las que la secuencia final conserva el residuo ancestral. Varios cambios en un mismo sitio cuentan como una sola diferencia, y por eso la identidad baja más despacio de lo que sube el recuento de sustituciones.
Solo de una manera sencilla: la opción Conservar C, H, D, E congela cisteína, histidina, aspartato y glutamato, los residuos que más a menudo se encuentran en sitios activos y puentes disulfuro. Todo lo demás evoluciona de forma neutral; no hay inserciones ni deleciones, y los sitios evolucionan con independencia unos de otros.