La longueur de branche est le nombre attendu de substitutions par site et par pas de temps. Chaque lignée évolue indépendamment à partir de l'ancêtre.
Collez une séquence protéique, fixez une longueur de branche et un nombre de points de temps, et ce simulateur de mutations fait évoluer plusieurs lignées indépendantes à partir de cet ancêtre selon un vrai modèle de substitution. Chaque nouvelle substitution est marquée en rouge sur la chronologie, le bloc de résultats les totalise, et le lien que vous partagez reproduit exactement l’exécution.
Le simulateur utilise le modèle de Markov en temps continu qui sous-tend la phylogénétique moderne. À partir des taux d’échange et des fréquences d’équilibre des acides aminés du modèle choisi, il construit la matrice de taux Q, la met à l’échelle pour qu’une unité de longueur de branche corresponde à une substitution attendue par site, et calcule la matrice de transition P = exp(Qt) pour la longueur de branche t que vous fixez. À chaque point de temps, chaque site de chaque lignée tire son résidu suivant dans la ligne de P correspondant à son résidu actuel. Le temps s’accumule d’une longueur de branche par point, donc cinq points à 0,1 couvrent une distance totale de 0,5 substitution par site depuis l’ancêtre.
L’ancêtre est en haut. En dessous, chaque point de temps liste une ligne par lignée, avec les substitutions survenues à cette étape en rouge gras, les différences antérieures avec l’ancêtre en rouge atténué, et les étiquettes de mutation après la ligne ; I3V signifie donc que l’isoleucine en position 3 est devenue valine. Le bloc de résultats compte les substitutions au total et par lignée, affiche le nombre attendu par séquence, qui est la longueur de branche totale multipliée par la longueur de la séquence, le nombre de séquences finales uniques, la distance moyenne entre lignées prises deux à deux en différences par site, et l’identité des séquences finales avec l’ancêtre. Copier le rapport place les nombres et les séquences finales dans le presse-papiers.
La séquence d’exemple est la chaîne A de l’insuline, longue de 21 résidus. Avec les valeurs par défaut, longueur de branche 0,1, cinq points de temps et cinq lignées, la distance totale est de 0,5 par site, donc le nombre attendu est de 10,5 substitutions par lignée. Les exécutions tombent autour de cette valeur, et l’identité avec l’ancêtre finit près de 60 à 70 pour cent plutôt que 50, parce qu’un site qui change deux fois ne compte que pour une différence et que certains sites reviennent en arrière. À une longueur de branche de 1, les lignées divergent tellement que presque chaque position diffère de l’ancêtre, le régime où le signal phylogénétique sature.
Les séquences sont tronquées à 2 000 résidus, les lignes d’en-tête FASTA sont supprimées, et seuls les vingt acides aminés standard évoluent. Il n’y a ni insertions, ni délétions, ni variation de taux entre sites, ni sélection au-delà de l’option de sites conservés : le résultat illustre la substitution neutre, il ne prédit pas comment une protéine donnée évolue.
JTT (Jones, Taylor et Thornton, 1992) et WAG (Whelan et Goldman, 2001), deux modèles empiriques d'acides aminés estimés à partir de grands ensembles d'alignements de protéines réelles, plus un modèle uniforme dans lequel chaque acide aminé a la même probabilité de changer en n'importe quel autre. Les modèles empiriques rendent les changements conservatifs, comme isoleucine vers valine, bien plus probables que, disons, tryptophane vers glycine.
La longueur de branche est une distance évolutive mesurée en substitutions attendues par site, l'unité utilisée sur les arbres phylogénétiques. À 0,1, chaque site a environ une chance sur dix de changer par point de temps, donc une protéine de 100 résidus accumule environ 10 substitutions par point, moins quand un site change puis revient en arrière.
Chaque site tire son nouveau résidu au hasard selon les probabilités du modèle, donc deux exécutions ne se ressemblent jamais. Relancer tire une simulation nouvelle ; le lien de partage contient la graine, et l'ouvrir reproduit exactement la même chronologie.
La part des positions, moyennée sur toutes les lignées, où la séquence finale a encore le résidu ancestral. Plusieurs changements sur un même site comptent pour une seule différence, ce qui explique que l'identité baisse plus lentement que le nombre de substitutions ne monte.
D'une seule façon simple : l'option Conserver C, H, D, E fige la cystéine, l'histidine, l'aspartate et le glutamate, les résidus le plus souvent présents dans les sites actifs et les ponts disulfure. Tout le reste évolue de façon neutre ; il n'y a ni insertions ni délétions, et les sites évoluent indépendamment les uns des autres.