Pesquisa · Mapa mental

Filogenética computacional

Filogenética computacional é a aplicação de algoritmos computacionais, métodos e programas para a análise filogenética. O objetivo é montar uma árvore filogenética representando uma hipótese sobre a ancestralidade evolutiva de um conjunto de genes, espécies ou outras taxa. Por exemplo, estas técnicas têm sido usadas para explorar a árvore genealógica da família das espécies de hominídeos e as relações entre genes específicos compartilhados por muitos tipos de organismos. A filogenética tradicional baseia-se nos dados morfológicos obtidos pela medição e quantificação das propriedades fenotípicas de organismos representativos, enquanto o campo mais recente da filogenia molecular usa seqüências de nucleotídeos codificando genes ou seqüências de aminoácidos codificando proteínas como base para a classificação. Muitas formas de filogenia molecular estão intimamente relacionadas e fazem uso extensivo do alinhamento de seqüências na construção e refino de árvores filogenéticas, que são utilizadas para classificar as relações evolutivas entre genes homólogos representados nos genomas de espécies divergentes. As árvores filogenéticas construídas por métodos computacionais não são susceptíveis de reproduzir perfeitamente as árvores evolutivas que representam as relações históricas entre as espécies que estão sendo analisadas. A árvore histórica das espécies também podem ser diferentes da árvore histórica de um gene homólogo individual compartilhado por essas espécies.

Fonte: Wikipédia (pt)Atualizado em 25/07/2026
01

Tipos de árvores filogenéticas

Imagem: Mmarpe · BY-SA · Openverse

Árvore filogenéticas geradas pela filogenia computacional podem ser enraizadas ou não enraizadas dependendo dos dados de entrada e do algoritmo utilizado. Uma árvore enraizada é um grafo orientado que identifica explicitamente a ancestral comum mais recente (MRCA), geralmente uma seqüência imputado que não esteja representada na entrada. Medidas de distância genética podem ser usadas para traçar uma árvore com as seqüências de entrada como sendo os nós folha e as suas distâncias da raiz proporcional à sua distância genética a partir do MRCA hipotetisado. A identificação de uma raiz geralmente requer a inclusão nos dados de entrada de pelo menos um "grupo-externo" sabendo-se apenas remotamente relacionado com as seqüências de interesse. Por outro lado, as árvores não enraizadas plotam as distâncias e as relações entre as seqüências de entrada, sem fazer suposições sobre a sua descida. Uma árvore não enraizada sempre pode ser produzida a partir de uma árvore enraizada, mas uma raiz normalmente não podem ser colocada em uma árvore não enraizadas sem dados adicionais sobre as taxas de divergência, como pressuposto na hipótese do relógio molecular.

02

Codificação de caracteres e definindo homologia

Imagem: Silva Selva · BY-SA · Openverse

Análise morfológica

O problema básico em filogenia morfológica é a montagem de uma matriz que represente um mapeamento de cada uma das taxa sendo comparadas a medições representativas para cada uma das características fenotípicas sendo usadas como um classificador. Os tipos de dados fenotípicos usados ​​para construir esta matriz dependem da taxa sendo comparada; para espécies individuais, elas podem envolver medidas de médio tamanho corporal, comprimentos ou tamanhos de ossos em particular ou outras características físicas, ou mesmo manifestações comportamentais. Naturalmente, uma vez que nem todas as características fenotípicas possíveis poderiam ser medidas e codificadas para análise, a seleção de quais recursos medir é um dos principais obstáculos inerentes ao método.

Análise molecular

O problema de codificação de caracteres é muito diferente em análise molecular, uma vez que os caracteres na seqüência de dados biológicos são definidos discretamente e de forma imediata - distintos nucleotídeos em seqüências de ADN ou ARN e distintos aminoácidos em seqüências de proteínas. No entanto, definir homologias pode ser um desafio devido às dificuldades inerentes do alinhamento múltiplo de sequências. Para um determinado alinhamento múltiplo de sequências (AMSs) com lacunas, várias árvores filogenéticas enraizadas podem ser construídas que variam em suas interpretações de quais mudanças são "mutações" versus caracteres ancestrais e quaiss eventos são mutações de inserção ou mutações de deleção. Por exemplo, dado apenas um alinhamento de pares com uma região de lacuna, é impossível determinar se uma seqüência tem uma mutação de inserção ou é a outra que tem uma deleção. O problema é ampliado em AMSs com lacunas desalinhadas e que não se sobrepõem. Na prática, regiões consideráveis de um alinhamento calculado podem ser descontadas na construção da árvore filogenética para evitar a integração de dados com ruído no cálculo da árvore.

03

Métodos de matrizes de distâncias

Métodos de matrizes de distâncias para análise filogenética dependem explicitamente de uma medida de "distância genética" entre as seqüências sendo classificadas, e, portanto, eles exigem um AMS como entrada. Distância é muitas vezes definida como a fração de não correspondências em posições alinhadas, com lacunas ou ignoradas ou contadas como não correspondências. Métodos de distância tentam construir uma matriz de todos-para-todos da consulta (query) de seqüências descrevendo a distância entre cada um dos pares da seqüência. A partir desta é construída uma árvore filogenética que coloca seqüências estreitamente relacionadas sob o mesmo nó interior e cujo comprimento de ramo reproduz de perto as distâncias observadas entre as seqüências. Métodos de matrizes de distâncias podem produzir árvores enraizadas ou não enraizadas, dependendo do algoritmo usado para calculá-las. Eles são freqüentemente usados ​​como base para progressivos e iterativos tipos de alinhamento múltiplo de sequências. A principal desvantagem dos métodos de matrizes de distâncias é sua incapacidade de usar eficientemente informações sobre regiões de alta variação local que aparecem através de múltiplas sub-árvores.

Agrupamento de vizinhos

Os métodos de Agrupamento de vizinhos (Neighbor-joining methods) aplicam técnicas gerais de clustering de dados para análise de sequências utilizando a distância genética como uma métrica de clustering. O método de Agrupamento de vizinhos produz árvores não enraizadas, mas não assume uma taxa constante de evolução (ou seja, um relógio molecular) em linhagens. Seu parente, o UPGMA (Unweighted Pair Group Method with Arithmetic mean) produz árvores enraizadas e requer um que seja pressuposta uma taxa constante - ou seja, ele assume uma árvore ultramétrica em que as distâncias a partir da raiz para cada ponta de ramo são iguais.

Método Fitch-Margoliash

O método Fitch-Margoliash usa um método dos mínimos quadrados ponderado para o agrupamento (clustering ) com base na distância genética. À seqüências estreitamente relacionadas é dado maior peso no processo de construção da árvore para corrigir a imprecisão crescente em medição de distâncias entre seqüências distantemente relacionadas. As distâncias utilizadas como entrada para o algoritmo devem estar normalizadas para evitar amplos artefatos nos relacionamentos computacionais entre os grupos afins e parentes distantes. As distâncias calculadas por este método devem ser lineares; o critério de linearidade para distâncias requer que os valores esperados dos comprimentos dos ramos para dois ramos individuais deve ser igual ao valor esperado da soma das duas distâncias dos ramos - uma propriedade que se aplica a seqüências biológicas apenas quando tiverem sido corrigidas para a possibilidade de mutações regressivas em locais específicos. Esta correcção é feita através da utilização de uma matriz de substituição, tais como as derivadas a partir do modelo de Jukes-Cantor da evolução do DNA. A correção da distância só é necessária na prática, quando as taxas de evolução diferem entre os ramos. Outra modificação do algoritmo pode ser útil, especialmente em caso de distâncias concentradas: essa modificação, descrita em tem sido demonstrada melhorar a eficiência do algoritmo e a sua robustez.

Usando grupos externos

A informação independente sobre a relação entre seqüências ou grupos pode ser usada para ajudar a reduzir o espaço de busca em árvore e enraizar as árvores não enraizadas. A utilização padrão de métodos de matriz de distâncias envolve a inclusão de pelo menos uma sequência de um grupo externo conhecida por ser apenas remotamente relacionada com as sequências de interesse no conjunto de consulta. Esta utilização pode ser vista como um tipo de controle experimental. Se um grupo externo foi adequadamente escolhido, ele terá uma distância genética muito maior e assim um comprimento dos ramos mais longo do que qualquer outra sequência, e ela vai aparecer perto da raiz de uma árvore enraizada. Escolher um grupo externo apropriado requer a seleção de uma seqüência que é moderadamente relacionada com as seqüências de interesse; um relacionamento muito próximo frustra a finalidade do grupo externo e um relacionamento muito distante adiciona ruído à análise. Cuidados também devem ser tomados para evitar situações nas quais as espécies das quais as seqüências foram tiradas são distantemente relacionadas, mas o gene codificado pelas seqüências é altamente conservado através das linhagens. A transferência horizontal de genes, especialmente entre bactérias divergentes, também pode confundir o uso de grupos externos.

Vídeos recomendados

Fontes consultadas

Continue pesquisando