Como estudar filogenia vegetal de forma que não perca semanas com dados ruins
A gente começa errado na maior parte das vezes. Acha que basta pegar um artigo recente, copiar os primers e rodar PCR. Na prática, você passa duas semanas esperando resultado e descobre que o primer não amplifica a espécie que você quer porque o locus não é conservado o suficiente para aquele grupo. Já vi isso acontecer com Gentianales inteiro. O caminho real, o que funciona de verdade, começa com um plano de seleção de marcadores antes de qualquer coisa no laboratório. Você precisa decidir quais regiões do genoma vai usar e isso depende do nível taxonômico que quer resolver. Para relações em nível de família, genes como matK, rbcL e psbA-trnH costumam dar conta. Para questões mais finas, dentro de um gênero, aí você sobe para UCOPIA, ITS, ou até datl-D. O erro mais comum é tentar resolver um problema específico com marcadores de propósito geral.
durante a evolução das plantas os genomas mudam de ritmo
Esse é um ponto que todo mundo subestima quando entra nessa área. O ritmo evolutivo não é uniforme entre linhagens. Um gene que funciona perfeitamente para angiospermas basais pode ser inútil para monocotiledôneas porque a taxa de substituição de nucleotídeos acelera ou desacelera de forma imprevisível. Eu descobri isso na prática quando estava construindo uma filogenia de Orchidaceae. Os dados de rbcL davam uma árvore com bons valores de bootstrap, mas quando adicionei ITS, a topologia mudava completamente. O problema era que o ITS estava saturado para os nós mais antigos do clado. A solução foi trocar por um conjunto de genes plastidiais mais conservados e usar modelos de mistura que levam em conta heterogeneidade composicional. Outro detalhe que não ensinam nos tutoriais básicos é a questão da polipliploidia. Durante milhões de anos, muitas linhagens vegetais passaram por eventos de duplicação do genoma inteiro. Isso significa que quando você faz PCR com primers universais, pode acabar amplificando cópias homeólogas em vez de alelos. O resultado é uma sequência quiral ou um perfil de sequenciamento duplo que parece erro técnico mas não é. A maneira mais eficiente de identificar isso é rodar cloning do produto de PCR antes de sequenciar, ou usar métodos de separação de haplotipos como SHREDDER ou Phasor. Leva mais tempo no início, mas evita meses de confusão depois.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O fluxo de trabalho que eu recomendo segue uma sequência bem definida. Primeiro você faz revisão filogenética do grupo alvo. Não pule essa etapa. Saber o que já foi publicado evita que você repita erros alheios e desperdice reagentes. Segundo, selecione os marcadores com base na resolução necessária e no grupo taxonômico. Terceiro, colete material com protocolo adequado de preservação. Folhas secas em silica gel funcionam, mas o ideal é material herborizado bem armazenado ou tecido congelado. Quarto, extraia DNA com kit que remova polissacarídeos e fenólicos, porque esses compostos inibem PCR e afetam a qualidade da sequência. Quinto, amplifique, clone se necessário, e séquencie. Sexto, alinhe com MAFFT ou MUSCLE, revise manualmente no BioEdit ou AliView. Sétimo, construa árvore com maximum likelihood no IQ-TREE ou RAxM, e confirme com Bayesian inference se o tempo permitir. Oitavo, interprete com prudência. Existe um custo real para cada passo e é bom saber desde o início. Um projeto de filogenia vegetal em nível de gênero, com dez a vinte espécies e quatro marcadores, gasta em média entre duzentos e quinhentos reais em reagentes, mais o tempo de sequenciamento. Se você tiver que refazer por causa de primer inadequado ou contaminação, esse valor dobra. Por isso a etapa de planejar os marcadores com antecedência economiza dinheiro e tempo.
Tem um limite prático que você precisa aceitar. Filogenia molecular sozinha não resolve tudo. Eventos de transferência horizontal de genes, hybridização ancient, incomplete lineage sorting, e seleção natural atuando em certas regiões do genoma podem gerar sinais conflitantes entre diferentes loci. Uma árvore baseada em DNA plastidial pode mostrar uma história diferente da árvore baseada em núcleos. Isso não é erro metodológico, é biologia. A solução é usar abordagens multilocus e, quando possível, genômica completa com dados de transcriptoma ou RADseq. Mas isso sobe o custo para várias milhares de reais e exige infraestrutura de bioinformática que nem todo laboratório tem. Se o seu grupo é grande e você precisa de resolução rápida com orçamento apertado, considere começar com balistica de sequências tipo barcoding com poucos marcadores padrão e aceitar que a topologia vai ter nós mal resolvidos. Se o orçamento permite, vá direto para capture de híbridos com sondas como Angiosperms353. O kit custa cerca de oitocentos dólares e gera dados para duzentas e cinquenta e três loci nuclear em uma única corrida de Illumina. É mais caro no início, mas resolve muitos problemas de uma vez.
O que mais causa frustração é a publicação de árvores sem suporte estatístico robusto. Bootstrap inferior a setenta por cento em nós principais, modelos de substituição mal escolhidos, alinhamentos não revisados. Se você está fazendo isso pela primeira vez, peça para alguém revisar o alinhamento antes de subir para construção de árvore. Um olho externo pega coisas que o seu cérebro já normalizou e não vê mais. Isso economiza semanas de retrabalho.