Proteinas Estruturas - Estrutura das proteínas - Aminoácidos, classificação e curiosidades
Estrutura das proteínas - Aminoácidos, classificação e curiosidades

Entendendo o que são proteínas e como suas estruturas funcionam na prática

Proteínas são cadeias de aminoácidos que se dobram em formas tridimensionais específicas, e essa forma é o que determina o que elas fazem dentro da célula. A gente chama isso de proteínas estruturas quando falamos especificamente das proteínas cujo papel principal é dar suporte mecânico, como o colágeno, a queratina e a elastina. Mas na verdade todo proteína tem uma estrutura que define sua função, não só as estruturais. A doçagem entre forma e função não é intuitiva no começo. Você pode ter uma sequência de aminoácidos que parece qualquer coisa numa análise rápida, mas que na prática dobra de um jeito completamente previsível se você souber onde olhar. O problema é que dobrar uma proteína de verdade leva microssegundos no corpo, e simular isso computacionalmente ainda é um dos maiores pesadelos da bioinformática.

Proteínas estruturas: o que realmente importa saber

Vou direto ao que funciona. Quando você vai analisar proteínas estruturas, o primeiro passo é entender os quatro níveis de organização: primária (a sequência de aminoácidos), secundária (hélices alfa e folhas beta), terciária (o dobramento tridimensional completo) e quaternária (como múltiplas subunidades se conectam). A maioria dos erros que eu vejo acontece quando as pessoas tentam pular direto para o terciário sem prestar atenção nos resíduos que stabilizam a secundária. Por exemplo, prolinas quebram hélices alfa porque seu anel cíclico trava o ângulo phi da cadeia peptídica. Glicinas são flexíveis demais e estabilizam giros apertados. Se você está construindo um modelo e ignora isso, o resultado fica pior que aleatório. Eu aprendi isso na hard way quando passei três diasando um modelo de colágeno que simplesmente não fechava direito, só pra descobrir que tinha colocado uma prolina num sítio que a literatura mostra ser absolutamente conservado há bilhões de anos.

Como estudar e analisar proteínas estruturas no dia a dia

O fluxo que eu uso pessoalmente começa com o RCSB PDB para buscar a estrutura cristalográfica mais relevante. A maioria das estruturas de proteínas estruturas já tem resolución boa porque são relativamente estáveis e cristalizam fácil. Colágeno triplo-hélice, por exemplo, tem dezenas de estruturas resolvidas com resolução abaixo de 2 Angstroms. Queratina tem menos dados bons porque é mais difícil de cristalizar em forma ordenada, aí você tem que recorrer a dados de microscopia eletrônica criogênica. Depois de baixar a estrutura, eu abro no PyMOL ou no ChimeraX e faço uma leitura sequencial:

Primeiro olho para a composição de aminoácidos. Proteínas estruturais são altamente enriquecidas em residues específicos. Colágeno é basicamente repetições de Glicina-X-Y onde X é frequentemente prolina e Y é frequentemente hidroxiprolina. Sem a hidroxilação da prolina, o colágeno não forma a triple-hélice estável, e esse é exatamente o mecanismo da escorbuto. Então se você vê uma estrutura de colágeno sem hidroxiprolina modelada, algo tá errado ou a estrutura foi refinada em condições não-fisiológicas. Segundo, analiso as interações que mantêm a estrutura. Pontes de hidrogênio, interações iônicas, ponte dissulfeto. Em proteínas estruturais como a queratina, as pontes dissulfeto são cruciais. Cistinás formando redes cross-link que dão resistência mecânica. Sem essas pontes, o tecido perde integridade structural quase que imediatamente. Eu já vi laboratórios inteiros perderem semanas tentando cristalizar queratina porque não consideraram que o pH e o redox do buffer estavam reduzindo as pontes dissulfeto antes mesmo de começar o experimento.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Terceiro, comparo com homólogos. Alinhamento de sequência usando BLAST ou HHsearch contra a UniProt, e depois sobreposição estrutural com o Dali ou o CE. Isso te mostra quais elementos estruturais são conservados evolutivamente e quais são variáveis. Resíduos conservados em posições estruturais-chave geralmente não podem ser mutados sem destruir a função. Se você está fazendo engenharia de proteínas e propõe uma mutação num resíduo conservado de uma proteína estrutura, tem muita chance de ser letal pro dobramento.

Pegadinhas e limitações que ninguém conta

O maior problema com estruturas de proteínas, principalmente as estruturais, é que a maioria dos dados vêm de cristalografia de raios-X. Isso significa que a proteína está parada num cristal, sob condições artificiais de pH, salinidade e temperatura. A dinâmica real da proteína no citoplasma ou na matriz extracelular pode ser radicalmente diferente. Eu já perdi tempo achando que uma conformação observada no cristal era funcional porque ninguém tinha parado pra verificar se ela aparece em solução. Outro problema sério são estruturas incompletas. O PDB está cheio de modelos onde loops inteiros não aparecem nos mapas de densidade eletrônica porque são desordenados. Para proteínas estruturais isso é particularmente traiçoeiro porque regiões desordenadas frequentemente são justamente as que fazem mediação de interações. Um colágeno sem seus domínios terminais bem definidos, por exemplo, perde informações importantes sobre como ele se organiza em fibrilas.

Se você precisa de informações funcionais além da estrutura estática, considere complementar com dados de NMR para dinâmica, ou simulações de dinâmica molecular. Simulações de microseconds com AMBER ou CHARMM dão uma noção realista de flexibilidade que cristalografia não consegue. Mas prepare-se: uma simulação de 1 microssegundo de uma proteína de 300 resíduos pode levar dias num cluster bom, e semanas num setup caseiro.

Onde encontrar dados e ferramentas

O RCSB PDB (rcsb.org) é a fonte primária, gratuita e sem cadastro. O UniProt (uniprot.org) dá a sequência e anotações funcionais. O Foldex e o AlphaFold DB (alphafold.ebi.ac.uk) oferecem modelos preditivos de alta qualidade que cobrem praticamente todo o proteoma humano e muitos organismos modelo. O AlphaFold costuma acertar muito bem domínios estruturais bem conservados, mas tem confiança baixa em regiões desordenadas e em interfaces de proteínas estruturas multiméricas. Para visualização, PyMOL (versão acadêmica gratuita) e ChimeraX são as opções mais sólidas. Para alinhamento e análise de conservação, o Jalview e o ConSurf são bons. O I-TASSER e o RoseTTAFold são alternativas ao AlphaFold se você quiser comparar predições entre métodos diferentes.

Se o seu interesse é mais prático, tipo projetar mutações ou entender doenças relacionadas a defeitos de dobramento de proteínas estruturais, o ClinVar e o HGMD cruzados com estruturas do PDB te dão um mapa direto de variantes patogênicas sobre a arquitetura 3D. Isso economiza horas de pesquisa manual porque você já sabe exatamente qual resíduo e qual tipo de substituição está associado a qual fenótipo clínico.