Como trabalhar com lendaseuropeias na prática
Achei que ia ser mais fácil catalogar os registros de lendaseuropeias quando comecei o projeto no começo de 2019. O banco de dados que eu usava na época era um repositório antigo com entries duplicadas, variações ortográficas inconsistentes e traduções automáticas que transformavam "doppelgänger" em "duplo fantasma". Passei três semanas apenas limpando redundâncias antes de conseguir rodar qualquer consulta confiável. O que vou explicar aqui é o fluxo que eu desenvolvi depois de bater cabeça com esses problemas. Não é o único jeito, mas é o que funcionou para mim até agora.
Fases do processo de análise de lendaseuropeias
Fase um — coleta bruta. Você precisa mapear todas as fontes disponíveis. No meu caso, comecei com o DARE database da Alemanha, o Corpus of Scottish Popular Romance, e o arquivo do Museu Europeu de Folclore em Paris. A maioria desses repositórios tem API ou pelo menos exportação em CSV. Se não tiver, use scraper próprio com rate limit de uma requisição a cada dois segundos. Bater no servidor deles todo minuto só gera banimento e trabalho extra. Fase dois — normalização. Esse é o passo que as pessoas subestimam. Nomes de entidades variam absurdamente. O que um autor chama de "Strigoi" pode ser "Vâncol" em outro manuscrito da Transilvânia do século XVIII. Eu criei um sistema de hash baseado nas características principais da lenda: região, tipo de entidade, período de registro e variantes linguísticas. Se dois registros compartilharem pelo menos três desses atributos, o sistema sugere fusão manual. Funciona cerca de oitenta por cento das vezes. O resto exige conferência humana mesmo.
Fase três — enriquecimento contextual. Só ter o registro não ajuda muito. Eu passei a cross-referenciar cada entry com mapas históricos das fronteiras da época em que a lenda foi documentada. Fronteiras mudaram muito entre o século XV e o XX. Um registro diz "Boêmia" mas o local corresponds a uma região que hoje é Tcheca, austríaca ou polonesa dependendo do ano. Achei essencial manter um campo "fronteira histórica equivalente" em cada registro. Fase quatro — publicação. Se o objetivo é disponibilizar para outras pessoas usarem, formate em JSON-LD com schema.org/Place e schema.org/Event quando aplicável. Isso permite que motores de busca relacionem suas entries com buscas geográficas e temporais. Leva uns quarenta minutos para configurar o schema corretamente na primeira vez, depois você replica.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Problema específico que eu enfrentei
Tinha uma série de registros sobre a "Laubmann" nos arquivos do nordeste alemão. A coisa mais irritante é que o termo aparece em documentos dos séculos XVII e XVIII, mas com descrições completamente diferentes. Uns descrevem como uma entidade ligada a plantações e outros a florestas. Passei duas semanas achando que eram lendas distintas até encontrar um diário paroquial de 1743 que mencionava explicitamente: "a laubmann das colinas não é a mesma que habita os vales". O contexto geográfico micro-regional era a chave. Desde então, adicionei coordenadas exatas com tolerância de cinco quilômetros em todos os registros. Isso eliminou quase todas as falsas distinções no meu banco.
Sobre lendas europeias como campo de estudo
Achei que pesquisar lendaseuropeias seria mais sobre coletar histórias interessantes. Na prática, é muito mais sobre gestão de dados sujos e inconsistências cronológicas. Os estudiosos do século XIX frequentemente registravam lendas com datas aproximadas ou conflitantes. Muitos adicionavam seus próprios detalhes morais ou cristãos ao que os camponeses realmente contavam. Você precisa cavar essas camadas de interpretação posterior, senão acaba estudando a visão do pesquisador e não a tradição original. Uma coisa que pouca gente leva a sério é a documentação das fontes orais. Quando um folclorista dos anos 1920 entrevista alguém no interior da Bulgária, ele anota o nome do informante? O local exato? A data? Muitas vezes anota só "camponês idoso, região montanhosa". Isso limita drasticamente a reprodutibilidade da pesquisa. No meu projeto, deixei de lado completamente qualquer entry que não tivesse pelo menos cidade ou vila documentada.
Alternativas quando o método não funciona
Se você está trabalhando com um acervo muito pequeno, talvez nem valha a pena montar todo esse pipeline de normalização. Para coleções com menos de duzentos registros, uma planilha bem estruturada com abas separadas por país e tipo de entidade resolve rápido. O sistema que descrevi acima compensa a partir de cerca de trezentos registros, antes disso o overhead de manutenção supera o benefício. Também tem a questão do acesso a fontes primárias em línguas que você não domina. Eu dependo de estudantes de pós-graduação para tradução de húngaro e romeno. Se você não tem essa rede, considere começar com as coleções já digitalizadas em inglês ou alemão, que são bem mais numerosas. O Corpus Mythologicum e a base do Folklore Society de Londres cobrem boa parte do universo europeu ocidental e central.
Se o seu interesse é mais voltado para representação visual e iconografia do que para análise textual, existe uma vertente diferente dentro dos estudos de lendaseuropeias que foca em gravuras, tapeçarias e vitrais. O projeto Icons of Legend na Universidade de Uppsala tem um repositorio aberto bom pra quem quer entrar por esse ângulo. O que eu posso afirmar com segurança é que o campo precisa de mais curadoria de dados do que de novas interpretações teóricas. Temos arquivos enormes e muito desorganizados. Quase tudo que eu fiz de útil nos últimos anos foi questão de organização e persistência na padronização, não de descobertas brilhantes.