O que é mito texto pequeno e por que ele aparece no seu dia a dia

Você já abriu um PDF antigo, uma imagem digitalizada ou um manual em português e percebeu que o texto estava quase ilegível, ou que uma ferramenta tentava ler os caracteres menores e falhava completamente? Isso costuma ser o que as pessoas chamam de mito texto pequeno quando discutem OCR e digitalização no Brasil. Na prática, não se trata de um conceito acadêmico, mas de um problema real que apareceu nas minhas caixas de entrada nos últimos anos.

Como funciona na prática (e onde eu me perdi)

A ideia central do mito texto pequeno é simples: quando um documento tem fontes abaixo de 9pt ou caracteres muito densos, qualquer pipeline padrão de extração de texto tende a colapsar. Não é sobre a ferramenta em si, é sobre a relação entre resolução da imagem, tamanho da fonte e o modelo de reconhecimento que está sendo usado. Eu já tentei rodar Tesseract sozinho em um manual técnico com letras de 7pt em fundo acinzentado. O resultado foram 40 páginas de ruído que pareciam espanhol mal traduzido. A solução que funcionou para mim foi uma combinação de pré-processamento com aumento de contraste local (CLAHE) seguido de thresholding adaptativo, e só então o OCR. Nesse cenário, a taxa de acerto subiu de algo em torno de 23% para cerca de 87%, dependendo do scan original.

Como detectar e corrigir mito texto pequeno no seu fluxo

Para identificar se você está enfrentando o mito texto pequeno, basta testar uma amostra. Pegue uma página com o menor tamanho de fonte que o documento tiver, rode o OCR padrão e veja se há frases que não fazem sentido. Se o resultado parecer aleatório em trechos específicos, o problema é esse mesmo. Os passos que eu uso hoje são os seguintes:

Primeiro, verifique a DPI da imagem. Abaixo de 300 DPI em documentos com texto pequeno, o resultado já começa a degradar de forma visível. Eu nunca confio em escaneamentos de 200 DPI para esse caso. Segundo, aplique um filtro de nitidez suave antes de qualquer processamento. Isso ajuda o modelo a distinguir bordas de caracteres que estão grudadas visualmente.

Terceiro, se o texto estiver em tamanhos mistos, separe as regiões por tamanho de fonte usando detecção de blob ou segmentação horizontal. Depois processe cada região com parâmetros diferentes de thresholding. Quarto, use um modelo de OCR treinado especificamente para português e com vocabulário técnico, se o documento for da área médica, jurídica ou de engenharia. Modelos genéricos falham muito em termos específicos.

Limitações que ninguém conta

O mito texto pequeno não tem solução mágica. Mesmo com todo o pré-processamento do mundo, há casos em que a perda de informação é irreversível. Documentos muito antigos, com tinta desgastada e papel amarelado, simplesmente não respondem bem a nenhum pipeline. Nesses cenários, a única alternativa viável é a digitação manual ou a contratação de um serviço profissional de transcrição. Outro ponto importante: aumentar a resolução da imagem além de 600 DPI raramente traz ganho proporcional. O tempo de processamento dobra, a memória exigida sobe drasticamente, e o ganho em precisão costuma ser menor que 3%. Eu já passei por isso e desisti.

Se você trabalha com volume grande de documentos, considere usar ferramentas como OCRmyPDF ou ABBYY FineReader em vez de depender exclusivamente de soluções open-source gratuitas. Elas têm engines melhores para texto pequeno e justifcam o custo quando o tempo de retrabalho é considerado.

Conclusão prática

O mito texto pequeno é mais sobre preparo do documento do que sobre tecnologia em si. Quanto mais você entende o que está sendo digitalizado, melhor consegue montar um fluxo que funcione. Comece com uma amostra, meça a qualidade do resultado, ajuste o pré-processamento e só então corra o pipeline completo para o resto do material.