quinta-feira, 19 de setembro de 2013

Conversão de Texto - OCR

Paulo Werneck
Mestre de Parral: São Jerônimo no scriptorium
Fonte: Wikimedia

Os textos apresentados aqui no Guardamoria são, em geral, obtidos na Internet, sob a forma de arquivos de imagem (jpg, pnt) ou pdf, e convertidos para texto. Alguns, felizmente poucos, são copiados em bibliotecas.

Algumas conversões foram feitas na base da cópia pura e simples, ou seja, alguém lê o texto e o digita, mas existem ferramentas denominadas OCR, acrônimo de Optical Character Recognition, em vernáculo Reconhecimento Ótico de Caracteres, que fazem o trabalho de conversão automaticamente.

O primeiro problema é que os textos são cópias de textos antigos, impressos há séculos, com caracteres irregulares, muitas manchas de oxidação do papel ou da tinta, umidade, insetos, além do formato dos caracteres muitas vezes ser bem diferente do formato atual, em especial o "ſ", forma antigamente usada para o "s" em algumas posições na palavra, nunca no final, e que se parece extremamente com o "f".

Essas características acabam ocasionando muitos erros de conversão, que precisam ser corrigidos manualmente, pela comparação visual entre o texto original e o convertido mecanicamente.

Um segundo problema é o próprio software OCR. Há versões pagas, há versões on line. Guardamoria prefere as gratuitas, on line e simples de usar, que tenham razoável taxa de acertos, ou baixa taxa de erros.

Assim recomenda o Free Online OCR, da Smart Soft, disponível em free-online-ocr.com, uma ferramenta bem simples de usar: basta subir o arquivo (PDF, GIF, BMP, JPEG, TIFF or PNG), selecionar o formato de saída (DOC, PDF, RTFou TXT) e pressionar o botão "Convert".