Converter BMP para TXT

Aqui você converte BMP para TXT de graça e sem conta: solte o arquivo acima e em poucos segundos o resultado está pronto para baixar. A conversão acontece dentro do seu próprio navegador, então o arquivo nunca é enviado. Funciona igual no Windows, no macOS e no Linux e também no iPhone e no Android, e continua funcionando mesmo se você cortar a conexão.

  • Onde roda No seu navegador. O arquivo nunca é enviado.
  • Reconstruído TXT funciona de um jeito diferente de BMP. Não é a degradação gradual de um codec com perda: o que TXT consegue expressar é reproduzido fielmente, e o que não tem equivalente ali não sobrevive de jeito nenhum.
  • Limite de tamanho Até 100 MB por arquivo, de graça e sem conta.
  • Vale saber O texto é lido por reconhecimento de padrões, então é um palpite fundamentado e não uma transcrição. Tipografia limpa, reta e bem iluminada numa resolução decente sai quase perfeita; uma foto tirada de lado, um fax apagado, uma fonte incomum ou letra à mão vão gerar erros. Confira sempre o resultado contra o original antes de confiar nele. O ajuste de idioma importa: com o errado, o que volta é bobagem com ar de certeza, e não uma mensagem de erro.

Até 100 arquivos de uma vez. Formatos misturados não são problema.

Uma página guardada como bitmap é sistema legado de alguém

Ninguém digitaliza para BMP de propósito hoje em dia. Os arquivos que chegam aqui foram escritos por um driver de scanner dos anos 1990, um gateway de fax, uma multifuncional com firmware antigo, ou um sistema de documentos do Windows rodando quieto num arquivo morto há vinte anos. O formato é de 1987 e o cabeçalho de 40 bytes que esses arquivos carregam é de 1990; o registro do site marca ele como legado, e os acervos que ele produziu ainda estão aí.

Isso muda a natureza do trabalho. Raramente é uma página e uma dúvida — é uma pasta inteira, um compartilhamento de rede, ou a exportação de um sistema sendo desativado, e o texto precisa sair porque o sistema capaz de lê-lo está indo embora. Também significa que ninguém pode voltar e digitalizar de novo, o que separa esta página de qualquer outra página de OCR do site: uma foto pode ser tirada de novo e um print de tela pode ser refeito maior, mas um fax de 1997 de uma carta assinada é o melhor que ele jamais vai ser.

O próprio bitmap revela como a digitalização foi feita

Como um BMP custa três bytes por pixel sem compressão nenhuma, o tamanho é aritmética pura, e dá para reverter a conta. Uma página A4 digitalizada a 300 dpi tem 2.480 por 3.508 pixels e cerca de 26 MB. A mesma página a 150 dpi tem 1.240 por 1.754 e cerca de 6,5 MB. Um arquivo medido em algumas centenas de kilobytes foi digitalizado numa resolução baixa demais para ler com confiança.

Vale conferir isso antes de converter um acervo, não depois. A resolução é o indicador mais forte de como o reconhecimento vai se sair, ela fica fixa no momento da digitalização, e num BMP dá para lê-la pelo tamanho do arquivo sem abrir nada. Ordenar a pasta por tamanho é, então, uma triagem grosseira de quão bem o reconhecimento vai funcionar — e é uma triagem incomumente barata porque o formato não comprime nada, então nada no conteúdo interfere no número.

Bitmaps em preto e branco já perderam os traços

Boa parte das digitalizações legadas era bilevel: cada pixel forçado a preto puro ou branco puro no momento da digitalização, porque uma página guardada num bit por pixel ocupava um oitavo do espaço, e espaço em disco era a restrição real. Imagens de fax são assim por definição.

O reconhecedor precisa do cinza. Bordas suavizadas e traços parciais são o que permite distinguir um e de um c, e o corte binário removeu isso antes mesmo do arquivo existir — serifas finas desaparecem, letras claras se quebram em fragmentos, e texto em negrito vira uma mancha só. Nada recupera isso, e nenhum ajuste desta página compensa. Se o papel original ainda existe, digitalizar de novo em escala de cinza a 300 dpi vale mais do que qualquer processamento posterior. Há um pequeno consolo: uma página A4 bilevel a 300 dpi fica em torno de 1,1 MB em vez de 26, então um acervo assim é uma fração do tamanho que um acervo colorido teria sido, o que explica por que foi digitalizado dessa forma.

Nomeação e ordem quando o acervo volta como texto

Cada resultado mantém o nome original com a extensão trocada, então a ordem dos arquivos de texto é a ordem dos bitmaps — que é o que o sistema de imagens decidiu lá em 1998. Nomes como SCAN0001 até SCAN0912 ordenam corretamente; nomes que terminam em números sem zeros à esquerda não, e um conjunto que chega até a página 10 vai ordenar ela logo depois da página 1.

O modo de falha a observar é o silencioso. Uma página em que o reconhecedor não achou nada volta como um arquivo vazio em vez de um erro, então uma folha separadora em branco, uma página digitalizada de cabeça para baixo e uma página cujo contraste derrotou o reconhecimento saem todas idênticas na pasta de resultado. Ordenar os resultados por tamanho e abrir os menores leva um minuto e encontra todas elas.

Escolha o idioma antes de o bitmap ser lido

Inglês, alemão, francês e espanhol têm modelo aqui, e a escolha não é uma dica opcional. O reconhecedor compara formas com as letras e o vocabulário de um idioma, e recebendo o idioma errado ele não falha — devolve a resposta mais próxima dentro de um conjunto que não contém a resposta certa.

O sintoma é texto fluente e errado. Num acervo, isso vale acertar já no primeiro arquivo, e não no centésimo, porque um lote lido no idioma errado produz uma pasta de saída plausível que ninguém percebe estar quebrada até muito depois.

O reconhecedor não consegue sinalizar os próprios erros

Este é o único motor do site que pode estar confiantemente errado em vez de simplesmente impreciso. Um conversor que transforma um bitmap em PNG funciona ou dá erro; este devolve um texto que parece exatamente um texto, esteja ele certo ou não, sem nenhuma marca nos trechos em que teve dúvida.

Leia o resultado contra o original, e leia os números primeiro. Um dígito errado num valor de nota fiscal, num número de conta ou numa data é exatamente o erro que sobrevive a uma conferência rápida e causa um problema real meses depois. Números também são o pior caso para o reconhecimento, porque não há vocabulário por trás deles — uma letra errada costuma virar uma palavra que não existe, mas um dígito errado vira um número perfeitamente plausível. Num acervo, conferir uma página em cada vinte é o mínimo que torna o resultado utilizável como evidência de algo, e guardar os bitmaps é o que torna o erro corrigível depois.

O que sai é a palavra, não o documento

Texto puro: sem títulos, sem colunas, sem tabelas, sem posições na página. Uma carta ou memorando de coluna única sai na ordem certa e lê normalmente, o que cobre boa parte do que fica num acervo de registros.

Qualquer coisa estruturada perde qualidade. Uma página de duas colunas pode voltar com as colunas intercaladas, porque o reconhecedor lê ao longo de linhas que parecem linhas. Um formulário perde a ligação entre um rótulo e o valor ao lado, e uma tabela vira uma sequência de números sem indicação de qual coluna eles vinham. Para esses casos, espere ter algum trabalho manual com o resultado, ou processar página por página.

O motor de OCR é servido por este site, não por um CDN

O Tesseract normalmente busca três coisas num CDN de terceiros: o script do worker, o núcleo em WebAssembly e o modelo de idioma. Se ficasse do jeito que vem por padrão, seriam três pedidos a outra empresa carregando o seu endereço e a URL da página que você está usando — num site cujo argumento inteiro é que o documento não é da conta de mais ninguém.

Os três são servidos por este domínio em vez disso, e um teste falha se uma URL de CDN reaparecer algum dia. O bitmap em si nunca ia a lugar nenhum de qualquer forma; o ponto é que uma pessoa lendo um holerite ou um prontuário médico não deveria ter esse fato anunciado a terceiros como efeito colateral da ferramenta.

Lendo um acervo de bitmaps, uma pasta por vez

Solte a pasta. Cada arquivo é reconhecido na sua vez e os resultados voltam juntos, mantendo os nomes originais com a extensão trocada. O motor é iniciado uma vez para o idioma escolhido e mantido entre os arquivos, então um lote de quarenta paga a inicialização de vários segundos uma vez só, não quarenta vezes.

Ainda assim é a coisa mais lenta do site, de longe, e o teto de 100 MB por arquivo — cerca de 33 megapixels de bitmap — não é a restrição real. Tempo é. Comece um acervo grande, deixe rodando, e confira os primeiros resultados antes de sair: uma hora de reconhecimento no idioma errado é uma hora gasta duas vezes.

Quando a resposta não é esta página

Se as digitalizações estão legíveis mas o que se precisa entregar é um documento, e não uma transcrição, converter os bitmaps para PDF mantendo as imagens costuma ser o que o destinatário realmente queria — a extração de texto só importa se alguém precisar buscar ou reaproveitar as palavras.

E se o reconhecimento vier ruim já nas primeiras páginas, a conclusão honesta costuma ser que o acervo não tem qualidade suficiente para leitura automática. Um fax bilevel de 200 dpi de uma cópia carbono tem um teto que nenhuma ferramenta ultrapassa. Saber disso depois de cinco páginas, em vez de quinhentas, é a coisa mais útil que esta página pode oferecer.

Como converter BMP para TXT

  1. Solte o seu arquivo BMP nesta página, ou clique para escolher um.
  2. Escolha TXT como destino. A conversão acontece no seu navegador e o arquivo não é enviado.
  3. Baixe o arquivo TXT pronto.

BMP ou TXT: o que muda

BMP comparado com TXT
BMPTXT
Nome completoBitmap do WindowsTexto simples
Extensão do arquivo.bmp, .dib.txt, .text, .log
Tipo de mídiaimage/bmptext/plain
CompressãoSem compressão
Publicado pela primeira vez19871963
Publicado porMicrosoft
EspecificaçãoUnicode
LicençaPublicado, não padronizadoPadrão aberto
Situação hojeAntigo, ainda lido em todo lugarAtual
Profundidade de bits8
Cor que consegue descreverRGB, paleta indexada
Abre no navegadorTodos os navegadoresTodos os navegadores
Considerado no lugarPNG, TIFFMD, RTF

O que o formato de destino acrescenta

TXT é formato de trabalho e BMP é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.

Abrir o resultado

BMP é de 1987 e está praticamente superado. TXT é o que os programas atuais escrevem, então converter também é uma forma de continuar conseguindo ler.

Os programas de sempre não se cruzam: BMP abre em Microsoft Paint, GIMP e IrfanView, e TXT em Notepad, TextEdit e Visual Studio Code, então quem receber o resultado precisa de algum do segundo grupo.

Para que serve cada formato

BMP é o formato da Microsoft, publicado em 1987. Registra 8 bits por canal.

TXT e de 1963, descrito em Unicode. Notepad, TextEdit e Visual Studio Code leem o formato.

TXT foi publicado em 1963 e BMP em 1987. O mais antigo costuma ser o arquivo mais seguro para entregar; o mais novo faz o mesmo com menos bytes.

De BMP para TXT: perguntas frequentes

Meu arquivo BMP é enviado para algum lugar?

Não. Esta conversão acontece inteiramente no seu navegador, então o arquivo não sai do seu aparelho. Você mesmo pode conferir: abra a aba de rede das ferramentas de desenvolvedor e converta alguma coisa. Você verá a própria página e as requisições de estatística e de publicidade com que este serviço é pago, e nenhuma que leve o seu arquivo. O motor deste par específico é Tesseract, o motor livre de reconhecimento de texto; seu navegador baixa isso uma vez e guarda.

Converter BMP para TXT é grátis?

É. Sem conta, sem marca d’água e sem cota diária para gastar: roda no seu próprio aparelho, então você pode voltar quantas vezes quiser. O navegador processa arquivos de até 100 MB, 100 por vez. Tesseract é baixado para a sua máquina e roda lá, e por isso não há contador.

Perde qualidade ao converter BMP para TXT?

BMP e TXT descrevem o conteúdo de maneiras radicalmente diferentes. A conversão é, portanto, uma reconstrução e não uma cópia: fiel, mas não idêntica byte a byte. O texto é lido por reconhecimento de padrões, então é um palpite fundamentado e não uma transcrição. Tipografia limpa, reta e bem iluminada numa resolução decente sai quase perfeita; uma foto tirada de lado, um fax apagado, uma fonte incomum ou letra à mão vão gerar erros. Confira sempre o resultado contra o original antes de confiar nele. O ajuste de idioma importa: com o errado, o que volta é bobagem com ar de certeza, e não uma mensagem de erro.

O arquivo TXT pode ser editado depois?

TXT é formato de trabalho e BMP é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.

Mais sobre esses formatos