Converter PDF para TXT

Aqui você converte PDF para TXT de graça e sem conta: solte o arquivo acima e em poucos segundos o resultado está pronto para baixar. A conversão acontece dentro do seu próprio navegador, então o arquivo nunca é enviado. Funciona igual no Windows, no macOS e no Linux e também no iPhone e no Android, e continua funcionando mesmo se você cortar a conexão.

  • Onde roda No seu navegador. O arquivo nunca é enviado.
  • Reconstruído TXT funciona de um jeito diferente de PDF. Não é a degradação gradual de um codec com perda: o que TXT consegue expressar é reproduzido fielmente, e o que não tem equivalente ali não sobrevive de jeito nenhum.
  • Limite de tamanho Até 100 MB por arquivo, de graça e sem conta.
  • Vale saber Só funciona com PDF que tenham camada de texto. Documentos digitalizados saem vazios e precisam de reconhecimento óptico.

Até 100 arquivos de uma vez. Formatos misturados não são problema.

O teste que decide se isto vai funcionar

Existem dois tipos de PDF e, por fora, são idênticos. Um veio de um documento — exportado do Word, impresso em PDF, gerado por um sistema — e tem caracteres de verdade. O outro veio de um scanner ou da câmera do celular e tem a fotografia de uma página.

Dá para saber em cinco segundos: abra o PDF e tente selecionar uma linha com o mouse. Se palavras isoladas ficam marcadas, os caracteres estão no arquivo e esta página tira eles de lá. Se a página inteira vira um retângulo azul, ou se nada acontece, é imagem — e aí o que resolve é reconhecimento de texto, que esta conversão não faz de propósito.

Por que o layout não vem junto

Texto puro é uma sequência de caracteres e mais nada. Não conhece coluna, tabela, título, página nem fonte. Converter PDF em texto é perder informação de propósito — não é a limitação, é exatamente o que foi pedido.

As consequências são previsíveis. Um artigo em duas colunas sai como uma sequência contínua, a coluna da esquerda inteira antes da direita, e não linha a linha. Uma tabela vira as suas células soltas, sem a grade que dava sentido a elas. Cabeçalho e rodapé aparecem no meio do texto a cada página. Se qualquer disso importa, o que você quer é converter o PDF para um formato de documento, onde a estrutura tem onde morar.

Onde a ordem das palavras pode sair errada

Um PDF não guarda frases nem parágrafos. Guarda instruções do tipo «desenhe estes glifos nesta posição», e a ordem dessas instruções costuma ser — mas não precisa ser — a ordem de leitura. Documento comum sai exato.

Quebra em páginas muito diagramadas: revista com uma frase destacada no meio da coluna, formulário com campos em volta dos rótulos, informativo cheio de caixas. Isso pode vir embaralhado, porque o arquivo realmente não registra qual bloco vem antes. Nenhum programa conserta isso só com o arquivo: a informação nunca foi escrita ali.

Aqui rodar no navegador pesa mais do que em outras conversões

Repare no que as pessoas extraem. Contrato de aluguel, contracheque, extrato bancário, laudo, nota fiscal, petição baixada do PJe, manuscrito ainda não publicado. É uma categoria puxada para documentos que dizem respeito a uma pessoa só.

Todo outro extrator da internet pede o upload. Este lê o arquivo com o pdf.js — o mesmo motor com que o Firefox exibe PDF, código aberto e licença Apache — dentro da página que você já abriu. E dá para conferir em vez de acreditar: abra as ferramentas de desenvolvedor, deixe a aba de rede à vista e converta alguma coisa.

Quando o texto vai para um modelo de linguagem

Virou um dos motivos mais comuns da conversão, e texto puro é o formato certo para isso. Modelo lê texto; fonte e posicionamento de PDF não acrescentam nada, e arrastar um PDF para a janela de conversa em geral significa que a ferramenta fez esta mesma conversão por você, com menos cuidado.

Duas coisas ajudam. Converta o documento inteiro em vez de mandar prints das páginas, porque texto é exato e imagem precisa ser adivinhada. E olhe o começo da saída: se a primeira página é uma capa só com o título, o texto vai começar com pouquíssimo — sinal de que deu certo, não de que falhou.

Ligaturas, hifens e outras esquisitices esperadas

A extração é fiel ao que está no arquivo, o que às vezes quer dizer ser fiel a algo estranho. Palavra separada no fim da linha mantém o hífen. Alguns documentos guardam fi e fl como um único glifo, e é assim que chegam.

Nada disso é estrago: é o documento sendo relatado como está. Um localizar-e-substituir resolve os hifens, e a maioria dos editores e dos modelos de linguagem lida com as ligaturas sem que ninguém peça.

Codificação, e que arquivo é esse que você recebe

A saída é UTF-8, que é o que se quer em praticamente todo caso: acentos, cedilha, grego, cirílico, japonês e emoji no mesmo arquivo, e qualquer programa atual lê.

O ponto onde ainda trava é software antigo do Windows, e o suspeito de sempre é o Excel: dois cliques num .txt ou .csv fazem ele chutar uma página de código velha e os acentos viram lixo. Entrar por Dados > Obter dados > De texto/CSV e escolher UTF-8 resolve, assim como abrir o arquivo em quase qualquer outra coisa.

Como tirar o texto de um PDF digitalizado mesmo assim

Se o teste da seleção mostrou uma imagem, esta página não ajuda, e dizer isso é melhor do que devolver um arquivo vazio. Reconhecimento de texto é outra operação, com outro tipo de erro: não falha alto, erra baixinho.

Os caminhos realistas são o reconhecimento do próprio sistema — macOS e versões recentes do Windows tiram texto de uma imagem — ou um programa de OCR dedicado. Seja qual for, leia o resultado antes de confiar: um dígito reconhecido errado numa nota fiscal é idêntico a um certo.

Que tamanho de documento isto aguenta

A extração é rápida porque lê estrutura em vez de desenhar. Algumas centenas de páginas passam despercebidas, e o esforço acompanha a quantidade de texto, não o tamanho do arquivo.

Fica lento com documento que é grande por estar cheio de imagem, porque elas precisam ser atravessadas do mesmo jeito. Um catálogo digitalizado de 200 MB demora um instante e depois devolve, corretamente, quase nenhum texto — é o teste da seleção de novo, pelo caminho longo.

Como converter PDF para TXT

  1. Solte o seu arquivo PDF nesta página, ou clique para escolher um.
  2. Escolha TXT como destino. A conversão acontece no seu navegador e o arquivo não é enviado.
  3. Baixe o arquivo TXT pronto.

PDF ou TXT: o que muda

PDF comparado com TXT
PDFTXT
Nome completoPortable Document FormatTexto simples
Extensão do arquivo.pdf.txt, .text, .log
Tipo de mídiaapplication/pdftext/plain
CompressãoUm ou outro, conforme a configuração
Publicado pela primeira vez19931963
Publicado porAdobe
EspecificaçãoISO 32000-2Unicode
LicençaPadrão abertoPadrão aberto
Situação hojeAtualAtual
Cor que consegue descreverRGB, CMYK, tons de cinza
Abre no navegadorTodos os navegadoresTodos os navegadores
Considerado no lugarDOCX, HTMLMD, RTF

O que o formato de destino acrescenta

TXT é formato de trabalho e PDF é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.

Abrir o resultado

Os programas de sempre não se cruzam: PDF abre em Adobe Acrobat, Preview e LibreOffice Draw, e TXT em Notepad, TextEdit e Visual Studio Code, então quem receber o resultado precisa de algum do segundo grupo.

Para que serve cada formato

PDF é o formato da Adobe, publicado em 1993. Está descrito em ISO 32000-2, e vale conhecer se o arquivo precisa sobreviver à ferramenta que o escreveu.

TXT e de 1963, descrito em Unicode. Notepad, TextEdit e Visual Studio Code leem o formato.

TXT foi publicado em 1963 e PDF em 1993. O mais antigo costuma ser o arquivo mais seguro para entregar; o mais novo faz o mesmo com menos bytes.

De PDF para TXT: perguntas frequentes

Meu arquivo PDF é enviado para algum lugar?

Não. Esta conversão acontece inteiramente no seu navegador, então o arquivo não sai do seu aparelho. Você mesmo pode conferir: abra a aba de rede das ferramentas de desenvolvedor e converta alguma coisa. Você verá a própria página e as requisições de estatística e de publicidade com que este serviço é pago, e nenhuma que leve o seu arquivo. O motor deste par específico é PDF.js, o motor de PDF da Mozilla, o mesmo que o Firefox usa; seu navegador baixa isso uma vez e guarda.

Converter PDF para TXT é grátis?

É. Sem conta, sem marca d’água e sem cota diária para gastar: roda no seu próprio aparelho, então você pode voltar quantas vezes quiser. O navegador processa arquivos de até 100 MB, 100 por vez. PDF.js é baixado para a sua máquina e roda lá, e por isso não há contador.

Perde qualidade ao converter PDF para TXT?

PDF e TXT descrevem o conteúdo de maneiras radicalmente diferentes. A conversão é, portanto, uma reconstrução e não uma cópia: fiel, mas não idêntica byte a byte. Só funciona com PDF que tenham camada de texto. Documentos digitalizados saem vazios e precisam de reconhecimento óptico.

O arquivo TXT pode ser editado depois?

TXT é formato de trabalho e PDF é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.

Mais sobre esses formatos

De onde vêm estes números

O que esta página afirma sobre PDF e TXT pode ser conferido, e estes são os documentos que resolvem a questão.