Cookies para estatística e publicidade
Usamos cookies de estatística e de publicidade, ambos enviados ao Google. Recusar não muda nada do que você vê.Ler a página de privacidade
Aqui você converte PDF para TXT de graça e sem conta: solte o arquivo acima e em poucos segundos o resultado está pronto para baixar. A conversão acontece dentro do seu próprio navegador, então o arquivo nunca é enviado. Funciona igual no Windows, no macOS e no Linux e também no iPhone e no Android, e continua funcionando mesmo se você cortar a conexão.
Até 100 arquivos de uma vez. Formatos misturados não são problema.
Eles são convertidos um após o outro e baixados juntos em um ZIP.
PDF para TXT
Existem dois tipos de PDF e, por fora, são idênticos. Um veio de um documento — exportado do Word, impresso em PDF, gerado por um sistema — e tem caracteres de verdade. O outro veio de um scanner ou da câmera do celular e tem a fotografia de uma página.
Dá para saber em cinco segundos: abra o PDF e tente selecionar uma linha com o mouse. Se palavras isoladas ficam marcadas, os caracteres estão no arquivo e esta página tira eles de lá. Se a página inteira vira um retângulo azul, ou se nada acontece, é imagem — e aí o que resolve é reconhecimento de texto, que esta conversão não faz de propósito.
Texto puro é uma sequência de caracteres e mais nada. Não conhece coluna, tabela, título, página nem fonte. Converter PDF em texto é perder informação de propósito — não é a limitação, é exatamente o que foi pedido.
As consequências são previsíveis. Um artigo em duas colunas sai como uma sequência contínua, a coluna da esquerda inteira antes da direita, e não linha a linha. Uma tabela vira as suas células soltas, sem a grade que dava sentido a elas. Cabeçalho e rodapé aparecem no meio do texto a cada página. Se qualquer disso importa, o que você quer é converter o PDF para um formato de documento, onde a estrutura tem onde morar.
Um PDF não guarda frases nem parágrafos. Guarda instruções do tipo «desenhe estes glifos nesta posição», e a ordem dessas instruções costuma ser — mas não precisa ser — a ordem de leitura. Documento comum sai exato.
Quebra em páginas muito diagramadas: revista com uma frase destacada no meio da coluna, formulário com campos em volta dos rótulos, informativo cheio de caixas. Isso pode vir embaralhado, porque o arquivo realmente não registra qual bloco vem antes. Nenhum programa conserta isso só com o arquivo: a informação nunca foi escrita ali.
Repare no que as pessoas extraem. Contrato de aluguel, contracheque, extrato bancário, laudo, nota fiscal, petição baixada do PJe, manuscrito ainda não publicado. É uma categoria puxada para documentos que dizem respeito a uma pessoa só.
Todo outro extrator da internet pede o upload. Este lê o arquivo com o pdf.js — o mesmo motor com que o Firefox exibe PDF, código aberto e licença Apache — dentro da página que você já abriu. E dá para conferir em vez de acreditar: abra as ferramentas de desenvolvedor, deixe a aba de rede à vista e converta alguma coisa.
Virou um dos motivos mais comuns da conversão, e texto puro é o formato certo para isso. Modelo lê texto; fonte e posicionamento de PDF não acrescentam nada, e arrastar um PDF para a janela de conversa em geral significa que a ferramenta fez esta mesma conversão por você, com menos cuidado.
Duas coisas ajudam. Converta o documento inteiro em vez de mandar prints das páginas, porque texto é exato e imagem precisa ser adivinhada. E olhe o começo da saída: se a primeira página é uma capa só com o título, o texto vai começar com pouquíssimo — sinal de que deu certo, não de que falhou.
A extração é fiel ao que está no arquivo, o que às vezes quer dizer ser fiel a algo estranho. Palavra separada no fim da linha mantém o hífen. Alguns documentos guardam fi e fl como um único glifo, e é assim que chegam.
Nada disso é estrago: é o documento sendo relatado como está. Um localizar-e-substituir resolve os hifens, e a maioria dos editores e dos modelos de linguagem lida com as ligaturas sem que ninguém peça.
A saída é UTF-8, que é o que se quer em praticamente todo caso: acentos, cedilha, grego, cirílico, japonês e emoji no mesmo arquivo, e qualquer programa atual lê.
O ponto onde ainda trava é software antigo do Windows, e o suspeito de sempre é o Excel: dois cliques num .txt ou .csv fazem ele chutar uma página de código velha e os acentos viram lixo. Entrar por Dados > Obter dados > De texto/CSV e escolher UTF-8 resolve, assim como abrir o arquivo em quase qualquer outra coisa.
Se o teste da seleção mostrou uma imagem, esta página não ajuda, e dizer isso é melhor do que devolver um arquivo vazio. Reconhecimento de texto é outra operação, com outro tipo de erro: não falha alto, erra baixinho.
Os caminhos realistas são o reconhecimento do próprio sistema — macOS e versões recentes do Windows tiram texto de uma imagem — ou um programa de OCR dedicado. Seja qual for, leia o resultado antes de confiar: um dígito reconhecido errado numa nota fiscal é idêntico a um certo.
A extração é rápida porque lê estrutura em vez de desenhar. Algumas centenas de páginas passam despercebidas, e o esforço acompanha a quantidade de texto, não o tamanho do arquivo.
Fica lento com documento que é grande por estar cheio de imagem, porque elas precisam ser atravessadas do mesmo jeito. Um catálogo digitalizado de 200 MB demora um instante e depois devolve, corretamente, quase nenhum texto — é o teste da seleção de novo, pelo caminho longo.
| TXT | ||
|---|---|---|
| Nome completo | Portable Document Format | Texto simples |
| Extensão do arquivo | .txt, .text, .log | |
| Tipo de mídia | application/pdf | text/plain |
| Compressão | Um ou outro, conforme a configuração | — |
| Publicado pela primeira vez | 1993 | 1963 |
| Publicado por | Adobe | — |
| Especificação | ISO 32000-2 | Unicode |
| Licença | Padrão aberto | Padrão aberto |
| Situação hoje | Atual | Atual |
| Cor que consegue descrever | RGB, CMYK, tons de cinza | — |
| Abre no navegador | Todos os navegadores | Todos os navegadores |
| Considerado no lugar | DOCX, HTML | MD, RTF |
TXT é formato de trabalho e PDF é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.
Os programas de sempre não se cruzam: PDF abre em Adobe Acrobat, Preview e LibreOffice Draw, e TXT em Notepad, TextEdit e Visual Studio Code, então quem receber o resultado precisa de algum do segundo grupo.
PDF é o formato da Adobe, publicado em 1993. Está descrito em ISO 32000-2, e vale conhecer se o arquivo precisa sobreviver à ferramenta que o escreveu.
TXT e de 1963, descrito em Unicode. Notepad, TextEdit e Visual Studio Code leem o formato.
TXT foi publicado em 1963 e PDF em 1993. O mais antigo costuma ser o arquivo mais seguro para entregar; o mais novo faz o mesmo com menos bytes.
Não. Esta conversão acontece inteiramente no seu navegador, então o arquivo não sai do seu aparelho. Você mesmo pode conferir: abra a aba de rede das ferramentas de desenvolvedor e converta alguma coisa. Você verá a própria página e as requisições de estatística e de publicidade com que este serviço é pago, e nenhuma que leve o seu arquivo. O motor deste par específico é PDF.js, o motor de PDF da Mozilla, o mesmo que o Firefox usa; seu navegador baixa isso uma vez e guarda.
É. Sem conta, sem marca d’água e sem cota diária para gastar: roda no seu próprio aparelho, então você pode voltar quantas vezes quiser. O navegador processa arquivos de até 100 MB, 100 por vez. PDF.js é baixado para a sua máquina e roda lá, e por isso não há contador.
PDF e TXT descrevem o conteúdo de maneiras radicalmente diferentes. A conversão é, portanto, uma reconstrução e não uma cópia: fiel, mas não idêntica byte a byte. Só funciona com PDF que tenham camada de texto. Documentos digitalizados saem vazios e precisam de reconhecimento óptico.
TXT é formato de trabalho e PDF é formato pronto. Volta texto editável em vez de uma imagem da página, o que costuma ser o motivo da conversão e também o seu limite.
O que esta página afirma sobre PDF e TXT pode ser conferido, e estes são os documentos que resolvem a questão.