TXT

O que é um arquivo TXT?

Caracteres e nada mais. Vai continuar abrindo daqui a cinquenta anos.

O que é TXT

TXT é um formato de texto puro que abre em qualquer editor. Ele é usado para mover dados entre programas e o arquivamento.

A extensão é .txt e o nome por extenso é Plain Text. Os dois importam menos do que aquilo que o arquivo consegue carregar, e é disso que trata o resto desta página.

De onde vem TXT

Ele remonta a 1963. A especificação é Unicode.

A um formato que se manteve legível por tanto tempo dá para confiar algo que você quer de volta daqui a dez anos.

A especificação é pública

Ela está publicada por inteiro, então dá para implementá-la a partir do documento em vez de por observação — é por isso que o formato aparece em tantos programas e por isso que arquivos escritos há vinte anos ainda abrem. Especificação publicada não é o mesmo que livre de royalties: quando o formato embrulha um codec, o licenciamento das patentes é uma questão à parte, que a norma não resolve.

Nada é jogado fora

TXT guarda o conteúdo exatamente. Salvar de novo não muda nada, então dá para abrir, editar e salvar quantas vezes você quiser sem acumular estrago — e é isso que faz dele um formato de trabalho e não de entrega.

O que abre TXT

Notepad, TextEdit e Visual Studio Code leem esse formato, e a maioria dos programas do mesmo tipo também.

Quando um arquivo não abre, o formato raramente é o problema — mais comum é o programa ser mais antigo que ele. Converter para algo mais antigo é o caminho confiável, e é para isso que serve o resto deste site.

Abrir no navegador

Qualquer navegador atual lê o formato.

Dá para colocá-lo numa página ou anexá-lo a uma mensagem sem se perguntar o que o outro lado tem instalado.

É um formato de trabalho

TXT foi feito para ser aberto e alterado. Mantenha o arquivo nesse formato enquanto o trabalho estiver em andamento e exporte a partir dele sempre que precisar de uma cópia pronta.

O único formato sem formato

Um arquivo TXT é uma sequência de caracteres. Não tem cabeçalho, não tem estrutura, não tem estilo, não tem metadado e não tem versão — nada para ficar obsoleto, e nada que precise de um programa para interpretar. Isso é a especificação inteira, e é por isso que um arquivo de texto escrito em 1970 abre hoje em qualquer coisa e vai abrir daqui a cinquenta anos em o que quer que tenha substituído tudo isso.

Tudo mais neste site é um formato no sentido real: bytes organizados para que um tipo específico de programa consiga reconstruir algo. Texto puro não pede nada. É o chão sobre o qual todo outro formato é construído, o que explica HTML, CSV, JSON, Markdown, SRT e SVG serem todos, por baixo, arquivos de texto com convenções em cima.

Codificação é a única decisão invisível

Caracteres precisam ser guardados como números, e qual número significa qual caractere é a codificação. UTF-8 é a resposta em todo lugar hoje, e tem a propriedade útil de que texto em inglês simples é idêntico byte a byte ao ASCII de cinquenta anos atrás.

Arquivos mais antigos não são UTF-8, e nada no arquivo diz isso. Texto salvo numa máquina Windows no Brasil provavelmente é Windows-1252; na Europa Central, 1250; na Rússia, 1251. Abra um desses presumindo UTF-8, e cada letra acentuada vira um losango preto ou um par de caracteres sem sentido. Os bytes estão intactos — o leitor está adivinhando, e adivinhando errado. Qualquer editor decente deixa você reabrir o arquivo com uma codificação diferente, o que conserta instantaneamente e sem redigitar nada.

A marca de ordem de byte, e por que um arquivo quebra de jeitos estranhos

Alguns editores gravam três bytes invisíveis no início de um arquivo UTF-8 para declarar o que ele é. No Windows isso é comum; em quase todo outro lugar é considerado um erro.

É invisível num editor e altamente visível para um programa. Um arquivo de configuração com uma marca dessas falha ao interpretar. Um CSV com uma tem um cabeçalho de primeira coluna que não bate com nada. Um script de shell com uma se recusa a rodar com um erro nada útil. Se um arquivo de texto está sendo rejeitado por algo sem motivo aparente, isso é a primeira coisa a conferir — "UTF-8 sem BOM" é o ajuste que você quer.

Terminação de linha, e a segunda decisão invisível

O Windows termina uma linha com dois caracteres, retorno de carro e alimentação de linha. Tudo mais usa um, só a alimentação de linha. Os dois são legítimos, e o arquivo não anuncia qual usa.

Os sintomas visíveis são antigos mas não sumiram: um arquivo Unix aberto no Bloco de Notas do Windows como uma linha enorme só, ou um arquivo Windows mostrando um marcador solto no fim de cada linha numa ferramenta Unix. Editores modernos tratam os dois silenciosamente e conseguem converter entre eles. Onde isso ainda morde é controle de versão, onde um arquivo inteiro aparece como alterado porque o editor de alguém reescreveu toda terminação de linha, e em scripts, onde um retorno de carro no fim vira parte de um nome de arquivo e nada funciona.

No que texto puro é genuinamente melhor

Longevidade, primeiro. Se algo precisa ser legível daqui a trinta anos sem nenhuma suposição sobre software, deveria ser texto. Isso cobre anotações, registros, transcrições, configuração, exportações de dados, e qualquer coisa pela qual um arquivista vai te agradecer.

Depois ferramentas. Texto pode ser buscado, filtrado, ordenado, comparado e editado por uma quantidade enorme de programas que não sabem nada sobre o seu dado. Um diff entre duas versões faz sentido. Controle de versão consegue mesclar as mudanças de duas pessoas. Nada disso é possível com um documento binário, e é o motivo de tanto trabalho técnico acontecer em formatos de texto que parecem primitivos ao lado das alternativas.

Arquivos de texto muito grandes

Logs e exportações chegam a gigabytes, e a maioria dos editores tenta carregar tudo na memória. Um processador de texto simplesmente se recusa; um editor genérico pode travar a máquina.

As ferramentas que aguentam leem em pedaços — um editor de código de verdade, um paginador, ou os utilitários de linha de comando feitos para isso. Em qualquer sistema, olhar as primeiras e últimas cinquenta linhas de um arquivo grande responde a maioria das perguntas sem abrir ele: o topo diz o que o arquivo é, o fim diz se o processo que gravou ele terminou.

Convertendo de e para texto

Converter um documento para TXT mantém as palavras e descarta tudo mais — fontes, layout, imagens, tabelas, títulos. Às vezes é isso mesmo que se quer: extrair o texto de um PDF para citar, buscar, ou alimentar outra coisa. Vale saber que uma tabela convertida para texto puro normalmente vira ilegível, porque o alinhamento que fazia dela uma tabela era formatação, não conteúdo.

Na direção contrária, converter texto para PDF é uma troca de envelope, não de conteúdo. Fixa a aparência, torna o arquivo imprimível, e produz algo que abre da mesma forma para todo mundo. O arquivo de texto continua sendo a versão que você ainda consegue editar, buscar e comparar, o que explica manter os dois normalmente ser o certo.

Os dados, num lugar só

Identificadores e procedência do formato TXT.
Extensão.txt, .text, .log
Tipo de mídiatext/plain
Primeira publicação1963
EspecificaçãoUnicode