PDF in TXT umwandeln

PDF kannst du hier kostenlos und ohne Konto in TXT umwandeln: Datei oben ablegen, und ein, zwei Sekunden später steht das Ergebnis zum Herunterladen bereit. Die Umwandlung läuft in deinem eigenen Browser, die Datei wird also nie hochgeladen — das klappt unter Windows, macOS und Linux ebenso wie auf iPhone und Android, und es funktioniert selbst dann noch, wenn du das Netz abschaltest.

  • Wo es läuft In deinem Browser. Die Datei wird nicht hochgeladen.
  • Neu aufgebaut TXT funktioniert anders als PDF. Es ist also nicht der schleichende Qualitätsverlust eines verlustbehafteten Codecs: Was TXT ausdrücken kann, wird originalgetreu wiedergegeben — was dort keine Entsprechung hat, bleibt ganz weg.
  • Größenbegrenzung Bis 100 MB pro Datei, kostenlos und ohne Konto.
  • Gut zu wissen Funktioniert nur bei PDFs mit Textebene. Scans kommen leer heraus und brauchen stattdessen Texterkennung.

Bis zu 100 Dateien auf einmal. Gemischte Formate sind kein Problem.

Der Test, der entscheidet, ob das überhaupt funktioniert

Es gibt zwei Arten von PDF, und von außen sehen sie gleich aus. Das eine stammt aus einem Dokument — aus Word exportiert, als PDF gedruckt, von einem System erzeugt — und enthält echte Zeichen. Das andere stammt aus einem Scanner oder einer Handykamera und enthält ein Bild einer Seite.

Du erkennst es in fünf Sekunden: Öffne das PDF und versuche, eine Zeile mit der Maus zu markieren. Werden einzelne Wörter hervorgehoben, stehen die Zeichen in der Datei und diese Seite holt sie heraus. Wird die ganze Seite als ein Rechteck markiert oder gar nichts, ist es ein Bild — dann brauchst du Texterkennung, und die versucht diese Seite bewusst nicht.

Warum das Layout nicht mitkommt

Reiner Text ist eine Folge von Zeichen und sonst nichts. Er kennt keine Spalte, keine Tabelle, keine Überschrift, keine Seite und keine Schrift. Ein PDF zu Text zu machen ist also absichtlich verlustbehaftet — das ist nicht die Einschränkung, sondern genau das Bestellte.

Die Folgen sind absehbar. Ein zweispaltiger Aufsatz kommt als eine durchgehende Folge heraus, linke Spalte vor rechter statt zeilenweise verschränkt. Eine Tabelle wird zu ihren Zellen als Wörtern, ohne das Raster, das ihnen Bedeutung gab. Kopf- und Fußzeilen erscheinen auf jeder Seite mitten im Fluss.

Wo die Wortreihenfolge kippen kann

Ein PDF speichert keine Sätze und keine Absätze. Es speichert Anweisungen der Art „zeichne diese Zeichen an diese Stelle", und die Reihenfolge dieser Anweisungen ist meist, aber nicht zwingend, die Lesereihenfolge.

Aufwendig gestaltete Seiten sind der Fall, in dem es bricht: ein Magazinlayout mit einem Zitat mitten in der Spalte, ein Formular mit Feldern um Beschriftungen herum, ein Rundbrief mit Kästen. Das kann verschränkt herauskommen, weil die Datei tatsächlich nicht festhält, was zuerst gelesen werden soll. Diese Information wurde nie aufgeschrieben.

Warum es hier mehr zählt als anderswo, dass das im Browser läuft

Sieh dir an, woraus Leute Text herausholen. Verträge, Mietverträge, Arztbriefe, Kontoauszüge, Rechnungen, unveröffentlichte Manuskripte, Aufsätze im Begutachtungsverfahren. Die Kategorie neigt ungewöhnlich stark zu Dokumenten, deren Inhalt genau eine Person etwas angeht.

Jeder andere Textextraktor im Netz verlangt einen Upload. Dieser liest die Datei mit pdf.js — der Engine, mit der Firefox PDFs anzeigt, quelloffen und Apache-lizenziert — in der Seite, die du ohnehin offen hast. Und du kannst es prüfen statt es zu glauben: Entwicklerwerkzeuge öffnen, Netzwerk-Tab beobachten, etwas umwandeln.

Wenn der Text in ein Sprachmodell soll

Das ist einer der häufigen Gründe geworden, und reiner Text ist dafür das richtige Format. Modelle lesen Text; von Schriften und Positionen eines PDF haben sie nichts, und ein PDF in ein Chatfenster zu ziehen heißt meist, dass das Werkzeug diese Umwandlung für dich gemacht hat, nur unsorgfältiger.

Zwei Dinge helfen. Wandle das ganze Dokument um statt Bildschirmfotos einzelner Seiten, denn Text ist exakt, wo ein Bild erkannt werden muss. Und sieh dir den Anfang der Ausgabe an: Ist die erste Seite ein Deckblatt mit einem Titel, beginnt der Text mit sehr wenig — ein Zeichen dafür, dass es funktioniert hat, nicht dass es gescheitert ist.

Ligaturen, Trennstriche und andere Eigenheiten

Die Extraktion ist exakt in dem, was die Datei sagt — was gelegentlich heißt, exakt in etwas Merkwürdigem zu sein. Ein am Zeilenende getrenntes Wort behält seinen Trennstrich. Manche Dokumente kodieren fi und fl als ein Zeichen, und so kommen sie an.

Das ist kein Schaden, sondern eine treue Wiedergabe. Ein Suchen-und-Ersetzen über die Ausgabe erledigt die Trennstriche, und mit den Ligaturen kommen die meisten Editoren und Sprachmodelle ungefragt zurecht.

Zeichensatz, und was für eine Datei du bekommst

Die Ausgabe ist UTF-8, und das willst du praktisch immer: Umlaute, Griechisch, Kyrillisch, Japanisch und Emoji in einer Datei, lesbar für jedes aktuelle Programm.

Die eine Stelle, an der es hakt, ist ältere Windows-Software, und Excel ist der übliche Verdächtige — ein Doppelklick auf eine Text- oder CSV-Datei lässt es eine alte Codepage raten. Über Daten, Aus Text/CSV zu importieren und dort UTF-8 zu wählen behebt es, ebenso wie sie in fast irgendetwas anderem zu öffnen.

Wie du trotzdem an den Text eines Scans kommst

Hat der Markiertest ein Bild gezeigt, kann diese Seite nicht helfen, und das zu sagen ist besser, als eine leere Datei zurückzugeben. Texterkennung ist ein anderer Vorgang mit einer anderen Fehlerart: Sie scheitert nicht laut, sie rät leise falsch.

Die realistischen Wege sind die Erkennung deines Betriebssystems — macOS und aktuelle Windows-Versionen holen Text aus einem Bild — oder ein eigenes OCR-Programm. Was immer du nimmst, lies das Ergebnis, bevor du ihm traust: Eine falsch erkannte Ziffer in einer Rechnung sieht genauso aus wie eine richtige.

Wie groß ein Dokument sein darf

Die Extraktion ist schnell, weil sie Struktur liest statt etwas zu zeichnen. Ein paar hundert Seiten sind unauffällig, und der Aufwand hängt ungefähr an der Textmenge, nicht an der Dateigröße.

Langsam wird es bei einem Dokument, das groß ist, weil es voller Bilder steckt — die müssen trotzdem überlesen werden. Eine 200 MB große gescannte Broschüre braucht einen Moment und liefert dann, völlig richtig, fast keinen Text. Das ist der Markiertest, nur auf dem langsamen Weg.

PDF in TXT umwandeln — so geht es

  1. Leg deine PDF-Datei auf dieser Seite ab, oder klick, um eine auszuwählen.
  2. Wähl TXT als Ziel. Die Umwandlung läuft in deinem Browser, die Datei wird nicht hochgeladen.
  3. Lade die fertige TXT-Datei herunter.

PDF und TXT im Vergleich: was sich ändert

PDF im Vergleich zu TXT
PDFTXT
Vollständiger NamePortable Document FormatReiner Text
Dateiendung.pdf.txt, .text, .log
Medientypapplication/pdftext/plain
KompressionBeides, je nach Einstellung
Erstmals veröffentlicht19931963
Herausgegeben vonAdobe
SpezifikationISO 32000-2Unicode
LizenzlageOffener StandardOffener Standard
Heutiger StandAktuellAktuell
Kann Farbe beschreiben alsRGB, CMYK, Graustufen
Öffnet im BrowserJeder BrowserJeder Browser
Stattdessen erwogenDOCX, HTMLMD, RTF

Was das Zielformat zusätzlich kann

TXT ist ein Arbeitsformat, PDF ein fertiges. Zurück kommt bearbeitbarer Text statt eines Bildes der Seite — meist der Grund für die Umwandlung und zugleich ihre Grenze.

Das Ergebnis öffnen

Die üblichen Programme überschneiden sich nicht: PDF öffnest du in Adobe Acrobat, Preview und LibreOffice Draw, TXT in Notepad, TextEdit und Visual Studio Code — wer das Ergebnis bekommt, braucht also eines aus der zweiten Reihe.

Wofür die beiden Formate gedacht sind

PDF stammt von Adobe und wurde 1993 veröffentlicht. Festgehalten ist das in ISO 32000-2 — lohnt sich zu kennen, wenn die Datei das Programm überleben soll, das sie geschrieben hat.

TXT stammt aus 1963, festgehalten in Unicode. Notepad, TextEdit und Visual Studio Code lesen das Format.

TXT wurde 1963 veröffentlicht, PDF 1993. Das ältere ist in der Regel die sicherere Datei zum Weitergeben, das jüngere erledigt dieselbe Aufgabe mit weniger Bytes.

PDF zu TXT: häufige Fragen

Werden meine PDF-Dateien irgendwo hochgeladen?

Nein. Diese Umwandlung läuft vollständig in deinem Browser, die Datei verlässt dein Gerät also nicht. Du kannst das selbst nachprüfen: Öffne den Netzwerk-Tab der Entwicklerwerkzeuge und wandle etwas um. Zu sehen sind die Seite selbst und die Statistik- und Werbeanfragen, mit denen dieser Dienst bezahlt wird — und keine einzige, die deine Datei trägt. Hinter genau diesem Paar steckt PDF.js, Mozillas PDF-Engine, die auch Firefox selbst benutzt; dein Browser lädt das einmal und behält es dann.

Ist das Umwandeln von PDF in TXT kostenlos?

Ja. Kein Konto, kein Wasserzeichen und kein Tageskontingent, das sich verbraucht — es läuft auf deinem eigenen Rechner, du darfst also so oft wiederkommen, wie du willst. Dateien bis 100 MB verarbeitet der Browser, 100 auf einmal. PDF.js wird auf deinen Rechner geladen und läuft dort — deshalb gibt es dafür keine Zählung.

Geht beim Umwandeln von PDF in TXT Qualität verloren?

PDF und TXT beschreiben Inhalte auf grundverschiedene Weise. Die Umwandlung ist deshalb ein Nachbau und keine Kopie: originalgetreu, aber nicht Byte für Byte dasselbe. Funktioniert nur bei PDFs mit Textebene. Scans kommen leer heraus und brauchen stattdessen Texterkennung.

Lässt sich die TXT-Datei danach bearbeiten?

TXT ist ein Arbeitsformat, PDF ein fertiges. Zurück kommt bearbeitbarer Text statt eines Bildes der Seite — meist der Grund für die Umwandlung und zugleich ihre Grenze.

Mehr über diese Formate

Woher diese Zahlen stammen

Was diese Seite über PDF und TXT behauptet, lässt sich nachprüfen — hier stehen die Dokumente, die es festlegen.