PDF-OCR
Mache gescannte PDF per OCR durchsuchbar.
So verwendest du PDF-OCR
Lade das gescannte oder reine Bild-PDF hoch.
Wähle die Sprache des Dokumenttextes.
Klicke auf OCR starten, um den Text auf allen Seiten zu erkennen.
Lade das PDF mit durchsuchbarem Text herunter.
PDF durchsuchbar machen: was OCR eigentlich tut
Ein gescanntes PDF sieht aus wie ein Dokument, verhält sich aber wie ein Fotoalbum: Jede Seite ist ein Bild, und für den Computer steht darauf — nichts. Deshalb findet Strg+F keine Treffer, deshalb lässt sich kein Satz kopieren, deshalb kann kein Konverter Text herausholen. OCR (optische Zeichenerkennung) analysiert das Seitenbild, erkennt die Buchstaben darin und legt eine unsichtbare Textebene exakt hinter die Schrift im Bild.
Das Ergebnis sieht aus wie vorher — dasselbe Scanbild, Stempel und Unterschriften inklusive — verhält sich aber endlich wie ein Dokument: durchsuchbar, kopierbar, für Screenreader lesbar und als Grundlage für jede weitere Umwandlung brauchbar. "PDF lesbar machen" heißt technisch genau das: dem Bild eine Textebene geben.
Was die Erkennungsqualität bestimmt
OCR kann nur lesen, was der Scan hergibt. Ein gerader Scan mit 300 dpi und sauberem Druck wird nahezu fehlerfrei erkannt; ein schiefes Handyfoto bei Schummerlicht produziert Ratewerk. Wenn du das Original noch hast, ist ein besserer Scan der wirksamste Hebel — wirksamer als jedes Nachbearbeiten. Handschrift bleibt für klassische Texterkennung weitgehend außer Reichweite; sie ist für gedruckten Text gebaut.
Wichtig zu wissen: Die Textebene liegt hinter dem Bild, sie ersetzt es nicht. Erkennungsfehler ändern also nie, was auf der Seite zu sehen ist — nur, was die Suche findet. Bei wichtigen Dokumenten lohnt eine Stichprobe: nach zwei, drei Begriffen suchen, die sicher vorkommen, und prüfen, ob sie gefunden werden.
Texterkennung im Browser statt auf fremden Servern
Die Erkennung übernimmt Tesseract, eine der meistgenutzten OCR-Engines überhaupt — hier zu WebAssembly kompiliert, damit sie direkt in deinem Browser läuft. Der komplette Vorgang läuft in deinem Browser ab, mit den WebAssembly- und Canvas-Schnittstellen, die dein Gerät ohnehin mitbringt. Es wird keine Datei hochgeladen, es bleibt keine Kopie zurück und nichts wartet auf einem fremden Server auf seine Löschung — deshalb funktioniert das Werkzeug sogar ohne Internetverbindung.
Gescannt werden nun einmal die heikelsten Papiere: Arztbriefe, Verträge, Bescheide, alte Personalakten. Dass die Zeichenerkennung lokal läuft, heißt, dass keine dieser Seiten je einen fremden Server sieht — der übliche Preis von "kostenlosen" Online-OCR-Diensten entfällt hier ersatzlos.
Häufige Fragen
Wie mache ich ein gescanntes PDF durchsuchbar?
Mit OCR: Die Texterkennung liest die Seitenbilder, erkennt die Buchstaben und legt eine unsichtbare Textebene dahinter. Danach funktionieren Suche, Kopieren und Screenreader — das Erscheinungsbild der Seiten bleibt unverändert.
Warum kann ich in meinem PDF keinen Text markieren?
Weil es ein Scan ist: Die Seiten sind Fotos ohne Textinformation. Genau das behebt OCR — nach der Erkennung lässt sich der Text markieren und kopieren.
Erkennt die Texterkennung auch Handschrift?
Praktisch nicht — klassische OCR ist für gedruckten Text gebaut. Gedruckte Dokumente, auch ältere, werden bei ordentlicher Scanqualität dagegen zuverlässig erkannt.
Wird mein gescanntes Dokument hochgeladen?
Nein. Die Erkennung läuft mit Tesseract, kompiliert zu WebAssembly, direkt in deinem Browser — deine Scans bleiben auf deinem Gerät.
Ähnliche Tools
Suchst du etwas anderes? Entdecke alle pdf-tools.