Text aus einem gescannten PDF erkennen: So geht’s
- 1
Klicken Sie auf Datei auswählen oder ziehen Sie ein gescanntes PDF oder ein Bild (JPG, PNG, WebP) in das Feld oben.
- 2
Wählen Sie die Sprache des Dokuments – Englisch, Französisch, Spanisch, Deutsch, Portugiesisch oder Italienisch.
- 3
Klicken Sie auf Umwandeln. Beim ersten Mal werden die OCR-Engine und die Sprachdaten geladen und von Ihrem Browser zwischengespeichert.
- 4
Sobald die Erkennung abgeschlossen ist, wird die Textdatei automatisch heruntergeladen.
Gescannte PDFs brauchen OCR
Wenn Sie Papier scannen oder eine Seite fotografieren, ist das Ergebnis ein Bild – auch wenn es als PDF gespeichert ist. Sie können es nicht durchsuchen, nichts daraus kopieren und es nicht in Word umwandeln. OCR analysiert die Formen der Buchstaben und baut den Text wieder auf.
TurboConvert nutzt Tesseract, eine weit verbreitete Open-Source-OCR-Engine, die für den Browser kompiliert ist. Die richtige Sprache zu wählen, ist wichtig: Erst dann erkennt die Engine Sonderzeichen wie ä, ö, ü und ß zuverlässig und kennt die häufigen Wörter der Sprache.
So wird die Erkennung am besten
| Faktor | Gut | Problematisch |
|---|---|---|
| Auflösung | Scans mit 300 dpi, scharfe Handyfotos | Kleine, stark komprimierte oder unscharfe Bilder |
| Ausrichtung | Gerade Seiten | Schiefe oder gedrehte Seiten |
| Kontrast | Schwarzer Text auf weißem Papier | Verblasster Druck, farbiger Hintergrund, Schatten |
| Inhalt | Gedruckter Fließtext | Handschrift, Zierschriften, Text auf Bildern |
Praktische Tipps:
- Quer liegende Scans zuerst drehen mit PDF drehen; OCR funktioniert am besten auf aufrechten Seiten.
- Dokument abfotografieren? Halten Sie das Smartphone parallel zur Seite, sorgen Sie für gutes Licht und füllen Sie das Bild mit dem Text.
- Nur einige Seiten nötig? Extrahieren Sie sie mit PDF teilen und sparen Sie bei langen Dokumenten Zeit.
- Wählen Sie die Sprache des Dokuments, nicht Ihre eigene: Ein englischer Brief, der in Berlin gescannt wurde, wird trotzdem mit Englisch gelesen.
OCR, PDF in Text oder PDF in Word?
| Ihre Datei | Das passende Tool | Warum |
|---|---|---|
| Gescanntes PDF, Foto einer Seite, Screenshot | OCR PDF | Der Text existiert nur als Pixel |
| Digitales PDF, Sie brauchen nur die Wörter | PDF in Text | Exakter Text, sofort, ohne Erkennungsfehler |
| Digitales PDF, Sie möchten mit Formatierung bearbeiten | PDF in Word | Behält Überschriften, Formatvorlagen und Bilder |
Der erkannte Text lässt sich direkt in eine E-Mail oder ein Dokument einfügen. Brauchen Sie ein formatiertes Dokument, fügen Sie ihn in Word oder Google Docs ein.
Häufige Probleme und Lösungen
Das Ergebnis ist voller unsinniger Zeichen. Wahrscheinlich ist die Seite gedreht, die Auflösung sehr niedrig oder die falsche Sprache gewählt. Richten Sie die Seite aus, nehmen Sie einen schärferen Scan und wählen Sie die Sprache des Dokuments.
Einzelne Wörter sind falsch. Achten Sie auf ähnlich aussehende Zeichen – „l“ und „1“, „O“ und „0“, „rn“ und „m“ sind klassische OCR-Verwechslungen, besonders bei kleiner Schrift. Ein kurzes Korrekturlesen behebt sie.
Spalten werden vermischt. Bei mehrspaltigen Seiten wie Zeitungsartikeln können Zeilen benachbarter Spalten zusammengeführt werden. Schneiden Sie jede Spalte als eigenes Bild zu, bevor Sie die Texterkennung starten.
Es dauert lange. Jede Seite wird einzeln analysiert. Verarbeiten Sie nur die Seiten, die Sie wirklich brauchen, und nutzen Sie für Dokumente mit mehr als ein paar Dutzend Seiten lieber einen Computer.