OCR – Text aus gescannten PDFs erkennen

Erkennen Sie den Text in gescannten PDFs, Fotos von Dokumenten und Screenshots und erhalten Sie ihn als bearbeitbaren Text. Die Texterkennung läuft mit der Tesseract-Engine auf Ihrem Gerät – Ihre Dateien werden nie hochgeladen.

Ihren Scan hier ablegen

oder per Drag & Drop · PDF, JPG, PNG, WEBP · bis 100 MB

    Optionen

    Wird verarbeitet …

    Beim ersten Mal wird die Konvertierungs-Engine geladen (≈ 5 MB). Danach speichert Ihr Browser sie im Cache.

    Fertig!

      Wird auf Ihrem Gerät verarbeitet. Kein Upload. · Kostenlos · Ohne Anmeldung · Ohne Wasserzeichen

      Text aus einem gescannten PDF erkennen: So geht’s

      1. 1

        Klicken Sie auf Datei auswählen oder ziehen Sie ein gescanntes PDF oder ein Bild (JPG, PNG, WebP) in das Feld oben.

      2. 2

        Wählen Sie die Sprache des Dokuments – Englisch, Französisch, Spanisch, Deutsch, Portugiesisch oder Italienisch.

      3. 3

        Klicken Sie auf Umwandeln. Beim ersten Mal werden die OCR-Engine und die Sprachdaten geladen und von Ihrem Browser zwischengespeichert.

      4. 4

        Sobald die Erkennung abgeschlossen ist, wird die Textdatei automatisch heruntergeladen.

      Gescannte PDFs brauchen OCR

      Wenn Sie Papier scannen oder eine Seite fotografieren, ist das Ergebnis ein Bild – auch wenn es als PDF gespeichert ist. Sie können es nicht durchsuchen, nichts daraus kopieren und es nicht in Word umwandeln. OCR analysiert die Formen der Buchstaben und baut den Text wieder auf.

      TurboConvert nutzt Tesseract, eine weit verbreitete Open-Source-OCR-Engine, die für den Browser kompiliert ist. Die richtige Sprache zu wählen, ist wichtig: Erst dann erkennt die Engine Sonderzeichen wie ä, ö, ü und ß zuverlässig und kennt die häufigen Wörter der Sprache.

      So wird die Erkennung am besten

      FaktorGutProblematisch
      AuflösungScans mit 300 dpi, scharfe HandyfotosKleine, stark komprimierte oder unscharfe Bilder
      AusrichtungGerade SeitenSchiefe oder gedrehte Seiten
      KontrastSchwarzer Text auf weißem PapierVerblasster Druck, farbiger Hintergrund, Schatten
      InhaltGedruckter FließtextHandschrift, Zierschriften, Text auf Bildern

      Praktische Tipps:

      • Quer liegende Scans zuerst drehen mit PDF drehen; OCR funktioniert am besten auf aufrechten Seiten.
      • Dokument abfotografieren? Halten Sie das Smartphone parallel zur Seite, sorgen Sie für gutes Licht und füllen Sie das Bild mit dem Text.
      • Nur einige Seiten nötig? Extrahieren Sie sie mit PDF teilen und sparen Sie bei langen Dokumenten Zeit.
      • Wählen Sie die Sprache des Dokuments, nicht Ihre eigene: Ein englischer Brief, der in Berlin gescannt wurde, wird trotzdem mit Englisch gelesen.

      OCR, PDF in Text oder PDF in Word?

      Ihre DateiDas passende ToolWarum
      Gescanntes PDF, Foto einer Seite, ScreenshotOCR PDFDer Text existiert nur als Pixel
      Digitales PDF, Sie brauchen nur die WörterPDF in TextExakter Text, sofort, ohne Erkennungsfehler
      Digitales PDF, Sie möchten mit Formatierung bearbeitenPDF in WordBehält Überschriften, Formatvorlagen und Bilder

      Der erkannte Text lässt sich direkt in eine E-Mail oder ein Dokument einfügen. Brauchen Sie ein formatiertes Dokument, fügen Sie ihn in Word oder Google Docs ein.

      Häufige Probleme und Lösungen

      Das Ergebnis ist voller unsinniger Zeichen. Wahrscheinlich ist die Seite gedreht, die Auflösung sehr niedrig oder die falsche Sprache gewählt. Richten Sie die Seite aus, nehmen Sie einen schärferen Scan und wählen Sie die Sprache des Dokuments.

      Einzelne Wörter sind falsch. Achten Sie auf ähnlich aussehende Zeichen – „l“ und „1“, „O“ und „0“, „rn“ und „m“ sind klassische OCR-Verwechslungen, besonders bei kleiner Schrift. Ein kurzes Korrekturlesen behebt sie.

      Spalten werden vermischt. Bei mehrspaltigen Seiten wie Zeitungsartikeln können Zeilen benachbarter Spalten zusammengeführt werden. Schneiden Sie jede Spalte als eigenes Bild zu, bevor Sie die Texterkennung starten.

      Es dauert lange. Jede Seite wird einzeln analysiert. Verarbeiten Sie nur die Seiten, die Sie wirklich brauchen, und nutzen Sie für Dokumente mit mehr als ein paar Dutzend Seiten lieber einen Computer.

      Fragen & Antworten

      Was ist OCR?
      OCR (optische Zeichenerkennung, auf Deutsch auch Texterkennung) macht aus einem Bild von Text – einem Scan, Foto oder Screenshot – echten Text, den Sie kopieren, durchsuchen und bearbeiten können. Ohne OCR ist ein gescanntes PDF nur eine Sammlung von Bildern.
      Woran erkenne ich, ob mein PDF OCR braucht?
      Versuchen Sie, ein Wort im PDF zu markieren. Geht das nicht oder wird die ganze Seite als Block markiert, ist das PDF gescannt und braucht OCR. Lassen sich Wörter markieren, ist PDF in Text schneller und exakt.
      Wie genau ist die Texterkennung?
      Bei sauberen gedruckten Dokumenten wird der Großteil des Textes korrekt erkannt, aber keine OCR ist perfekt. Prüfen Sie Namen, Zahlen und Beträge immer, bevor Sie sich darauf verlassen.
      Kann sie Handschrift lesen?
      Nicht zuverlässig. Die Engine ist für Drucktext gemacht; saubere Druckbuchstaben klappen manchmal, Schreibschrift meist nicht.
      Warum dauert es beim ersten Mal länger?
      Ihr Browser lädt zuerst die OCR-Engine und die Daten für Ihre Sprache herunter. Danach liegen sie im Cache, spätere Durchläufe starten deutlich schneller.
      Werden meine Scans hochgeladen?
      Nein. Die Erkennung läuft vollständig in Ihrem Browser. Scans von Ausweisen, Arztbriefen oder Verträgen verlassen Ihr Gerät nie.