OCR: estrarre il testo da PDF scansionati

Riconosci il testo in PDF scansionati, foto di documenti e screenshot, e ottienilo come testo modificabile. L’OCR gira sul tuo dispositivo con il motore Tesseract: i file non vengono mai caricati.

Trascina qui la tua scansione

oppure trascina e rilascia · PDF, JPG, PNG, WEBP · fino a 100 MB

    Opzioni

    Elaborazione…

    Al primo utilizzo viene scaricato il motore di conversione (≈ 5 MB). Poi resta nella cache del browser.

    Fatto!

      Elaborato sul tuo dispositivo. Nessun caricamento. · Gratis · Senza registrazione · Senza filigrana

      Come estrarre il testo da un PDF scansionato

      1. 1

        Fai clic su Scegli un file oppure trascina un PDF scansionato o un’immagine (JPG, PNG, WebP) nel riquadro qui sopra.

      2. 2

        Scegli la Lingua del documento: inglese, francese, spagnolo, tedesco, portoghese o italiano.

      3. 3

        Fai clic su Converti. La prima volta il browser scarica il motore OCR e i dati della lingua, poi li tiene in cache.

      4. 4

        Al termine del riconoscimento, il file di testo si scarica automaticamente.

      I PDF scansionati hanno bisogno dell’OCR

      Quando scansioni un foglio o fotografi una pagina, il risultato è un’immagine, anche se viene salvata come PDF. Non puoi cercarci dentro, copiarne il testo né convertirla in Word. L’OCR analizza la forma delle lettere e ricostruisce il testo.

      TurboConvert usa Tesseract, un motore OCR open source molto diffuso, compilato per girare nel tuo browser. Scegliere la lingua giusta è importante: permette al motore di riconoscere i caratteri accentati (à, è, é, ì, ò, ù…) e le parole più comuni di quella lingua.

      Ottenere il riconoscimento migliore

      FattoreBeneProblematico
      RisoluzioneScansioni a 300 dpi, foto nitide dal telefonoImmagini piccole, compresse o sfocate
      AllineamentoPagine drittePagine storte o ruotate
      ContrastoTesto nero su carta biancaStampa sbiadita, sfondi colorati, ombre
      ContenutoTesto stampatoScrittura a mano, font decorativi, testo sopra immagini

      Consigli pratici:

      • Raddrizza prima le scansioni di lato con Ruotare PDF: l’OCR funziona meglio sulle pagine dritte.
      • Fotografi un documento? Tieni il telefono parallelo al foglio, con buona luce, e riempi l’inquadratura con il testo.
      • Ti servono solo alcune pagine? Estraile con Dividere PDF per risparmiare tempo sui documenti lunghi.
      • Scegli la lingua del documento, non la tua: una lettera in inglese scansionata a Milano va comunque letta in inglese.

      OCR, PDF in testo o PDF in Word?

      Il tuo fileStrumento migliorePerché
      PDF scansionato, foto di una pagina, screenshotOCR PDFIl testo esiste solo come pixel
      PDF digitale, ti servono solo le parolePDF in testoTesto esatto, immediato, senza errori di riconoscimento
      PDF digitale da modificare con la formattazionePDF in WordMantiene titoli, stili e immagini

      Il testo riconosciuto è pronto da incollare in un’email o in un documento. Se ti serve un documento formattato, incollalo in Word o Google Documenti.

      Problemi frequenti e soluzioni

      Il risultato è pieno di caratteri senza senso. Probabilmente la pagina è ruotata, ha una risoluzione molto bassa o è selezionata la lingua sbagliata. Raddrizza la pagina, usa una scansione più nitida e scegli la lingua del documento.

      Alcune parole sono sbagliate. Controlla i caratteri simili: «l» e «1», «O» e «0», «rn» e «m» sono confusioni classiche dell’OCR, soprattutto con caratteri piccoli. Una rilettura veloce le corregge.

      Le colonne si mescolano. Nelle pagine a più colonne, come i giornali, le righe di colonne vicine possono essere unite. Ritaglia ogni colonna in un’immagine separata prima di avviare l’OCR.

      Ci mette molto tempo. Ogni pagina viene analizzata singolarmente. Elabora solo le pagine che ti servono davvero e, per documenti di più di qualche decina di pagine, preferisci un computer.

      Domande e risposte

      Che cos’è l’OCR?
      L’OCR (riconoscimento ottico dei caratteri) trasforma un’immagine di testo (una scansione, una foto o uno screenshot) in testo vero che puoi copiare, cercare e modificare. Senza OCR, un PDF scansionato è solo una serie di immagini.
      Come capisco se il mio PDF ha bisogno dell’OCR?
      Prova a selezionare una parola nel PDF. Se non ci riesci, o si evidenzia tutta la pagina come un blocco, il PDF è scansionato e serve l’OCR. Se riesci a selezionare le parole, PDF in testo è più veloce ed esatto.
      Quanto è preciso l’OCR?
      Sui documenti stampati e puliti la maggior parte del testo viene riconosciuta correttamente, ma nessun OCR è perfetto. Rileggi sempre nomi, numeri e importi prima di farci affidamento.
      Riesce a leggere la scrittura a mano?
      Non in modo affidabile. Il motore è pensato per il testo stampato; lo stampatello ordinato a volte funziona, il corsivo di solito no.
      Perché la prima volta è lento?
      Il browser scarica prima il motore OCR e i dati della tua lingua. Poi restano in cache, quindi le volte successive si parte molto più in fretta.
      Le mie scansioni vengono caricate?
      No. Il riconoscimento avviene interamente nel tuo browser. Scansioni di documenti d’identità, referti medici o contratti non lasciano mai il tuo dispositivo.