Come estrarre il testo da un PDF scansionato
- 1
Fai clic su Scegli un file oppure trascina un PDF scansionato o un’immagine (JPG, PNG, WebP) nel riquadro qui sopra.
- 2
Scegli la Lingua del documento: inglese, francese, spagnolo, tedesco, portoghese o italiano.
- 3
Fai clic su Converti. La prima volta il browser scarica il motore OCR e i dati della lingua, poi li tiene in cache.
- 4
Al termine del riconoscimento, il file di testo si scarica automaticamente.
I PDF scansionati hanno bisogno dell’OCR
Quando scansioni un foglio o fotografi una pagina, il risultato è un’immagine, anche se viene salvata come PDF. Non puoi cercarci dentro, copiarne il testo né convertirla in Word. L’OCR analizza la forma delle lettere e ricostruisce il testo.
TurboConvert usa Tesseract, un motore OCR open source molto diffuso, compilato per girare nel tuo browser. Scegliere la lingua giusta è importante: permette al motore di riconoscere i caratteri accentati (à, è, é, ì, ò, ù…) e le parole più comuni di quella lingua.
Ottenere il riconoscimento migliore
| Fattore | Bene | Problematico |
|---|---|---|
| Risoluzione | Scansioni a 300 dpi, foto nitide dal telefono | Immagini piccole, compresse o sfocate |
| Allineamento | Pagine dritte | Pagine storte o ruotate |
| Contrasto | Testo nero su carta bianca | Stampa sbiadita, sfondi colorati, ombre |
| Contenuto | Testo stampato | Scrittura a mano, font decorativi, testo sopra immagini |
Consigli pratici:
- Raddrizza prima le scansioni di lato con Ruotare PDF: l’OCR funziona meglio sulle pagine dritte.
- Fotografi un documento? Tieni il telefono parallelo al foglio, con buona luce, e riempi l’inquadratura con il testo.
- Ti servono solo alcune pagine? Estraile con Dividere PDF per risparmiare tempo sui documenti lunghi.
- Scegli la lingua del documento, non la tua: una lettera in inglese scansionata a Milano va comunque letta in inglese.
OCR, PDF in testo o PDF in Word?
| Il tuo file | Strumento migliore | Perché |
|---|---|---|
| PDF scansionato, foto di una pagina, screenshot | OCR PDF | Il testo esiste solo come pixel |
| PDF digitale, ti servono solo le parole | PDF in testo | Testo esatto, immediato, senza errori di riconoscimento |
| PDF digitale da modificare con la formattazione | PDF in Word | Mantiene titoli, stili e immagini |
Il testo riconosciuto è pronto da incollare in un’email o in un documento. Se ti serve un documento formattato, incollalo in Word o Google Documenti.
Problemi frequenti e soluzioni
Il risultato è pieno di caratteri senza senso. Probabilmente la pagina è ruotata, ha una risoluzione molto bassa o è selezionata la lingua sbagliata. Raddrizza la pagina, usa una scansione più nitida e scegli la lingua del documento.
Alcune parole sono sbagliate. Controlla i caratteri simili: «l» e «1», «O» e «0», «rn» e «m» sono confusioni classiche dell’OCR, soprattutto con caratteri piccoli. Una rilettura veloce le corregge.
Le colonne si mescolano. Nelle pagine a più colonne, come i giornali, le righe di colonne vicine possono essere unite. Ritaglia ogni colonna in un’immagine separata prima di avviare l’OCR.
Ci mette molto tempo. Ogni pagina viene analizzata singolarmente. Elabora solo le pagine che ti servono davvero e, per documenti di più di qualche decina di pagine, preferisci un computer.