Come estrarre il testo da un PDF
- 1
Fai clic su Scegli i file oppure trascina uno o più PDF nel riquadro qui sopra.
- 2
Fai clic su Converti. Viene estratto il testo di tutte le pagine.
- 3
Il file .txt si scarica automaticamente. Con più PDF, scarica ogni file oppure usa Scarica tutto (ZIP).
Perché estrarre il testo semplice?
Copiare e incollare da un lettore PDF è noioso sui documenti lunghi, e spesso spezza le righe, mescola intestazioni e piè di pagina o salta delle pagine. Estrarre il testo in un colpo solo ti dà un file .txt pulito che qualsiasi programma può aprire. Utile per:
- Citare o riutilizzare contenuti in un’email, una relazione o un sito web.
- Tradurre: incolla in un traduttore senza che l’impaginazione ti intralci.
- Cercare e analizzare: trova termini in più documenti, conta le parole, elabora il testo con script.
- Assistenti IA e strumenti di riassunto: molti accettano il testo semplice in modo più affidabile dei PDF.
- Accessibilità: il testo semplice funziona con gli screen reader e i lettori di e-book più semplici.
Il mio PDF è digitale o scansionato?
Aprilo e prova a selezionare una sola parola con il cursore:
| Cosa succede | Tipo di PDF | Cosa usare |
|---|---|---|
| Riesci a evidenziare parole e righe | PDF digitale con livello di testo | PDF in testo (questo strumento) |
| Si seleziona tutta la pagina come un blocco, o niente | PDF scansionato / immagine | OCR PDF |
Consigli
- Ti servono le tabelle come tabelle? Il testo semplice le appiattisce. PDF in Excel mantiene righe e colonne.
- Le parole sillabate a fine riga escono come appaiono nel PDF; un rapido «trova e sostituisci» del trattino seguito da un a capo le sistema.
- Ti serve solo una parte di un PDF lungo? Estrai prima le pagine utili con Dividere PDF.
Il PDF viene letto nel tuo browser e non viene mai caricato, quindi estrarre il testo da contratti o relazioni interne è sicuro.
Problemi frequenti e soluzioni
Il file .txt è vuoto o quasi. Il PDF non ha un livello di testo: tipico di scansioni, foto salvate come PDF e alcuni fax. L’OCR è l’unico modo per ricavarne il testo.
Simboli strani al posto delle lettere. Alcuni PDF usano font con una codifica interna non standard, quindi il testo non può essere decodificato correttamente anche se a schermo sembra a posto. In questi casi l’OCR della pagina di solito restituisce un testo leggibile.
Parole o righe in un ordine strano. Un PDF memorizza il testo nell’ordine in cui è stato disegnato, che nelle impaginazioni complesse (colonne, riquadri laterali, didascalie) non sempre coincide con l’ordine di lettura. I paragrafi ci sono tutti, ma potrebbero andare riordinati.
Intestazioni e piè di pagina si ripetono su ogni pagina. Intestazioni, numeri di pagina e piè di pagina sono testo vero nel PDF, quindi vengono estratti anche loro. Un «trova e sostituisci» nell’editor di testo li elimina in fretta.
Contano solo alcune pagine. Le relazioni lunghe producono file di testo lunghi. Estrai prima le pagine che ti servono con Dividere PDF, poi converti solo quelle.