Cómo extraer el texto de un PDF escaneado
- 1
Haz clic en Elegir archivo o arrastra un PDF escaneado o una imagen (JPG, PNG, WebP) al recuadro (hasta 100 MB).
- 2
Elige el Idioma del documento: English, Français, Español, Deutsch, Português o Italiano.
- 3
Haz clic en Convertir. La primera vez, tu navegador descarga el motor de OCR y los datos del idioma y los guarda en caché.
- 4
Cuando termina el reconocimiento, el archivo de texto se descarga automáticamente.
Los PDF escaneados necesitan OCR
Cuando escaneas un papel o fotografías una página, el resultado es una imagen, aunque se guarde como PDF. No puedes buscar en ella, copiar texto ni convertirla a Word. El OCR analiza la forma de las letras y reconstruye el texto.
TurboConvert usa Tesseract, un motor de OCR de código abierto muy extendido, compilado para funcionar en tu navegador. Elegir bien el idioma importa: permite al motor reconocer los caracteres con tilde (á, é, ñ, ü, ç…) y las palabras habituales de ese idioma.
Cómo conseguir el mejor reconocimiento
| Factor | Bien | Problemático |
|---|---|---|
| Resolución | Escaneos a 300 ppp, fotos nítidas con el teléfono | Imágenes pequeñas, muy comprimidas o borrosas |
| Alineación | Páginas rectas | Páginas inclinadas o giradas |
| Contraste | Texto negro sobre papel blanco | Impresión desvaída, fondos de color, sombras |
| Contenido | Texto impreso | Letra manuscrita, fuentes decorativas, texto sobre imágenes |
Consejos prácticos:
- Endereza primero los escaneos torcidos con Girar PDF; el OCR funciona mejor con páginas derechas.
- ¿Fotografías un documento? Sostén el teléfono paralelo a la página, con buena luz, y llena el encuadre con el texto.
- ¿Solo necesitas algunas páginas? Extráelas con Dividir PDF para ahorrar tiempo en documentos largos.
- Elige el idioma del documento, no el tuyo: una carta en inglés escaneada en Madrid debe leerse con English.
¿OCR, PDF a texto o PDF a Word?
| Tu archivo | Mejor herramienta | Por qué |
|---|---|---|
| PDF escaneado, foto de una página, captura de pantalla | OCR PDF | El texto solo existe como píxeles |
| PDF digital, solo necesitas las palabras | PDF a texto | Texto exacto, al instante, sin errores de reconocimiento |
| PDF digital, quieres editarlo con formato | PDF a Word | Conserva títulos, estilos e imágenes |
El texto reconocido está listo para pegar en un correo o un documento. Si necesitas un documento con formato, pégalo en Word o Google Docs.
Problemas frecuentes y soluciones
El resultado está lleno de caracteres sin sentido. Probablemente la página está girada, tiene muy poca resolución o el idioma elegido no es el correcto. Endereza la página, usa un escaneo más nítido y elige el idioma del documento.
Algunas palabras están mal. Busca caracteres parecidos: «l» y «1», «O» y «0», «rn» y «m» son confusiones clásicas del OCR, sobre todo en letra pequeña. Una revisión rápida las corrige.
Las columnas se mezclan. En páginas a varias columnas, como los periódicos, se pueden juntar líneas de columnas vecinas. Recorta cada columna en su propia imagen antes de pasar el OCR.
Tarda mucho. Cada página se analiza por separado. Procesa solo las páginas que necesitas y usa una computadora para documentos de más de unas pocas decenas de páginas.