OCR: extraer el texto de un PDF escaneado

Reconoce el texto de PDF escaneados, fotos de documentos y capturas de pantalla, y obtenlo como texto editable. El OCR se ejecuta en tu dispositivo con el motor Tesseract: tus archivos nunca se suben.

Suelta tu escaneo aquí

o arrastra y suelta · PDF, JPG, PNG, WEBP · hasta 100 MB

    Opciones

    Procesando…

    El primer uso descarga el motor de conversión (≈ 5 MB). Después tu navegador lo guarda en caché.

    ¡Listo!

      Continuar con

      Se procesa en tu dispositivo. No se sube nada. · Gratis · Sin registro · Sin marca de agua

      Cómo extraer el texto de un PDF escaneado

      1. 1

        Haz clic en Elegir archivo o arrastra un PDF escaneado o una imagen (JPG, PNG, WebP) al recuadro (hasta 100 MB).

      2. 2

        Elige el Idioma del documento: English, Français, Español, Deutsch, Português o Italiano.

      3. 3

        Haz clic en Convertir. La primera vez, tu navegador descarga el motor de OCR y los datos del idioma y los guarda en caché.

      4. 4

        Cuando termina el reconocimiento, el archivo de texto se descarga automáticamente.

      Los PDF escaneados necesitan OCR

      Cuando escaneas un papel o fotografías una página, el resultado es una imagen, aunque se guarde como PDF. No puedes buscar en ella, copiar texto ni convertirla a Word. El OCR analiza la forma de las letras y reconstruye el texto.

      TurboConvert usa Tesseract, un motor de OCR de código abierto muy extendido, compilado para funcionar en tu navegador. Elegir bien el idioma importa: permite al motor reconocer los caracteres con tilde (á, é, ñ, ü, ç…) y las palabras habituales de ese idioma.

      Cómo conseguir el mejor reconocimiento

      FactorBienProblemático
      ResoluciónEscaneos a 300 ppp, fotos nítidas con el teléfonoImágenes pequeñas, muy comprimidas o borrosas
      AlineaciónPáginas rectasPáginas inclinadas o giradas
      ContrasteTexto negro sobre papel blancoImpresión desvaída, fondos de color, sombras
      ContenidoTexto impresoLetra manuscrita, fuentes decorativas, texto sobre imágenes

      Consejos prácticos:

      • Endereza primero los escaneos torcidos con Girar PDF; el OCR funciona mejor con páginas derechas.
      • ¿Fotografías un documento? Sostén el teléfono paralelo a la página, con buena luz, y llena el encuadre con el texto.
      • ¿Solo necesitas algunas páginas? Extráelas con Dividir PDF para ahorrar tiempo en documentos largos.
      • Elige el idioma del documento, no el tuyo: una carta en inglés escaneada en Madrid debe leerse con English.

      ¿OCR, PDF a texto o PDF a Word?

      Tu archivoMejor herramientaPor qué
      PDF escaneado, foto de una página, captura de pantallaOCR PDFEl texto solo existe como píxeles
      PDF digital, solo necesitas las palabrasPDF a textoTexto exacto, al instante, sin errores de reconocimiento
      PDF digital, quieres editarlo con formatoPDF a WordConserva títulos, estilos e imágenes

      El texto reconocido está listo para pegar en un correo o un documento. Si necesitas un documento con formato, pégalo en Word o Google Docs.

      Problemas frecuentes y soluciones

      El resultado está lleno de caracteres sin sentido. Probablemente la página está girada, tiene muy poca resolución o el idioma elegido no es el correcto. Endereza la página, usa un escaneo más nítido y elige el idioma del documento.

      Algunas palabras están mal. Busca caracteres parecidos: «l» y «1», «O» y «0», «rn» y «m» son confusiones clásicas del OCR, sobre todo en letra pequeña. Una revisión rápida las corrige.

      Las columnas se mezclan. En páginas a varias columnas, como los periódicos, se pueden juntar líneas de columnas vecinas. Recorta cada columna en su propia imagen antes de pasar el OCR.

      Tarda mucho. Cada página se analiza por separado. Procesa solo las páginas que necesitas y usa una computadora para documentos de más de unas pocas decenas de páginas.

      Preguntas y respuestas

      ¿Qué es el OCR?
      El OCR (reconocimiento óptico de caracteres) convierte una imagen de texto —un escaneo, una foto o una captura— en texto real que puedes copiar, buscar y editar. Sin él, un PDF escaneado no es más que un conjunto de imágenes.
      ¿Cómo sé si mi PDF necesita OCR?
      Intenta seleccionar una palabra del PDF. Si no puedes, o se resalta toda la página como un bloque, el PDF está escaneado y necesita OCR. Si puedes seleccionar palabras, PDF a texto es más rápido y exacto.
      ¿Qué tan preciso es el OCR?
      En documentos impresos limpios, la mayor parte del texto se reconoce bien, pero ningún OCR es perfecto. Revisa siempre nombres, cifras e importes antes de fiarte de ellos.
      ¿Puede leer letra manuscrita?
      No de forma fiable. El motor está pensado para texto impreso; las mayúsculas escritas con cuidado a veces funcionan, pero la letra cursiva normalmente no.
      ¿Por qué tarda más la primera vez?
      Tu navegador descarga primero el motor de OCR y los datos de tu idioma. Después quedan en caché, así que las siguientes veces empieza mucho más rápido.
      ¿Se suben mis escaneos?
      No. El reconocimiento se hace por completo en tu navegador. Los escaneos de documentos de identidad, informes médicos o contratos nunca salen de tu dispositivo.