Cómo extraer el texto de un PDF
- 1
Haz clic en Elegir archivos o arrastra uno o varios PDF al recuadro (hasta 200 MB por archivo).
- 2
Haz clic en Convertir. Se extrae el texto de todas las páginas.
- 3
El archivo .txt se descarga automáticamente. Con varios PDF, descarga cada archivo o usa Descargar todo (ZIP).
¿Por qué extraer el texto sin formato?
Copiar y pegar desde un visor de PDF es tedioso en documentos largos, y a menudo corta las líneas, mezcla encabezados y pies de página o se salta páginas. Extraer el texto de una vez te da un archivo .txt limpio que cualquier programa puede abrir. Es útil para:
- Citar o reutilizar contenido en un correo, un informe o una web.
- Traducir: pégalo en un traductor sin que el diseño estorbe.
- Buscar y analizar: encontrar términos en varios documentos, contar palabras o procesar el texto con scripts.
- Asistentes de IA y resumidores: muchos aceptan el texto plano mejor que los PDF.
- Accesibilidad: el texto plano funciona con lectores de pantalla y lectores electrónicos sencillos.
¿Tu PDF es digital o escaneado?
Ábrelo e intenta seleccionar una sola palabra con el cursor:
| Qué pasa | Tipo de PDF | Qué usar |
|---|---|---|
| Puedes resaltar palabras y líneas | PDF digital con capa de texto | PDF a texto (esta herramienta) |
| Se selecciona toda la página como un bloque, o nada | PDF escaneado o de imagen | OCR PDF |
Consejos
- ¿Necesitas las tablas como tablas? El texto plano las aplana. PDF a Excel conserva filas y columnas.
- Las palabras cortadas con guion al final de línea salen tal como están en el PDF; un buscar y reemplazar de «-» seguido de salto de línea las arregla.
- ¿Solo necesitas una parte de un PDF largo? Extrae antes las páginas que te interesan con Dividir PDF.
Tu PDF se lee dentro de tu navegador y nunca se sube, así que puedes extraer el texto de contratos o informes internos con tranquilidad.
Problemas frecuentes y soluciones
El .txt está vacío o casi vacío. El PDF no tiene capa de texto, algo típico de escaneos, fotos guardadas como PDF y algunos faxes. El OCR es la única forma de sacar el texto.
Aparecen símbolos raros en lugar de letras. Algunos PDF usan fuentes con una codificación interna no estándar, así que el texto no se puede decodificar bien aunque se vea correctamente en pantalla. En ese caso, el OCR de la página suele dar un texto legible.
Las palabras o las líneas salen en un orden extraño. Un PDF guarda el texto en el orden en que se dibujó, que en diseños complejos —columnas, recuadros laterales, pies de foto— no siempre es el orden de lectura. Los párrafos están todos, pero puede que tengas que reordenarlos.
Los encabezados y pies se repiten en cada página. Los encabezados, los números de página y los pies son texto real en el PDF, así que también se extraen. Un buscar y reemplazar en tu editor los elimina en un momento.