Como extrair o texto de um PDF escaneado
- 1
Clique em Escolher arquivo ou arraste um PDF digitalizado ou uma imagem (JPG, PNG, WebP) para a caixa acima.
- 2
Escolha o Idioma do documento — Português, English, Español, Français, Deutsch ou Italiano.
- 3
Clique em Converter. Na primeira vez, o motor de OCR e os dados do idioma são baixados e ficam no cache do navegador.
- 4
Quando o reconhecimento termina, o arquivo de texto é baixado automaticamente.
PDFs digitalizados precisam de OCR
Quando você escaneia um papel ou fotografa uma página, o resultado é uma imagem — mesmo que seja salvo como PDF. Não dá para pesquisar, copiar nem converter para Word. O OCR analisa o formato das letras e reconstrói o texto.
O TurboConvert usa o Tesseract, um motor de OCR de código aberto muito usado, compilado para rodar no seu navegador. Escolher o idioma certo faz diferença: assim o motor reconhece os caracteres acentuados (ã, ç, é, ô…) e as palavras comuns daquela língua.
Para ter o melhor reconhecimento
| Fator | Bom | Problemático |
|---|---|---|
| Resolução | Digitalizações a 300 dpi, fotos nítidas de celular | Imagens pequenas, muito comprimidas ou borradas |
| Alinhamento | Páginas retas | Páginas tortas ou giradas |
| Contraste | Texto preto em papel branco | Impressão desbotada, fundo colorido, sombras |
| Conteúdo | Texto impresso | Letra de mão, fontes decorativas, texto sobre imagens |
Dicas práticas:
- Gire antes as digitalizações deitadas com o Girar PDF; o OCR funciona melhor com páginas na posição certa.
- Fotografando um documento? Segure o celular paralelo à folha, com boa luz, enquadrando só o texto.
- Só precisa de algumas páginas? Separe-as com o Dividir PDF para ganhar tempo em documentos longos.
- Escolha o idioma do documento, não o seu: uma carta em inglês digitalizada em São Paulo deve ser lida com English.
E depois?
O texto reconhecido está pronto para colar num e-mail ou num documento. Se precisar de um documento formatado, cole no Word ou no Google Docs. Se o seu PDF tiver texto de verdade, afinal, o PDF para Word mantém todo o layout e a formatação.
OCR, PDF para texto ou PDF para Word?
| Seu arquivo | Melhor ferramenta | Por quê |
|---|---|---|
| PDF digitalizado, foto de página, captura de tela | OCR de PDF | O texto só existe como pixels |
| PDF digital, você só precisa das palavras | PDF para texto | Texto exato, na hora, sem erros de reconhecimento |
| PDF digital, você quer editar com formatação | PDF para Word | Mantém títulos, estilos e imagens |
Problemas comuns e soluções
O resultado está cheio de caracteres sem sentido. A página provavelmente está girada, em resolução muito baixa ou com o idioma errado selecionado. Endireite a página, use uma digitalização mais nítida e escolha o idioma do documento.
Algumas palavras saem erradas. Procure caracteres parecidos — “l” e “1”, “O” e “0”, “rn” e “m” são confusões clássicas do OCR, principalmente em letras pequenas. Uma revisão rápida resolve.
As colunas se misturam. Em páginas com várias colunas, como jornais, linhas de colunas vizinhas podem ser juntadas. Recorte cada coluna em uma imagem separada antes do OCR.
Está demorando muito. Cada página é analisada individualmente. Processe só as páginas de que você precisa e prefira um computador para documentos com mais de algumas dezenas de páginas.