OCR — extrair texto de PDF escaneado

Reconheça o texto de PDFs digitalizados, fotos de documentos e capturas de tela e receba tudo como texto editável. O OCR roda no seu aparelho com o motor Tesseract — seus arquivos nunca são enviados.

Solte sua digitalização aqui

ou arraste e solte · PDF, JPG, PNG, WEBP · até 100 MB

    Opções

    Processando…

    No primeiro uso, o motor de conversão é baixado (≈ 5 MB). Depois ele fica guardado no cache do navegador.

    Pronto!

      Processado no seu aparelho. Nada é enviado. · Grátis · Sem cadastro · Sem marca d’água

      Como extrair o texto de um PDF escaneado

      1. 1

        Clique em Escolher arquivo ou arraste um PDF digitalizado ou uma imagem (JPG, PNG, WebP) para a caixa acima.

      2. 2

        Escolha o Idioma do documento — Português, English, Español, Français, Deutsch ou Italiano.

      3. 3

        Clique em Converter. Na primeira vez, o motor de OCR e os dados do idioma são baixados e ficam no cache do navegador.

      4. 4

        Quando o reconhecimento termina, o arquivo de texto é baixado automaticamente.

      PDFs digitalizados precisam de OCR

      Quando você escaneia um papel ou fotografa uma página, o resultado é uma imagem — mesmo que seja salvo como PDF. Não dá para pesquisar, copiar nem converter para Word. O OCR analisa o formato das letras e reconstrói o texto.

      O TurboConvert usa o Tesseract, um motor de OCR de código aberto muito usado, compilado para rodar no seu navegador. Escolher o idioma certo faz diferença: assim o motor reconhece os caracteres acentuados (ã, ç, é, ô…) e as palavras comuns daquela língua.

      Para ter o melhor reconhecimento

      FatorBomProblemático
      ResoluçãoDigitalizações a 300 dpi, fotos nítidas de celularImagens pequenas, muito comprimidas ou borradas
      AlinhamentoPáginas retasPáginas tortas ou giradas
      ContrasteTexto preto em papel brancoImpressão desbotada, fundo colorido, sombras
      ConteúdoTexto impressoLetra de mão, fontes decorativas, texto sobre imagens

      Dicas práticas:

      • Gire antes as digitalizações deitadas com o Girar PDF; o OCR funciona melhor com páginas na posição certa.
      • Fotografando um documento? Segure o celular paralelo à folha, com boa luz, enquadrando só o texto.
      • Só precisa de algumas páginas? Separe-as com o Dividir PDF para ganhar tempo em documentos longos.
      • Escolha o idioma do documento, não o seu: uma carta em inglês digitalizada em São Paulo deve ser lida com English.

      E depois?

      O texto reconhecido está pronto para colar num e-mail ou num documento. Se precisar de um documento formatado, cole no Word ou no Google Docs. Se o seu PDF tiver texto de verdade, afinal, o PDF para Word mantém todo o layout e a formatação.

      OCR, PDF para texto ou PDF para Word?

      Seu arquivoMelhor ferramentaPor quê
      PDF digitalizado, foto de página, captura de telaOCR de PDFO texto só existe como pixels
      PDF digital, você só precisa das palavrasPDF para textoTexto exato, na hora, sem erros de reconhecimento
      PDF digital, você quer editar com formataçãoPDF para WordMantém títulos, estilos e imagens

      Problemas comuns e soluções

      O resultado está cheio de caracteres sem sentido. A página provavelmente está girada, em resolução muito baixa ou com o idioma errado selecionado. Endireite a página, use uma digitalização mais nítida e escolha o idioma do documento.

      Algumas palavras saem erradas. Procure caracteres parecidos — “l” e “1”, “O” e “0”, “rn” e “m” são confusões clássicas do OCR, principalmente em letras pequenas. Uma revisão rápida resolve.

      As colunas se misturam. Em páginas com várias colunas, como jornais, linhas de colunas vizinhas podem ser juntadas. Recorte cada coluna em uma imagem separada antes do OCR.

      Está demorando muito. Cada página é analisada individualmente. Processe só as páginas de que você precisa e prefira um computador para documentos com mais de algumas dezenas de páginas.

      Perguntas e respostas

      O que é OCR?
      OCR (reconhecimento óptico de caracteres) transforma uma imagem de texto — uma digitalização, uma foto ou uma captura de tela — em texto de verdade, que você pode copiar, pesquisar e editar. Sem ele, um PDF escaneado é só um conjunto de imagens.
      Como saber se o meu PDF precisa de OCR?
      Tente selecionar uma palavra no PDF. Se não der, ou se a página inteira for destacada como um bloco só, o PDF é digitalizado e precisa de OCR. Se der para selecionar as palavras, o PDF para texto é mais rápido e exato.
      O OCR é preciso?
      Em documentos impressos e limpos, a maior parte do texto é reconhecida corretamente, mas nenhum OCR é perfeito. Revise sempre nomes, números e valores antes de confiar neles.
      Ele lê letra de mão?
      Não de forma confiável. O motor foi feito para texto impresso; letra de forma bem caprichada às vezes funciona, mas letra cursiva geralmente não.
      Por que demora na primeira vez?
      Primeiro o navegador baixa o motor de OCR e os dados do seu idioma. Depois eles ficam no cache, então as próximas vezes começam bem mais rápido.
      Minhas digitalizações são enviadas?
      Não. O reconhecimento roda inteiro no seu navegador. Digitalizações de RG, laudos médicos ou contratos nunca saem do seu aparelho.