Comment extraire le texte d’un PDF scanné
- 1
Cliquez sur Choisir un fichier ou glissez un PDF scanné ou une image (JPG, PNG, WebP) dans le cadre, jusqu’à 100 Mo.
- 2
Choisissez la Langue du document : Français, English, Español, Deutsch, Português ou Italiano.
- 3
Cliquez sur Convertir. À la première utilisation, le moteur OCR et les données de la langue choisie sont téléchargés puis gardés en cache par votre navigateur.
- 4
Le texte reconnu se télécharge une fois l’analyse terminée. Relisez-le, en particulier les chiffres et les noms propres.
Pourquoi votre PDF scanné n’est pas « lisible »
Quand vous scannez un document, ou le photographiez avec votre téléphone, le PDF obtenu contient une photo de chaque page, pas du texte. On ne peut donc ni y chercher un mot, ni copier une phrase, ni le convertir en Word correctement. L’OCR comble ce manque : il examine les formes des lettres et reconstitue le texte.
TurboConvert utilise Tesseract, un moteur d’OCR open source largement utilisé, compilé pour fonctionner directement dans votre navigateur.
Obtenir une bonne reconnaissance
| Facteur | Conseil |
|---|---|
| Résolution | Scannez à 300 dpi : en dessous, les petits caractères sont mal reconnus |
| Cadrage | Page droite et entière, sans bord de table ni doigts |
| Éclairage | Lumière uniforme, sans ombre ni reflet |
| Contraste | Texte noir sur fond clair ; évitez le papier froissé |
| Langue | Sélectionnez la langue réelle du document |
Une page bien scannée donne généralement un texte propre, à relire rapidement. Vérifiez toujours les chiffres (montants, dates, numéros) : une erreur comme « 8 » lu à la place de « 3 » est vite arrivée.
Pourquoi l’OCR prend un peu de temps
Les services d’OCR en ligne font travailler leurs serveurs ; ici, c’est votre appareil qui analyse chaque page. Lors de la première utilisation, le navigateur télécharge le moteur et le modèle de langue choisi (plusieurs mégaoctets), puis les garde en cache : les fois suivantes, le démarrage est beaucoup plus rapide. La contrepartie de cette attente est simple : vos documents ne sont jamais envoyés. Pour un long PDF, gardez l’onglet ouvert jusqu’à la fin du traitement ; sur téléphone, évitez de verrouiller l’écran pendant l’analyse.
Que faire du texte reconnu ?
- Le modifier dans un traitement de texte : collez-le dans Word, LibreOffice ou Google Docs.
- Le traduire ou le résumer avec l’outil de votre choix.
- Archiver une version consultable de vos courriers papier.
Si votre PDF contient déjà du texte sélectionnable, l’OCR n’est pas nécessaire : PDF en texte ou PDF en Word seront bien plus rapides et plus fidèles.
OCR d’un PDF de plusieurs pages
Un PDF scanné de plusieurs pages est analysé page après page, et le texte de toutes les pages est réuni dans le résultat. Si seules quelques pages vous intéressent, extrayez-les d’abord avec Diviser PDF : l’analyse sera bien plus rapide, surtout sur un téléphone.