Tous les besoins
Besoin · Lire

C’est un scan, vous ne pouvez rien en tirer

Quand un PDF vient d’un scanner ou d’une photo, chaque page n’est qu’une image. L’œil lit le texte, l’ordinateur ne voit que des pixels : la recherche ne trouve rien, le copier-coller ne donne rien. La reconnaissance optique de caractères ajoute une couche de texte invisible sous l’image, et tout redevient possible.

  • La recherche dans le document ne trouve aucun mot, même visible à l’écran.
  • Sélectionner du texte sélectionne la page entière comme une photo.
  • Vous devez recopier à la main un document que vous avez déjà sous les yeux.

Le conseil de Poulpi

Choisissez la bonne langue de reconnaissance avant de lancer : c’est ce qui influence le plus le résultat, bien avant la qualité du scan. Un document en français traité comme de l’anglais perd tous ses accents.

OCR — Extraction de texte

FAQ

Questions fréquentes

Le document changera-t-il d’apparence ?

Non. La couche de texte est ajoutée sous l’image, invisible. Vous voyez exactement le même document, mais la recherche et la sélection fonctionnent.

Pourquoi des erreurs dans le texte reconnu ?

La reconnaissance dépend de la netteté, du contraste et de la droiture de la page. Un scan de travers, taché ou à 150 points par pouce produit des confusions classiques entre « l » et « 1 », « rn » et « m ». Rescanner à 300 points par pouce change tout.

L’écriture manuscrite est-elle reconnue ?

Non, pas de façon fiable. La reconnaissance est entraînée sur des caractères imprimés. Sur du manuscrit, le résultat est trop incertain pour être utile.