Comment une numérisation devient un PDF lisible, pourquoi la reconnaissance de texte seule ne suffit pas, où l’écriture manuscrite et les mauvais originaux posent des limites – et quand recréer le document est le meilleur choix.
Un PDF numérisé ne contient que des images de pages – pour un lecteur d’écran, il est vide. La reconnaissance de texte (OCR, Optical Character Recognition, reconnaissance optique de caractères) place une couche de texte invisible derrière les images de pages ; le document a ensuite exactement le même aspect, mais il peut être recherché et lu à voix haute (technique WCAG PDF7). L’OCR est donc la condition préalable à l’accessibilité, mais pas l’accessibilité elle-même : le document a encore besoin d’une structure, d’une langue et d’un titre – et d’un texte reconnu qui soit réellement exact.
Comment reconnaître une numérisation
- Le texte ne peut être ni sélectionné ni copié (test de sélection).
- La recherche dans le document ne trouve rien, alors que le mot est visible.
- Les pages sont légèrement de travers, présentent des perforations, des tampons ou une bordure grise.
- Formes mixtes : un document créé numériquement contient quelques pages numérisées, par exemple la dernière page signée ou des annexes insérées.
Ce que fait l’OCR
Avec des originaux proprement imprimés, numérisés bien droits et dans des polices courantes, l’OCR moderne reconnaît en général le texte de manière fiable. La bonne langue est importante : la reconnaissance s’appuie sur des dictionnaires, et un document allemand traité avec un réglage de langue anglais produit davantage d’erreurs sur les trémas et le ß.
La reconnaissance de texte est suivie de la structure : titres, paragraphes, listes et tableaux doivent être balisés, en-têtes et pieds de page marqués comme artefacts. Avec les numérisations, c’est plus difficile qu’avec des PDF créés numériquement, car il n’y a pas d’informations sur les polices – les titres ne peuvent être reconnus qu’à leur taille et à leur position. Les structures générées automatiquement devraient donc être vérifiées par échantillonnage.
Les limites
- Écriture manuscrite : les notes manuscrites, annotations en marge et mentions remplies à la main ne sont reconnues que de manière peu fiable. Si elles sont importantes pour le contenu, elles doivent être retranscrites.
- Signatures : elles ne sont pas « lues ». Si la signature est pertinente, un court texte alternatif suffit (« Signature », éventuellement avec le nom imprimé).
- Mauvais originaux : télécopies, doubles carbone, faible résolution, papier de couleur, tampons sur le texte et forte inclinaison augmentent nettement le taux d’erreur.
- Écritures anciennes : l’écriture gothique allemande (Fraktur) – par exemple dans d’anciens règlements ou actes – est nettement moins bien reconnue par de nombreux systèmes d’OCR.
- Tableaux : dans les numérisations, lignes et colonnes se désagrègent facilement ; les cellules d’en-tête doivent souvent être associées à la main.
- Plans et cartes : l’OCR extrait des fragments de légendes qui, lus à voix haute, ne font que dérouter. Il vaut mieux traiter ces pages comme une illustration avec texte alternatif.
- Les erreurs de reconnaissance sont invisibles : un validateur vérifie si du texte est présent – pas s’il est exact. Si une erreur de reconnaissance transforme 1 800 € en 7 800 €, le document passe tous les contrôles techniques et il est pourtant faux. Montants, dates et noms ont donc leur place dans l’échantillon contrôlé.
Recréer, corriger ou exempter ?
- Le fichier source existe-t-il encore ? Alors, réexporter à partir de celui-ci – c’est presque toujours mieux que n’importe quelle OCR (Guide Word).
- Une exemption s’applique-t-elle ? Les fichiers publiés avant le 23 septembre 2018 sont exemptés en vertu de la directive (UE) 2016/2102, sauf s’ils sont nécessaires à des procédures administratives en cours. Un règlement en vigueur ou un formulaire utilisé n’en relève donc en général pas. Les documents exemptés doivent être mentionnés dans la déclaration d’accessibilité.
- Le document est-il encore nécessaire ? Sinon : le retirer du site web ou l’archiver (voir Garder la maîtrise des PDF de votre site).
- Bon original, texte dactylographié ? OCR, structure, échantillonnage – c’est le cas normal pour les documents d’archives.
- Mauvais original, beaucoup d’écriture manuscrite, Fraktur, tableaux complexes ? Alors une nouvelle saisie est souvent plus rapide et plus fiable qu’une correction – en particulier pour des documents courts et souvent consultés.
- Reproductions issues des archives ? Pour les pièces des collections patrimoniales, la directive européenne prévoit une exemption spécifique ; la manière dont elle est transposée dans le droit du Land concerné est à vérifier au cas par cas.
Mieux numériser à l’avenir
- Publier les originaux numériques au lieu de « imprimer, signer, numériser » – la signature est rarement nécessaire en ligne.
- S’il faut numériser : poser le document bien droit, choisir une résolution suffisante (au moins 300 dpi est l’usage), niveaux de gris plutôt que noir et blanc pour les tampons et le papier de couleur.
- Activer la reconnaissance de texte directement dans le processus de numérisation – avec la bonne langue.
- Supprimer les pages blanches et les versos, orienter correctement les pages.
Erreurs fréquentes
- La numérisation est publiée sans reconnaissance de texte.
- « Recherchable » est confondu avec « accessible » – la couche texte est là, les balises manquent.
- Le texte OCR n’est jamais vérifié, montants et noms sont mal reconnus.
- Tampons, perforations et bords de page sont lus comme du texte au lieu d’être des artefacts.
- Les pages pivotées et les doubles pages restent telles qu’elles sont sorties du scanner.
Comment DokAudit vous aide
DokAudit détecte les pages numérisées et, dans le mode entièrement automatique du hub documentaire, exécute d’abord la reconnaissance de texte, puis la structuration avec titres, paragraphes, listes, tableaux et artefacts, ainsi que le titre, la langue et les signets. Le résultat est revérifié avec veraPDF et les propres contrôles de la structure logique de DokAudit. Aucun logiciel ne peut garantir que le texte reconnu est exact sur le fond – le rapport de contrôle le signale, et l’échantillonnage reste votre tâche. Si vous voulez seulement rendre une numérisation recherchable, vous trouverez un outil gratuit sous PDF OCR ; pour un résultat accessible, il faut en plus la structure.
Sources:
État : 09/2026. Cet article donne une vue d’ensemble générale et ne constitue pas un conseil juridique. Seuls les textes de loi et de normes en vigueur font foi ; dans certains cas, le droit des Länder allemands peut différer.