Photos pleine page, pages numérisées, aucune structure : pourquoi le premier passage automatique s’est arrêté à 84 points, quelle nouvelle règle a résolu le reste – et ce qu’une personne devrait examiner malgré le contrôle réussi.
Exemple anonymisé tiré d’un traitement réel ; le nom de l’organisation et le titre du document ont été modifiés.
Un plan de développement urbain de 344 pages a pu être porté de 0 à 100 points de manière entièrement automatique et réussit désormais le contrôle PDF/UA-1 – mais seulement à la deuxième tentative. Le premier passage s’est arrêté à 84 points, non pas à cause de tableaux ou de titres, mais à cause de photos pleine page et du charabia que la reconnaissance de texte avait lu dans ces photos. Cette étude de cas montre d’où venait le problème, quelle règle l’a résolu et ce qui reste du ressort d’un humain malgré le contrôle réussi.
Situation de départ
Un plan intégré de développement urbain (en Allemagne : integriertes Stadtentwicklungskonzept) décrit dans quelle direction une ville veut évoluer au cours des années à venir : état des lieux, vision directrice, champs d’action, mesures, ainsi que des contributions spécialisées. Ces plans sont adoptés politiquement, débattus dans le cadre de procédures de participation et consultés encore et encore pendant des années. Ils font partie des documents que beaucoup de gens veulent réellement lire.
Le plan d’une grande ville dont il est question ici présentait les difficultés typiques :
- 344 pages, organisées en chapitres et contributions spécialisées.
- De nombreuses photos pleine page, le plus souvent avec une courte légende.
- Des pages en partie numérisées, qui avaient déjà fait l’objet d’une reconnaissance de texte (OCR).
- Aucune structure de balises exploitable – le contrôle a donné 0 point sur 100.
Ce que le contrôle a révélé
0 point ne signifie pas que le document était mal fait ; visuellement, c’était un plan soigneusement mis en page. Cela signifie que les technologies d’assistance ne peuvent rien en faire. Sans balises, pas de titres permettant de sauter d’un champ d’action à l’autre, pas d’illustrations avec texte alternatif et aucune séparation entre le contenu et les ornements de page. Au mieux, un lecteur d’écran lit le texte dans l’ordre où il est stocké dans le fichier – pratiquement inutilisable sur 344 pages. Sur les pages numérisées s’ajoutait le fait que personne n’avait vérifié la couche de texte existante, y compris tout ce que la reconnaissance de texte avait extrait des images.
Ce que DokAudit a fait automatiquement
Premier passage. Le mode entièrement automatique a construit la structure : titres, paragraphes, listes et tableaux, en-têtes et pieds de page en tant qu’artefacts, ainsi que titre, langue et signets. DokAudit a ensuite contrôlé à nouveau avec veraPDF et ses propres contrôles de la structure logique. Résultat : 84 points sur 100. L’identifiant PDF/UA ne pouvait pas encore être apposé – DokAudit ne l’appose que si le contrôle est effectivement réussi. Deux choses faisaient obstacle :
- Photos traitées comme décoration : les photos pleine page étaient marquées comme artefacts, c’est-à-dire comme ornements sans signification. Pour les utilisateurs de lecteurs d’écran, elles n’existaient pas, alors qu’elles font partie du contenu.
- Charabia OCR traité comme du texte : sur les pages photo, la reconnaissance de texte avait trouvé de prétendues lettres dans les structures de l’image. Ces suites de caractères sans vrais mots étaient balisées comme paragraphes et auraient été lues à voix haute.
Nouvelle règle « pages photo ». Une règle spécifique est née de ce cas. Elle détecte les pages composées presque entièrement d’une image avec peu de texte et les traite comme le ferait un humain :
- La photo devient une illustration (Figure). La légende de la page sert de texte alternatif, par exemple « Photo : fête de quartier dans la zone piétonne ». En l’absence de légende, le texte alternatif reste ouvert pour une proposition de l’IA – à condition que l’IA soit autorisée pour l’organisation.
- Le texte de la page qui ne se compose guère de vrais mots est reconnu comme bruit OCR et devient un artefact.
Dans ce document, 18 photos pleine page sont ainsi devenues des illustrations avec texte alternatif, et 53 éléments de bruit OCR ont disparu de l’ordre de lecture en tant qu’artefacts. Depuis, la règle fait partie du mode entièrement automatique.
Résultat
Chiffres clés de l’étude de cas sur le plan de développement urbain| Caractéristique | Fichier d’origine | Premier passage | Avec la règle « pages photo » |
|---|
| Score | 0 sur 100 | 84 sur 100 | 100 sur 100 |
|---|
| PDF/UA-1 | échoué | pas encore réussi, pas d’identifiant | réussi, identifiant apposé |
|---|
| Photos pleine page | sans structure | en tant que décoration (artefact) | 18 illustrations avec la légende comme texte alternatif |
|---|
| Bruit OCR | sans structure | balisé comme paragraphe | 53 éléments en tant qu’artefacts |
|---|
100 points sur 100 et un contrôle de conformité réussi signifient que toutes les exigences vérifiables automatiquement sont remplies. Cela ne signifie pas que toutes les questions de contenu ont trouvé une réponse.
Ce qu’un humain devrait encore faire
- Deux pages intercalaires de chapitre : ici, le titre du chapitre a été repris comme texte alternatif, selon le modèle « Photo : CONTRIBUTION SPÉCIALISÉE … ». Formellement, c’est correct, mais pauvre sur le fond. Mieux vaut une phrase qui dit ce que montre la photo – ou, si elle ne fait que créer une ambiance, la décision de la traiter comme décoration et de baliser le titre du chapitre comme titre.
- Quatre pages sans texte interrogeable : quelqu’un devrait vérifier si elles contiennent un contenu qui manque sous forme de texte – par exemple une carte avec légende – ou s’il s’agit de pages purement illustrées pour lesquelles un texte alternatif suffit.
- Contraste des couleurs : la mesure du contraste a signalé un avertissement pour plusieurs milliers de caractères. Le contraste n’est pas une règle PDF/UA, mais une exigence WCAG (1.4.3). L’option « Améliorer le contraste des couleurs » assombrirait automatiquement le texte trop clair ; comme cela modifie l’apparence, elle est facultative. Autre possibilité : adapter la mise en page dans la prochaine version (Contraste des couleurs dans les PDF).
- Relire les légendes : elles proviennent du document et sont donc justes sur le fond. La rédaction devrait vérifier sur quelques exemples si elles suffisent aux personnes qui ne voient pas la photo.
- Écoute test : écouter quelques chapitres avec un lecteur d’écran, en particulier les pages autrefois numérisées (Tester soi-même).
Les enseignements à en tirer
- Les gros documents de planification peuvent être traités automatiquement. 344 pages ne sont pas à elles seules une raison de reléguer un document dans la déclaration d’accessibilité au titre d’une « charge disproportionnée ».
- Les pages photo et le bruit OCR exigent leurs propres règles. Une automatisation générale prend facilement une photo pleine page pour un arrière-plan, et la reconnaissance de texte trouve des lettres là où il n’y en a pas. Seule la règle ciblée a permis de passer de 84 à 100.
- Les légendes sont un bon début, pas le dernier mot. Elles fournissent immédiatement une information juste, mais pas toujours utile (Rédiger de bons textes alternatifs).
- La reconnaissance de texte sur des photos est un risque. Quiconque rend des documents interrogeables après coup devrait ensuite examiner spécifiquement les pages photo (Documents numérisés).
- 100 points est un résultat technique. Il prouve que les règles vérifiables sont respectées, pas que tout est compréhensible. Les points ouverts du rapport de contrôle font partie de la réception.
Sources:
État : 10/2026. Cet article donne une vue d’ensemble générale et ne constitue pas un conseil juridique. Font foi les textes de loi et de normes en vigueur ; dans certains cas, le droit d’un Land allemand peut différer.