
Pourquoi un PDF lisible à l’écran peut rester opaque pour l’IA
Un rapport municipal de 1998, un registre d’organisme ou une ancienne convention collective peut sembler parfaitement lisible dans un lecteur PDF. Pourtant, chaque page est parfois une simple photographie. Il devient alors impossible de sélectionner une phrase, de chercher un nom ou de demander à un assistant de retrouver une décision précise sans passer d’abord par la reconnaissance optique de caractères, souvent appelée OCR. Le risque ne se limite pas aux mots mal reconnus. Lorsqu’un outil extrait tout le texte d’un seul bloc, les changements de page, les tableaux et les notes peuvent disparaître. L’assistant produit alors une réponse plausible, mais son utilisateur ne sait plus où la vérifier. Pour les municipalités, bibliothèques, centres d’archives, cégeps et organismes québécois qui conservent des documents en français ou bilingues, cette traçabilité est plus importante qu’un résumé élégant. L’objectif du tutoriel n’est donc pas seulement d’obtenir du texte. Il consiste à créer une version consultable où chaque passage demeure rattaché à sa page d’origine, puis à vérifier si l’IA sait reconnaître ses limites.
Préparer un petit échantillon avant de traiter toute la collection
Commencez avec un document de 8 à 12 pages représentatif de vos archives. Il devrait contenir au moins un titre, un tableau, quelques nombres, des accents français et, si possible, une page imparfaite. Évitez de lancer immédiatement un traitement sur des centaines de fichiers. Un petit échantillon permet de repérer rapidement les problèmes de rotation, de contraste ou de mise en page. Conservez trois versions distinctes : le PDF original, les images de pages et le texte produit par l’OCR. Ne remplacez jamais l’original par une version retraitée. Nommez les fichiers de façon stable, par exemple « rapport-1998_original.pdf », « rapport-1998_page-007.png » et « rapport-1998_ocr.txt ». Ce système réduit le risque de confondre une page physique, une page imprimée dans le document et le numéro affiché par le lecteur PDF. Avant l’extraction, vérifiez manuellement trois pages : une au début, une au milieu et une à la fin. Si une page est tournée, floue ou coupée, corrigez son image ou signalez le défaut. L’IA ne peut pas reconstituer avec certitude une donnée qui n’est pas visible.
Créer des repères que l’assistant devra conserver
Après l’OCR, insérez une balise explicite avant le texte de chaque page. Utilisez par exemple « PAGE PDF 007 » sur une ligne isolée. Si le document possède aussi une pagination imprimée, ajoutez « PAGE IMPRIMÉE 5 ». Ces deux nombres ne correspondent pas toujours, notamment lorsque le fichier comprend une couverture ou une table des matières non numérotée. Demandez ensuite à l’assistant de respecter un format rigide : réponse brève, page PDF, page imprimée si elle existe, puis extrait justificatif. Ajoutez cette consigne : « Si le passage exact n’est pas présent ou si l’OCR paraît ambigu, réponds information incertaine et indique la page à vérifier. Ne complète pas les mots manquants. » Pour un tableau, exigez une transcription ligne par ligne avant toute interprétation. Un nombre comme 8 500 peut devenir 8500, 8.500 ou même B 500 selon la qualité de l’image. La réponse finale doit donc séparer ce qui a été lu, ce qui a été calculé et ce qui a été déduit. Cette distinction transforme l’IA en outil de repérage contrôlable plutôt qu’en autorité documentaire.
Tester avec des questions dont vous connaissez déjà la réponse
Préparez une série de 12 questions avant de faire confiance au système. Six doivent viser des informations clairement présentes, comme une date, un nom ou un montant. Trois doivent porter sur des passages difficiles, par exemple un tableau ou une note en bas de page. Les trois dernières doivent demander des renseignements absents du document. Ce dernier groupe vérifie si l’assistant sait refuser d’inventer. Construisez un tableau de contrôle avec cinq colonnes : question, réponse attendue, réponse de l’IA, page indiquée et résultat. Une réponse n’est correcte que si l’information et la page sont justes. Si l’assistant trouve le bon montant, mais cite la mauvaise page, classez le résultat comme un échec de traçabilité. Comme règle interne de départ, vous pouvez exiger 11 bonnes réponses sur 12 pour les informations simples, aucune invention sur les questions absentes et une vérification humaine obligatoire pour tous les tableaux. Ce seuil n’est pas une norme universelle : c’est un critère de décision que votre équipe peut resserrer selon les conséquences d’une erreur. Notez aussi le temps nécessaire pour vérifier chaque réponse; un système exact mais laborieux peut offrir peu d’avantages.
Documenter les erreurs avant d’élargir l’usage
Lorsque le test échoue, classez la cause plutôt que de modifier la consigne au hasard. Les catégories utiles comprennent l’image illisible, l’erreur d’OCR, la page perdue, le tableau désorganisé, la question ambiguë et l’invention de contenu. Cette courte liste révèle si le problème vient du document, de l’extraction ou du comportement de l’assistant. Refaites ensuite le test sur une nouvelle série de pages. Ne réutilisez pas uniquement les questions qui ont servi à ajuster la méthode, car l’essai deviendrait trop facile. Pour un déploiement réel, gardez toujours un lien entre la réponse, le texte extrait et l’image originale. Une personne doit pouvoir remonter à la page en quelques secondes. Au Québec, cette méthode peut faciliter la consultation d’anciens procès-verbaux, de politiques internes ou de collections patrimoniales sans prétendre que l’IA remplace l’archiviste, le bibliothécaire ou le spécialiste du dossier. Le résultat utile n’est pas une réponse qui semble certaine, mais une réponse qui conduit rapidement vers une preuve lisible et vérifiable.





