Pour ne rien manquer

Tutoriels

Anonymiser un document avant de le confier à un assistant IA

Une méthode en cinq étapes pour retirer les renseignements sensibles, tester la réidentification et restaurer seulement les données nécessaires.

Par Le Journal IAPublié le 5 min de lectureMis à jour le
Illustration générée par IA : gros plan sur un document imprimé anonymisé par des jetons, une clé USB, un crayon et une fiche de contrôle sur une table de bois éclairée de côté.

Commencer par une copie et un inventaire

Avant de téléverser un rapport, une plainte, un dossier de candidature ou des notes de service dans un assistant IA, créez une copie réservée au traitement. Le document original demeure intact dans son emplacement habituel. Cette séparation évite qu’une suppression accidentelle devienne permanente et permet de comparer le résultat avec la source. Parcourez ensuite le document sans demander l’aide de l’IA. Repérez les renseignements qui identifient directement une personne : nom, adresse, courriel, numéro de téléphone, signature, photographie et numéro de dossier. Ajoutez les indices indirects qui pourraient permettre une déduction, comme un titre très rare, une petite municipalité, une date précise ou la description d’un incident unique. Pour une équipe technologique québécoise, cette étape doit aussi tenir compte des particularités du français : noms composés, patronymes avec apostrophe, adresses contenant un appartement et formulations comme « la directrice du seul laboratoire de la région ». Une simple recherche de noms propres ne suffit donc pas. Créez enfin une courte fiche d’inventaire. Pour chaque catégorie, notez le nombre d’occurrences attendu. Si la copie contient 12 noms, 4 courriels et 3 numéros de dossier, ces chiffres deviennent vos premiers critères de vérification.

Remplacer plutôt que simplement supprimer

Une suppression complète peut rendre le texte difficile à comprendre. Si toutes les personnes deviennent des espaces vides, l’assistant risque de confondre les rôles ou d’attribuer une décision au mauvais intervenant. Utilisez plutôt des jetons cohérents, par exemple PERSONNE_01, ORGANISATION_02, DATE_03 et DOSSIER_01. Un même renseignement doit toujours recevoir le même jeton. Si Marie Tremblay apparaît huit fois, remplacez ses huit occurrences par PERSONNE_01. Une deuxième personne devient PERSONNE_02. Cette stabilité conserve la structure du récit sans révéler l’identité réelle. Prenons un exemple fictif : « Marie Tremblay a transmis le dossier 8472 à Karim Bouchard le 6 mai. » La version préparée devient : « PERSONNE_01 a transmis DOSSIER_01 à PERSONNE_02 à DATE_01. » L’assistant peut encore résumer l’action, repérer une responsabilité ou produire une chronologie. Ne remplacez toutefois pas automatiquement chaque chiffre. Un montant, une durée ou une mesure technique peut être essentiel à la tâche. Posez-vous une question simple pour chaque élément : l’IA en a-t-elle besoin pour produire le résultat demandé? Si la réponse est non, retirez-le ou généralisez-le.

Nettoyer ce qui se cache autour du texte

Le corps du document n’est pas le seul endroit où des renseignements peuvent survivre. Vérifiez les en-têtes, pieds de page, commentaires, suggestions de modification, propriétés du fichier, noms des auteurs et noms des pièces jointes. Une photographie peut révéler un visage, une plaque, un badge ou un emplacement, même si le paragraphe associé a été anonymisé. Méfiez-vous aussi du masquage visuel. Placer un rectangle noir au-dessus d’un nom ne retire pas nécessairement le texte sous-jacent. Selon le format utilisé, il peut encore être sélectionné, copié ou récupéré. Après une caviardisation, exportez une nouvelle copie aplatie, puis tentez vous-même de sélectionner et de rechercher les éléments retirés. Pour un document de huit pages, une procédure réaliste peut comprendre cinq contrôles : recherche des noms connus, recherche du caractère arobase, vérification des commentaires, inspection des propriétés et extraction du texte dans un fichier vierge. Le but n’est pas de faire confiance à l’apparence, mais de confirmer que les renseignements ne sont plus accessibles. Conservez la table reliant PERSONNE_01 au vrai nom dans un fichier séparé. Cette clé ne doit jamais accompagner le document envoyé à l’assistant.

Faire un test de réidentification

Avant la vraie tâche, utilisez l’assistant comme adversaire. Demandez-lui d’énumérer les personnes, organisations, lieux et dossiers qu’il pense pouvoir reconnaître à partir du document anonymisé. Demandez ensuite quels indices ont soutenu chaque déduction et exigez qu’il distingue les identités certaines des simples hypothèses. Le résultat attendu n’est pas une réponse brillante, mais une absence d’identification crédible. Si l’assistant déduit qu’une personne est probablement la directrice d’un établissement précis grâce à son titre, à sa ville et à la date d’un événement, retournez au document. Vous pourriez généraliser le titre, remplacer la municipalité par une région et réduire la précision de la date. Fixez vos critères avant le test. Exemple : zéro nom complet récupérable, zéro courriel, zéro numéro de dossier réel et aucune combinaison de trois indices permettant une identification raisonnable. Notez les échecs dans un tableau avec quatre colonnes : indice trouvé, risque, correction appliquée et résultat du nouveau test. Cette méthode est particulièrement utile dans les petites communautés professionnelles québécoises, où un poste rare et un lieu suffisent parfois à reconnaître quelqu’un. L’anonymisation doit donc viser le contexte autant que les champs évidents.

Restaurer seulement ce qui doit l’être

Une fois le résumé, le classement ou l’analyse produit, ne demandez pas à l’assistant de restaurer les identités. Faites cette opération dans votre environnement de travail à partir de la table de correspondance conservée séparément. Vous gardez ainsi le contrôle sur les renseignements réintroduits. Relisez le résultat avant toute restauration. Vérifiez que PERSONNE_01 n’a pas été confondue avec PERSONNE_02, que les dates généralisées n’ont pas été transformées en dates précises et qu’aucun jeton inconnu n’a été inventé. Un contrôle mécanique peut aussi repérer les éléments oubliés : recherchez PERSONNE_, DOSSIER_, DATE_ et ORGANISATION_ dans la version finale. Dans un exercice fictif comportant 21 jetons, le critère de réussite pourrait être simple : les 21 occurrences sont expliquées, aucune identité n’apparaît avant la restauration et seuls 6 jetons nécessaires au document final sont remplacés. Les 15 autres demeurent anonymes. Terminez par un petit journal indiquant la date, la tâche demandée, les catégories retirées, les tests effectués et la personne ayant validé le résultat. Cette trace transforme une précaution improvisée en méthode reproductible pour toute l’équipe.

La rédaction a vérifié les annonces récentes de plusieurs sources primaires avant de retenir ce tutoriel, aucune nouvelle majeure postérieure aux publications fournies n’ayant été confirmée. La méthode repose sur un scénario fictif et des contrôles reproductibles. Une IA a aidé à structurer et réviser le texte; la validation éditoriale demeure humaine.

Notre démarche éditoriale · Signaler une erreur

Pour poursuivre