Copier un courriel client dans ChatGPT pour en tirer une réponse propre prend dix secondes. Chefs de projet, commerciaux et équipes support le font sans y penser. Sauf que le message part avec tout ce qu’il contient : le nom du client, son numéro de téléphone, parfois une référence de contrat ou un IBAN resté dans la signature.
La CNIL a posé le cadre dès juillet 2024, dans ses questions-réponses sur l’utilisation d’un système d’IA générative. Sur un service grand public, écrit-elle, on ne devrait jamais partager d’informations confidentielles telles que des données personnelles. Facile à énoncer, moins à appliquer : dans bien des tâches, la donnée personnelle est justement la matière sur laquelle on travaille, qu’il s’agisse de répondre à un client ou de résumer un dossier.
Entre l’interdiction pure et l’usage sans précaution, juristes et informaticiens connaissent une troisième voie : la pseudonymisation. On remplace les identifiants par des marqueurs avant l’envoi, puis on les remet en place au retour. Reste à voir comment le procédé s’applique à un prompt, ce qu’il protège réellement et quels angles morts il laisse.
Anonymisation ou pseudonymisation : ce que dit le RGPD
On emploie souvent les deux mots l’un pour l’autre, à tort. Le RGPD définit la pseudonymisation, à son article 4, comme un traitement qui empêche d’attribuer les données à une personne précise sans recourir à des informations supplémentaires, conservées séparément et protégées. L’anonymisation va plus loin : selon la CNIL, elle doit rendre toute identification impossible en pratique, par quelque moyen que ce soit et de manière irréversible.
La conséquence juridique est nette. Des données réellement anonymisées sortent du champ du RGPD. Des données pseudonymisées restent des données personnelles, comme l’a rappelé le Comité européen de la protection des données dans ses lignes directrices sur la pseudonymisation, adoptées en janvier 2025 et soumises à consultation publique. La table de correspondance existe quelque part, donc la personne reste identifiable pour qui la détient.
Pourquoi s’y intéresser, alors ? Parce que le règlement la cite lui-même parmi les mesures de protection, à l’article 25 sur la protection des données dès la conception et à l’article 32 sur la sécurité du traitement. Et parce qu’avec l’IA, la réversibilité joue en sa faveur : c’est grâce à elle qu’on récupère une réponse exploitable telle quelle, avec les vrais noms revenus à leur place.
Lire Aussi : Comment l’intelligence artificielle rend le phishing plus difficile à repérer
Comment fonctionne la pseudonymisation d’un prompt
Tout se joue en trois temps. Avant l’envoi, un outil repère dans le texte les données qui identifient quelqu’un : noms, adresses électroniques, numéros de téléphone, numéro de sécurité sociale, IBAN ou numéro SIRET. Il remplace chacune d’elles par une étiquette neutre du type [PERSONNE_1] ou [TELEPHONE_1], et garde la correspondance de son côté, sur le poste de l’utilisateur.
Le modèle reçoit donc un texte dont la structure est intacte. Il comprend qu’il s’agit d’une relance adressée à une personne au sujet d’une facture, et il peut rédiger, résumer, traduire ou reformuler sans difficulté. Il ignore simplement de qui il s’agit. Dans sa réponse, il réutilise les mêmes étiquettes, puisque ce sont les seuls noms qu’il connaisse pour désigner les personnes concernées.
Au retour, l’outil fait l’opération inverse et remet chaque valeur réelle à sa place. Deux exigences distinguent un système fiable d’un bricolage. La cohérence d’abord : le même client doit recevoir la même étiquette dans tout le document, sinon le modèle croit avoir affaire à deux personnes. La localisation ensuite : la table de correspondance doit rester sur la machine de l’utilisateur.
Ce que la pseudonymisation ne couvre pas
La première limite tient aux identifiants indirects. Masquer le nom d’un salarié ne sert pas à grand-chose si le prompt précise qu’il est le seul directeur financier d’une PME de douze personnes à Annecy. La CNIL le souligne à propos des données pseudonymisées : il reste souvent possible de retrouver l’identité des personnes en croisant d’autres informations. Or aucun logiciel ne sait repérer à coup sûr ce genre de contexte.
La deuxième tient aux fichiers. Un PDF ou une capture d’écran envoyés tels quels échappent à un outil qui ne surveille que le texte collé dans la fenêtre de discussion. Les documents doivent donc passer par le même traitement avant d’être déposés dans la conversation, ce qui suppose un outil capable de les lire et d’en restituer une version masquée.
La troisième est humaine. Aucun détecteur n’est parfait, et un identifiant au format inhabituel, comme une référence interne de dossier, peut passer entre les mailles. Relire ce qui part reste un réflexe utile, surtout pour les documents sensibles. La pseudonymisation réduit nettement le risque, sans faire pour autant d’un assistant grand public un coffre-fort.
Lire Aussi : Avis négatifs et IA : comment donner du contexte aux moteurs de réponse
Ce que recommande la CNIL pour l’IA générative en entreprise
Les questions-réponses de la CNIL dessinent une hiérarchie. Pour des usages non confidentiels, un service grand public peut être envisagé avec des adresses professionnelles dédiées et, le cas échéant, en désactivant la réutilisation des données par le fournisseur. Dès qu’il s’agit de données de clients ou de collaborateurs, l’autorité juge généralement plus sûr un déploiement sur site.
Elle admet aussi qu’installer un modèle en interne coûte cher et que beaucoup d’organisations passeront par le cloud ou par une API, avec un contrat de sous-traitance. Pour l’API, elle recommande d’éviter autant que possible la saisie de données personnelles. Elle rappelle enfin que c’est en général l’organisme qui engage sa responsabilité si son personnel utilise mal l’outil.
La pseudonymisation trouve sa place dans cet entre-deux : on conserve les outils du marché, sans infrastructure à monter, et on limite ce qui leur parvient. Des applications de bureau s’en chargent au moment de l’envoi : sur Mac comme sur Windows, Nonimo repère les noms, numéros d’identité, IBAN et autres données personnelles et les remplace par des marqueurs sur l’ordinateur lui-même, avant que le texte n’atteigne ChatGPT, Claude ou Copilot. C’est la pseudonymisation pour l’IA ramenée au geste de tous les jours.
Déployer la pseudonymisation dans une équipe
Le point de départ est un inventaire honnête des usages. Quels services utilisent déjà l’IA, sur quels documents et avec quels comptes ? La réponse fait souvent apparaître quelques cas récurrents : courriels clients, comptes rendus, contrats, exports de tableurs. Ce sont eux qu’il faut couvrir en priorité, avant de chercher l’exhaustivité sur des usages marginaux qui concernent peu de monde.
Le choix de l’outil se joue ensuite sur un critère simple : il doit s’intégrer là où les gens travaillent déjà, dans le navigateur, la messagerie et les fichiers, sinon il sera contourné. Il faut aussi vérifier où se trouve la table de correspondance, quels identifiants français, du numéro de sécurité sociale au SIRET, sont reconnus et si les documents sont traités au même titre que le texte collé.
Reste la règle écrite, courte et compréhensible par tous : aucune donnée de client ou de salarié ne part vers un assistant sans être passée par la pseudonymisation. Une consigne d’une ligne, illustrée par deux ou trois exemples tirés des vrais usages de l’équipe, se retient mieux qu’un règlement détaillé. Elle mérite d’être relue chaque fois qu’un nouvel outil d’IA entre dans la maison.
