Skip to content

CyberClass > Partie 2 - Données > Côté pile > Fiche concept 2.2.2


📌 2.2.2 Anonymisation et recoupement de données ?

#Pseudonymisation #Anonymisation #DonnéesIdentifiantes #Réidentification #RecoupementDesDonnées #SécuritéNationale #ProtectionDesDonnées #GuerreNumérique #RégulationDesActivitésEnLigne #IngérenceNumérique #Cyberespionnage #Influence

Résumé
  • Pour pouvoir exploiter les données tout en assurant le respect de la vie privée, il faut pouvoir réduire les risques d’identification.
  • La pseudonymisation consiste à remplacer des données directement identifiantes par des données indirectement identifiantes. Elle permet de réduire les risques mais ne garantit pas un anonymat complet, puisqu’il existe toujours une clé de correspondance permettant de réidentifier les individus.
  • L’anonymisation consiste à transformer des données personnelles pour qu’elles ne puissent plus être associées à une personne directement ou indirectement. Elle repose sur trois garanties : empêcher l’individualisation, la corrélation et l’inférence.
  • Il faut ainsi s’assurer que l’on ne puisse pas réidentifier une personne en individualisant, en recoupant des données ou par inférence.
  • Ces techniques à elles seules n’assurent pas un risque zéro.

→ Comment exploiter la richesse des données sans menacer la vie privée ?

La valorisation des données joue un rôle essentiel dans les progrès scientifiques, technologiques et sociaux1. Mais pour les exploiter légalement, sans nuire à la vie privée des individus, il est nécessaire de transformer les données personnelles (1) en données non identifiantes. C'est-à-dire en données qui ne permettent plus d’identifier une personne physique, directement ou indirectement, par quelque moyen raisonnablement envisageable. Il peut s’agir de données purement statistiques ou de données personnelles ayant fait l’objet d’un procédé d’anonymisation supprimant tout lien avec l’identité de la personne concernée.

  1. 🔎 Définition : Une donnée personnelle (ou information personnelle) est toute information se rapportant à une personne physique identifiée ou identifiable. Mais, parce qu’elle concerne des personnes, celles-ci doivent en conserver la maîtrise.

Cette transformation permet de les analyser, de les partager, de les croiser avec d’autres sources ou même de les commercialiser, tout en protégeant les personnes concernées, (voir Partie 2 : Données > Fiche Concept 2.1.1 ; Partie 2 : Données > Fiche Concept 2.2.1)

→ Pseudonymiser ou anonymiser, quelle différence ?

La pseudonymisation et l’anonymisation sont des techniques qui contribuent à la protection de données personnelles dans le cadre de l’utilisation des données à des fins d’innovation ou d’aide à la prise de décision (par exemple, le Health Data Hub en France2,3). Il ne faut cependant pas confondre ces deux techniques : elles altèrent plus ou moins les données, et ne permettent pas le même niveau de protection. Concrètement :

  • la pseudonymisation remplace certaines informations par des identifiants artificiels ;
  • l’anonymisation supprime la possibilité de rattacher la donnée à une personne.

Ces pratiques garantissent que les données conservent leur valeur collective, tout en préservant les droits individuels.

La pseudonymisation

Elle consiste à remplacer des données directement identifiantes par des données indirectement identifiantes, comme un numéro, un alias, un token (1) ou un code4, afin de limiter l’identification directe des personnes concernées.

  1. 🔎 Définition : Techniquement, un token (ou jeton) est un actif numérique qui s'échange sur internet grâce à la technologie de la blockchain. Pour faire simple, c'est l'équivalent numérique d'un jeton de casino ou d'une cryptomonnaie : il a une valeur financière et peut servir à plein de choses, comme acheter un objet virtuel dans un jeu vidéo ou investir dans un projet.

Par exemple, un prénom un prénom peut être remplacé par un code ("Emma" devient P001 et Karim devient P002) dans une base de données pseudonymisée, tandis qu’une table de correspondance conservée séparément et sécurisée permet, si nécessaire, de retrouver l’identité initiale.

Les données pseudonymisées restent donc des données personnelles, car la réidentification demeure possible.

Type de donnée Avant pseudonymisation
(donnée directement identifiante)
Après pseudonymisation
(donnée non identifiante)
Méthode utilisée
Nom et prénom Jean Dupont ID_458726 Remplacement par un identifiant unique
Adresse email jean.dupont@gmail.com utilisateur_01@emailfictif.fr Remplacement par email fictif
Adresse postale 12 rue des Lilas, 75012 Paris Secteur_Paris_12 Agrégation géographique
Numéro de téléphone 06 12 34 56 78 Tél_ID_1002 Remplacement par identifiant
Nom d’élève Lina tok_483xg Tokenisation

→ Qu’est-ce qui caractérise la pseudonymisation ?

  • Processus réversible : les données peuvent être réidentifiées à l’aide d’une information supplémentaire (comme une clé de correspondance).
  • Données indirectement identifiantes : la personne n’est pas identifiable directement, mais une combinaison d’informations peut permettre de la retrouver.
  • Toujours des données personnelles : elles sont soumises aux obligations du RGPD (1).

    1. 🔎 Définition : Le Règlement général sur la protection des données (RGPD) est un texte réglementaire européen qui harmonise les règles de traitement des données à caractère personnel dans toute l’Union européenne. Entré en application en 2018, il vient renforcer et compléter la loi française Informatique et Libertés de 1978 relative à la protection des données personnelles. Le RGPD est guidé par 3 objectifs principaux : renforcer les droits des personnes, responsabiliser les acteurs traitant des données et crédibiliser la régulation grâce à une coopération renforcée entre les autorités de protection des données.
    2. Séparation et protection des informations sensibles : les éléments identifiants (ex : clé, table de correspondance) doivent être stockés séparément et sécurisés.
    3. Compatibilité avec d’autres traitements : contrairement à l’anonymisation, la pseudonymisation permet encore de réaliser des analyses, un suivi ou de répondre aux droits des personnes (ex. droit d’accès ou de rectification).
    4. Attention aux attributs indirects : le simple retrait du nom et du prénom ne suffit pas. Des données comme la date de naissance, le code postal ou la profession peuvent permettre d’identifier une personne.

→ Pseudonymiser, à quoi ça sert ?

La pseudonymisation permet de conserver un lien avec une personne sans la rendre directement identifiable. Par exemple, elle est particulièrement utile :

  • pour suivre un patient dans une étude médicale,
  • pour analyser les réponses de jeunes dans une enquête sur le harcèlement scolaire,
  • ou encore pour répondre à une demande d’accès aux données.

Elle réduit ainsi les risques pour la vie privée tout en préservant la possibilité d’exploiter les données.

Cependant, retirer uniquement le nom et le prénom ne suffit pas à garantir l’anonymat. Une combinaison d’informations comme la date de naissance, l’adresse et la profession peut suffire à réidentifier une personne.

La pseudonymisation constitue donc un premier niveau de protection, mais elle n’assure pas l’anonymat complet. Les données restent des données personnelles, toujours soumises au RGPD, et leur accès doit être strictement limité aux personnes autorisées, après accord, (voir Partie 2 : Données > Fiche Activité 2.2)

L’anonymisation

Elle consiste à transformer des données personnelles de telle sorte qu’elles ne puissent plus être associées à une personne identifiée ou identifiable4. Contrairement à la pseudonymisation, il n’existe plus de clé de correspondance permettant de retrouver l’individu : l’anonymisation est donc (raisonnablement) irréversible.

Type de donnée Avant pseudonymisation
(donnée directement identifiante)
Après pseudonymisation
(donnée non identifiante)
Méthode utilisée
Prénom Emma - Suppression
Date de naissance 12/3/2007 2007 Généralisation
(moins précise)
Temps passé sur Instagram 3h45 par jour 3h30 ou 4h Randomisation
(légère modification)

→ Qu’est-ce qui caractérise l’anonymisation ?

Quelques caractéristiques de l'anonymisation
Quelques caractéristiques de l'anonymisation
- L'anonymisation est (théoriquement) irréversible donc la réidentification des personnes théoriquement (impossible). - Les données anonymisées ne sont plus considérées comme personnelles au sens du Règlement général sur la protection des données (RGPD). - Les données anonymisées perdent en précision. *Nota Bene* : L’efficacité de l’anonymisation doit être évaluée au regard du risque résiduel de réidentification.

→ Données anonymisées, que dit l’Union Européenne ?

Pour qu’un jeu de données soit considéré comme réellement anonymisé, il ne doit plus être possible d’identifier une personne, directement ou indirectement, à partir des données disponibles.

Le CEPD (Comité Européen de la Protection des Données)5 définit trois critères essentiels :

  • L’individualisation : il ne doit pas être possible d’isoler une personne dans un jeu de données.
    Exemple : un profil de santé pseudonymisé peut sembler anonyme, mais si on croise plusieurs caractéristiques (date de naissance, taille, pathologies…), la combinaison peut être unique et permettre d’identifier la personne concernée6.
  • La corrélation : il ne doit pas être possible de relier entre elles plusieurs informations au sein d’un même jeu de données, ou entre plusieurs bases différentes7. Ce risque existe même sans individualisation directe, et peut être amplifié par l’usage de bases publiques ou d’algorithmes d’intelligence artificielle.
    Exemple : Si une base de données scolaire anonymisée contient : Classe : 4e – Ville : Dijon – Passion : Guitare et la base publique d’un réseau social affiche un profil : "Léo, 13 ans, joue de la guitare, habite à Dijon". En croisant ces deux sources, on retrouve l’identité de l’élève dans la base scolaire pourtant anonymisée.
  • L’inférence : il ne doit pas être possible de déduire de nouvelles informations sur une personne8.
    Exemple : Si une base de données indique : 100% des filles de 3e du collège ont signalé être victimes de harcèlement, on peut en déduire que Lina, élève de 3e de ce collège, a été victime de harcèlement. Cette base n'est donc pas anonymisée selon les critères du RGPD.

→ Anonymiser, à quoi ça sert ?

  • Protection renforcée : une fois anonymisées, les données n’ont plus de caractère personnel. On perd en précision, mais on gagne en sécurité.
  • Partage facilité : elles peuvent être diffusées au-delà de leur usage initial, par exemple sous forme de données ouvertes (open data)9.
  • Durée de conservation étendue : si un jeu de données est réellement anonymisé, il n’est plus soumis au RGPD et peut donc être conservé sans limite légale. Mais encore faut-il que l’anonymisation soit garantie10 ! (Voir Partie 2 : Données > Fiche Activité 2.2)

→ C’est quoi les limites de l’anonymisation ?

  • Risque de réidentification par recoupement des données : même anonymisées, les données peuvent parfois être recoupées entre plusieurs sources, permettant d’identifier à nouveau une personne.
  • Croisement avec d’autres bases (réidentification par croisement) : c’est la principale menace contre l’efficacité de l’anonymisation.
  • OSINT (Open Source Intelligence / ROSO) : ces méthodes, qui consistent à recouper des informations publiques en ligne pour profiler un individu, préoccupent la CNIL. Elle alerte sur ces risques et propose des moyens de limiter les atteintes à la vie privée10.

→ Et comment anonymiser correctement ?

Un cas à relever

En 2021, le média catholique conservateur The Pillar a utilisé des données de géolocalisation provenant d'applications de rencontre, comme Grindr, pour identifier et "démasquer" des prêtres homosexuels aux États-Unis. En réalité, il était possible de réidentifier des personnes en recoupant les lieux fréquentés (paroisses, domiciles, bureaux) avec leurs habitudes et horaires de déplacement.11.

Source : Des prêtres gays américains traqués via leurs applications de rencontre, France Inter.

→ Et comment anonymiser correctement ?

Un processus d’anonymisation efficace repose sur plusieurs étapes clés12 :

  • Supprimer les éléments d’identification directe : noms et prénoms, numéros de sécurité sociale, …
  • Traiter avec vigilance les valeurs rares : certaines données rendent une personne unique. Exemple : en 2016, il y avait moins de 2000 personnes de plus de 105 ans sur la France entière. La réidentification est facile.
  • Définir les informations essentielles à conserver : sélectionner les données nécessaires pour atteindre l’objectif de l’analyse, sans garder d’éléments superflus.
  • Ajuster le niveau de précision : trouver le bon équilibre entre protection de la vie privée et utilité des données. Exemple : garder uniquement l’année de naissance plutôt que la date complète.

→ Quelles techniques sont utilisées pour anonymiser ?

Une fois les identifiants directs supprimés, il faut choisir une méthode adaptée. Il existe deux grandes familles :

La randomisation :

Cette méthode consiste à modifier légèrement les données pour les rendre moins précises, tout en conservant les tendances générales.

Elève Temps réel passé sur les réseaux sociaux Temps randomisé
Elève A 3h45 4h10
Elève B 2h 1h50

La randomisation peut consister notamment en l’ajout de bruit (modification de données pour les rendre moins précises) : par exemple, on modifie les âges au hasard entre deux ans de moins et deux ans de plus.

La généralisation :

Cette méthode consiste à regrouper les données dans des catégories plus larges, pour qu’elles ne soient plus spécifiques à une seule personne mais communes à un ensemble.

Données identifiables Avant généralisation Après généralisation
Code postal 75013 75***
Marque de téléphone iPhone 13 Pro Max Smartphone
Activité déclarée Je joue à Fortnite avec mon ami Yacine Je joue à un jeu vidéo avec un camarade
Âge 22 ans entre 20 et 30 ans

La généralisation empêche l’individualisation et limite les corrélations possibles, mais elle n’empêche pas totalement l’inférence : si on connaît le groupe auquel appartient une personne, certaines informations peuvent encore être déduites.

Les techniques d’anonymisation sont à choisir en fonction des objectifs du traitement des données, et en prenant en compte leurs limites et leurs failles cachées13.

→ Au final, quelles sont les bonnes pratiques pour une anonymisation fiable ?

  • Accepter que l’anonymisation parfaite n’existe pas : viser un risque de réidentification raisonnablement faible.
  • Mettre en place une veille régulière et analyser les risques de réidentification.
  • Supprimer les données inutiles avant toute diffusion.
  • Limiter l’accès et protéger les bases de données.

→ Qu'est-ce qu'on peut conclure ?

Dans notre monde ultra-interconnecté, garantir un anonymat parfait est un défi complexe, presque une illusion. L’anonymisation est un outil puissant, mais elle ne suffit pas toujours, à elle seule, à protéger efficacement les données personnelles.

Pour renforcer cette protection, il peut être nécessaire de la combiner avec d’autres techniques : si l’on ne peut pas toujours rendre une donnée invisible, on peut au moins la rendre illisible pour les personnes non autorisées. C’est tout l’enjeu du chiffrement14, (voir Partie 2 : Données > Fiche Concept 2.2.3)



Qu’avez-vous pensé de ce contenu ? Clair : Utile :

Si vous souhaitez nous faire part de vos suggestions d'amélioration contactez-nous !

Envoyer un email à cyberclass@class-code.fr



Pour aller plus loin ?

Fiches concepts liées


Licence

 

🎯 Attribution : Une réalisation collective produite par Class’Code dans le cadre du programme TalCyb. Ce travail a bénéficié d’une aide de l’État gérée par l’Agence nationale de la recherche au titre de France 2030 portant la référence ANR-23-CMAS-0020.

Cette ressource éducative a été produite sous licence CC BY-SA Class’Code 4.0 FR (1) - Publication : janvier 2026 ; Dernière mise à jour : juin 2026.

  1. Creative Commons - Attribution obligatoire et crédit à l’auteur - Liberté d’utilisation et d’adaptation - Pas de restriction spécifique

Licences : CC BY-ND pour les vidéos; CC BY-SA pour l'ensemble des autres contenus


Sources

  1. Titre : Une stratégie européenne pour les données ; origine : eur-lex.europa.eu - Portail d'acces aux lois de l'Union Européen ; date de publication : 19 février 2020 ; date de consultation : 15 janvier 2026

  2. Titre : Qui sommes-nous ? ; origine : Health Data Hub ; date de publication : [s.d.] ; date de consultation : 15 janvier 2026

  3. Titre : La Plateforme des données de santé (PDS) ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : [s.d.] ; date de consultation : 15 janvier 2026

  4. Titre : Recherche scientifique (hors santé) : enjeux et avantages de l’anonymisation et de la pseudonymisation ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 13 janvier 2022 ; date de consultation : 21 janvier 2026

  5. Titre : Le G29 publie un avis sur les techniques d’anonymisation ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 25 janvier 2016 ; date de consultation : 15 janvier 2026

  6. Titre : Qu’est-ce que la ré-identification des données ? ; origine : Code-Garage ; auteur(s) : Nicolas Brondin Bernard ; date de publication : 4 mars 2024 ; date de consultation : 15 janvier 2026

  7. Titre : Quels critères permettent de considérer une donnée comme véritablement anonyme ? ; origine : Octopize ; date de publication : 1 décembre 2021 ; date de consultation : 15 janvier 2026

  8. Titre : Comment anonymiser des données personnelles ? ; origine : Télécom SudParis ; auteur(s) : Maryline Laurent et Nesrine Kâaniche ; date de publication : 13 mars 2023 ; date de consultation : 15 janvier 2026

  9. Titre : L’anonymisation des données, un traitement clé pour l’open data ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 9 octobre 2019 ; date de consultation : 15 janvier 2026

  10. Titre : Recoupement d’informations en ligne : ce que vous publiez peut dévoiler votre vie privée ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 6 février 2024 ; date de consultation : 15 janvier 2026

  11. Titre : Des prêtres gays américains traqués via leurs applications de rencontre ; type de média : podcast et article ; origine : Radio France - France Inter ; auteur(s) : Manon Mariani ; date de publication : 20 mars 2023 ; date de consultation : 15 janvier 2026

  12. Titre : L’anonymisation de données personnelles ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 19 mai 2020 ; date de consultation : 15 janvier 2026

  13. Titre : Au-delà du masque : les failles cachées de l'anonymisation des données ; origine : DPO Partagé ; date de publication : 12 décembre 2023 ; date de consultation : 15 janvier 2026

  14. Titre : Chiffrement, anonymisation et tokenisation ; origine : BlueFinch-ESBD ; date de publication : 12 décembre 2022 ; date de consultation : 15 janvier 2026

See this page is the portal