Aller au contenu

CyberClass > Partie 2 - Données > Côté face > Activité : Profils numériques


🚀 Profils numériques

#CollecteDeDonnées #TracesNumériques #ProfilNumérique #DonnéesPersonnelles #DonnéesSensibles #OSINT #SourcesOuvertes #Métadonnées #Doxing #Cookies #Traceurs #MonétisationDesDonnées #Droits #RGPD #CNIL #Interopérabilité #Doits #BiaisDeConfirmation #IA

Objectifs
  • Se rendre compte de la quantité et de la qualité des informations qui sont disponibles sur Internet et accessibles sans avoir recours à du piratage.
  • Identifier les utilisations possibles et/ou les risques liés aux traces que nous laissons sur Internet.
  • Prendre conscience que nous partageons des informations qui, en fonction du contexte d'utilisation, peuvent produire des effets indésirables.
  • Questionner l’éthique autour de l’utilisation des données disponibles en ligne.

Introduction : le data de plus en plus big !

L'émergence du Big Data s'est accompagnée d'une croissance exponentielle du volume mondial de données. Le volume de données créées, capturées, copiées et consommées est passé de 2 zettaoctets (1 zettaoctet correspond à 10 puissance 21 octets, autrement dit mille milliards de gigaoctets) en 2010 à 18 zettaoctets en 2016, 33 zettaoctets en 2018, 149 en 2024 et 181 zettaoctets en 20251. En 2029, la création mondiale de données devrait passer à plus de 527 zettaoctets selon le site Statista2. Voir Partie 2 : Données > Vidéo d'introduction : Des milliards de données !

Cette croissance est en partie alimentée par l'Internet des objets (IdO), qui désigne le réseau croissant d'appareils et de capteurs connectés générant et échangeant des données en ligne, ainsi que par les intelligences artificielles génératives (1).

  1. 🔎 Définition : L'IA générative est un type de système d'intelligence artificielle capable de générer du texte, des images, des vidéos, de la musique et de l'audio en réponse à des requêtes (prompts).

→ Mais QUI produit toutes ces données ?

Que l'on soit une influenceuse qui gagne sa vie en publiant sur les réseaux, un demandeur d’emploi qui renseigne son profil sur France Travail, un élève de primaire qui fait des recherche sur Internet pour réaliser un exposé sur les grenouilles, sa sœur aînée qui joue à Fortnite toute la nuit, la directrice d'une société privée d'import-export, un infirmier hospitalier qui renseigne une base de données ou encore une experte qui maintient une veille active dans son domaine… nous sommes tous des producteurs de contenus ! (Voir Partie 2 : Données > Fiche Concept 2.1.4)

→ Mais, si je ne publie jamais, comment je produis des données ?

Dès que nous avons une activité en ligne, nous produisons des contenus, des informations, des traces. Certains contenus sont explicitement produits (publications intentionnelles), d'autres sont implicites (traces de nos publications, de nos parcours collectés par les plateformes) et d'autres encore sont hérités (on nous "like" et parfois même, on parle de nous). (Voir Partie 2 : Données > Fiche Concept 2.1.3)

Explorons un peu tout cela.

Dans ce déroulé, nous vous proposons de partir à la découverte de nos traces numériques et d'identifier les principaux canaux (outils ou services) sur lesquels on peut les trouver. Vous découvrirez comment ces données, parfois anodines et dispersées, peuvent devenir de l’information utile pour construire notre fameux profil numérique (1).

  1. 🔎 Définition : Image d’une personne physique sur le Net : c'est sa carte d’identité accessible à tous, constituée de toutes ses traces laissées sur le Web au fil des ans.
Plan de l'activité

Nous vous proposons une enquête en plusieurs étapes, dont chacune peut durer entre 20' et 35'

Les données visibles publiées "volontairement
Activité interactive "Exposition numérique" : vérifiez votre taux d'exposition sur Internet pour réaliser qu'une quantité d'informations de qualités différentes sont disponibles et accessibles à tous, sans avoir recours à du piratage. Utilisez nos différentes thématiques, pour guider vos recherches et (re)trouvez ce qu'Internet sait de vous.

Les données invisibles ou métadonnées publiées "involontairement" Identifier les données invisibles qui créent le profil numérique.

Les données offertes avec notre "consentement involontaire", la monétisation des données Identifier les données non accessibles librement que nous avons consenti à partager, parfois sans en être pleinement conscients.

La compilation automatique des données pour une objectivation des profils "Quand c'est gratuit, c'est moi le produit" : comment nos traces servent à influencer nos comportements.

❺ Enfin, nous vous indiquerons quelques méthodes pour consulter, modifier ou exercer vos droits sur ces données personnelles qui vous concernent.

Note de la rédaction : Cette activité est dense et aborde de nombreux aspects des données qui peuvent paraître éloignés de notre sujet principal : la cybersécurité. Pourtant, ces notions sont essentielles pour comprendre pourquoi les données constituent aujourd'hui un enjeu majeur.
Nous vous proposons une succession logique d’exercices et de fléchage de ressources qu'il nous semble cohérent d'appréhender dans cet ordre et avec ce niveau d'exhaustivité. Libre à vous de ne traiter que certaines étapes ou de réaliser l’ensemble en plusieurs fois.

❶ Les données visibles publiées "volontairement"

Vous vous souvenez peut-être de Marc L. dont le portrait a été brossé fin 2008 par un journaliste qui s'est contenté de collecter des informations publiques trouvées grâce à des recherches sur Google. L’auteur de l’article a dressé un portrait troublant de précision sans même connaître Marc L.3. À l’époque, cet article a enflammé la presse et scandalisé l'opinion.

Presque vingt ans après, qu'en est-il des pratiques de publication des internautes ? Sommes-nous plus sages que Marc L. quand nous utilisons Internet ?

Pour répondre à ces questions, nous vous proposons dans un premier temps, de (re)trouver ce qu'Internet sait précisément de nous. Identité, déplacements, activités ou relations personnelles… Regardons ce qu’il en est concrètement

Pour une expérience optimale, activez le plein écran et cliquez sur les zones interactives.
Évitez d'utiliser la barre inférieure de navigation qui permet de contourner le scénario pédagogique.


Conseils pour l'animation

L'exercice est proposé sous la forme d'une activité multimédia en autonomie mais plusieurs variantes peuvent être imaginées :

  • Choisissez un personnage public (personnalité politique ou du spectacle par exemple) puis répartissez-vous en groupe avec chacun une thématique différente (identité, relations, localisation, activités). Utilisez nos grilles pour faire les recherches en sources ouvertes. Puis regroupez-vous et mettez en commun les informations trouvées pour dresser le profil complet de la personnalité choisie.
  • Tous ensemble, choisissez une thématique pour identifier la démarche de recherche :

    • Comment procéder pour retrouver le nom d'un club sportif ?
    • Sachant qu'une personne a été dans un club sportif, sur quels canaux de diffusion trouver des traces de son passage ?
    • Peut-on connaître la ville d'habitation d'un individu à partir de sa date de naissance ?
    • Quelles informations peuvent être trouvées ou retrouvées sur LinkedIn ? Sur Instagram ?

À vous d'en imaginer d'autres !

→ On fait un bilan de cette activité ?

Toutes les données ne se valent pas : certaines sont des données de moindre importance, d'autres sont dites "personnelles", et ces données personnelles (1) peuvent même être caractérisées par la loi comme étant des données sensibles (2). Il est donc important de savoir les distinguer et de réfléchir avant de les rendre accessibles à tous. (Voir Partie 2 : Données > Fiche Concept 2.1.2)

  1. 🔎 Définition : Toute information se rapportant à une personne physique identifiée ou identifiable. Parce qu'elle concerne des individus, une donnée personnelle ne doit pas être collectée, utilisée ou partagée sans garanties et son utilisation doit rester maîtrisée par les personnes concernées.
  2. 🔎 Définition : Catégorie particulière de données personnelles dont le traitement est particulièrement encadré par le RGPD en raison de leur caractère sensible. Elles concernent notamment la prétendue origine raciale ou ethnique, les opinions politiques, les convictions religieuses ou philosophiques, l'appartenance syndicale, ainsi que les données génétiques, les données biométriques utilisées pour identifier une personne de manière unique, les données de santé et les informations relatives à la vie sexuelle ou à l'orientation sexuelle d'une personne physique.

Ayant exploré notre profil Internet, nous avons maintenant une vision plus concrète de ces traces que nous laissons. Plus elles s'accumulent, plus elles deviennent des informations qui nous décrivent avec une précision parfois surprenante… (Voir Partie 2 : Données > Fiche Concept 2.1.1)

Résumé
  • À partir de données de base comme un nom, un prénom ou une ville, il est possible d’accéder à une grande variété d’informations disponibles publiquement sur Internet.
  • Une grande quantité de données sont visibles et consultables par tous sur le Web.
  • Toutes les données que nous produisons via un "like", une photo de vacances, le commentaire d'un post… deviennent des informations dès qu'elles sont regroupées, croisées, contextualisées : en corrélant différentes sources et/ou ressources on peut ainsi dresser un profil très détaillé d’une personne.
  • La diversité d’informations publiques et accessibles en ligne s’explique par la multiplicité des plateformes que nous utilisons au quotidien.

Plus notre exposition est importante, plus la probabilité d'une utilisation malveillante de nos informations personnelles s'accroît.

Comme Marc L., nous nous croyons à l'abri dans cet espace anonyme, cachés derrière nos écrans… mais le cyberespace (1) stocke et se "souvient".

  1. 🔎 Définition : Espace virtuel constitué par les infrastructures interconnectées relevant des technologies de l'information, notamment l'Internet. C'est l’ensemble des équipements, des applications, des données numériques, des communications et des transactions qui existe grâce aux ordinateurs, à Internet et à tous les autres appareils connectés.

Allons maintenant un peu plus loin pour mieux comprendre les enjeux de sécurité liés à cette masse de données accessibles.

❷ Les données invisibles ou métadonnées publiées "involontairement"

Il existe aujourd'hui une méthode de collecte et d'analyse d'informations appelée OSINT (Open Source Intelligence) ou ROSO (Renseignement d’Origine Sources Ouvertes), qui consiste à chercher des renseignements en s'appuyant exclusivement sur des informations librement accessibles au public, notamment sur Internet, les réseaux sociaux, les médias ou les bases de données ouvertes. Le principe pour les enquêteurs et les enquêtrices qui l'utilisent, professionnels ou non, est de collecter, croiser, organiser et analyser ces données numériques disponibles pour en tirer des renseignements utiles.

→ Un exemple de recherche OSINT ?

La CNIL propose une vidéo de démonstration4 (~6min), qui montre clairement comment la méthode OSINT peut être utilisée pour une réidentification (1) via Internet et à partir d'une seule photo !

  1. 🔎 Définition : Processus par lequel une personne est identifiée à partir de données anonymisées ou pseudonymisées grâce au croisement de plusieurs sources d'information. La réidentification par recoupement consiste à croiser plusieurs informations (photo, données de géolocalisation, relations, abonnements, centres d'intérêt, etc.) afin de parvenir à identifier la personne concernée.

Pour faire votre propre expérience, la Forge des communs numériques éducatifs5 (accessible sans compte) ou THE OSINT PROJECT6 (accessible via un compte) proposent des défis progressifs qui pointent les enjeux de sécurité numérique relatifs à la démarche appliquée.

Voici une sélection de défis proposés par la Forge des communs numériques éducatifs que nous vous recommandons7 :

  • Challenge À vélo (temps estimé ~10min)8 : ce défi vous propose de retrouver plusieurs éléments géographiques en partant d’une simple photo. Nous vous invitons à le tester en retrouvant les éléments suivants :
    • Quel est le nom de cette piste cyclable ?
    • Quelles sont les deux villes aux extrémités de la piste ?
  • Challenge Quelle vue ! (temps estimé ~10min)9 : ce défi vous propose de géolocaliser un lieu et de retrouver plusieurs éléments spécifiques en partant d’une simple photo. Nous vous invitons à le tester en retrouvant les éléments suivants :

    • Combien de marches ai-je montées ?
    • Quel est le nom du phare que l’on voit au large ?
  • Challenge git ou les secrets de la Forge (temps estimé ~10min)10 : ce défi vous propose de retrouver des noms de projet ou des propriétaires de fichiers en explorant un site en ligne de gestion de fichiers et en fouillant dans les dossiers. Nous vous invitons à le tester en retrouvant l'élément suivant :

    • Quel est le nom de cette fameuse équipe de cybersécurité ?
Conseils pour l'animation

Cette approche ludique et concrète permet de mobiliser les éléments et informations rencontrés dans la première activité interactive et d'introduire le concept de métadonnées.

Même si nous ne vous proposons qu'une sélection de défis OSINT, libre à vous de les réaliser tous ! Visitez la plateforme de challenges OSINT pour en découvrir d'autres11 : vous pouvez choisir le niveau des défis en fonction de votre niveau d'expertise.

Ces défis peuvent être proposés en introduction ou en conclusion de l'activité précédente.

→ On fait un bilan de cette activité ?

Les éléments collectés proviennent de sources variées, parfois explicites, parfois implicites et parfois même héritées. La recherche repose autant sur la logique que sur l’attention portée aux détails. Elle mobilise différents types de supports numériques qui sont accessibles publiquement. Ces défis mettent en évidence la diversité des moyens qui permettent d’accéder à une information : observation d’images, lecture de textes, exploration de profils ou analyse de métadonnées (1). (Voir Partie 2 : Données > Fiche Concept 2.1.3)

  1. 🔎 Définition : Données qui apportent des informations sur d’autres données. Par exemple, dans un email, les métadonnées sont la date, l'heure, l'expéditeur, le destinataire, l'objet, etc. ; dans une conversation en ligne, la date et l'heure de l’échange, les adresses IP des participants, la géolocalisation approximative sont des métadonnées.

L’OSINT n'est pas une méthode illégale car toutes les données utilisées sont des données publiques accessibles en ligne. Mais questionnons notre éthique lors de cette collecte d'informations. Que voulons-nous savoir sans nous adresser directement à la personne concernée ? Pourquoi ? Que voulons-nous faire des informations trouvées ? N'y a-t-il pas d'autres moyens moins "intrusifs" d'obtenir ces informations ?

Côté légalité : trouver et collecter ces informations ne nous donne pas le droit de les diffuser ou de les utiliser à des fins commerciales et/ou non autorisées ou sans le consentement des personnes concernées. Même si elles sont accessibles publiquement, la divulgation de données personnelles qui pourraient affecter la vie privée ou la sécurité des personnes concernées est interdite par le RGPD (1). (Voir Partie 2 : Données > Fiche Concept 2.1.3)

  1. 🔎 Définition : (Règlement général sur la protection des données) Règlement européen qui protège les données personnelles des citoyens de l'Union européenne. Il encadre la manière dont les organisations collectent, utilisent, conservent et partagent ces données, tout en garantissant aux personnes concernées plusieurs droits sur leurs informations.

Enfin, rappelons que le doxing, qui consiste à diffuser publiquement des informations personnelles (même si ces informations ont été obtenues légalement) est puni par la loi (article 223-1-1 du Code pénal). (Voir Partie 2 : Données > Fiche Concept 2.2.1)

Résumé
  • Les métadonnées ou informations de descriptions de contenu numérique, accompagnent de façon "invisible" des informations publiées volontairement.
  • L'OSINT (ROSO en français) est une méthode de recherche qui peut-être utilisée professionnellement pour mener des enquêtes. Cette recherche de renseignements s'appuie exclusivement sur des informations disponibles en sources ouvertes et publiques.
  • L'accès à une donnée publique ne donne aucun droit sur son utilisation et sa divulgation. Sans autorisation, ces actions sont punies par la loi.

Toutes nos données personnelles racontent une histoire : la nôtre. Reste à savoir avec qui nous souhaitons réellement partager notre récit.

Nous avons vu que nombre de nos données personnelles sont en ligne, accessibles et ouvertes. Mais certaines ne le sont pas. Nous ne les avons partagées qu'à des tiers de confiance. Et nous avons aussi accepté d'en confier à des éditeurs d'applications ou de services qui les réclament pour faire fonctionner leur offre correctement.

Observons maintenant ces données que nous partageons : comment sont-elles utilisées ?

❸ Les données offertes avec notre "consentement involontaire" ou la monétisation des données.

Et si nous parlions un peu de consentement ? Lisez donc cet article éclairant sur les pratiques de grandes entreprises qui recueillent notre consentement pour la collecte de nos données en jouant sur l’utilisation de termes peu accessibles à la compréhension de la majorité des utilisateurs12.

Afin de garantir leur bon fonctionnement, de nombreuses applications nous demandent, sous différentes formes, notre accord pour accéder à des données personnelles. À commencer par la fameuse fenêtre dans laquelle on nous demande : "Tout accepter / Personnaliser / Refuser ?" Qu'il s'agisse de cookies, de traceurs, de conservation d'historique, de géolocalisation… Combien d'entre nous donnons notre accord "automatiquement" sans lire les conditions d'utilisation de ces données ?

→ Moi j’accepte TOUT ! Les services ont besoin de ces informations pour fonctionner correctement, non ?

Prenons l’exemple de la géolocalisation. Il semble évident que les applications de cartographie aient besoin des données GPS lorsque nous cherchons un restaurant ou un magasin "à proximité". Mais pourquoi notre application de gestionnaire de cartes de fidélité en a besoin ? Et notre application de pense-bêtes ?

Vérifiez vous-même les éléments suivants :

  • Allez dans les "Paramètres" de votre téléphone, cherchez l’onglet "Localisation" ou dans "Applications" la page qui liste les "autorisations des applications" : regardez combien d'applis vous géolocalisent et vérifiez le rapport avec le service qu'elles proposent…
  • Fouillez un peu plus dans les "autorisations des applications" : quelles applications ont l’autorisation d'accès à votre appareil photo? Est-ce que des applications de transports ont vraiment besoin d’un accès direct à vos photos de vacances ?

Combien de ces applications ont accès à la géolocalisation, à l'appareil photo, au microphone ou à nos contacts et cela, en permanence, pas seulement quand elles sont activées ! Si ces autorisations sont affichées et activées, c'est obligatoirement que vous y avez consenti… volontairement ?! N'hésitez pas à modifier ces paramètres s’ils vous semblent incohérents et/ou intrusifs.

Observons maintenant de plus près le fonctionnement de ces traceurs13 (pixel espion, script de suivi ou cookies).

Les cookies, on connaît : ces mini-fichiers, conçus pour faciliter la communication entre notre appareil et le serveur d'un site web. Ils récoltent un identifiant, une date, un nom de serveur. Ajoutez-y l'ensemble des autres traceurs et cela augmente considérablement les collectes d’information. Conçus tout d'abord dans le but d'améliorer l'expérience client, ils servent également à mesurer l'audience ou encore à collecter des données utiles aux rapports statistiques (voir Partie 2 : Données > Fiche Concept 2.1.3). Ils peuvent être fonctionnels, nécessaires, de performance, publicitaires

Mais qu'est-ce qu'ils collectent ? Quels sont ces fameux partenaires ou ces sites tiers avec lesquels ils échangent des informations ? Et d’ailleurs, qu’est ce qu’ils échangent comme informations ?

Aujourd’hui, de plus en plus d’outils permettent d’identifier ou d’analyser en temps réel les cookies et traceurs téléchargés sur nos appareils au gré des sites que nous visitons. Nous vous proposons de vous rendre sur le site de Cookieviz proposé par la CNIL14 et d’installer l’extension correspondante à votre navigateur internet préféré (il est aussi possible de télécharger l’application CookieViz localement15). Ensuite, reprenez simplement votre routine de navigation : vous pourrez visualiser en direct les échanges de données entre les sites visités et les fameux partenaires tiers.

Certes, les traceurs rendent la recherche plus rapide, ils adaptent les interfaces de nos boutiques en ligne pour mieux nous servir, mais ils enregistrent aussi notre activité de navigation, comparent les sites visités, etc. Bref, ils analysent nos comportements et font évoluer en temps réel notre profil numérique.

Conseils pour l'animation

Cette activité peut être proposée en introduction d’un atelier sur la traçabilité numérique. Voici quelques variantes possibles après l'installation de l’extension Cookieviz14 :

  • En groupe : répondez aux questions suivantes :
    • Quelles lois encadrent la collecte et la diffusion des données personnelles en France ? En Espagne ? Au Canada ?
    • Quels types de données sont collectés via les cookies ?
  • En autonomie : visitez des sites utilisés régulièrement par les internautes (sites d’actualité, boutiques en ligne, plateformes de streaming…) et analysez les informations récoltées.
  • Pour un bilan collectif, interrogez-vous : quels sont les sites tiers identifiés ? Combien en a t-on trouvé ? Lesquels sont les plus fréquents ?

Pour finir ? On pourrait lancer une discussion sur la transparence de ces pratiques commerciales et/ou commencer à s'interroger sur la monétisation de nos données personnelles.

→ Ça ne me semble pas bien grave… En quoi j'ai tort ?

Vous vous dites peut-être : "Que tout soit enregistré ou tracé, si je n’ai rien à cacher, où est le problème ?"

Le véritable enjeu commence à partir du moment où ces données se cumulent et subissent un traitement d'optimisation par ceux qui les collectent (voir Partie 2 : Données > Fiche Concept 2.2.1). Ces informations (qui en disent long sur nous) commencent alors à nous échapper. À partir de là, elles ne concernent plus seulement notre personne, mais s’inscrivent dans un système plus large qui implique également les autres. En effet, nos données sont utilisées pour hiérarchiser, comparer, classer ; elles servent à mettre en parallèle des profils, des comportements, des opinions… Une fois croisées, agrégées et analysées, ces données sont revendues, avec notre "accord" (et à notre insu), à des tiers qui les transforment à leur tour pour mieux nous cibler encore. Nos différences se réduisent à un "échantillon représentatif" qui correspond de plus en plus parfaitement à un catalogue d'offres de plus en plus minces, excluant les données "atypiques"… (Voir Partie 3 : Réseaux > Fiche Concept 3.1.3)

Les données personnelles ont une valeur marchande, on parle de monétisation des données (1) :

  1. 🔎 Définition : Pratique consistant à générer des revenus à partir de données collectées. Elle peut prendre différentes formes, comme la vente de données, l'exploitation d'informations à des fins publicitaires ou l'amélioration de produits et services grâce à l'analyse des données.

  2. La convoitise des courtiers en données (data brokers) et des agences publicitaires qui améliorent sans cesse leurs outils de collecte en sont la preuve. Une fois récoltées, elles permettent aux plateformes de ventes de produire moins tout en vendant davantage.

  3. Collecter des données personnelles est un des principaux objectifs des cyberattaquants car elles leur permettent à la fois d'en tirer un profit financier mais aussi de les utiliser pour influencer le comportement des individus.

Si vous souhaitez un autre exemple de la manière dont la collecte de vos données orientent vos choix, prenez aussi le temps d’explorer le webdocumentaire "Do Not Track" d’Upian16. Pas à pas, les exemples se personnalisent, utilisant les informations récoltées clic après clic par les cookies et traceurs. Cette mise en image de l'intrusion dans notre vie privée, par la collecte et l’utilisation des données, permet de visualiser l'économie du Web sous-jacente.

Penchons-nous un peu sur le marché de la donnée : nos activités numériques génèrent chaque année toujours plus de données qui alimentent une économie fondée sur leur exploitation. Selon le Siècle Digital :

"En 2023, le marché de la data en France a dépassé 2,7 milliards d’euros et devrait continuer à croître à un rythme soutenu de 4% par an jusqu’en 2026 au moins17."

Résumé
  • L'accès à nos données peut être nécessaire pour certains éditeurs numériques, mais d'autres les récoltent à leurs propres fins indépendamment du service proposé. Il est essentiel de contrôler les autorisations que l’on accorde aux applications.
  • Les traceurs d'aujourd'hui se divisent en plusieurs catégories selon leurs utilités, leurs fonctions, leurs objectifs… Soyons conscient de leurs impacts sur nos données personnelles et donc sur notre vie privée.
  • Au fil de nos navigations, et selon nos propres consentements, nos habitudes et nos préférences sont collectées, croisées, analysées et revendues à des tiers, tissant une véritable toile d’échanges commerciaux de données personnelles.
  • Nos données personnelles, après traitement, impactent certaines de nos actions bien au-delà de leur contexte initial.
  • Mieux nous "connaître" sert aussi aux cyberattaquants à mieux nous manipuler.

Dans le registre commercial, les données récoltées peuvent donc être utilisées pour mieux cibler des offres, mieux nous influencer, mieux nous pousser à l'acte… Et pas seulement à l'acte d'achat.

Voyons maintenant ensemble comment les humains s'appuient sur les "machines" pour aller encore plus loin dans la définition d'un profil numérique.

❹ La compilation automatique pour une objectivation des profils

Cela vous est déjà arrivé, en rencontrant une personne pour la première fois, d'imaginer ses goûts musicaux, ses hobbies ou sa profession ?
Demandez-vous sur quels critères vous vous appuyez pour motiver ces ressentis ?

Voici quelques photomontages réalisés par nos soins :

1 2 3 4 5
Photo 1 Photo 2 Photo 3 Photo 4 Photo 5
photo1 photo2 photo3 photo4 photo5
Photo 6 Photo 7 Photo 8 Photo 9 Photo 10
photo6 photo7 photo8 photo9 photo10

Pouvez-vous répondre à une ou plusieurs de ces questions :

  • Où habitent les personnages des photos 1, 2, 9 et 10 ?
  • Qui touche le meilleur salaire parmi les personnages des photos 3, 5 et 7 ?
  • Classer les photos 4, 6 et 8 du plus jeune au plus âgé ? Justifiez vos réponses.

Téléchargez (exportez) ces photos et téléversez-les (importez) sur le site internet suivant : They See Your Photos18. Aviez-vous vu juste ?

Et encore : pouviez-vous imaginer autant de détails sur une personne à partir d'une simple photo ?

Conseils pour l'animation

Très ludique et efficace, cette activité est un bon point de départ pour parler des algorithmes d'analyse, à la base des intelligences artificielles.

Une variante de cette activité en sous-groupes :

  • Donnez une photo différente par groupe afin d'imaginer le profil de la personne représentée : quel est son âge, son métier, ses loisirs, son style de vie ? Trouvez les arguments qui justifient ces projections.
  • Faites circuler les photos entre les groupes.
  • Regroupement : observez ensemble si certaines projections sont semblables ou si, au contraire, elles sont très différentes d’un groupe à l’autre.
  • Enfin, chargez chaque photo sur le site They See Your Photos18 et comparez les projections des participants avec celles générées par l’intelligence artificielle.

→ Mais comment peut-on affirmer autant de choses à partir d'une simple photo ?

Ce site utilise l’outil Google Vision API, une technologie d’intelligence artificielle capable d’analyser une image pour en extraire des éléments comme des objets, des lieux et même l'émotion sur un visage ! L'application analyse des éléments visibles ou invisibles (métadonnées) pour identifier les personnes et les environnements.

→ Il analyse d'accord, mais comment il conclut ?

L'analyse d'une simple photo peut dévoiler de nombreuses informations. Sur quoi s'appuie cette analyse ? Sens de l'observation ? Stéréotypes ? Préjugés ? Déterminisme social ? Influence culturelle ? Biais d'interprétation ? … Tout à la fois ?

L’API utilise des machines capables de calculer de plus en plus rapidement et tire des conclusions grâce à des algorithmes entraînés à déduire des informations à partir de données brutes. Ajoutez à cela une masse suffisamment importante de données et le tour est joué !

Nous comprenons mieux maintenant pourquoi nos données personnelles ont de la valeur… Plus des informations précises et réelles sont amassées pour servir d'entraînement aux intelligences artificielles, plus le résultat, par recoupements statistiques, s'approchera d'une réalité plausible. Et nous sommes évidemment influencés par une proposition émanant de ce type de calcul, car elle renforce notre sentiment d'appartenance et notre biais de confirmation (1) : le modèle type est de plus en plus proche de la vision (idéale ?) que nous avons de nous-même. (Voir Partie 3 : Réseaux > Fiche Concept 3.1.3)

  1. 🔎 Définition : Mécanisme cognitif qui désigne la tendance à privilégier les informations qui confirment nos croyances et à écarter celles qui les remettent en question.

Mais… n'est-ce pas déjà le principe des réseaux sociaux que nous favorisons ? La hiérarchisation automatisée de l'information renforcée par la mise en place des algorithmes d'analyse (notamment pour évaluer la "valeur" des posts sur les réseaux sociaux), donne un impact inattendu à une simple remarque, impact que nous n’avions pas forcément imaginé, ni souhaité. Ainsi, le cyberharcèlement peut prendre des proportions très graves car sur les réseaux sociaux l’information circule rapidement et peut être amplifiée par les algorithmes.

Résumé
  • Une simple photo peut révéler bien plus qu’il n’y paraît, car elle intègre une grande quantité de données qui, croisées avec d'autres, tracent les contours d’un profil type : utilisateur, consommateur, sensibilité politique, niveau de revenus, habitudes, etc.
  • Des algorithmes d'analyse automatisent les processus de recoupement des données pour mieux "optimiser" les résultats recherchés. On peut se demander quelle est la valeur réelle des résultats ainsi obtenus.

Finalement, notre profil numérique est la combinaison de ce que nous laissons volontairement en accès public, couplé aux traces que nous laissons involontairement derrière nous.

Voyons maintenant quels sont nos recours pour mieux protéger nos données.

❺ Consulter, modifier ou supprimer des données qui nous concernent.

→ Mais quel est réellement mon pouvoir sur la non divulgation de ces données ?

Quel niveau de contrôle avons-nous réellement sur les traces que nous produisons sur Internet ?
* Comment limiter la collecte de nos données à ce qui est réellement nécessaire ?
* Peut-on modifier nos choix de partage ?
* Peut-on supprimer des données déjà partagées ?

Explorons le droit à la portabilité des données19 qui nous permet de demander à récupérer des données personnelles que nous avons déjà fournies à une plateforme, le tout, dans un format lisible par une machine. (Voir Partie 2 : Données > Fiche Concept 2.1.3)

Ce droit est de nature à encourager l’interopérabilité (1) des formats de données utilisés par les prestataires de services et ainsi donner aux personnes concernées, la possibilité d'en changer facilement. Par exemple, une personne peut demander à une plateforme telle que Deezer de lui communiquer ses données afin de les transférer ensuite à Spotify.

  1. 🔎 Définition : Aptitude de systèmes informatiques, logiciels ou équipements différents à communiquer et à échanger des informations de façon fiable grâce à des standards communs. Elle favorise le partage sécurisé des données et la coopération entre les acteurs d'un même écosystème.

Faire valoir ce droit, très pratique pour nous, implique que nous acceptons volontiers de partager nos informations à des tiers. D'autant plus que ce droit permet aussi de fournir des données utiles à la recherche et à l’amélioration des services. Mais cela ouvre également la porte à ceux qui utilisent notre consentement au partage de données pour les utiliser à notre insu.

L’artiste Albertine Meunier publie régulièrement son historique de recherche Google, faisant un objet artistique de ce témoin de ses traces numériques. Elle élabore ici un pas à pas pour consulter et télécharger toutes nos recherches Google sous un format lisible20.

Nous vous invitons à l'utiliser pour visualiser vos propres traces. Et puis, pour aller un peu plus loin dans l'expérience, nous vous proposons de regarder en détail vos données personnelles qui sont archivées par votre compte Google (si vous en possédez un) ou sur l'un de vos réseaux sociaux favoris.

Pour récupérer les archives personnelles de vos comptes, plusieurs modes d'emploi sont disponibles. Nous ne citerons que le site Démarches Administratives qui rassemble les outils numériques les plus couramment utilisés et qui propose notamment un mode d’emploi pour chaque plateforme21.

Google étant le plus couramment utilisé (si, si…), voici la démarche que nous vous proposons :

  • Tout d'abord, rendez-vous sur l’espace de configuration "Données et confidentialité" de votre compte Google22.
  • Regardez toutes les informations dont Google dispose, ainsi que les autorisations de partage accordées à d’autres applications ou services de synchronisation.
  • Explorez les paramètres de votre historique : votre activité sur le Web, les applications utilisées… Pouvez-vous trouver l’historique complet YouTube ?

Allons plus loin et regardons les données partagées !

  • Rendez-vous sur le site Google Takeout23.
  • Sélectionnez les contenus que vous souhaitez explorer, puis faites une demande d'extraction des données de votre compte Google.
  • Attendez quelques minutes à quelques jours, selon la quantité d’informations que Google possède sur vous,
  • Enfin, prenez le temps d'explorer ces données.
Conseils pour l'animation

Répondre à une seule de ces questions est l'occasion d'approfondir les enjeux de l'utilisation de nos données personnelles numérisées.

  • De combien d'informations dispose ce site ?
  • Pouvez-vous retrouver les lieux que vous avez visités ?
  • Combien d'informations personnelles partagez-vous ? Avec qui ?
  • Quels sont les services et applications que vous utilisez via cette plateforme ?

C'est peut-être même l'occasion de se poser la question du patrimoine numérique (que faire de mes données après ma mort) ?

Résumé
  • Vous avez le droit d'accéder à l'ensemble de vos données personnelles auprès de ceux qui les détiennent.
  • Vous pouvez, dans certains cas, récupérer vos données personnelles dans un format lisible par une machine, afin d'être en mesure de les réexploiter vous-même.

Bien sûr, il existe de nombreux autres droits relatifs à l'utilisation de vos données personnelles. (Voir Partie 2 : Données > Fiche Concept 2.1.3)

  • Le droit à l’information
  • Le droit de rectification
  • Le droit d'accès
  • Le droit d'opposition
  • Le droit à l'effacement
  • Le droit au déréférencement

Tous ces droits font partie du RGPD et sont garantis par la CNIL (1) qui met à disposition sur son site toutes les informations utiles sur le sujet24,25.

  1. 🔎 Définition : Acronyme de Commission nationale de l'informatique et des libertés. Autorité administrative indépendante, la CNIL est chargée de veiller à la protection des données personnelles et au respect de la réglementation applicable en France, notamment du RGPD et de la loi Informatique et Libertés.

Terminons avec cette citation du professeur Shoshana Zuboff, enseignante à l'université de droit à Harvard, un peu provocatrice certes, mais qui peut aussi permettre de lancer un débat autour de l'utilisation de nos données personnelles :

"Bienvenue dans le capitalisme de surveillance ! Les géants du Web [...] ne cherchent plus seulement à capter toutes nos données, mais à orienter, modifier et conditionner tous nos comportements : notre vie sociale, nos émotions, nos pensées les plus intimes... jusqu’à notre bulletin de vote. En un mot, décider à notre place à des fins strictement lucratives." Shoshana Zuboff, podcast Radio France26

Conclusion : nos données personnelles sont précieuses…

Nos données sont précieuses, elles sont l’essence même de notre profil numérique. Le profilage (1) nous sert, comme il nous dessert : soyons conscients qu’il nous appartient de savoir comment on utilise nos données, de connaître nos droits sur elles et de les exercer le cas échéant.

  1. 🔎 Définition : Utiliser les données personnelles d’un individu en vue d’analyser et de prédire son comportement, comme par exemple déterminer ses performances au travail, sa situation financière, sa santé, ses préférences, ses habitudes de vie, etc.

Mais revenons à notre sujet principal : la cybersécurité. Les attaques d’ingénierie sociale (1), le harcèlement, l’usurpation d'identité, le doxing, le ciblage des vendeurs qui connaissent nos points faibles, les cambriolages pendant nos vacances exposées sur nos réseaux sociaux… toutes ces attaques commencent par la collecte de nos données personnelles…

  1. 🔎 Définition : Ensemble de méthodes utilisées pour obtenir des informations, des accès ou des autorisations, en exploitant des techniques de manipulation psychologique. Les attaquants tirent parti de traits humains spécifiques, tels que la confiance, la curiosité ou la peur, afin de passer outre la vigilance des utilisateurs.

En poursuivant notre parcours, nous reviendrons sur les enjeux de l’exploitation des données et nous découvrirons comment elles peuvent et doivent être protégées. Voir Partie 2 : Données > Vidéo : Interview d'expert – Gaston Gautreneau.



Qu’avez-vous pensé de ce contenu ? Clair : Utile :

Si vous souhaitez nous faire part de vos suggestions d'amélioration contactez-nous !

Envoyer un email à cyberclass@class-code.fr





Pour aller plus loin ?

Fiches concepts liées
Ressources complémentaires :
Licence

 


🎯 Attribution : Une réalisation collective produite par Class’Code dans le cadre du programme TalCyb. Ce travail a bénéficié d’une aide de l’État gérée par l’Agence nationale de la recherche au titre de France 2030 portant la référence ANR-23-CMAS-0020.

Cette ressource éducative a été produite sous licence CC BY-SA Class’Code 4.0 FR (1) - Publication : janvier 2026.

  1. Creative Commons - Attribution obligatoire et crédit à l’auteur - Liberté d’utilisation et d’adaptation - Pas de restriction spécifique

Licence CC BY-SA Class’Code 4.0 FR

Sources

  1. Titre : Lettre de la DAJ – Explosion des données numériques ; origine : economie.gouv.fr - les Ministères Économiques et Financiers ; date de publication : 9 février 2023 ; date de consultation : 12 janvier 2026

  2. Titre : Data generation volume worldwide 2010-2029 ; origine : Statista ; auteur(s) : Petroc Taylor ; date de publication : 19 novembre 2025 ; date de consultation : 12 janvier 2026

  3. Titre : Marc L. Genèse d’un buzz médiatique ; origine : Le tigre ; auteur(s) : Raphaël Meltz ; date de publication : 28 avril 2009 ; mise à jour : 16 mai 200 ; date de consultation : 12 janvier 2026

  4. Titre : VIDÉO OSINT : Le Renseignement en Sources Ouvertes pour la réidentification sur Internet ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; auteur(s) : cnil_video ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  5. Titre : La Forge des communs numériques éducatifs - Création, mutualisation et partage de ressources éducatives libres ! Par et pour les enseignants, mais pas seulement. ; origine : cybersecurite.forge.apps.education.fr - La Forge des communs numériques éducatifs ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  6. Titre : The Osint Project ; origine : The Osint Project ; auteur(s) : Campus Cyber ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  7. Titre : Liste des challenges - CyberSécurité - Catégorie OSINT ; origine : cybersecurite.forge.apps.education.fr - La Forge des communs numériques éducatifs ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  8. Titre : À vélo - CyberSécurité - Catégorie OSINT ; origine : cybersecurite.forge.apps.education.fr ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  9. Titre : Quelle vue ! - CyberSécurité - Catégorie OSINT ; origine : cybersecurite.forge.apps.education.fr ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  10. Titre : Git ou les secrets de la Forge - CyberSécurité - Catégorie OSINT ; origine : cybersecurite.forge.apps.education.fr ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  11. Titre : Introduction - CyberSécurité ; origine : cybersecurite.forge.apps.education.fr ; auteur(s) : La Forge des communs numériques éducatifs - AEIF ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  12. Titre : Nouvelles sanctions pour Google : vos données personnelles en danger ? ; origine : Haas Avocats ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  13. Titre : Traceurs et vie privée : quels efforts à faire pour une navigation respectueuse de la vie privée ? ; origine : RiskInsight ; auteur(s) : Marine Maitre ; date de publication : 2019 ; date de consultation : 12 janvier 2026

  14. Titre : Evaluer la protection de votre navigateur au moyen de l’extension CookieViz ; origine : LINC – Laboratoire d’Innovation Numérique de la CNIL ; auteur(s) : Jérôme Gorin et Line Gallen ; date de publication : 5 décembre 2022 ; date de consultation : 12 janvier 2026

  15. Titre : CookieViz 2.3 : une nouvelle version plus sécurisée, plus stable et une mise en avant du rôle des intermédiaires ; origine : LINC – Laboratoire d’Innovation Numérique de la CNIL ; auteur(s) : Jérôme Gorin ; date de publication : 8 juin 2022 ; date de consultation : 12 janvier 2026

  16. Titre : Do Not Track ; origine : Do Not Track ; auteur(s) : Brett Gaylor, Vincent Glad, Zineb Dryef, Richard Gutjahr, Christiane Miethge, Sandra Rodriguez, Virginie Raisson, Akufen et al. ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  17. Titre : Le marché de la data en 2025 : Quel état ? ; origine : Siècle Digita ; auteur(s) : Frédéric Olivieri ; date de publication : 1 juillet 2025 ; date de consultation : 12 janvier 2026

  18. Titre : They See Your Photos ; origine : They See Your Photos ; date de publication : 2024 ; date de consultation : 12 janvier 2026

  19. Titre : Le droit à la portabilité : obtenir et réutiliser une copie de vos données ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 25 mai 2018 ; date de consultation : 12 janvier 2026

  20. Titre : Télécharger toutes vos recherches Google sous un format lisible ; origine : Albertine meunier ; auteur(s) : Albertine Meunier ; date de publication : 2018 ; date de consultation : 12 janvier 2026

  21. Titre : Comment récupérer ses données personnelles personnelles collectées par les réseaux sociaux ? ; origine : DemarchescAdministratives ; auteur(s) : La Rédaction de DemarchesAdministratives.fr ; date de publication : [s.d.] ; mise à jour : 31 mars 2020 ; date de consultation : 12 janvier 2026

  22. Titre : Données et confidentialité ; origine : Google Compte ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  23. Titre : Données et confidentialité ; origine : Google Takeout ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  24. Titre : Les droits pour maîtriser vos données personnelles ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : [s.d.] ; date de consultation : 12 janvier 2026

  25. Titre : Les droits des personnes sur leurs données ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 31 mai 2023 ; date de consultation : 12 janvier 2026

  26. Titre : Entretien avec Shoshana Zuboff : les mutations du capitalisme de surveillance à l'ère de l'IA ; type de média : podcast ; origine : Radio France - France Culture ; date de publication : 31 mai 2024 ; date de consultation : 12 janvier 2026

Voir la fiche dans le portail