CyberClass > Partie 2 - Données > Côté face > Fiche concept 2.1.1¶
📌 2.1.1 Pourquoi les données sont au cœur des enjeux de la cybersécurité ?¶
#Donnée #Information #TraitementDesDonnées #Qualité #Collecte #RGPD #ProtectionDesDonnées #EffetBoîteNoire #BiaisAlgorithmique #IA #IntelligenceArtificielleGénérative #ApprentissageAutomatique #MachineLearning #DeepLearning
Résumé
- Les données sont la matière première de l’informatique : elles peuvent être de différentes natures (texte, image, son, etc.) et sont structurées ou non. Une personne génère en moyenne 1,7 Mo de données chaque seconde1.
- Les données traitées deviennent de l’information : à chaque étape du traitement des données, des risques cyber apparaissent – modification, exfiltration, interception, détournement de finalité.
- Les enjeux de la donnée : qualité, utilisation et protection. La qualité et l’utilisation maîtrisée des données permettent de produire une information fiable et utile. Leur protection est indispensable pour éviter les abus, garantir la confidentialité et respecter les cadres légaux.
- L’IA générative et la manipulation des données : les intelligences artificielles génératives s’appuient sur des bases de données d'entraînement. Les risques encourus alors sont : les biais algorithmiques, l’effet "boîte noire" et les menaces liées à l’exfiltration ou la manipulation des données.
Le monde informatique dans lequel nous vivons se nourrit de données pour produire de l’information. L’informatique – science du traitement automatique2 et rationnel de l'information – repose, selon Gilles Dowek de l'INRIA, sur quatre concepts : les algorithmes, les machines, les langages et les données3,4. La sécurité du cyberespace dépend donc de la protection de cette matière première vulnérable que représentent les données : si elles sont altérées, volées ou mal utilisées, c’est tout le système qui est impacté (voir Partie 2 : Données > Fiche Concept 2.2.1).
→ Mais qu’est-ce qu’une donnée au juste et pourquoi est-elle vulnérable ? ¶
Une donnée est une valeur brute (chiffre, mot, image…) sans signification immédiate, mais porteuse d'information potentielle (le nombre 21 seul est une donnée brute, par exemple. Il devient une information quand on le contextualise : 21 ans est une donnée d'âge, 21°C, une température ou 21, rue X, une adresse). Même une donnée apparemment anodine peut, une fois recoupée avec d'autres, révéler d'autres informations exploitables par des attaquants.
→ Comment on produit de l’information à partir de données brutes ? ¶
Quel processus permet de produire de l'information ?¶
Quels sont les risques associés aux étapes de transformation des données ?¶
→ Pourquoi on parle de "qualité" des données ? ¶
Lorsque des données sont collectées, elles ont une finalité spécifique, souvent définie par l’organisation ou l’entreprise qui les collecte. On parle de qualité d'une donnée dans la mesure où celle-ci répond aux critères d'exactitude, d'exhaustivité, de validité, de cohérence, d'unicité, d'actualité et d'adéquation à l'objectif19.
Cependant, l'usage de la donnée peut être détourné. Par exemple, une date de naissance collectée pour des raisons administratives lors de la création d’un compte peut être utilisée pour du marketing ciblé20. Une donnée peut donc perdre sa finalité initiale et être exploitée de manière abusive ou même à des fins malveillantes.
Un cas à relever
En janvier 2023, deux ministères français ont envoyé un message vidéo à des agents publics pour leur parler de la réforme des retraites. Pour ce faire, ils ont utilisé les adresses emails que les agents avaient données en s’inscrivant sur un site officiel (ENSAP) servant normalement à consulter leurs bulletins de salaire et autres documents administratifs. La CNIL a estimé que c’était un mauvais usage des données, car ces adresses emails n’avaient pas été données pour recevoir des messages politiques. Elle a donc rappelé à l’ordre les deux ministères après avoir reçu environ 1600 plaintes21.
La qualité des données est donc essentielle pour obtenir des résultats fiables et pertinents et le respect de l'utilisation prévue de ces données est crucial pour éviter les dérives.
Le respect de la protection des données, très encadré par le Règlement général sur la protection des données – RGPD, devient un enjeu de cybersécurité essentiel (voir Partie 1 : Enjeux > Fiche Concept 1.2.3). Pour protéger les données personnelles, des mécanismes comme la pseudonymisation (1) ou l’anonymisation (2) peuvent être mis en place pour réduire les risques de réidentification des individus en cas de réutilisation malveillante ou en cas de fuite des données. (Voir Partie 2 : Données > Fiche Concept 2.1.2 ; Fiche Activité 2.2)
- 🔎 Définition : Consiste à masquer l'identité d'une personne en remplaçant les informations qui permettent de l'identifier directement par des identifiants de substitution (alias, numéro, code, etc.). Les données restent rattachées à la même personne, mais il devient plus difficile de savoir de qui il s'agit sans disposer des informations complémentaires permettant d'établir le lien.
- 🔎 Définition : Consiste à transformer des données de façon à ce qu'il soit impossible, en pratique et de manière irréversible, d'identifier la personne à laquelle elles se rapportent. Contrairement à la pseudonymisation, l'anonymisation ne permet plus de retrouver l'identité de la personne concernée, même à l'aide d'informations complémentaires.
→ Et quelles règles suit l'intelligence artificielle alors ? ¶
D'abord, précisons ce que nous entendons par intelligence artificielle : l'IA ou plus précisément, l'IA générative, s'appuie sur l'apprentissage automatique22 (machine learning) qui vise à donner aux machines la capacité "d'apprendre" via des modèles mathématiques. Plutôt que de suivre des règles prédéfinies, l’algorithme apprend à partir des données : il détecte des récurrences, ajuste des paramètres… Il s’améliore au fil de ses "entraînements", à partir des exemples qui lui sont soumis.
Les IA génératives23 reposent donc sur des bases de données d’entraînement. Ces bases de données sont utilisées pour entraîner les IA à effectuer des tâches spécifiques, comme par exemple la reconnaissance faciale, le traitement du langage naturel, ou la prévision des comportements des consommateurs.
Cependant, l’utilisation des données dans le cadre de l’IA pose plusieurs défis24 :
- Les biais algorithmiques : si les données d’entraînement sont biaisées (par exemple, si elles ne représentent pas une population diverse), l'IA risque de produire des résultats discriminatoires.
- L’effet "boîte noire"25 : l'apprentissage profond (deep learning) connaît actuellement une croissance exponentielle. Ce sous-domaine de l'IA, dont l'approche se base sur les probabilités plus que sur la logique, utilise des réseaux neuronaux artificiels26 pour analyser d'immenses quantités de données qu'il serait impossible à un humain d'appréhender. Si les résultats semblent cohérents, les concepteurs sont incapables d'identifier précisément le "raisonement" du programme pour les obtenir. C'est ce que les experts appellent la "boîte noire". Comment garantir la pertinence de ces résultats que l'on ne peut expliquer ?
- Exfiltration et manipulation des données : les données utilisées pour entraîner des IA peuvent être volées ou utilisées dans d'autres contextes que celles pour lesquelles elles étaient initialement prévues, ce qui représente un risque de sécurité majeur. Il est donc essentiel de protéger ces bases de données. (Voir Partie 2 : Données > Fiche Concept 2.1.2)
- Utilisation en ingénierie sociale : à partir des données collectées, les cyberattaquants peuvent utiliser les IA génératives pour personnaliser davantage leurs attaques ou développer des logiciels malveillants plus spécifiques à un système27. Cette capacité à produire des contenus variés et crédibles en grande quantité rend les IA particulièrement efficaces, car elles peuvent rapidement "apprendre" à faire tomber les défenses et génèrent des menaces plus ciblées, plus difficiles à détecter que des attaques traditionnelles. (Voir Partie 1 : Enjeux > Fiche Concept 1.1.1 ; Partie 4 : Terminaux > Fiche Concept 4.2.2)
→ Les machines génèrent aussi des informations originales ? ¶
Oui. Les humains produisent des données, les traitent et les analysent pour en faire des informations, et les machines aussi. L’IA peut créer automatiquement des informations originales par compilation de données, par exemple :
- Un chatbot crée des réponses à nos questions.
- Des logiciels compilent des images ou des musiques pour en réaliser de nouvelles.
- Des algorithmes prédisent nos goûts et nos comportements.
L'IA produit énormément de nouvelles informations, parfois utiles elles peuvent être fausses ou trompeuses (comme les deepfakes (1), par exemple).
- 🔎 Définition : Technique d'intelligence artificielle qui génère des vidéos ou audios à l’apparence authentique, mais entièrement fictifs. Les deepfakes, ou hypertrucages sont principalement utilisés à des fins malveillantes, par exemple en diffusant des fake news ou de la propagande.
→ Qu'est-ce qu'on peut conclure ? ¶
Avec l’essor de l’intelligence artificielle, de nouveaux défis sur l'utilisation des données émergent28, 29 : éviter les biais d'interprétation, exiger la transparence, prévenir les risques de manipulation…
Pour garantir un avenir numérique éthique et plus sûr, chacun a un rôle à jouer : comprendre d’où viennent les données, apprendre à les protéger, et soutenir les efforts d’encadrement de l’IA, à l’image de l’Union européenne avec l’IA Act adopté en mars 2024 – le premier cadre réglementaire au monde régissant l’IA. (Voir Partie 1 : Enjeux > Fiche Concept 1.2.3)
Qu’avez-vous pensé de ce contenu ?
Clair :
Utile :
Si vous souhaitez nous faire part de vos suggestions d'amélioration contactez-nous !
¶
Pour aller plus loin ?¶
Fiches concepts liées¶
- Partie 2 : Données > Fiche Concept 2.1.2 : Toutes les données ne se valent pas…
- Partie 2 : Données > Fiche Concept 2.1.3 : Qu’est-ce que nos traces disent de nous ?
- Partie 2 : Données > Fiche Concept 2.1.4 : Produire et partager des informations.
- Partie 2 : Données > Fiche Concept 2.2.1 : Des données, pour quoi faire ?
- Partie 1 : Enjeux > Fiche Concept 1.1.1 : Des attaques partout tout le temps
- Partie 1 : Enjeux > Fiche Concept 1.2.3 : Régulation du Cyberespace : que dit la loi ?
- Partie 4 : Terminaux > Fiche Concept 4.2.2 : Vulnérabilités comportementales et Ingénierie sociale.
Ressources complémentaires :¶
Licence¶
🎯 Attribution : Une réalisation collective produite par Class’Code dans le cadre du programme TalCyb. Ce travail a bénéficié d’une aide de l’État gérée par l’Agence nationale de la recherche au titre de France 2030 portant la référence ANR-23-CMAS-0020.
Cette ressource éducative a été produite sous licence CC BY-SA Class’Code 4.0 FR (1) - Publication : janvier 2026 ; Dernière mise à jour : juin 2026.
- Creative Commons - Attribution obligatoire et crédit à l’auteur - Liberté d’utilisation et d’adaptation - Pas de restriction spécifique
Sources¶
-
Titre : Combien de données sont générées en ligne chaque seconde ? ; origine : Maleye ; auteur(s) : Mandiaye Ndiaye ; date de publication : 23 novembre 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Traitement automatique de données ; type de média : ressources de références ; origine : culture.fr/franceCulture - ministère de la Culture ; date de publication : 22 septembre 2000 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Les quatre concepts de l'informatique ; origine : Epi asso - Association Enseignement Public et Informatique ; auteur(s) : Gilles Dowek (INRIA) ; date de publication : octobre 2011 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Les quatre piliers de l’informatique : Algorithmes, Données, Machines, Langages ; type de média : vidéo ; origine : 4videos.socinfo.fr - Société Informatique de France ; auteur(s) : Société Informatique de France et l’Esprit Sorcier ; date de publication : 2022 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Le traitement des données : Qu'est-ce que c'est et quelles sont les étapes à suivre ; origine : QuestionPro ; auteur(s) : Fabyio Villegas ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩↩
-
Titre : Transformation des données - fonction, méthodes, avantages et logiciels ; origine : Konfuzio ; auteur(s) : Christopher Helm ; date de publication : 28 août 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : 2024 Report on the State of Cybersecurity in the Union - Condensed version ; type de média : rapport ou publication ; origine : enisa.europa.eu - Agence de l'Union européenne pour la cybersécurité ; auteur(s) : ENISA - Agence de l'Union européenne pour la cybersécurité ; date de publication : décembre 2024 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Maîtrise du risque numérique - L’atout confiance ; origine : cyber.gouv.fr - Agence nationale de la sécurité des systèmes d'information ; auteur(s) : ANSSI et l’Association pour le Management des Risques et des Assurances de l’Entreprise (AMRAE) ; date de publication : 18 novembre 2019 ; mise à jour : 18 novembre 2019 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Qu'est-ce que l'OWASP ? Introduction aux 10 principales vulnérabilités et risques de l'OWASP ; origine : F5 entreprise ; date de publication : 2021 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Risques cyber : des pistes pour la protection des entreprises ; origine : economie.gouv.fr - les Ministères Économiques et Financiers ; date de publication : 7 septembre 2022 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Qu’est-ce qu’une fuite de données ? 6 causes courantes de fuite de données ; origine : Fortinet ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Bases de données relationnelles ; origine : cyber.gouv.fr - Agence nationale de la sécurité des systèmes d'information ; auteur(s) : ANSSI ; date de publication : 31 janvier 2025 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Quels sont les risques liés à la sécurité des API ? ; origine : Akamai ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Cartographie des risques cybersécurité : guide complet pour identifier et gérer les menaces en 2025 ; origine : Make IT Safe ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : L'anatomie d'une attaque par injection SQL et comment l'éviter ; origine : Kiteworks ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Recoupement d’informations en ligne : ce que vous publiez peut dévoiler votre vie privée ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : 6 février 2024 ; date de consultation : 15 janvier 2026. ↩
-
Titre : Qu’est-ce que le reverse engineering ? ; origine : Nexa Digital School ; date de publication : 25 juin 2025 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Qu’est-ce que la qualité des données ? ; origine : IBM ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Mes droits dans le cadre du marketing direct ; origine : autoriteprotectiondonnees.be - Autorité de protection des données de Belgique ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Sanction de deux ministères français par la CNIL pour violation du droit des données personnelles : quelles leçons pour les acteurs publics ? ; origine : Blog Economie Numérique ; auteur(s) : Freddy Basila Bulambo ; date de publication : 17 novembre 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Apprentissage automatique ; type de média : ressources de références ; origine : cnil.fr - Commission Nationale de l'Informatique et des Libertés ; date de publication : [s.d.] ; date de consultation : 2 décembre 2025. ↩
-
Titre : Les vrais enjeux de l'intelligence artificielle ; origine : Mission CES ; auteur(s) : Jean-Pierre Corniou, François Pistre et Xavier Dalloz ; date de publication : 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Intelligence artificielle : opportunités et risques ; origine : europarl.europa.eu - Parlement Européen ; date de publication : 25 avril 2025 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Lever l’effet « boîte noire » des méthodes d’IA en analysant des textes ; origine : cirad.fr - La recherche agronomique pour le dévéloppement ; date de publication : 27 décembre 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Que sont les réseaux neuronaux ? ; origine : IBM ; date de publication : juillet 2023 ; date de consultation : 2 décembre 2025. ↩
-
Titre : IA Générative : Nouvelle Arme Pour Les Cyberattaquants Ou Atout Pour La Cybersécurité Des Organisations ? ; origine : Citalid ; auteur(s) : Maxime Cartan ; date de publication : 19 mars 2024 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Impact de l’intelligence artificielle sur les droits de l’homme, la démocratie et l’État de droit ; origine : Conseil de l’Europe ; auteur(s) : Comité ad hoc sur l'intelligence Artificielle (CAHAI) ; date de publication : 24 Juin 2020 ; date de consultation : 2 décembre 2025. ↩
-
Titre : Recommandation sur l'éthique de l'intelligence artificielle ; origine : unesdoc.unesco.org - UNESCO Bibliothèque Numérique ; auteur(s) : collectivité d'auteurs UNESCO ; date de publication : 2022 ; date de consultation : 2 décembre 2025. ↩
