Le grand basculement : l’IA, le web et nos données privées
L’IA générative transforme le web en matière première, puis en canal de diffusion de nouveaux contenus. Lorsqu’elle absorbe ou restitue des informations sur des personnes, le problème n’est pas seulement culturel. Il devient juridique. Le RGPD n’interdit ni l’apprentissage automatique ni le web scraping, mais il exige une finalité, une base légale, une collecte proportionnée, une information accessible, une sécurité adaptée et des droits réellement exerçables.
Prologue : l’accélération silencieuse
Depuis l’ouverture au grand public des outils d’IA générative, produire un texte, une image, une voix ou une vidéo est devenu presque instantané. Le changement est visible dans les moteurs de recherche, les réseaux sociaux, les services clients, la publicité et les outils professionnels. Il est pourtant impossible d’affirmer avec sérieux qu’une proportion mondiale précise du web serait désormais produite par des machines. Les méthodes de détection restent imparfaites, les corpus étudiés varient et les créations hybrides brouillent la frontière entre assistance et génération.
Le basculement existe néanmoins. La question utile n’est plus seulement « combien de contenus sont artificiels ? », mais « quelles données ont servi à les produire, qui en répond et comment une personne peut-elle encore agir sur leur utilisation ? ». Le web est à la fois un espace d’expression, un ensemble de bases de données accessibles et une infrastructure d’apprentissage. Une photographie, un commentaire ou un ancien billet de blog peuvent être copiés, agrégés, annotés et réutilisés loin de leur contexte initial.
Cette mutation fragilise deux repères. Le premier est la maîtrise de nos traces. Le second est la confiance dans l’origine de ce que nous lisons. Le RGPD apporte une partie de la réponse, mais il ne constitue ni une interdiction générale de l’IA ni une garantie magique contre toute réutilisation.
I. Quand le web devient une base d’apprentissage
Public ne veut pas dire libre de toute règle
Une donnée accessible sans mot de passe peut rester une donnée à caractère personnel. Son exposition publique ne fait pas disparaître les principes de finalité, de licéité, de minimisation et de transparence. La réutilisation doit être appréciée selon le contexte de publication, les attentes raisonnables des personnes, la nature des sites, les catégories d’informations recueillies et les effets possibles du traitement.
La CNIL rappelle que le moissonnage du web n’est pas interdit en soi. Un organisme privé peut, selon les circonstances, envisager l’intérêt légitime. Il doit alors démontrer un intérêt licite, la nécessité du traitement et une mise en balance favorable, accompagnée de garanties réelles. Les forums de santé, les espaces destinés aux mineurs, les fuites de données ou les contenus placés derrière une restriction appellent une vigilance beaucoup plus forte.
Le rôle limité de robots.txt
Un fichier robots.txt, une condition d’utilisation ou un mécanisme d’exclusion constitue un signal à prendre en compte. Ce n’est toutefois ni une base juridique, ni un formulaire universel d’opposition au sens de l’Article 21, ni une protection contre tous les collecteurs. Inversement, l’absence de ce fichier n’équivaut pas à un consentement.
La bonne gouvernance combine donc plusieurs moyens : liste d’exclusion, filtrage des données sensibles, limitation des sources, journalisation de la provenance, information largement accessible, canal d’opposition et mécanisme de suppression avant l’entraînement lorsqu’une demande est fondée.
II. Les fantômes de l’oubli
Effacer une source ne suffit pas toujours
La copie d’un contenu peut survivre dans des jeux de données, des index, des sauvegardes ou des versions dérivées. Après l’apprentissage, la situation devient plus complexe encore. Un modèle n’est pas nécessairement une base documentaire qui restitue chaque enregistrement à l’identique. Il peut cependant mémoriser certaines séquences ou permettre l’extraction d’informations dans des conditions particulières.
Il serait donc excessif de dire que toute donnée est « dissoute » de façon irréversible dans les poids, tout comme il serait imprudent d’affirmer qu’un modèle ne contient jamais de données personnelles. Selon le CEPD, l’anonymat doit être évalué au cas par cas. Il faut notamment examiner la probabilité d’identifier une personne, d’extraire une information la concernant ou d’obtenir une restitution mémorisée, en tenant compte des moyens raisonnablement susceptibles d’être employés.
Le droit à l’effacement ne disparaît pas
L’Article 17 n’est pas un bouton universel permettant d’effacer toute trace dans toute technologie. Il prévoit des motifs et des exceptions. Lorsqu’il s’applique, le responsable doit rechercher une réponse effective. Celle-ci peut viser les données sources, les bases intermédiaires, les index, les systèmes de récupération, les sorties ou le comportement du modèle. Des techniques d’unlearning, des filtres, un réentraînement ou des mesures empêchant la restitution peuvent être pertinents selon le cas.
La difficulté technique ne transforme pas automatiquement une obligation en impossibilité juridique. Elle doit être anticipée dès la conception, documentée et réévaluée. C’est précisément le rôle des Articles 25 et 35 : réduire les risques avant que l’architecture ne rende l’exercice des droits excessivement difficile.
III. Trois lignes de défense pour les personnes et les éditeurs
1. Exprimer et rendre opérante l’opposition
Les personnes doivent disposer d’une information compréhensible et d’un canal permettant d’exercer leurs droits. Les éditeurs de sites peuvent ajouter des signaux techniques et contractuels, mais ils ne doivent pas promettre une protection absolue. Pour l’organisme qui développe un système, respecter ces signaux contribue à l’analyse des attentes raisonnables et à la réduction du risque.
2. Réduire l’exposition à la source
Le chiffrement de bout en bout peut protéger le contenu d’une communication contre des tiers qui n’en détiennent pas les clés. Il ne protège plus une donnée rendue publique ou transmise volontairement à un service qui peut la traiter en clair. Les paramètres de confidentialité, la limitation des destinataires, la pseudonymisation et la maîtrise des durées de conservation restent donc essentiels.
3. Explorer les protections techniques sans les mythifier
Des outils comme Glaze ou Nightshade cherchent à perturber certains usages automatisés des images. Ils illustrent une volonté légitime de reprendre du contrôle, mais leur efficacité dépend des modèles, des transformations et des contre-mesures. Ils ne remplacent ni le droit, ni les contrats, ni une architecture respectueuse des choix des personnes.
IV. Trois risques collectifs, sans prophétie d’apocalypse
Le recyclage statistique
La recherche sur le model collapse montre qu’un entraînement récursif et indiscriminé sur des données produites par des générations précédentes peut réduire la diversité de la distribution apprise et faire disparaître des cas rares. Ce résultat est sérieux. Il ne démontre pas que tous les modèles vont nécessairement s’effondrer. La sélection des corpus, le maintien de données humaines, la traçabilité et les méthodes d’entraînement changent fortement l’issue.
Un web peuplé d’intermédiaires automatiques
Agents, moteurs de recommandation et générateurs peuvent produire des interactions destinées à d’autres systèmes. L’enjeu n’est pas une mystérieuse « mort du web », mais une dilution possible de la responsabilité. Lorsqu’un contenu faux ou une donnée personnelle circule à travers plusieurs acteurs, l’identification du responsable, de la source et du moyen de correction devient plus difficile.
L’homogénéisation
Les modèles favorisent souvent les formes les plus probables de leurs données et de leurs réglages. Une dépendance excessive peut lisser les voix, renforcer les biais dominants et réduire la visibilité d’expressions minoritaires. Sous l’angle du RGPD, cette question rejoint la qualité des données, l’équité, la transparence et les risques de profilage ou de décision automatisée.
V. RGPD et règlement IA : deux cadres complémentaires
Le règlement IA organise des obligations fondées sur les risques propres aux systèmes d’intelligence artificielle. Son Article 50 prévoit notamment des obligations de transparence pour certains systèmes interactifs et contenus générés ou manipulés. Ces règles deviennent applicables à compter du 2 août 2026 conformément à l'Article 113(c) du règlement.
Le RGPD conserve sa fonction propre dès que des données personnelles sont traitées. Un marquage « généré par IA » ne régularise pas une collecte illicite. À l’inverse, une base légale RGPD ne suffit pas à satisfaire toutes les obligations du règlement IA. Les deux analyses doivent être conduites ensemble.
- définir la finalité et les responsabilités de chaque acteur ;
- identifier la base légale et, si nécessaire, la condition applicable aux données sensibles ;
- documenter les sources, exclusions, durées et critères de minimisation ;
- évaluer les risques de mémorisation, extraction et restitution ;
- organiser l’information, l’opposition, l’accès et l’effacement ;
- réaliser une AIPD lorsque le traitement est susceptible d’engendrer un risque élevé ;
- vérifier séparément les obligations de transparence du règlement IA.
Épilogue : prouver la provenance plutôt que promettre la vérité
À mesure que l’origine des contenus devient plus difficile à percevoir, la provenance prend de la valeur. Les Content Credentials du standard C2PA peuvent associer à un fichier des informations signées sur son origine et ses transformations. Ils apportent un signal vérifiable de traçabilité.
Ce signal ne dit pas, à lui seul, qu’une affirmation est vraie, qu’une œuvre est bonne ou qu’aucun outil d’IA n’a été utilisé. Il ne doit pas non plus exposer inutilement l’identité d’un créateur. La provenance crédible est donc une pièce du dispositif, avec l’éducation aux médias, la responsabilité des plateformes, la transparence des fournisseurs et la protection des données.
Le véritable choix n’oppose pas une humanité pure à des machines étrangères. Il consiste à décider quelles données peuvent nourrir quels systèmes, sous quelles garanties et avec quelle possibilité de revenir sur une décision. La voix humaine reste précieuse non parce qu’elle serait toujours exacte, mais parce qu’elle porte une intention, une responsabilité et la faculté de douter. Le droit doit préserver cet espace de choix.
Sources officielles contrôlées et références scientifiques
Principes, bases légales, droits, protection dès la conception, sécurité et AIPD.
Consulter la source officielle →Anonymat, intérêt légitime, mémorisation, extraction et conséquences d’un traitement illicite.
Consulter le CEPD →Projet en consultation publique au 10 septembre 2026, à ne pas confondre avec une doctrine définitive.
Consulter le projet →Finalité, licéité, réutilisation, scraping, minimisation et droits.
Consulter la CNIL →Cadre européen et obligations de transparence de l’Article 50.
Consulter EUR-Lex →