Intelligence Artificielle, Web Scraping & Conformité RGPD
Le fait que des données personnelles soient publiquement accessibles sur le web ne les prive aucunement de la protection du RGPD. L'entraînement de modèles d'IA sur des corpus scrappés nécessite une base juridique valable (généralement l'intérêt légitime Art. 6.1.f soumis à un test LIA rigoureux). La présence de données sensibles (Art. 9) impose une exception valable, l'exception des données manifestement rendues publiques (Art. 9.2.e) étant d'interprétation très restrictive. Le responsable doit respecter le devoir d'information (Art. 14) et mettre en place des mécanismes techniques d'opt-out et de filtrage.
⚖️ 2. Cadre Juridique & Textes Applicables
Les dispositions normatives régissant cette thématique au niveau de l'Union européenne :
- Article 4(1) & (2) RGPD : L'extraction, le moissonnage, le prétraitement, le filtrage et l'entraînement de pondérations algorithmiques constituent des opérations de traitement de données personnelles dès lors que des individus sont identifiables.
- Article 6(1)(f) RGPD : L'intérêt légitime est la base juridique principalement revendiquée par les développeurs d'IA, imposant de démontrer la nécessité du scraping massif et l'adéquation des mesures de filtrage pour préserver les droits des personnes.
- Article 9(1) & 9(2)(e) RGPD : Interdiction de traiter des données sensibles sauf si la personne concernée les a 'manifestement rendues publiques'. Le CEPD rappelle qu'une publication sur un forum ou un réseau social ne suffit pas à caractériser une volonté explicite d'autoriser l'entraînement de modèles d'IA.
- Article 14(5)(b) RGPD : Obligation d'information indirecte des personnes dont les données ont été scrappées, sauf disproportion manifeste. En cas de dispense individuelle, des mesures appropriées de transparence publique (avis d'information détaillé sur le web) sont obligatoires.
- Guidelines CEPD 03/2026 : Lignes directrices adoptées le 7 juillet 2026 fixant les obligations des développeurs d'IA : respect des balises robots.txt/HTTP, filtrage préalable des données personnelles non pertinentes, droit à l'effacement dans les jeux d'entraînement et prévention de l'hallucination.
🧭 3. Matrice de Décision & Arbre Logique
Logique d'arbitrage pas-à-pas pour qualifier vos obligations et orienter votre stratégie :
1. Qualification des données collectées
Le corpus scrappé contient-il des données personnelles identifiables (noms, e-mails, photos de visages, avis personnels) ? Si OUI -> Le RGPD s'applique intégralement.
2. Cadrage de la base légale (LIA)
Conduire le test d'intérêt légitime : finalité légitime de recherche ou de développement technologique, nécessité de la masse de données, et mise en balance avec les droits des personnes concernées.
3. Filtrage amont des données sensibles (Art. 9)
Mettre en œuvre des filtres NLP/classifieurs automatiques pour exclure du jeu d'entraînement les données médicales, politiques, religieuses ou sexuelles.
4. Gouvernance des droits et opt-out
Respecter les balises techniques d'exclusion (robots.txt, protocoles d'opt-out IA), publier une notice d'information Art. 14 accessible et fournir un canal pour faire supprimer ses données du corpus.
🏢 4. Cas Pratiques & Scénarios d'École (IA & Web Scraping)
Scénarios pédagogiques hypothétiques illustrant l'ingestion de données et la gouvernance des modèles :
📌 Entraînement d'un grand modèle de langage (LLM) souverain
Contexte : [Scénario pédagogique] Une entreprise de la Tech française scrappe les actualités, wikis et blogs francophones pour entraîner un modèle de fondation.
Analyse & Résolution : Application des Guidelines CEPD 03/2026 : l'entreprise doit purger les données de contact (e-mails, téléphones) avant l'ingestion dans les tokens d'entraînement, respecter les en-têtes d'opposition des sites sources et publier un registre de transparence des sources moissonnées.
📌 Outil de veille commerciale et agrégation de profils professionnels
Contexte : [Scénario pédagogique] Start-up créant un moteur de recherche B2B scrappant les pages publiques et organigrammes d'entreprises.
Analyse & Résolution : La réutilisation de données professionnelles publiques pour du profilage commercial sans information des personnes viole l'Article 14. L'entreprise doit notifier individuellement chaque personne ou justifier de la disproportion en publiant une notice claire avec désinscription en 1 clic.
📌 Fine-tuning d'un modèle de génération d'images sur des bases d'art en ligne
Contexte : [Scénario pédagogique] Collecte massive d'images publiques comportant des visages et des photographies de personnes réelles.
Analyse & Résolution : Risque élevé de violation du droit à l'image et de l'intégrité des personnes (deepfakes). Nécessité d'une AIPD préalable (Art. 35) et de techniques de floutage ou d'anonymisation des visages des personnes non publiques.
⚠️ 5. Pièges Fréquents & Mauvaises Pratiques Sanctionnées
Les erreurs d'interprétation récurrentes constatées lors des contrôles des autorités de protection :
📋 6. Modèle Documentaire & Checklist d'Audit Opérationnelle
Points de contrôle impératifs à vérifier dans le dossier d'Accountability de votre organisme :
- ☑ Réalisation obligatoire d'une Analyse d'Impact relative à la Protection des Données (AIPD) avant scraping massif
- ☑ Formalisation écrite du test d'intérêt légitime (LIA) articulé avec la liberté de recherche et d'innovation
- ☑ Mise en place de filtres techniques amont pour exclure les catégories particulières de données (Art. 9) et données de mineurs
- ☑ Prise en compte automatisée des mécanismes d'opt-out machine-readable (robots.txt, en-têtes HTTP de refus)
- ☑ Publication d'une notice d'information publique conforme à l'Article 14 sur le portail de l'organisme
- ☑ Mise à disposition d'un formulaire dédié permettant aux personnes d'exercer leur droit d'opposition ou d'effacement de leurs données du corpus d'entraînement
⚖️ 7. Jurisprudence CJUE Associée & Portée Pratique
🇪🇺 8. Doctrine CEPD & Pratique de l'APD Belgique / CNIL
🗓️ 9. Plan d'Action Étape par Étape
Feuille de route chronologique de déploiement et de mise en conformité :
❓ 10. FAQ Technique & Juridique
Réponses directes aux interrogations les plus fréquentes sur ce sujet :
Les poids d'un réseau de neurones (weights) contiennent-ils des données personnelles ?
Généralement non sous forme explicite, mais l'Avis 28/2024 du CEPD note que si le modèle est sujet au surapprentissage (overfitting) et peut restituer textuellement les données personnelles d'un individu sur requête ciblée, les poids peuvent être considérés comme comportant des données personnelles résiduelles.
Le règlement européen sur l'IA (AI Act) remplace-t-il le RGPD pour les modèles d'IA ?
Absolument pas. L'AI Act (Règlement UE 2024/1689) et le RGPD s'appliquent de manière cumulative. L'article 2(7) de l'AI Act stipule expressément que le règlement s'applique sans préjudice du RGPD.
Un internaute peut-il exiger que ses données soient 'oubliées' d'un modèle déjà entraîné ?
Oui, le droit à l'effacement (Art. 17) demeure opposable. Les développeurs doivent prévoir des solutions d'atténuation : techniques d'unlearning (machine unlearning), filtres de blocage en sortie (guardrails) ou suppression de la donnée lors de la prochaine génération de modèle (checkpoint).
🛠️ 11. Outils & Calculateurs Associés
Interagissez directement avec les micro-outils et simulateurs opérationnels de RGPD.click :