Digit 100 · Numérique
Préparer ses données pour l'IA : nettoyer, structurer, anonymiser un fichier avant de le confier
DIGIT-100 — IA au quotidien (hard skill) · séance 1 · ≈ 32 min d’écoute
Écouter un extrait
Partie 1 — Comprendre pourquoi les données doivent être préparées
Dans cette partie :
- Ce que l'IA voit dans votre fichier
- Les erreurs de données les plus fréquentes
- RGPD et IA : les règles de base à connaître
Définition : Donnée structurée
Une donnée structurée est une information organisée dans un format prévisible — lignes, colonnes, cellules — que l'IA peut lire et traiter automatiquement sans effort d'interprétation.
Origine du terme : du latin data (ce qui est donné) et structura (assemblage ordonné)
Marques tierces — mention obligatoire
- Excel, ChatGPT, Copilot : cités en texte seul
- Ces marques appartiennent à leurs éditeurs
- L'ESEAD n'est affiliée à aucun de ces éditeurs
- Aucun logo tiers dans ce cours
Ce que l'IA lit réellement dans votre tableau
- L'IA lit du texte brut, ligne par ligne
- Elle ne « voit » pas vos couleurs Excel
- Une cellule vide = une information absente
- Un format incohérent = une erreur d'interprétation
Les 5 erreurs qui bloquent l'IA
- 1. Valeurs manquantes non signalées
- 2. Formats mixtes dans une même colonne
- 3. Doublons non détectés
- 4. En-têtes absents ou fusionnés
- 5. Données parasites (espaces, caractères)
RGPD et IA : trois réflexes obligatoires
- Réflexe 1 : repérer les données personnelles
- Réflexe 2 : ne jamais confier des données brutes
- Réflexe 3 : vérifier les CGU de l'outil IA utilisé
Ce que ce cours ne fait PAS
- Pas de conseil juridique individualisé
- Pas d'analyse de votre situation spécifique
- Pour votre cas : contactez votre DPO ou la CNIL
Qualité des données : état des lieux en entreprise française
Les problèmes de qualité des données coûtent cher — les chiffres le confirment.
- 60 % des PME françaises déclarent perdre du temps sur la qualité des données chaque semaine (France Num · Baromètre numérique des PME · 2024)
- 3 h/sem temps moyen perdu par collaborateur à cause d'erreurs de données en entreprise (DGE · Étude transformation numérique des TPE-PME · 2023)
À retenir : Ce que l'IA voit dans votre fichier
- L'IA lit du texte brut, pas des mises en forme
- Cellule vide = information manquante pour l'IA
- Traduire les intentions visuelles en données textuelles
- Structure prévisible = analyse fiable
À retenir : Les erreurs de données les plus fréquentes
- 5 erreurs couvrent 90 % des problèmes
- Doublons, formats mixtes, valeurs manquantes
- En-têtes flous et caractères parasites
- 3 h/semaine perdues en moyenne par collaborateur
À retenir : RGPD et IA : les règles de base
- Données personnelles = toute info sur une personne identifiable
- Confier à une IA = transfert à un tiers
- Lire les CGU de l'outil avant usage
- Cas complexes → DPO ou CNIL (cnil.fr)
Partie 2 — Nettoyer et structurer un fichier pas à pas
Dans cette partie :
- Diagnostiquer un fichier en 5 minutes
- Corriger, uniformiser, compléter
- Structurer pour que l'IA comprenne
La checklist diagnostic en 5 minutes
- Étape 1 : compter les lignes et colonnes
- Étape 2 : repérer les cellules vides
- Étape 3 : vérifier les formats de colonnes
- Étape 4 : détecter les doublons évidents
- Étape 5 : lire les 10 premières et 10 dernières lignes
Corriger les erreurs : les gestes essentiels
- Supprimer les espaces parasites : SUPPRESPACE()
- Uniformiser la casse : MAJUSCULE(), MINUSCULE()
- Convertir Texte → Nombre : coller avec multiplication
- Traiter les vides : NA(), 0 ou valeur médiane selon le cas
Astuce pro — Toujours travailler sur une copie
- Dupliquer le fichier original AVANT de corriger
- Nommer : « fichier_original_AAAA-MM-JJ »
- Corriger sur « fichier_travail »
- Zéro regret en cas d'erreur de manipulation
Les règles d'or de la structure
- 1 ligne = 1 observation unique
- 1 colonne = 1 type d'information
- Ligne 1 = en-têtes explicites, sans fusion
- Pas de sous-totaux intégrés dans les données
Cas : Export CRM d'un service commercial
- Fichier : export de 847 lignes depuis un CRM
- Problème : 63 lignes vides, 12 doublons, colonne CA en format Texte
- Temps de diagnostic : 4 minutes
- Problèmes identifiés avant toute correction
Cas : Tableau de suivi RH restructuré
- Avant : noms complets, dates textuelles, sous-totaux mélangés
- Après : colonnes séparées, dates ISO, onglet résumé distinct
- Résultat : l'IA identifie les absences récurrentes en 30 secondes
À retenir : Diagnostiquer un fichier en 5 minutes
- Ctrl + Fin : dernière cellule utilisée
- Accueil → Sélectionner les cellules vides
- Données → Supprimer les doublons (compter d'abord)
- Lire les 10 premières et 10 dernières lignes à la main
À retenir : Corriger, uniformiser, compléter
- SUPPRESPACE() élimine les espaces invisibles
- NOMPROPRE() uniformise les noms propres
- Collage spécial × 1 convertit Texte → Nombre
- Toujours travailler sur une copie du fichier
À retenir : Structurer pour que l'IA comprenne
- 1 ligne = 1 observation, 1 colonne = 1 type
- Ligne 1 : en-têtes sans fusion, sans caractères spéciaux
- Sous-totaux → onglet séparé
- Format ISO pour les dates : AAAA-MM-JJ
Partie 3 — Anonymiser avant de confier à l'IA
Dans cette partie :
- Identifier les données personnelles dans un fichier
- Techniques d'anonymisation et de pseudonymisation
- Valider, exporter et confier à l'IA en confiance
Définition : Donnée personnelle
Une donnée personnelle est toute information se rapportant à une personne physique identifiée ou identifiable — directement par son nom, ou indirectement par une combinaison d'informations permettant de l'identifier.
Origine du terme : du latin persona (masque, rôle, identité individuelle)
Cartographier les colonnes à risque
- Colonnes directes : nom, prénom, email, tél
- Colonnes indirectes : age, ville, poste, service
- Colonnes sensibles : santé, religion, opinion politique
- Combinaisons : évaluer le risque croisé
Anonymisation vs pseudonymisation : la différence clé
- Anonymisation : suppression irréversible de l'identité
- Pseudonymisation : remplacement par un code réversible
- Anonymisation → hors RGPD après traitement
- Pseudonymisation → reste dans le périmètre RGPD
5 techniques à appliquer dans un tableur
- 1. Suppression de colonne : supprimer le direct
- 2. Généralisation : âge exact → tranche d'âge
- 3. Masquage : email → e***@***.fr
- 4. Agrégation : individus → groupes
- 5. Remplacement : nom → code aléatoire
La checklist de validation finale avant partage
- ✓ Aucune colonne identifiante directe
- ✓ Colonnes indirectes généralisées ou supprimées
- ✓ Format de fichier adapté (CSV, non Excel natif)
- ✓ CGU de l'outil IA vérifiées
- ✓ Journal de nettoyage complété
Cas : Fichier de facturation prêt à analyser
- Fichier d'origine : 1 200 lignes, données clients complètes
- Traitement : suppression de 4 colonnes, généralisation secteur
- Export : CSV UTF-8, 1 180 lignes nettes
- Résultat IA : top 3 produits, saisonnalité détectée en 45 secondes
Violations de données : les secteurs les plus touchés en France
Les sanctions CNIL illustrent où les données personnelles fuient le plus souvent.
- 4 240 violations de données notifiées à la CNIL en 2024 (CNIL · Rapport annuel 2024)
- 110 M€ montant total des amendes CNIL prononcées en France depuis 2018 (CNIL · Bilan des sanctions 2024 · cnil.fr)
À retenir : Identifier les données personnelles
- 3 niveaux : directes, indirectes, sensibles
- La combinaison de données peut ré-identifier
- Créer un onglet « Cartographie des colonnes »
- 4 240 violations notifiées à la CNIL en 2024
À retenir : Techniques d'anonymisation
- Anonymisation = irréversible → hors RGPD
- Pseudonymisation = réversible → reste dans RGPD
- 5 techniques : supprimer, généraliser, masquer, agréger, remplacer
- Ressources officielles : cnil.fr
À retenir : Valider, exporter, confier
- Checklist 5 points avant tout partage
- Format CSV UTF-8 pour l'export final
- Vérifier les CGU de l'outil IA utilisé
- Journal de nettoyage = preuve de diligence
Lexique
- Donnée structurée
- Information organisée en lignes et colonnes, dans un format prévisible et traitable automatiquement par une machine
- Donnée personnelle
- Toute information permettant d'identifier directement ou indirectement une personne physique (RGPD, art. 4)
- Anonymisation
- Traitement irréversible qui supprime tout lien entre une donnée et la personne concernée — les données anonymisées sortent du périmètre RGPD
- Pseudonymisation
- Remplacement des identifiants directs par un code réversible — les données restent dans le périmètre RGPD
- Ré-identification
- Risque de retrouver l'identité d'une personne à partir de données apparemment anonymes, en les croisant entre elles
- Fichier tidy
- Fichier de données respectant les règles : 1 ligne = 1 observation, 1 colonne = 1 type, en-têtes clairs, pas de sous-totaux intégrés
- Valeur manquante
- Cellule sans valeur dans un fichier de données — peut fausser les calculs si elle est ignorée ou traitée comme zéro
- Format ISO de date
- Format standard international pour les dates : AAAA-MM-JJ (exemple : 2025-03-15), reconnu universellement par tous les outils
- Journal de nettoyage
- Document traçant toutes les corrections et transformations effectuées sur un fichier de données — preuve de diligence raisonnable
- K-anonymat
- Technique d'anonymisation avancée garantissant qu'un individu ne puisse pas être distingué d'au moins k-1 autres individus dans un fichier
Sigles
- IA : Intelligence Artificielle
- RGPD : Règlement Général sur la Protection des Données (UE 2016/679)
- CNIL : Commission Nationale de l'Informatique et des Libertés
- DPO : Data Protection Officer — Délégué à la Protection des Données
- CSV : Comma-Separated Values — format de fichier texte structuré
- CGU : Conditions Générales d'Utilisation
- ERP : Enterprise Resource Planning — Progiciel de gestion intégré
- CRM : Customer Relationship Management — Gestion de la relation client
- DGE : Direction Générale des Entreprises (Ministère de l'Économie)
- SIRET : Système d'Identification du Répertoire des Établissements
Questions fréquentes
Combien de temps dure le cours « Préparer ses données pour l'IA : nettoyer, structurer, anonymiser un fichier avant de le confier » ?
Environ 32 minutes d’écoute, réparties en 42 écrans avec voix-off, et un quiz d’auto-évaluation.
Faut-il s’inscrire ou payer ?
Non. Le cours est gratuit, sans inscription ni compte, et il peut être téléchargé pour être écouté hors-ligne.
À quel niveau correspond ce cours ?
Il correspond au niveau Tous publics (Utilisateur opérationnel) (Tous publics (Utilisateur opérationnel)) du catalogue du Groupe École de Commerce de Lyon. Il ne délivre aucun diplôme.
Que signifie « Donnée structurée » ?
Une donnée structurée est une information organisée dans un format prévisible — lignes, colonnes, cellules — que l'IA peut lire et traiter automatiquement sans effort d'interprétation.
Que signifie « Donnée personnelle » ?
Une donnée personnelle est toute information se rapportant à une personne physique identifiée ou identifiable — directement par son nom, ou indirectement par une combinaison d'informations permettant de l'identifier.
Que veut dire « Anonymisation » ?
Traitement irréversible qui supprime tout lien entre une donnée et la personne concernée — les données anonymisées sortent du périmètre RGPD
Que veut dire « Pseudonymisation » ?
Remplacement des identifiants directs par un code réversible — les données restent dans le périmètre RGPD
Que veut dire « Ré-identification » ?
Risque de retrouver l'identité d'une personne à partir de données apparemment anonymes, en les croisant entre elles
Que veut dire « Fichier tidy » ?
Fichier de données respectant les règles : 1 ligne = 1 observation, 1 colonne = 1 type, en-têtes clairs, pas de sous-totaux intégrés
Références du cours
- (),
- (),
- (),
- (),
- (),
- (),
- (),
- (),
- (),
- (),
Dans la même série
- Créer son premier assistant IA personnalisé : instructions, base de connaissances, tests (27 min)
- Relier ses outils entre eux : construire, tester et superviser un scénario d'automatisation no-code (27 min)
- Prendre en main ChatGPT et lui déléguer ses premières tâches de bureau : e-mails, comptes rendus, synthèses (23 min)
- Prendre en main Claude et lui déléguer ses premières tâches : rédaction, synthèses, analyses de documents (25 min)
- Organiser son travail récurrent avec Claude : projets, instructions personnalisées, documents longs — et vérifier chaque résultat (26 min)
- Activer Copilot et accélérer sa rédaction : documents Word et e-mails Outlook assistés — avec relecture systématique (29 min)
- Analyser, présenter, résumer : Copilot dans Excel, PowerPoint et Teams, chaque résultat contrôlé avant envoi (27 min)
- Repérer quand l'IA se trompe : hallucinations, biais, limites — et vérifier une affirmation jusqu'à sa source (24 min)
- Recouper, détecter, décider : méthodes de vérification, indices de contenus artificiels, bons usages au travail (27 min)
- Prendre en main Gemini et produire ses premiers livrables : e-mails, synthèses, comptes rendus (26 min)
- Faire travailler Gemini avec ses outils Google du quotidien — et contrôler chaque résultat avant de l'utiliser (26 min)
- Faire parler un tableau : tendances, anomalies et synthèses chiffrées produites et vérifiées avec l'IA (29 min)
Toute la série « DIGIT-100 — IA au quotidien (hard skill) » · Tous les cours Digit 100
Cours conçu par le Groupe École de Commerce de Lyon. Contenu pédagogique de formation, sans valeur de diplôme.