Digit 100 · Numérique
De la base au flux : où naissent les données, comment elles circulent et comment juger leur qualité
DIGIT-100 — Socle — Du clavier au datacenter (hard skill) · séance 1 · ≈ 28 min d’écoute
Écouter un extrait
Partie 1 — Où naissent les données de l'entreprise
Dans cette partie :
- Les sources internes : ERP, CRM, capteurs
- Les sources externes : open data, partenaires, web
- Cartographier les données : qui produit quoi
Définition : Donnée
Une donnée est une valeur brute — chiffre, texte, date, image — enregistrée par un système ou saisi par un humain, avant toute interprétation. Elle devient information dès qu'on lui donne un contexte.
Origine du terme : du latin datum, « ce qui est donné »
Marques citées : à titre référentiel uniquement
- Excel, Power BI, SAP, Salesforce, Google : marques tierces
- Cités en texte seul, à titre illustratif
- L'ESEAD n'est affiliée à aucun éditeur
- Certifications éditeurs : distinctes et indépendantes
Les trois grandes familles de sources internes
- ERP : gestion intégrée (stock, compta, RH)
- CRM : relation client et pipeline commercial
- Capteurs IoT : machines, bâtiment, logistique
- Fichiers bureautiques : Excel, PDF, e-mails
Sources externes : trois grandes catégories
- Open data : données publiques gratuites
- Données partenaires : fournisseurs, distributeurs
- Web scraping et flux tiers : prix, avis, tendances
- Coût, fiabilité et droits d'usage à vérifier
La cartographie des données : un outil de décideur
- Lister les systèmes sources (ERP, CRM, capteurs…)
- Identifier propriétaire et fréquence de mise à jour
- Indiquer où la donnée est stockée et qui y accède
- Format simple : tableau ou post-it suffit
Cas : Mini-cartographie d'un commerce de distribution
- Jeu de données : Ventes journalières
- Source : logiciel de caisse (ERP TPV)
- Propriétaire : responsable de magasin
- Fréquence : quotidienne, export à 23h
- Stockage : serveur local + cloud sauvegarde
Open data en France : volume et usage en entreprise
Le portail data.gouv.fr recense plus de 50 000 jeux de données publics — une ressource massive encore sous-exploitée.
- 50 000+ Jeux de données sur data.gouv.fr (2025) (data.gouv.fr, Etalab)
- 3 % Du PIB mondial estimé en valeur créée par l'open data (indicatif) (OCDE, rapport Open Government Data, 2020)
À retenir : Sources internes
- ERP = gestion intégrée, source la plus structurée
- CRM = données clients, commerciales
- Capteurs IoT = volumes élevés, temps réel
- Fichiers bureautiques = source fragile à surveiller
À retenir : Sources externes
- Open data : gratuit, officiel, sous-exploité
- Données partenaires : contrat + format à vérifier
- Flux web : droits d'usage et RGPD à contrôler
- Toujours vérifier : producteur, date, droit d'usage
À retenir : Cartographier les données
- Tableau 5 colonnes : source, propriétaire, fréquence, stockage, droits
- Révèle doublons, sources obsolètes, données RGPD
- Indispensable avant tout projet BI ou tableau de bord
- Un post-it peut suffire pour démarrer
Partie 2 — Comment les données circulent : bases, flux et API
Dans cette partie :
- La base de données : le conteneur fondamental
- Les flux de données : temps réel vs batch
- L'API : le connecteur universel
Définition : Base de données
Une base de données est un ensemble organisé de données structurées, stockées sur un support numérique et accessibles selon des règles définies. Elle permet de stocker, rechercher, modifier et croiser des informations de façon fiable et rapide.
Origine du terme : de l'anglais database, composé de data (données) et base (socle, fondation)
Définition : API
Une API est un contrat standardisé qui permet à deux logiciels de communiquer entre eux de façon sécurisée et automatique, sans que les utilisateurs aient besoin de comprendre le fonctionnement interne de chaque application.
Origine du terme : acronyme de l'anglais Application Programming Interface, interface de programmation d'application
Base relationnelle vs base NoSQL : choisir sans coder
- Relationnelle (SQL) : tableaux liés, données structurées
- NoSQL : documents, JSON, données flexibles
- Entrepôt (Data Warehouse) : analyse historique
- Lac de données (Data Lake) : tout stocker, trier après
Flux temps réel vs transfert batch : deux logiques opposées
- Temps réel (streaming) : donnée disponible en secondes
- Batch : transfert groupé, différé (nuit, semaine)
- Temps réel = coût élevé, infra complexe
- Batch = suffisant pour 80 % des décisions de gestion
Piège : confondre fraîcheur et temps réel
- Une donnée batch peut être fraîche si bien cadencée
- Temps réel ≠ meilleure qualité, juste plus rapide
- Coût temps réel : x3 à x10 vs batch (indicatif)
- Vérifiez le SLA : délai garanti de livraison
API : ce que le décideur doit savoir évaluer
- API publique : documentée, accessible (ex. open data)
- API privée : accès sur contrat, authentification
- Coût API : gratuit à plusieurs milliers € / mois
- Risque : dépendance si l'éditeur la ferme ou la modifie
À retenir : La base de données
- Base SQL : tableaux liés, gestion opérationnelle
- NoSQL : flexibilité, données variables
- Data Warehouse : analyse, tableaux de bord
- Data Lake : stockage brut, exploration future
À retenir : Flux temps réel vs batch
- Batch : adapté à 80 % des décisions de gestion
- Temps réel : justifié si décision < quelques minutes
- Coût temps réel nettement supérieur au batch
- Demandez toujours le SLA avant de choisir
À retenir : L'API
- API = contrat de communication entre deux logiciels
- Publique vs privée : coût et accès différents
- Toujours évaluer : coût, SLA, réversibilité
- Dépendance à une API tierce = risque stratégique
Partie 3 — Juger et préparer la qualité des données
Dans cette partie :
- Les quatre critères de qualité d'une donnée
- Détecter et corriger les problèmes courants
- Préparer les données pour décider
Les quatre critères FSCC pour juger une donnée
- Fraîcheur : date de dernière mise à jour
- Source : qui a produit cette donnée, comment
- Complétude : champs vides, données manquantes
- Cohérence : valeurs plausibles, format homogène
Les cinq problèmes de qualité les plus fréquents
- Doublons : même entité enregistrée plusieurs fois
- Valeurs manquantes : cellules vides ou nulles
- Formats incohérents : date en trois formats différents
- Valeurs aberrantes : prix négatif, âge = 999
- Libellés non standardisés : « Paris », « paris », « PARIS »
Piège : supprimer sans comprendre
- Ne jamais supprimer sur le fichier source original
- Travailler toujours sur une copie datée
- Un doublon apparent peut être une transaction légitime
- Données personnelles : effacement soumis au RGPD (cnil.fr)
De la donnée brute au tableau de bord : les étapes clés
- 1. Identifier la question de décision
- 2. Localiser et extraire les données sources
- 3. Nettoyer et standardiser (FSCC)
- 4. Structurer pour Power BI ou Excel
Cas : Procédure — Détecter les doublons dans Excel
- 1. Sélectionner la colonne identifiant (ex. e-mail)
- 2. Accueil → Mise en forme conditionnelle → Règles de mise en surbrillance → Valeurs en double
- 3. Les doublons apparaissent en rouge
- 4. Trier par couleur pour les regrouper et décider
Coût des mauvaises données pour les organisations
Les erreurs de données coûtent en moyenne 15 à 25 % du chiffre d'affaires des organisations selon les estimations sectorielles.
- 15-25 % Du CA estimé perdu annuellement en raison de données de mauvaise qualité (indicatif) (IBM Data Analytics, estimations sectorielles, 2022)
- 1 sur 3 Décisions de gestion fondées sur des données inexactes ou incomplètes (indicatif) (Gartner, Data Quality Research, 2023)
À retenir : Les quatre critères FSCC
- Fraîcheur : date de production ou de mise à jour
- Source : producteur identifié, méthode connue
- Complétude : taux de remplissage des champs
- Cohérence : valeurs plausibles, format homogène
À retenir : Détecter et corriger
- 5 problèmes clés : doublons, manquants, formats, aberrants, libellés
- Travailler toujours sur une copie datée
- Détecter avant de supprimer : vérifier le contexte
- Données personnelles : RGPD, consulter cnil.fr
À retenir : Préparer pour décider
- Commencer par la question, pas par les données
- Tableau plat : 1 ligne = 1 observation, 1 colonne = 1 variable
- Pas de cellules fusionnées ni totaux dans le tableau source
- Les modules Excel et Power BI ESEAD prennent le relais
Lexique
- Batch
- Mode de transfert de données par lots, de façon différée et groupée (ex. export quotidien à minuit)
- Data Lake
- Espace de stockage massif et peu structuré qui conserve des données brutes en attendant de les analyser
- Data Warehouse
- Entrepôt de données nettoyées et historisées, conçu pour l'analyse décisionnelle et les tableaux de bord
- Donnée brute
- Valeur enregistrée (chiffre, texte, date) avant toute interprétation ou mise en contexte
- Flux de données
- Circulation continue ou séquentielle de données d'un système à un autre
- Garbage in, garbage out
- Principe selon lequel des données de mauvaise qualité en entrée produisent des résultats erronés en sortie, quel que soit l'outil utilisé
- NoSQL
- Famille de bases de données non relationnelles, adaptées aux données peu structurées ou très volumineuses
- Open data
- Données publiques mises à disposition librement par des organismes officiels, réutilisables sous conditions de licence
- Streaming
- Traitement et transfert de données en continu, en temps réel ou quasi-temps réel
- Tableau plat
- Format de données tabulaire sans cellules fusionnées ni totaux intermédiaires : une ligne par observation, une colonne par variable
Sigles
- API : Application Programming Interface — interface permettant à deux logiciels de communiquer
- CRM : Customer Relationship Management — logiciel de gestion de la relation client
- ERP : Enterprise Resource Planning — progiciel de gestion intégré (stock, compta, RH, achats)
- FSCC : Fraîcheur, Source, Complétude, Cohérence — les quatre critères de qualité d'une donnée
- IoT : Internet of Things — Internet des objets : capteurs et appareils connectés
- RGPD : Règlement Général sur la Protection des Données — Règlement (UE) 2016/679
- SLA : Service Level Agreement — accord de niveau de service définissant les garanties de performance
- SQL : Structured Query Language — langage standard d'interrogation des bases de données relationnelles
- BI : Business Intelligence — ensemble des outils et méthodes d'analyse décisionnelle
- ETL : Extract, Transform, Load — processus d'extraction, transformation et chargement des données
Questions fréquentes
Combien de temps dure le cours « De la base au flux : où naissent les données, comment elles circulent et comment juger leur qualité » ?
Environ 28 minutes d’écoute, réparties en 41 écrans avec voix-off, et un quiz d’auto-évaluation.
Faut-il s’inscrire ou payer ?
Non. Le cours est gratuit, sans inscription ni compte, et il peut être téléchargé pour être écouté hors-ligne.
À quel niveau correspond ce cours ?
Il correspond au niveau Tous publics (Utilisateur opérationnel) (Tous publics (Utilisateur opérationnel)) du catalogue du Groupe École de Commerce de Lyon. Il ne délivre aucun diplôme.
Que signifie « Donnée » ?
Une donnée est une valeur brute — chiffre, texte, date, image — enregistrée par un système ou saisi par un humain, avant toute interprétation. Elle devient information dès qu'on lui donne un contexte.
Que signifie « Base de données » ?
Une base de données est un ensemble organisé de données structurées, stockées sur un support numérique et accessibles selon des règles définies. Elle permet de stocker, rechercher, modifier et croiser des informations de façon fiable et rapide.
Que signifie « API » ?
Une API est un contrat standardisé qui permet à deux logiciels de communiquer entre eux de façon sécurisée et automatique, sans que les utilisateurs aient besoin de comprendre le fonctionnement interne de chaque application.
Que veut dire « Batch » ?
Mode de transfert de données par lots, de façon différée et groupée (ex. export quotidien à minuit)
Que veut dire « Data Lake » ?
Espace de stockage massif et peu structuré qui conserve des données brutes en attendant de les analyser
Que veut dire « Data Warehouse » ?
Entrepôt de données nettoyées et historisées, conçu pour l'analyse décisionnelle et les tableaux de bord
Que veut dire « Donnée brute » ?
Valeur enregistrée (chiffre, texte, date) avant toute interprétation ou mise en contexte
Que veut dire « Flux de données » ?
Circulation continue ou séquentielle de données d'un système à un autre
Que veut dire « Garbage in, garbage out » ?
Principe selon lequel des données de mauvaise qualité en entrée produisent des résultats erronés en sortie, quel que soit l'outil utilisé
Références du cours
- (),
- (),
- (),
- (),
- (),
- (),
- (),
- (),
Dans la même série
- Où vivent vos données : datacenters, cloud public, privé, hybride et modèles de service expliqués au décideur (29 min)
- Souveraineté et conformité : localisation des données, acteurs européens et américains, critères d'achat (27 min)
- GPS, Galileo et les autres : comprendre le GNSS, sa précision et ses limites pour décider (25 min)
- L'agriculture de précision : guidage, modulation, cartographie de rendement — le calcul du retour à l'hectare (27 min)
- Logistique, flottes et géomarketing : exploiter la position en respectant le cadre CNIL (27 min)
- Panorama des langages et briques techniques : la culture générale pour ne plus subir le jargon (26 min)
- ERP, CRM, SaaS : cartographier et choisir le système d'information sans se faire piéger (25 min)
Toute la série « DIGIT-100 — Socle — Du clavier au datacenter (hard skill) » · Tous les cours Digit 100
Cours conçu par le Groupe École de Commerce de Lyon. Contenu pédagogique de formation, sans valeur de diplôme.