AccueilBlogData & IAData Governance
Data Governance

Data Governance :
définition, roles, qualité et comment la mettre en oeuvre

La Data Governance (gouvernance des données) est le socle invisible sur lequel reposent tous les projets data reussis. Sans elle, les Data Lakes deviennent des marais, les KPIs se contredisent d'un rapport a l'autre, la conformité RGPD devient une source de risque permanent, et les modèles IA s'entrainent sur des données biaisées. Comprendre ses fondements — framework DAMA-DMBOK, roles, qualité des données, lineage — est indispensable pour tout Data Engineer, Data Analyst ou Chief Data Officer qui construit ou fait évoluer une organisation data.

14 min de lectureData GovernanceIntermédiaire a Avance

Ce que vous allez apprendre

  • La définition exacte de la Data Governance et la distinction avec le Data Management
  • Les roles clés et leur articulation : CDO, Data Owner, Data Steward, Data Custodian, Data Council
  • Le framework DAMA-DMBOK et ses 11 domaines de connaissance
  • Les 6 dimensions de la qualité des données et comment les mesurer avec Great Expectations et Monte Carlo
  • Le data lineage (lineage bout en bout, column-level, standard OpenLineage) et pourquoi il est indispensable
  • Comment demarrer une initiative de gouvernance en 90 jours sans bloquer les équipes data
Fondements

Qu'est-ce que la Data Governance ?

La Data Governance (gouvernance des données) est l'ensemble des politiques, processus, roles et standards qui definissent comment une organisation collecte, gere, utilise et protege ses données. Ce n'est pas un outil ni une technologie : c'est un cadre organisationnel et opérationnel qui repose sur des décisions humaines autant que sur de l'infrastructure.

La gouvernance répond a des questions fondamentales que toute organisation data rencontre inévitablement : qui a le droit de modifier ces données ? Quelle est la définition officielle de 'client actif' dans notre entreprise — et pourquoi le Marketing et les Finances ont-ils deux chiffres differents ? Ou sont stockées les données personnelles de nos utilisateurs ? Qui est responsable si une donnée critique est erronée et alimente un mauvais KPI en comite de direction ? La gouvernance transforme ces questions sans réponse en politiques claires, documentées et appliquées.

Data Governance vs Data Management : quelle différence ?

La confusion entre les deux termes est fréquente. Le Data Management (gestion des données) est le terme le plus large : il englobe toutes les pratiques techniques et organisationnelles qui permettent de gerer le cycle de vie des données — de leur creation a leur archivage. La Data Governance est un sous-domaine du Data Management : c'est le cadre de pilotage qui définit les règles, les responsabilités et les standards que le Data Management met ensuite en oeuvre techniquement.

En pratique : le Data Management construit et opère les pipelines, le data lake, le data warehouse et les outils. La Data Governance decide quelles données doivent respecter quelles règles de qualité, qui peut acceder a quoi, et comment les définitions métier sont arbitrées. Le DAMA-DMBOK formalise cette relation en placant la Governance comme domaine central qui pilote les 10 autres domaines du Data Management.

Le perimetre de la gouvernance des données

La gouvernance des données couvre typiquement six grands domaines opérationnels : la qualité des données (data quality — mesure et amélioration continue), la gestion des métadonnées (metadata management — documenter les données sur les données), la maîtrise des données de référence (master data management — une source de vérité unique pour les entités clés), le lineage des données (traçabilite bout en bout des flux), la sécurité et la confidentialite (RGPD, conformité réglementaire, contrôles d'accès), et le data catalog (inventaire et documentation des actifs data).

Ces six domaines ne fonctionnent pas indépendamment : un data catalog sans lineage est une documentation statique qui devient vite obsolete. Une politique de qualité sans Data Stewards pour l'appliquer reste lettre morte. La gouvernance efficace orchestre ces domaines de manière cohérente.

Donnée, information et métadonnée

La gouvernance s'applique aux trois niveaux : les données (faits bruts — '42', 'Paris', '2024-03-15'), les informations (données interpretées — 'age du client : 42 ans'), et les métadonnées (données sur les données — 'cette colonne contient l'age du client en années entières, proprietaire : équipe CRM, sensibilité : confidentiel'). Un bon data catalog gouverne les trois niveaux.

Enjeux

Pourquoi la Data Governance est devenue critique

Trois forces convergentes ont rendu la Data Governance incontournable dans les organisations modernes : la proliferation exponentielle des données, la pression réglementaire croissante, et la dépendance des décisions stratégiques a des données fiables. Une quatrieme force émergente — l'IA générative — amplifie et accélère ce besoin.

La qualité des données : un enjeu business directement quantifiable

Une etude IBM estime que les données de mauvaise qualité coutent aux entreprises américaines 3,1 trillions de dollars par an. Les conséquences sont multiples et directes : des dashboards de direction qui se contredisent (le Marketing annonce 12 000 clients actifs, les Finances 9 500 — car la définition de 'client actif' n'est pas la même), des campagnes marketing envoyées a des adresses invalides, des modèles de machine learning entraînes sur des données erronées qui produisent des predictions biaisées, des reconciliations comptables qui nécessitent des semaines de travail manuel.

La mauvaise qualité des données n'est pas un problème technique — c'est un problème organisationnel. La donnée se degrade parce qu'il n'y a personne de responsable de sa qualité, pas de définition partagée de ce qu'est une 'bonne donnée', et pas de processus pour détecter et corriger les anomalies. La gouvernance est le remede organisationnel a ce problème.

La conformité réglementaire : RGPD, AI Act et au-dela

Le RGPD (entrée en vigueur en mai 2018 en Europe) a rendu la gouvernance des données personnelles une obligation légale. Savoir ou se trouvent exactement les données personnelles de chaque utilisateur, qui y accede, depuis quand, combien de temps elles sont conservées et comment les supprimer sur demande (droit a l'effacement) : ce sont des obligations legales que seule une gouvernance structurée permet de respecter de manière systématique et auditée. Les amendes peuvent atteindre 4 % du chiffre d'affaires mondial annuel — Amazon a ecopé de 746 millions d'euros en 2021, Meta de 1,2 milliard en 2023.

L'EU AI Act (entre en vigueur en 2024) introduit une nouvelle couche réglementaire qui amplifie le besoin de gouvernance : les systèmes d'IA a haut risque doivent documenter leurs données d'entraînemnt (lineage, qualité, biais detectes), maintenir des registres d'audit et garantir la traçabilite des décisions. La gouvernance des données devient le prerequis de la conformité IA.

L'IA générative amplifie et transforme le besoin de gouvernance

Les modèles d'IA générative déployés en entreprise creent trois nouveaux risques de gouvernance. Premierement, le risque de divulgation de données sensibles : un employe qui colle des données confidentielles dans un prompt ChatGPT les expose potentiellement. Deuxiemement, le risque de biais amplifie : un LLM fine-tune sur des données non gouvernées peut reproduire et amplifier les biais présents dans les données d'entraînement. Troisiemement, le risque de RAG non contrôle : un système RAG (Retrieval-Augmented Generation) connecte a un data lake non gouverne peut restituer des informations incorrectes, perimées ou confidentielles a des utilisateurs non autorises.

175 zettabytes d'ici 2025

Selon IDC, le volume mondial de données devait atteindre 175 zettabytes d'ici 2025. Sans gouvernance adaptée, cette croissance exponentielle rend la gestion et la conformité proportionnellement plus complexes — chaque nouvelle source de données non gouvernée est un nouveau risque de qualité, de sécurité et de conformité.

IDC DataSphere, 2020
Organisation

Les roles clés de la gouvernance des données

La gouvernance des données distribue les responsabilités selon un modèle de roles clairement définis. L'erreur la plus courante est de penser que la gouvernance est la responsabilité exclusive de l'équipe data technique — c'est un modèle de responsabilité partagée entre le business et l'IT.

Chief Data Officer (CDO)

Le CDO est le responsable executif de la stratégie data et de la gouvernance au niveau de l'entreprise. Il (ou elle) définit la vision data, alloue les ressources, arbitre les conflits de propriete entre domaines, et représente la valeur des données au comite de direction. Encore rare au debut des années 2010, ce poste s'est depuis largement repandu dans les grandes entreprises, a mesure que la donnée est devenue un actif stratégique a part entiere.

Le CDO se distingue du CTO (qui gere l'infrastructure et les systèmes) et du DSI/CIO (qui gere les applications métier et l'IT). Son perimetre est specifiquement la valeur, la qualité et la gouvernance des données comme actif stratégique de l'entreprise.

Data Owner

Le Data Owner (proprietaire de données) est un role business, pas IT. C'est le responsable métier d'un domaine de données spécifique : le DAF pour les données financieres, le DRH pour les données RH, le CMO pour les données marketing. Il decide qui a accès aux données de son domaine, valide les définitions métier officielles (qu'est-ce qu'un 'client actif' pour notre departement ?) et est responsable devant la direction de la qualité et de l'usage correct des données de son perimetre.

Le Data Owner n'a pas besoin d'être expert technique. Son role est d'apporter l'autorite métier et la connaissance du contexte business. Il delegue l'implementation aux Data Stewards.

Data Steward

Le Data Steward est le pivot opérationnel de la gouvernance. Il traduit les politiques du Data Owner en actions concretes : documenter les métadonnées dans le data catalog (définitions, types, sensibilité, exemples de valeurs), surveiller les métriques de qualité, resoudre les anomalies détectées, former les équipes aux bonnes pratiques de saisie et d'utilisation des données.

C'est souvent un role a temps partiel (20 a 30 % du temps), assure par des analystes métier, des data analysts ou des experts fonctionnels proches des données. Nommer un Data Steward sans lui donner du temps dedie est une erreur courante qui condamne l'initiative de gouvernance.

Data Custodian

Le Data Custodian (parfois appele Data Engineer dans les organisations modernes) est le gardien technique des données. Il gere l'infrastructure (bases de données, data lake, pipelines d'ingestion), implemente techniquement les contrôles d'accès définis par le Data Owner (via les policies IAM, les roles Snowflake ou les masques de données dans Databricks Unity Catalog) et assure la sécurité physique et logique des données.

Data Council : le comite de gouvernance

Le Data Council (ou comite de gouvernance des données) est l'instance de pilotage transverse qui reunit le CDO, les Data Owners des principaux domaines, les representants IT et légal, et les parties prenantes métier clés. Il se reunit périodiquement (mensuel ou trimestriel) pour arbitrer les conflits de propriete, valider les définitions métier contestées, prioriser les initiatives de qualité et valider les politiques de gouvernance.

Le Data Council est l'équivalent d'un conseil d'administration pour les données : il n'opere pas au quotidien mais prend les décisions structurantes qui orientent l'ensemble du programme de gouvernance.

Framework

Le framework DAMA-DMBOK : la référence mondiale

Le DAMA-DMBOK (Data Management Body of Knowledge), publie par DAMA International et dont la 2e édition date de 2017, est le referentiel le plus utilise pour structurer la gouvernance et la gestion des données. Il découpe le data management en 11 domaines de connaissance organises autour d'un coeur central : la Data Governance.

Les 11 domaines DAMA-DMBOK

Le DAMA-DMBOK structure le Data Management en 11 domaines : Data Governance (pilotage global et central), Data Architecture (modélisation des structures data de l'entreprise), Data Modelling & Design (conception des schemas logiques et physiques), Data Storage & Opérations (gestion des bases, performances, sauvegardes), Data Security (contrôles d'accès, chiffrement, anonymisation), Data Intégration & Interoperability (ETL/ELT, APIs, event streaming), Documents & Content (gestion des documents non structures), Référence & Master Data (données de référence partages entre systèmes), Data Warehousing & Business Intelligence (analytique), Metadata Management (gestion des métadonnées actives), et Data Quality (mesure et amélioration continue de la qualité).

La Governance est le domaine central qui pilote les 10 autres : elle définit les standards, alloue les responsabilités et suit la conformité dans chacun des autres domaines. C'est pour cette raison que DAMA représente souvent le DMBOK sous forme de roue, avec la Governance au centre.

La certification CDMP : le standard professionnel

La CDMP (Certified Data Management Professional), délivrée par DAMA International, est la certification de référence pour les professionnels de la gouvernance et du data management. Elle couvre l'ensemble des 11 domaines du DAMA-DMBOK et existe en trois niveaux : Associate (examen de 100 questions sur le DMBOK), Practitioner (specialisation dans 2 domaines), et Master (specialisation dans 5 domaines). La CDMP est de plus en plus demandée dans les offres d'emploi Data Governance Manager, CDO adjoint et Data Steward senior.

Référence academique

Le DAMA-DMBOK 2e édition (2017) est la bible des professionnels de la gouvernance des données. Il structure 11 domaines de connaissance autour d'un modèle en roue (Wheel) avec la Governance au centre. La certification CDMP qui en est dérivée est reconnue internationalement comme standard de competence en Data Management.

DAMA International, DAMA-DMBOK 2nd Édition, 2017
Data Quality

Les 6 dimensions de la qualité des données

La qualité des données n'est pas une notion binaire (bonne ou mauvaise) : elle se mesure sur plusieurs dimensions indépendantes, définies par le DAMA-DMBOK. Comprendre ces dimensions est essentiel pour concevoir des tests de qualité pertinents et communiquer avec les équipes métier sur l'état réel des données.

Les 6 dimensions DAMA : completude, exactitude, cohérence, unicite, validité, actualite

La Completude (Completeness) mesure si toutes les données attendues sont presentes : un champ email null dans 30 % des lignes d'une table clients est un problème de completude. L'Exactitude (Accuracy) mesure la conformité des données a la réalité : un code postal qui ne correspond pas a la ville est un problème d'exactitude. La Cohérence (Consistency) mesure si la même information est identique dans plusieurs systèmes : un client dont le statut est 'actif' dans le CRM et 'inactif' dans la base de facturation est un problème de cohérence.

L'Unicite (Uniqueness) mesure l'absence de doublons : deux enregistrements pour le même client avec des IDs differents creent de la deduplication manuelle et des erreurs dans les analyses. La Validité (Validity) mesure la conformité au domaine de valeurs acceptables : un age de -3 ans ou 150 ans est invalide même s'il est présent. L'Actualite (Timeliness) mesure si les données sont disponibles quand et pour qui elles sont nécessaires : une donnée exacte mais disponible avec 3 jours de retard peut être inutilisable pour certains cas d'usage temps réel.

Mesurer et surveiller la qualité : Great Expectations, Monte Carlo, dbt tests

Great Expectations est la librairie open-source Python de référence pour ecrire des tests de qualité declaratifs sur les données. On définit des 'expectations' (assertions sur les données) — expect_column_values_to_not_be_null, expect_column_values_to_be_between — qui sont exécutées automatiquement dans les pipelines et generent des rapports HTML documentés. C'est le test unitaire applique aux données.

Monte Carlo est la plateforme de Data Observability leader du marche : elle surveille en continu les métriques de qualité (fraicheur, volume, schema, distribution des valeurs) et détecte automatiquement les anomalies (une table qui n'a pas ete mise a jour depuis 3 heures alors que d'habitude elle l'est toutes les heures). dbt propose des tests de qualité natifs (not_null, unique, accepted_values, relationships) directement intègres aux transformations SQL. Soda est une alternative open-source a Monte Carlo pour la data observability.

Règle des 1-10-100

La règle empirique des coûts de la qualité : corriger une erreur de donnée au moment de sa saisie coute 1 euro. La détecter et corriger lors de l'intégration coute 10 euros. La corriger après qu'elle a affecte un rapport de direction ou un modèle ML peut couter 100 euros (ou plus, en termes de décisions incorrectes prises sur cette base). Investir dans la prévention et la détection précoce est toujours plus rentable que la correction tardive.

Traceabilite

Le data lineage : tracer le cycle de vie des données

Le data lineage (lineage des données) est la traçabilite complète du parcours d'une donnée : d'ou elle vient (système source), quelles transformations elle a subi (ETL, SQL, modèles dbt), ou elle est stockée, qui la consomme et dans quels rapports ou modèles elle apparait. C'est la réponse a la question : si cette colonne 'chiffre d'affaires' dans mon dashboard est incorrecte, quelle est la source du problème ?

Sans lineage, l'impact analysis est impossible : quand un schema source change (un champ renomme, un type modifie), il est impossible de savoir rapidement quels pipelines, quelles tables et quels rapports sont affectes. Avec un lineage column-level complet, cette analyse prend quelques secondes dans l'outil de catalogue.

Lineage table-level vs column-level

Le lineage table-level (ou dataset-level) montre que la table 'fact_orders' est alimentée par 'raw.orders' via une transformation dbt — mais ne dit pas quelle colonne vient de quelle source. C'est utile pour comprendre l'architecture globale mais insuffisant pour le debugging et la conformité.

Le lineage column-level (column-level lineage) trace chaque colonne individuellement : 'La colonne revenue dans le rapport Q4 vient de la colonne amount dans raw.transactions, transformée par la vue staging.stg_transactions puis agrégée dans mart.fct_revenue.' C'est le niveau requis par le RGPD (tracer les données personnelles a travers tous les systèmes) et par l'EU AI Act (documenter les données d'entraînemnt des modèles IA).

OpenLineage, DataHub et les outils de lineage

OpenLineage est le standard ouvert (CNCF) pour l'emission et la collecte d'événements de lineage en temps réel depuis les orchestrateurs (Airflow, Prefect, Dagster) et les frameworks de transformation (dbt, Spark). Il permet d'aggerer le lineage de multiples outils dans un catalogue central. Marquez est le backend OpenLineage de référence (open-source).

DataHub (open-source, LinkedIn) et Apache Atlas sont les data catalogs open-source qui integrent nativement le lineage. Collibra et Alation proposent du lineage automatique dans leurs versions enterprise. dbt génère automatiquement un graphe de lineage de toutes les transformations SQL définies dans le projet — visible dans dbt Docs — et l'exporte via des integrations DataHub ou OpenLineage.

Lineage actif vs passif

Il existe deux approches pour collecter le lineage. Le lineage passif (ou statique) analyse le code SQL ou les définitions dbt a la compilation — rapide a mettre en place mais peut rater les transformations dynamiques ou les sources non documentées. Le lineage actif (ou dynamique) intercepte les événements d'exécution en temps réel via OpenLineage — plus precis et toujours a jour mais nécessite une intégration dans chaque outil du pipeline. La combinaison des deux est recommandée pour une gouvernance complète.

Outillage

Les outils de gouvernance des données

La gouvernance des données s'appuie sur deux catégories principales d'outils : les data catalogs (inventaire, documentation et lineage) et les outils de data quality et data observability (surveillance et remediation). Le choix de l'outil doit suivre la maturite organisationnelle — pas l'inverse.

Data Catalogs enterprise : Collibra, Alation, Atlan

Collibra est le leader historique du marche enterprise, avec des fonctionnalites avancées de stewardship (workflows d'approbation des définitions métier), de lineage bout en bout, de conformité RGPD (cartographie des données personnelles) et de business glossary. Il s'adresse aux grandes organisations avec des besoins de gouvernance complexes et des budgets consequents.

Alation se distingue par son moteur de recommandation base sur les patterns d'utilisation réels des requetes SQL — il recommande les tables et colonnes les plus fiables selon l'usage observe. Atlan est la solution cloud-native moderne, très populaire dans les jeunes organisations data-driven (data mesh, dbt-first), avec une interface très collaborative et des integrations natives dbt, Airflow et Snowflake.

Alternatives open-source : DataHub, OpenMetadata, Apache Atlas

DataHub (open-source, créé par LinkedIn, maintenu par Acryl Data) est le data catalog open-source le plus adopte dans les écosystèmes modernes. Il supporte le lineage automatique depuis dbt, Airflow, Spark et Kafka, le business glossary, les tags de sensibilité et les politiques d'accès. Apache Atlas reste la référence dans les écosystèmes Hadoop/Cloudera.

OpenMetadata est une alternative récente qui vise a devenir le catalog open-source le plus complet : lineage, profiling de données, tests de qualité intègres, collaboration, API ouverte. Unity Catalog de Databricks n'est pas un data catalog au sens traditionnel mais propose la gouvernance centralisée (ACL, masquage de données, lineage) pour toutes les ressources d'un Lakehouse Databricks.

Data Quality et Data Observability

Great Expectations est la librairie open-source Python de référence pour les tests de qualité declaratifs. Monte Carlo est la plateforme de Data Observability leader — elle détecte automatiquement les anomalies de fraicheur, volume, schema et distribution sur les tables critiques. Soda Core (open-source) est une alternative a Great Expectations avec un support natif cloud et des checks declaratifs en YAML. dbt tests restent le point de depart recommande pour les organisations dbt-first.

Mise en oeuvre

Comment demarrer une initiative de gouvernance en 90 jours

La gouvernance des données ne se met pas en place en un projet de 6 mois avec un outil enterprise et un nouveau departement. C'est un programme continu qui commence par des victoires rapides sur un perimetre restreint et s'etend progressivement par la valeur demontrée.

Les étapes clés du demarrage (90 jours)

Les 90 premiers jours doivent produire des résultats visibles. Mois 1 : identifier les Critical Data Éléments (CDE) — les 20 % de données qui generent 80 % de la valeur business (clients, produits, revenus). Nommer des Data Owners pour ces domaines. Creer un glossaire métier minimal avec les 20 définitions les plus contestées. Mois 2 : implementer les premiers tests de qualité (Great Expectations ou dbt tests) sur les CDE identifiés. Documenter ces données dans un data catalog minimal (peut être un Confluence enrichi avant de déployer Collibra). Mois 3 : presenter les premières métriques de qualité en Data Council. Montrer la valeur concrete : 'On a réduit les doublons clients de 23 % et les DRH et Finances utilisent maintenant la même définition de FTE.'

Gouvernance centralisée vs federe : quel modèle choisir ?

La gouvernance centralisée (hub-and-spoke) place l'équipe Data Governance centrale au coeur du système : elle définit les standards, les outils, les processus, et les domaines métier appliquent. C'est adapte aux organisations plus petites ou très regulées (banque, assurance, sante) ou la cohérence et la conformité sont prioritaires sur la velocite.

La gouvernance federée (ou distribuée, alignée avec le Data Mesh) donne aux domaines métier l'autonomie de definir et gerer leurs propres données, avec une équipe centrale qui fixe les standards minimaux (interoperabilite, sécurité, qualité des métadonnées) sans contrôler le contenu. C'est adapte aux grandes organisations decentralisées ou la vitesse d'iteration est critique. En pratique, la plupart des organisations adoptent un modèle hybride : standards et outils centralises, responsabilité et exécution fédérées.

L'ecueil classique : commencer par l'outil

L'erreur la plus courante est d'acheter Collibra ou Alation avant d'avoir nommer des Data Owners, defini les processus et alloue du temps aux Data Stewards. Un data catalog sans stewards actifs devient un referentiel vide en 6 mois — exactement comme un wiki d'entreprise que personne ne maintient. Les outils amplifient une gouvernance qui existe ; ils ne creent pas une gouvernance qui n'existe pas.

Approfondir le cluster Data & IA


Questions fréquentes sur la Data Governance

Qu'est-ce que la Data Governance ?

La Data Governance est l'ensemble des politiques, processus, roles et standards qui definissent comment une organisation collecte, gere, utilise et protege ses données. Elle répond aux questions : qui possède quelles données, qui peut y acceder, comment elles sont définies et comment leur qualité est assurée. Ce n'est pas un outil mais un cadre organisationnel.

Quelle est la différence entre Data Governance et Data Management ?

Le Data Management est le terme le plus large : il englobe toutes les pratiques de gestion du cycle de vie des données (pipelines, stockage, qualité, sécurité). La Data Governance est un sous-domaine du Data Management — c'est le cadre de pilotage qui définit les règles, responsabilités et standards que le Data Management met en oeuvre techniquement. Le DAMA-DMBOK place la Governance au centre de 10 autres domaines de Data Management.

Quelle est la différence entre Data Owner et Data Steward ?

Le Data Owner est un responsable business qui detient l'autorite sur un domaine de données — il decide des politiques et valide les définitions métier. Le Data Steward est un role opérationnel qui met en oeuvre ces politiques : il documente les métadonnées, surveille la qualité et resout les problèmes au quotidien. Le Data Owner donne la direction ; le Data Steward exécute.

Qu'est-ce que le DAMA-DMBOK ?

Le DAMA-DMBOK (Data Management Body of Knowledge) est le referentiel mondial de la gestion des données, publie par DAMA International (2e édition 2017). Il structure le Data Management en 11 domaines de connaissance, avec la Data Governance comme domaine central qui pilote les 10 autres. La certification CDMP (Certified Data Management Professional) est basée sur ce referentiel.

Quelles sont les 6 dimensions de la qualité des données ?

Le DAMA-DMBOK définit 6 dimensions : Completude (toutes les données attendues sont presentes), Exactitude (conformité a la réalité), Cohérence (même valeur dans tous les systèmes), Unicite (pas de doublons), Validité (conformité aux valeurs acceptables) et Actualite (disponible quand nécessaire). Great Expectations et dbt tests permettent de mesurer ces dimensions automatiquement dans les pipelines.

Qu'est-ce que le data lineage ?

Le data lineage est la traçabilite complète du parcours d'une donnée : d'ou elle vient, quelles transformations elle a subies et ou elle est consommée. Le lineage column-level trace chaque colonne individuellement. Il est indispensable pour l'impact analysis (savoir quels pipelines sont affectes quand un schema source change), la conformité RGPD et les exigences de l'EU AI Act. OpenLineage est le standard ouvert ; DataHub et dbt proposent du lineage automatique.

Comment la Data Governance est-elle liée au RGPD et a l'EU AI Act ?

Le RGPD impose de savoir exactement ou se trouvent les données personnelles, qui y accede, combien de temps elles sont conservées et comment les supprimer sur demande. L'EU AI Act (2024) requiert la documentation des données d'entraînemnt des modèles IA a haut risque (lineage, qualité, biais). La Data Governance est le cadre organisationnel qui permet de répondre a ces obligations de manière systématique et auditée.

Qu'est-ce qu'un data catalog ?

Un data catalog est un inventaire centralise des actifs data d'une organisation : tables, colonnes, fichiers, rapports, modèles ML. Il documente les métadonnées (définition métier, proprietaire, sensibilité, lineage) et permet aux équipes de decouvrir et comprendre les données disponibles. Les outils leaders sont Collibra, Alation et Atlan (enterprise) et DataHub, OpenMetadata (open-source).

Qu'est-ce que le Master Data Management (MDM) ?

Le Master Data Management est la gestion des données de référence partages entre plusieurs systèmes : clients, produits, fournisseurs, employes. L'objectif est de maintenir un 'golden record' — une version unique et fiable de chaque entité — pour éviter les inconsistances entre systèmes (un client avec 3 IDs differents dans 3 systèmes differents).

Par ou commencer une initiative de Data Governance ?

Commencez par identifier vos Critical Data Éléments (CDE) — les données les plus critiques pour le business (20 % qui generent 80 % de la valeur). Nommez des Data Owners pour ces domaines. Creez un glossaire métier minimal avec les 20 définitions les plus debattues. Implementez les premiers tests de qualité sur les CDE. Presentez les résultats en Data Council au bout de 90 jours. Privilegiez les victoires rapides sur un perimetre restreint plutot qu'un programme global.


Article précédent : Data Lake, Data Warehouse et Lakehouse

Article suivant : Business Intelligence et KPI