La gouvernance des données consiste à décider qui est responsable de quelles données, avec quel niveau de qualité, pendant combien de temps et sous quelles règles. En PME belge, c'est le chantier qu'on saute trop vite : on veut un tableau de bord ou un assistant IA avant d'avoir mis de l'ordre dans les données qui les alimentent. Or l'IA se répand vite. En 2024, 24,7 % des entreprises belges d'au moins dix personnes utilisaient déjà une technologie d'IA, un des taux les plus élevés d'Europe [1]. Se lancer sur des données non gouvernées, c'est automatiser ses propres erreurs à grande échelle.
Qu'est-ce que la gouvernance des données ?
La gouvernance des données est l'ensemble des règles, rôles et processus qui déterminent comment une organisation crée, nomme, stocke, partage et supprime ses données. Ce n'est pas un outil ni un logiciel : c'est une discipline de décision. Elle répond à des questions simples mais rarement tranchées dans une PME : qui décide de ce qu'est un « client actif » ? Quelle version de l'adresse fait foi entre la comptabilité et le CRM ? Combien de temps garde-t-on les CV reçus ?
Beaucoup de dirigeants confondent gouvernance des données et infrastructure : serveurs, sauvegardes, base de données. L'infrastructure est le contenant ; la gouvernance concerne le contenu et ses règles d'usage. Une PME peut avoir un cloud impeccable et une gouvernance inexistante, avec trois fichiers clients contradictoires et personne pour arbitrer.
La bonne nouvelle : à l'échelle d'une PME, la gouvernance n'exige ni comité pléthorique ni référentiel de plusieurs centaines de pages. Elle exige de la clarté sur quelques données critiques et des responsables nommés.
Pourquoi structurer ses données avant l'IA ou la BI ?
Un projet d'analytique ou d'intelligence artificielle ne crée pas de la fiabilité : il révèle et amplifie l'état réel des données. Un modèle entraîné sur des données dupliquées, mal catégorisées ou sans définition partagée produit des résultats faux mais présentés avec l'assurance d'un chiffre. C'est le piège le plus coûteux : une décision prise sur un tableau de bord crédible mais bâti sur des données pourries.
L'adoption de l'IA n'est plus marginale dans les PME. Environ 21 % des entreprises européennes de taille moyenne utilisaient une technologie d'IA en 2024 [1], et la tendance est nettement haussière. Le risque n'est donc pas théorique : de plus en plus de PME branchent des outils d'analyse ou des assistants sur des données qu'elles n'ont jamais mises au propre.
Structurer ses données en amont apporte trois bénéfices concrets. D'abord la fiabilité : des définitions partagées évitent que deux services calculent le même indicateur différemment. Ensuite la vitesse : un projet BI ou IA passe l'essentiel de son temps à nettoyer et réconcilier des données ; une base gouvernée raccourcit ce délai. Enfin la conformité : brancher un outil d'IA sur des données personnelles non cartographiées expose directement au risque RGPD. La gouvernance est le préalable qui rend l'investissement dans l'IA rentable plutôt que hasardeux. C'est aussi le socle d'une transformation digitale qui tient dans la durée.
Les quatre piliers d'une gouvernance utile
Inutile d'importer un cadre théorique complet. Pour une PME, quatre piliers couvrent l'essentiel.
1. La qualité des données. Une donnée utile est exacte, complète, cohérente et à jour. Concrètement : pas de doublons clients, des champs obligatoires renseignés, un même format pour les numéros de TVA ou les codes postaux. La qualité se mesure (taux de doublons, de champs vides) et se corrige à la source, pas dans chaque rapport en aval.
2. La propriété et la responsabilité. Chaque domaine de données a besoin d'un data owner : la personne qui tranche sur les définitions, la qualité attendue et les droits d'accès. C'est un rôle d'arbitrage métier, pas un poste technique. Sans propriétaire, personne n'arbitre les conflits et la donnée se dégrade sans que quiconque en réponde.
3. La cartographie. Il s'agit de savoir quelles données existent, où elles vivent, d'où elles viennent et où elles vont. Un inventaire simple (jeu de données, système, propriétaire, sensibilité, base légale) suffit à révéler les zones aveugles : le fichier de prospection oublié, l'export Excel qui circule par courriel, la copie stockée sur un poste.
4. Le cycle de vie et la rétention. Une donnée naît, sert, puis doit disparaître. Fixer des durées de conservation par type de données évite l'accumulation indéfinie, qui est à la fois un coût de stockage, un risque de sécurité et une non-conformité. Le principe de limitation de la conservation impose de ne pas garder des données personnelles plus longtemps que nécessaire [4].
| Pilier | Question clé | Signe qu'il manque |
|---|---|---|
| Qualité | La donnée est-elle exacte et cohérente ? | Deux services, deux chiffres différents |
| Propriété | Qui arbitre sur ce domaine ? | Personne ne répond des incohérences |
| Cartographie | Où vivent nos données et d'où viennent-elles ? | Des fichiers « fantômes » découverts par hasard |
| Cycle de vie | Quand supprime-t-on ? | Des données de 2015 encore actives |
Le RGPD au cœur de la gouvernance, pas à côté
En Belgique comme dans toute l'Union, la protection des données personnelles n'est pas une couche que l'on ajoute après : c'est un principe structurant de la gouvernance. Trois obligations se recoupent directement avec les piliers ci-dessus.
Le registre des activités de traitement est le point de départ. Il recense chaque traitement de données personnelles : sa finalité, les catégories de données et de personnes concernées, les destinataires et les durées de conservation. C'est, de fait, la cartographie RGPD de vos données. Contrairement à une idée répandue, la dispense pour les entreprises de moins de 250 personnes est d'application très limitée : le registre reste exigé dès que le traitement n'est pas occasionnel, présente un risque ou porte sur des données sensibles, ce qui recouvre la plupart des activités d'une PME (paie, gestion clients, prospection). L'Autorité de protection des données recommande d'ailleurs à toute organisation de le tenir comme outil interne de conformité [2][3].
La minimisation impose de ne collecter que les données réellement nécessaires à une finalité définie [4]. Ce principe entre en tension directe avec la logique du « collectons tout, on verra plus tard » qui accompagne souvent les projets data. Une gouvernance saine tranche en amont : chaque donnée collectée doit servir un usage identifié.
La protection dès la conception et par défaut demande d'intégrer la conformité au moment de concevoir un traitement, pas de la rattraper après [5]. Pour une PME qui s'apprête à déployer un outil BI ou un assistant IA, cela signifie poser les questions de finalité, de base légale et de rétention avant de brancher la donnée, jamais après.
Sécuriser les données sans confondre avec l'audit cyber
La sécurité fait partie de la gouvernance, mais elle ne s'y résume pas et ne remplace pas un audit de cybersécurité en bonne et due forme. Ici, l'angle est celui de la maîtrise des données : qui a accès à quoi, selon quel besoin réel. Un principe suffit à cadrer l'essentiel, celui du moindre privilège : chaque personne accède aux données strictement nécessaires à son rôle, ni plus.
Concrètement, une gouvernance qui tient inclut une gestion des droits d'accès révisée périodiquement, une classification par sensibilité (publique, interne, confidentielle, données personnelles) et des mesures techniques proportionnées au risque, comme le prévoit le RGPD pour la sécurité du traitement. La classification issue de la cartographie oriente directement l'effort : on protège d'abord ce qui est sensible et critique. Le diagnostic approfondi des vulnérabilités, lui, relève d'un audit de sécurité dédié, complémentaire mais distinct de la démarche de gouvernance.
Par où commencer sans usine à gaz ?
La principale cause d'échec d'une démarche de gouvernance en PME n'est pas le manque d'outils : c'est l'ambition démesurée. Vouloir tout cartographier, tout normaliser et tout documenter d'emblée mène à un projet interminable qui n'aboutit jamais. La bonne approche est étroite et itérative.
- Choisir trois à quatre jeux de données critiques. Ceux qui portent une décision, un revenu ou un risque : clients, ventes, données RH par exemple. On ignore le reste pour l'instant.
- Nommer un data owner par jeu. Une personne métier, pas l'informatique. Elle devient l'arbitre des définitions et de la qualité.
- Cartographier ces jeux et tenir le registre RGPD correspondant. Origine, systèmes, sensibilité, base légale, durée de conservation. Cette étape sert la conformité et la clarté d'un même geste.
- Fixer quelques règles simples. Une définition partagée par indicateur clé, un format standard, une durée de rétention. Peu de règles, mais tenues.
- Itérer. On élargit ensuite le périmètre aux données suivantes, en s'appuyant sur ce qui fonctionne, plutôt que de tout figer dans un référentiel monumental.
Cette progression par petits périmètres maîtrisés est aussi ce qui distingue un chantier data qui aboutit d'un projet qui s'enlise. Chez ITOPS.be, nous abordons la gouvernance des données selon la même logique que nos autres missions : un Blueprint d'abord (cartographie des données critiques, définition des rôles, registre RGPD, priorisation par valeur et par risque), puis un Build par vagues (mise en qualité, règles d'accès, préparation des données pour l'analytique ou l'IA). Cette continuité entre le cadrage et la mise en œuvre évite le rapport de conseil qui reste lettre morte, et pose des fondations sur lesquelles un projet BI ou IA devient enfin fiable. C'est le même esprit que celui d'une DSI externalisée qui pilote l'IT sans embauche permanente, appliqué au patrimoine de données. Une fois ce socle en place, un projet d'intelligence artificielle en PME repose sur des données dignes de confiance plutôt que sur du sable.
La gouvernance des données n'est pas un préalable bureaucratique à l'innovation : c'est ce qui la rend possible sans se retourner contre vous. Mieux vaut gouverner peu de données correctement que d'en analyser beaucoup sans savoir ce qu'elles valent.
Questions fréquentes
Faut-il gouverner ses données avant de lancer un projet d'IA ou de BI ?
Oui. Un modèle d'IA ou un tableau de bord n'invente pas la qualité : il amplifie ce qu'on lui donne. Des données incohérentes, dupliquées ou sans responsable produisent des analyses fausses mais crédibles. Structurer la propriété, la qualité et la cartographie des données est le socle qui rend l'analytique fiable [4].
Une PME de moins de 250 personnes doit-elle tenir un registre des traitements RGPD ?
Souvent oui. L'exception prévue pour les entreprises de moins de 250 employés est d'application très limitée : le registre reste requis dès que le traitement n'est pas occasionnel, présente un risque, ou porte sur des données sensibles, ce qui couvre la plupart des activités courantes (paie, clients, prospection). En pratique, l'Autorité de protection des données recommande à toute organisation de tenir ce registre [2].
Qu'est-ce qu'un data owner et pourquoi en désigner un ?
Le data owner est la personne responsable d'un domaine de données (clients, produits, RH). Elle tranche sur les définitions, la qualité attendue et les accès. Sans propriétaire nommé, personne n'arbitre les incohérences et la donnée se dégrade silencieusement. C'est un rôle d'arbitrage métier, pas un poste technique à temps plein.
Par où commencer une démarche de gouvernance des données sans se lancer dans une usine à gaz ?
Par un périmètre étroit : cartographier vos trois ou quatre jeux de données les plus critiques, leur attribuer un propriétaire, et fixer le registre RGPD correspondant. On élargit ensuite par itérations, sur les données qui portent une décision ou un risque, plutôt que de tout modéliser d'un coup.
Sources et Références
- Eurostat : Use of artificial intelligence in enterprises
- Autorité de protection des données : Qui doit tenir un registre des activités de traitement ?
- RGPD, article 30 : Registre des activités de traitement
- RGPD, article 5 : Principes relatifs au traitement des données à caractère personnel
- RGPD, article 25 : Protection des données dès la conception et par défaut