Cartographier ses données avant l'IA
Outils, flux, ressaisies : la méthode en sept questions...
Publié le
La qualité des données désigne la capacité d'un ensemble de données à servir correctement un usage donné : être exact, complet, cohérent, à jour et rattaché à la bonne personne ou au bon dossier. Pour une IA d'entreprise, c'est la condition première de fiabilité : un assistant qui lit une fiche en double, un document classé dans le mauvais dossier ou une note périmée produira une réponse fausse, bien rédigée et difficile à repérer comme telle.
Ce guide s'adresse aux dirigeants et responsables qui préparent un projet d'IA sur leurs propres données : CRM, emails, documents, comptes rendus. Il définit la qualité des données appliquée à l'IA, décrit les sept défauts qui trompent le plus souvent un assistant (dont les doublons, les homonymes et les documents mal rattachés), explique pourquoi l'IA les amplifie, rappelle les obligations d'exactitude des professions réglementées, puis propose une méthode pour mesurer et corriger sans tout nettoyer. Il fait partie de notre série sur le deuxième cerveau, l'IA agentique et l'IA en environnement réglementé, et prolonge notre guide sur la cartographie des sources avant un projet d'IA.
À retenir : une IA ne corrige pas vos données, elle les récite. Avant de la brancher, il faut savoir quels défauts faussent le premier usage visé, les mesurer sur des dossiers réels et les corriger en priorité. C'est pourquoi, dans la méthode de Majors Brain, l'étape de connexion d'une source inclut le nettoyage et la structuration des données (doublons et fiches incomplètes remis en ordre) et un test des réponses sur vos dossiers réels : une réponse sans source ne compte pas.
Définition courte. Une donnée est de qualité lorsqu'elle permet de prendre la bonne décision pour l'usage auquel elle sert. La même fiche client peut être suffisante pour envoyer une newsletter et insuffisante pour préparer un rendez-vous de conseil : la qualité n'est pas une propriété absolue, c'est une adéquation à l'usage.
Le cadre normatif. La norme ISO/IEC 25012 (famille SQuaRE) propose un modèle de quinze caractéristiques de qualité des données. Cinq d'entre elles sont dites inhérentes, c'est-à-dire propres à la donnée elle-même : l'exactitude (la donnée représente correctement la réalité), la complétude (les attributs attendus sont renseignés), la cohérence (pas de contradiction avec d'autres données), la crédibilité (la donnée est jugée digne de confiance) et l'actualité (elle est à jour pour l'usage). Les autres dépendent du système : accessibilité, confidentialité, traçabilité, portabilité, etc. Ce vocabulaire est utile parce qu'il permet de nommer précisément un défaut au lieu de dire « nos données sont mauvaises ».
Ce que montrent les mesures disponibles. Dans un article de la Harvard Business Review (septembre 2017), Tadhg Nagle, Thomas Redman et David Sammon rapportent les mesures réalisées avec 75 dirigeants sur deux ans : en moyenne, 47 % des enregistrements récemment créés comportaient au moins une erreur critique, et seuls 3 % des scores obtenus atteignaient le seuil jugé acceptable, même avec le critère le plus indulgent. En février 2025, Gartner prévoyait que 60 % des projets d'IA non soutenus par des données « prêtes pour l'IA » seraient abandonnés d'ici fin 2026. La première donnée est une mesure sur un échantillon ; la seconde est une prévision d'analyste : elles ne se valent pas, mais elles pointent dans la même direction.
Données « prêtes pour l'IA » : une distinction utile. Une base peut être propre au sens comptable (chaque champ est rempli et valide) et pourtant inutilisable par une IA, parce que l'information décisive se trouve ailleurs : dans une pièce jointe, un compte rendu, un échange de mails. Pour une IA d'entreprise, la qualité porte donc sur trois objets à la fois : les données structurées (fiches, champs, montants), les documents (et leur rattachement) et les textes libres (notes, comptes rendus, emails), où se loge une grande partie de la connaissance explicitée de l'organisation.
Les défauts ci-dessous se retrouvent dans presque toutes les organisations qui travaillent depuis plusieurs années avec un CRM, une messagerie et un espace documentaire. Ils étaient tolérables tant qu'un collaborateur les compensait de mémoire. Ils ne le sont plus lorsqu'une IA lit les données sans ce filtre.
| Défaut | Exemple type | Effet sur la réponse d'une IA | Comment le repérer |
|---|---|---|---|
| 1. Doublon | Le même client existe sous « J. Durand » et « Jean Durand », chaque fiche portant une partie de l'historique | Réponse incomplète : l'IA ne voit qu'une moitié du dossier, ou additionne deux fois un même actif | Rapprochement sur email, téléphone, date de naissance, SIREN |
| 2. Homonyme (fusion à tort) | Deux personnes distinctes portant le même nom, parfois dans la même famille (père et fils) | Réponse plausible sur la mauvaise personne : l'erreur la plus dangereuse, car elle ne se voit pas | Contrôle des identifiants secondaires avant toute fusion |
| 3. Document mal rattaché | Un avis d'imposition classé dans le dossier du conjoint, un contrat dans « Divers » | L'IA cite un document réel… du mauvais dossier, ou ignore une pièce décisive | Documents sans rattachement, contrôle du nom figurant dans le document |
| 4. Notes contradictoires | Une note indique « profil prudent », un compte rendu ultérieur « accepte davantage de risque » | L'IA choisit l'une des deux sans le dire, ou fabrique une synthèse incohérente | Relecture des dossiers actifs, dates des notes |
| 5. Information périmée | Situation familiale, adresse, revenus ou employeur non mis à jour | Réponse exacte au regard des données, fausse au regard de la réalité | Date de dernière mise à jour par champ clé |
| 6. Champ clé vide | Objectifs, horizon de placement, origine des fonds non renseignés | L'IA comble le vide par inférence, ou répond « non documenté » sans signaler l'enjeu | Taux de remplissage des champs critiques |
| 7. Format hétérogène | Dates au format 03/04 ambigu, montants en k€ ou en €, abréviations internes (« AV », « PER », « RDV2 ») | Erreurs de calcul, de chronologie ou d'interprétation | Contrôle de format, glossaire interne |
Doublons et homonymes : deux erreurs opposées. Le doublon est une même réalité enregistrée deux fois ; l'homonyme est deux réalités confondues en une. En informatique, le problème porte un nom, la résolution d'entités (ou rapprochement d'enregistrements), étudié depuis les travaux de Fellegi et Sunter en 1969. Leçon pratique : un dédoublonnage trop agressif crée des homonymes fusionnés, souvent plus graves que les doublons qu'il supprime. Toute fusion automatique devrait donc reposer sur au moins deux identifiants concordants et laisser les cas douteux à un arbitrage humain.
Le défaut invisible : la version. Un huitième cas recoupe plusieurs lignes du tableau : plusieurs versions d'un même document (projet, version signée, avenant) coexistent sans indication de statut. Une IA qui retrouve le projet non signé le cite avec la même assurance que la version définitive. Distinguer clairement les statuts, ou n'exposer à l'IA que les versions validées, règle une grande partie du problème.
Il est tentant de penser qu'une IA « intelligente » saura faire le tri. C'est l'inverse qui se produit, pour quatre raisons de fonctionnement. Ce sont des constats sur la mécanique des assistants génératifs branchés sur des documents (approche dite RAG, génération augmentée par la recherche), pas sur un outil en particulier.
Ce que la citation des sources change. Une IA qui indique d'où vient chaque information ne supprime pas les défauts de données, mais elle les rend visibles : en voyant qu'une synthèse s'appuie sur une note de 2021 ou sur un document du mauvais dossier, le lecteur peut corriger la réponse et, surtout, la donnée. C'est une raison forte de préférer des réponses sourcées : chaque usage devient une occasion de repérer un défaut.
Dans la méthode Brain, les données ne sont pas branchées « en l'état » : à l'étape de connexion, elles sont nettoyées et structurées, doublons et fiches incomplètes remis en ordre, puis les réponses sont vérifiées sur vos dossiers réels. Chaque réponse cite d'où vient l'information, ce qui permet de repérer et corriger un défaut au lieu de le reproduire. On commence par deux ou trois sources, pas par tout le système d'information.
Audit de 30 minutes • Gratuit, sans engagement • Aucun accès technique nécessaire
Dans les professions réglementées, la qualité des données n'est pas seulement une question d'efficacité. Plusieurs textes en font une obligation, bien avant toute question d'IA.
| Texte | Ce qu'il exige | Qui est concerné |
|---|---|---|
| RGPD, art. 5.1.d (principe d'exactitude) | Données personnelles exactes et, si nécessaire, tenues à jour ; mesures raisonnables pour rectifier ou effacer sans tarder les données inexactes | Toute organisation traitant des données personnelles |
| RGPD, art. 16 (droit de rectification) | La personne concernée peut obtenir la rectification de données inexactes et compléter des données incomplètes | Idem |
| Règlement délégué (UE) 2017/565, art. 54 §7 (MIF 2) | Mesures raisonnables pour s'assurer que les informations recueillies sur les clients sont fiables, et informations adéquates et à jour dans une relation suivie | Conseil en investissement (CIF, prestataires de services d'investissement) |
| Code monétaire et financier, art. L. 561-6 (LCB-FT) | Vigilance constante sur la relation d'affaires et mise à jour des éléments de connaissance du client | Assujettis à la lutte contre le blanchiment (banque, assurance, CIF, IOBSP, experts-comptables, avocats pour certaines activités…) |
Ce que l'IA change. Ces obligations ne sont pas nouvelles. Ce qui change, c'est la vitesse à laquelle une donnée inexacte se diffuse. Une fiche client périmée consultée une fois par an restait une anomalie locale ; lue par un assistant qui prépare les rendez-vous, rédige des comptes rendus et propose des relances, elle se retrouve dans plusieurs documents remis au client. Dans le conseil patrimonial, un profil de risque ou une situation familiale erronée peut ainsi fausser un rapport d'adéquation, avec les conséquences qu'on imagine sur le devoir de conseil.
La tension avec la minimisation et la conservation. Améliorer la qualité ne signifie pas tout garder. Le RGPD impose aussi de limiter la conservation (art. 5.1.e) et de ne collecter que le nécessaire. Nettoyer ses données, c'est donc à la fois corriger, compléter et supprimer ce qui n'a plus lieu d'être, dans le respect des durées légales (par exemple la conservation des documents LCB-FT prévue à l'article L. 561-12 du CMF). Les enjeux de confidentialité propres à ces professions sont traités dans notre guide sur l'IA et le secret professionnel.
On ne corrige bien que ce qu'on a mesuré. Inutile pour autant de lancer un audit de plusieurs mois : un échantillon bien choisi donne en quelques heures une image suffisante pour décider.
La mesure « du vendredi après-midi ». Thomas Redman, l'un des auteurs de l'étude citée plus haut, propose une méthode simple, dite Friday Afternoon Measurement : prendre les 100 derniers enregistrements créés (par exemple les 100 dernières fiches du CRM), retenir 10 à 15 champs critiques, puis réunir trois ou quatre personnes qui connaissent les dossiers pour marquer, ligne par ligne, les erreurs évidentes. Le pourcentage d'enregistrements sans aucune erreur donne un score de qualité de 0 à 100. La méthode ne prétend pas à l'exhaustivité ; elle répond à la seule question utile au départ : faut-il s'inquiéter ?
Les indicateurs à ajouter pour un projet d'IA. Le score global ne suffit pas, car une IA est sensible à des défauts qu'un tableur ne montre pas. Sur le même échantillon, ou sur une trentaine de dossiers actifs, on peut relever :
| Indicateur | Comment le calculer | Ce qu'il révèle |
|---|---|---|
| Taux de doublons | Fiches rapprochables sur un identifiant fort / total des fiches | Risque de dossiers fragmentés |
| Taux de remplissage des champs critiques | Champs renseignés / champs attendus, par champ | Zones où l'IA devra inférer ou avouer une lacune |
| Âge de la dernière mise à jour | Date de dernière modification des champs clés (situation, revenus, profil) | Part des réponses exactes « sur le papier » mais fausses en réalité |
| Documents non rattachés | Pièces sans client, dossier ou date identifiable | Information que l'IA ne pourra pas relier ou reliera mal |
| Contradictions relevées | Nombre de dossiers où deux sources se contredisent sur un point clé | Besoin d'une règle de résolution |
| Ressaisies | Informations saisies dans plusieurs outils | Sources probables de divergences futures |
Ce diagnostic s'appuie naturellement sur la cartographie des sources, dont la couche « qualité » n'est qu'esquissée : la cartographie dit où sont les données, la mesure dit dans quel état elles se trouvent.
Le réflexe courant, « nettoyons tout avant de commencer », est rarement le bon. Il retarde le projet de plusieurs mois et consomme l'énergie sur des données qui ne serviront peut-être jamais. Mieux vaut raisonner par usage.
1. Prioriser par usage. Si le premier usage est la préparation des rendez-vous, les champs qui comptent sont la situation familiale et professionnelle, les objectifs, les contrats détenus et les derniers échanges. Les défauts sur ces champs, pour les dossiers actifs, passent avant tout le reste.
2. Désigner une source de référence par information. Pour chaque information clé, décider quel outil fait foi : le CRM pour l'identité et la situation, l'espace documentaire pour les pièces signées, les comptes rendus validés pour les décisions. Sans cette règle, deux outils divergents produiront tôt ou tard deux réponses divergentes. Les rôles et le cycle de vie qui font tenir cette règle dans la durée sont détaillés dans le guide pour capitaliser les connaissances et gouverner leur cycle de vie.
3. Écrire une règle de résolution des contradictions. Par défaut, l'information la plus récente, datée et sourcée l'emporte ; pour les points sensibles (profil de risque, bénéficiaires, origine des fonds), l'arbitrage revient à un humain, et la décision est tracée. Une IA bien conçue devrait signaler une contradiction plutôt que la trancher en silence.
4. Fusionner avec prudence. Pas de fusion automatique sur le seul nom. Deux identifiants concordants au minimum, une revue humaine pour les cas douteux, et un journal des fusions pour pouvoir revenir en arrière.
5. Traiter la cause, pas seulement le symptôme. La plupart des défauts naissent à la saisie ou dans les ressaisies entre outils. Rendre obligatoires quelques champs critiques, imposer un format de date, rattacher un document au moment où il entre plutôt qu'en fin de mois : ces règles simples évitent que la base se dégrade à nouveau. C'est l'enseignement central de Redman : la qualité se construit à la création de la donnée.
6. Nommer un responsable par domaine. Une donnée sans propriétaire se dégrade. Dans une petite structure, il suffit qu'une personne soit responsable de la qualité des fiches clients, une autre de l'espace documentaire, avec un point de contrôle trimestriel. Ces règles trouvent leur place dans la charte d'usage de l'IA de l'organisation.
Le cercle vertueux. Une fois l'IA en place, chaque réponse sourcée devient un contrôle qualité : l'utilisateur qui repère une information fausse corrige la donnée à la source, et la mémoire de l'organisation s'améliore au fil de l'usage. C'est ce qui distingue une mémoire d'entreprise exploitable d'une simple archive : elle est rattachée, datée, justifiée, et entretenue.
Illustration : un cabinet fictif. Prenons un cabinet de conseil en gestion de patrimoine fictif, trois conseillers et une assistante, qui souhaite qu'une IA prépare ses rendez-vous. La mesure sur les 100 dernières fiches fait apparaître des défauts classiques : un couple enregistré comme deux fiches sans lien, un père et son fils homonymes dont les contrats ont été mélangés lors d'un import, des avis d'imposition classés au nom du conjoint, et une situation familiale restée « mariée » deux ans après un divorce mentionné seulement dans un compte rendu.
Sans correction, la synthèse préparée par l'IA pour le rendez-vous du fils aurait mentionné les contrats du père, et celle de la cliente divorcée aurait raisonné sur un foyer fiscal qui n'existe plus. Le cabinet décide de corriger d'abord les dossiers des clients vus dans les trois prochains mois, de faire du CRM la source de référence pour la situation familiale, et d'exiger un rattachement au client dès l'enregistrement d'un document. Ce cas est une illustration construite pour l'article, pas un retour d'expérience.
Où se place Brain. Cette démarche correspond à la logique de Majors Brain, présentée sur sa page méthode : un périmètre initial de deux ou trois sources, un nettoyage et une structuration des données au moment de la connexion, une vérification des réponses sur les dossiers réels, puis un point de décision libre avant d'élargir. Les réponses citent d'où vient l'information et aucune proposition n'est transmise sans validation, ce qui laisse à l'humain le dernier mot sur ce que la donnée dit vraiment. Pour les cabinets qui veulent aussi fiabiliser la collecte à la source, le recueil patrimonial de la Suite Majors® structure dès la saisie les informations clés du client.
Les 7 manquements qui reviennent le plus souvent dans les dossiers clients, avec les références réglementaires vérifiées. 10 minutes de lecture, sans inscription.
Lire le guide conformité →Lecture libre. Aucune inscription requise.
Une IA d'entreprise ne vaut pas mieux que les données qu'elle lit. Les doublons, les homonymes, les documents mal rattachés, les notes contradictoires et les informations périmées ne sont pas des détails techniques : ce sont les causes les plus probables de ses erreurs, et elles deviennent plus graves à mesure que l'IA gagne en autonomie.
La bonne réponse n'est ni d'attendre une base parfaite, ni de brancher l'IA sur tout en espérant qu'elle fasse le tri. Elle consiste à choisir un premier usage, mesurer la qualité sur des dossiers réels, corriger ce qui compte pour cet usage, poser des règles qui empêchent la dégradation, puis élargir. C'est ainsi qu'un deuxième cerveau d'entreprise devient fiable : non par la puissance du modèle, mais par la qualité de la mémoire qu'il exploite.
Pour aller plus loin : Centraliser les données clients : méthode 2026
L'audit Brain passe en revue vos outils, l'endroit où vivent vos données et ce que vos équipes ressaisissent. Il en ressort une carte de vos sources connectables, votre porte d'entrée et une feuille de route par phases, qui commence par deux ou trois sources remises en ordre plutôt que par tout votre système d'information.
30 minutes • Gratuit, sans engagement • Aucun accès technique nécessaire
Outils, flux, ressaisies : la méthode en sept questions...
Hallucinations, sources et méthode de vérification en entreprise...
Préserver et valoriser la connaissance interne...
Pourquoi Brain, la méthode progressive et les trois portes d'entrée...