Cartographier ses sources de données avant un projet d'IA : la méthode en sept questions

Mur de post-it listant des irritants de travail : cartographier ses outils, ses données et ses ressaisies avant un projet d'IA

La cartographie des sources de données est l'inventaire, réalisé avant de choisir un outil d'intelligence artificielle, de tous les endroits où une organisation produit et conserve de l'information utile : logiciels métier, messageries, agendas, espaces documentaires, tableurs, conversations, notes. Pour chaque source, elle décrit ce qu'elle contient, où elle est hébergée, comment l'information y entre et en sort, qui y a accès, dans quel état elle se trouve et sous quelles contraintes légales. C'est le document qui permet de décider ce qu'une IA pourra lire, ce qu'elle ne verra pas, et par où commencer.

Dans la plupart des projets, cette étape est sautée : on choisit un outil, puis on découvre ce qu'il peut atteindre. Ce guide propose l'ordre inverse. Il explique ce qu'est une cartographie des sources et en quoi elle diffère de la cartographie du système d'information et du registre RGPD, les six couches à décrire pour chaque source, les sept questions d'un diagnostic préalable, une grille de classement (connectable, à valider, non relié), le rôle des ressaisies comme boussole, les points de conformité à faire apparaître et une méthode en six étapes. Il fait partie de notre série sur le deuxième cerveau, l'IA agentique et l'IA en environnement réglementé.

À retenir : une IA d'entreprise ne vaut que par ce qu'elle peut lire. Avant de comparer des outils, il faut savoir où vivent vos données, ce que vos équipes ressaisissent et quelles informations se perdent. C'est la logique du diagnostic qui ouvre tout déploiement de Majors Brain : cartographier les sources, classer chacune (connectable, à valider techniquement, non reliée), puis relier deux ou trois sources seulement pour commencer.

Cartographie des sources : définition, et pourquoi elle précède le choix de l'outil

Définition courte. Cartographier ses sources, c'est répondre par écrit à une question simple : si une IA devait connaître notre activité aussi bien qu'un collaborateur expérimenté, où devrait-elle aller chercher l'information ? La réponse n'est presque jamais « dans le logiciel principal ». Elle est dans le logiciel, mais aussi dans les emails, les pièces jointes, les comptes rendus, les tableurs personnels et la mémoire des personnes.

Ce que disent les études sur les échecs. Deux travaux souvent cités convergent. Le rapport de la RAND Corporation publié en 2024, fondé sur des entretiens avec 65 data scientists et ingénieurs, identifie cinq causes profondes d'échec des projets d'IA. Les deux premières ne sont pas techniques : un problème mal compris ou mal formulé par les décideurs, et l'absence des données nécessaires. En février 2025, Gartner prévoyait que, jusqu'en 2026, les organisations abandonneraient 60 % des projets d'IA non soutenus par des données « prêtes pour l'IA », et relevait que 63 % des organisations interrogées (248 responsables de la gestion des données) n'avaient pas, ou ne savaient pas si elles avaient, les bonnes pratiques de gestion des données pour l'IA. Il s'agit d'une prévision d'analyste, pas d'une mesure : elle indique néanmoins où se situe le risque.

Le cadre de référence. Le cadre de gestion des risques de l'IA du NIST (AI RMF 1.0, janvier 2023) organise la démarche en quatre fonctions : gouverner, cartographier (Map), mesurer, gérer. La fonction Map consiste à établir le contexte : usages prévus, lois applicables, parties prenantes, limites du système. Selon le NIST, c'est à l'issue de cette étape qu'une organisation dispose d'assez d'éléments pour décider de concevoir, déployer ou non un système d'IA. Autrement dit, la cartographie n'est pas une formalité préalable : c'est le moment où l'on peut encore renoncer à un usage.

Trois documents voisins, trois questions différentes. La cartographie des sources emprunte à deux pratiques existantes, sans se confondre avec elles.

Document Point de départ Ce qu'il décrit Question à laquelle il répond
Cartographie du système d'information (ANSSI) Les actifs informatiques Écosystème, vue métier, applications, administration, infrastructures logiques et physiques De quoi est fait notre SI, et comment le protéger ?
Registre des activités de traitement (art. 30 RGPD) Les finalités Données personnelles, personnes concernées, destinataires, durées de conservation, sécurité Quels traitements de données personnelles sommes-nous autorisés à faire ?
Cartographie des sources pour l'IA Le travail réel Où naît l'information, comment elle circule, ce qui est ressaisi ou perdu, qui y accède, dans quel état Qu'est-ce qu'une IA pourrait lire, pour quel usage, et par où commencer ?

Le guide de l'ANSSI sur la cartographie du système d'information (2018) apporte une leçon de méthode directement transposable : il recommande une démarche progressive (on enrichit par de nouvelles vues) et itérative (on affine les vues existantes), plutôt qu'un inventaire exhaustif du premier coup, et consacre sa cinquième étape à la mise à jour de la cartographie dans la durée. Une cartographie des sources pour l'IA suit la même logique : une première version en quelques heures, affinée à chaque source reliée.

Les six couches à décrire pour chaque source de données

Une ligne de tableau « Outlook — emails » ne suffit pas à décider quoi que ce soit. Pour qu'une cartographie serve à choisir, chaque source doit être décrite selon six couches. Elles forment la fiche type d'une source.

  1. Le contenu. Quelles informations la source contient-elle réellement, et sous quelle forme : données structurées (champs d'un logiciel), documents (PDF, Word, scans), textes libres (emails, notes), audio ? Un scan non lisible par une machine n'a pas la même valeur qu'un document texte.
  2. L'emplacement et l'hébergement. Où la donnée est-elle stockée : logiciel en ligne, serveur interne, poste de travail, téléphone personnel ? Chez quel prestataire, dans quel pays ? Cette couche conditionne à la fois l'accès technique et l'analyse de conformité.
  3. Les flux. D'où vient l'information, où va-t-elle ensuite ? Un recueil client peut arriver par email, être enregistré dans l'espace documentaire, puis ressaisi dans le logiciel métier. Chaque passage manuel est un point de perte ou d'erreur, et souvent le meilleur candidat à l'automatisation.
  4. Les droits d'accès. Qui peut lire, modifier, supprimer ? Les droits sont-ils définis par personne, par équipe, par dossier ? C'est une couche critique : un outil d'IA branché sur une source hérite de ses permissions, et peut révéler à un collaborateur une information qu'il n'aurait jamais ouverte lui-même si ces permissions sont trop larges. Nous détaillons ces risques et la manière de les prévenir dans notre guide sur les droits d'accès et le cloisonnement d'une IA d'entreprise.
  5. La qualité et la fraîcheur. Doublons, homonymes, documents mal rattachés au bon client, notes contradictoires, informations périmées. Une IA ne corrige pas ces défauts : elle les restitue avec aplomb. Notre guide sur la fiabilité des réponses d'une IA d'entreprise montre comment ces défauts se transforment en erreurs ; notre guide sur la qualité des données avant l'IA explique comment les mesurer et les corriger.
  6. Les contraintes. Données personnelles ou sensibles, secret professionnel, durées de conservation imposées, clauses du contrat avec l'éditeur (export autorisé, accès par un tiers), existence ou non d'un moyen d'accès technique documenté.

Ce qu'il ne faut pas oublier. Les sources les plus précieuses sont souvent les moins visibles : le tableur de suivi que tient une assistante, le fil de messagerie instantanée avec un client, le carnet de notes du dirigeant. Une partie de la connaissance n'est d'ailleurs écrite nulle part ; notre article sur la connaissance tacite et explicite explique comment la capter. La cartographie doit au moins signaler ces zones, même si elles ne seront jamais reliées.

Les sept questions d'un diagnostic avant un projet d'IA

Plutôt que de partir d'une liste de fonctionnalités, un bon diagnostic part de la façon dont l'organisation travaille. Les sept questions ci-dessous sont celles que présente le diagnostic de Majors Brain. Elles valent quel que soit l'outil envisagé ; nous précisons pour chacune ce qu'elle doit faire apparaître et le piège courant.

# Question Ce qu'elle doit faire apparaître Piège courant
1 Quels outils utilisez-vous ? La liste complète, y compris les outils personnels et gratuits Ne citer que les logiciels payés par l'entreprise
2 Où vivent vos données ? L'emplacement réel de chaque type d'information, et les copies Confondre l'outil de référence et l'endroit où l'on cherche vraiment
3 Comment communiquez-vous avec les clients ? Les canaux (email, téléphone, visio, messagerie instantanée, courrier) et ce qu'il en reste Oublier les canaux dont rien n'est conservé
4 Qu'est-ce que vous ressaisissez ? Chaque copie manuelle d'un outil vers un autre Ne plus voir les ressaisies devenues des habitudes
5 Qu'est-ce qui consomme du temps ? Les tâches répétitives et leur fréquence Estimer au jugé au lieu d'observer une semaine réelle
6 Quelles informations tombent entre les mailles ? Les relances oubliées, les engagements non suivis, les informations connues d'une seule personne Répondre « rien » faute d'avoir cherché
7 Qu'aimeriez-vous automatiser ? Les attentes, formulées comme des tâches Commencer par cette question et laisser l'envie guider le périmètre

L'ordre compte. Les questions 1 à 3 décrivent l'existant, les questions 4 à 6 révèlent les frictions, la question 7 exprime un souhait. Poser la septième en premier revient à choisir une solution avant d'avoir décrit le problème, ce que le rapport RAND désigne justement comme la première cause d'échec.

Qui répondre. Pas seulement le dirigeant. Les réponses d'un associé, d'un assistant et d'un collaborateur arrivé récemment divergent presque toujours sur les questions 2, 4 et 6, et ces écarts sont une information en soi : ils montrent où la connaissance dépend d'une personne.

Majors Brain Majors Brain

Faire ce diagnostic avec un regard extérieur

Ces sept questions sont le point de départ de l'audit Brain : trente minutes, gratuites et sans engagement, en visio ou via un questionnaire en ligne, sans accès technique demandé. Vous repartez avec la carte de vos sources connectables, votre porte d'entrée (garder vos outils, remplacer le CRM ou digitaliser progressivement), les tâches automatisables avec validation, et une feuille de route par phases, sans obligation d'aller au bout.

30 minutes • Gratuit, sans engagement • Aucun accès technique nécessaire

Classer chaque source : connectable, à valider techniquement, non reliée

Une fois les sources décrites, il faut les classer. La méthode de Brain retient trois catégories, simples et utiles au-delà de ce seul outil : connectable (un accès technique existe et peut être activé), à valider techniquement (un accès semble possible mais doit être vérifié : documentation, contrat, droits), non reliée (pas d'accès, ou un coût de développement disproportionné). Sur la page méthode de Brain, l'exemple donné range la messagerie, l'agenda et l'espace documentaire parmi les sources connectables, les conversations et le CRM existant parmi celles à valider.

Connectable ne veut pas dire prioritaire. Le classement technique se croise avec deux autres critères : la valeur de la source pour les usages visés, et sa sensibilité. Une source très sensible et peu utile au premier usage peut attendre, même si elle est techniquement accessible.

Illustration. Prenons un cabinet fictif de conseil patrimonial de quatre personnes. Le tableau ci-dessous est un exemple de raisonnement, pas un diagnostic réel : le classement technique de chaque outil se vérifie au cas par cas.

Source Classement technique Valeur pour le 1er usage (préparer un rendez-vous) Sensibilité Décision
Messagerie professionnelle Connectable Forte : échanges, pièces jointes, engagements pris Élevée Périmètre initial, avec droits par collaborateur
Agenda Connectable Forte : qui voit qui, quand Moyenne Périmètre initial
Espace documentaire partagé Connectable Forte, si les documents sont rattachés au bon client Élevée Périmètre initial, après tri des dossiers mal classés
CRM existant À valider Forte Élevée Vérifier l'accès prévu pour un tiers et le contrat ; sinon export ou migration plus tard
Messagerie instantanée avec les clients À valider Moyenne Élevée Phase 2, après clarification des comptes (professionnels ou personnels)
Tableur de suivi des relances Import ponctuel Moyenne Moyenne Reprendre les données, puis abandonner le tableur
Carnets de notes papier Non reliée Variable Élevée Hors périmètre ; changer la pratique pour les nouveaux rendez-vous

Savoir ce que l'IA ne voit pas. Le classement « non reliée » n'est pas un échec : c'est une information. Une IA qui n'a pas accès aux notes papier ne peut pas les restituer, et ses réponses doivent être lues en conséquence. La méthode de Brain assume cette limite : certaines sources ne seront pas reliées, ou demanderont un développement qui ne vaut pas toujours son coût, et cela est dit à l'audit, source par source.

Les ressaisies, meilleur indicateur de ce qu'il faut relier en premier

Définition. Une ressaisie est toute copie manuelle d'une information d'un support vers un autre : recopier dans le logiciel métier les éléments d'un recueil reçu en PDF, retranscrire des notes de rendez-vous, reporter dans un tableur des valeurs lues sur un extranet, transférer un email vers l'espace documentaire.

Pourquoi elles sont si révélatrices. Une ressaisie signale trois choses à la fois : deux sources qui devraient communiquer et ne le font pas, un temps de travail sans valeur ajoutée, et un risque d'erreur ou d'écart entre deux versions d'une même information. C'est pourquoi la question « qu'est-ce que vous ressaisissez ? » est souvent la plus productive d'un diagnostic : elle désigne directement les flux à relier en priorité.

Comment les mesurer sans y passer des semaines.

  • Tenir pendant une à deux semaines un journal des ressaisies : quoi, depuis quelle source, vers quelle destination, combien de fois, combien de temps.
  • Noter à part les écarts constatés : une adresse différente entre deux outils, une situation familiale non mise à jour, un document présent dans l'email mais absent du dossier.
  • Repérer les informations qui tombent entre les mailles : une relance promise en rendez-vous et jamais notée, une échéance connue d'un seul collaborateur.
  • Classer ensuite les flux par fréquence × temps × risque. Les trois premiers désignent en général le premier usage.

Du constat au périmètre initial. La tentation est de tout relier d'un coup. La méthode de Brain prend le contre-pied : « deux ou trois sources suffisent à produire un bénéfice visible ». Ce choix n'est pas qu'une question de prudence. Avec peu de sources, on peut tester les réponses sur des dossiers réels, vérifier que chacune cite sa source, corriger les défauts de qualité découverts, puis décider d'élargir, d'automatiser ou de s'arrêter. Nous avons détaillé cette logique progressive dans Majors Brain : le deuxième cerveau d'entreprise, et les critères pour passer d'un niveau d'autonomie à l'autre dans IA agentique en entreprise : assistant, copilote ou agent.

Données sensibles, droits et conformité : ce que la cartographie doit faire apparaître

Une cartographie des sources n'est pas un document juridique, mais elle doit rendre visibles les points qui décideront de la faisabilité d'un usage. Dans une profession réglementée, cinq points sont incontournables.

  1. La cohérence avec le registre des traitements. Le registre des activités de traitement prévu par l'article 30 du RGPD recense, pour chaque traitement, ses finalités, les catégories de données et de personnes, les destinataires et sous-traitants, les transferts, les délais d'effacement et les mesures de sécurité. La CNIL précise qu'il doit être tenu quelle que soit la taille de l'organisme, l'allègement prévu sous 250 salariés ne couvrant pas les traitements non occasionnels ou sensibles. Brancher une IA sur une source, c'est ajouter un destinataire ou une finalité : le registre doit suivre.
  2. La minimisation. Toutes les données d'une source ne sont pas nécessaires à un usage. Dans ses questions-réponses sur l'IA générative (juillet 2024), la CNIL recommande de partir de besoins concrets, de choisir le mode de déploiement en fonction des risques (sur site, en nuage, par API) et de ne transmettre au système que les données que l'on est autorisé à partager. La cartographie permet de délimiter ce sous-ensemble.
  3. Les droits d'accès. Pour chaque source, noter qui voit quoi aujourd'hui, et vérifier que l'outil d'IA respectera ces cloisonnements. Un assistant qui interroge toute la messagerie de l'organisation au nom d'un seul utilisateur contourne les permissions sans que personne ne l'ait décidé.
  4. Le secret et la confidentialité. Les sources couvertes par un secret professionnel ou une obligation contractuelle de confidentialité appellent une analyse du trajet des données : où elles sont envoyées, qui les traite, si elles servent à entraîner un modèle. Notre guide IA et secret professionnel détaille cette analyse.
  5. Les obligations de conservation. Certaines pièces doivent être conservées sous une forme probante pendant une durée fixée par les textes : en matière de lutte contre le blanchiment, par exemple, l'article L. 561-12 du Code monétaire et financier impose cinq ans. La cartographie doit distinguer l'archive réglementaire, qui ne se modifie pas, de la mémoire de travail qu'une IA exploite.

Quand approfondir. Si l'usage envisagé porte sur des données sensibles, à grande échelle ou de façon innovante, une analyse d'impact relative à la protection des données peut être requise ; la CNIL la mentionne expressément pour les déploiements d'IA générative lorsque les circonstances le justifient. La cartographie en fournit la matière première. Les règles d'usage qui en découlent trouvent leur place dans une charte IA.

Méthode : cartographier ses sources en six étapes, du questionnaire à la feuille de route

  1. Nommer un responsable et un usage de départ. Une personne tient la cartographie ; un premier usage concret (préparer un rendez-vous, retrouver un historique, suivre les relances) sert de fil conducteur. Sans usage, on inventorie tout et on ne décide rien.
  2. Poser les sept questions à plusieurs profils. Dirigeant, collaborateurs, assistants. Consigner les écarts entre les réponses.
  3. Remplir une fiche par source. Les six couches : contenu, emplacement, flux, droits, qualité, contraintes. Une demi-page par source suffit.
  4. Tenir le journal des ressaisies. Une à deux semaines d'observation réelle, pour objectiver les réponses aux questions 4 à 6.
  5. Classer et choisir le périmètre initial. Connectable, à valider, non reliée ; croisé avec valeur et sensibilité. Retenir deux ou trois sources, et noter explicitement ce qui reste hors champ.
  6. Écrire la feuille de route et prévoir la mise à jour. Phases successives, critère de passage d'une phase à l'autre, point de décision (élargir, automatiser, s'arrêter). Comme le recommande l'ANSSI pour la cartographie du SI, la carte se révise à chaque changement d'outil, de fournisseur ou d'organisation.

Choisir sa porte d'entrée. La cartographie fait souvent apparaître l'une de trois situations. Les outils en place conviennent et il suffit de les relier ; l'outil central (souvent le CRM) est le problème et mérite d'être remplacé ; ou l'organisation fonctionne encore largement sur papier et tableurs, et gagne à se numériser brique par brique. Ce sont les trois portes d'entrée de Brain : garder ses outils, remplacer le CRM, digitaliser le cabinet, sans bascule imposée.

Le cas du cabinet patrimonial. Pour un cabinet de conseil en gestion de patrimoine, la cartographie révèle presque toujours la même géographie : un logiciel métier qui porte la conformité, une messagerie qui porte la relation, un espace documentaire qui porte les pièces, et des connaissances qui n'existent que dans la tête des conseillers. Les documents réglementaires (recueil, profil de risque, rapport d'adéquation) gagnent à rester produits et archivés dans l'outil métier, comme la Suite Majors® ; s'il faut migrer depuis un autre logiciel, voir notre guide de migration depuis Harvest ou Wealthcome. Un deuxième cerveau comme Brain vient ensuite relier ces sources pour que l'information circule entre elles : sa connexion se fait une fois, avec les accès du cabinet, dans son environnement, les accès restent révocables à tout moment, et les droits se configurent par collaborateur et par périmètre. Pour aller plus loin sur la centralisation des données clients, voir centraliser les données clients d'un cabinet CGP, et sur la valeur de ce qui est ainsi capitalisé, la mémoire d'entreprise comme actif.

Questions fréquentes sur la cartographie des données avant l'IA

C'est l'inventaire, réalisé avant de choisir un outil, de tous les endroits où l'organisation produit et conserve de l'information utile : logiciels, messageries, espaces documentaires, tableurs, conversations, notes. Pour chaque source, on décrit ce qu'elle contient, où elle est hébergée, comment l'information circule et est ressaisie, qui y a accès, sa qualité et ses contraintes légales. La cartographie permet ensuite de classer chaque source (connectable, à valider techniquement, non reliée) et de choisir un périmètre de départ.

Non. Une donnée n'est pas « prête pour l'IA » dans l'absolu, mais pour un usage donné. La cartographie sert justement à repérer les deux ou trois sources utiles au premier usage, puis à corriger en priorité leurs défauts (doublons, documents mal rattachés, informations périmées). Vouloir tout assainir avant de commencer retarde le projet sans garantir qu'on a nettoyé les bonnes données.

Le registre des activités de traitement (article 30 du RGPD) recense les traitements de données personnelles par finalité : catégories de données et de personnes, destinataires, durées de conservation, mesures de sécurité. La cartographie des sources part des outils et des flux réels, y compris les ressaisies et les usages non documentés. Les deux se complètent : le registre dit ce qui est autorisé, la cartographie montre ce qui se passe réellement, et un projet d'IA doit être cohérent avec les deux.

Peu. Deux ou trois sources bien choisies, par exemple la messagerie, l'agenda et l'espace documentaire, suffisent souvent à produire un bénéfice visible et à tester la fiabilité des réponses sur des dossiers réels. Élargir ensuite, source par source, permet de mesurer ce que chaque ajout apporte et de corriger les problèmes de qualité ou de droits au fur et à mesure.

Les noter comme telles, sans les forcer. Un outil fermé, un CRM sans accès prévu pour un tiers ou des notes papier peuvent rester hors du périmètre, être exportés ponctuellement, ou être remplacés plus tard si leur valeur le justifie. L'essentiel est de savoir ce que l'IA ne voit pas, pour ne pas prendre une réponse incomplète pour une réponse exhaustive.

Avant votre prochain contrôle, lisez notre guide conformité

Les 7 manquements qui reviennent le plus souvent dans les dossiers clients, avec les références réglementaires vérifiées. 10 minutes de lecture, sans inscription.

Lire le guide conformité →

Lecture libre. Aucune inscription requise.

Conclusion

La question qui décide du succès d'un projet d'IA n'est pas « quel outil choisir ? », mais « que pourra-t-il lire, et pour quoi faire ? ». Une cartographie des sources y répond en quelques jours : six couches décrites pour chaque source, sept questions posées à plusieurs profils, un journal des ressaisies, un classement honnête entre ce qui est connectable, ce qui est à valider et ce qui restera hors champ.

Ce travail a une vertu supplémentaire : il est utile même si le projet s'arrête là. Il montre où l'information se perd, où elle dépend d'une personne, et où les droits d'accès sont trop larges. C'est la base d'un deuxième cerveau d'entreprise construit progressivement, deux ou trois sources à la fois, plutôt que d'un outil de plus posé sur des silos.

Pour aller plus loin : CRM, GED, IA : pourquoi votre cabinet a besoin d'une mémoire intelligente

Votre cartographie, en trente minutes

Vous avez les sept questions ; l'audit Brain vous aide à y répondre avec méthode. Il passe en revue vos outils, vos données et vos ressaisies, classe chaque source (connectable, à valider, non reliée), identifie votre porte d'entrée et vous remet une feuille de route par phases, sans obligation d'aller au bout.

30 minutes  •  Gratuit, sans engagement  •  Aucun accès technique nécessaire

Articles connexes


Top