Fiabilité de l'IA en entreprise : hallucinations, citation des sources et vérification des réponses

Carnet de notes ouvert, stylo et lunettes : relire et vérifier les réponses d'une IA d'entreprise

La fiabilité d'une IA d'entreprise se mesure à une question simple : peut-on utiliser sa réponse dans un dossier sans la refaire soi-même ? Une hallucination, c'est une réponse fausse ou inventée, formulée avec la même assurance qu'une réponse juste. Le risque ne vient pas seulement de l'erreur. Il vient du fait qu'elle ne se voit pas.

On entend souvent que la solution tient en un mot : les sources. Brancher l'IA sur les documents de l'organisation et lui faire citer ses références suffirait à la rendre fiable. C'est nécessaire, mais pas suffisant. Une citation rend la vérification possible ; elle ne garantit pas l'exactitude. Ce guide explique pourquoi une IA se trompe, ce que montrent les études et la jurisprudence, comment tester un outil sur ses propres dossiers et quels critères d'acceptation fixer avant d'utiliser une réponse. Il fait partie de notre série sur le deuxième cerveau, l'IA agentique et l'IA en environnement réglementé.

À retenir : une réponse d'IA n'est utilisable que si elle est exacte, rattachée à une source identifiable et à jour, relative au bon dossier, et validée par une personne compétente. C'est le principe que pose la méthode Majors Brain : « une réponse sans source ne compte pas », et la vérification porte sur la réponse et sur sa source.

Hallucination de l'IA : définition et six formes d'erreur en entreprise

Définition courte. Le NIST, l'institut américain de normalisation, désigne ce risque par le terme de confabulation : la production, avec assurance, d'un contenu erroné ou faux, appelé couramment « hallucination » (NIST AI 600-1, profil IA générative, juillet 2024). Le mot compte : un modèle de langage ne ment pas et ne « voit » rien. Il produit la suite de texte la plus probable compte tenu de ce qu'on lui a donné. Quand l'information manque ou est ambiguë, il comble le vide avec quelque chose de plausible.

En entreprise, l'invention pure (un texte de loi qui n'existe pas) est la forme la plus connue, mais pas la plus fréquente. Les erreurs qui coûtent cher sont souvent plus discrètes. Le tableau ci-dessous les classe ; les exemples sont des illustrations construites pour un cabinet de conseil patrimonial.

Forme d'erreur Illustration Ce qui permet de la détecter
Invention Un article du Code monétaire et financier cité avec un numéro qui n'existe pas Ouvrir la source citée ; exiger un lien vers le texte officiel
Source réelle mal lue Le compte rendu mentionne un projet immobilier « à horizon trois ans » ; la synthèse en fait un projet « cette année » Comparer l'affirmation au passage précis de la source
Source périmée Un plafond fiscal repris d'une note interne rédigée avant la dernière loi de finances Afficher la date de la source ; relier les textes officiels à jour
Mauvais dossier Deux clients homonymes ; l'allocation de l'un est attribuée à l'autre Rattacher chaque source à un dossier identifié ; vérifier le client concerné
Omission La synthèse oublie la donation de 2021 qui change le calcul des abattements Poser des questions dont on connaît la réponse complète ; relecture métier
Réponse hors périmètre Aucune information sur la clause bénéficiaire dans les sources ; l'outil en propose une « standard » Tester des questions sans réponse ; exiger « je ne trouve pas » plutôt qu'une supposition

Analyse. Seule la première forme relève de l'« hallucination » au sens populaire. Les cinq autres peuvent se produire avec un outil parfaitement branché sur les bons documents. C'est pourquoi la question de la fiabilité ne se règle ni par le choix du « meilleur modèle » ni par une promesse commerciale : elle se règle par la qualité des sources, la façon dont l'outil les cite et la discipline de vérification de ceux qui l'utilisent.

Ce que montrent les études et la jurisprudence sur les erreurs de l'IA

Trois faits documentés suffisent à cadrer le sujet. Ils concernent d'autres secteurs que le conseil patrimonial, mais leurs enseignements s'appliquent à toute profession qui engage sa responsabilité sur l'exactitude d'une information.

  • Même adossés à des bases documentaires, les outils se trompent. Des chercheurs de Stanford RegLab et HAI ont testé des outils de recherche juridique professionnels qui s'appuient sur des bases de jurisprudence. Selon l'outil, entre 17 % et 33 % des réponses contenaient une hallucination, alors que les éditeurs mettaient en avant l'absence d'hallucinations (Stanford RegLab, 2024, publié au Journal of Empirical Legal Studies en 2025).
  • L'erreur de l'outil devient celle du professionnel. En juin 2023, dans l'affaire Mata v. Avianca, un tribunal fédéral de New York a sanctionné des avocats qui avaient déposé un mémoire citant des décisions inventées par un assistant d'IA, sans les vérifier.
  • L'organisation répond de ce que dit son IA. En février 2024, dans Moffatt v. Air Canada, un tribunal de Colombie-Britannique a jugé la compagnie responsable d'une information erronée donnée par son chatbot, en écartant l'argument selon lequel l'outil serait une entité distincte (American Bar Association).

Le cadre européen des services financiers dit la même chose. Dans sa déclaration du 30 mai 2024 sur l'IA dans les services d'investissement aux clients de détail, l'ESMA rappelle que les décisions de l'entreprise restent de la responsabilité de l'organe de direction, qu'elles soient prises par des personnes ou par des outils d'IA, et attend des tests et une surveillance réguliers des systèmes utilisés (ESMA35-335435667-5924). Pour un conseiller, le devoir de conseil ne se délègue pas à un outil.

Ce qu'il ne faut pas en conclure. Ces chiffres ne donnent pas un « taux d'erreur de l'IA » transposable à votre organisation : ils dépendent des questions posées, des sources et de l'outil. Ils montrent seulement qu'aucun fournisseur ne peut promettre zéro erreur, et que la seule mesure qui vaille est celle que l'on fait sur ses propres cas.

Réponse sourcée ou réponse exacte : pourquoi le RAG ne suffit pas

Définition courte. Le RAG (retrieval-augmented generation, génération augmentée par recherche) consiste à faire chercher à l'IA des passages pertinents dans une base documentaire avant de rédiger sa réponse. L'OWASP le cite comme première parade contre la désinformation produite par les modèles, aux côtés de la supervision humaine, de la vérification croisée et de la formation des utilisateurs (OWASP LLM09:2025).

Le RAG réduit l'invention, mais il déplace le problème vers trois questions : la recherche a-t-elle trouvé le bon passage ? Ce passage est-il à jour ? La réponse dit-elle ce que dit le passage, ni plus ni moins ? Une citation peut être parfaitement réelle et ne pas étayer la phrase qu'elle accompagne. D'où l'intérêt de distinguer plusieurs niveaux de traçabilité.

Niveau Ce que l'outil affiche Ce que l'utilisateur peut vérifier Usage acceptable
0. Sans source Une réponse rédigée, rien d'autre Rien, sauf à tout refaire Idées, reformulation de textes non sensibles
1. Source générique « Selon la réglementation », « d'après vos documents » Presque rien Aucun usage en dossier
2. Source identifiée Le nom du document, de l'email ou du texte Que la source existe Recherche interne, première orientation
3. Source vérifiable Le document, sa date et le passage qui fonde chaque affirmation Que la source existe, qu'elle est à jour et qu'elle dit bien cela Brouillons clients, synthèses, préparation de dossier, après relecture

Analyse. Le niveau 3 ne supprime pas l'erreur ; il la rend détectable en quelques secondes. C'est toute la différence entre une IA qui fait gagner du temps et une IA qui oblige à tout revérifier. Il suppose aussi une condition en amont : que les sources soient rassemblées, rattachées au bon dossier et tenues à jour. C'est le rôle d'une mémoire d'organisation, que nous distinguons d'une simple GED ou d'un chatbot branché sur des documents dans notre article sur le deuxième cerveau d'entreprise. La traçabilité des réponses complète celle des accès, détaillée dans notre guide IA et secret professionnel.

Majors Brain Majors Brain

« Une réponse sans source ne compte pas »

C'est une règle de la méthode Brain, appliquée pendant la phase de connexion et de test : chaque réponse est vérifiée sur vos propres dossiers, sur sa justesse et sur sa source, et l'on ne passe pas à l'étape suivante tant qu'une réponse n'est pas juste et sourcée. La page Méthode décrit les six étapes, de l'audit à la sortie.

Réponses sourcées • Brain propose, vous validez • Hébergement en Union européenne

Méthode : tester une IA sur ses propres dossiers en 6 étapes

Une démonstration sur des données d'exemple ne dit presque rien de la fiabilité d'un outil chez vous. La seule mesure utile se fait sur vos documents, avec vos questions, par des personnes qui connaissent les réponses. Voici une méthode applicable à n'importe quel outil ; les volumes indiqués sont des ordres de grandeur recommandés, pas des normes.

  1. Choisir un périmètre réduit. Deux ou trois sources bien tenues (par exemple les comptes rendus de rendez-vous, les emails et le dossier client) valent mieux que tout le système d'information branché d'un coup. Un périmètre restreint permet de savoir d'où vient une erreur.
  2. Écrire un jeu de questions réelles. Une vingtaine à une trentaine de questions que l'équipe pose vraiment, sur des dossiers qu'elle connaît : « Quand avons-nous parlé de transmission avec ce client ? », « Quelle est son allocation actuelle ? », « Quels clients ont un projet immobilier ? ». Notez la réponse attendue et le document qui la contient avant d'interroger l'outil.
  3. Ajouter des questions pièges. Des questions dont la réponse n'est pas dans les sources, des homonymes, une information qui a changé entre deux documents, une question réglementaire dont le seuil a évolué. C'est là que se voient les suppositions et les mélanges de dossiers.
  4. Vérifier la réponse et la source, séparément. Une réponse juste appuyée sur une mauvaise source est un succès fragile ; une bonne source mal résumée est une erreur. Les deux se contrôlent.
  5. Classer chaque réponse. Trois statuts suffisent : validé (juste et sourcé), à reprendre (juste mais source incomplète, ou source juste mais réponse imprécise), rejeté (faux, inventé ou mauvais dossier). Notez la cause de chaque écart : source manquante, source périmée, recherche ratée, rédaction infidèle.
  6. Corriger à la source, puis décider. Beaucoup d'écarts viennent des données (doublons, documents mal rattachés, notes contradictoires) plus que du modèle. On corrige, on rejoue les mêmes questions, et l'on n'élargit le périmètre qu'une fois le résultat satisfaisant.

Ce que Brain documente sur ce point. La méthode Brain suit la même logique : un premier périmètre de deux ou trois sources choisies par l'organisation, une étape de connexion et de test où « tant qu'une réponse n'est pas juste et sourcée, on ne passe pas à la suite », des réponses relues et marquées « Validé » ou « À reprendre » lorsque la source est incomplète, puis un point de décision avant de relier une nouvelle source. Sur vos dossiers, précise la méthode, vous êtes le seul juge. Nous avons présenté l'ensemble de la démarche dans Majors Brain : le deuxième cerveau d'entreprise, pas à pas.

Critères d'acceptation : quand une réponse d'IA peut entrer dans un dossier

Définition courte. Un critère d'acceptation est la condition, fixée à l'avance, qu'une réponse doit remplir pour être utilisée sans être refaite. Il transforme une impression (« l'outil a l'air fiable ») en règle opposable, que l'on peut écrire dans une procédure interne et montrer lors d'un contrôle.

Quatre critères s'appliquent à toute réponse :

  • Exacte : elle dit ce que dit la source, sans ajout ni omission qui change le sens.
  • Sourcée : chaque affirmation factuelle renvoie à un document, un échange ou un texte identifiable.
  • À jour et au bon dossier : la source est datée, en vigueur, et concerne bien la personne ou l'affaire en cause.
  • Validée : une personne compétente l'a relue avant tout usage externe.

Le niveau de contrôle, lui, varie selon l'usage. La grille ci-dessous est une proposition de départ à adapter à votre organisation.

Usage de la réponse Enjeu Contrôle minimal recommandé
Retrouver un document ou un échange Faible : l'utilisateur lit ensuite la source Ouvrir la source proposée
Préparer un rendez-vous (synthèse interne) Moyen : oriente la discussion Contrôler dates, montants et événements récents dans les sources
Brouillon d'email ou de compte rendu au client Élevé : engage l'organisation Relecture complète avant envoi ; rien ne part sans validation
Réponse réglementaire ou fiscale Élevé : risque de conseil erroné Vérifier dans le texte officiel en vigueur (Légifrance, Bofip), date comprise
Chiffre ou élément d'un document réglementaire (recueil, rapport d'adéquation) Très élevé : preuve en cas de contrôle ou de réclamation Contrôle systématique dans le document d'origine ; donnée issue de la base structurée plutôt que d'un résumé

Un critère souvent oublié : le droit de ne pas savoir. Lors des tests, vérifiez comment l'outil se comporte quand l'information n'existe pas dans les sources. Un outil qui répond « je ne trouve pas cette information » est plus fiable qu'un outil qui répond toujours. C'est un critère de sélection à exiger de tout fournisseur, et à contrôler avec les questions pièges de l'étape précédente. Ce lien entre fiabilité et autonomie est développé dans notre guide de l'IA agentique en entreprise : plus un agent IA agit seul, plus ces critères doivent être stricts.

Au quotidien : la relecture comme discipline, pas comme formalité

Le principal risque, une fois l'outil adopté, n'est plus l'erreur de l'IA : c'est la confiance excessive. L'OWASP la classe parmi les causes directes de la désinformation par les modèles : des utilisateurs qui intègrent une réponse à une décision sans la vérifier (OWASP LLM09:2025). Plus un outil a raison souvent, plus on cesse de le relire. Quelques règles simples limitent ce glissement :

  • Vérifier la source, pas le style. Une réponse bien rédigée n'est pas plus juste qu'une réponse maladroite. Le réflexe utile est d'ouvrir la référence, pas de relire la phrase.
  • Toujours contrôler quatre types d'éléments dans le document d'origine : les chiffres, les dates, les noms (de personnes, de contrats, de supports) et les références réglementaires.
  • Garder la décision humaine sur tout ce qui sort. Un email, une relance ou une recommandation part après validation, jamais automatiquement.
  • Remonter chaque erreur. Une erreur signalée permet de corriger la source (document mal classé, note contradictoire) et profite à toute l'équipe. Une erreur corrigée en silence se reproduira.
  • Rejouer le jeu de test régulièrement. Après l'ajout d'une source, un changement de modèle ou une évolution réglementaire, les mêmes questions permettent de vérifier que rien ne s'est dégradé. C'est aussi ce qu'attend l'ESMA : tester et surveiller les systèmes dans la durée.

Comment Brain l'intègre. Sur la page Utiliser Brain, le principe est formulé ainsi : Brain lit, relie et cite toujours d'où vient l'information. Chaque proposition affiche ses sources (par exemple des emails, un compte rendu de rendez-vous et un recueil patrimonial), les brouillons de relance ou de compte rendu sont « prêts à relire », et rien ne part sans l'accord de l'utilisateur. Pour les questions réglementaires, Brain est relié à Légifrance et au Bofip, ce qui permet de rattacher la réponse au texte officiel plutôt qu'à une connaissance générale du modèle.

Le cas du cabinet patrimonial : fiabilité et devoir de conseil

Prenons un cabinet fictif de quatre conseillers qui souhaite utiliser une IA pour préparer ses rendez-vous. Avant tout usage, l'associé et une assistante écrivent vingt-cinq questions sur une dizaine de dossiers qu'ils connaissent bien, dont cinq pièges : deux clients qui portent le même nom, un client dont le profil de risque a été révisé, une question sur un contrat absent des sources. Ils constatent que les écarts viennent surtout de comptes rendus non rattachés au bon dossier. Ils corrigent le classement, rejouent le test, puis n'utilisent l'outil que pour la préparation interne pendant les premières semaines.

Analyse. Pour un conseiller, l'enjeu dépasse le gain de temps. Une recommandation doit être fondée sur une connaissance exacte et à jour de la situation du client : c'est le cœur du devoir de conseil, et c'est ce que l'on devra démontrer en cas de réclamation ou de contrôle. Une IA peut accélérer la recherche et la préparation ; elle ne doit jamais devenir la source d'un chiffre qui figure dans un document réglementaire sans que ce chiffre ait été vérifié dans la base.

Répartir les rôles. Les données structurées du dossier (recueil, profil de risque, rapport d'adéquation) restent dans l'outil métier qui les produit ; dans la Suite Majors®, ces documents sont générés et éditables par le conseiller. La mémoire du cabinet, elle, relie ces données aux échanges et aux comptes rendus pour retrouver et préparer, en citant chaque source. Pour situer ces briques dans le système d'information, voir CRM, GED, IA : pourquoi votre cabinet a besoin d'une mémoire intelligente. Côté obligations propres à l'IA, notre article sur l'AI Act et les CGP fait le point sur le statut de déployeur.

Questions fréquentes sur la fiabilité des réponses de l'IA

Une hallucination, que le NIST appelle confabulation, est la production par une IA générative d'un contenu erroné ou inventé, présenté avec assurance. Elle vient du fonctionnement même des modèles de langage, qui produisent la suite de texte la plus probable et non une vérité vérifiée. En entreprise, elle prend souvent des formes discrètes : un chiffre inexact, une date décalée, une source réelle mal lue ou une information attribuée au mauvais client.

Oui. L'étude de Stanford RegLab publiée en 2024 a montré que des outils de recherche juridique adossés à des bases documentaires se trompaient encore dans 17 % à 33 % des cas selon l'outil. Une citation peut être réelle mais ne pas étayer l'affirmation, être périmée ou concerner un autre dossier. La citation ne garantit pas l'exactitude : elle rend la vérification possible.

En vérifiant la réponse et sa source, pas seulement la formulation. Avant le déploiement, il faut tester l'outil sur un jeu de questions réelles dont on connaît la réponse, y compris des questions pièges sans réponse dans les sources, et classer chaque réponse en validée, à reprendre ou rejetée. Au quotidien, les chiffres, dates, noms et références réglementaires se contrôlent toujours dans le document d'origine.

L'organisation qui l'utilise. Dans l'affaire Moffatt contre Air Canada (2024), un tribunal canadien a jugé la compagnie responsable des informations erronées données par son chatbot. Pour les services d'investissement, l'ESMA a rappelé en mai 2024 que les décisions restent de la responsabilité de l'organe de direction, qu'elles soient prises par des personnes ou par des outils d'IA.

Une réponse n'est utilisable que si elle est exacte, rattachée à une source identifiable et à jour, relative au bon dossier et validée par une personne compétente. Le niveau de contrôle dépend de l'usage : une recherche interne tolère une vérification rapide, alors qu'un chiffre destiné à un rapport d'adéquation ou une réponse réglementaire exige un contrôle systématique dans le document d'origine.

Recevez nos guides CGP chaque mois

Conformité, IA patrimoniale, bonnes pratiques : restez informé des dernières ressources pour votre cabinet.

Pas de spam. Désinscription en un clic.

Conclusion

La fiabilité de l'IA en entreprise ne s'achète pas avec un modèle ; elle se construit. Les hallucinations ne disparaîtront pas, même avec des outils adossés à des documents, comme le montrent les études disponibles. Ce qui change tout, c'est la capacité à détecter l'erreur : des sources rassemblées et tenues à jour, des réponses qui citent le passage exact, des tests sur ses propres dossiers, des critères d'acceptation écrits et une relecture qui porte sur la source plutôt que sur le style.

Pour une organisation soumise à un devoir de conseil ou à un contrôle, le bon ordre est donc toujours le même : commencer sur un périmètre réduit, vérifier, corriger les données, puis élargir. Une réponse sans source ne compte pas ; une réponse sourcée ne compte qu'une fois vérifiée.

Pour aller plus loin : IA agentique en entreprise : assistant, copilote ou agent IA ?

Des réponses vérifiables commencent par des sources en ordre

La plupart des erreurs d'une IA viennent de sources dispersées, en double ou mal rattachées. Le diagnostic Brain (7 questions, en visio ou par questionnaire) cartographie vos outils et vos données, indique ce qui est connectable, à valider ou non relié, et vous remet une feuille de route par phases, en commençant par un premier périmètre que vous choisissez.

30 minutes en visio ou questionnaire en ligne  •  Gratuit, sans engagement  •  Ne renseignez aucune donnée personnelle de vos clients

Articles connexes


Top