Mesurer le ROI d'un projet d'IA en entreprise : indicateurs, mesure de référence et méthode, sans chiffres inventés

Courbe tracée à la main sur une feuille, avec une règle et des stylos posés sur un bureau

Le ROI d'un projet d'IA (retour sur investissement) rapporte les gains nets obtenus grâce à l'outil à ce qu'il a coûté au total. La formule est connue ; ce qui manque presque toujours, ce sont les deux termes. Les gains sont rarement mesurés par rapport à une situation de départ, et les coûts oublient le temps passé à relire, corriger et superviser l'IA. Résultat : des chiffres de « gain de productivité » qui circulent sans qu'on sache d'où ils viennent.

Ce guide propose une autre approche, adaptée aux petites structures et aux professions réglementées : mesurer avant de déployer, suivre cinq familles d'indicateurs plutôt qu'un seul chiffre, calculer un gain net et fixer un point de décision où l'on choisit d'étendre, d'ajuster ou d'arrêter. Il distingue ce que disent les études (faits), ce que nous en tirons (analyse) et les exemples chiffrés, qui sont des illustrations. Il fait partie de notre série sur le deuxième cerveau, l'IA agentique et l'IA en environnement réglementé.

À retenir : un gain qui n'a pas été mesuré avant le déploiement ne peut pas être démontré après. Pour un projet d'IA, la bonne question n'est pas « combien rapporte l'IA ? » mais « sur quelles tâches précises, par rapport à quelle mesure de départ, et une fois la relecture déduite ? ». C'est aussi la logique de la méthode de Majors Brain : « un outil utilisé, pas un outil installé », avec un point de décision après les premières semaines d'usage réel.

ROI, valeur, indicateur : trois notions à distinguer avant de mesurer un projet d'IA

Définition courte : le ROI est un ratio financier, (gains nets − coût complet) ÷ coût complet, sur une période donnée. La valeur d'un projet d'IA est plus large : elle inclut des effets qui ne se convertissent pas directement en euros, comme une erreur évitée, une information retrouvée ou un dossier mieux documenté. Un indicateur est une mesure observable qui renseigne sur l'un de ces effets. La mesure de référence (« baseline ») est la valeur de cet indicateur avant le déploiement : sans elle, aucun écart ne peut être établi.

Notion Question posée Exemple Limite
ROI L'investissement est-il rentabilisé, et en combien de temps ? Gains nets annuels rapportés au coût complet du projet Ne capte que ce qui se convertit en euros
Valeur Qu'est-ce qui va mieux, y compris hors finances ? Moins de dossiers incomplets, moins d'informations perdues au départ d'un collaborateur Se prête mal à un chiffre unique
Indicateur Que peut-on observer et compter ? Durée moyenne de préparation d'un rendez-vous, temps de relecture compris Devient trompeur s'il devient un objectif en soi
Mesure de référence Quelle était la situation avant ? Vingt préparations de rendez-vous chronométrées avant le déploiement Impossible à reconstituer après coup avec fiabilité

Analyse. Dans une grande entreprise, le ROI d'un projet d'IA se discute en comité d'investissement. Dans un cabinet de quatre personnes, la question est plus simple et plus exigeante : l'outil fait-il gagner du temps à quelqu'un, sur une tâche identifiée, sans dégrader la qualité ni augmenter le risque ? Le ROI au sens strict n'est alors qu'une des réponses. Pour une profession réglementée, la valeur passe aussi par la traçabilité et la maîtrise de l'information, qui ne se mesurent pas en euros mais se constatent lors d'un contrôle ou d'une réclamation.

Ce que disent les études : des gains réels, inégaux et souvent mal mesurés

Les faits. Les données publiques convergent sur un constat : l'IA produit des gains mesurables sur certaines tâches, mais la plupart des organisations peinent à les démontrer à leur échelle.

  • La valeur est la première cause d'abandon. En juillet 2024, Gartner prévoyait qu'au moins 30 % des projets d'IA générative seraient abandonnés après la preuve de concept d'ici fin 2025, en raison de données de mauvaise qualité, de contrôles des risques insuffisants, de coûts croissants ou d'une valeur métier peu claire (communiqué Gartner du 29 juillet 2024). Le cabinet d'études y soulignait la difficulté à traduire des gains de productivité en bénéfice financier.
  • L'effet sur le résultat reste modeste. Dans l'enquête State of AI 2025 de McKinsey, 39 % des répondants attribuent à l'IA un effet sur le résultat opérationnel (EBIT) de leur organisation, et la plupart d'entre eux l'estiment à moins de 5 %. Les bénéfices de coûts sont surtout rapportés au niveau des cas d'usage, pas de l'entreprise entière.
  • Les gains se concentrent sur certaines tâches et certains profils. L'étude de Brynjolfsson, Li et Raymond sur 5 172 agents de support client, publiée en 2025 dans le Quarterly Journal of Economics, mesure une hausse de 15 % du nombre de demandes résolues par heure ; la version de travail précisait un gain de 34 % pour les agents débutants ou les moins qualifiés et un effet minime pour les plus expérimentés (NBER, document de travail w31161).
  • Hors de sa « frontière », l'IA peut dégrader le travail. L'expérience menée avec 758 consultants du Boston Consulting Group (Dell'Acqua et al., 2023) a mesuré, sur des tâches adaptées à l'IA, des gains de plus de 25 % en vitesse et de plus de 40 % en qualité jugée ; sur une tâche située hors de ce périmètre, les consultants aidés de l'IA ont moins souvent trouvé la bonne réponse. Les auteurs parlent d'une frontière technologique irrégulière (synthèse de la Harvard Business School).
  • Le ressenti n'est pas une mesure. Dans un essai contrôlé publié par METR en juillet 2025, seize développeurs expérimentés travaillant sur 246 tâches réelles ont mis 19 % de temps en plus avec l'IA. Ils avaient prévu un gain de 24 % et estimaient encore, après coup, avoir été accélérés d'environ 20 %. Les auteurs insistent sur les limites de l'échantillon et précisent que ce résultat ne vaut pas pour toutes les situations.

Analyse. Ces études ne disent pas que l'IA est inutile. Elles disent trois choses utiles à une petite structure. D'abord, les gains dépendent de la tâche : il faut mesurer tâche par tâche, pas « l'IA » en général. Ensuite, ils dépendent du profil : le collaborateur qui débute et l'associé qui connaît ses dossiers par cœur ne gagneront pas la même chose. Enfin, le ressenti des utilisateurs, même sincère, peut s'écarter de la réalité, dans un sens comme dans l'autre. En France, l'usage reste en phase d'installation : selon l'Insee (Insee Première n° 2120), 18 % des entreprises d'au moins dix salariés déclaraient utiliser au moins une technologie d'IA en 2025. C'est précisément le moment de prévoir la mesure, avant que les habitudes ne rendent la situation de départ impossible à retrouver.

Les cinq familles d'indicateurs d'un projet d'IA : usage, temps, qualité, risque, connaissance

Un projet d'IA ne se pilote pas avec un indicateur unique. Un outil très utilisé peut ne rien faire gagner ; un outil qui fait gagner du temps peut introduire des erreurs. Les cinq familles ci-dessous se contrôlent mutuellement. Pour une petite structure, deux ou trois indicateurs par famille suffisent largement.

Famille Indicateurs utiles Comment mesurer simplement Piège
1. Usage Nombre d'utilisateurs actifs par semaine, tâches pour lesquelles l'outil est utilisé, abandons Statistiques de l'outil, point hebdomadaire de dix minutes Confondre usage et valeur
2. Temps Durée d'une tâche avant / après, temps de relecture et de correction compris Chronométrage d'un échantillon de tâches, avant puis après Oublier la relecture, compter le temps « ressenti »
3. Qualité Part des réponses justes et sourcées, nombre de corrections par document, retours des clients Relecture notée sur une grille, jeu de test rejoué Ne noter que les cas faciles
4. Risque Erreurs détectées avant envoi / après envoi, incidents, données sensibles sorties en clair Registre des erreurs et incidents, revue mensuelle Ne compter que les erreurs qui ont fait du bruit
5. Connaissance Ressaisies supprimées, informations retrouvées sans demander à un collègue, questions restées sans réponse Journal des ressaisies, liste des questions sans réponse L'oublier : c'est la valeur qui s'accumule

Les familles 3 et 4 sont celles que les tableaux de bord oublient le plus souvent. Elles sont pourtant décisives en environnement réglementé : un gain de temps obtenu au prix d'une erreur dans un document remis à un client n'est pas un gain. Les méthodes pour les mesurer sont détaillées dans nos articles sur la fiabilité des réponses d'une IA d'entreprise et sur la validation humaine, qui décrit notamment les indicateurs de vigilance d'un relecteur.

La famille 5 mérite une attention particulière. Une ressaisie supprimée est un gain qui se répète chaque jour ; une information retrouvée en dix secondes plutôt qu'en interrompant un collègue est une valeur que personne ne chronomètre. Pour un deuxième cerveau, c'est souvent là que se trouve l'essentiel, et c'est aussi ce qui fait de la mémoire d'entreprise un actif.

Majors Brain Majors Brain

Une méthode qui prévoit le point de décision dès le départ

Les indicateurs n'ont de sens que si une décision est prévue au bout. La méthode publiée par Brain en tient compte : tests sur vos dossiers réels avant d'aller plus loin (« tant qu'une réponse n'est pas juste et sourcée, on ne passe pas à la suite »), suivi rapproché des premières semaines d'usage, puis un point de décision où le cabinet choisit entre relier une autre source, automatiser, remplacer un outil… ou arrêter. C'est la lecture utile avant de fixer vos propres critères.

Tests sur dossiers réels • Point de décision après usage • L'arrêt fait partie des issues prévues

La mesure de référence : mesurer avant de déployer l'IA

Définition courte : la mesure de référence est la photographie, prise avant le déploiement, des indicateurs que l'on veut voir évoluer. Elle porte sur un nombre limité de tâches, mesurées sur un échantillon réel, pendant une période courte. C'est l'étape la plus souvent sautée, parce qu'elle paraît retarder le projet ; c'est aussi la seule qui rende les résultats démontrables.

Pour une petite structure, une mesure de référence raisonnable tient en deux semaines et cinq gestes :

  1. Choisir trois à cinq tâches cibles. Des tâches fréquentes, identifiables et répétitives : préparer un rendez-vous, rédiger un compte rendu, répondre à une question réglementaire, retrouver une pièce, relancer un client. Pas « l'administratif » en général.
  2. Chronométrer un échantillon. Dix à vingt occurrences par tâche, notées par la personne qui la réalise (début, fin, interruptions). L'objectif n'est pas la précision à la minute, mais un ordre de grandeur honnête.
  3. Tenir un journal des ressaisies. Chaque fois qu'une information est recopiée d'un outil vers un autre, une ligne : quoi, d'où, vers où, combien de temps. C'est l'outil le plus révélateur de la cartographie des sources.
  4. Noter les ratés. Ce qui « passe entre les mailles du filet » : relance oubliée, pièce introuvable, information donnée par un collègue absent. Un simple registre suffit.
  5. Relever la qualité actuelle. Sur quelques documents produits sans IA, le nombre de corrections nécessaires à la relecture. Sans ce point de comparaison, on attribuera à l'IA des erreurs qui existaient déjà, ou l'inverse.

Analyse. Ces questions recoupent celles qu'un diagnostic sérieux pose avant tout projet : qu'est-ce qui est ressaisi, qu'est-ce qui prend du temps, qu'est-ce qui passe parfois entre les mailles du filet. Ce sont, à la lettre, trois des sept questions de l'audit proposé sur brain.majors.fr. La différence entre un diagnostic et une mesure de référence est simple : le premier identifie les tâches, la seconde les chiffre avant que l'outil ne change les habitudes.

Une précaution : la mesure ne doit pas devenir une surveillance individuelle. On mesure des tâches, pas des personnes ; les résultats se présentent de façon agrégée, et l'équipe sait ce qui est mesuré et pourquoi. Notre article sur la charte d'usage de l'IA rappelle le cadre applicable à l'information des salariés.

Calculer le gain net et le coût complet d'un projet d'IA

Le calcul du ROI échoue rarement sur la formule. Il échoue sur ce qu'on met dedans. Deux corrections changent tout : compter le gain net plutôt que le gain brut, et le coût complet plutôt que le prix de l'abonnement.

Gain net de temps par tâche = temps avant − (temps avec l'IA + temps de relecture + temps de correction). Le temps de relecture n'est pas une option : c'est la condition d'un usage responsable de l'IA, surtout pour un document remis à un client. L'ignorer revient à surestimer systématiquement le gain.

Poste de coût Souvent oublié parce que…
Abonnements et consommation (licences, usage du modèle)Rarement oublié, mais parfois variable selon l'usage
Mise en place : connexion des sources, paramétragePayé une fois, puis sorti du calcul
Remise en ordre des données (doublons, documents mal rattachés)Considéré comme un « à-côté » alors qu'il conditionne la qualité (voir qualité des données)
Formation et prise en mainCompté en jours de formation, pas en semaines de productivité réduite
Relecture et supervision continuesDilué dans le travail quotidien
Gouvernance : charte, tests, revue des incidentsInvisible tant qu'il n'y a pas d'incident

Illustration chiffrée (hypothèses fictives). Prenons un cabinet fictif qui mesure, avant déploiement, 45 minutes en moyenne pour préparer un rendez-vous client, sur vingt rendez-vous chronométrés. Avec l'IA, la synthèse est produite en quelques minutes, mais la relecture et les compléments prennent encore 25 minutes : le gain net est de 20 minutes, pas de 40. À raison de 40 rendez-vous par mois, cela représente environ 13 heures par mois. Ces chiffres ne sont pas des résultats observés : ils montrent seulement comment l'écart entre gain brut et gain net se construit.

Le temps libéré n'est pas encore une valeur. Treize heures gagnées ne valent quelque chose que si elles sont réaffectées : davantage de rendez-vous, un délai de réponse aux clients raccourci, moins de travail le soir, du temps consacré à la conformité. Il faut donc nommer, dès le départ, ce que deviendra le temps libéré, et le vérifier au point de décision. Sinon, le gain se dissout dans le quotidien et le ROI reste théorique. Notre article sur la réduction du temps administratif en cabinet donne des pistes de réaffectation propres au conseil patrimonial.

Les pièges de mesure qui faussent le ROI de l'IA

Même avec de bons indicateurs, certains biais reviennent dans presque tous les projets. Les connaître permet de les neutraliser à peu de frais.

Piège Ce qui se passe Parade
Le ressenti pris pour une mesure Les utilisateurs estiment un gain que la mesure ne confirme pas (ou l'inverse), comme dans l'essai METR Confronter le ressenti à un échantillon chronométré
Le gain brut Le temps de relecture et de correction n'est pas compté Chronométrer la tâche jusqu'au document validé
Les tâches faciles On mesure là où l'IA brille et on extrapole à tout Inclure des cas difficiles dans l'échantillon (frontière irrégulière)
L'effet nouveauté Usage et enthousiasme élevés les premières semaines, puis baisse Mesurer à nouveau après deux ou trois mois
L'indicateur devenu objectif Quand une mesure devient une cible, on optimise la mesure plutôt que le résultat (loi de Goodhart) Suivre plusieurs familles qui se contrôlent : temps et qualité, usage et risque
L'usage confondu avec la valeur « Tout le monde l'utilise » sans qu'aucune tâche ne soit plus rapide ou plus fiable Rattacher chaque usage à une tâche cible et à sa mesure de référence
Les usages cachés Une partie du travail passe par des outils non déclarés, invisibles dans la mesure Inventaire anonyme des usages (voir IA fantôme)

Analyse. Le piège le plus coûteux pour une profession réglementée est celui des tâches faciles. Les études citées plus haut montrent qu'en dehors de son périmètre de compétence, l'IA peut dégrader la qualité du travail de personnes compétentes. Un projet mesuré uniquement sur les synthèses simples peut donc afficher un excellent ROI et produire, sur un dossier complexe (succession, structuration de société, situation de vulnérabilité), une erreur que personne n'a prévu de détecter.

Méthode en sept étapes : piloter un projet d'IA par la mesure jusqu'au point de décision

Voici une méthode adaptée à une petite structure, qui s'articule avec un déploiement progressif : un périmètre limité, des critères de passage écrits, une décision au bout.

  1. Formuler l'hypothèse de valeur. Une phrase par tâche cible : « l'IA réduit le temps de préparation des rendez-vous sans dégrader la qualité des synthèses ». Une hypothèse qu'on ne peut pas réfuter n'est pas mesurable.
  2. Prendre la mesure de référence. Deux semaines, trois à cinq tâches, les cinq gestes décrits plus haut.
  3. Fixer les critères de décision à l'avance. Par exemple : gain net positif sur au moins deux tâches, aucune erreur non détectée dans un document remis à un client, part des réponses justes et sourcées au-dessus d'un seuil défini sur le jeu de test, usage régulier par les personnes concernées. Écrits avant, pas ajustés après.
  4. Tester sur dossiers réels avant l'usage courant. Le jeu de test vérifie que les réponses sont justes et sourcées avant que l'outil n'entre dans le travail quotidien.
  5. Mesurer pendant l'usage réel. Mêmes tâches, même méthode de chronométrage, même grille de qualité, sur un échantillon équivalent. Tenir le registre des erreurs et la liste des questions sans réponse.
  6. Décider. Au point de décision, quatre issues : étendre (nouvelle tâche ou nouvelle source), ajuster (données, consignes, formation), maintenir en l'état ou arrêter. L'arrêt est une issue normale, pas un échec, s'il est décidé sur des faits.
  7. Remesurer régulièrement. Après deux ou trois mois (effet nouveauté), puis à chaque changement de modèle, de source ou d'équipe. Les résultats se consignent : ils servent aussi de trace en cas de contrôle.

Le cas d'un cabinet patrimonial (illustration). Prenons un cabinet fictif de conseil en gestion de patrimoine, trois conseillers et une assistante. Il retient trois tâches : préparation des rendez-vous, rédaction des comptes rendus, recherche de pièces dans les dossiers. Sa mesure de référence révèle que la recherche de pièces, qu'il n'avait pas jugée prioritaire, est la plus coûteuse en ressaisies et en interruptions. Ses critères incluent un indicateur de conformité : aucun compte rendu transmis sans relecture, et des comptes rendus qui reprennent fidèlement les éléments du rendez-vous. Au point de décision, il étend l'usage à la recherche de pièces, ajuste les consignes de rédaction des comptes rendus et renonce provisoirement à une automatisation des relances qui ne fait pas gagner de temps net. Pour la production des documents réglementaires eux-mêmes, un outil dédié comme la Suite Majors® se mesure avec les mêmes indicateurs de temps et de qualité.

Comment Brain traite ce point. Le site de Brain n'affiche pas de gain chiffré ni de promesse de ROI. Sa méthode repose sur ce qui rend la mesure possible : un audit qui part de ce qui est ressaisi et de ce qui prend du temps, un premier périmètre de deux ou trois sources, des tests sur dossiers réels, un suivi rapproché des premières semaines et un point de décision dont l'arrêt fait partie. La logique est celle de cet article : prouver sur un périmètre réduit avant d'étendre. Notre présentation de Majors Brain et du deuxième cerveau d'entreprise replace cette démarche dans l'ensemble.

Questions fréquentes sur le ROI d'un projet d'IA

Le ROI se calcule comme pour tout investissement : (gains nets − coût complet) ÷ coût complet. La difficulté tient aux deux termes. Le gain doit être un gain net, mesuré par rapport à une mesure de référence prise avant le déploiement, et il doit déduire le temps de relecture et de correction des résultats de l'IA. Le coût doit être complet : abonnements, mise en place, remise en ordre des données, formation, temps de supervision. Enfin, un temps libéré ne devient une valeur que s'il est réaffecté à autre chose de mesurable.

Cinq familles d'indicateurs couvrent l'essentiel : l'usage (qui utilise l'outil, pour quelles tâches, à quelle fréquence), le temps (durée d'une tâche avant et après, temps de relecture compris), la qualité (taux de réponses justes et sourcées, corrections nécessaires), le risque (erreurs détectées avant ou après envoi, incidents, données sensibles exposées) et la connaissance (ressaisies supprimées, informations retrouvées, questions sans réponse). L'usage seul ne prouve rien : un outil très utilisé peut ne rien faire gagner.

Parce que la mesure est rarement prévue. En juillet 2024, Gartner prévoyait qu'au moins 30 % des projets d'IA générative seraient abandonnés après la preuve de concept d'ici fin 2025, notamment en raison d'une valeur métier peu claire. L'enquête State of AI 2025 de McKinsey indique que 39 % des répondants attribuent un effet sur le résultat opérationnel (EBIT) de leur organisation à l'IA, la plupart pour moins de 5 %. Sans mesure de référence prise avant le déploiement, aucun gain ne peut être démontré, même quand il existe.

Non, pas seul. Dans un essai contrôlé publié par METR en juillet 2025, seize développeurs expérimentés ont mis 19 % de temps en plus pour terminer leurs tâches avec l'IA, alors qu'ils avaient prévu un gain de 24 % et estimaient encore, après coup, avoir été accélérés d'environ 20 %. Les auteurs rappellent que ce résultat ne se généralise pas à toutes les situations. Il montre surtout que le ressenti doit être confronté à une mesure, au moins sur un échantillon de tâches chronométrées.

Quand, au point de décision fixé à l'avance, les critères définis au départ ne sont pas atteints et qu'aucun ajustement crédible ne permet de les atteindre : gain net de temps nul ou négatif une fois la relecture comptée, taux de réponses justes et sourcées insuffisant, risque non maîtrisé ou usage qui ne décolle pas malgré la formation. L'arrêt est une issue normale d'un projet piloté par la mesure. La méthode publiée par Majors Brain prévoit d'ailleurs explicitement l'arrêt parmi les choix possibles au point de décision.

Avant votre prochain contrôle, lisez notre guide conformité

Les 7 manquements qui reviennent le plus souvent dans les dossiers clients, avec les références réglementaires vérifiées. 10 minutes de lecture, sans inscription.

Lire le guide conformité →

Lecture libre. Aucune inscription requise.

Conclusion

Le ROI d'un projet d'IA n'est pas introuvable ; il est rarement préparé. Les études disponibles montrent des gains réels sur des tâches précises, inégaux selon les profils, et un écart fréquent entre ce que les utilisateurs ressentent et ce que la mesure constate. Pour une petite structure, la réponse n'est pas un tableau de bord sophistiqué, mais quelques gestes simples : choisir trois à cinq tâches, les mesurer avant, compter le gain net relecture comprise, suivre la qualité et le risque autant que le temps.

Et surtout, fixer à l'avance le moment et les critères de la décision. Un projet d'IA piloté par la mesure peut s'étendre, s'ajuster ou s'arrêter sur des faits. Pour une profession réglementée, c'est aussi une façon de documenter, devant un client ou un contrôleur, pourquoi et comment l'outil est utilisé.

Pour aller plus loin : déploiement progressif ou big bang : comment introduire l'IA dans une organisation

Identifier les tâches à mesurer dans votre cabinet

La mesure de référence commence par trois questions : qu'est-ce qui est ressaisi, qu'est-ce qui prend du temps, qu'est-ce qui passe entre les mailles du filet. Ce sont celles du diagnostic Brain, un échange gratuit de 30 minutes sans accès technique, qui aboutit à une carte de vos sources, aux tâches automatisables avec validation et à une feuille de route par phases. Vous saurez par où commencer, et donc quoi mesurer.

30 minutes  •  Gratuit, sans engagement  •  Sans accès technique

Articles connexes


Top