Generative AI for organisations whose product is knowledge
I help consultancies, think tanks, research organisations and public bodies put generative AI to work without giving up the rigour their credibility rests on. I work in French and English, from Belgium.
Two reports, one firm, one year
In July 2025 Deloitte delivered a report to Australia's Department of Employment and Workplace Relations. It contained references to academic papers that do not exist, and a quote attributed to a Federal Court judgment that was never written. A researcher outside the project found the errors. Deloitte acknowledged limited use of a generative AI system, republished a corrected version, and repaid the final instalment of the contract, about A$97,000. The department stated that the substance of the review and its recommendations were unchanged.
A few months later, a 526-page health workforce plan commissioned by the province of Newfoundland and Labrador was found to carry at least four citations pointing to research that does not exist. Deloitte acknowledged that the four citations are incorrect and stands by the report's conclusions. The provincial body regulating chartered professional accountants opened an investigation, which has not reported.
One incident reads as an individual failure. Two, in the same firm, on two continents, on reports commissioned by public authorities, point to a procedure that did not catch the problem. In both cases a model produced something false and produced it convincingly, and it reached publication uncorrected.
That is the exposure for an organisation whose product is analysis. The work still ships, and the conclusions may well hold. What stops holding is the ability to defend it line by line.
Accounting Times, October 2025. Refund from CFO Dive, October 2025. Departmental statement from City A.M., October 2025.
CBC News, 2025. Investigation reported by The Independent, 2025.
Nobody can tell you in advance what you will gain
Two nationally representative studies have measured what generative AI actually saves at work. In the United States, workers report time savings equivalent to 1.6% of all hours worked. In Denmark, where survey answers were matched to administrative payroll records, users report 2.8%, with no detectable effect on earnings or hours.
Controlled experiments on individual tasks often find much larger gains. One of them found the reverse: experienced developers took 19% longer with AI assistance, and estimated afterwards that they had been 20% faster.
So the honest range runs from below 2% across an economy to well above 15% on a single task, and the people doing the work are not reliable judges of which one applies to them. There is one way to find out what your firm gets. You measure it, before and after, on your own work. That is the first thing I install.
Bick, Blandin and Deming, Federal Reserve Bank of St. Louis, 13 November 2025.
Humlum and Vestergaard, NBER Working Paper 33777, 2025.
METR, 10 July 2025.
1.6% Alexander Bick, Adam Blandin and David Deming, « The State of Generative AI Adoption in 2025 », Federal Reserve Bank of St. Louis, 13 November 2025. Real-Time Population Survey, pooled February, May and August 2025. On a 40-hour week that is about 38 minutes, my arithmetic rather than theirs. The same authors read this figure as consistent with an aggregate labour productivity gain of up to 1.3% since the release of ChatGPT.
2.8% Anders Humlum and Emilie Vestergaard, « Large Language Models, Small Labor Market Effects », NBER Working Paper 33777, 2025. About 25,000 workers across some 7,000 workplaces, survey answers linked to administrative earnings and hours records. Working paper, not peer reviewed at the date of writing.
19% METR, « Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity », 10 July 2025. Randomised, 16 experienced developers, 246 real tasks. Sixteen participants in one occupation is a narrow base, and I cite it for the gap between belief and stopwatch rather than for the size of the effect.
Ninety days to install. The measurement closes at month five.
Scattered experimentation becomes a documented system: which tools for which tasks, which quality gates a deliverable passes before it leaves the building, which workflows get redesigned, and a governance frame that holds under the AI literacy obligation of the European AI Act.
Article 4 of Regulation (EU) 2024/1689 has applied since 2 February 2025 and was not postponed. Regulation (EU) 2026/1744, in force since 27 July 2026, rewrote it: providers and deployers support the development of AI literacy, without having to guarantee a level for any individual. The heavier obligations on high-risk systems, a separate matter, moved to 2 December 2027 and 2 August 2028.
Three indicators, measured before and after
Hours booked on one type of deliverable, fixed in advance, taken from your own time records.
Share of deliverables clearing internal review without major rework.
Share of factual claims that resolve to a retrievable source, on a random sample audit.
I do not promise a percentage. I promise you will know which one you got, with a method that survives a sceptical partner, and that you keep the ability to measure it after I leave.
The traceability audit
This is the protocol as I run it. You can apply it to your own last report this afternoon, without me.
Five or six delivered reports of one deliverable type, fixed before anything is drawn. Every instance in the window is eligible, so a comfortable engagement cannot migrate into the sample. About twenty factual claims per report, drawn at random.
Five minutes per claim, timed. The limit is part of the measurement, because a partner challenged in a meeting has less than that.
One rate, with its sample size and its audit date. The baseline is rebuilt from records that already exist, so it cannot be dressed up after the fact.
Whether a source is any good. Only whether it exists and can be found by someone who did not write the report.
Where this comes from
I come from research. A PhD in economics and management from UCLouvain, at the intersection of human-computer interaction and customer experience: seven mixed-methods studies, over 130 laboratory sessions, more than 80 interviews, and peer-reviewed publications including the International Journal of Human-Computer Studies.
Before that, a Master's in Business Engineering from the Louvain School of Management, major in business analytics. My Master's internship put me in the delivery unit of the CATCH plan in Charleroi, an economic acceleration plan designed by the Boston Consulting Group. I have also taught what I practise, having created and taught the Monetization of Digital Assets course at HEC Montréal.
Until December 2026 I also hold a half-time research position at ExperiSens, an applied research centre in Montreal. The AI workflows I install elsewhere are the ones I built there, on interview processing, analysis, questionnaire design and literature monitoring.
No baseline was measured before that redesign, so I quote no percentage from it, including my own. Saying that is part of the demonstration.
Awarded on written application, 2019.
Application written and project led at ExperiSens, Montreal, January 2024 to July 2026.
Start with one question
When someone asks where a figure in one of your reports came from, what happens? If the answer is a laugh, or « we find it, but it takes a while », we have something to talk about.
Write to me and tell me what you produce, and how many people produce it. If the fit is wrong, I will say so in the first reply, and point you somewhere better.
L'IA générative pour les organisations dont le produit est du savoir
J'aide les cabinets, think tanks, centres de recherche et institutions publiques à mettre l'IA générative au travail sans renoncer à la rigueur qui fonde leur crédibilité. Je travaille en français et en anglais, depuis la Belgique.
Deux rapports, un cabinet, un an
En juillet 2025, Deloitte a remis un rapport au ministère australien de l'Emploi et des Relations de travail. Il citait des articles académiques qui n'existent pas, et une phrase attribuée à un jugement de la Cour fédérale qui n'a jamais été écrite. C'est un chercheur extérieur au projet qui a trouvé les erreurs. Deloitte a reconnu un usage limité d'un système d'IA générative, republié une version corrigée et remboursé la dernière tranche du contrat, environ 97 000 dollars australiens. Le ministère a déclaré que la substance de la revue et ses recommandations restaient inchangées.
Quelques mois plus tard, un plan de ressources humaines en santé de 526 pages, commandé par la province de Terre-Neuve-et-Labrador, s'est révélé porter au moins quatre citations renvoyant à des travaux qui n'existent pas. Deloitte reconnaît que ces quatre citations sont incorrectes et maintient les conclusions du rapport. L'ordre provincial des comptables professionnels agréés a ouvert une enquête, qui n'a pas rendu ses conclusions.
Un incident se lit comme une défaillance individuelle. Deux, dans le même cabinet, sur deux continents, sur des rapports commandés par des pouvoirs publics, désignent une procédure qui n'a pas arrêté le problème. Dans les deux cas, un modèle a produit quelque chose de faux, l'a produit de façon convaincante, et cela a atteint la publication sans correction.
C'est l'exposition que court toute organisation dont le produit est une analyse. Le travail sort quand même, et les conclusions tiennent peut-être. Ce qui cesse de tenir, c'est la capacité à le défendre ligne par ligne.
Accounting Times, octobre 2025. Montant remboursé d'après CFO Dive, octobre 2025. Déclaration du ministère rapportée par City A.M., octobre 2025.
CBC News, 2025. Enquête rapportée par The Independent, 2025.
Personne ne peut vous dire à l'avance ce que vous allez gagner
Deux études nationalement représentatives ont mesuré ce que l'IA générative fait réellement gagner au travail. Aux États-Unis, les travailleurs déclarent un gain de temps équivalent à 1,6 % de l'ensemble des heures travaillées. Au Danemark, où les réponses d'enquête ont été appariées aux données administratives de salaires et d'heures, les utilisateurs déclarent 2,8 %, sans effet détectable sur les revenus ni sur les heures.
Les expériences contrôlées sur des tâches isolées trouvent souvent des gains bien plus élevés. L'une d'elles a trouvé l'inverse : des développeurs expérimentés ont mis 19 % de temps en plus avec l'assistance de l'IA, et ont estimé après coup avoir été 20 % plus rapides.
L'écart honnête va donc de moins de 2 % à l'échelle d'une économie à bien plus de 15 % sur une tâche isolée, et ceux qui font le travail ne sont pas des juges fiables de ce qui s'applique à eux. Il existe une façon de savoir ce que votre cabinet obtient : la mesurer, avant et après, sur votre propre production. C'est la première chose que j'installe.
Bick, Blandin et Deming, Réserve fédérale de Saint-Louis, 13 novembre 2025.
Humlum et Vestergaard, NBER Working Paper 33777, 2025.
METR, 10 juillet 2025.
1,6 % Alexander Bick, Adam Blandin et David Deming, « The State of Generative AI Adoption in 2025 », Federal Reserve Bank of St. Louis, 13 novembre 2025. Real-Time Population Survey, vagues de février, mai et août 2025 regroupées. Sur une semaine de 40 heures, cela fait environ 38 minutes, mon calcul et non le leur. Les mêmes auteurs lisent ce chiffre comme compatible avec un gain agrégé de productivité du travail pouvant aller jusqu'à 1,3 % depuis la sortie de ChatGPT.
2,8 % Anders Humlum et Emilie Vestergaard, « Large Language Models, Small Labor Market Effects », NBER Working Paper 33777, 2025. Environ 25 000 travailleurs dans quelque 7 000 lieux de travail, réponses d'enquête liées aux registres administratifs de salaires et d'heures. Document de travail, non revu par les pairs à la date de rédaction.
19 % METR, « Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity », 10 juillet 2025. Essai randomisé, 16 développeurs expérimentés, 246 tâches réelles. Seize participants dans un seul métier font une base étroite, et je cite cette étude pour l'écart entre la croyance et le chronomètre, pas pour la taille de l'effet.
90 jours pour installer. La mesure ferme à cinq mois.
Les expérimentations dispersées deviennent un système documenté : quels outils pour quelles tâches, quels points de contrôle un livrable franchit avant de sortir, quels flux de travail sont repensés, et un cadre de gouvernance qui tient sous l'obligation de littératie en IA du règlement européen.
L'article 4 du règlement (UE) 2024/1689 s'applique depuis le 2 février 2025 et n'a pas été reporté. Le règlement (UE) 2026/1744, en vigueur depuis le 27 juillet 2026, l'a réécrit : fournisseurs et déployeurs soutiennent le développement de la littératie en IA, sans avoir à garantir un niveau pour une personne donnée. Les obligations lourdes sur les systèmes à haut risque, qui sont un autre sujet, ont été reportées aux 2 décembre 2027 et 2 août 2028.
Trois indicateurs, mesurés avant et après
Heures imputées sur un type de livrable, fixé à l'avance, tirées de vos propres relevés de temps.
Part des livrables qui passent la revue interne sans reprise majeure.
Part des affirmations factuelles qui remontent à une source retrouvable, sur un audit par échantillon aléatoire.
Je ne promets pas un pourcentage. Je promets que vous saurez lequel vous avez obtenu, avec une méthode qui tient devant un associé sceptique, et que vous garderez cette capacité de mesure après mon départ.
L'audit de traçabilité
Voici le protocole tel que je le mène. Vous pouvez l'appliquer à votre dernier rapport cet après-midi, sans moi.
Cinq ou six rapports livrés d'un même type, fixé avant tout tirage. Toutes les occurrences de la période sont éligibles, pour qu'une mission confortable ne puisse pas se glisser dans l'échantillon. Une vingtaine d'affirmations factuelles par rapport, tirées au hasard.
Cinq minutes par affirmation, chronométrées. La limite fait partie de la mesure, parce qu'un associé pris à partie en réunion en a moins que cela.
Un taux, avec la taille de son échantillon et sa date d'audit. La ligne de base est reconstruite à partir de relevés qui existent déjà, elle ne peut donc pas être arrangée après coup.
La qualité d'une source. Seulement son existence, et le fait qu'elle soit retrouvable par quelqu'un qui n'a pas écrit le rapport.
D'où cela vient
Je viens de la recherche. Un doctorat en économie et gestion de l'UCLouvain, à l'intersection de l'interaction humain-machine et de l'expérience client : sept études en méthodes mixtes, plus de 130 séances de laboratoire, plus de 80 entretiens, et des publications à comité de lecture dont l'International Journal of Human-Computer Studies.
Avant cela, un master d'ingénieur de gestion de la Louvain School of Management, majeure business analytics. Mon stage de mémoire m'a placé dans l'équipe de mise en oeuvre du plan CATCH à Charleroi, un plan d'accélération économique conçu par le Boston Consulting Group. J'ai aussi enseigné ce que je pratique, puisque j'ai créé et donné le cours de monétisation des actifs numériques à HEC Montréal.
Jusqu'en décembre 2026, j'occupe aussi un poste de chercheur à mi-temps chez ExperiSens, un centre de recherche appliquée à Montréal. Les flux de travail IA que j'installe ailleurs sont ceux que j'y ai construits, sur le traitement d'entretiens, l'analyse, la création de questionnaires et la veille scientifique.
Aucune ligne de base n'a été mesurée avant cette refonte, je n'en tire donc aucun pourcentage, y compris sur mon propre travail. Le dire fait partie de la démonstration.
Obtenue sur dossier, 2019.
Dossier rédigé et projet dirigé chez ExperiSens, Montréal, janvier 2024 à juillet 2026.
Commencez par une question
Quand quelqu'un vous demande d'où vient un chiffre dans un de vos rapports, qu'est-ce qui se passe ? Si la réponse est un rire, ou « on retrouve, mais ça prend du temps », nous avons de quoi parler.
Écrivez-moi en me disant ce que vous produisez, et combien de personnes le produisent. Si ça ne colle pas, je vous le dirai dès la première réponse, et je vous orienterai ailleurs.