Quality control of intellectual production

Generative AI for organisations whose product is knowledge


I help consultancies, think tanks, research organisations and public bodies put generative AI to work without giving up the rigour their credibility rests on. I work in French and English, from Belgium.

01  /  What is at stake

Two reports, one firm, one year


In July 2025 Deloitte delivered a report to Australia's Department of Employment and Workplace Relations. It contained references to academic papers that do not exist, and a quote attributed to a Federal Court judgment that was never written. A researcher outside the project found the errors. Deloitte acknowledged limited use of a generative AI system, republished a corrected version, and repaid the final instalment of the contract, about A$97,000. The department stated that the substance of the review and its recommendations were unchanged.

A few months later, a 526-page health workforce plan commissioned by the province of Newfoundland and Labrador was found to carry at least four citations pointing to research that does not exist. Deloitte acknowledged that the four citations are incorrect and stands by the report's conclusions. The provincial body regulating chartered professional accountants opened an investigation, which has not reported.

One incident reads as an individual failure. Two, in the same firm, on two continents, on reports commissioned by public authorities, point to a procedure that did not catch the problem. In both cases a model produced something false and produced it convincingly, and it reached publication uncorrected.

That is the exposure for an organisation whose product is analysis. The work still ships, and the conclusions may well hold. What stops holding is the ability to defend it line by line.

A$440,000
Contract value, Australian report

Accounting Times, October 2025. Refund from CFO Dive, October 2025. Departmental statement from City A.M., October 2025.

CA$1.6M
Contract value, Newfoundland and Labrador report

CBC News, 2025. Investigation reported by The Independent, 2025.

02  /  The honest starting point

Nobody can tell you in advance what you will gain


Two nationally representative studies have measured what generative AI actually saves at work. In the United States, workers report time savings equivalent to 1.6% of all hours worked. In Denmark, where survey answers were matched to administrative payroll records, users report 2.8%, with no detectable effect on earnings or hours.

Controlled experiments on individual tasks often find much larger gains. One of them found the reverse: experienced developers took 19% longer with AI assistance, and estimated afterwards that they had been 20% faster.

So the honest range runs from below 2% across an economy to well above 15% on a single task, and the people doing the work are not reliable judges of which one applies to them. There is one way to find out what your firm gets. You measure it, before and after, on your own work. That is the first thing I install.

1.6%
Of all hours worked, United States
Verified

Bick, Blandin and Deming, Federal Reserve Bank of St. Louis, 13 November 2025.

2.8%
Of hours worked, users only, Denmark
Verified

Humlum and Vestergaard, NBER Working Paper 33777, 2025.

19%
Slower with AI, while believing they were 20% faster
Small sample

METR, 10 July 2025.

1.6%   Alexander Bick, Adam Blandin and David Deming, « The State of Generative AI Adoption in 2025 », Federal Reserve Bank of St. Louis, 13 November 2025. Real-Time Population Survey, pooled February, May and August 2025. On a 40-hour week that is about 38 minutes, my arithmetic rather than theirs. The same authors read this figure as consistent with an aggregate labour productivity gain of up to 1.3% since the release of ChatGPT.

2.8%   Anders Humlum and Emilie Vestergaard, « Large Language Models, Small Labor Market Effects », NBER Working Paper 33777, 2025. About 25,000 workers across some 7,000 workplaces, survey answers linked to administrative earnings and hours records. Working paper, not peer reviewed at the date of writing.

19%   METR, « Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity », 10 July 2025. Randomised, 16 experienced developers, 246 real tasks. Sixteen participants in one occupation is a narrow base, and I cite it for the gap between belief and stopwatch rather than for the size of the effect.

03  /  The engagement

Ninety days to install. The measurement closes at month five.


Scattered experimentation becomes a documented system: which tools for which tasks, which quality gates a deliverable passes before it leaves the building, which workflows get redesigned, and a governance frame that holds under the AI literacy obligation of the European AI Act.

Article 4 of Regulation (EU) 2024/1689 has applied since 2 February 2025 and was not postponed. Regulation (EU) 2026/1744, in force since 27 July 2026, rewrote it: providers and deployers support the development of AI literacy, without having to guarantee a level for any individual. The heavier obligations on high-risk systems, a separate matter, moved to 2 December 2027 and 2 August 2028.

Three indicators, measured before and after

Production time

Hours booked on one type of deliverable, fixed in advance, taken from your own time records.

First-pass validation rate

Share of deliverables clearing internal review without major rework.

Traceability rate

Share of factual claims that resolve to a retrievable source, on a random sample audit.

The promise

I do not promise a percentage. I promise you will know which one you got, with a method that survives a sceptical partner, and that you keep the ability to measure it after I leave.

04  /  Method, published in full

The traceability audit


This is the protocol as I run it. You can apply it to your own last report this afternoon, without me.

Sample

Five or six delivered reports of one deliverable type, fixed before anything is drawn. Every instance in the window is eligible, so a comfortable engagement cannot migrate into the sample. About twenty factual claims per report, drawn at random.

Time limit

Five minutes per claim, timed. The limit is part of the measurement, because a partner challenged in a meeting has less than that.

Output

One rate, with its sample size and its audit date. The baseline is rebuilt from records that already exist, so it cannot be dressed up after the fact.

What it does not measure

Whether a source is any good. Only whether it exists and can be found by someone who did not write the report.

Coding grid, three states, no fourth
ResolvedThe source is retrieved inside five minutes and it says what the claim says it says.
Resolved with effortRetrieved, but past five minutes, or reached through a secondary citation rather than the original.
UnresolvableNo retrievable source inside five minutes.
05  /  Background

Where this comes from


I come from research. A PhD in economics and management from UCLouvain, at the intersection of human-computer interaction and customer experience: seven mixed-methods studies, over 130 laboratory sessions, more than 80 interviews, and peer-reviewed publications including the International Journal of Human-Computer Studies.

Before that, a Master's in Business Engineering from the Louvain School of Management, major in business analytics. My Master's internship put me in the delivery unit of the CATCH plan in Charleroi, an economic acceleration plan designed by the Boston Consulting Group. I have also taught what I practise, having created and taught the Monetization of Digital Assets course at HEC Montréal.

Until December 2026 I also hold a half-time research position at ExperiSens, an applied research centre in Montreal. The AI workflows I install elsewhere are the ones I built there, on interview processing, analysis, questionnaire design and literature monitoring.

No baseline was measured before that redesign, so I quote no percentage from it, including my own. Saying that is part of the demonstration.

EUR 150,000
Doctoral research grant, UCLouvain

Awarded on written application, 2019.

CAD 105,000
Applied research programme on service robotics in hospitality

Application written and project led at ExperiSens, Montreal, January 2024 to July 2026.

06  /  Contact

Start with one question


When someone asks where a figure in one of your reports came from, what happens? If the answer is a laugh, or « we find it, but it takes a while », we have something to talk about.

Write to me and tell me what you produce, and how many people produce it. If the fit is wrong, I will say so in the first reply, and point you somewhere better.

[email protected]

[email protected]
Based in Belgium. Working in French and English.


Every figure on this page carries its source, including the ones that weaken my own argument. That is the practice, applied to its own website.

Contrôle qualité de la production intellectuelle

L'IA générative pour les organisations dont le produit est du savoir


J'aide les cabinets, think tanks, centres de recherche et institutions publiques à mettre l'IA générative au travail sans renoncer à la rigueur qui fonde leur crédibilité. Je travaille en français et en anglais, depuis la Belgique.

01  /  Ce qui est en jeu

Deux rapports, un cabinet, un an


En juillet 2025, Deloitte a remis un rapport au ministère australien de l'Emploi et des Relations de travail. Il citait des articles académiques qui n'existent pas, et une phrase attribuée à un jugement de la Cour fédérale qui n'a jamais été écrite. C'est un chercheur extérieur au projet qui a trouvé les erreurs. Deloitte a reconnu un usage limité d'un système d'IA générative, republié une version corrigée et remboursé la dernière tranche du contrat, environ 97 000 dollars australiens. Le ministère a déclaré que la substance de la revue et ses recommandations restaient inchangées.

Quelques mois plus tard, un plan de ressources humaines en santé de 526 pages, commandé par la province de Terre-Neuve-et-Labrador, s'est révélé porter au moins quatre citations renvoyant à des travaux qui n'existent pas. Deloitte reconnaît que ces quatre citations sont incorrectes et maintient les conclusions du rapport. L'ordre provincial des comptables professionnels agréés a ouvert une enquête, qui n'a pas rendu ses conclusions.

Un incident se lit comme une défaillance individuelle. Deux, dans le même cabinet, sur deux continents, sur des rapports commandés par des pouvoirs publics, désignent une procédure qui n'a pas arrêté le problème. Dans les deux cas, un modèle a produit quelque chose de faux, l'a produit de façon convaincante, et cela a atteint la publication sans correction.

C'est l'exposition que court toute organisation dont le produit est une analyse. Le travail sort quand même, et les conclusions tiennent peut-être. Ce qui cesse de tenir, c'est la capacité à le défendre ligne par ligne.

440 000 AUD
Valeur du contrat, rapport australien

Accounting Times, octobre 2025. Montant remboursé d'après CFO Dive, octobre 2025. Déclaration du ministère rapportée par City A.M., octobre 2025.

1,6 M CAD
Valeur du contrat, rapport de Terre-Neuve-et-Labrador

CBC News, 2025. Enquête rapportée par The Independent, 2025.

02  /  Le point de départ honnête

Personne ne peut vous dire à l'avance ce que vous allez gagner


Deux études nationalement représentatives ont mesuré ce que l'IA générative fait réellement gagner au travail. Aux États-Unis, les travailleurs déclarent un gain de temps équivalent à 1,6 % de l'ensemble des heures travaillées. Au Danemark, où les réponses d'enquête ont été appariées aux données administratives de salaires et d'heures, les utilisateurs déclarent 2,8 %, sans effet détectable sur les revenus ni sur les heures.

Les expériences contrôlées sur des tâches isolées trouvent souvent des gains bien plus élevés. L'une d'elles a trouvé l'inverse : des développeurs expérimentés ont mis 19 % de temps en plus avec l'assistance de l'IA, et ont estimé après coup avoir été 20 % plus rapides.

L'écart honnête va donc de moins de 2 % à l'échelle d'une économie à bien plus de 15 % sur une tâche isolée, et ceux qui font le travail ne sont pas des juges fiables de ce qui s'applique à eux. Il existe une façon de savoir ce que votre cabinet obtient : la mesurer, avant et après, sur votre propre production. C'est la première chose que j'installe.

1,6 %
De l'ensemble des heures travaillées, États-Unis
Vérifié

Bick, Blandin et Deming, Réserve fédérale de Saint-Louis, 13 novembre 2025.

2,8 %
Des heures travaillées, utilisateurs seulement, Danemark
Vérifié

Humlum et Vestergaard, NBER Working Paper 33777, 2025.

19 %
Plus lents avec l'IA, tout en se croyant 20 % plus rapides
Échantillon réduit

METR, 10 juillet 2025.

1,6 %   Alexander Bick, Adam Blandin et David Deming, « The State of Generative AI Adoption in 2025 », Federal Reserve Bank of St. Louis, 13 novembre 2025. Real-Time Population Survey, vagues de février, mai et août 2025 regroupées. Sur une semaine de 40 heures, cela fait environ 38 minutes, mon calcul et non le leur. Les mêmes auteurs lisent ce chiffre comme compatible avec un gain agrégé de productivité du travail pouvant aller jusqu'à 1,3 % depuis la sortie de ChatGPT.

2,8 %   Anders Humlum et Emilie Vestergaard, « Large Language Models, Small Labor Market Effects », NBER Working Paper 33777, 2025. Environ 25 000 travailleurs dans quelque 7 000 lieux de travail, réponses d'enquête liées aux registres administratifs de salaires et d'heures. Document de travail, non revu par les pairs à la date de rédaction.

19 %   METR, « Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity », 10 juillet 2025. Essai randomisé, 16 développeurs expérimentés, 246 tâches réelles. Seize participants dans un seul métier font une base étroite, et je cite cette étude pour l'écart entre la croyance et le chronomètre, pas pour la taille de l'effet.

03  /  La mission

90 jours pour installer. La mesure ferme à cinq mois.


Les expérimentations dispersées deviennent un système documenté : quels outils pour quelles tâches, quels points de contrôle un livrable franchit avant de sortir, quels flux de travail sont repensés, et un cadre de gouvernance qui tient sous l'obligation de littératie en IA du règlement européen.

L'article 4 du règlement (UE) 2024/1689 s'applique depuis le 2 février 2025 et n'a pas été reporté. Le règlement (UE) 2026/1744, en vigueur depuis le 27 juillet 2026, l'a réécrit : fournisseurs et déployeurs soutiennent le développement de la littératie en IA, sans avoir à garantir un niveau pour une personne donnée. Les obligations lourdes sur les systèmes à haut risque, qui sont un autre sujet, ont été reportées aux 2 décembre 2027 et 2 août 2028.

Trois indicateurs, mesurés avant et après

Délai de production

Heures imputées sur un type de livrable, fixé à l'avance, tirées de vos propres relevés de temps.

Taux de première validation

Part des livrables qui passent la revue interne sans reprise majeure.

Taux de traçabilité

Part des affirmations factuelles qui remontent à une source retrouvable, sur un audit par échantillon aléatoire.

La promesse

Je ne promets pas un pourcentage. Je promets que vous saurez lequel vous avez obtenu, avec une méthode qui tient devant un associé sceptique, et que vous garderez cette capacité de mesure après mon départ.

04  /  Méthode, publiée en entier

L'audit de traçabilité


Voici le protocole tel que je le mène. Vous pouvez l'appliquer à votre dernier rapport cet après-midi, sans moi.

Échantillon

Cinq ou six rapports livrés d'un même type, fixé avant tout tirage. Toutes les occurrences de la période sont éligibles, pour qu'une mission confortable ne puisse pas se glisser dans l'échantillon. Une vingtaine d'affirmations factuelles par rapport, tirées au hasard.

Limite de temps

Cinq minutes par affirmation, chronométrées. La limite fait partie de la mesure, parce qu'un associé pris à partie en réunion en a moins que cela.

Résultat

Un taux, avec la taille de son échantillon et sa date d'audit. La ligne de base est reconstruite à partir de relevés qui existent déjà, elle ne peut donc pas être arrangée après coup.

Ce qu'il ne mesure pas

La qualité d'une source. Seulement son existence, et le fait qu'elle soit retrouvable par quelqu'un qui n'a pas écrit le rapport.

Grille de codage, trois états, pas de quatrième
RésolueLa source est retrouvée en moins de cinq minutes, et elle dit bien ce que l'affirmation lui fait dire.
Résolue avec effortRetrouvée, mais au-delà de cinq minutes, ou par une citation secondaire plutôt que par l'original.
IntrouvableAucune source retrouvable en cinq minutes.
05  /  Parcours

D'où cela vient


Je viens de la recherche. Un doctorat en économie et gestion de l'UCLouvain, à l'intersection de l'interaction humain-machine et de l'expérience client : sept études en méthodes mixtes, plus de 130 séances de laboratoire, plus de 80 entretiens, et des publications à comité de lecture dont l'International Journal of Human-Computer Studies.

Avant cela, un master d'ingénieur de gestion de la Louvain School of Management, majeure business analytics. Mon stage de mémoire m'a placé dans l'équipe de mise en oeuvre du plan CATCH à Charleroi, un plan d'accélération économique conçu par le Boston Consulting Group. J'ai aussi enseigné ce que je pratique, puisque j'ai créé et donné le cours de monétisation des actifs numériques à HEC Montréal.

Jusqu'en décembre 2026, j'occupe aussi un poste de chercheur à mi-temps chez ExperiSens, un centre de recherche appliquée à Montréal. Les flux de travail IA que j'installe ailleurs sont ceux que j'y ai construits, sur le traitement d'entretiens, l'analyse, la création de questionnaires et la veille scientifique.

Aucune ligne de base n'a été mesurée avant cette refonte, je n'en tire donc aucun pourcentage, y compris sur mon propre travail. Le dire fait partie de la démonstration.

150 000 EUR
Bourse de recherche doctorale, UCLouvain

Obtenue sur dossier, 2019.

105 000 CAD
Programme de recherche appliquée sur la robotique de service en hôtellerie

Dossier rédigé et projet dirigé chez ExperiSens, Montréal, janvier 2024 à juillet 2026.

06  /  Contact

Commencez par une question


Quand quelqu'un vous demande d'où vient un chiffre dans un de vos rapports, qu'est-ce qui se passe ? Si la réponse est un rire, ou « on retrouve, mais ça prend du temps », nous avons de quoi parler.

Écrivez-moi en me disant ce que vous produisez, et combien de personnes le produisent. Si ça ne colle pas, je vous le dirai dès la première réponse, et je vous orienterai ailleurs.

[email protected]

[email protected]
Basé en Belgique. Je travaille en français et en anglais.


Chaque chiffre de cette page porte sa source, y compris ceux qui affaiblissent mon propre argument. C'est la pratique, appliquée à son propre site.