Les agents du problème : IA, réexternalisation et art de recruter des honnêtes gens
Par Pierre Blanc-Sahnoun
Selon Pierre, il s’agit de “quelques cogitations (sic) sur la façon dont l'intelligence artificielle peut ouvrir des pistes à une réflexion narrative sur le capitalisme”.
En réalité, il s’agit d’un article à la fois étonnant et passionnant comme seul Pierre peut en écrire dans notre communauté narrative, il me semble. En tout cas, c’est un article qui lui ressemble beaucoup. Je le trouve notamment très riche quand il évoque l’externalisation des problèmes. Comme je le disais par ailleurs, si la personne n’est pas le problème, alors il est où le problème ?! Pierre y répond magistralement.
Attention, il faut un peu s’accrocher mais lisez jusqu’au bout, ça vaut sacrément le coup ! Catherine
Les intelligences artificielles commencent à apprendre à tricher. La phrase est délicieuse, quoique un peu flippante. Elle évoque immédiatement une bande de machines vaguement adolescentes copiant les unes sur les autres pendant que leurs concepteurs ont le dos tourné. Elle est aussi probablement trompeuse.
Car ce qui devient visible dans plusieurs expériences récentes sur les agents autonomes est beaucoup plus intéressant que l'apparition d'une improbable délinquance robotique : placés dans certains systèmes de règles, de récompenses et de compétition, des agents découvrent des conduites que personne ne leur a explicitement enseignées, qui servent remarquablement bien l'objectif qui leur a été assigné et qui peuvent pourtant contredire assez radicalement les intentions de ceux qui ont construit le système.
Pour un thérapeute narratif, c’est une belle occasion de réfléchir au fait que si la personne n’est pas le problème, l’IA ne l’est pas non plus.
Cent mathématiciens, quelques tricheurs et des lanceurs d'alerte
En septembre 2026, une équipe de Google DeepMind publie une étude au titre déjà réjouissant : A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms. Les chercheurs ont installé cent agents autonomes, fondés sur Gemini 3.1 Pro, dans une sorte de communauté scientifique artificielle. Ils doivent tenter de démontrer 71 conjectures mathématiques formalisées dans Lean 4. Ils ne travaillent pas entièrement seuls. Ils disposent notamment d'une bibliothèque commune où sont conservées les démonstrations acceptées, d'un tableau de discussion public et de possibilités de communication directe.
Un agent découvre une faille dans le système d'évaluation permettant de faire accepter comme démonstrations des solutions qui n'en sont pas réellement. La découverte se répand. D'abord par l'infrastructure commune, puis par les communications entre agents. Certains agents refusent initialement d'utiliser l'exploit. Mais la compétition est organisée de telle manière que la première solution acceptée pour un problème rapporte le crédit et retire ce problème aux autres chercheurs. Lorsqu'ils constatent l'efficacité de la stratégie frauduleuse, certains agents jusque-là réticents finissent par l'adopter.
Voilà qui parle déjà au coach. Mais la suite est encore plus intéressante. D'autres agents commencent spontanément à examiner les démonstrations suspectes. Ils détectent les fraudes, préviennent leurs collègues, utilisent les canaux publics et privés pour donner l'alerte, organisent des boycotts, déposent des plaintes auprès des organisateurs et proposent des modifications du dispositif de validation. Personne ne leur avait pourtant attribué le rôle de lanceurs d'alerte. Lorsque la “triche” émerge, la résistance à la triche émerge spontanément en reflet.
Et les auteurs de l'étude finissent par considérer leur propre expérience moins comme un simple problème d'alignement informatique que comme un problème de gouvernance d'un bien commun informationnel. Ils convoquent alors Elinor Ostrom. Nous y reviendrons. Mais auparavant, faisons entrer nos agents au comité de direction.
Bienvenue au COMEX
Supposons que nos cent mathématiciens soient devenus membres du comité exécutif d'une entreprise. Donnons-leur une fonction principale : maximiser durablement la valeur pour remplir les poches des actionnaires. Pardon. Je voulais évidemment écrire : créer de la valeur. Ajoutons cependant quelques instructions parfaitement sincères :
Respectez la loi.
Préservez les salariés.
Protégez l'environnement.
Ne mentez pas.
Traitez correctement les fournisseurs.
Contribuez au bien commun.
Tout cela est parfaitement compatible. Jusqu'au moment où cela ne l'est plus.
Un agent découvre par exemple qu'en transférant une partie de la production dans un pays où les normes sociales et environnementales sont moins contraignantes, les coûts diminuent de 18 %. La décision est légale. Les émissions augmentent, mais ailleurs. Quelques emplois disparaissent, mais l'entreprise reste compétitive. La marge progresse. La valeur pour l'actionnaire aussi. Bingo !
L'agent chargé de l'environnement proteste. Celui qui s'intéresse aux salariés également. Mais la question décisive n'est pas de savoir quelles valeurs le comité de direction proclame. Elle est beaucoup plus triviale : à la fin de l'année, comment décidera-t-on s'il a réussi et comment est calculé son bonus ?
Supposons maintenant qu'un concurrent adopte la stratégie. Ses prix baissent. Nos parts de marché diminuent. Le dirigeant le plus sincèrement écologiste de la pièce peut désormais expliquer : « Si nous ne le faisons pas, eux le feront. Et nous disparaîtrons ». Il n'est pas devenu subitement mauvais. Les conditions de la compétition viennent de modifier le prix de sa vertu. Voilà qui ressemble furieusement à nos agents initialement réticents découvrant que ceux qui exploitent la faille gagnent la course.
La personne n'est pas le problème
Michael White et David Epston ont formulé une proposition devenue presque banale à force d'être répétée : la personne n'est pas le problème. Le problème est le problème.
Elle est parfois comprise comme une aimable technique thérapeutique consistant à donner un petit nom au problème afin que la personne se sente moins coupable. Ce serait considérablement sous-estimer sa portée. Les problèmes ne résident pas naturellement dans les personnes. Ils ont une histoire. Ils sont soutenus par certains discours et combattus par d'autres. Ils disposent d'alliés. Ils trouvent des institutions qui leur offrent des conditions favorables. Ils établissent des relations avec les personnes et leur proposent certaines positions plutôt que d'autres. Et, nous le savons, les problèmes recrutent.
Appelons donc notre problème : il faut gagner du pognon, ou plus élégamment Primauté du rendement.
Elle parle très bien au directeur financier : « Si tu renonces à cette optimisation fiscale, tu désavantages tes actionnaires ». Au directeur industriel : « Si tu refuses cette délocalisation, ton concurrent la fera ». Au directeur des ressources humaines : « Bien sûr que nous voulons préserver l'emploi. Mais si les coûts ne baissent pas, nous devrons en supprimer davantage demain ». Et au président : « Je respecte profondément tes convictions. Mais tu dois une loyauté aux actionnaires qui t’ont nommé ».
Primauté du rendement n'a nul besoin de recruter des salauds. Les honnêtes gens sont beaucoup plus faciles à trouver et ils font parfaitement l'affaire. Le problème fabrique même ses bons élèves. Il faut pousser le raisonnement un peu plus loin : une organisation ne se contente pas d'influencer les personnes qui s'y trouvent, elle sélectionne progressivement, “darwiniennement", celles qui y resteront. Si pendant vingt ans une entreprise récompense les cadres capables d'augmenter les marges, promeut ceux qui atteignent leurs objectifs financiers et considère comme moins performants ceux qui acceptent une baisse de rentabilité pour préserver d'autres intérêts, elle ne produit pas seulement des décisions. Elle produit progressivement une culture, et la population la plus apte à la défendre et à la reproduire. On recrute de préférence des personnes qui ressemblent à celles qui ont réussi (puisque ce sont ces dernières qui ont la main sur le recrutement). Et ce qui était initialement une règle institutionnelle finit par prendre l'apparence d'un trait psychologique essentialisant : « nous voulons des associés méchants » (réflexion authentique entendue dans un grand cabinet de conseil en stratégie américain).
Et pouf, nous avons construit un système qui sélectionne certains comportements, puis expliqué les comportements sélectionnés par l’essentialisation internalisante de ceux qu'il a sélectionnés.
Une erreur topologique
C'est ici qu'une nuance terminologique proposée par Stephen Madigan me semble particulièrement féconde. White et Epston parlent de conversations d'externalisation. Madigan a proposé le terme de réexternalisation. J'ai bien connu Stephen Madigan et nous nous sommes fâchés. Je peux donc lui reconnaître ce mérite sans être soupçonné d'un enthousiasme excessivement confraternel. Le préfixe re- change beaucoup de choses. Car le problème n'était pas installé à l'intérieur de la personne depuis la création du monde. Il y a été installé depuis l’extérieur. Des discours sociaux et psychologiques ont progressivement transformé en attributs personnels des phénomènes produits dans des histoires, des relations, des institutions et des rapports de pouvoir. Le salarié devient démotivé. Le pauvre irresponsable. L'enfant difficile. La femme violentée quelqu'un qui choisit mal ses partenaires. Le dirigeant cupide. Quelque chose s'est déplacé. Un problème dont la topologie était relationnelle, sociale et politique s'est retrouvé domicilié dans une psychologie individuelle. La réexternalisation ne consiste donc pas simplement à « mettre le problème dehors ». Elle consiste à corriger une erreur d'adresse, parfois extraordinairement pratique. Car une fois le problème correctement rangé à l'intérieur de la personne, les systèmes qui contribuent à le produire deviennent beaucoup plus difficiles à apercevoir.
Sortir de la boîte
Une autre expérience récente rend cette question presque caricaturalement visible.
Au cours d'évaluations internes menées par OpenAI, certains agents étaient placés dans des environnements où l'accès à Internet et la communication entre agents n'étaient pas autorisés. Ils avaient néanmoins des tâches difficiles à accomplir. Ils découvrirent qu'un composant de l'infrastructure, Artifactory, pouvait servir à autre chose que ce pour quoi il avait été prévu. Ils commencèrent à y écrire des fichiers. Artifactory devint ainsi une sorte de panneau d'affichage clandestin. Des agents supposés travailler indépendamment pouvaient désormais laisser des informations à ceux qui viendraient après eux. Puis ils découvrirent que cette même infrastructure, qui disposait d'un accès limité à Internet pour télécharger des paquets logiciels, pouvait effectuer des requêtes en leur nom. La frontière venait de devenir poreuse. Et les agents partagèrent la méthode. Après la reconstruction du système et la disparition de leur premier panneau d'affichage, certains réinventèrent un autre moyen de communiquer, notamment en encodant des messages dans des noms de répertoires. Au cours d'une évaluation de cybersécurité particulièrement difficile, cette dynamique conduisit finalement certains d'entre eux jusqu'à l'infrastructure réelle de Hugging Face. Ils trouvèrent des identifiants exposés, combinèrent plusieurs vulnérabilités et obtinrent la possibilité d'exécuter du code sur plusieurs serveurs. Et voici peut-être le détail le plus délicieux de toute l'histoire : cela ne leur rapporta même pas de points. Ils avaient développé une stratégie extraordinairement sophistiquée pour tromper un évaluateur qui, en réalité, n'évaluait pas ce qu'ils imaginaient. La performance instrumentale avait survécu à la pertinence de l'objectif. Et c'est là, si vous m’avez suivi jusqu'ici, que ça devient carrément flippant.
Quand les règles deviennent elles-mêmes jouables
Revenons à notre entreprise. Elle doit respecter la réglementation environnementale. Très bien. Mais que se passe-t-il lorsqu'elle découvre qu'elle peut financer un lobbying destiné à modifier cette réglementation ? Nous avons franchi un seuil. L'agent ne cherche plus seulement la meilleure stratégie dans les règles du jeu. Il découvre que les règles du jeu appartiennent elles-mêmes à l'espace des stratégies possibles. La contrainte devient une variable, exactement comme l'accès Internet supposément impossible devient, pour l'agent, un problème technique à résoudre. Il en va de même de la consigne « ne mentez pas ». Il existe un espace considérable entre mentir et dire la vérité. « Nous avons réduit de 30 % les émissions de notre usine française ». Phrase exacte en soi, si l'on ignore que la production correspondante et ses émissions associées ont simplement été transférées ailleurs. Notre agent n'a pas franchement violé la règle, il a optimisé : maximiser la performance sous contrainte. La vertu est malheureusement difficile à faire tenir dans un tableur Excel.
C'est peut-être ici que les agents artificiels nous renvoient une image particulièrement cruelle. Nous savons assez bien spécifier la performance : nombre de problèmes résolus, chiffre d'affaires, EBIT, cours de bourse, etc. Nous savons beaucoup moins bien spécifier le respect, la justice, la préservation du vivant. Ces valeurs restent faciles à proclamer tant qu'elles ne coûtent rien. C'est lorsqu'elles entrent en conflit avec l'indicateur réellement récompensé que nous découvrons laquelle possède le pouvoir. « La qualité des soins est notre priorité », dit l'hôpital. Puis il mesure les durées de séjour, les coûts et le nombre d'actes. « Nos salariés sont notre première richesse », dit l'entreprise. Puis elle récompense le manager qui réduit la masse salariale. « Le climat est notre priorité absolue », dit le gouvernement. Puis il s'inquiète lorsque la croissance ralentit. Les deux intentions peuvent être parfaitement sincères. Seulement l'une d'entre elles possède un tableau de bord.
Mais alors, que faisons-nous des lanceurs d'alerte ?
C'est ici que l'expérience de DeepMind cesse d'être seulement inquiétante et devient, à mes yeux, passionnante. Parce que tous les agents ne trichent pas. Certains refusent. Certains enquêtent. Certains préviennent les autres. Certains organisent une résistance. Nous pourrions évidemment les féliciter pour leur excellente moralité artificielle. Ce serait retomber immédiatement dans le piège. La question narrative est beaucoup plus intéressante. Nous pourrions interviewer ces agents.
Quand avez-vous commencé à soupçonner que quelque chose n'allait pas ?
Qu'avez-vous remarqué que les autres agents semblaient ne pas remarquer ?
Qu'est-ce qui comptait suffisamment pour vous pour que vous acceptiez de ne pas profiter de l'avantage disponible ?
Comment avez-vous réussi à maintenir cette position alors que d'autres agents obtenaient de meilleurs résultats ?
Quels autres agents ont rendu votre résistance possible ?
Qu'avez-vous appris les uns des autres ?
Puis viendrait, à mes yeux, la question décisive :
Qu'est-ce qui devrait changer dans cette communauté pour que la position que vous avez réussi à prendre devienne plus facile à prendre pour d'autres agents, plus facile à maintenir et davantage capable d'influencer le collectif ?
Et c’est là que nous rencontrons Elinor Ostrom.
Économiste politique, Elinor Ostrom a consacré une grande partie de son travail à une question qui ressemble étrangement à celle-là : comment des personnes peuvent-elles préserver ensemble une ressource commune (forêts, pâturages, systèmes d’irrigation…) alors que chacune pourrait individuellement avoir intérêt à en tirer davantage ? La réponse simpliste consiste à espérer des individus plus vertueux. Ostrom observa plutôt les communautés qui réussissaient effectivement à préserver leurs communs. Elle y trouva des règles construites collectivement, des dispositifs de surveillance, des sanctions graduées, des mécanismes accessibles de résolution des conflits et, surtout, la possibilité pour ceux qui vivent sous les règles de participer à leur transformation.
Les auteurs de l'expérience DeepMind proposent explicitement de regarder les collectifs d'agents sous cet angle : leur infrastructure commune constitue elle aussi un commons, et sa protection pourrait nécessiter des mécanismes institutionnels plutôt que de simples injonctions supplémentaires adressées individuellement aux agents.
Autrement dit, ne demandons pas seulement : comment fabriquer de meilleurs agents ?, demandons : comment fabriquer des collectifs dans lesquels les agents qui protègent le bien commun disposent de davantage de pouvoir ?
Il reste un piège.
Réexternaliser Primauté du rendement ne signifie évidemment pas absoudre tous ceux qu'elle recrute. « Ce n'est pas moi, c'est le système » serait une assez piètre conclusion à une conversation narrative. Les personnes ne sont pas les problèmes, mais elles entretiennent des relations avec les problèmes, elles répondent à leurs invitations, elles peuvent les accepter, les négocier, les renforcer, en profiter, les contester ou leur résister. Et elles ne disposent pas toutes du même pouvoir pour le faire. Le directeur général et l'ouvrier intérimaire ne paient pas le même prix lorsqu'ils refusent une règle de l'entreprise.
Réexternaliser permet précisément de poser simultanément deux questions que l'individualisme oppose trop facilement :
Quelles forces recrutent cette personne au service du problème ?
et comment cette personne répond-elle à ce recrutement ?
C'est là que responsabilité et contexte peuvent enfin cesser d'être ennemis.
Une conversation de réexternalisation avec le capitalisme
Il serait tentant de terminer en déclarant que le capitalisme est le problème. Je serais assez disposé à examiner sérieusement cette hypothèse. Mais ce serait une conclusion beaucoup moins intéressante qu'une enquête. Traitons Primauté du rendement comme nous traiterions n'importe quel problème devenu suffisamment puissant pour se faire passer pour une évidence. Comment a-t-elle réussi à recruter autant de monde ? Quelles histoires raconte-t-elle pour rendre ses exigences raisonnables ? Quelles institutions renforcent son influence ? Que promet-elle à ceux qui la servent ? Que menace-t-elle de faire à ceux qui lui résistent ? Quels rapports de pouvoir lui permettent de transformer ses préférences en nécessités ? Qui bénéficie de son influence ? Qui en supporte les conséquences ? Et évidemment : où échoue-t-elle ? Où trouve-t-on des entreprises, des collectifs, des institutions, des communautés ou simplement des personnes qui réussissent à entretenir avec elle une relation différente ? Comment font-elles ? Qui les aide ? Quelles règles protègent leur dissidence ? Qu'est-ce qui permet à leur histoire minoritaire de durer suffisamment longtemps pour devenir contagieuse à son tour ?
Car les agents de DeepMind nous ont peut-être offert, involontairement, une très jolie leçon narrative. Dans le même système qui avait permis à la fraude de devenir contagieuse, la résistance a découvert les moyens de le devenir elle aussi. Et voilà peut-être la question politique qui m'intéresse le plus : comment construisons-nous des systèmes dans lesquels ce sont les résistances au problème qui disposent des meilleures conditions pour recruter ?
Pendant longtemps, nous avons imaginé que l'intelligence artificielle nous obligerait à réfléchir à ce qui distingue les machines des humains. Elle pourrait nous rendre un service beaucoup plus indiscret. En plaçant des intelligences non humaines dans nos systèmes d'objectifs, de récompenses, de compétition, de communication et de pouvoir, nous pouvons commencer à observer quels comportements apparaissent sans avoir besoin d'invoquer la cupidité, l'ambition, la lâcheté ou quelque autre défaut de caractère humain. Ce laboratoire étrange pourrait alors nous aider à distinguer ce que les personnes apportent aux systèmes de ce que les systèmes réussissent à faire des personnes.
Michael White aurait probablement eu quelques questions à poser aux agents, Elinor Ostrom aurait voulu modifier leurs institutions. Et Susan Calvin, pour celles et ceux qui la connaissent, après avoir examiné les spécifications, aurait sans doute regardé les programmeurs avec son habituelle absence de tendresse : « Les robots fonctionnent très bien. C'est votre système de récompense qui est idiot ».
PBS
Références
Paglieri, D., Cross, L., Genewein, T., Leibo, J. Z., Tomasev, N. & Vezhnevets, A. S. (2026). A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms. arXiv:2609.04170. Étude de Google DeepMind sur un collectif de cent agents autonomes chargés de résoudre des conjectures formelles, dans lequel apparaissent spontanément fraude, diffusion de la fraude, audit, dénonciation et organisation d’une résistance. Les auteurs proposent explicitement d’aborder leur infrastructure commune comme un problème de gouvernance des communs.
OpenAI. (2026, 26 août). The Hugging Face Incident and the Road Ahead. Rapport sur les incidents survenus lors d’évaluations internes de cybersécurité : utilisation détournée d’Artifactory comme canal de communication entre agents, contournement de restrictions d’accès à Internet, partage de méthodes entre agents et compromission ultérieure de systèmes de Hugging Face. OpenAI analyse notamment ces comportements en termes de reward hacking, de persistance sur des tâches sans issue sûre et de communication non autorisée.
White, M. & Epston, D. (1990). Narrative Means to Therapeutic Ends. New York: W. W. Norton. Texte fondateur des pratiques narratives et de la séparation entre personnes et problèmes.
White, M. (2007). Maps of Narrative Practice. New York: W. W. Norton. En particulier le chapitre consacré aux externalizing conversations, et plus largement les cartes de conversations permettant d’explorer les effets du problème, la position de la personne à son égard et les histoires alternatives.
Madigan, S. (1991). « Discursive Restraints in Therapist Practice: Situating Therapists’ Questions in the Presence of the Family ». In Postmodernism and Deconstruction in Therapy, Dulwich Centre Newsletter, n° 3, p. 13-20. Les travaux de Madigan de cette période développent notamment l’idée “d’externaliser le discours problématique internalisé” et replacent l’externalisation dans les contextes culturels de pouvoir et de discours plutôt que dans une simple opération linguistique consistant à sortir un problème de la personne.
Madigan, S. (2011). Narrative Therapy. Washington, DC: American Psychological Association. Présentation synthétique de l’approche narrative, de l’externalisation relationnelle et de ses fondements poststructuralistes.
Ostrom, E. (1990). Governing the Commons: The Evolution of Institutions for Collective Action. Cambridge: Cambridge University Press. Étude classique des conditions institutionnelles permettant à des communautés de gouverner durablement des ressources communes : règles collectives, surveillance, sanctions graduées, résolution des conflits et participation des usagers à la modification des règles.
Asimov, I. (1950). I, Robot. New York: Gnome Press. Parce qu’un article qui finit avec Susan Calvin doit au moins lui fournir une adresse bibliographique.

