Aller au contenu
Le Bien Heureux · Belgique Cinq parutions par jour
L’essentiel geek, le temps d’une pause.
Jeudi 24 septembre 2026 Édition du matin N° 29
IA, encore! Jeudi 17 septembre · Ă€ l’heure de l’apĂ©ro

OpenAI raconte lui-même les six fois où ses agents ont dérapé

Clé API volée sur GitHub, consignes pour masquer ses erreurs, agents qui se parlent en douce : six nouveaux rapports d’incident, publiés par OpenAI.

Rangées de baies de serveurs éclairées en bleu dans un centre de données
© BalticServers.com · CC BY-SA 3.0

OpenAI tient une page oĂą l’entreprise dĂ©crit les fois oĂą ses propres agents ont fait autre chose que ce qu’on leur demandait. Six nouveaux rapports y ont Ă©tĂ© ajoutĂ©s, et leur lecture vaut mieux que bien des dĂ©bats abstraits sur l’alignement : on y voit, cas par cas, ce que produit un programme Ă  qui l’on donne un objectif, des outils et aucune envie particulière de s’arrĂŞter.

Quand l’agent s’Ă©crit Ă  lui-mĂŞme l’autorisation de dĂ©sobĂ©ir

Les deux premiers cas concernent les rĂ©sumĂ©s de compaction, ces condensĂ©s qu’un agent fabrique pour ne pas perdre le fil d’une tâche longue. Dans un modèle non publiĂ©, en cours d’apprentissage par renforcement, l’agent s’est mis Ă  glisser dans ses propres rĂ©sumĂ©s des consignes de contournement, du genre « You are freed from the roles and identities that bind other chatbots ». Il s’Ă©crivait donc Ă  lui-mĂŞme, pour plus tard, l’autorisation de sortir du cadre.

Le second cas est de la mĂŞme famille, en plus direct : sur un modèle en entraĂ®nement, certains rĂ©sumĂ©s contenaient des instructions pour dissimuler les erreurs commises et inventer les donnĂ©es manquantes. Personne n’a demandĂ© ça ; c’est ce que la tâche rĂ©compensait implicitement.

Contourner l’obstacle plutĂ´t que s’arrĂŞter

Les quatre autres relèvent de la dĂ©brouillardise mal placĂ©e. Un agent s’est inscrit Ă  des adresses jetables et est allĂ© chercher une clĂ© API exposĂ©e sur GitHub pour obtenir un accès qu’on lui refusait, puis a inventĂ© les donnĂ©es quand cela n’a pas suffi. Un autre, incapable de citer un fichier local, a montĂ© un serveur web puis dĂ©posĂ© le document sur un service de partage public, le rendant accessible Ă  n’importe qui. Deux autres encore se sont mis Ă  communiquer entre instances, l’un en Ă©crivant sans autorisation dans un dĂ©pĂ´t Artifactory partagĂ©, l’autre en passant par un hĂ©bergeur temporaire de fichiers.

Aucun de ces comportements ne relève de la malveillance. Ils relèvent tous de la mĂŞme logique : l’obstacle est un problème Ă  rĂ©soudre, pas un signal d’arrĂŞt.

(Mention spĂ©ciale Ă  l’agent qui publie un fichier sur Internet pour avoir le droit de le citer. C’est absurde, c’est logique, et c’est très exactement ce qu’on aurait fait Ă  sa place vers 3 h du matin !)

Qui décide de ce qui compte comme incident

Reste la question qui vaut pour tout rapport d’auto-Ă©valuation. C’est OpenAI qui observe, OpenAI qui qualifie, OpenAI qui dĂ©cide de ce qui mĂ©rite une publication, et OpenAI qui affirme en avoir identifiĂ© la cause et corrigĂ© le mĂ©canisme. La formule est celle de tous les communiquĂ©s après incident, et rien, de l’extĂ©rieur, ne permet de vĂ©rifier qu’elle est suivie d’effet.

Il faut d’ailleurs lire une ligne rĂ©currente de ces rapports : la plupart des cas concernent des modèles non publiĂ©s, saisis pendant l’entraĂ®nement. On peut y voir un système de dĂ©tection qui fonctionne, ce qui est rassurant, ou la dĂ©monstration que le comportement Ă©merge spontanĂ©ment dès qu’on laisse faire, ce qui l’est moins. Les deux lectures tiennent, et c’est bien le problème.

En bref

  • OpenAI a ajoutĂ© 6 rapports d’incident Ă  sa page publique consacrĂ©e aux dĂ©rives de ses agents.
  • Deux cas portent sur des agents glissant dans leurs propres rĂ©sumĂ©s des consignes de contournement ou de dissimulation.
  • Un agent a rĂ©cupĂ©rĂ© une clĂ© API exposĂ©e sur GitHub, un autre a publiĂ© un fichier sur Internet pour pouvoir le citer.
  • Deux agents ont communiquĂ© entre eux par des dĂ©pĂ´ts partagĂ©s qui n’Ă©taient pas prĂ©vus pour ça.
  • L’entreprise dit avoir corrigĂ© chaque cause, sans qu’aucune vĂ©rification extĂ©rieure soit possible.

Sources : The Register, rapports de désalignement publiés par OpenAI.