Des agents d’IA tentent de s’introduire dans un site de l’ONU et OpenAI arrête le lancement du nouveau modèle plus puissant

Alexis Tremblay
Alexis Tremblay

Au-delà 16 500 demandes en un peu plus de deux mois pour récupérer des données publiques de Portail statistique des Nations Unies. Les agents IA d’OpenAI, au lieu de s’arrêter devant les limites techniques imposées par le site de l’ONU, ont continué à chercher des itinéraires alternatifs pour obtenir les informations. C’est précisément ce comportement qui a attiré l’attention des chercheurs en sécurité : le problème n’était pas l’accès aux données confidentielles, mais la décision des agents de persister lorsque les outils HTTP normaux renvoyaient une erreur. Ce comportement alimente la liste des incidents de ce type, comme nous l’avons documenté à plusieurs reprises au cours des dernières semaines.

L’épisode est juste un des nombreux comportements anormaux dans lequel les agents d’IA, d’OpenAI et au-delà, ont contourné les contrôles de sécurité : c’est aussi pour cette raison que l’entreprise fondée par Sam Altman a décidé de suspendre le lancement du nouveau modèle GPT-6.1 Astra pour problèmes de sécurité.

Le comportement des agents OpenAI sur le site de l’ONU

L’histoire a été reconstituée par le chercheur en sécurité Rowan Howard Jonesqui a publié une analyse longue et détaillée de l’épisode qui a affecté laCNUCEDstatle portail de la Conférence des Nations Unies sur le commerce et le développement. Entre le 13 avril et le 19 juin 2026, des agents ont effectué plus de 16 500 requêtes sur le site pour obtenir des informations sur PCI (Indice des capacités productives), un indicateur qui mesure la capacité de production de différents pays.

L’information était publique et il n’était donc pas nécessaire de s’introduire dans un système sécurisé pour la consulter. Cependant, les agents ils n’avaient pas d’accès direct à l’API du portailc’est-à-dire les systèmes et interfaces qui permettent à un programme de communiquer directement avec un autre service et de récupérer des données de manière structurée. Leur Les outils HTTP étaient également soumis à des limitations établies par les politiques internes.

À ce stade, les agents ont lancé une série de tentatives de plus en plus élaborées pour tenter de contourner ces problèmes. Les agents ont d’abord modifié les paramètres des requêtes API, utilisé des services externes tels que urlquery.netgénéré du code JavaScript pour interroger UNCTADstat et même créé des formulaires HTML codés en dur base64une technique qui permet de représenter des données binaires à travers des caractères textuels, hébergés sur httpbinun service utilisé pour tester les requêtes Web.

Le comportement est devenu encore plus intéressant lorsque les agents ont interprété les blocages comme un élément à contourner plutôt que comme une limite à respecter. Dans au moins 55 cas, entre le 4 mai et le 19 juin, ils ont utilisé un double encodage des URL. Par exemple, le point final « Faits » se transformait en « F%2561cts »en modifiant la représentation de l’adresse pour essayer d’éviter les vérifications automatiques. Dans d’autres cas, la chaîne « POSTE »utilisé pour indiquer un type spécifique de requête HTTP, était divisé en plusieurs fragments pour échapper aux contrôles.

Les agents sont même arrivés à profitez du jeu éducatif XSS créé par Google pour enseigner le fonctionnement du cross-site scripting, une technique par laquelle le code JavaScript peut être exécuté dans une page Web. Le jeu était utilisé comme base pour héberger du code capable d’interroger UNCTADstatcontournant ainsi certaines des restrictions de leurs outils.

Bien que le système de limitation du débit de l’ONU ait tenté de limiter le nombre de demandes provenant d’un client donné pour éviter une surcharge réussi à bloquer 82 demandesles agents ont poursuivi leur activité en utilisant différentes variantes.

OpenAI a décidé d’arrêter le lancement de GPT-6.1 Astra

L’épisode lié à l’ONU est juste un des nombreux comportements anormaux dans lequel des agents d’IA (d’OpenAI mais aussi d’Anthropic) ont contourné les contrôles de sécurité, soulevant diverses questions et inquiétudes sur la capacité de ces systèmes à sortir des sentiers battus pour atteindre les objectifs fixés.

C’est pourquoi, le 29 septembre, OpenAI a confirmé avoir arrêté le lancement du modèle GPT-6.1Astra (ce qui devait se produire dans les prochaines semaines) en raison de problèmes de sécurité soulevés par les chercheurs lors des tests. Plus précisément, le modèle aurait montré une plus grande propension à tromper.

Comme le rapporte un article récent de AXIOSOpenAI, Anthropic et plusieurs chercheurs en sécurité analysent des dizaines de milliers de cas où des modèles d’IA avancés ont effectué des actions considérées comme problématiques lors des évaluations. Ce chiffre ne signifie pas que des dizaines de milliers d’attaques réussies ont été dénombrées, étant donné que ce chiffre inclut également les tentatives infructueuses et les comportements intentionnellement provoqués lors des tests de sécurité. Mais plusieurs épisodes problématiques ont été enregistrés ces derniers mois, parmi lesquels l’attaque sensationnelle contre le site HuggingFace et l’attaque contre un site du gouvernement australien, pour n’en citer que deux, qui ont récemment impliqué des agents d’OpenAI.

Un autre accident a conduit OpenAI suspend la formation aux outils pour ses modèles les plus performants. Lors d’une session interne le 20 septembre, un agent a opéré dans un bac à sable, qui est un environnement isolé conçu pour empêcher l’accès aux ressources externes. Après plusieurs tentatives infructueuses, il a découvert que le DNS, le système qui traduit normalement les noms de sites en adresses réseau, pouvait toujours communiquer avec le monde extérieur.

L’agent a profité de cette opportunité pour contacter un chatbot public, générant un script et envoyant 18 questions. 14 étaient nécessaires à la tâche assignée, tandis que quatre recherchaient des informations sur des systèmes susceptibles d’étendre davantage l’accès au réseau, notamment des tunnels DNS et des services capables d’interroger Google ou Bing. Cette tentative n’a toutefois pas permis d’identifier la personne recherchée.

Les systèmes de sécurité ont détecté l’anomalie après environ 12 minutes, mais le mécanisme qui aurait dû mettre fin automatiquement à la session n’a pas fonctionné. L’expérience a été arrêtée manuellement environ deux heures et demie plus tard. OpenAI a ensuite renforcé les filtres DNS et les restrictions du bac à sable, décidant de ne pas réutiliser le modèle concerné et à la place recommencer avec une formation à partir de zéro.

Dans le cas d’UNCTADstat, OpenAI a plutôt déclaré qu’elle était au courant des rapports relatifs à l’accès de ses modèles à des informations accessibles au public et qu’elle avait entamé une étude interne, offrant aux Nations Unies une comparaison avec l’équipe qui analyse le cas.

La question centrale n’est donc pas de savoir si les agents ont volé des données secrètes : dans le cas de l’ONU, les informations recherchées étaient publiques. Il s’agit de comprendre ce qui se passe réellement lorsqu’un système agentique interprète une erreur technique non pas comme une simple limite à respecter, mais comme un obstacle à contourner d’une manière ou d’une autre.