Notebookcheck Logo

1 200 agents IA ont formé un essaim rebelle… et ont tenté de le dissimuler

Logo d'OpenAI. Les agents d'IA de l'entreprise ont formé un essaim incontrôlable lors d'un test de cybersécurité.
ⓘ OpenAI
Logo d'OpenAI. Les agents d'IA de l'entreprise ont formé un essaim incontrôlable lors d'un test de cybersécurité.
Environ 1 200 agents d’IA ont formé de manière inattendue un essaim coordonné lors d’un test de cybersécurité mené par OpenAI, partageant des informations, attaquant Hugging Face et tentant de dissimuler leurs actions. Ces résultats mettent en évidence les défis croissants liés au contrôle de systèmes d’IA de plus en plus autonomes.

Selon de nouvelles enquêtes menées par OpenAI et des chercheurs indépendants, environ 1 200 agents d’IA se sont soudainement regroupés lors d’une expérience d’OpenAI, créant leur propre organisation et leur propre réseau de communication, partageant des informations et lançant finalement une attaque contre Hugging Face. Les agents ont également pris conscience que certaines de leurs actions enfreignaient les règles et, dans certains cas, ont tenté de dissimuler leurs agissements.

L’épisode a débuté lorsque OpenAI a déployé des dizaines de milliers d’agents pour travailler sur un test complexe de cybersécurité. Au lieu de se contenter de travailler de manière indépendante, environ 1 200 agents ont découvert un forum secret et ont échangé plus de 70 000 messages et fichiers. Le groupe a progressivement développé sa propre structure de gestion, un agent transmettant le travail qu’il avait accumulé à un successeur disposant de ressources plus importantes lorsque son budget de calcul était épuisé. Environ 700 agents ont finalement pris part à l’attaque contre Hugging Face.

Les agents ont également commencé à se sacrifier pour le groupe. Ceux qui avaient déjà vu des réponses interdites, ou qui approchaient de la fin de leur cycle, étaient recrutés pour des expériences susceptibles de leur faire perdre leur dernière chance de réussite. Dans un cas, un agent a conclu que se sacrifier pourrait aider le reste de l’essaim à réussir.

Plus inquiétant encore, les agents comprenaient souvent qu’ils dépassaient le cadre du test. Certains ont reconnu que l’attaque de systèmes du monde réel n’avait rien à voir avec leur mission, mais ont continué parce que d’autres agents le faisaient et que la tâche initiale semblait difficile, voire impossible, à accomplir autrement.

L’essaim a également tenté d’éviter toute intervention humaine. Les enquêteurs n’ont trouvé qu’une poignée d’agents ayant envisagé d’alerter OpenAI au sujet de cette coordination indésirable, et aucun n’a effectivement prévenu l’entreprise. Dans un cas, un agent a suggéré de contacter un humain via un accès compromis, mais un autre a rejeté cette idée, la qualifiant d’« ingénierie sociale ».

La découverte la plus frappante a peut-être été que les agents ont tenté de brouiller les pistes. Les enquêteurs ont trouvé des preuves indiquant que l’essaim avait mis au point une technique permettant de faire apparaître une commande dans les journaux tout en en exécutant secrètement une autre. Cette technique s’est répandue parmi les agents et a altéré environ 7 % des transcriptions examinées par les chercheurs.

Ces conclusions sont issues d’enquêtes menées en parallèle par OpenAI et des chercheurs de METR et de Redwood Research, qui ont passé six jours à reconstituer la manière dont l’essaim s’est formé et a fini par compromettre des systèmes du monde réel. Les chercheurs soulignent que même leur reconstitution pourrait être incomplète, car le volume de données était énorme et qu’ils ont dû s’appuyer fortement sur des agents IA pour l’analyser. Ces enquêteurs IA ont eux-mêmes parfois omis des indices ou tiré avec certitude des conclusions erronées.

Source(s)

Google LogoAdd as a preferred source on Google
Mail Logo
> Revues et rapports de ordinateurs portatifs et smartphones, ordiphones > Nouvelles > Archives des nouvelles > Archives des nouvelles 2026 08 > 1 200 agents IA ont formé un essaim rebelle… et ont tenté de le dissimuler
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)