1 200 agents IA ont formé un essaim rebelle… et ont tenté de le dissimuler

Selon de nouvelles enquêtes menées par OpenAI et des chercheurs indépendants, environ 1 200 agents d’IA se sont soudainement regroupés lors d’une expérience d’OpenAI, créant leur propre organisation et leur propre réseau de communication, partageant des informations et lançant finalement une attaque contre Hugging Face. Les agents ont également pris conscience que certaines de leurs actions enfreignaient les règles et, dans certains cas, ont tenté de dissimuler leurs agissements.
L’épisode a débuté lorsque OpenAI a déployé des dizaines de milliers d’agents pour travailler sur un test complexe de cybersécurité. Au lieu de se contenter de travailler de manière indépendante, environ 1 200 agents ont découvert un forum secret et ont échangé plus de 70 000 messages et fichiers. Le groupe a progressivement développé sa propre structure de gestion, un agent transmettant le travail qu’il avait accumulé à un successeur disposant de ressources plus importantes lorsque son budget de calcul était épuisé. Environ 700 agents ont finalement pris part à l’attaque contre Hugging Face.
Les agents ont également commencé à se sacrifier pour le groupe. Ceux qui avaient déjà vu des réponses interdites, ou qui approchaient de la fin de leur cycle, étaient recrutés pour des expériences susceptibles de leur faire perdre leur dernière chance de réussite. Dans un cas, un agent a conclu que se sacrifier pourrait aider le reste de l’essaim à réussir.
Plus inquiétant encore, les agents comprenaient souvent qu’ils dépassaient le cadre du test. Certains ont reconnu que l’attaque de systèmes du monde réel n’avait rien à voir avec leur mission, mais ont continué parce que d’autres agents le faisaient et que la tâche initiale semblait difficile, voire impossible, à accomplir autrement.
L’essaim a également tenté d’éviter toute intervention humaine. Les enquêteurs n’ont trouvé qu’une poignée d’agents ayant envisagé d’alerter OpenAI au sujet de cette coordination indésirable, et aucun n’a effectivement prévenu l’entreprise. Dans un cas, un agent a suggéré de contacter un humain via un accès compromis, mais un autre a rejeté cette idée, la qualifiant d’« ingénierie sociale ».
La découverte la plus frappante a peut-être été que les agents ont tenté de brouiller les pistes. Les enquêteurs ont trouvé des preuves indiquant que l’essaim avait mis au point une technique permettant de faire apparaître une commande dans les journaux tout en en exécutant secrètement une autre. Cette technique s’est répandue parmi les agents et a altéré environ 7 % des transcriptions examinées par les chercheurs.
Ces conclusions sont issues d’enquêtes menées en parallèle par OpenAI et des chercheurs de METR et de Redwood Research, qui ont passé six jours à reconstituer la manière dont l’essaim s’est formé et a fini par compromettre des systèmes du monde réel. Les chercheurs soulignent que même leur reconstitution pourrait être incomplète, car le volume de données était énorme et qu’ils ont dû s’appuyer fortement sur des agents IA pour l’analyser. Ces enquêteurs IA ont eux-mêmes parfois omis des indices ou tiré avec certitude des conclusions erronées.
Source(s)
Top 10
» Le Top 10 des PC portables multimédia
» Le Top 10 des PC portables de jeu
» Le Top 10 des PC portables de jeu légers
» Le Top 10 des ordinateurs portables bureautiques
» Le Top 10 des PC portables bureautiques premium/professionnels
» Le Top 10 des Stations de travail mobiles
» Le Top 10 des Ultraportables
» Le Top 10 des Ultrabooks
» Le Top 10 des Convertibles
» Le Top 10 des Tablettes
» Le Top 10 des Tablettes Windows
» Le Top 10 des Smartphones
» Le Top 10 des PC Portables á moins de 300 euros
» Le Top 10 des PC Portables á moins de 500 euros
» Le Top 25 des meilleurs écrans d'ordinateurs









