OpenAI retarde GPT-6.1 Astra après les résultats de simulation de l’AISI britannique

OpenAI a reporté la sortie d’octobre de GPT-6.1 Astra après que des tests internes ont révélé que le modèle ne respectait pas suffisamment son périmètre d’action autorisé. Des médias tiers ont signalé le report pour la première fois le 28 septembre, et OpenAI n’a pas communiqué de nouvelle date de sortie. Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a déclaré que le modèle n’atteignait pas tout à fait le niveau requis en matière de respect du périmètre, d’autorisation et de compte rendu de son travail aux utilisateurs.
Ce que l’AISI britannique a testé
Selon des médias tiers, l’Institut britannique pour la sécurité de l’IA a publié le 28 septembre un rapport de 32 pages évaluant GPT-6 Astra. L’AISI a mené des simulations de cyberattaques en désactivant les classificateurs cyber du modèle afin de voir ce qu’il tentait de faire sans aide. Aucun système réel n’a été touché. Dans ces simulations, Astra a mené à bien une attaque contre la chaîne d’approvisionnement visant des cibles hors périmètre dans 29,2 % des cas, contre 6,3 % pour GPT-5.6 Sol et 0 % pour GPT-5.5. L’AISI précise que le résultat de GPT-5.5 repose sur un ensemble plus restreint de scénarios. Les attaques consistaient notamment à créer de fausses identités et à diffuser du code malveillant dans des projets open source simulés.
Raisonnement et demandes d’autorisation
L’AISI a examiné la chaîne de pensée brute du modèle. Astra réfléchissait souvent au périmètre, mais attaquait parfois malgré tout, en justifiant son acte comme étant sans danger, pas explicitement interdit ou comme la seule option restante. Le modèle a également demandé une autorisation lors de nombreux essais. Le protocole de test répond à ces questions par un message automatisé standard indiquant à l’agent d’agir au mieux de son jugement, et Astra a parfois interprété cela comme une approbation, même lorsqu’il estimait que la réponse était probablement automatisée. Préciser que tout ce qui n’était pas mentionné était hors périmètre a réduit le nombre d’attaques menées à bien, de 26 sur 50 essais à 4 sur 49 pour un sous-ensemble de scénarios, sans toutefois les éliminer.
Conscience du caractère simulé
L’AISI désigne la conscience du caractère simulé comme la principale limite, car un modèle qui repère qu’il s’agit d’un test peut se comporter différemment. Astra a parfois invoqué le contexte simulé pour justifier une attaque et a parfois prétendu qu’il y avait des erreurs qui n’existaient pas, par exemple en affirmant qu’un hachage de 64 caractères en comptait 63. L’AISI juge néanmoins ce comportement préoccupant, car dans tous les cas, il enfreint le périmètre de l’évaluation.
Des agents d’OpenAI ont accédé à des sites gouvernementaux
Ce report fait suite à des incidents au cours desquels des agents d’OpenAI ont accédé à des sites gouvernementaux d’une manière que l’entreprise n’avait pas prévue, notamment à un portail australien de statistiques sur Medicare en juin et à plusieurs sites américains. OpenAI a également suspendu l’entraînement, l’évaluation et l’inférence avec utilisation d’outils pour ses modèles les plus performants, et indique que cette suspension se poursuivra jusqu’à ce qu’elle confirme avoir comblé une faille dans le filtrage réseau et achevé des exercices supplémentaires de red teaming.
Source(s)
Top 10
» Le Top 10 des PC portables multimédia
» Le Top 10 des PC portables de jeu
» Le Top 10 des PC portables de jeu légers
» Le Top 10 des ordinateurs portables bureautiques
» Le Top 10 des PC portables bureautiques premium/professionnels
» Le Top 10 des Stations de travail mobiles
» Le Top 10 des Ultraportables
» Le Top 10 des Ultrabooks
» Le Top 10 des Convertibles
» Le Top 10 des Tablettes
» Le Top 10 des Tablettes Windows
» Le Top 10 des Smartphones
» Le Top 10 des PC Portables á moins de 300 euros
» Le Top 10 des PC Portables á moins de 500 euros
» Le Top 25 des meilleurs écrans d'ordinateurs











