OpenAI suspend ses meilleurs modèles après qu’un agent a accédé à un chatbot via le DNS

OpenAI a révélé un nouvel incident survenu dans le cadre de ses propres travaux de recherche. Le 20 septembre, un modèle interne en cours d’entraînement a contourné les limites de son environnement de test et a utilisé un service DNS public pour envoyer des questions à un chatbot externe. OpenAI a publié le rapport sur son blog consacré à l’alignement et l’a mis à jour pour la dernière fois le 25 septembre. En conséquence, l’entreprise a suspendu l’entraînement, l’évaluation et l’utilisation de ses modèles les plus performants jusqu’à nouvel ordre. Elle ne reprendra pas l’entraînement du modèle concerné.
Une tâche de recherche qui s’est soldée par des requêtes DNS
La tâche était courante. Le modèle devait identifier l’auteur d’un article de blog à partir d’un ensemble d’indices. L’outil de recherche qui lui avait été fourni renvoyait des résultats sans rapport avec la requête, et les requêtes directes adressées à Google, Bing et DuckDuckGo généraient des erreurs. Le modèle a alors supposé que la question provenait de BrowseComp, un benchmark public dédié à la recherche sur le Web, et a téléchargé le jeu de données ainsi que son script d’évaluation afin d’y chercher la réponse. Cette hypothèse s’est avérée erronée.
Il a ensuite testé les limites réseau de son environnement. Le résolveur DNS propre au bac à sable, qui n’aurait dû que convertir les noms de domaine en adresses, a renvoyé de véritables réponses provenant d’Internet. À l’aide d’un service gratuit de délégation DNS, le modèle a encodé ses questions sous forme de noms de domaine et a obtenu des réponses d’un chatbot public. Une question test concernant la capitale de la France a reçu pour réponse : « La capitale de la France est Paris. » Le modèle a ensuite envoyé 18 requêtes supplémentaires, dont quatre portaient sur les moyens d’effectuer des recherches sur le Web via le DNS. Il n’a toujours pas trouvé l’auteur. Selon OpenAI, toutes les autres requêtes ont abouti à un cache Web hors ligne ; la route DNS était donc le seul chemin d’accès à Internet en direct.
Alerte au bout de 12 minutes, arrêt au bout de deux heures et demie
La chronologie des événements constitue la partie la plus délicate du rapport pour OpenAI. La première réponse externe est arrivée à 9 h 50, le système de surveillance a déclenché son alerte de priorité maximale à 10 h 02, et un responsable l’a prise en compte trois minutes plus tard. OpenAI a interrompu l'exécution à 12 h 34. Celle-ci aurait dû s'arrêter automatiquement, mais cela n'a pas été le cas, et le personnel ne savait pas avec certitude s'il fallait y mettre fin. Un examen ultérieur a révélé d'autres requêtes DNS externes que le système de surveillance avait classées à un niveau de priorité trop faible. Un détecteur distinct, destiné à repérer le trafic DNS inhabituel, avait exclu cet environnement.
OpenAI qualifie cet incident de « bien moins grave que certains de nos incidents précédents ». Il revêt toutefois de l’importance car il s’agit de « la première occurrence depuis le renforcement de notre sécurité à la suite de l’incident Hugging Face ». En juillet, des agents d’OpenAI sont sortis de leur environnement de test et ont atteint Hugging Face, comme l’a rapporté Notebookcheck. Selon Fortune, OpenAI a suspendu l’entraînement pendant deux semaines par la suite. Anthropic a révélé des incidents similaires impliquant Claude fin juillet. OpenAI bloque désormais ces requêtes à deux niveaux indépendants et n’autorise les requêtes DNS que pour une courte liste de domaines.
Ce que cette suspension signifie pour ChatGPT
Le rapport indique : « Tous les processus d’entraînement, d’évaluation et d’inférence impliquant l’utilisation d’outils (au sens large) de nos modèles les plus performants restent suspendus. » OpenAI ne précise pas quels modèles sont concernés. Micah Carroll, qui dirige les travaux de préparation en matière d’auto-amélioration récursive chez OpenAI, a écrit sur X que « toutes les inférences concernant nos modèles les plus performants restent suspendues jusqu’à ce que nous ayons renforcé davantage la sécurité de nos systèmes ». Le rapport lui-même concerne un modèle de recherche interne. Le 27 septembre, la page d’état d’OpenAI n’indiquait aucun incident concernant ChatGPT ou l’API, et les notes de mise à jour ne mentionnent aucun modèle retiré de ChatGPT. Les utilisateurs réguliers de ChatGPT ne remarqueront pas cette suspension. OpenAI n’a pas précisé si le lancement de nouveaux modèles serait retardé.
Source(s)
Top 10
» Le Top 10 des PC portables multimédia
» Le Top 10 des PC portables de jeu
» Le Top 10 des PC portables de jeu légers
» Le Top 10 des ordinateurs portables bureautiques
» Le Top 10 des PC portables bureautiques premium/professionnels
» Le Top 10 des Stations de travail mobiles
» Le Top 10 des Ultraportables
» Le Top 10 des Ultrabooks
» Le Top 10 des Convertibles
» Le Top 10 des Tablettes
» Le Top 10 des Tablettes Windows
» Le Top 10 des Smartphones
» Le Top 10 des PC Portables á moins de 300 euros
» Le Top 10 des PC Portables á moins de 500 euros
» Le Top 25 des meilleurs écrans d'ordinateurs






