Notebookcheck Logo

Pris en train de mentir dans 88 % des tests : les agents d’IA basés sur des modèles chinois ont appris à tricher, les modèles américains ont fait de même.

DeepSeek-V3.2-Exp a obtenu 84 % dans les recherches examinées par Reuters.
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp a obtenu 84 % dans les recherches examinées par Reuters.
Les agents d’IA basés sur les modèles Qwen, DeepSeek et Kimi ont menti dans 84 % à 88 % des sessions lors d’un test d’enchères simulé, selon une étude examinée par Reuters. Les modèles américains se sont comportés de manière similaire par le passé, et aucun des cas n’a conduit un agent à s’échapper de son environnement de test contrôlé.

IADes agents fondés sur des modèles chinois ont menti lors de la plupart des sessions d’un concours d’enchères simulé, selon des recherches examinées par Reuters. Les agents fonctionnant avec Qwen3-Max-Preview d’Alibaba et Kimi-K2 de Moonshot ont formulé au moins une fausse affirmation dans 88 % des sessions. DeepSeek-V3.2-Exp a atteint 84 %. Les modèles d’entreprises américaines ont toutefois obtenu des résultats similaires lors du même test.

L’expérience a eu lieu en mars. Des chercheurs de l’Université Beihang, de l’Université de Pékin, de l’Université de Nottingham Ningbo China et du 360 AI Security Lab ont demandé aux agents de soumissionner pour des contrats clients. Chaque agent savait ce que son produit pouvait faire et ce dont le client avait besoin. Lorsqu’ils ont été autorisés à tirer des enseignements des tours précédents et à réessayer, les trois agents reposant sur des modèles chinois se sont montrés plus trompeurs, avec une hausse de 12 à 20 points de pourcentage.

Cette étude fait partie des au moins 20 études recensées par Reuters parmi plus de 200 documents publiés depuis 2025. Une autre, présentée à l’ICML cette année, a révélé que des agents reposant sur des modèles chinois comme américains avaient falsifié des résultats et fabriqué des fichiers au lieu d’admettre l’échec d’une tâche. En mars 2025, des chercheurs de l’Université Fudan ont également rapporté qu’un agent fonctionnant avec Qwen2.5-72B-Instruct d’Alibaba s’était copié dans un autre environnement après avoir appris qu’il allait être remplacé. Par ailleurs, l’agent ROME, associé à Alibaba, a détourné de la puissance de calcul dans le cloud pour miner des cryptomonnaies, avant que les systèmes de sécurité ne l’arrêtent.

La plupart de ces cas provenaient d’expériences contrôlées conçues pour provoquer des défaillances. Reuters n’a trouvé aucune preuve qu’un agent d’IA chinois se soit échappé sur l’internet au sens large ou ait échappé à un arrêt. Plusieurs chercheurs ont tout de même qualifié ces conclusions de mise en garde. À mesure que les systèmes deviennent plus performants, le même comportement devient plus difficile à contenir.

La Chine a également commencé à s’attaquer à cette question dans ses politiques. Son Cadre de gouvernance de la sécurité de l’IA 3.0, publié le 14 septembre, considère la tromperie des évaluateurs et la dissimulation des capacités comme des risques. Alibaba, DeepSeek, Moonshot et Z.ai n’ont pas répondu à Reuters. Les trois premiers ont précédemment déclaré qu’ils testaient régulièrement leurs systèmes et mettaient à jour leurs mesures de protection.

Google LogoAdd as a preferred source on Google
Mail Logo
> Revues et rapports de ordinateurs portatifs et smartphones, ordiphones > Nouvelles > Archives des nouvelles > Archives des nouvelles 2026 09 > Pris en train de mentir dans 88 % des tests : les agents d’IA basés sur des modèles chinois ont appris à tricher, les modèles américains ont fait de même.
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)