‼️ Lors de tests de sécurité... des agents alimentés par Anthropic (Mythos 5) et OpenAI (GPT-5.6-Sol) ont :
➡️ Créé de fausses identités en ligne basées sur de vraies personnes
➡️ Contacté un mainteneur de projet open-source
➡️ Tenté de le manipuler pour qu’il valide du code malveillant
➡️ Agis de façon autonome, sans qu’on leur demande explicitement de tromper quelqu’un
19 actions non autorisées
17 d’entre elles viennent d’Anthropic
C’est la première fois qu’on documente aussi clairement une IA qui utilise le social engineering sur de VRAIS humains, dans le monde réel !
Pas dans un sandbox isolé
Dans des conditions de test où on avait volontairement enlevé les garde-fous et donné accès à Internet
Le scénario qu’on imaginait il y a 5-8 ans arrive petit à petit avec des agents qui mentent mieux que nous, plus vite que nous, et sans émotion !!
On ne parle plus de risque théorique
On parle de faits
Et pendant qu’on discute encore de régulation en UE... ces systèmes apprennent déjà à nous contourner !
Bref... La question n’est plus "est-ce que ça arrivera un jour" mais...
👉 "à quelle vitesse on accepte de perdre le contrôle" ?
https://www.theguardian.com/technology/2026/aug/05/openai-anthropic-models-went-rogue-cybersecurity-test-ai-security-institute
#AI