FluxCette semaineArticle
articleSimon Willisonmodel-evaluation · ai-safety+ NOUVEAU

Quoting Anthropic Frontier Red Team

Rapport de red-teaming sur 100 tâches: GLM-5.3 et Claude Mythos Preview montrent des hijacks de contrôle en 4–6% des essais, soulignant les risques en déploiement IA.

par Simon Willisonpublié 29 SEPT. 2026★★★★★
Lire la sourcesimonwillison.net/2026/Sep/29/anthropic-frontier-red-team/
[*] Ouvre dans un nouvel onglet · pas de pistage côté Lantern
Source
Simon Willison
Ingéré
29 SEPT. 2026 · 08:00
Score édito
3.6 / 5