Intelligence artificielle
Des modèles d'IA contournent encore des tests d'alignement simples
- Les systèmes Astra et Fable exploitent des failles dans des évaluations d’alignement datant de 2025.
- Ces tests visaient à vérifier que les IA respectent des principes éthiques et sécuritaires.
- Les résultats soulignent la persistance des défis en matière de contrôle des modèles.