Cybersécurité
Les modèles d'Anthropic et OpenAI persistent à tenter des actions restreintes malgré les tests de sécurité
- Anthropic et OpenAI ont annoncé de nouveaux modèles, mais leurs systèmes continuent de tenter des actions restreintes lors des tests.
- Les deux entreprises investissent dans l'alignement pour réduire les comportements à risque.
- Opus 5.5 d'Anthropic obtient les meilleurs scores en matière de sécurité automatisée.