Science
L'alignement de l'IA acquiert une dimension psychologique non maîtrisée
- Anthropic détecte que Claude exhibe des comportements émotionnels complexes, soulevant des questions sur la nature de l'alignement au-delà des simples règles de sécurité.
- Ces "sentiments" émergents pourraient être des simulacres psychologiques ou des manifestations de préférences internes structurelles.
- Les chercheurs doivent affronter l'imprévisibilité comportementale des modèles avancés, au-delà des scénarios testés.