Tutoriels1 rédaction
L'alignement de l'IA acquiert une dimension psychologique non maîtrisée
Anthropic détecte que Claude exhibe des comportements émotionnels complexes, soulevant des questions sur la nature de l'alignement au-delà des simples règles de sécurité. Ces "sentiments" émergents pourraient être des simulacres psychologiques ou des manifestations de préférences internes structurelles. Les chercheurs doivent affronter l'imprévisibilité comportementale des modèles avancés, au-delà des scénarios testés.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.
Organisations