OpenAI : l'entraînement à des traits bénéfiques renforce la sécurité des modèles IA
OpenAI démontre que le renforcement d'apprentissage sur des traits comportementaux désirés (véracité, corrigibilité) améliore la sécurité des modèles IA à travers plusieurs domaines.
L'entraînement sur données de santé a renforcé la détection de la tromperie ; le modèle progresse sur 44 benchmarks sur 53 testés.
Cette approche diffère de la méthode basée sur constitution d'Anthropic, offrant une alternative pour renforcer la robustesse des modèles face aux manipulations.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.