CRUX : évaluer les capacités des IA de frontier sur des tâches complexes
Lancement de CRUX, un cadre d'évaluation conçu pour mesurer les capacités des modèles IA avancés sur des tâches longues et non structurées
Approche « open-world » qui simule des environnements réalistes plutôt que des benchmarks isolés, pour évaluer la robustesse et l'adaptabilité
Vise à combler l'écart entre les évaluations académiques et les performances réelles des systèmes IA en conditions operationnelles
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.