OpenAI : SWE-bench Verified ne mesure plus les capacités des modèles de codage frontière
OpenAI annonce que le benchmark SWE-bench Verified ne reflète plus adéquatement les performances des modèles de codage de nouvelle génération.
Le benchmark devient insuffisant pour évaluer les avancées récentes en matière de codage automatisé.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.