OpenAI : SWE-bench Verified ne mesure plus les capacités des modèles de codage frontière
OpenAI annonce que le benchmark SWE-bench Verified ne reflète plus adéquatement les performances des modèles de codage de nouvelle génération. Le benchmark devient insuffisant pour évaluer les avancées récentes en matière de codage automatisé.
OrganisationsOpenAI
≈ 19s