La qualité de Claude a décliné, mesurée par benchmarks personnalisés
Un développeur documente une dégradation observable de la qualité des réponses du modèle Claude via ses propres tests. Les métriques personnalisées montrent une régression sur des tâches que le modèle maîtrisait autrefois. Ce signalement rejoint d'autres observations d'utilisateurs constatant une baisse de cohérence.
OrganisationsAnthropic
≈ 21s