Benchmark MirrorCode : un modèle IA coûte 2 600 $ pour recréer un programme en 19 jours
Le benchmark MirrorCode d'Epoch AI évalue la capacité des modèles à recréer des programmes sans accès au code original, avec Claude Opus 4.7 en tête (56 % de réussite).
Un modèle a tourné en continu 19 jours pour résoudre une tâche complexe, générant un coût de 2 600 $, tandis que les modèles échouent encore sur les cas les plus difficiles.
Claude Opus 4.7 a reconstruit un outil de 16 000 lignes en 14 heures, illustrant les progrès et limites actuelles des LLM en génération de code.
1 rédaction rapporte ce fait
Factae établit le fait ; chaque récit est à un clic, chez sa rédaction.