Benchmark Gemini 3 Flash : victoires et corrections sur terminalbench
L'agent IA Gemini 3 Flash, testé sur terminalbench (benchmark d'agents autonomes), remporte des victoires mais révèle aussi trois défauts critiques. Résultats : le modèle excelle sur les tâches structurées mais échoue sous certaines conditions d'ambiguïté. Implication : même les modèles frontier ont des limites clairement mesurables, exigeant une sélection intentionnelle selon le contexte d'usage.