Claude Opus 5 domine le benchmark ARC-AGI-3
Claude Opus 5 d'Anthropic établit un record sur le benchmark ARC-AGI-3 avec 30,2%, loin devant GPT-5.6 Sol (7,8%). Le modèle a résolu 5 environnements inédits, dont 4 au niveau humain, grâce à un raisonnement logique supérieur.