Pas le temps de lire l'article ? Voici ce qu'il faut retenir.
Anthropic annonce un score historique de 30,2 % pour son modèle Claude Opus 5 sur le test ARC-AGI-3, trois fois supérieur à celui du deuxième meilleur modèle, GPT-5.6 Sol.
1
Triomphe éphémère — Le score de Claude Opus 5 est trois fois supérieur à celui du deuxième meilleur modèle, GPT-5.6 Sol, sur le test ARC-AGI-3.
2
Réglages clés — Deux réglages ont triplé le score de GPT-5.6 Sol sur le test ARC-AGI-3.
3
Test de raisonnement — Le test ARC-AGI-3 est conçu pour mesurer le raisonnement des modèles d'IA en les lançant dans des jeux en 2D qu'ils n'ont jamais vus.
💡
Pourquoi c'est important : Le résultat met en lumière l'importance des réglages et des harnais dans les tests d'IA, affectant les scores et les performances des modèles.