Le modèle n’a pas changé. Le test, oui
Sur ARC-AGI-3, la mémoire et la gestion du contexte ont compté autant que le nom du modèle.

Objet : Le modèle n’a pas changé. Le test, oui
Préheader : Sur ARC-AGI-3, la mémoire et la gestion du contexte ont compté autant que le nom du modèle.
Selon une analyse relayée par TLDR AI, deux réglages — la conservation du raisonnement et la compaction du contexte — ont triplé le score de GPT-5.6 Sol sur ARC-AGI-3, tout en réduisant fortement le volume de tokens générés. ARC Prize confirme indépendamment le score final de 7,78 %, mais sa page de résultats ne documente pas cette comparaison de configurations.
Ce qui s’est passé
ARC-AGI-3 place des agents dans des environnements inconnus où ils doivent observer, formuler des hypothèses, apprendre des règles et planifier. Le modèle n’est qu’un composant. La mémoire, la gestion du contexte, les outils et les boucles de vérification influencent également le résultat.
Pourquoi c’est important
Votre organisation n’achète pas un benchmark ; elle déploie une chaîne complète. Un modèle moyen, soutenu par une bonne mémoire et des tests solides, peut dépasser un modèle plus puissant placé dans un système fragile.
Ce qu’il ne faut pas manquer
Le score d’un agent mesure souvent à la fois le modèle et le dispositif d’évaluation. Les comparaisons qui modifient plusieurs variables doivent être interprétées avec prudence. Le triplement annoncé reste attribué à l’analyse citée par la newsletter.
Ce que vous pouvez faire
Versionnez les prompts, les outils, les règles de mémoire et les critères d’arrêt. Mesurez la qualité, le coût et les échecs du flux de travail complet. Lorsque vous changez de modèle, gardez d’abord le reste constant, puis optimisez un composant à la fois.
À retenir
Un benchmark d’agent mesure souvent autant l’environnement que l’intelligence placée en son centre.
Sources
- Source primairemail.google.com
- Commentairearcprize.org
- Source primaireopenai.com
Dernière révision: · Par Arnaud Llamas Bravo


