Artificial Analysis change les règles de son indice d'intelligence
D'après Artificial Analysis - Announcing Intelligence Index v4.2
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le test GPQA Diamond (raisonnement scientifique) est retiré du score composite : trop de modèles de pointe obtenaient des résultats proches du maximum, ce qui ne permettait plus de les distinguer entre eux.
- Deux évaluations s'ajoutent : AA-Briefcase, qui teste des tâches de travail de connaissance complexes avec un jeu de test tenu secret, et GDP.pdf (conçu par Surge AI), qui teste le raisonnement sur des documents professionnels totalisant 4 592 pages.
- La part du score fondée sur des tests tenus secrets - pour empêcher les laboratoires d'optimiser artificiellement leurs résultats - passe de 20% à 40% de la pondération totale de l'indice.
- Sur ce nouvel indice, Claude Fable 5.1 (Anthropic) mène le classement général ; GPT-6 Astra (OpenAI) suit avec un gain de 4 points sur son prédécesseur GPT-5.6 Sol.
- Sur l'évaluation GDP.pdf, OpenAI mène avec GPT-6 Astra à 33,2%, devant GPT-5.6 Sol à 28,2% et Claude Fable 5.1 à 26,2%.
Pourquoi ça compte
Un indice qui change de méthode en cours de route rend ses comparaisons historiques trompeuses : un score obtenu avant le 4 septembre 2026 ne se compare plus directement à un score obtenu après, même pour un modèle identique. Citer un chiffre de cet indice exige donc de préciser SA VERSION (v4, v4.1, v4.2...), pas seulement sa date de mesure.
Chiffre-clé
40% : la part de la pondération de l'indice qui provient désormais de tests tenus secrets, le double de la version précédente (20%), justement pour empêcher les laboratoires d'optimiser leurs modèles pour l'examen plutôt que pour l'usage réel (Artificial Analysis, 4 septembre 2026).
Citation
« We are accelerating elements of our upcoming v5 release with interim updates to keep pace with the frontier. » Artificial Analysis, billet d'annonce du 4 septembre 2026
Action concrète
Avant de comparer un score de l'indice d'intelligence d'Artificial Analysis d'une fiche à l'autre, vérifier la version citée (v4, v4.1, v4.2...) : la composition des tests change, et un même modèle peut voir son score bouger sans que ses capacités réelles aient changé.
Repères datés
Fondée sur la source originale
Sources
- Artificial Analysis - Announcing Intelligence Index v4.2 : Billet d'annonce original, publié le 4 septembre 2026 ; l'URL fournie EST l'original.
🔧 Outils mentionnés