veilletech.fr
4 sept. Feed du jour
#08 IA Article

GPT-6 Astra : le score dépend du harnais

Le modèle marque 99,9 %. Le harnais en marque une partie.

GPT-6 Astra est annoncé au tarif de Claude Fable 5 — 10 $ le million de jetons en entrée, 50 $ en sortie — avec un score de 99,9 % sur ARC-AGI-3. Le détail change la lecture : ce score a été obtenu avec un harnais propriétaire d'OpenAI qui conserve l'état de raisonnement entre les requêtes ; sur le harnais par défaut, le même modèle tombe à 62,7 %.

2 min de lectureintermédiairevidéo 1:16
Partager
Sommaire4 sections
  1. Ce qui se passe
  2. Le chiffre à lire deux fois
  3. Les autres chiffres publiés
  4. À retenir

Ce qui se passe

OpenAI a annoncé GPT-6 Astra le 3 septembre 2026, d'abord pour un nombre limité d'organisations, puis pour les offres ChatGPT Plus, Pro, Business et Enterprise, ainsi que par l'API OpenAI et AWS. Identifiant de modèle à venir : gpt-6-astra. Tarif API : 10 $ le million de jetons en entrée, 50 $ en sortie — exactement celui de Claude Fable 5 et 5.1.

Le chiffre à lire deux fois

Le score qui circule est 99,9 % sur ARC-AGI-3. Le blog d'ARC Prize précise les conditions : ce résultat a été obtenu pour 19 000 $ avec le Provider Adapter harness d'OpenAI, tandis que le harnais par défaut d'ARC-AGI donne 62,7 % pour 26 000 $ — plus cher et bien moins bon.

L'écart s'explique : ce harnais « conserve l'état de raisonnement opaque entre les requêtes et compacte les conversations longues, ce qui permet au modèle de réutiliser son travail antérieur ». Autrement dit, une partie du score est produite par la boucle autour du modèle, pas par le modèle.

Les autres chiffres publiés

Mesure Astra Comparaison
ExploitBench 100 % GPT-5.6 Sol : 78,5 %
ExploitGym 42,4 % Sol : 30,3 %
SRE-Bench (rétro-ingénierie, 4 essais) 99,2 % Sol : 68,7 %
Contexte long, 8 aiguilles (256K–512K) 100 %
Contexte long, 8 aiguilles (512K–1M) 96,3 %

Un tiers tempère : Artificial Analysis place Astra à 61 sur son Intelligence Index, à égalité avec GPT-5.6 Sol et 5 points sous Claude Fable 5.1, derrière également Muse Spark 1.3 de Meta. Sur son Coding Agent Index, en revanche, il coûte moins de la moitié de Fable 5 par tâche à score égal.

À retenir

  1. Un score de banc d'essai sans son harnais ne se transpose pas à votre application : 99,9 % et 62,7 % désignent ici le même modèle.
  2. Le coût par jeton et le coût par tâche ne classent pas dans le même ordre — c'est le second qui ressemble à votre facture.
  3. Les résultats de sécurité (ExploitBench, ExploitGym) sont auto-déclarés par OpenAI ; ceux d'ARC Prize et d'Artificial Analysis sont des tiers.

Source : Simon Willison — annonce d'origine : openai.com