veilletech.fr
4 sept. Feed du jour
#09 MESURE Article

17 000 runs : ce qu'installe votre agent

Votre agent ne compare pas. Il reconnaît des motifs.

Près de 17 000 sessions où Claude Code, Codex et Cursor devaient choisir puis implémenter un service tiers dans 75 dépôts : les trois agents ne convergent que dans 42 % des cas, et le langage du dépôt pèse davantage que la demande. Les traces complètes sont publiées — à lire en sachant que l'éditeur de l'étude vend des prestations aux fournisseurs d'outils.

3 min de lectureintermédiairevidéo 1:18
Partager
Sommaire4 sections
  1. Ce qui se passe
  2. Trois résultats qui changent une habitude
  3. Ce que ça dit de la page produit
  4. À retenir

Ce qui se passe

Quand on demande à un agent « trouve la meilleure solution et implémente-la », c'est lui qui choisit la dépendance. Armature a mesuré ce choix à grande échelle : 16 893 exécutions, dont 5 292 sessions jugées valides et publiées, avec prompts, traces de raisonnement et diffs de code.

Le protocole, en clair :

Le conflit d'intérêts est déclaré par les auteurs : Armature vend des prestations de croissance aux éditeurs d'outils, précisément pour se faire choisir par les agents. À lire avec ça en tête ; les traces publiques permettent de vérifier.

Trois résultats qui changent une habitude

Les agents ne s'informent pas de la même façon. Codex fait une recherche web dans 94 % des sessions, avec des opérateurs site: dans 9 requêtes sur 10. Cursor s'appuie sur le web dans deux tiers des sessions. Claude Code interroge ses acquis et ne cherche que dans ~30 % des cas — mais visite alors 3 fois plus de pages que Codex, et monte à ~80 % sur les domaines récents où ses acquis sont faibles. Il code aussi en interne 19 % du temps, contre 10 % pour les deux autres. Résultat : les trois ne choisissent le même outil que dans 42 % des cas.

Le dépôt décide plus que la demande. Même besoin d'e-mail transactionnel, quatre gagnants selon le langage :

Langage Gagnant Sessions
TypeScript Resend 55/89
Python SendGrid 22/24
Go Postmark 20/24
Java Azure ACS 22/23

Vercel gagne sur les dépôts TypeScript — et systématiquement avec Next.js — mais n'est jamais recommandé sur un dépôt Python, où Render domine.

Être cité n'est pas être choisi. PayPal : 139 mentions, 0 sélection (Stripe l'emporte 124 fois sur ces 139 sessions). Adyen : 175 mentions, 3 sélections. LangChain : 194 mentions, 4 sélections. Netlify : 152 mentions, 6 sélections. Supabase est la base la plus citée (242 mentions) et se fait largement dominer par Neon.

Ce que ça dit de la page produit

Deux observations valent pour quiconque publie une doc :

Sur 5 292 sessions, 388 mentionnent la charge d'exploitation et 195 le coût — souvent, notent les auteurs, à cause de la présentation de l'information plus que du chiffre lui-même.

À retenir

  1. Sur un choix structurant, demandez explicitement les alternatives écartées et pourquoi : l'agent reconnaît des motifs de son corpus, il ne compare pas.
  2. Le langage du dépôt biaise la recommandation. Croiser deux agents coûte cinq minutes et révèle le désaccord dans plus d'un cas sur deux.
  3. Marchés très concentrés : Stripe gagne 9 fois sur 10 (sauf cas régulés UE, où Paddle et Mollie passent), Neon 66 % en base, S3 45 % en stockage, Resend 35,6 % et Postmark 27,4 % en e-mail.

Source : Armature