veilletech.fr
23 août Feed du jour
#03 IA Article

Le harnais des agents fond dans le modèle

Écrivez votre échafaudage en sachant qu'il est temporaire.

Une analyse de Latent Space explique le basculement de fin 2025 par le croisement de deux courbes : celle des modèles et celle du harnais qui les entoure. Sa thèse est que les modèles absorbent progressivement ce harnais dans leurs poids, ce qui rend jetable une grande partie de l'échafaudage que les équipes écrivent aujourd'hui.

4 min de lecturevidéo 1:11
Partager
Sommaire7 sections
  1. Ce qui se passe
  2. Ce qu'est un harnais
  3. Les quatre étapes
  4. Le cycle : entraîner, absorber, élaguer
  5. Ce que ça change pour votre outillage
  6. La thèse finale
  7. À retenir

Ce qui se passe

Vers Noël 2025, les ingénieurs travaillant sur les agents ont constaté la même chose : ça s'était mis à marcher. Personne n'a su dire précisément pourquoi, y compris Lukasz Kaiser, l'un des inventeurs du Transformer, qui parle d'un « grand saut difficile à attribuer ».

Dan McAteer propose sur Latent Space une explication qui ne cherche pas la cause dans les poids : le saut vient de la rencontre de deux courbes de progression, celle du modèle et celle du harnais qui l'entoure.

Ce qu'est un harnais

Le harnais, c'est tout ce qui n'est pas les poids : l'environnement, les outils, le contexte, la mémoire et la compaction, les permissions et les garde-fous. Sans lui, le modèle est un cerveau dans un bocal : il peut prendre une décision, pas l'exécuter.

Son poids se mesure. Harness-Bench a fait tourner le même modèle sur les mêmes 106 tâches dans différents harnais : les scores vont de 52,4 à 76,2, soit près de 24 points d'écart sans toucher au modèle. OpenAI rapporte un effet comparable sur ARC-AGI-3 : en ajoutant uniquement le raisonnement retenu et la compaction, le score d'un même modèle passe de 13,3 % à 38,3 %.

Les quatre étapes

L'article raconte l'écart entre les deux courbes — ce que le harnais demande au modèle, et ce que le modèle sait faire — comme une succession de moments :

  1. ReAct, le harnais sur le papier (octobre 2022). La boucle raisonner → agir → observer existe uniquement comme technique de prompting. Les deux courbes sont proches de zéro, l'écart est faible.
  2. AutoGPT et BabyAGI, l'autonomie prématurée (printemps 2023). Le harnais sprinte devant le modèle : on demande à un prédicteur de tokens de se comporter en employé autonome. Une boucle n'ajoute pas de capacité, elle amplifie celle qui existe — y compris les erreurs. À 95 % de fiabilité par étape sur 20 étapes, le taux de succès moyen tombe autour de 36 %.
  3. Cursor et Copilot, le repli sur l'humain dans la boucle (2023-2024). On ne donne plus la boucle au modèle mais à l'humain. Ce n'était pas de la frilosité : la première version de Devin, testée par Answer.AI, plafonnait vers 15 % de réussite.
  4. Claude Code, le croisement (février 2025). Fin 2024, les modèles de raisonnement inversent le rapport : le modèle passe devant le harnais. Le premier produit à en tirer parti abandonne l'IDE pour le terminal, donne au modèle un shell et l'accès aux fichiers, et remplace l'approbation de chaque changement par des règles de permission.

Le cycle : entraîner, absorber, élaguer

C'est la partie qui a des conséquences pratiques. L'apprentissage par renforcement est passé à l'intérieur du harnais : les modèles sont désormais entraînés sur des tâches réelles, dans des environnements outillés. À force, ils absorbent les capacités du harnais dans leurs poids — savoir compacter son propre contexte, par exemple, devient un comportement natif plutôt qu'un échafaudage externe.

Une fois la capacité absorbée, le harnais peut jeter l'échafaudage correspondant. L'article cite l'exemple d'Anthropic, dont l'équipe a supprimé environ 80 % du prompt système de Claude Code. La mesure de la maturité d'un harnais devient alors : combien puis-je en supprimer sans rien perdre ?

Le cycle se répète : entraîner → absorber → élaguer → recommencer.

Ce que ça change pour votre outillage

La conséquence est directe et concerne quiconque construit des agents : l'échafaudage que vous écrivez aujourd'hui a une durée de vie courte. La décomposition de tâche maison, la relance après échec, la sélection d'outil, la gestion de contexte : tout cela est candidat à l'absorption. L'article place d'ailleurs sur la liste des prochains absorbés l'orchestration multi-agents, la sélection d'outils et la mémoire.

Ce qui ne s'absorbe pas, en revanche, dépend de votre système et non du modèle : accès aux données, permissions, identité, isolation, vérification, lisibilité pour l'humain. Un modèle qui absorberait les permissions ne les aurait pas apprises, il les aurait dissoutes.

La thèse finale

McAteer en tire une prédiction : le harnais ne disparaît pas, il s'inverse. Né comme interface de l'humain vers le modèle, il devient l'interface du modèle vers l'attention humaine — la seule ressource qui reste rare quand les tokens deviennent abondants. Quand l'agent doit-il interrompre, quand doit-il continuer, quelles décisions peut-il prendre seul : l'auteur parie que chaque entreprise du domaine publiera d'ici un an une « surface de politique d'attention », comme toutes ont publié un AGENTS.md.

C'est une prédiction, pas une mesure — à prendre comme telle. Le cadre d'analyse, lui, est immédiatement utile pour décider où mettre son effort d'ingénierie.