veilletech.fr
6 oct. Feed du jour
#07 IA Article

ReviewBench : 219 PR pour noter votre agent de revue

Un agent qui trouve tout et un agent qui dérange peu ne sont pas le même agent.

GitHub publie ReviewBench, un banc d'essai ouvert pour les agents de revue de code : 219 pull requests publiques de 187 dépôts et 19 langages, une vérité terrain issue de plusieurs sources et jugée par Claude Sonnet 5 selon une grille publiée. Deux familles de métriques séparent les problèmes connus de ceux qu'un agent découvre. GitHub est à la fois auteur du banc et d'un agent classé.

3 min de lectureintermédiairevidéo 1:20
Partager
Sommaire8 sections
  1. Ce qui se passe
  2. Le corpus
  3. La vérité terrain
  4. Deux familles de métriques
  5. Hors ligne contre production
  6. Soumettre son agent
  7. Les limites
  8. À retenir

Ce qui se passe

GitHub ouvre ReviewBench, un banc d'essai pour les agents de revue de code, en préversion de recherche. Le jeu de données, la grille d'évaluation, le prompt et la configuration du juge, ainsi qu'un exécuteur en libre-service sont publics.

Le corpus

La vérité terrain

  1. Collecte large : commentaires de relecteurs humains, problèmes déduits des commits de suivi des auteurs, outils d'analyse déterministes, plusieurs LLM de familles différentes.
  2. Fusion sémantique des doublons, pour qu'un accord entre sources ne gonfle pas le décompte.
  3. Validation sous une grille unique : un constat compte s'il est vrai, pertinent et non trivial. Juge : Claude Sonnet 5.

Chaque constat porte une gravité (critique, moyenne, faible) et une catégorie (exactitude, sécurité, fiabilité, maintenabilité, tests…). Des ingénieurs seniors extérieurs au projet ont réétiqueté chaque constat : 96,6 % d'accord.

Deux familles de métriques

Le β du score Fβ se règle : plus de poids au rappel pour la couverture, à la précision pour le silence.

Hors ligne contre production

GitHub a testé une revue combinant plusieurs exécutions de modèles pour Copilot code review. ReviewBench annonçait plus de précision et de rappel pour un coût moindre ; l'A/B test a suivi :

Soumettre son agent

  1. Se connecter avec GitHub sur review-bench.ai.
  2. Enregistrer l'agent : image de conteneur, configuration, sa propre clé de modèle. Le juge est fourni.
  3. Itérer sur un sous-ensemble de 25 PR.
  4. Passage final sur les 219 PR, en trois tours.
  5. Publication après validation par un mainteneur, et seulement si le score dépasse le précédent de l'agent (ou pour une première entrée).

Les limites

Source : ReviewBench: An open benchmark for AI code review, GitHub Blog, 5 octobre 2026.