Ce qui se passe
GitHub ouvre ReviewBench, un banc d'essai pour les agents de revue de code, en préversion de recherche. Le jeu de données, la grille d'évaluation, le prompt et la configuration du juge, ainsi qu'un exécuteur en libre-service sont publics.
Le corpus
- 219 pull requests publiques, issues de 187 dépôts sous licence open source, en 19 langages ;
- répartition par langage et par taille de dépôt calquée sur l'analyse de 103,9 millions de PR GitHub ;
- un écart assumé : la taille des PR penche vers les changements moyens et gros, pour ne pas noyer le banc sous des modifications d'un seul fichier.
La vérité terrain
- Collecte large : commentaires de relecteurs humains, problèmes déduits des commits de suivi des auteurs, outils d'analyse déterministes, plusieurs LLM de familles différentes.
- Fusion sémantique des doublons, pour qu'un accord entre sources ne gonfle pas le décompte.
- Validation sous une grille unique : un constat compte s'il est vrai, pertinent et non trivial. Juge : Claude Sonnet 5.
Chaque constat porte une gravité (critique, moyenne, faible) et une catégorie (exactitude, sécurité, fiabilité, maintenabilité, tests…). Des ingénieurs seniors extérieurs au projet ont réétiqueté chaque constat : 96,6 % d'accord.
Deux familles de métriques
- Ancrées (précision, rappel, F1) : seulement contre les constats connus. C'est la comparaison principale entre systèmes.
- Augmentées : un constat absent de la référence est soumis au juge, et crédité s'il est valable. Utile pour un agent qui trouve ce que personne n'avait vu ; mais le dénominateur varie d'un agent à l'autre, d'où leur usage en diagnostic plutôt qu'en classement.
Le β du score Fβ se règle : plus de poids au rappel pour la couverture, à la précision pour le silence.
Hors ligne contre production
GitHub a testé une revue combinant plusieurs exécutions de modèles pour Copilot code review. ReviewBench annonçait plus de précision et de rappel pour un coût moindre ; l'A/B test a suivi :
- part des commentaires suivis d'une correction (proxy de précision) : +8,0 % ;
- rappel : +13,6 % ; volume de commentaires : +61 % ;
- coût par revue : −8,0 % ;
- commentaires critiques : +227 % prévus, +262 % observés.
Soumettre son agent
- Se connecter avec GitHub sur review-bench.ai.
- Enregistrer l'agent : image de conteneur, configuration, sa propre clé de modèle. Le juge est fourni.
- Itérer sur un sous-ensemble de 25 PR.
- Passage final sur les 219 PR, en trois tours.
- Publication après validation par un mainteneur, et seulement si le score dépasse le précédent de l'agent (ou pour une première entrée).
Les limites
- GitHub conçoit le banc, choisit le juge et classe son propre produit.
- Un juge LLM unique : ses biais pèsent sur toutes les métriques.
- 219 PR sur 19 langages, c'est peu par langage.
- La règle de publication ne retient que les meilleurs essais de chaque agent.
Source : ReviewBench: An open benchmark for AI code review, GitHub Blog, 5 octobre 2026.