Votre agent a réussi. Recommencera-t-il ?
Une équipe d'IBM Research mesure l'écart entre la réussite moyenne d'un agent et sa réussite reproductible : sur AppWorld test_normal, un agent ReAct avec GPT-4.1 affiche 77,4 % en Mean@5 mais seulement 53,0 % en Pass^5, soit 24,4 points d'écart, à température 0. Leur Consistency Analyzer rejoue chaque point de décision d'une trace enregistrée pour repérer ceux qui sont à un tirage de basculer, et les consignes qui en découlent ramènent l'écart à 12,0 points.

