Ce qui se passe
Ai2 (Allen Institute for AI) ouvre AstaBrief 8B, le modèle qui alimente le mode « Fast » de la génération de rapports d'Asta, sa plateforme de recherche scientifique. À partir d'une question et d'extraits d'articles récupérés, il rédige un rapport complet avec citations, en une seule passe. Les poids et les jeux d'entraînement sont publiés sur Hugging Face, avec un exemple de chaîne pour produire des rapports à partir de ses propres PDF.
L'intérêt dépasse le cas d'usage : le billet détaille une recette de spécialisation peu coûteuse, et dit ce qui a compté.
La recette
- Base : Qwen3-8B.
- Pas de RL : l'apprentissage par renforcement, envisagé, a été écarté comme instable et cher. À la place, un fine-tuning supervisé (SFT) puis une optimisation directe des préférences (DPO).
- Données SFT : 90 000 requêtes réelles de chercheurs, nettoyées (trafic de test et de robots, requêtes trop courtes, hors sujet ou contenant des données personnelles). Des rapports cibles générés par la chaîne existante, appuyée sur des modèles propriétaires (Claude 3.5 et 3.7 Sonnet, o3, o4-mini, GPT-4.1), ont donné 47 000 exemples après filtrage.
- Paires DPO : pour d'autres requêtes, deux rapports issus de modèles différents, départagés par deux juges (GPT-4.1 et DeepSeek-R1). Seules les paires où les deux juges s'accordent sont gardées : 6 000 au final. Les juges s'alignaient à 95 % sur des préférences humaines.
Le filtre qui a payé
Les premiers essais SFT écrivaient mieux mais citaient moins bien que la chaîne de référence. L'équipe a testé quatre filtres sur les exemples synthétiques :
| Filtre | Ce qu'il écarte |
|---|---|
| Ratio sortie / entrée en jetons | Beaucoup de texte produit à partir de peu de matière |
| Pertinence des citations | Rapports appuyés sur des sources mal classées |
| Densité de citations | Rapports dont peu d'affirmations sont sourcées |
| Diversité des citations | Rapports qui s'appuient sur trop peu d'articles |
Le gain le plus net est venu de la densité de citations seule. Filtrer plus fort, combiner les filtres ou balayer le taux d'apprentissage n'a rien ajouté de notable. Pour qui affine un modèle sur des réponses sourcées, c'est la première mesure à poser sur ses données.
Les résultats, et leurs limites
- Dans la chaîne Asta, 51,1 s par rapport en mode Fast contre 178,5 s en mode Thinking (Claude), soit 3,5 fois plus rapide.
- Sur SQABench-CS2 (200 questions d'informatique) et DeepScholarBench (63 requêtes), AstaBrief se situe au niveau de la chaîne Claude et de DR Tulu, selon des juges automatiques.
- Étude humaine : 14 questions, trois chercheurs. DR Tulu l'emporte en préférence générale ; deux chercheurs sur trois préfèrent AstaBrief sur l'exactitude des citations.
Les auteurs le disent eux-mêmes : entraînement et évaluations datent de 2025 et n'ont pas été refaits face aux modèles actuels. Ce sont des mesures de l'équipe, à lire comme une validation de la méthode plutôt que comme un classement.
Source : Open-sourcing AstaBrief, the fast report-generation model in Asta, blog Hugging Face (Ai2), 2 octobre 2026.