veilletech.fr
3 oct. Feed du jour
#09 IA Article

AstaBrief : un 8B spécialisé, et le filtre qui a payé

Le filtre qui a payé était le plus simple des quatre.

Ai2 publie les poids et les données d'AstaBrief 8B, un Qwen3-8B affiné par SFT puis DPO pour rédiger des rapports scientifiques cités. Le résultat le plus transposable porte sur les données : parmi quatre filtres testés sur les exemples synthétiques, écarter ceux à faible densité de citations a le plus aidé, et les combinaisons plus élaborées n'ont rien ajouté. Évaluations conduites en 2025, par l'équipe elle-même.

3 min de lectureavancévidéo 1:21
Partager
Sommaire5 sections
  1. Ce qui se passe
  2. La recette
  3. Le filtre qui a payé
  4. Les résultats, et leurs limites
  5. À retenir

Ce qui se passe

Ai2 (Allen Institute for AI) ouvre AstaBrief 8B, le modèle qui alimente le mode « Fast » de la génération de rapports d'Asta, sa plateforme de recherche scientifique. À partir d'une question et d'extraits d'articles récupérés, il rédige un rapport complet avec citations, en une seule passe. Les poids et les jeux d'entraînement sont publiés sur Hugging Face, avec un exemple de chaîne pour produire des rapports à partir de ses propres PDF.

L'intérêt dépasse le cas d'usage : le billet détaille une recette de spécialisation peu coûteuse, et dit ce qui a compté.

La recette

Le filtre qui a payé

Les premiers essais SFT écrivaient mieux mais citaient moins bien que la chaîne de référence. L'équipe a testé quatre filtres sur les exemples synthétiques :

Filtre Ce qu'il écarte
Ratio sortie / entrée en jetons Beaucoup de texte produit à partir de peu de matière
Pertinence des citations Rapports appuyés sur des sources mal classées
Densité de citations Rapports dont peu d'affirmations sont sourcées
Diversité des citations Rapports qui s'appuient sur trop peu d'articles

Le gain le plus net est venu de la densité de citations seule. Filtrer plus fort, combiner les filtres ou balayer le taux d'apprentissage n'a rien ajouté de notable. Pour qui affine un modèle sur des réponses sourcées, c'est la première mesure à poser sur ses données.

Les résultats, et leurs limites

Les auteurs le disent eux-mêmes : entraînement et évaluations datent de 2025 et n'ont pas été refaits face aux modèles actuels. Ce sont des mesures de l'équipe, à lire comme une validation de la méthode plutôt que comme un classement.

Source : Open-sourcing AstaBrief, the fast report-generation model in Asta, blog Hugging Face (Ai2), 2 octobre 2026.