Ce qui se passe
Churn, défaut de paiement, demande, prix : l'essentiel du machine learning en entreprise se fait sur des tableaux, et depuis vingt ans avec des arbres de décision boostés. Le modèle marche, le cycle autour ne bouge pas : étiquettes, variables, recherche d'hyperparamètres, validation, déploiement — et on recommence à zéro pour la question suivante.
NVIDIA publie Kumo Tabular, un modèle de fondation ouvert qui prend le problème autrement. On lui fournit les lignes dont on connaît l'étiquette et celles à prédire ; il renvoie des probabilités de classe, ou une prédiction numérique, en une passe, sans entraînement.
- Poids :
nvidia/Kumo-Tabular - Code :
NVIDIA/structured-data-models - Trois tailles, de 28 à 215 millions de paramètres
- Licence OpenMDW-1.1, usage commercial autorisé
Comment ça marche
C'est l'apprentissage en contexte des LLM appliqué aux tables, dans la lignée de TabPFN et TabICL. Trois étages :
- Cellules. Valeurs numériques et catégorielles passent par des caractéristiques de Fourier ; les valeurs manquantes n'ont pas besoin d'imputation.
- Lignes. Une attention par colonne situe chaque valeur dans sa
distribution (un
42est-il courant ou extrême ?), une attention par ligne capte les interactions entre variables. Chaque ligne est ensuite résumée, ce qui rend l'étage suivant indépendant du nombre de colonnes. - Contexte. Les lignes à prédire consultent les lignes étiquetées, jamais l'inverse. Une prédiction ne dépend donc pas des autres lignes du lot, et le contexte, calculé une fois, se réutilise.
En régression, la sortie est de 999 quantiles : une valeur et son incertitude. Une température d'attention qui croît avec le nombre de lignes évite que l'attention se dilue sur les grandes tables.
Le préentraînement n'a vu que des tables artificielles — 35, 71 et 137 millions selon la taille — tirées de graphes causaux aléatoires, avec valeurs manquantes, variables arrondies et cibles à queue lourde. Dernière étape : jusqu'à 60 000 lignes et 100 colonnes. La recette et les générateurs doivent être publiés plus tard.
Ce que valent les chiffres
NVIDIA annonce la première place sur TabArena (ELO 1950), BeyondArena, TALENT et ScoringBench, et une exécution 17 fois plus rapide que LimiX-2 sur une RTX 6000 Pro. Ce sont les mesures de l'éditeur : elles disent quoi tester, pas quoi conclure.
Comment l'essayer
La bibliothèque structured-data-models télécharge les poids au premier
appel et fournit prétraitement, ensembles et gestion des classes nombreuses. On
convertit un DataFrame pandas avec sdm.TableTensor.from_pandas(...), puis
sdm.models.KumoTabular prend trois arguments : x_context et y_context
pour les lignes connues, x_query pour celles à prédire. L'exemple officiel
tourne sur device="cuda".
Le bon premier test : un problème où un modèle à arbres existe déjà, même découpage entraînement/test, et comparer précision et calibration.
Les limites
- Colonnes numériques et catégorielles seulement ; texte, images et dates passent par des recettes de prétraitement fournies.
- Dix classes par passe ; au-delà, la bibliothèque recourt à des codes correcteurs d'erreurs.
- Précision fragile sur des tables hors des tailles vues à l'entraînement, ou quand les lignes à prédire ne ressemblent pas au contexte.
Source : NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction, blog Hugging Face de NVIDIA, 29 septembre 2026.