2026年9月29日,NVIDIA 在 Hugging Face 官方博客发布了开源表格基础模型 Kumo Tabular。这是 NVIDIA Kumo Structured 模型系列的一员,专门做表格数据的分类与回归:给它一张带标签的表格,它一次前向传播就能预测新行的标签——不需要训练,不需要调参,也不需要特征工程。模型分三个尺寸,从 2800 万到 2.15 亿参数,全部只在合成数据上预训练,权重已上线 Hugging Face(nvidia/Kumo-Tabular),采用允许商用的 OpenMDW-1.1 许可,推理走开源的 structured-data-models 库,首次使用会自动下载权重,并自带预处理、集成与多分类处理。
它想替代的是 XGBoost 那套流程
过去二十年,企业里的表格预测——客户流失、违约、需求、定价——几乎是梯度提升树的天下。每个新问题都要走一遍老流程:标注数据、做特征工程、调参、验证、上线,动辄几周。Kumo Tabular 把大语言模型的上下文学习搬到了表格上:把带标签的表格当作上下文读进去,直接输出对新行的预测,跳过了“为每个任务训一个模型”这一步。NVIDIA 称它在 TabArena、BeyondArena、TALENT、ScoringBench 四个表格基准上全部拿下第一,算是给这条路线立了个标杆。
什么人该试,什么场景别指望它
最适合的是这样的团队:手里有标注好的表格,想快速验证一个预测想法,但数据科学资源紧张、等不起完整建模周期——Kumo Tabular 能把“有个想法”到“看到预测结果”的链路缩到最短。但它替代的是建模流程,不是预测本身的可靠性:预测准不准、能不能上线、出了问题谁负责,依然是团队要回答的问题,模型不会替你背。另外注意它的主战场是单表分类回归;如果你面对的是横跨几百张表的企业级关联预测,Kumo 另有一条 KumoRFM-2 产品线(今年 4 月发布),两者分工不同,别选错。
背景上值得一提:Kumo 团队是 NVIDIA 此前收购的,这次发布可以看作收购后的技术落地。对表格预测场景感兴趣的读者,可以在 NVIDIA 专题 继续跟踪相关进展。