Prior Labs 近期宣布推出 TabPFN-3.5,一款在表格数据领域引发广泛关注的全新基础模型。这款模型最引人注目的特点是,它仅通过合成数据进行了预训练,却展现出了惊人的性能,甚至在无需任何微调的情况下,以默认参数击败了 Otto Kaggle 竞赛的获胜解决方案。
在数据科学领域,结构化表格数据的处理一直是一个难点。与图像和文本数据不同,表格数据往往缺乏大规模的标注数据,且分布特性各异。传统的机器学习方法虽然强大,但往往需要针对每个数据集进行繁琐的参数调优和特征工程,这使得数据科学家的工作重心容易偏离对业务本质的思考。
TabPFN-3.5 的出现标志着表格数据基础模型的成熟。作为一款基础模型,TabPFN 借鉴了大型语言模型(LLM)的核心理念。它不再局限于特定的数据集,而是学习通用的函数分布。这意味着,一旦模型完成预训练,它能够极其快速地适应新的任务,甚至只需要极少的样本数据即可进行零样本或少样本分类。3.5 版本的升级,通常意味着在模型容量、泛化能力或训练数据规模上的显著提升。
在 Otto Kaggle 竞赛的数据集上,TabPFN-3.5 的表现令人印象深刻。该数据集以其高维度和复杂的类别分布而闻名,许多参赛者通过复杂的集成方法和大量的超参数调优才勉强获胜。然而,Prior Labs 的团队发现,直接使用 TabPFN-3.5 的默认设置,其分类准确率就超越了此前所有获胜方案。这一结果不仅证明了该模型强大的鲁棒性,也极大地降低了数据科学家的使用门槛——用户无需成为调参专家,即可获得顶尖的模型性能。
对于行业而言,TabPFN-3.5 的意义在于“民主化”。它使得中小企业或个人开发者也能利用最先进的 AI 技术,在结构化数据上进行高精度的分析。无论是金融风控、医疗诊断还是供应链预测,这种能够快速适配新场景的模型都具有巨大的应用潜力。
随着 AI 技术的不断发展,从非结构化数据(如文本、图像)向结构化数据的拓展已成为必然趋势。Prior Labs 的这一尝试,或许正在为表格数据的 AI 分析打开一扇新的大门,预示着未来我们将不再为每一个数据集训练单独的模型,而是像使用搜索引擎或生成式 AI 一样,直接调用一个通用的“表格大脑”。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/15/prior-labs-releases-tabpfn-3-5-a-tabular-foundation-model-that-beats-the-winning-otto-kaggle-solution-with-default-settings/