Nums AI 发布 Causilo:超越 Google 与 LG,登顶 TabArena 单模型榜首

在人工智能的版图中,大语言模型(LLM)虽然占据了舆论的制高点,但结构化的表格数据依然承载着金融、医疗、电商等行业的核心业务逻辑。长期以来,处理表格数据往往需要针对每一张表格数据重新训练,缺乏通用的解决方案。针对这一行业痛点,Nums AI 近日正式对外发布了名为 Causilo 的预训练表格基础模型,并在权威的 TabArena 基准测试中,以单模型之姿击败了 Google 和 LG 等科技巨头,登顶榜首。

Causilo 的核心价值在于其作为“表格基础模型”的定位。与传统机器学习算法需要针对每一张表格数据重新训练不同,基础模型通过在海量多样化的表格数据上进行预训练,学习到了通用的数据分布特征。这使得 Causilo 能够像大语言模型理解文本一样,理解表格数据的结构和模式。该模型支持分类和回归任务,能够处理从用户画像分析到销售预测等多种场景。

为了降低开发者的使用门槛,Nums AI 特别为 Causilo 设计了 scikit-learn 接口。这是一个极具战略意义的举措。对于熟悉 Python 生态的数据科学家和开发者来说,scikit-learn 是最主流的机器学习库之一。通过兼容这一接口,Causilo 可以无缝集成到现有的数据科学工作流中,开发者无需学习全新的 API,即可利用这一强大的预训练模型进行快速部署和微调,大大缩短了从数据处理到模型落地的周期。

在性能表现上,Causilo 展现出了惊人的竞争力。在由机器学习社区维护的 TabArena 基准测试中,Causilo 在单模型类别中取得了最高的 Elo 评分,超越了 Google 推出的 TabFM 模型和 LG 的 EXAONE Tabular。TabArena 是目前评估表格数据模型性能的重要标准之一,能够全面衡量模型在不同数据集上的泛化能力和鲁棒性。Causilo 的胜出,证明了其架构设计的有效性,也为后续的表格数据处理技术树立了新的标杆。

此外,Nums AI 在开源策略上也颇具诚意。Causilo 的代码采用了 Apache-2.0 协议开源,这意味着研究人员和开发者可以自由地查看、修改和分发代码。不过,模型的权重目前仅授权用于非商业研究目的。这种“代码开源、权重非商用”的策略,既促进了学术界对模型内部机制的研究,又为商业公司留下了探索应用的空间,有助于构建健康的行业生态。

表格基础模型的兴起,标志着 AI 技术正在从“特定任务专用”向“通用智能”迈进。Causilo 的发布,不仅为解决复杂的表格数据处理难题提供了新的工具,也推动了 AI 技术在垂直行业中的落地。随着更多类似 Causilo 的工具涌现,我们有理由相信,结构化数据的智能化处理将变得更加高效、普惠。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/15/nums-ai-releases-causilo-a-tabular-foundation-model-that-tops-tabarena-among-single-models/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注