返回

文章详情

TabPFN 和 TabICL 与调优后的 XGBoost:未经过训练的模型赢得 14/14

Hacker News2026年9月28日 02:27

玩耍摘要 这一说法已经流传了几个月,且足够具体可以进行测量:一个表格基础模型在没有经过训练的情况下对一个表格进行预测,依然击败了调优后的增强模型。如果这是真的,半个世纪的实践将改变方向。超参数搜索不再是必不可少的步骤,而是有时无法获利的奢侈品。因此,我在自己选用的十四个数据集上进行了测试,采用四个竞争者和相同的计时器。您的浏览器不支持 HTML5 视频。 在 33 秒内有旁白:两个机器人在一个表格上竞争。独眼机器人观察并回答;装备好的机器人尝试了二十五种组合后才作出回应。每一个数字都是一个测量值。默认静音:在控制中打开它。通过卷轴查看它 → 这些模型究竟做了什么 一个表格基础模型是在专门生成的数百万个合成表格上进行预训练的。当新的表格到来时,它不会调整任何权重:它将训练行作为上下文并在一次前向推理中产生预测。这与我们已经从语言模型中了解的上下文学习思想是相同的,只不过从单词转移到了列。这就是为什么“训练”这个动词显得不协调:代码依然称之为拟合,但内部没有梯度下降,只有数据复制到卡上。这也解释了为什么成本在你意想不到的地方出现。拟合几乎是免费的,而预测才是花费,这正好与树形模型相反。这样一说显得有些抽象,所以这里有一行的完整旅程:请求到达,某个单元格是空的,模型根据已经发生的所有事情进行计算,在一次推断中解决返回一个结果。选择我测量的六个案例中的任何一个,以真实数据查看: 默认风险 销售活动 临床再入监护 再犯率 电力需求 分子筛查 请求 上下文 单次推断 预测 信贷申请到达 2 100 个已经结算的申请 · 10 列 clf_num/credit.csv TabICL · 无调优 · 0.8 秒 他们会偿还吗? 偿还 违约 AUC 0.8528 信贷 联系人进入名单 2 100 个已拨打的电话 · 7 列 clf_num/bank-marketing.csv TabICL · 无调优 · 0.8 秒 值得打电话吗? 注册 不注册 AUC 0.8699 银行营销 患者出院 2 100 个先前出院病例 · 7 列 clf_num/Diabetes130US.csv TabICL · 无调优 · 0.8 秒 他们会再入院吗? 返回 不返回 AUC 0.6484 Diabetes130US 案件被评估 2 100 个已结案的案件 · 11 列 clf_cat/compas-two-years.csv TabICL · 无调优 · 0.6 秒 他们会再犯吗? 再犯 不再犯 AUC 0.7329 compas-two-years 市场期结束 2 100 个先前期间 · 7 列 clf_num/electricity.csv TabICL · 无调优 · 0.8 秒 价格会上涨还是下跌? 上涨 下跌 AUC 0.8873 电力 候选分子到达 2 100 个已经检测的分子 · 419 列 clf_num/Bioresponse.csv TabICL · 无调优 · 6.0 秒 是否触发生物反应? 活性 惰性 AUC 0.8667 Bioresponse 请求 上下文 单次推断 预测 信贷申请到达 2 100 个已经结算的申请 · 10 列 clf_num/credit.csv TabICL · 无调优 · 0.8 秒 他们会偿还吗? 偿还 违约 AUC 0.8528 信贷 联系人进入名单 2 100 个已拨打的电话 · 7 列 clf_num/bank-marketing.csv TabICL · 无调优 · 0.8 秒 值得打电话吗? 注册 不注册 AUC 0.8699 银行营销 患者出院 2 100 个先前出院病例 · 7 列 clf_num/Diabetes130US.csv TabICL · 无调优 · 0.8 秒 他们会再入院吗? 返回 不返回 AUC 0.6484 Diabetes130US 案件被评估 2 100 个已结案的案件 · 11 列 clf_cat/compas-two-years.csv TabICL · 无调优 · 0.6 秒 他们会再犯吗? 再犯 不再犯 AUC 0.7329 compas-two-years 市场期结束 2 100 个先前期间 · 7 列 clf_num/electricity.csv TabICL · 无调优 · 0.8 秒 价格会上涨还是下跌? 上涨 下跌 AUC 0.8873 电力 候选分子到达 2 100 个已经检测的分子 · 419 列 clf_num/Bioresponse.csv TabICL · 无调优 · 6.0 秒 是否触发生物反应? 活性 惰性 AUC 0.8667 Bioresponse 默认风险,基础模型获胜 银行中最常被提及的案例:决定谁能借款。 数据集大小 TabICL TabPFN 调优后的 XGB 信贷 3000 × 10 0.7667 0.7578 0.7533 heloc 3000 × 22 0.7222 0.7300 0.7078 信贷违约 3000 × 20 0.6956 0.6967 0.6944 所有三个数据集均用于基础模型。在 heloc 中 TabPFN 是 0.022,TabICL 是 0.014:在信贷风险中这并不是装饰。 上下文:来自 inria-soda/tabular-benchmark 套件的 clf_num/credit.csv,修剪为 3000 行,种子为 0,分割为 70/30,带有分层处理。 sha256 22a759296600c39a56884dafd84eb346be018c537ff096adc8c2ae7e0520f2a9 销售活动,基础模型获胜 当有一千个联系人和一个小时的时间可以拨打给一百个。 数据集大小 TabICL TabPFN 调优后的 XGB 银行市场

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡