不更新模型参数,如何让表格大模型获得可进化的边界拓展能力?SkillTFM:首次将Skill技术引入表格大模型。
编辑丨岑峰
编者按:
在近期的深度报道中,AI科技评论持续为您追踪了因果智能(Causal AI)的发展脉络——从“稳定学习”打破分布外泛化(OOD)魔咒,到因果大数据模型重塑物理世界,再到因果发现大模型DAG-FM 破解因果图的理论死结。我们反复向行业抛出一个命题:单纯依靠“关联拟合”与“海量刷题”的深度学习大模型,在面对未知环境与分布偏移时,必然陷入“盲目自信”的系统性幻觉。
那么,在当下火热的大模型与 Agent(智能体)时代,严谨的“因果哲学”究竟应该如何工程化落地?
今天我们为大家解读的这篇《SkillTFM》工作,给出了一套教科书级别的解法。
这篇论文首创性地将 Agent 领域的“Skill(技能)”引入了表格大模型。表面上看,这是一次系统架构的创新;但在底层,这完全是因果思想在 Agent 时代的一次“降维打击”:面对模型的局部失败,它拒绝了传统打补丁的盲目性,而是将因果推断中最核心的准则刻入了系统基因——无证据,不干预;无安全验证,不部署。
在这个框架下,强如 Claude 或 Gemini 等顶级 LLM,也仅仅拥有“提案权”,而没有“部署权”。任何修改都必须经过严格的局部因果证据匹配和无害性(no-harm)检查。本文将带您深度拆解,因果思想是如何化身为“理性的守门员”,让大模型获得安全、可控且可进化的边界拓展能力的。
论文标题:SkillTFM: Gated Skill Evolution for Training-Free Adaptation of Tabular Foundation Models
论文链接:https://arxiv.org/abs/2608.06137
研究团队:浙江大学、清华大学
通讯作者:浙江大学人工智能学院况琨副教授
论文核心亮点:
边界定位:表格基础模型并非在整个任务上完全失效,其错误通常集中在特定数据结构或局部区域。SkillTFM 首次将Skill技术引入表格基础模型,从数据规律和模型行为中识别这些边界,只在证据充分时执行修复。
选择性修复:系统不会无条件调用预处理或校准方法,而是对候选技能进行排序和认证;没有技能通过时,主动保留基础模型预测。
闭环进化:SkillTFM 将边界证据、执行记录、候选修改与本地验证连接成闭环,使系统不仅能调用已有技能,还能在发现新边界后,经验证吸收新的能力。
迁移能力:实验将同一套外部技能状态应用于 LimiX、TabPFN、TabICL和TabDPT,并在四种 runner 上均观察到性能提升。
表格基础模型正在颠覆传统的结构化数据学习方式。面对一个新数据集,模型可以通过任务上下文直接服务新数据集,大幅免去了逐一训练和反复调参的痛苦。
但统一预测器并不意味着没有边界。当真实物理世界的数据出现分布偏移、缺失、噪声或未知的非线性结构时,再强的表格大模型也会产生系统性误差。如果直接保留原始预测,等于对错误视而不见;但如果固定地执行预处理或校准,又极易破坏模型原本可靠的结果。
这里的真正难点,并不是程序员手里有没有“修复工具”,而是:当前任务是否真的需要修复?现有证据是否足以支持修复?当新的失败模式出现时,系统能否把处理经验转化为可复用的新能力?
为此,研究团队提出了SkillTFM。据我们所知,SkillTFM 是首个将 Skill 引入表格基础模型免训练适配的框架,并可通过可插拔设计接入不同的智能体与表格基础模型。它将证据驱动的技能调用、选择性修复与验证式技能更新连接成闭环。
不同于重新训练模型或固定执行后处理,SkillTFM 将能力扩展放在模型外部:系统既能调用已有技能处理已知边界,也能在发现新边界后,经验证吸收新的技能与控制规则。证据充分时,系统执行修复;证据不足时,则保留基础模型预测。
在 10 次随机种子实验中,SkillTFM 在三类边界设置下取得了 0.128–0.142 的平均 AUC 增益,并实现了惊人的“Zero Observed Harm(零观察伤害)”。面对初始技能库未覆盖的非线性边界,技能进化更是一举将 AUC 从 0.699 暴力拉升至 0.898。
01
边界失败,绝不等于模型整体失效
现实中的模型失败,往往不是一个简单的“会”或“不会”。
以论文中的电价预测任务为例,基础模型在绝大部分时间段内都能给出合理预测,却偏偏在几个局部区域“掉链子”——比如出现周期性的高估、短时的持续高估,或者面对价格快速上冲时反应迟钝(低估幅度)。
面对这种情况,SkillTFM 拒绝“推倒重来”。它不会重新生成整条预测曲线,而是从局部数据规律和基础模型的误差趋势中寻找证据,只修改获得证据支持的区域;而在证据不足、或修复方案未通过安全认证的区域,系统会非常保守地保留基础模型的原始预测。
图1:丨 真实电价预测中的选择性修复。SkillTFM 针对周期性高估、短时持续高估和快速上冲低估调用相应技能,并在其他区域保留基础模型轨迹。
在这种克制的“选择性修复”下,两个示例窗口的 MAE分别从 45.03 降至 23.90,以及从 66.16 降至 33.62。在完整电价预测实验中,SkillTFM 仅仅修改了 38.2% 的预测点,却精准覆盖了 83.4% 的大误差点,让整体 MAE 发生质变(53.02 降至 25.16)。
这个案例揭示了 SkillTFM 的基本判断:模型的能力边界不是一道死板的“三八线”。即使在同一个任务中,也可能同时存在“亟待修复的雷区”和“必须保留的安全区”。
02
SkillTFM:让边界拓展有证据、有门槛
SkillTFM 是如何在基础模型外部,搭建起这套结构化的技能状态的?其核心由证据提取、修复技能、门控策略和技能记忆四大模块组成。
首先,系统观察当前数据与基础模型行为,从特征分布、标签与特征关系、预测偏差、趋势和周期性、缺失模式等方面寻找边界迹象。
随后,这些证据会激活技能库中可能适用的修复技能,例如特征筛选、降维、样本调整、缺失修复、输出校准和预测融合。技能库中的方法不会全部执行,只有适用条件与当前证据匹配、且没有触发禁用条件的技能才会进入候选集合。
候选技能经过排序后,按照顺序依次接受运行时认证。只有当证据充分、风险可接受,并且历史失败记录没有阻断该路线时,候选技能才会执行。如果排名靠前的候选没有通过,系统继续检查下一个;如果所有候选均未通过,则 fallback 到基础模型预测。
图2丨SkillTFM 的整体机制。下方展示证据如何激活修复技能,并通过排序和认证产生 certified repair 或 fallback;上方展示执行记录如何形成候选修改,并经过 promotion gate 更新技能状态。
SkillTFM 还会记录每次 repair 或 fallback 时观察到的证据、考虑过的技能、认证结果和最终动作。当已有技能无法覆盖新的边界时,这些 execution traces 可以支持本地搜索、失败分析或外部 LLM 提出 candidate edits。
新的候选不只可以增加修复方法,也可以调整证据提取、技能排序和风险控制方式。但任何候选都不能直接进入部署状态:它必须证明自己能够改善目标边界,并通过 no-harm 与回归检查。
在初始技能库没有覆盖的非线性边界上,SkillTFM 首先选择全部 fallback,与基础模型保持相同的0.699 AUC;新的非线性技能通过验证后,AUC 提升至0.898,fallback rate 降至23.0%,同时没有观察到性能伤害。
03
该拓展时拓展,该保留时保留
研究首先在 held-out、mixed 和 generator/severity transfer 三种边界设置下评估 SkillTFM。
SkillTFM 在三种设置下分别取得 0.142、0.135 和 0.128 的平均 AUC 增益,并保持 zero observed harm。这些结果说明,技能层不仅能够覆盖训练时已经观察到的边界,还可以迁移到边界混合、生成机制变化和严重程度变化的任务。
但 SkillTFM 并不追求尽可能高的修复覆盖率。研究进一步按照基础模型的 AUC 将任务划分为 C1–C4 四个性能区间,观察系统在不同基础能力下的行为。
表1丨不同边界设置下的能力评估。表中报告10次随机种子实验的均值与标准差。
图3丨不同基础模型性能区间下的边界拓展与 fallback 行为。随着基础模型性能提高,SkillTFM 的修复收益逐渐收敛,同时更加倾向于保留原始预测。
在 C1 区间,基础模型 AUC 仅为 0.367,SkillTFM 将其提升至 0.815,增益达到 0.448,fallback rate 为 12.5%。随着基础模型逐渐可靠,修复收益依次下降,fallback rate 则从 27.3%、63.2% 持续上升。
到了 C4 区间,基础模型 AUC 已达到 0.931,SkillTFM 仅将其提高至 0.936,同时 fallback rate 达到 98.8%。
这说明 SkillTFM 并不会因为技能库中存在修复方法就强行调用。面对明显边界失败时,它积极拓展能力;当基础模型已经接近性能饱和时,它几乎完全保留原始预测。
04
技能可以跨模型迁移,LLM 也只有“提案权”
如果外部技能只适用于某一个基础模型,那么它仍然更像模型专属补丁,而不是可复用的边界能力。
研究将同一套 SkillTFM 技能状态连接到 LimiX、TabPFN、TabICL和TabDPT。尽管这些模型的结构、训练方式和基础性能不同,SkillTFM 均带来稳定改善,核心迁移实验中的 AUC 增益达到 0.139–0.148。
图4丨SkillTFM 在不同表格基础模型之间的技能迁移。同一套外部技能状态持续改善四种 TFM,说明经过验证的边界处理能力可以跨基础模型复用。四种 runner 上的一致增益说明,学习到的 skill state 并非针对单一模型构造的临时补丁,而具有跨 TFM 复用的潜力。
这种可迁移性同样体现在技能进化的候选提出环节。SkillTFM 不绑定某一个固定的 optimizer,Qwen、Gemini 和 Claude 都可以根据 execution traces 分析失败模式,并提出新的候选修改。
但大模型只有“提案权”,没有“部署权”。
表2丨不同 LLM optimizer 在统一 SkillTFM 技能进化协议下的候选修改结果。LLM 负责提出候选方案,本地 promotion gate 独立决定其能否进入部署状态。
实验中,Qwen、Gemini 和 Claude 分别提出了 7、11 和 11 个符合格式要求的候选。其中只有少数候选通过基础模型上的初步验证,最终没有一个候选满足完整的 promotion 条件;Claude 提出的方案则因证据不足而停止晋升。
这些结果体现了本地 promotion gate 的作用:不同 LLM 负责提出候选方案,但不能直接修改部署状态;候选是否被接受,取决于其是否具有充分证据、带来目标能力提升,并通过 no-harm 与回归检查。
05
结语:从“盲目拟合”走向“可控进化”
SkillTFM 提供了一种面向表格基础模型的能力拓展路径,为当前火热的大模型 Agent 架构指明了一条新路:大模型负责提供强大的通用预测基础,而外部的 Skill State(技能状态)则作为“理性的守门员”,专门处理那些有明确证据支持的边界疑难杂症,并将验证过的新经验内化为可复用的能力。
这项工作表明:在不更新大模型底层参数的前提下,凭借基于证据的选择性修复和严苛的门控技能进化,AI 系统的能力边界依然可以得到持续、安全、可验证的拓展。这不仅是一次技术的突破,更是一次模型治理哲学的胜利。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
热门跟贴