
ILP团队 投稿在线配资导航
量子位 | 公众号 QbitAI
大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的LLM落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用SFT做领域适配。
但一个尴尬的事实是:大家都默认SFT“训练完就是学完了”。直到腾讯混元团队对Qwen、LLaMA、OLMo2等多个模型家族(1.8B–14B)和10个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss也降下去了,但回头重测就是答不对。平均比例高达15.3%。
这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)——SFT训练的系统性盲区。

发表:ACL 2026主会长文(Long Paper,Pages 30186–30213)
背景
场景与痛点
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:
准备标注数据(QA对、指令-回复对等)
在基座模型上跑SFT训练
看loss曲线收敛了→认为训练完成
但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4等都有专门的数据质量研究),但SFT阶段几乎没人追问“模型到底学会了什么、没学会什么”。
论文做了什么
这篇论文完成了四项工作:
定义ILP——将SFT后无法正确复现训练样本的行为正式命名为“Incomplete Learning”
找到五大根因——不是笼统地说“数据不好”,而是把每个未学会样本对应到一个可解释的原因
提出四步诊断框架——Detect→Attribute→Intervene→Verify,全流程可复现
验证五种干预——证明了CPT补充知识远优于加epoch,且部分根因无法通过SFT本身解决
ILP现象:训练loss收敛后仍有大量样本无法正确复现:

△不完全学习现象示意图——SFT后训练集回测,部分样本在训练过程中并未被有效学习
四步诊断框架一图胜千言:

△三段式诊断框架——检测→归因→干预,覆盖ILP全生命周期
技术方案——四步诊断框架
整个框架分为四个阶段:
Detect(检测)→Attribute(归因)→Intervene(干预)→Verify(验证)
Step 1:检测(Detect)——怎么知道模型“没学会”?
这是最复杂的一步。难点在于:怎么区分“大致理解”和“真正学会”?
SFT通常生成自由文本,这种形式的“答对”太模糊。论文的做法是:
MC转换(Multiple-Choice Conversion):
把每条SFT数据(QA对)用GPT-4转成4选1选择题(1个正确答案+3个干扰项)
四级质量过滤:答案可解性→唯一性→干扰项区分度→人工抽检
极端情况直接丢弃(如正确答案和干扰项太接近无法分辨)
案例:原始数据是“What is the capital of France?→Paris”,转换成:
Q:What is the capital of France?
A. London B. Paris C. Berlin D. Madrid
pass@k指标(k=5):
对每个MC题,用训练好的模型采样5次
只要5次中有1次选对了答案→判定为“已学会”
5次全部选错→判定为ILP样本
这里k=5不是随便取的:温度变化可能带来回答的随机性,pass@5=给了5次机会,比top-1更公允。
三重验证(Triple Validation):
为避免误判,论文做了三层交叉验证:
跨温度一致性:同一样本在T=0.1/0.5/1.0下重新评估,ILP差异<0.5%
重测信度(Kappa=0.89):同一批样本两次独立检测,Cohen’s Kappa高达0.89
跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的ILP判定高度一致
检测流程图:

△MC转换方案——将监督响应转化为选择题格式,消除自由文本评估噪声
Step 2:归因(Attribute)——为什么没学会?
这是全文最核心的贡献。论文提出了一个2×2归因矩阵,纵轴是“基模型是否已掌握该知识”(预训练阶段),横轴是“SFT标签是否正确”(标注质量)。

两步快速定位:
知识方向判断:在基座模型上做零样本测试→如果基模型能答对,说明“知识已经有了”,问题出在SFT过程的冲突;如果基模型答不对,说明“预训练阶段就缺知识”
训练方向判断:取early-20% checkpoint和late-20% checkpoint,比较:如果先答对后答错→左侧遗忘(IV);如果一直答不对→优化不足(V);如果有多个冲突标签→数据矛盾(III)
最终锁定五大根因:

2×2归因矩阵:

△2×2归因框架——横轴「基模型是否已知该知识」,纵轴「SFT标签是否正确」
关键发现:ILP与标注质量无关。即使SFT标签正确率超过98%,ILP仍然存在。说明这不是“数据错了”的问题,而是SFT训练机制本身的系统性不足。
元股证券:ygzq.hk另一个惊人发现:ILP与模型规模弱相关。从Qwen-1.8B换到Qwen-14B,ILP仅降低2.1个百分点。也就是说,更大规模的模型并不能显著解决“学不会”的问题——这指向SFT优化机制,而不是模型容量。
Step 3:干预(Intervene)——怎么让模型学会?
论文根据五种根因,设计了对症的五类干预:

最惊人的对比实验:
CPT(2倍训练量)→ILP降12.5%
南京配资公司加epochs(10倍训练量)→ILP仅降2%
这意味着:拼命加SFT训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT本身存在物理上限,它只能“重新组织”已有知识,无法凭空创造新知识。
Step 4:验证(Verify)——干预真的有效吗?
干预后重新走一遍检测流程,对比干预前后的ILP率:
使用相同的MC转换+pass@5评估
引入最小效应量阈值(min_effect=0.01),防止统计噪声
确保干预收益>统计波动
实验结果
ILP现象确实存在

数据集中ILP分布:

△CPT引入后医疗、法律、金融等知识密集型领域的准确率持续增长
ILP与模型规模关系极弱

从1.8B到14B,参数量翻了近8倍,ILP仅降了2.1个百分点。ILP是SFT机制层面的问题,不是模型不够大。

干预效果:CPT>>加Epochs

10倍算力换来2%vs2倍算力换来12.5%。该把钱花在预训练,而不是无限堆SFT epoch。
物理溯源验证
将ILP样本中涉及的知识点在Dolma 5T语料库中检索:
19.3%的知识点在Dolma中完全不存在→根因I(知识缺失)
14.5%存在冲突信息→根因II(知识冲突)
消融与溯源结果:

△CPT前后各模型准确率对比——提升在跨模型规模和领域中保持稳定
模型家族对比:

△应用各项优化策略后各基线模型的性能提升对比
项目价值
学术价值
首次系统性定义和量化SFT中的不完全学习现象
提出了可复现的诊断框架(Detect→Attribute→Intervene→Verify)
揭示了SFT的物理上限:它只能重组已有知识,无法创造新知识
实践指导意义
不要迷信loss收敛。训练完了不等于学会了,需要pass@k+MC转换做样本级诊断。
加epoch性价比极低。10倍SFT算力换2%改善,不如把预算投到预训练数据上。
知识缺失是第一大根因。如果你的下游任务有大量模型没见过的新知识,SFT几乎无能为力——要先做CPT。
数据去重和一致性是低成本高收益的事。全局shuffle和动态分桶实现简单,ROUGE-L能提升29%。
2×2矩阵可在几分钟内完成根因定位。不需要全量重训,用early/late checkpoint对比即可。
作者团队
腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。
该工作入选ACL 2026主会Long Paper,是SFT诊断方向第一篇系统性研究。
论文(arXiv):https://arxiv.org/abs/2604.10079
论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/
代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🎓 我们会 (尽量) 及时回复你 :)
🌟 点亮星标 🌟
科技前沿进展每日见在线配资导航
元股证券实盘-一站式服务提示:本文来自互联网,不代表本网站观点。