“对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。”
开源大模型领军人物 Nathan Lambert 在 X 上发帖说。
Nathan Lambert 是全球顶尖大模型后训练、RLHF(人类反馈强化学习)权威学者。
他应该是看不下去 针对 K3 的一堆胡乱指责,写了篇关于蒸馏的小作文进行科普。
Nathan Lambert 说,即使 K3 使用了 Claude 等前沿模型生成的数据,这更可能发生在 SFT(监督微调)阶段,用于帮助模型学习推理模式,而不是简单“复制”一个美国顶级模型的能力。
“蒸馏确实可能被使用了,但大家高估了它对最终模型能力的影响。”他分析称,蒸馏最多只是模型训练早期的助推器。
从初始 SFT 数据,到达到 Kimi K3、GLM-5.2 这样的性能水平,中间仍需要大量的数据筛选、强化学习、训练策略优化等复杂过程。真正决定模型上限的,是后训练体系和工程能力,而非是否拥有某个强大的“教师模型”。
他直接发推指出,“中国实验室在 RL 期间并没有使用 Fable / 最强的模型作为教师,那不是蒸馏的工作方式”。
Nathan Lambert还无奈的说,“对于那些指责我在蒸馏问题上充当中国水军的人,我想说:我很早以前就一直担心这个问题。如今,我们才刚刚开始感受到在开放模型领域落后的代价。如果美国不想办法支持本土开放模型的发展,未来情况只会变得更加糟糕。”
以下为博文全文——
我目前对于蒸馏技术的使用方式,以及它究竟能带来多少性能提升的一些看法。
先说明背景:Anthropic 确实曾表示,DeepSeek 等模型正在使用他们的模型参与一种基于强化学习(RL)的数据生成流程,但这并不意味着这种方式带来了显著的性能提升。
这些案例中的样本数量非常少,很可能只是用于初始化一个内部模型,或者进行小规模训练实验。
真正将蒸馏作为关键步骤使用的阶段,是 SFT(监督微调)和/或中期训练(midtraining)阶段(把 SFT 和 midtraining 完全分开来看其实并不合理,因为两者在培养模型推理行为方面存在连续性)。
这也是为什么一些中国模型在输出时会出现“I’m Claude(我是 Claude)”之类的行为。
原因在于,在进行下一词预测(next-token prediction)训练时,模型会学习一些“特征”(features),这些特征实际上是由大量 token 聚类形成的模式,并且会经常出现在模型输出中。
这种 SFT 数据通常是通过绕过 API 原本设计的行为限制,获取模型的推理过程 token(reasoning tokens)生成的。
如果不能直接获得模型的推理token,那么这些数据会非常难以用于训练,而且很可能不会包含类似“我是 Claude”这样的行为模式。
目前,高质量 SFT 数据集的规模通常在 百万级提示词(约 O(1 million prompts)),并配套高质量回答。如今,获取这些提示词往往才是最困难的部分——尤其是那些经过精心设计、未来可以用于强化学习(RL)的环境型任务提示。不过,这更多影响的是 SFT 阶段。
说到底,SFT 蒸馏真正可能发挥巨大作用的地方,是当模型进入一个新的专业领域时。
一个很好的例子是 CripPT 物理基准测试,在这个领域,美国实验室目前领先很多。
理论上,可以获取一些专业领域的问题提示,然后让一个前沿模型生成答案,用这些数据作为新模型初始 SFT 的训练材料。
但是,即便拥有了一套初始 SFT 数据,要让一个模型达到 GLM 5.2 和 Kimi K3 这样的性能水平,仍然需要大量工作。
SFT 阶段只是构建后训练(post-training)体系的开始,后续还有一个漫长且艰苦的过程,包括:
生成更多 SFT 数据;
对数据进行筛选(类似 rejection sampling,拒绝采样);
通过大规模强化学习不断优化模型行为。
对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。不过,未来模型可能会从 Fable 5 这类前沿模型中获益。
而随着后训练越来越依赖诸如 多教师在线策略蒸馏(multi-teacher on-policy distillation) 等技术,而不仅仅是强化学习,SFT 蒸馏究竟如何影响最终模型,变得更加复杂。
整个过程包含很多环节,而且强化学习已经在最终模型能力中占据越来越重要的比例。
这里最关键的一点是:在上述 SFT 阶段,最强的教师模型通常并不是最容易被整合进后训练流程的模型。
例如,目前领先的完全开放推理模型 SFT 项目——如 Open Thoughts 和 OLMo——在尝试更新训练流程、使用最强模型作为教师时,都遇到了很大困难。
很多时候,真正优秀的教师模型反而是一些规模更小、出人意料的模型。
这意味着,推动蒸馏进步的可能并不一定是最顶尖的闭源模型!整个过程非常复杂。
综合来看,目前关于后训练阶段的证据表明,蒸馏的重要性正在下降。
过去,在强化学习尚未大规模应用之前,蒸馏的重要性更高,因为在基础模型(base model)之上,通过 SFT 获得的性能提升占最终能力的比例更大。
但随着 RL 规模扩大,这种趋势正在改变。我认为这一趋势还会持续,尤其是在开放权重模型(open-weight models)越来越强的情况下。
同时,教师模型存在的不确定性,也削弱了一种常见观点——即开放模型只是通过“蒸馏洗白”(distillation washing)获得能力。
因为如果必须依赖 Claude 或 GPT 的 API 才能实现蒸馏,那么开放模型的发展空间会受到限制。
但现实可能恰恰相反,开放模型可能本身更容易被蒸馏,因为它们更容易修改、更容易实验、更方便研究人员进行调整和迭代。
这才是目前蒸馏竞争格局中更值得关注的方向。