576 字
3 分钟
Model Spec Midtraining: Improving How Alignment Training Generalizes
arXiv: 2605.02087 | 2026-05-03 | Anthropic Chloe Li, Sara Price, Samuel Marks, Jon Kutasov
一句话
在标准对齐微调前,让模型学习介绍 Model Spec 价值观、规则及理由的合成文档。实验表明,这能改善对齐泛化,尤其是分布外表现。
核心思路
示范数据能展示期望行为,却未必充分说明背后的原则,因此难以确定模型在新场景中如何泛化。
MSM(Model Spec Midtraining):在预训练之后、对齐微调(AFT)之前,用合成文档训练模型讨论其 Model Spec 的内容。规范内容为模型学习后续对齐数据提供背景,影响其泛化方向。
关键方法
- 合成中间训练:生成讨论 Model Spec 的合成文档(包含价值观、规则及其背后的推理),作为中间训练阶段的语料
- 先理解后执行:MSM → 标准对齐微调(AFT),两步走
- 可控泛化:同一份对齐数据配合不同的 Spec,产生不同的泛化方向。例如,相同的奶酪偏好数据配合「亲美」Spec → 泛化为亲美价值观;配合「亲实惠」Spec → 泛化为亲实惠价值观
实验结果
| 模型 | 基线错位率 | MSM+AFT 错位率 | 对比基线 (DA) |
|---|---|---|---|
| Qwen2.5-32B | 68% | 5% | DA: — |
| Qwen3-32B | 54% | 7% | DA: 14% |
- 在 Agentic misalignment 评估中,MSM+AFT 将错位率从 68%→5%(Qwen2.5)和 54%→7%(Qwen3)
- 效果显著优于 deliberative alignment 基线(14% vs 7%)
- 优势在分布外场景尤为突出——普通 QA 对齐在难题场景中失效的地方,MSM 仍保持有效
发现与洞察
- 解释价值观比仅给规则更有效:在 Spec 中说明规则背后的价值观能改善泛化
- 具体指导优于笼统指导:提供具体的而非泛泛的规范内容效果更好
- MSM 不仅是一种训练方法,也是研究工具——可用来探索哪种 Model Spec 产生最强的对齐泛化
为什么重要
- 仅靠行为示范,可能不足以让模型在新场景中遵循同样的原则
- MSM 补充规范背后的理由,帮助后续行为训练更稳定地泛化
- 方法简单、可叠加到现有对齐流程上
- 为模型规范(Model Spec / Constitution)的研究提供了新的实验范式
Model Spec Midtraining: Improving How Alignment Training Generalizes
https://blog.lpkt.cn/posts/papers/model-spec-midtraining/