CASE 01 / 整体退化 → 层级机制
两位专家都很强,为什么合起来反而变差?
第一步:先画逐任务结果,再逐层替换或缩放任务增量。
Task Arithmetic、TIES、DARE 已分别研究任务向量组合、符号冲突和增量稀疏化;TSV 进一步分析层级奇异向量。“解决任务冲突”需要落到更具体的机制。
展开:原因假设、候选贡献与最小验证
- 01具体场景与价值
- 来自同一预训练底座的多个任务专家,部署时希望只保留一个共享模型;明确是共享输出头还是已知任务头。
- 02观察与证据
- 教学假设,待观测:简单相加后少数任务大幅退化,且任务增量的范数差异明显。保存逐任务指标和每层增量统计。
- 03原因假设与预测
- 候选原因是部分层的增量尺度失衡,而不只是参数符号相反。预测:保留方向只统一尺度,应恢复部分能力;若方向冲突才是主因,单纯缩放效果有限。
- 04竞争解释
- 可能是 tokenizer / 头不一致、源模型过拟合、底座不相同,或全局系数不合适。符号冲突率与性能相关也不等于因果。
- 05最近相关工作与查新
- 精读 TIES 与 TSV 的干扰定义,再查任务向量归一化、层级系数与功能敏感度。直接做 SVD 或逐层合并已经有相关工作。
- 06候选贡献
- 候选贡献待查新:建立能预测某类任务损伤的机制诊断,并在未用于设计的新任务组合上验证;新统计量必须提供已有范数 / 冲突率之外的信息。
- 07公平比较
- 简单平均、Task Arithmetic、TIES、DARE、简单范数归一化,以及适用的 TSV 方法;统一系数与稀疏率的搜索预算。
- 08最小验证
- 先用两个专家,固定模型身份与数据,逐层恢复原底座或只调整增量尺度。加入范数匹配的随机掩码对照,逐项分离修剪、符号处理与缩放。再留出新的任务组合,测试诊断能否预测退化,而非只拟合已见结果。
- 09推翻或停止条件
- 若统一全局系数或修复参数对应就达到相同效果,放弃层级机制主张。若指标只解释用于构造它的任务,也不能声称可预测一般合并质量。
- 10资源与下一步
- 从少量同源小模型做无再训练合并,先完成干预分析,再考虑大规模任务组合。
用这些词继续查新
model merging task interference layer norm sign conflicttask singular vectors model merging interference functional sensitivity先对照上面的代表性工作,再找同义机制、后续论文和被引工作;检索到的空白需要人工核验。
前往一页纸,选择案例 01 ↓