CASE 01 / 稳定性 × 可塑性
遗忘很少,是记得好,还是根本没学进去?
第一步:把旧任务保持与新任务学习曲线放在同一张实验记录里。
展开:原因假设、候选贡献与最小验证
- 01具体场景与价值
- 模型顺序学习多个任务,评估既要考虑保留旧知识,也要考虑学习新任务的能力;冻结主干、正则化等方法会改变两者权衡。
- 02观察与证据
- 教学假设,待观测:某方法遗忘指标很低,但后续任务训练损失下降越来越慢,或新任务最终表现不佳。
- 03原因假设与预测
- 候选原因是过强稳定约束限制了更新。预测:适当放松约束后新任务恢复学习,同时旧任务可能下降;需要观察完整权衡,而非只选一个遗忘数值。
- 04竞争解释
- 后续任务可能本来更难,学习率过小或优化器状态不适配;样本数量与标签噪声差异也会改变学习速度。
- 05最近相关工作与查新
- 查稳定性—可塑性、欠学习、可塑性丧失与冻结预训练模型基线;增长网络已是已知路径,增加模块本身需要额外差异。
- 06候选贡献
- 候选贡献待查新:提出能区分任务变难与模型学不动的诊断,并在固定容量 / 算力下改善两者权衡;不要预设所有慢学习都由神经元失活造成。
- 07公平比较
- 冻结模型、顺序微调、简单正则强度扫描;同初始化单任务训练作难度参照,清楚标注其额外训练成本与用途。
- 08最小验证
- 改变任务顺序并对调难度,固定数据量、步数和优化器策略。记录每阶段对全部已见任务的 R[t,i],同时报告新任务学习曲线、最终性能和旧任务回退。扫描约束强度,画学习与保持的权衡;只凭单个死神经元比例不做机制结论。
- 09推翻或停止条件
- 如果把困难任务提前仍然同样难,先修正任务难度解释;如果低遗忘只是冻结造成的新任务零进步,就不能称为更有效的持续学习。
- 10资源与下一步
- 先用短任务序列和小网络建立诊断,再看长序列是否出现一致趋势;参数增长的方法另报容量随时间的曲线。
用这些词继续查新
continual learning stability plasticity underlearning frozen baselineloss of plasticity continual learning learning speed task difficulty先对照上面的代表性工作,再找同义机制、后续论文和被引工作;检索到的空白需要人工核验。
前往一页纸,选择案例 01 ↓