追踪失败,而非只看均值
同一个方法,究竟在哪一类输入上反复失败?
复现一个可运行的基线。把错误按输入长度、稀有类别、噪声、分布变化或负载分组,保存原始样本与日志。优先解释重复出现且有实际代价的模式。
- 留下什么
- 一张分组结果图 + 一组可重现的失败样本
- 容易误判的地方
- 只挑几个坏例子会夸大问题;在独立样本上检查发生频率。
RESEARCH / IDEA NOTEBOOK
先找具体、重要、尚未解释清楚的问题,再寻找解法。读论文、跑基线、观察真实使用、推演理论边界,都可以是起点。
开始写一页纸01 / 从方向到问题
我想做 RAG。
确定兴趣范围。新旧证据冲突时,答案会受什么影响?
指定场景与可观察现象。冲突没有进入决策过程,可能导致错误作答。
提出可被区分的原因。固定检索结果,控制冲突,比较风险与覆盖率。
用结果决定是否继续。上面是教学推演,问题是否新、机制是否成立,都需要另行查新与验证。
在 [具体场景与约束] 下,现有 [方法] 出现 [有证据的问题]。我怀疑原因是 [机制 / 假设];如果成立,改变 [变量] 应当带来 [可测预测]。
新手可以先选一个能运行、能解释评价指标的小任务,围绕一组失败样本问“为什么”。理论研究则可以从一个清晰定义、一个尚未闭合的界或一个反例开始。问题一开始不必宏大,但需要知道答案为什么有用。
02 / 从哪里找
这些是本站整理的工作方法。每次选一个入口,产出可检查的材料;读到论文的 future work 后,还要确认该问题今天是否仍然存在。
同一个方法,究竟在哪一类输入上反复失败?
复现一个可运行的基线。把错误按输入长度、稀有类别、噪声、分布变化或负载分组,保存原始样本与日志。优先解释重复出现且有实际代价的模式。
如果这个假设不成立,结论还成立吗?
从论文的方法、证明和数据处理里提取前提:标签完整、数据独立同分布、上下文可靠、网络稳定、用户愿意配合。一次改变一个有现实依据的条件,画出方法开始失效的边界。
限制效果的是算法、数据、内存、通信,还是人的操作成本?
先做 profiling 或流程观察,把总耗时和资源消耗拆开。围绕主要瓶颈提出机制,并估计即使完全消除它,端到端最多能改善多少。
两篇论文为什么得出不同结论?指标是否掩盖了真实效果?
对齐数据划分、预算、预处理和指标后复查差异。检查平均分与长尾、离线分与真实任务成功率是否一致,尝试用一个可控变量解释冲突。
另一个领域的方法解决了什么结构相同的问题?
先写两边共享的结构:例如有限预算下的选择、延迟反馈、局部信息决策。指出原机制迁移后哪条前提失效,以及必须怎样改造。
这个组件真的必要吗?现有保证究竟能推广多远?
经验方向逐项移除模块,检查收益是否来自训练预算或数据。理论方向先写清计算模型与假设,从小规模反例、特殊情形或上下界间隙入手。
选一篇任务定义或基线论文、一篇代表性强方法,再找一篇提出限制或相反结论的工作。篇数只是起步方式,不是查新完成标准。
每条笔记保留页码、图号和链接。读完尝试画出方法流程,并预测“改变某个条件后会发生什么”,再去代码或数据里检查。
03 / 向已发表工作学习提问
论文在多文档问答和键值检索任务中改变相关信息的位置,发现所测模型的表现会随位置变化,尤其在长上下文中间位置退化。
可以学的动作:把“能接收长输入”拆成“能否利用不同位置的信息”,通过受控评测揭示能力边界。这里的提问与评测设计本身就有价值。
这是论文在其模型与任务设置下的发现;不能直接推广到今天所有模型。仅重复同一现象,也不能据此声称新贡献。
Lost in the Middle · Liu et al., 2023 ↗论文指出,减少注意力计算量不一定带来实际加速,GPU 内存层级之间的读写也需要计入。其通过分块减少 HBM 与 SRAM 之间的数据搬运,设计精确注意力算法。
可以学的动作:先查实际瓶颈,再选择优化目标。研究问题从“怎样少做计算”进一步变成“怎样适应真实的内存层级”。
IO 感知注意力已是已有研究。本例用于学习问题重构,不代表这里发现了新的加速方向。
FlashAttention · Dao et al., 2022 ↗04 / 选择你的方向
以下六个案例都是教学假设,未完成针对候选方案的查新,也没有实际结果。重点看如何定位原因、做公平比较,以及什么证据会让自己改变想法。
初始想法:做一个更强的 RAG,加一个 Agent。
retrieval augmented generation conflicting evidence abstentionRAG selective prediction contradiction evidence用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓初始想法:给多模态模型加注意力,提升鲁棒性。
vision language models modality conflict text biasmultimodal counterfactual evaluation spurious correlation用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓初始想法:使用 AI 优化调度,让系统更快。
mixed workload head of line blocking tail latency schedulingsize aware scheduling starvation p99 latency用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓初始想法:用大模型自动修 bug,再加一个验证 Agent。
automated program repair plausible patches overfitting independent testsLLM program repair patch correctness test leakage用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓初始想法:做一个有解释功能的 AI 助手。
human AI decision making explanations overreliance calibrated relianceAI explanation source verification cognitive effort user study用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓初始想法:把机器学习加到一个经典算法中。
learning augmented algorithms consistency robustness prediction erroronline algorithms imperfect predictions lower bound用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。
在一页纸中载入该方向示例 ↓05 / 新在哪里,值不值得
先从主题词扩展到问题词、机制词与邻近领域术语。用学术检索找到论文,用 GitHub 核对实现与实际问题;社区帖子可以提供线索,但新颖性判断要回到原论文和最新工作。
| 比较维度 | 具体记录 | 追问差异 |
|---|---|---|
| 问题与条件 | 任务、人群、数据分布、约束 | 新条件会改变原来的解法吗? |
| 假设与机制 | 依赖什么,关键改动是什么 | 是必要的改变,还是已有机制重命名? |
| 已有证据 | 结果、证明、误差范围、失败边界 | 原论文真的没回答这个问题吗? |
| 代价与比较 | 数据、计算、部署与人工成本 | 相同条件下,简单方案能否做到? |
| 候选新增知识 | 发现 / 方法 / 数据 / 理论 / 设计原则 | 别人知道它以后,能做什么不同的事? |
它不能证明没人做过。保留最接近论文的原文依据;如果差异很小,先判断差异带来的价值,再决定缩小、转向或继续。
方法研究说明新机制及其优势;系统研究解释关键设计及端到端权衡;评测与数据研究建立可靠、能揭示问题的测量方式;理论研究给出严格命题、证明或边界;HCI 研究可以产生有依据的新理解与设计知识。
ICLR 2026 的指南关注问题、动机、证据与新增知识,明确不以达到最优结果作为价值的唯一条件。CHI 强调贡献、受益者及适合贡献类型的验证方法。这些可帮助反向检查选题,但不是所有计算机会议统一的录用标准。
这是选题讨论框架,不是创新打分表。缺哪项,就先补哪项。
06 / 从想法到第一份证据
把“我要做一个完整系统”暂时缩成“我最不确定的这条假设,怎样才能被检验”。以下顺序适用于经验研究;理论工作可把实验替换为引理、反例或证明步骤。
NeurIPS 的清单要求结论与证据范围一致,并交代假设、实验细节、不确定性和计算资源。把这些问题前移到选题阶段,有助于避免做完实验才发现结论无法支持。
NeurIPS · Paper Checklist ↗现象可靠,机制预测得到初步支持,查新留下实质差异,成本可接受。下一步扩大条件范围。
结果波动大、判定标准不可靠,或缺强基线。先修好证据链,再判断方法优劣。
问题由实现错误造成、已被简单方案解决,或核心命题被反例推翻。保留记录,重新定位未知点。
先选资源与你匹配的证据形式:可控评测、错误分析、小模型机制检查、CPU 上的系统模拟、开源项目缺陷研究、理论推演,或具备参与者条件的 HCI 研究。它们仍需要严谨设计。
不要默认小模型发现一定适用于大模型、模拟器结果一定适用于生产,或少量试用代表广泛用户。把外推限制写清楚,再选择最有价值的一项扩展验证。
07 / 现在开始写
先填写你知道的内容。未知项写清下一步怎么查;用 AI 陪练时,让它帮你找竞争解释、查新线索与反例,并逐条核验它的输出。
内容仅在当前页面内编辑,不会自动保存;离开前请复制或下载。示例没有完成查新,也没有实际实验结果。
谁在什么任务、约束下遇到问题?解决后谁受益?
失败样本、日志、图表或论文页码是什么?未做的实验明确写“待验证”。
因为 X,所以在条件 C 下出现 Y;改变 X 后应怎样变化?
除了你的原因,还有什么能解释现象?怎样区分?
记录题名 / DOI / 链接、具体差异、检索词与日期。未知就写待查。
相对最近工作,究竟新增了什么知识或能力?为什么值得做?
当前强基线、简单方案、相同数据 / 预算 / 环境,以及关键消融。
只检验一个关键不确定性:改变什么、固定什么、测什么、怎样留出验证数据?
什么结果会让你放弃当前解释?事前定义实际有意义的改善门槛。
可用设备、数据、时间;最先做的一项检查及时间上限。
还未填写:具体场景与价值、观察与证据、原因假设与预测、竞争解释、最近相关工作与查新、候选贡献、公平比较、最小验证、推翻或停止条件、资源与下一步。
08 / 继续阅读
指南、步骤、问题句式和教学案例由本站整理;不是来源机构发布的教程。真实论文案例按原始摘要范围概述。来源核对于 2026-09-07,六个教学方案的候选创新性未核验。
用目标、现状、价值、风险、成本和阶段检验审视研究计划。
看具体问题、方法动机、证据和新增知识;价值不必只靠刷新最优结果体现。
核对结论范围、假设、复现、实验设置、不确定性与计算资源。
不同类型的 HCI 贡献需要适合自身的方法、证据与相关工作比较。
历史案例:通过改变证据位置,检验模型实际利用长上下文的能力。
历史案例:把 GPU 内存层级之间的数据搬运纳入注意力算法设计。
DARPA 的问题清单适合追问研究目标、价值、风险、资源与验证节点;这里的一页纸据此类问题意识组织,并结合计算机研究中的查新和证据要求扩展。
继续使用科研网站、方法与 Skill 库 ↗