RESEARCH / IDEA NOTEBOOK

计算机研究,如何想出好 Idea?从一个反常现象,到一个值得验证的新问题。

资源库 ↗

先找具体、重要、尚未解释清楚的问题,再寻找解法。读论文、跑基线、观察真实使用、推演理论边界,都可以是起点。

开始写一页纸

按方向练习如何想 Idea

查看全部 28 个案例 ↗

01 / 从方向到问题

“做大模型”是方向,研究问题还要再走几步。

方向

我想做 RAG。

确定兴趣范围。
问题

新旧证据冲突时,答案会受什么影响?

指定场景与可观察现象。
假设

冲突没有进入决策过程,可能导致错误作答。

提出可被区分的原因。
验证

固定检索结果,控制冲突,比较风险与覆盖率。

用结果决定是否继续。

上面是教学推演,问题是否新、机制是否成立,都需要另行查新与验证。

一个可操作的问题句式

[具体场景与约束] 下,现有 [方法] 出现 [有证据的问题]。我怀疑原因是 [机制 / 假设];如果成立,改变 [变量] 应当带来 [可测预测]

新手可以先选一个能运行、能解释评价指标的小任务,围绕一组失败样本问“为什么”。理论研究则可以从一个清晰定义、一个尚未闭合的界或一个反例开始。问题一开始不必宏大,但需要知道答案为什么有用。

02 / 从哪里找

六种寻找 Idea 的入口

这些是本站整理的工作方法。每次选一个入口,产出可检查的材料;读到论文的 future work 后,还要确认该问题今天是否仍然存在。

01

追踪失败,而非只看均值

同一个方法,究竟在哪一类输入上反复失败?

复现一个可运行的基线。把错误按输入长度、稀有类别、噪声、分布变化或负载分组,保存原始样本与日志。优先解释重复出现且有实际代价的模式。

留下什么
一张分组结果图 + 一组可重现的失败样本
容易误判的地方
只挑几个坏例子会夸大问题;在独立样本上检查发生频率。
02

把默认假设写出来

如果这个假设不成立,结论还成立吗?

从论文的方法、证明和数据处理里提取前提:标签完整、数据独立同分布、上下文可靠、网络稳定、用户愿意配合。一次改变一个有现实依据的条件,画出方法开始失效的边界。

留下什么
假设清单 + 条件变化下的性能或误差曲线
容易误判的地方
随意造一个极端场景不等于重要问题;先说明该条件在哪里发生。
03

测量真正的瓶颈

限制效果的是算法、数据、内存、通信,还是人的操作成本?

先做 profiling 或流程观察,把总耗时和资源消耗拆开。围绕主要瓶颈提出机制,并估计即使完全消除它,端到端最多能改善多少。

留下什么
开销分解 + 可实现的改进上界
容易误判的地方
只优化占比很小的模块,可能局部快很多、整体几乎不变。
04

追问相反的结论

两篇论文为什么得出不同结论?指标是否掩盖了真实效果?

对齐数据划分、预算、预处理和指标后复查差异。检查平均分与长尾、离线分与真实任务成功率是否一致,尝试用一个可控变量解释冲突。

留下什么
可对照的复现实验 + 差异来源说明
容易误判的地方
复现失败先排查实现与环境;不能直接断言原论文错误。
05

迁移机制,而非拼装名字

另一个领域的方法解决了什么结构相同的问题?

先写两边共享的结构:例如有限预算下的选择、延迟反馈、局部信息决策。指出原机制迁移后哪条前提失效,以及必须怎样改造。

留下什么
结构对应表 + 必要改动 + 简单迁移基线
容易误判的地方
A + B 可以是候选方案;研究贡献要靠必要性、差异和证据建立。
06

删掉复杂性,寻找边界

这个组件真的必要吗?现有保证究竟能推广多远?

经验方向逐项移除模块,检查收益是否来自训练预算或数据。理论方向先写清计算模型与假设,从小规模反例、特殊情形或上下界间隙入手。

留下什么
最小充分方案,或反例 / 引理 / 条件边界
容易误判的地方
没发现显著差异不等于等价;有限规模枚举也不能替代普遍证明。
读论文时,具体记什么才容易长出 Idea?

选一篇任务定义或基线论文、一篇代表性强方法,再找一篇提出限制或相反结论的工作。篇数只是起步方式,不是查新完成标准。

  1. 问题:到底要解释或解决什么?对谁重要?
  2. 依赖:方法成立要什么数据、标签、预算、硬件或用户行为?
  3. 关键选择:为什么这样设计?换成最简单方案会怎样?
  4. 证据:哪张图或哪个定理最支撑结论?还没覆盖什么条件?
  5. 我的检查:写一个反例、一个竞争解释或一个最小实验。

每条笔记保留页码、图号和链接。读完尝试画出方法流程,并预测“改变某个条件后会发生什么”,再去代码或数据里检查。

03 / 向已发表工作学习提问

两个真实案例:创新来自把问题看清楚

评测与现象 · 2023

Lost in the Middle

论文在多文档问答和键值检索任务中改变相关信息的位置,发现所测模型的表现会随位置变化,尤其在长上下文中间位置退化。

可以学的动作:把“能接收长输入”拆成“能否利用不同位置的信息”,通过受控评测揭示能力边界。这里的提问与评测设计本身就有价值。

这是论文在其模型与任务设置下的发现;不能直接推广到今天所有模型。仅重复同一现象,也不能据此声称新贡献。

Lost in the Middle · Liu et al., 2023
算法与系统 · 2022

FlashAttention

论文指出,减少注意力计算量不一定带来实际加速,GPU 内存层级之间的读写也需要计入。其通过分块减少 HBM 与 SRAM 之间的数据搬运,设计精确注意力算法。

可以学的动作:先查实际瓶颈,再选择优化目标。研究问题从“怎样少做计算”进一步变成“怎样适应真实的内存层级”。

IO 感知注意力已是已有研究。本例用于学习问题重构,不代表这里发现了新的加速方向。

FlashAttention · Dao et al., 2022

04 / 选择你的方向

把模糊想法,推演成可验证的问题

以下六个案例都是教学假设,未完成针对候选方案的查新,也没有实际结果。重点看如何定位原因、做公平比较,以及什么证据会让自己改变想法。

大模型 / RAG证据冲突时,系统为什么仍然自信作答?

初始想法:做一个更强的 RAG,加一个 Agent。

具体场景与价值
面向有版本更新的技术文档问答。在证据冲突时,用户需要正确区分版本,或得到可解释的拒答。
观察与证据
教学设想,尚未观测:同一问题检索出新旧两版说明时,系统可能采用过时结论。先保存问题、证据、时间信息、答案和模型版本。
原因假设与预测
候选解释:证据间的冲突未参与回答决策。预测:在检索集合不变时,显式检测冲突并设置拒答机制,可能降低错误作答风险。
竞争解释
也可能只是正确证据没被检索到、时间标签缺失、上下文顺序偏差,或答案评判不可靠。需分别控制。
最近相关工作与查新
待查:冲突证据处理、时间感知 RAG、选择性预测与拒答。逐篇比较冲突定义、可用元数据、拒答策略和评估方式;不能把已有拒答机制当新贡献。
候选贡献
候选贡献待查新:某一明确冲突条件下的失效分析,或在固定回答覆盖率下更可靠的决策机制。单纯加检测器尚不能确立创新。
公平比较
普通 RAG、按时间过滤的简单规则、可运行的相关拒答方法;固定模型、检索结果、token 预算并计入额外调用成本。
最小验证
先构造一小组可人工核验的新旧证据对和无冲突对。只改变冲突程度,分开开发集与未参与调参的测试集。比较相同覆盖率下的错误风险,并检查来源支持度、延迟与成本。小样本先判断方向,正式结论需扩大验证。
推翻或停止条件
若时间过滤已解决问题,或增益在控制检索质量后消失,就放弃当前机制解释。若只能靠大量拒答降低错误,也不能声称整体更可靠。
资源与下一步
先用一个可复现的小模型或固定版本 API,人工核验有限的文档对;第一步确认冲突现象真实存在,再估算扩大评估的成本。

起步检索词

retrieval augmented generation conflicting evidence abstentionRAG selective prediction contradiction evidence

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓
视觉 / 多模态图像和文字冲突时,模型到底相信谁?

初始想法:给多模态模型加注意力,提升鲁棒性。

具体场景与价值
图文内容不完全一致的识别任务,关注模型能否依据真正与任务相关的模态作答。
观察与证据
教学设想,尚未观测:图片不变,只修改无关配文,答案可能跟着变化。需要配对样本和可核验标签。
原因假设与预测
候选解释:模型依赖训练中的文字捷径。预测:改变无关文字的影响大于改变真正的视觉证据,且这种差异在控制语义后仍存在。
竞争解释
文字可能确实包含任务所需信息;图像可能不可辨认;配对编辑也可能引入额外线索。
最近相关工作与查新
待查:模态偏置、跨模态冲突、反事实评测和相关鲁棒训练。比较已有基准是否已覆盖相同干预与结论。
候选贡献
候选贡献待查新:可靠的诊断协议与明确的失效边界;若设计训练策略,还需说明为什么比现有数据增强更有效。
公平比较
原模型、图像单模态、文字单模态、简单文字屏蔽 / 数据增强;固定基础模型与训练预算。
最小验证
建立配对的四种条件:图文一致、仅文字冲突、仅图像变化、无关文字变化。人工检查标签和编辑质量。按原始样本分组划分数据,比较配对差异、各条件准确率及正常样本代价。
推翻或停止条件
若效应由错误标签、编辑痕迹或任务本来需要文字解释,放弃文字捷径假设;若简单屏蔽已取得相同收益,重新审视复杂方案。
资源与下一步
先使用已有可访问模型和小规模人工审核样本,确认诊断协议有效后再考虑训练。

起步检索词

vision language models modality conflict text biasmultimodal counterfactual evaluation spurious correlation

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓
系统 / 网络平均延迟很低,为什么高峰期仍然卡顿?

初始想法:使用 AI 优化调度,让系统更快。

具体场景与价值
长短任务混合的服务队列,在固定硬件与到达负载下关心尾延迟、吞吐量和长任务公平性。
观察与证据
教学设想,尚未观测:均值改善但短任务 p99 恶化。先分解排队时间、实际服务时间和资源利用率。
原因假设与预测
候选解释:长任务占据队头造成阻塞。预测:在可区分任务大小时,有限度分流能降低短任务等待,同时保持长任务可接受的完成时间。
竞争解释
也可能是垃圾回收、锁竞争、I/O 抖动或已经过载;若判断错瓶颈,改调度不会解决。
最近相关工作与查新
待查:队头阻塞、大小感知调度、多级反馈队列和尾延迟优化。该现象和常见策略已有大量研究,需要找到尚未覆盖的具体约束。
候选贡献
候选贡献待查新:未知任务大小或估计有误的约束下,某个可解释的延迟与公平性权衡;仅实现短任务优先没有新意证明。
公平比较
FIFO、简单大小感知策略、适用的当前调度方法;使用相同硬件、请求轨迹和预热规则,计入预测及调度开销。
最小验证
先在模拟器或可控本地服务上改变长短任务比例与到达负载。固定服务时间分布,测各类任务延迟分布、吞吐量、最长等待与调度开销,重复独立轨迹。固定到达过程,避免变慢后发出的请求也随之减少而低估排队。
推翻或停止条件
若主要耗时不在排队,或者短任务获益来自长任务饥饿,就停止当前方案。若预测开销抵消收益,也不能只报告队列内部指标。
资源与下一步
普通 CPU 上先做可控负载诊断;第一步是开销分解,不依赖先训练调度模型。

起步检索词

mixed workload head of line blocking tail latency schedulingsize aware scheduling starvation p99 latency

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓
软件工程测试明明通过了,修复为什么还是错的?

初始想法:用大模型自动修 bug,再加一个验证 Agent。

具体场景与价值
自动程序修复中,补丁通过现有测试但仍可能违背程序意图,开发者需要更可靠的补丁筛选。
观察与证据
教学设想,尚未观测:部分候选补丁通过原测试,却在独立边界测试失败。需保存失败用例和人工核验记录。
原因假设与预测
候选解释:补丁过拟合可见测试。预测:加入独立构造的行为约束,能在相同候选预算下提高补丁筛选精度。
竞争解释
独立测试的预期结果可能错误;测试生成器和修复器也可能共享同一种盲点。
最近相关工作与查新
待查:补丁过拟合、补丁正确性评估、差分测试、性质测试及 LLM 修复验证。特别查是否已有相同的约束来源和筛选策略。
候选贡献
候选贡献待查新:一种有独立依据的验证信号及其适用边界。新增一个 Agent 角色本身不构成验证信号。
公平比较
只用原测试、简单额外测试、可复现的补丁验证方法;固定修复模型、候选数量和总生成预算。
最小验证
在可公开复现的历史缺陷上回放修复;独立隐藏测试不提供给生成或调参阶段。按项目划分数据,报告正确补丁保留率、错误补丁通过率、人工复核一致性和额外成本。
推翻或停止条件
若收益来自隐藏测试泄漏,或增加同等测试预算就能取得相同结果,放弃所声称的机制优势。
资源与下一步
先挑少量有明确规范的缺陷,建立可重复测试环境;先核验判定器可靠性,再扩大项目范围。

起步检索词

automated program repair plausible patches overfitting independent testsLLM program repair patch correctness test leakage

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓
人机交互展示 AI 的依据,会帮助用户纠错吗?

初始想法:做一个有解释功能的 AI 助手。

具体场景与价值
用户借助 AI 完成有可核查答案的任务,需要在节省时间和发现错误之间做选择。
观察与证据
教学设想,尚未观测:用户可能阅读了说明,却没有核对原始依据。先通过试用观察与访谈明确使用过程。
原因假设与预测
候选解释:核验成本影响用户是否纠错。预测:降低定位原始证据的操作成本,可能提升错误发现能力,但也可能拖慢任务。
竞争解释
变化也可能来自界面新鲜感、额外提示或参与者对实验目的的猜测,而非证据核验。
最近相关工作与查新
待查:人机协作、自动化依赖、解释界面、证据核验与交互成本。比较人群、任务风险、界面操作和结论范围。
候选贡献
候选贡献待查新:核验成本如何影响依赖行为的证据与设计原则。做出界面只是研究材料,尚未形成贡献。
公平比较
仅答案、文字解释、可直接定位来源的解释;保持底层 AI 答案、可见信息与正确 / 错误题比例一致,区分信息差异与交互差异。
最小验证
先做流程试用修正任务,正式研究按设计估计样本量并控制顺序效应。记录任务正确率、对正确和错误建议的依赖、完成时间及核验行为,结合访谈解释原因;涉及参与者时按机构要求处理同意与审查。
推翻或停止条件
若只提高主观信任而未改善判断,不能称为提升可靠性;若用户无法完成任务,应先修正任务或界面。
资源与下一步
先验证任务与交互可操作,招募和正式数据采集留出独立时间;试用结果不直接推为普遍用户结论。

起步检索词

human AI decision making explanations overreliance calibrated relianceAI explanation source verification cognitive effort user study

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓
算法 / 理论当预测不准时,算法的保证还剩多少?

初始想法:把机器学习加到一个经典算法中。

具体场景与价值
使用外部预测的在线决策问题,预测准确时希望获益,预测错误时仍需要可解释的最坏情况保证。
观察与证据
教学设想,尚未证明:某个理想预测假设一旦被轻微破坏,已有推导可能不再适用。需要明确指出证明中依赖它的步骤。
原因假设与预测
候选命题:在明确定义的误差模型下,采用限制预测影响的策略,可能获得依赖误差大小的性能界。
竞争解释
误差定义可能掩盖困难实例;已有定理可能通过变量替换就包含这个命题。
最近相关工作与查新
待查:学习增强算法、一致性与鲁棒性权衡、对应在线问题的上下界。逐项对齐计算模型、对手能力和误差定义。
候选贡献
候选贡献待查新:更弱假设下的保证、紧界、反例或不可能性结果;需要严格比较已有界。
公平比较
无预测的经典算法、已有预测算法与相同模型中的已知界。经验对比只能补充理论分析。
最小验证
先写形式化定义,枚举小实例寻找反例,再尝试证明一个受限情形的引理。检查零误差和极大误差两端;将小实例计算作为找反例工具,普遍命题仍需证明。
推翻或停止条件
找到满足全部假设的反例即可推翻当前命题。若现有定理已覆盖结果,应改问更弱条件、紧性或其他尚未回答的问题。
资源与下一步
先用纸笔和小规模枚举检查定义与边界,设定完成一个引理或反例的短周期,再决定是否扩大问题。

起步检索词

learning augmented algorithms consistency robustness prediction erroronline algorithms imperfect predictions lower bound

用问题与机制分别检索,再沿引用和被引扩展;这些检索词不代表已查明新颖性。

在一页纸中载入该方向示例 ↓

05 / 新在哪里,值不值得

创新性要和最近相关工作逐项对照。

先从主题词扩展到问题词、机制词与邻近领域术语。用学术检索找到论文,用 GitHub 核对实现与实际问题;社区帖子可以提供线索,但新颖性判断要回到原论文和最新工作。

  1. 写两组词。一组描述问题,例如“冲突证据 + 拒答”;一组描述机制,例如“选择性预测 + 置信校准”。中英文与同义词都试。
  2. 锁定最接近的工作。先精读 3–5 篇与问题或机制最接近的论文,再向其引用、被引、作者后续工作和近期预印本扩展。
  3. 做差异矩阵。同一套列记录每篇论文和自己的候选方案;不只比较标题或摘要。
  4. 主动寻找反证。检索“你的方法换一个名字”的可能性。记录检索渠道、检索式、日期和未覆盖范围。继续研究期间定期复查。
每行一篇真实工作;最后一行写自己的候选方案
比较维度具体记录追问差异
问题与条件任务、人群、数据分布、约束新条件会改变原来的解法吗?
假设与机制依赖什么,关键改动是什么是必要的改变,还是已有机制重命名?
已有证据结果、证明、误差范围、失败边界原论文真的没回答这个问题吗?
代价与比较数据、计算、部署与人工成本相同条件下,简单方案能否做到?
候选新增知识发现 / 方法 / 数据 / 理论 / 设计原则别人知道它以后,能做什么不同的事?
“未检索到”只是当前检索结果。

它不能证明没人做过。保留最接近论文的原文依据;如果差异很小,先判断差异带来的价值,再决定缩小、转向或继续。

贡献可以长成不同的样子

方法研究说明新机制及其优势;系统研究解释关键设计及端到端权衡;评测与数据研究建立可靠、能揭示问题的测量方式;理论研究给出严格命题、证明或边界;HCI 研究可以产生有依据的新理解与设计知识。

ICLR 2026 的指南关注问题、动机、证据与新增知识,明确不以达到最优结果作为价值的唯一条件。CHI 强调贡献、受益者及适合贡献类型的验证方法。这些可帮助反向检查选题,但不是所有计算机会议统一的录用标准。

投入大实验前,先过五个问题

  • 真实:问题有可复查的证据,或有明确的理论动机吗?
  • 重要:结果会改变谁的理解、能力或决策?
  • 有差异:最近相关工作不能直接覆盖它的原因是什么?
  • 可检验:有能区分原因、支持或推翻命题的办法吗?
  • 能推进:现有资源足够检查最关键的不确定性吗?

这是选题讨论框架,不是创新打分表。缺哪项,就先补哪项。

06 / 从想法到第一份证据

最小验证,只回答一个关键问题。

把“我要做一个完整系统”暂时缩成“我最不确定的这条假设,怎样才能被检验”。以下顺序适用于经验研究;理论工作可把实验替换为引理、反例或证明步骤。

  1. 先验证问题存在。固定版本与环境,跑一个可信基线,保存原始失败证据。先排查 bug、数据泄漏、错误标注和不合理指标。
  2. 再区分原因。只改变关键变量,同时设计“原因不存在”的对照条件。列出竞争解释,避免把相关性当成机制证据。
  3. 试最简单的干预。新方法要与有竞争力的已有方法、简单规则及关键消融比较;保证数据、调参机会与资源预算可比。
  4. 留出独立检验。开发数据用来找想法,未参与设计的测试数据检验它;按问题需要跨种子、数据、工作负载或参与者复核,并说明波动来源。
  5. 写结果判据。事先确定主要指标、实际有意义的改善幅度和可接受的成本。探索中改了假设就记录下来,并用新证据确认。

NeurIPS 的清单要求结论与证据范围一致,并交代假设、实验细节、不确定性和计算资源。把这些问题前移到选题阶段,有助于避免做完实验才发现结论无法支持。

NeurIPS · Paper Checklist

继续验证

现象可靠,机制预测得到初步支持,查新留下实质差异,成本可接受。下一步扩大条件范围。

先补证据

结果波动大、判定标准不可靠,或缺强基线。先修好证据链,再判断方法优劣。

调整问题

问题由实现错误造成、已被简单方案解决,或核心命题被反例推翻。保留记录,重新定位未知点。

没有大算力,怎样开始?

先选资源与你匹配的证据形式:可控评测、错误分析、小模型机制检查、CPU 上的系统模拟、开源项目缺陷研究、理论推演,或具备参与者条件的 HCI 研究。它们仍需要严谨设计。

不要默认小模型发现一定适用于大模型、模拟器结果一定适用于生产,或少量试用代表广泛用户。把外推限制写清楚,再选择最有价值的一项扩展验证。

07 / 现在开始写

我的 Idea 一页纸

先填写你知道的内容。未知项写清下一步怎么查;用 AI 陪练时,让它帮你找竞争解释、查新线索与反例,并逐条核验它的输出。

内容仅在当前页面内编辑,不会自动保存;离开前请复制或下载。示例没有完成查新,也没有实际实验结果。

谁在什么任务、约束下遇到问题?解决后谁受益?

失败样本、日志、图表或论文页码是什么?未做的实验明确写“待验证”。

因为 X,所以在条件 C 下出现 Y;改变 X 后应怎样变化?

除了你的原因,还有什么能解释现象?怎样区分?

记录题名 / DOI / 链接、具体差异、检索词与日期。未知就写待查。

相对最近工作,究竟新增了什么知识或能力?为什么值得做?

当前强基线、简单方案、相同数据 / 预算 / 环境,以及关键消融。

只检验一个关键不确定性:改变什么、固定什么、测什么、怎样留出验证数据?

什么结果会让你放弃当前解释?事前定义实际有意义的改善门槛。

可用设备、数据、时间;最先做的一项检查及时间上限。

已填写 0 / 10

还未填写:具体场景与价值、观察与证据、原因假设与预测、竞争解释、最近相关工作与查新、候选贡献、公平比较、最小验证、推翻或停止条件、资源与下一步。

查看导出内容与 AI 陪练提示词

08 / 继续阅读

参考来源与适用边界

指南、步骤、问题句式和教学案例由本站整理;不是来源机构发布的教程。真实论文案例按原始摘要范围概述。来源核对于 2026-09-07,六个教学方案的候选创新性未核验。

DARPA 的问题清单适合追问研究目标、价值、风险、资源与验证节点;这里的一页纸据此类问题意识组织,并结合计算机研究中的查新和证据要求扩展。

继续使用科研网站、方法与 Skill 库 ↗