RESEARCH / CASE NOTEBOOKS
科研 Idea 案例库从语音、音频到音乐与声学,再追问背后的机器学习问题。
7 个方向 · 28 个完整案例。 每个案例都沿着“观察现象 → 区分原因 → 对照已有工作 → 最小验证”展开。候选问题均为教学推演,未完成创新性查证或实验。
FIND A QUESTION / 怎么从方向想到问题
先找一个值得解释的反常现象。
设备、说话人、房间变了,哪种证据不再可靠?
看一个具体推演 ↗02 / 平均分掩盖问题总体变好,短事件、稀有类或瞬态发生了什么?
看一个具体推演 ↗03 / 两个目标互相冲突听感、识别、延迟,究竟需要优化哪个目标?
看一个具体推演 ↗04 / 方法的前提不成立同一种增强,对不同任务还保持标签吗?
看一个具体推演 ↗例如“做声纹识别”还只是方向;“同人跨设备的分数为什么低于异人同设备”才开始形成可验证的问题。若现象尚未观测,先在基线里确认它。
从声音任务出发
语音说了什么、谁在说、环境发生了什么,以及音乐和空间线索如何变化。
AUTOMATIC SPEECH RECOGNITION
语音识别
从听错了什么、何时决定输出、适配后谁被遗忘,寻找可解释的研究问题。
- 没人在说话,模型为什么还在输出?失效切片 → 机制区分
- 热词识别变好了,为什么没说的词也被插入?局部收益 → 整体代价
- 同一句话,为什么换个切块位置就识别错?人为边界 → 可控干预
- 学会新语言后,旧语言是真的被遗忘了吗?ASR × 持续学习
VOICE ANALYSIS
语音分析
关键词检索、语种、声纹、情感与健康:先问声音里哪种证据真正支持判断。
- 单词测得很准,连续录音里为什么频繁误报?关键词检索 / 检测 · 改变评估单位
- 一句话越短,语种置信度为什么反而很高?语种识别 · 证据不足与拒识
- 声纹模型认出的是人,还是录音设备?说话人验证 · 交叉控制混淆
- 情感识别分数高,是听出了情绪还是记住了台词?情感识别 · 标签含义与泛化
- 健康检测学到的是疾病信号,还是招募与设备差异?声音健康筛查 · 增量价值
AUDIO UNDERSTANDING
音频识别与分析
检索、事件、场景与异常:从时间关系、漏标、设备变化和正常变化中找突破口。
- 能搜到狗和门,却分不清谁先发出声音?音频检索 · 组合语义与难负例
- 整段分类正确,为什么漏掉半秒钟的声音?声音事件检测 · 标签粒度与时间分辨率
- 换一部手机,街道怎么就被识别成商场?声学场景识别 · 可用条件与域偏移
- 机器换了工况,正常声音为什么全变成异常?异常声音检测 · 正常变化与故障
MUSIC & ACOUSTICS
音乐与声学信号处理
从旋律、分离伪影、识别目标与空间线索出发,找到信号处理中的具体矛盾。
- 换了歌手和速度,模型还认得同一首作品吗?音乐检索 · 该保留什么不变性
- 平均分离分数提高了,鼓点为什么更糊?音乐源分离 · 平均指标与瞬态
- 降噪后更好听,语音识别为什么反而更差?语音增强 · 上下游目标冲突
- 声音类别认对了,位置为什么跟着房间跑?空间声学 · 检测与定位分开看
从机器学习方法出发
将表征、监督、模型合并与持续更新放进明确的任务和资源约束中。
MACHINE LEARNING FOR AUDIO
音频机器学习
把表征、伪标签和数据增强放回具体音频任务,判断方法为什么有效、又在哪里失效。
- 同一个编码器,为什么擅长识词却不擅长认人?自监督表征 · 任务需要的信息不同
- 伪标签越加越多,稀有声音为什么越来越学不会?半监督学习 · 置信偏差与覆盖
- 同样是变调,为什么识词受益、声纹和音乐却受损?数据增强 · 标签是否真的不变
MODEL MERGING
模型合并
先弄清模型为什么能合、为什么会相互伤害,再寻找比调系数更有解释力的问题。
- 两位专家都很强,为什么合起来反而变差?整体退化 → 层级机制
- 合并系数在验证集上很好,换一批任务为什么失效?选优过程 → 泛化边界
- 同一个 LoRA 更新,换种分解后合并结果为什么变了?等价表示 → 不变性检查
- 合并语音专家,提升来自互补知识还是训练随机性?模型合并 × 语音识别
CONTINUAL LEARNING
持续学习
从时间、可用信息和资源限制定义问题,同时检查旧知识保留与新知识学习。
- 遗忘很少,是记得好,还是根本没学进去?稳定性 × 可塑性
- 同样大小的记忆库,为什么罕见类别还是先被忘掉?记忆预算 → 样本价值
- 每个适配器都保留了,为什么真实输入还是选错专家?协议漏洞 → 可部署问题
- 不断合并新专家,独有知识会被平均掉吗?持续学习 × 模型合并 × ASR
CROSSOVER / 交叉方向
组合方向之后,把变量和代价说清楚。
沿着新语言到来 → 训练适配器 → 合并知识 → 检查旧语言追问:损失发生在训练还是合并?没有旧音频时,用什么信息决定合并系数?
也可以沿着声音增强 → 识别 → 情绪或声纹判断追问:前端保留的线索是否足够服务每个任务?先分别定位误差,再考虑共享表示。
交叉组合已有大量研究。案例中的来源用于查新起步,真正的差异还要对照具体条件与后续工作。
来源核对:2026-09-07。采用原始论文、官方数据与评测说明确认研究范围;未复现,亦非完整系统综述。年份按 arXiv 首发、论文出版或对应协议版本标注。