CASE 01 / 音频检索 · 组合语义与难负例
能搜到狗和门,却分不清谁先发出声音?
第一步:构造事件相同、先后顺序不同的成对音频和查询。
展开:原因假设、候选贡献与最小验证
- 01具体场景与价值
- 用“关门后狗叫”检索录音。先固定两个可区分事件,研究顺序关系;以音频找相似音频可沿用排序协议,但正例定义需另写。
- 02观察与证据
- 教学假设,待观测:模型对“关门后狗叫”和“狗叫后关门”返回相似排名。先确认两条描述都能由人从音频中分辨。
- 03原因假设与预测
- 候选原因是全局表示偏向事件集合而忽略时序。预测:只交换事件顺序会显著改变人工相关性,却较少改变全局模型分数;时序局部匹配可能缩小这个差距。
- 04竞争解释
- 文本编码器可能忽略关系词,或数据本身存在未标注的多正例;拼接痕迹也可能被当成时序线索。
- 05最近相关工作与查新
- 查时序音频文本对齐、组合检索、局部匹配、多正例对比学习与 hard negatives;逐项比较是否真的测试事件次序。
- 06候选贡献
- 候选贡献待查新:确定时序关系在文本端还是音频端丢失,并据此设计局部比较或评价集;不能只给 CLAP 加一个模块就声称理解关系。
- 07公平比较
- 冻结 CLAP 全局检索、分段特征与简单时序匹配、只用事件词的查询;新方法保持相同骨干、候选池和训练配对数量。
- 08最小验证
- 以不同原始录音制作开发 / 测试配对,平衡拼接边界与音量;另用人工核验的自然录音复核。报告顺序对判别准确率、Recall@K 与多正例 mAP,并列事件名词查询结果。检查检索库是否存在被误当负例的相关音频。
- 09推翻或停止条件
- 若简单分段已经同样好,缩小结构创新;若只在合成拼接有效、自然事件无效,就不能宣称真实时序理解提升。
- 10资源与下一步
- 先缓存一个模型的片段嵌入,只做小候选池和人工核验;先诊断,不预训练新的大模型。
用这些词继续查新
text audio retrieval temporal compositional reasoning hard negativesaudio language retrieval multiple positives false negatives temporal order先对照上面的代表性工作,再找同义机制、后续论文和被引工作;检索到的空白需要人工核验。
前往一页纸,选择案例 01 ↓