CASE 01 / 关键词检索 / 检测 · 改变评估单位
单词测得很准,连续录音里为什么频繁误报?
第一步:把孤立词准确率换成完整音频上的每小时误报与目标词漏检曲线。
Speech Commands 已提供关键词检测数据和基线。离散短片段分类与连续语音搜索的负样本数量、边界和部署成本不同,不能用一个分类分数互相替代。
展开:原因假设、候选贡献与最小验证
- 01具体场景与价值
- 在会议录音里找固定专业词的出现时间,之后才考虑用户任意输入新词。先限定固定词表的连续检测任务。
- 02观察与证据
- 教学假设,待观测:孤立词分类不错,但近音词、词间拼接和背景人声导致重复或错误命中。按完整录音保存预测区间与参考词边界。
- 03原因假设与预测
- 候选原因是训练负例缺少真实连续上下文。预测:固定词表和阈值选择流程后,加入训练录音中挖出的近音负例,应该主要降低近音误报,而非所有输出一并减少。
- 04竞争解释
- 可能只是同一次命中被滑窗重复计数、标注漏词,或候选阈值没有校准;先修复时间合并和标注。
- 05最近相关工作与查新
- 对照关键词检测、spoken term detection、ASR 转写后检索与上下文偏置;逐项记录是否开放词表、是否有目标词训练样本、是否报告连续音频结果。
- 06候选贡献
- 候选贡献待查新:在极少目标词样本下,识别哪类连续上下文导致误报,并验证负例选择能否跨说话人迁移;仅把孤立词模型滑窗运行不构成新方法。
- 07公平比较
- 固定关键词模型、ASR 转写后精确 / 近音检索、随机负例与近音负例训练;固定总负例数量、解码预算及命中合并规则。
- 08最小验证
- 先标注少量独立长录音中的目标词与近音混淆词。训练 / 开发 / 测试按会话及说话人分开;在开发集锁定阈值和时间容差,测试报告每小时误报、固定误报水平的漏检率、定位误差和延迟。不能仅拼接孤立词来证明真实连续场景有效。
- 09推翻或停止条件
- 若合并重复命中就消除差异,停止模型解释;若同一误报水平下漏检无改善,或只记住训练中的近音词,则缩小贡献。
- 10资源与下一步
- 先跑现成模型与 ASR 检索,无需预训练。长负录音不足以稳定估计极低误报率时,报告时长和置信区间,不宣称达到部署指标。
用这些词继续查新
streaming keyword spotting false alarms per hour confusable negativesopen vocabulary keyword search spoken term detection ASR lattice先对照上面的代表性工作,再找同义机制、后续论文和被引工作;检索到的空白需要人工核验。
前往一页纸,选择案例 01 ↓