VoiceCodeBench:评估自动语音识别中的精确结构化标记恢复
VoiceCodeBench: Evaluating Exact Structured-Token Recovery in Automatic Speech Recognition
浏览论文内容
中文总结 AI 辅助
本研究推出VoiceCodeBench基准,评估英文ASR的精确结构化标记恢复,发现WER与相关指标相关性为-0.73,最高TSR仅68.7%,需实体敏感指标评估ASR输出的精确值保留情况。
中文摘要 AI 辅助
自动语音识别(ASR)系统通常用词错误率(WER)进行评估,但许多语音工作流依赖于标识符、路径和测量值的精确书面值。转录文本可能看起来流畅且WER较低,却破坏了下游系统必须解析、存储或执行的值。我们推出VoiceCodeBench,这是一个用于评估英文ASR中精确结构化标记恢复的基准。它包含300个人录制的工作场所片段,涵盖8个工作流领域和26种实体类型的1482个经审核的目标实体,每个实体都有可从音频中恢复的规范书面形式。在仅原始音频协议下,系统仅接收音频字节,无额外上下文或元数据。除WER外,我们还评估规范标记/实体匹配(CTEM)、任务成功率(TSR)和每种类型的精确恢复。在12个基线ASR系统中,较低的WER通常对应更好的结构化标记恢复,但并不能完全决定:WER与CTEM、WER与TSR的斯皮尔曼相关系数均为-0.73。TSR最高的基线仅达到68.7%,近三分之一的录音至少有一个工作流关键值未被恢复。这些结果表明,需要实体敏感指标来评估ASR输出是否保留了生产系统必须解析、路由、存储、比较或执行的精确值。
英文摘要
Automatic speech recognition is usually evaluated with word error rate (WER), although voice workflows often require exact written values. VoiceCodeBench measures whether transcripts preserve identifiers, paths, commands, and other structured tokens needed by downstream software. It contains 300 human-recorded English workplace segments (5.59 hours, 85 speakers) and 1,482 audited entities across 26 types and eight domains. Under a raw-audio-only protocol, we evaluate 19 batch and streaming systems using WER, Canonical Token/Entity Match (CTEM), and strict segment-level Task Success Rate (TSR). Across systems, WER has little rank agreement with CTEM (Spearman $ρ=-0.28$) or TSR ($ρ=-0.22$). The best CTEM and TSR are 91.8% and 68.7%. Even the strongest system therefore leaves nearly one-third of recordings with an unrecovered critical value. Symbol-, separator-, and boundary-sensitive entities account for most errors.
发表机构
- Besimple AI
机构由 AI 辅助整理,请以论文原文为准。