[2606.24889] 基于图的嘈杂ASR语音错误纠正
[2606.24889] 基于图的嘈杂ASR语音错误纠正
作者: Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik
提交于2026年4月29日
摘要:
自动语音识别(ASR)系统尽管整体词错误率较低,仍会产生残留的词汇错误,这些错误对语义关键token(如命名实体、否定词和情感词)影响尤为严重。这些错误通常是结构性的,源于语音相似性而非随机噪声,导致简单的token级纠正方法不足以应对。我们提出了一种结构化的ASR纠正框架,称为G-SPIN,它将语音图建模与上下文语言理解相结合。图神经网络(GNN)首先为标记token构建声学上合理的候选邻域,明确地将纠正搜索空间限制在语音替代项内。随后,掩码语言模型(MLM)提供局部上下文评分,而经过指令微调的大语言模型(LLM)则在此紧凑候选集上执行最终的上下文感知重排序。通过将结构化的语音推理与上下文语义选择解耦,我们的方法在避免无约束生成的同时提高了纠正准确性。该框架轻量级、模块化,并完全在推理时运行。