Guiding an Automatic Speech Recognition Decoder Using Large Language Models
2026/7/27 8:06:26 网站建设 项目流程

文章主要内容和创新点

主要内容

本文聚焦于将大型语言模型(LLMs)集成到自动语音识别(ASR)系统中,解决传统ASR中语言模型(LM)与声学模型(AM)集成的挑战。传统ASR由声学模型(将音频转换为语言单位概率)、语言模型(评估词序列合理性)和解码机制(整合两者输出)组成,而LLMs虽在语言理解上表现优异,但难以直接融入ASR。

作者通过分解“给定音频信号的词序列最大后验概率(MAP)估计器”,提出了一种迭代解码方法:在每一步中,基于已预测的token序列作为提示,从LLM中采样候选token;通过声学模型将候选token与音频信号对齐并打分;结合LLM和声学模型的分数筛选最优候选,更新beam并用于下一步迭代,直至完成解码。

该方法为零样本方式(无需额外训练),允许AM和LLM独立训练与改进。实验在ALLSSTAR(短简单句)、WSJ0(新闻朗读语料)、TEDLIUM 3(专业演讲语料)三个数据集上验证,使用wav2vec 2.0、HuBERT作为声学模型,GPT-2、LLaMA 2、Falcon作为LLM,结果显示其在复杂句子、缩写和领域特定词汇的识别上表现突出。

创新点
  1. 新型集成框架:通过分解MAP估计器,提出迭代解码过程,实现LLM与声学模型的分离式集成,两者可独立训练,无需联合优化。
  2. 零样本解码:无需对LLM或声学模型进行额外微调,直接利用预训练模型,降低部署成本。
  3. 针对性优化:在处理复杂语音(如长句)、缩

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询