课题详情
课题背景:
针对ASR在复杂场景(多轮对话、噪声、口音)的识别瓶颈及传统模型迭代慢、响应滞后问题,利用LLM的上下文推理与热词感知能力,构建可敏捷适应线上变化、快速修复识别缺陷的新一代架构。
课题挑战:
1、实时响应滞后:传统模型无法即时吸收新热词、适应主题切换,线上问题修复不及时。
2、语境歧义难解:缺乏长上下文参考,易混淆同音词或在噪声中丢失关键语义。
3、LLM流式效果不佳:低延迟流式场景下,音频特征与LLM动态文本特征的维度高效对齐困难,影响实时识别效果。
具体工作:
1、构建动态上下文修复机制:研发LLM推理模块捕捉对话主题演变,设计动态提示工程注入实时主题与热词,修正语境缺失错误。
2、开发热词自适应与在线纠偏方案:建立热词库与解码器毫秒级联动,生成候选修正列表,实现无需全量重训的热修复能力。
3、实现跨模态特征高效对齐:研究音文特征维度映射算法,验证最优融合架构,平衡开销与效果,保障复杂场景高准确率。
课题要求
1、计算机、人工智能、数学等相关专业的全日制研究生及以上学历;
2、熟悉ASR语音识别、LLM模型项目;
3、具备 Python/C++ 的算法实现能力,有深度学习框架 PyTorch/TensorFlow 经验。