课题详情
课题背景:
近年来, 端到端语音对话大模型在智能客服、虚拟人交互、辅助诊疗等领域得到广泛应用,其具备低延迟、丰富副语言信息等优点,但模型智商的维持仍面临较大挑战。
课题挑战:
本课题研究聚焦模态对齐、跨模态语义迁移、动态融合推理等关键问题,通过自监督学习、专家混合机制等技术提升模型对复杂场景的适配能力。其核心目标是让智能系统精准捕捉多模态信息中的情感倾向与语义关联,实现更贴近人类交互习惯的自然对话。
具体工作:
参与语音大模型的全流程研发,包括跨模态对齐、多模态理解及生成,涵盖文本和语音等训练数据的清洗和制作、基础模型算法选型与优化,聚焦预训练、监督微调及强化学习等关键环节的技术迭代; 提高在远场、低信噪比、多人、音乐等场景下的理解及生成效果,改善模型在方言、副语言信息等方面的理解能力,加强情感对话能力。
课题要求
1、具有语音对话、语音识别、语音合成、语音翻译、语音合成转换、说话人识别等方向的研究经验;
2、掌握端到端多模态大模型的训练和调优技术;
3、熟悉实时对话模型的流式处理实现方案和多种模态之间对齐的技术实现;
4、掌握改善模型遵循复杂指令能力的技术。