课题详情
课题背景:随着多模态大模型的发展,数据在模型训练中承载了越来越重要的位置,数据的选择、构建和处理也是当前音视频大模型的重要探索方向
具体工作:参与音视频大模型训练数据的管理、管线设计和迭代,配合训练一起不断迭代和优化
核心挑战:音视频数据相比图片模态具备信息高度冗余和缺少天然文本数据的特点,对于数据本身的insights和管线设计有非常大的挑战
课题要求
1、来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。
2、精通 PyTorch 框架与 Python 编程;深度掌握 主流MLLM和omni模型的训练数据 原理;熟悉多模态模型架构及 DeepSpeed/Megatron 分布式训练工具。
3、具备较强的问题分解与独立研究能力;能在数据和任务定义上给出清晰的拆解思路和方法。