课题详情
课题背景
研发面向多模态理解(VLM)、图像生成、视频生成、语言理解和生成、3D大模型的高效推理框架和算子优化,通过底层算子优化、推理框架架构设计、深度并行优化、智能调度策略等全栈技术突破,在保证模型精度的前提下,大幅降低推理成本、提升性能吞吐和用户体验。
课题挑战
1.多模态长上下文的显存与延迟挑战:图像、视频等多模态输入上下文长度激增,KV Cache显存占用呈指数级增长,首字延迟显著恶化,显存压力大
2.异构模态并行优化挑战:不同模态的模型结构差异巨大,难以统一并行策略,且在复杂pipeline中实现算子/通信/CPU三重深度Overlap极具挑战
3.多模态信息传输在弱互联通信下的瓶颈:多阶段推理产生大量跨机Tensor/KV传输,极易触发网络吞吐瓶颈。
4.多模态海量异构数据流量调度:图/视频/3D调度诉求截然不同,万卡级集群中实现推/拉模式动态融合、KV Cache亲和性路由对全局调度器设计提出严苛要求
5.底层算子性能:MoE、Attn、通算融合、量化压缩、低比特通信等算子需针对不同GPU架构极致优化,且需保证跨模态泛化性能
具体工作:
1.长上下文优化:EPD /AF分离、kv cache 压缩/管理、算子融合、通信计算Overlap、CPUGPU并行
2.并行与调度优化:多模态并行和调度策略
3.通信优化:NVLink/RDMA/TCP通信、异步编排、NUMA/Socket感知调度
4.算子加速:Attn/GEMM/通算融合、多精度量化算子、All-to-All/All-Reduce
课题要求
1.包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士;
2.有至少其中一项技能/知识:熟悉一种推理框架、GPU编程、高性能网络/分布式并行、编译器优化、大规模数据处理;
3、在AI Infra、推理优化、LLM Serving等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式推理系统相关领域经验者优先;
4.有好奇心,自驱力强,有较好的学习能力和沟通能力、编程能力强;
5、良好的沟通协作能力,能和团队一起探索新技术,推进技术进步。