职位描述
1、探索通算智算一体化场景下,端到端性能分析诊断体系的研究与构建,覆盖从底层硬件(CPU、GPU、NPU等)、系统软件到上层分布式框架和应用负载;
2、深入研究CPU-GPU异构计算系统、分布式框架、系统软件栈(如操作系统、编译器、运行时)的性能瓶颈,提出并实现创新的软硬件协同优化方案;
3、开发和落地先进的性能监控、剖析和诊断工具,支持从底层硬件指标到上层业务负载的全链路追踪与精准瓶颈定位;
4、针对大规模AI模型训练/推理、通用计算等多样化负载,探索和实践GPU等异构资源的调度优化、资源容错、任务状态保存/恢复与快速迁移等关键技术,提升资源利用率和系统稳定性;
5、研究内存(包括CPU内存和GPU显存)与计算的协同优化方案,旨在提升训推场景性能,降低整体成本,并优化资源利用率;
6、将研究成果应用于阿里云平台及相关产品服务,提升云平台的整体性能、资源利用率和性价比,支持关键业务场景;
7、在顶级学术会议和期刊上发表研究成果,并积极参与开源社区合作与技术推广,提升团队和公司在相关领域的技术影响力。
职位要求
1、扎实的计算机科学与工程功底,优秀的编程能力(精通或熟练掌握C/C++/Python等),熟悉常用数据结构、算法和设计模式,具备复杂系统设计、开发与调试经验。
2、优秀的沟通表达、团队协作能力;具备快速学习新知识和深入钻研复杂技术问题的能力与耐心。
3、深入理解计算机体系结构(CPU/GPU/NPU等)、操作系统、编译原理、分布式系统等基础知识。
4、具备以下至少一个领域的深入实践经验:
1)高性能计算(HPC),特别是异构计算环境下的性能分析与优化;
2)GPU编程与优化(如CUDA, ROCm, OpenCL等),熟悉GPU架构;
3)系统性能分析与调优工具(如perf, eBPF, VTune, Nsight Profiler等)的开发或深度使用经验;
4)虚拟化(KVM/QEMU等)、容器技术(Docker/Kubernetes等)及其性能优化;
5)分布式系统调度与资源管理(如YARN, Mesos, Kubernetes Scheduler等);
5、对AI大模型训练/推理框架(如PyTorch, TensorFlow, TensorRT, Triton等)有一定了解,并对其系统层面的性能优化有兴趣。
加分项:
1)在相关领域的顶级会议/期刊(如OSDI, SOSP, ASPLOS, ISCA, MICRO, SC, NSDI, EuroSys, ATC等)有论文发表者优先;
2)对大规模AI模型(如LLM)训练/推理、大数据处理等复杂应用场景的系统性能瓶颈有深入理解和实际优化经验者优先;
3)具有GPU高性能Kernel(CUDA/ROCm等)开发和极致优化经验者优先;
4)有参与新硬件(如自研CPU/GPU/NPU,例如倚天)评估、适配和优化经验者优先;
5)有重要开源项目(如Linux Kernel, GCC/LLVM, Kubernetes, PyTorch/TensorFlow等)贡献经验者优先;
6)熟悉云原生技术栈,并有相关性能优化经验者优先。