1. 设计并搭建高性能、高可扩展的AI基础设施平台,支持模型的训练与推理任务,优化GPU集群资源调度策略。
2. 构建容器化部署方案(Kubernetes/Docker),实现模型服务的弹性伸缩与故障自愈。
3. 搭建AI系统全链路监控体系(Prometheus/Grafana/ELK),实时追踪GPU利用率、推理延迟、错误率等核心指标
4. 维护分布式存储系统(如JuiceFS、Cubefs等),确保训练推理数据的高可用与读写性能。制定并执行机房容灾备份策略,防范硬件故障、数据丢失等风险。
5. 负责机器学习平台的开发,支撑公司训练、评测、标注等相关业务的算法生产与高效迭代;
任职资格要求
任职资格:
1.统招本科及以上学历,计算机科学、人工智能或相关领域专业。两年及以上相关工作经验
2.了解前沿的AI技术,有工程实践经验者优先,有火山云、阿里云等云厂商使用经验;
3.熟练掌握Linux环境下的C/C++,Go,Python有大型 AI集群(含多机多卡分布式训练)运维经验,了解 TensorFlow/PyTorch 等框架的运行机制。
4. 具备实际问题分析与故障排查能力,能快速定位并解决平台与机房的复杂问题。
1. 设计并搭建高性能、高可扩展的AI基础设施平台,支持模型的训练与推理任务,优化GPU集群资源调度策略。
2. 构建容器化部署方案(Kubernetes/Docker),实现模型服务的弹性伸缩与故障自愈。
3. 搭建AI系统全链路监控体系(Prometheus/Grafana/ELK),实时追踪GPU利用率、推理延迟、错误率等核心指标
4. 维护分布式存储系统(如JuiceFS、Cubefs等),确保训练推理数据的高可用与读写性能。制定并执行机房容灾备份策略,防范硬件故障、数据丢失等风险。
5. 负责机器学习平台的开发,支撑公司训练、评测、标注等相关业务的算法生产与高效迭代;
任职资格要求
任职资格:
1.统招本科及以上学历,计算机科学、人工智能或相关领域专业。两年及以上相关工作经验
2.了解前沿的AI技术,有工程实践经验者优先,有火山云、阿里云等云厂商使用经验;
3.熟练掌握Linux环境下的C/C++,Go,Python有大型 AI集群(含多机多卡分布式训练)运维经验,了解 TensorFlow/PyTorch 等框架的运行机制。
4. 具备实际问题分析与故障排查能力,能快速定位并解决平台与机房的复杂问题。