Lightwheel
Posted 4mo ago

云资源管理与调度工程师

Lightwheel
Beijing or Shanghai
OnsiteFull Time
Responsibilities
  • managing resources
  • designing schedulers
  • monitoring usage
Requirements
  • Bachelor's in computer/cloud field,3+ years cloud resource management or cloud-native devops
  • K8s, IaC
  • GPU scheduling
  • Observability and AI-assisted tool usage required
Technical tools mentioned
ClaudeCursorKubernetes (K8s)HelmArgo WorkflowKedatemporalAirflowK8s CronJobTerraformAnsiblePulumiAlibaba CloudTencent CloudAWSGitCI/CDPrometheus+Grafana

Job description

1.负责数据平台云端基础设施的资源管理和调度,支撑海量Task并发采集、Workflow编排和自动化任务执行;
2.设计、搭建并优化云资源调度体系,包括K8s集群管理、GPU/CPU资源分配、自动扩缩容、任务优先级调度等,确保平台在PB级数据处理场景下高效稳定运行;
3.建设和维护云端自动化服务管理模块,优化Workflow引擎的资源分配与执行效率,解决资源争抢、Latency高、任务堆积等痛点;
4.实时监控云资源使用情况,进行成本优化、性能调优、容量规划和故障快速恢复;
5.参与数据平台核心模块与云资源的深度集成,提升端到端Pipeline的整体吞吐量;
6.主动使用AI工具辅助资源调度策略设计、脚本生成、日志分析和问题排查,显著提升运维与调度效率。

1.本科及以上学历,计算机、云计算相关专业,3年以上云资源管理或云原生开发/运维经验;
2.AI Native:熟练使用Claude、Cursor等AI编码/辅助工具,能高效生成调度脚本、优化K8s配置和自动化运维流程;
3.精通Kubernetes(K8s)集群管理、调度器扩展、Operator开发,熟悉Helm、Argo Workflow、Keda等工具者优先;
4.熟悉云资源调度与自动化技术栈(消息队列、任务调度框架如temporal/Airflow/K8s CronJob、负载均衡等);
5.具备大规模分布式系统资源优化经验,熟悉GPU集群调度、成本分析和容量规划;
6.熟练使用Terraform / Ansible / Pulumi等IaC工具,熟悉云厂商(阿里云/腾讯云/AWS等)资源管理;
7.有数据平台、AI训练数据Pipeline或高并发任务调度系统经验者优先;
8.良好的代码规范意识,熟练使用Git、CI/CD、Prometheus+Grafana等可观测性工具。

加分项:
有Workflow编排引擎(Argo、Temporal等)实际落地经验;

About Lightwheel

Provides simulation and data infrastructure for physical AI systems.