一、技术方案设计与优化
深入理解AI算力运营模式,结合多云异构资源现状,牵头设计整体技术方案,涵盖算力管理、训推调度等核心平台的深度架构设计,解决异构资源纳管、跨域调度、协同效率等核心痛点。
主导技术方案拆解与迭代,针对多云统一管理、容器集群管控、训推调度、算网融合等核心模块,设计精细化技术实现方案,确保方案具备高可用、高弹性、可扩展特性,支撑业务从基础算力服务向运营型服务演进。
结合业务规模化扩展需求,设计可复用、标准化的架构扩展方案,实现资源快速纳管、平台复制部署,适配多地域、多用户接入场景。
负责技术方案可行性论证与技术选型,对比主流智算架构路线,引入优质技术组件,提升平台性能与稳定性。
二、技术实施与团队带领
带头推动技术方案落地,制定实施计划与里程碑,统筹协调各技术团队,解决实施过程中的核心技术难点,确保项目按质按量按期交付。
主导智算云平台核心模块技术攻坚,优化多云纳管、容器管理、训推调度、资源监控等模块的技术实现,提升资源利用率与用户体验。
带领团队跟踪智算领域前沿技术,开展技术研究与创新,将新技术融入现有架构,构建技术壁垒。
负责团队技术指导与能力培养,规范开发流程,提升团队整体技术水平,支撑方案落地与平台迭代。
三、平台运维与迭代
设计智算云平台整体运维架构,制定完善的监控、告警、故障排查方案,保障平台7×24小时稳定运行,支撑各类用户正常使用。
持续监控平台运行指标,分析资源使用、调度效率等情况,提出架构优化建议,持续提升平台性能、可靠性与可维护性。
对接业务、客户及合作方,挖掘技术需求,转化为技术方案,推动平台迭代升级,适配业务发展需求。
四、合规与安全保障
结合业务特点,设计符合合规要求的技术架构,确保资源访问、数据传输、任务运算等环节合规合法。
主导平台安全架构设计,完善身份认证、权限管控、数据加密等安全机制,保障平台与客户数据安全。
任职要求
一、学历与工作经验
本科及以上学历,计算机、电子信息、软件工程等相关专业,5年以上智算云、云计算、AI算力平台架构设计及落地经验,至少3年跨境/多云异构场景相关经验。
具备大型智算平台、容器集群、多云纳管、训推调度相关项目主导经验,有跨境算力服务平台方案设计与落地经验者优先。
具备带领5人以上技术团队完成复杂项目实施的经验,具备良好的项目统筹与团队管理能力。
二、核心技术能力
多云管理能力:精通各类公有云、私有云及裸机资源纳管技术,能设计高效的异构资源纳管架构,解决跨域资源同步、权限隔离、利用率优化等问题。
容器与调度技术:精通Kubernetes集群架构设计与深度调优,具备容器化部署、GPU容器调度、跨域集群协同经验,能设计精细化训推任务调度方案。
算网融合技术:深入理解全球网络与专线架构,具备跨域算力调度网络优化经验,能设计优质算网融合方案,解决跨境网络相关痛点。
核心模块设计能力:具备算力管理、训推调度、资源监控等平台核心模块深度设计能力,能独立撰写技术方案,针对现有方案不足提出创新性优化建议。
技术选型与创新:熟悉智算领域前沿技术,能结合业务需求选型合适技术组件,推动技术创新与架构升级。
三、软实力要求
具备极强的技术方案撰写能力,逻辑清晰、表达严谨,能精准呈现架构设计思路与技术实现方案。
具备良好的沟通协调能力与问题解决能力,能高效对接各方,推动问题闭环。
具备较强的责任心与抗压能力,能带领团队应对复杂技术挑战,确保项目顺利推进。