岗位职责
1. 负责 AI Infra / MaaS / 大模型训练与推理平台相关产品设计,包括需求分析、产品方案、原型设计、PRD 编写和版本迭代。
2. 围绕大模型训练、模型部署、模型仓库、推理服务、模型 API、模型路由、调用计量、权限管理、监控告警等场景,设计平台化产品能力。
3. 关注大模型推理性能与资源效率,推动 TTFT、吞吐量、并发能力、GPU/NPU 利用率、单位 Token 成本等核心指标的可视化、分析与优化。
4. 负责国产 GPU/NPU、异构算力、私有化部署等场景下的产品需求梳理与方案设计,支持客户在不同算力环境下稳定使用大模型能力。
5. 与研发、算法、测试、运维、售前及交付团队协作,推动需求评审、开发落地、测试验收、上线发布和客户交付。
6. 跟踪大模型基础设施、推理框架、云原生、MLOps、MaaS 等方向的发展,结合客户需求持续优化产品体验和平台能力。
必备条件
5 年以上产品经理工作经验,有 AI 平台、MaaS 平台、智算平台、云计算平台、MLOps / DevOps 平台相关经验优先。
熟悉大模型训练、微调、评测、部署、推理、监控等基本流程,有大模型训练平台或推理平台产品经验优先。
理解大模型推理基本原理和常见优化方向,如 Prefill / Decode、KV Cache、连续批处理、模型量化、张量并行、PD 分离、模型预热等。
了解国产异构算力环境,熟悉 GPU/NPU、国产服务器、Kubernetes、容器化部署、资源调度等相关概念;有国产算力适配经验优先。
了解主流推理框架或服务框架,如 vLLM、SGLang、TGI、KServe、Triton 等,有相关产品或项目经验优先。
具备良好的平台型产品设计能力,能够将复杂技术能力抽象为清晰的产品功能、流程和配置界面。
具备较强的数据分析意识,能够围绕资源利用率、任务成功率、推理延迟、吞吐量、Token 成本、SLA 等指标进行产品设计和优化。
具备优秀的沟通协调能力、文档能力和项目推进能力,能够与研发、算法、运维、客户团队高效协作。
加分项
有大模型训练平台、推理平台、MaaS 平台、AI 网关、智算云平台从 0 到 1 建设经验。
熟悉 NVIDIA GPU、华为 Ascend、寒武纪、海光、沐曦、天数智芯等国产或异构算力生态。
熟悉 Kubernetes、Volcano、GPU 调度、模型服务弹性伸缩、可观测性、计费计量等平台能力。
有 To B 企业服务、私有化交付、信创项目或国产化适配项目经验。