1 负责AI模型在生产环境中的高效推理部署,优化模型推理性能(延迟、吞吐量、资源利用率等)。
2 设计并实现分布式推理架构,支持高并发、低延迟的实时推理服务。
3 与算法团队协作,完成模型压缩、量化、剪枝等优化,提升模型在边缘端/云端部署的可行性。
4 监控推理服务稳定性,定位并解决线上性能瓶颈和故障问题。
5 探索新兴推理框架(如TensorRT、ONNX Runtime等)在生产环境的应用落地。
1 精通Python/C++,熟悉深度学习框架(PyTorch/TensorFlow),了解模型部署全流程(训练→优化→部署)。
2 熟悉Linux系统调优、Docker容器化、Kubernetes集群管理。
3 具备分布式系统设计经验,熟悉RPC、消息队列等技术。
4 了解GPU/TPU加速推理原理,掌握CUDA/OpenCL等并行计算技术。
工程能力
1 有大规模AI模型推理服务落地经验(如推荐系统、NLP、CV等场景)。
2 熟悉模型监控工具(Prometheus、Grafana)及日志分析(ELK)。
3 具备A/B测试、灰度发布等工程实践经验。