【团队简介】
我们是公司核心的AI团队,肩负着将前沿AI模型转化为高效、稳定、可扩展的实际服务的重任。我们不仅是技术的践行者,更是创新边界的开拓者。
在这里,你将:
直面核心挑战:攻克大模型及深度学习模型在推理性能、延迟、吞吐和资源消耗方面的极限。
掌握尖端技术:深入应用和优化包括TensorRT, ONNX, Triton, vLLM等在内的业界最先进的推理部署工具链。
影响千万用户:你优化和部署的模型服务将直接赋能公司主营业务,服务亿万级用户和请求,见证技术带来的巨大商业价值。
与高手同行:与来自国内外顶尖高校和公司的资深专家一起工作,获得快速的技术成长和专业的职业指导。
【工作职责】
参与大规模深度学习模型(尤其是LLM大语言模型、多模态模型、CV模型等)的推理性能优化与部署工作。
基于NVIDIA TensorRT, ONNX Runtime, Triton Inference Server 等框架,进行模型转换、量化、编译和加速。
开发和维护高并发、低延迟、高可用的模型推理服务,保障线上服务的稳定性与效率。
设计和实现推理服务的监控、告警与自动化运维体系。
探索和落地推理部署领域的新技术和新方案,持续提升团队的技术影响力。
1 2026届应届毕业生,本科及以上学历,计算机、人工智能、电子工程等相关专业。
2 掌握Python/C++编程
对以下至少一个方向有浓厚兴趣或项目经验:
1 模型优化:模型量化、剪枝、知识蒸馏。
2 推理引擎:TensorRT, ONNX Runtime, OpenVINO, Triton。