1.参与真机强化学习算法研发,在导师指导下完成 RL 算法的实现、训练与真机验证,协助开展数据配方、训练策略与评测实验。
2.协助多模态建模与训练实验,涉及图像/视频/语言/触觉/动作等信息融合与能力评估。
3.参与灵巧手/双臂等接触丰富(contact-rich)操作任务的策略学习探索。
4.协助维护训练—评测—迭代闭环,参与真机实验与数据分析。
5.跟踪 RL 与具身智能前沿进展,优秀成果可产出学术论文或开源项目。
1.在读硕士/博士(优秀本科生亦可),计算机/机器人/自动化/AI 等相关专业。
2.熟悉 PPO/SAC/TD3/GRPO 等主流RL算法,对offline/online RL等前沿方向有了解。
3.熟练使用 Python 与 PyTorch,具备良好的代码能力。
4.使用过 RLINF、VeRL 等 RL 训练框架者优先。
5.有课程项目、竞赛或科研中的机器人真机训练部署经验,或对机器人操作、灵巧手等方向有浓厚兴趣者优先。
6.有顶会论文、开源项目或竞赛获奖经历者优先。
7.每周可到岗 4 天及以上,实习期 6 个月以上优先。