关于该职位
在这个岗位上,你将大规模训练和微调用于机器人应用的最先进的视频和世界模型,例如,从模拟到现实的视觉迁移、合成数据生成、基于视频的规划,以及用于策略评估的学习模拟。你的工作将直接塑造我们的机器人如何理解、预测和与物理世界互动。
主要职责
- 在机器人数据上对大规模视频和世界模型进行训练、微调并迭代,推动从架构设计和预训练到特定任务适配的实验,并通过复现和基准测试最先进的方法来建立强大的基线。
- 开发用于机器人的视频模型应用,例如视觉历史建模、基于视频的规划,使用世界模型作为学习模拟器进行策略评估和奖励估计,并使用世界模型设计数据增强框架(例如新颖视角合成、模拟到现实的风格迁移、轨迹条件视频生成),以扩展和多样化现实世界的机器人训练数据集。
- 构建并维护数据管道,用于整理、处理和扩充来自模拟和现实世界机器人交互的大规模视频数据集。
- 交付可部署的模型工件和评估协议,并与具身AI、大语言模型/视觉语言模型(LLM/VLM)和3D视觉领域的研究人员合作,将世界模型集成到机器人系统栈中。
资格要求
- 计算机科学、电气工程或相关领域的博士学位(优先)或硕士学位。
- 在大规模视频模型的训练、微调或数据处理(例如,视频扩散模型、自回归视频模型、视频变换器)方面有实际操作经验。
- 精通PyTorch/JAX,有分布式训练经验(FSDP、DeepSpeed、Megatron)。
- 对生成式建模、时间序列建模和大规模优化有扎实的理解。
资格要求 - 优先考虑
- 有将视频模型应用于机器人任务(从仿真到现实的迁移、合成数据生成、用于规划的视频预测或学习仿真)的经验。
- 具备机器人学习数据增强策略的经验,包括轨迹增强、视图合成或领域随机化
- 熟悉现实世界机器人数据管道和远程操作数据格式。
- 在顶级CS/CV会议(如NeurIPS、ICML、ICLR、CVPR、ICCV、ECCV)上的第一作者发表记录。
- 熟悉3D感知视频生成、多视图合成或神经场景表示。
- 跨领域经验将视频生成与具身AI、强化学习或机器人操作联系起来。
- 有领导或参与被广泛采用的开源模型,或已被集成到知名产品或平台中的研究的经验。