Responsibilities
1.参与微信搜索Agent能力优化,包括Search Agent(DeepSearch/DeepResearch)和真实世界复杂任务上的Agentic能力;
2.跟进前沿技术:Mid-Train、SFT、GRM、PRM、RLVR、Agentic RL、Agent自进化、Context管理/Memory等;
3.探索稳定高效的Agentic RL方案,探索下一代大模型结合Agent结合搜索的技术和产品范式。
Requirements
1.算法功底:精通PPO、GRPO、DPO等强化学习算法,有大模型RLHF实战经验;
2.专业深度:深刻理解CoT、自反思及工具学习,熟悉分布式训练框架;
3.学术背景:在NeurIPS、ICLR、ICML等顶会以一作发表过RL或Agent相关论文优先。