1. 模型后训练: 负责 LLM/多模态模型的 SFT 微调与 RLHF/DPO 等后训练过程,优化模型在特定领域下的指令遵循和逻辑推理能力。
2. Agent 专项优化: 针对 Agent 场景(如 Tool Use、多步规划),通过强化学习等手段提升模型决策的准确率和稳定性。
3. 效果评估: 建立模型能力评测基准,跟踪前沿对齐技术,持续迭代模型能力。
1. 计算机、人工智能等相关专业,1-3 年工作经历,表现优秀的校招生亦可。
2. 具备 NLP 或多模态方向经验,对 Transformer 架构及 LLM 训练/微调全流程有体系化理解。
3. 熟练掌握 Python,熟悉 LLaMA-Factory、DeepSpeed、Megatron 等主流训练框架及工具。