1. 建立模型评测指标体系和定期评测流程,支持多模型、多版本、多场景下的评测、对比和报告产出。
2. 将复杂任务拆解为可执行、可复现、可评分的评测场景,定义成功标准、失败类型和评分规则。
3. 负责评测数据清洗、处理和分析,识别无效数据、异常样本、典型失败模式和高价值训练样本。
4. 参与自动化评测系统建设,结合规则、VLM / value model / reward model 和人工抽审,提高评测效率和一致性。
5. 与数据、运营团队协作,将评测结果转化为模型迭代建议、数据采集需求和诊断报告。
1. 有智能驾驶、机器人、多模态模型或其他 AI 系统的评测、数据分析、benchmark 维护经验。
2. 理解模型评测的基本方法,熟悉 A/B test、场景集构建、长尾/OOD 测试、可复现实验等概念。
3. 能把复杂任务拆成清晰的评测场景,定义成功标准、失败模式和评分规则。
4. 熟悉 Python 数据分析与实验工具链,能处理视频、状态、动作、标签、日志等多模态评测数据。
5. 对真实系统评测有基本理解,知道传感器、标定、环境扰动、人工操作、安全事件等因素会影响模型结果。
6. 有较强的问题拆解和写作能力,能把评测结果整理成清晰的诊断报告。
加分项
1. 做过智能驾驶感知/规划/端到端模型评测、仿真场景评测、数据闭环或问题归因。
2. 做过机器人、VLA、robot foundation model、模仿学习、强化学习或多模态模型相关工作。
3. 熟悉自动化评测、人工标注校准、评分一致性分析或模型 leaderboard。
4. 有 value model / reward model / VLM-as-Judge 相关经验。
5. 有将评测结果转化为训练数据、数据筛选或模型迭代建议的经验。