课题描述
课题背景:
随着 Coding LLM 与多模态大模型的快速发展,Code Agent 正从单一文本驱动的代码补全工具,演进为能够理解多模态上下文(屏幕截图、设计稿、报错日志、终端输出、UI 渲染结果等)、自主调用工具、执行代码并根据反馈持续迭代的智能体系统。真实软件工程场景中,代码任务往往伴随丰富的视觉信息与运行时反馈——从需求文档、UI 设计稿到编译报错、页面渲染差异——这对模型的多模态理解、工具使用与自我纠错能力提出了全新挑战。本课题旨在探索原生多模态与 Code LLM 深度融合的 Agent 训练范式,构建具备多模态感知、自主决策与执行反馈闭环能力的下一代 Code Agent 基础模型。
课题挑战:
1、多模态代码上下文理解:如何让模型同时理解代码、终端/日志文本、UI 截图、设计稿等异构输入,建立视觉-代码-执行状态的统一表征;
2、工具调用与执行环境交互:如何设计高效稳定的 Agent-工具交互协议,使模型能够自主调用终端、编辑器、浏览器、调试器等工具完成复杂多步编码任务;
3、执行反馈驱动的自我迭代:如何构建"编写代码—执行—观察反馈(报错/渲染结果/测试用例)—修正"的闭环机制,并将执行反馈转化为可用于训练的奖励信号;
4、长程任务规划与状态管理:面对跨文件、多步骤的软件工程任务,如何让 Agent 具备稳定的任务分解、进度追踪与错误恢复能力,避免长序列执行中的目标漂移;
5、Agent 训练数据与奖励系统构建:如何规模化采集/合成真实编码轨迹(含多模态上下文与工具调用记录),并设计兼顾正确性、效率与代码质量的统一奖励体系。
具体工作:
你将参与多模态 Code Agent 基础模型的研发,包括但不限于:多模态代码理解与对齐算法研究、Agent-工具调用框架设计与优化、Renderer/Executor-in-the-Loop 强化学习训练、多模态编码轨迹数据构建与评测体系搭建等。
课题要求
1、计算机科学、人工智能、软件工程等相关专业的博士或优秀硕士;
2、深入理解多模态大模型与 Code LLM 技术路径,熟悉 ViT、VLM、Agent 框架、SFT/DPO/RL 等关键技术,在 NeurIPS、ICLR、ACL、ICSE 等顶会有相关研究成果者优先;
3、具备扎实的工程能力,精通 Python,熟悉至少一种主流深度学习框架(PyTorch 优先)及分布式训练技术;具备打通「代码—执行—反馈」闭环链路的工程经验者优先;
4、有 Coding Agent、GUI Agent、工具调用、Renderer/Executor-in-the-Loop 强化学习、代码大模型后训练等相关研究或实践经验者优先;
5、对技术有强烈的好奇心,具备解决复杂系统问题的韧性,以及出色的团队协作与沟通能力。
CSIG — 优图实验室
腾讯优图实验室——离产业最近的AI。我们专注于人工智能领域的前沿技术研究和产业实践落地,涵盖了视觉感知理解、多模态理解、大语言模型、计算加速、AIGC等技术研究领域;作为腾讯顶级的人工智能实验室,优图实验室在多个领域开展技术研究和应用落地,同时为腾讯内外部超500+产品和业务提供技术支持和服务;优图实验室汇聚来自国内外的顶尖人才,并与世界顶级院校和机构合作,我们拥有超过1800项全球专利,1000余篇论文被国际顶会收录。