课题描述
课题背景:
随着多模态大模型能力持续提升,研究重点正由感知与理解逐步拓展至复杂推理。面向视觉、音频、音视频等多模态场景,构建具备长思维链推理能力的全模态 Reasoning Model,使模型能够在推理过程中持续利用多模态信息完成分析、判断与决策,已成为多模态智能的重要研究方向。
课题挑战:
本课题的主要挑战在于,如何在长思维链推理过程中保持对多模态输入的持续关注与有效利用,避免模型随推理链条加深而逐渐脱离原始视觉、音频或音视频证据,进而产生事实性偏差;同时,如何在思维链中有效引入多模态信息,构建“Think with Multimodal”的推理范式,使模型能够将跨模态感知信息与中间推理过程有机结合。
具体工作:
参与全模态长思维链推理数据构建,开展后训练数据设计,研究 Think with Multimodal 的后训练方法与流程,并完成实验评测与结果分析。
课题要求
学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。
技能要求:精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流 MLLM(如 LLaVA, Qwen-Audio, Qwen-Omni) 原理;熟悉 PPO、GRPO 等强化学习算法及 DeepSpeed/Megatron 分布式训练工具。
软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
TEG — 腾讯混元基础模型部
基础模型部负责混元大模型的前沿技术探索与基础模型研发,聚焦模型结构、数据与训练策略、强化学习及Agent能力,协同各模态研发能力,高效开发并迭代基础模型架构,面向AGI愿景探索智能上限、确保技术领先;同时构建基于大模型的AI PaaS中台能力,赋能公司内外部的产品创新与业务应用。