课题描述
课题背景:
随着大语言模型能力边界的持续拓展,如何衡量其所创造的经济与社会价值已成为新的话题。而模型在超长上下文场景中的学习、推理能力,正是实现这些潜在价值的关键技术基座。不管是给模型一本长说明书它能够立即理解并上手,还是给他一个游戏规则他能够当场参与游玩,我们可以通过系统性评估模型在获取特定领域长文本资料后的表现水平,并对标人类达到相同水平需要学习多久,从而构建出相应的指标体系。然而,这一核心能力的优化仍面临诸多技术挑战亟待突破:从模型的长序列输入输出处理能力,到复杂指令遵循与深度推理能力,均需要实现质的飞跃;更为关键的是,跨轮次对话的上下文记忆保持机制是支撑复杂交互场景的技术基石,这些前沿研究方向都有待我们深入探索与攻克。
课题挑战:
1. 当前研究范式主要聚焦于"长上下文输入+长链推理+短响应输出"的模式,而当模型需要生成数万token级别的长文本时,如何维持语义连贯性、逻辑一致性和结构完整性将成为核心技术瓶颈。
2. 面对复杂技术文档、游戏规则等结构化长文本,模型需要在超长上下文中进行非连续的信息定位、多跳推理和交叉引用,我们需要全新的结构和训练方式去解决这类问题。
具体工作:
你将参与到大模型的超长文学习、推理能力的前沿研究中,包括长序列输入输出架构的创新设计,复杂指令遵循与深度推理能力的突破性提升,跨轮次记忆机制的体系化构建,自适应学习评测体系的建立与优化。你将推动模型从简单的信息处理走向真正的智能学习,让AI能够像人类一样快速掌握新领域知识,即时适应复杂场景。
课题要求
学历和专业要求:
自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
技术技能要求:
1. 在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验;
2. 较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等);
3. 有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等);
软性素质要求:
具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。
TEG — 腾讯混元基础模型部
基础模型部负责混元大模型的前沿技术探索与基础模型研发,聚焦模型结构、数据与训练策略、强化学习及Agent能力,协同各模态研发能力,高效开发并迭代基础模型架构,面向AGI愿景探索智能上限、确保技术领先;同时构建基于大模型的AI PaaS中台能力,赋能公司内外部的产品创新与业务应用。