课题详情
课题背景:
随着企业数字化转型加速,非结构化数据(图像、视频、文档等)占比已超过80%,传统基于文本的关键词检索已无法满足企业对全类型数据的智能管理需求。当前市场上多数检索产品仍停留在单模态或浅层多模态阶段,跨模态语义理解能力薄弱,导致"信息孤岛"现象严重——用户需要分别在图像库、视频库、文档库中进行多次检索,无法获得统一的语义关联结果。与此同时,大模型的爆发式增长对检索系统提出了更高要求:不仅需要返回相关结果,更需要理解多模态内容间的深层语义关联,为下游任务(如问答、生成、推理)提供精准的知识支持。在此背景下,统一多模态检索(Universal Multimodal Retrieval, UMR)技术成为突破检索天花板、构建下一代智能知识基础设施的关键方向。
课题挑战:
1、跨模态语义对齐难题:不同模态的数据(如产品图、说明书、操作视频、技术文档)在特征空间分布差异巨大,如何学习真正统一的嵌入表示,而非简单的特征拼接,使得文本-图像-视频的语义粒度对齐成为核心难点;
2、垂类场景适配困境:通用UMR模型在特定行业(如工业质检、医疗影像、零售商品))中往往面临领域知识缺失、专业术语理解不足等问题,需要在保持跨模态通用能力的同时实现高效定制化;
3、负样本挖掘与难例区分:多模态场景下硬负样本的定义与挖掘策略远比单模态复杂,如何构建有效的难例学习机制,避免模型在"看似简单"的跨模态对(如外观相似但功能不同的产品)上失效,是提升检索精度的关键;
4、计算效率与精度的平衡:统一嵌入空间的高维计算开销大,如何在百亿级规模下实现毫秒级响应,同时保持细粒度语义区分能力,对索引结构、量化策略、硬件加速都提出严苛要求。
具体工作:
1、参与UMR核心算法在MetaInsight产品中的工程化落地,包括跨模态预训练模型的垂类微调策略设计与实验、基于难例挖掘的对比学习优化;
2、参与构建多模态统一索引架构,支持文本/图像/视频的混合检索与排序;参与面向企业客户的检索产品功能迭代,包括多模态Query理解、结果重排序及相关性解释机制开发;
3、参与检索效果评测体系建设,设计跨模态检索准确率、泛化能力及端到端延迟等核心指标的评测方案与工具开发。
课题要求
专业背景:
1、计算机科学与技术、人工智能、机器学习、模式识别、计算机视觉等相关专业的博士 / 硕士同学;
2、具备多模态特征学习、检索系统相关研究或项目背景者优先。
技术技能要求:
1、具备多模态大模型的模型预训练、后训练、模型推理等基本技能;
2、具备大模型产品,尤其是多模态检索/图像检索/视频检索产品方案的落地实践经验;
3、熟练运用 Python,熟悉 PyTorch/TensorFlow 框架,熟悉vLLM/SGLang等大模型推理框架;
4、密切跟进多模态大模型技术发展,具备大模型效果调优能力和开发经验。
软性素质要求:
1、具备较强的问题拆解与创新能力,沟通协作、跨团队对接效率高;
2、对垂类行业场景适配有耐心,能高效推进算法落地与迭代。