
腾讯|优图实验室—多模态理解与检索研究实习
岗位职责
课题背景:
随着大语言模型(LLM)及多模态大模型(MLLM)技术的突破性发展,通用场景下的图文内容语义理解能力与embedding 表征能力得到显著提升。然而,在开放业务场景中,现有技术仍面临两大核心挑战:首先,在复杂场景下,细粒度特征(如局部属性、跨模态语义关联等)的精准建模能力不足;其次,直接应用预训练大模型容易导致灾难性遗忘、幻觉输出和泛化能力欠缺等问题,难以满足精细场景理解,多粒度图文检索,开放场景识别等业务需求。本研究致力于面向复杂开放场景下的多模态内容理解与检索,探索基于大模型架构的高效细粒度理解方案,构建多粒度感知与检索范式,突破模型在业务场景中的适配瓶颈,推动在多业务场景下的规模化落地。
课题挑战:
1、优化多模态大模型在细粒度感知理解中的效果,研究如何设计跨模态细粒度对齐方法、优化视觉表征能力,实现更精准的语义理解与交互;
2、研究如何基于多模态大模型构建高效多粒度数据管线与检索匹配方法;
3、研究如何解决大模型在业务适配中的灾难性遗忘与泛化性损失等问题;探索基于DPO、GRPO等人类反馈对齐技术,提升模型在复杂场景任务理解与Reasoning能力;
4、研究模型结构优化,知识蒸馏等方法提升大模型推理效率,在满足适配效果同时降低推理成本。
具体工作:
你将参与到多模态大模型感知增强的数据管线设计与实现,基于 RL 等方法构建多粒度感知理解方案,设计多粒度跨模态检索特征学习与匹配方案,推动上述多模态相关技术在内容理解等真实业务场景的落地
任职要求
1、计算机科学、人工智能、模式识别等相关专业的博士及优秀硕士;具有目标检测与识别、Grounding,VLM等研究背景者优先;
2、熟悉VLM/MLLM前沿进展,熟悉 CLIP/InternVL等技术路径;精通 PyTorch,熟悉分布式训练框架(DeepSpeed、Megatron-LM);在 CVPR/ICLR/NeurIPS/ICCV等顶会有相关成果者优先;
3、对多模态理解技术有强烈研究热情,对技术有较强的好奇心,具备较好的研究能力;沟通协作能力强,逻辑性强,具备独立解决问题的能力。
腾讯招聘实习生:优图实验室—多模态理解与检索研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
