
腾讯|内容服务-多模态理解与生成实习
岗位职责
课题背景:
随着多模态大模型的发展,人工智能正从单一模态理解逐步迈向跨模态的通用智能能力。在开放世界场景中,模型需要同时处理文本、图像、视频、音频等多源信息,并在不同模态之间建立统一的语义理解与知识关联。如何让模型具备从感知、语义理解到推理决策的综合能力,成为当前多模态智能研究的重要方向。本课题聚焦多模态大模型的统一表征与推理能力,探索构建跨模态理解与知识整合框架,为多模态智能在真实业务场景中的应用提供技术基础。
课题挑战:
多模态大模型在开放环境中的应用仍面临多方面挑战。首先,不同模态信息在表达形式和语义空间上存在差异,如何实现文本、图像、视频、音频等多模态数据的有效对齐与联合表征,是实现统一理解的关键问题。其次,在复杂场景下,模型不仅需要完成基础感知与语义理解,还需要具备跨模态的时空推理与知识整合能力,这对模型结构与训练方式提出更高要求。此外,多模态模型在实际应用中还需具备良好的鲁棒性、泛化能力与可控性,如何构建合理的数据体系与评测方法,刻画模型能力边界并保障安全可靠,也是研究的重要挑战。
具体工作:
参与多模态大模型相关研究,包括跨模态对齐与联合表征方法探索、多模态推理能力实验验证,以及数据与评测体系的构建;结合具体任务场景,评估模型在内容理解、交互问答等任务中的表现并持续优化。
任职要求
1、相关专业(计算机、人工智能等)在读的博士和优秀硕士;
2、具备较强的学习能力、清晰的逻辑思维能力和出色的沟通能力,有强烈的好奇心和自驱力;
3、具有多模态内容理解,多模态生成与编辑,机器学习算法基础,有图像生成与编辑、agent,音视频生成和编辑方向顶级论文者优先。
腾讯招聘实习生:内容服务-多模态理解与生成岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
