
腾讯|混元基座模型-视觉理解大模型研究实习
岗位职责
课题背景:
视觉理解能力是大模型感知真实世界和走向物理世界的基础,混元的视觉理解大模型能力长期位居业界领先水平。本青云课题主要探索面向未来的视觉理解技术,包括O3类图像推理方法,视觉Agents能力等。
课题挑战:
目前整个领域的视觉理解能力在全面性和可靠性上还有较大的提升空间,如何进一步提升能力以及展现新的特性仍旧是一个开放性问题。
课题价值:
本课题的目标是持续提升视觉理解模型的能力,包括全面性和可靠性,以及探索面向未来的视觉理解技术,包括类O3的推理能力建设,以及视觉Agents能力等。视觉理解模型有着广阔的应用前景,例如在广告理解、短视频分析等司内场景中正发挥着较大价值,是原生大模型APP例如元宝的重要组成部分,也使得未来机器人看懂这个世界成为可能。
任职要求
1、计算机科学、机器学习、人工智能、应用数学等相关专业;
2、在多模态理解相关领域(包括自然语言处理、计算机视觉、语音理解/生成等)有扎实的研究基础
3、熟悉一个或多个模态领域的主流模型和算法,如CLIP、LLAVA、VALL-E等;
4、熟悉深度学习框架,如TensorFlow或PyTorch;了解分布式训练框架,如DeepSpeed和Megatron-LM等,并有一定的多机多卡分布式训练经验;
5、较强的工程实现能力,熟练掌握C/C++,Java,Python等至少一种语言;
6、有高质量论文发表者优先(如ICLR,NeurIPS,CVPR,ICCV,ECCV,ACL,EMNLP,等);
7、具备极强的学习能力和技术追求,良好的团队合作和沟通能力。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元基座模型-视觉理解大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
