岗位职责
- 针对字节跳动商业化(广告、电商、生活服务)场景中文本、视觉、语音多种模态的内容理解问题,负责多种尺寸的LLM、VLM、Omni基座模型迭代;围绕预训练、SFT、RL及推理环节优化,提升模型在通用&领域多种测评集的真实泛化能力;
- 负责大规模多模态数据的分析洞察,利用算法深度挖掘数据多样性、数据分布、数据质量、数据特征对模型预训练、SFT微调效果的关联影响,为模型训练策略优化、效果迭代提供数据依据;
- 探索多模态大模型领域的长期关键问题,研究方向包括但不限于视觉/语音编码器(ViT/AuT)、模型结构、统一多模态理解-生成-编辑(Unified Model)、音频/视频内容理解、音乐理解、Reward Model、强化学习及其变种(PPO/GRPO/OPD等)、Agentic RL、推理加速等。
职位要求
- 本科及以上学历,计算机相关专业,具备扎实的深度学习理论基础,精通Transformer等主流模型结构,熟悉多模态编码器及模态间对齐算法(ViT、AuT、CLIP等),熟悉LLM/VLM/Omni模型的技术原理、训练范式,熟悉大模型相关的数据构造方法,熟悉Pre-train、Post-train涉及算法及变种;
- 在大语言模型、多模态大模型、视觉或语音理解领域有深入的研究或落地经验,具备优秀的会议论文相关学术成果者或相关业界落地经验优先;
- 有基于文本/多模态大模型继续预训练(Continual Pre-train)、后训练(SFT/RL)经验,熟悉Swift、VeOmni、VeRL、Easy-R
- Megatron、DeepSpeed等训练框架者优先,有大规模分布式训练经验者优先;
- 有较强的问题分析与学习能力,对解决有挑战性的问题有热情,能快速跟进前沿技术并应用于实际问题解决,具有良好的团队沟通协作能力。