岗位职责
- 负责大语言模型及多模态大模型的研发工作,涵盖模型架构设计、预训练与后训练、推理加速、高质量数据集建设等
- 深入探索文本、图像、视频、音频等多模态理解与生成技术,推动原生多模态架构设计与跨模态对齐,加速大模型在复杂业务场景中的落地应用
- 持续跟踪大模型领域前沿研究,提升模型在业务场景中的效果与效率
- 建立系统化的模型评估体系,覆盖多维度能力评测与线上效果监控,确保模型迭代的质量可控与持续提升
- 与产品、工程、数据等团队紧密协作,推动大模型能力在业务场景中的端到端落地
职位要求
- 计算机科学、人工智能、数据科学、数学或相关专业硕士及以上学历
- 具备扎实的编程功底与工程实现能力,熟悉分布式训练与模型加速技术
- 具有深厚的机器学习与深度学习理论基础,对自然语言处理或计算机视觉领域有深入理解
- 熟悉大模型训练流程,有相关大规模训练实践经验者优先
- 具有良好的科研素养和优秀的团队协作能力,对前沿技术保持高度敏感,具备较强的问题分析与解决能力 加分项 有类似工作经验优先