岗位职责
- 从事多模态算法和模型的研究与开发,包括但不局限于文本-图像、文本-视频等跨模态算法研发和优化;
- 推进跨模态内容理解/生成前沿技术的创新落地。设计和优化现有算法,提高性能和准确性,确保高质量的用户体验;
- 协助基模落地,开展消融实验、数据生产等,配合业务落地;
- 持续追踪多模态AI、理解&生成、LLM等方向进展,产出高水平论文,建立行业技术影响力。
职位要求
- 自然语言处理、计算机视觉、语音、机器学习、跨模态表征学习等相关专业在读;
- 综合素质优秀,对技术有热情,工程能力扎实,有NLP/CV/ML顶会发表经验者,有大规模模型训练工程经验的同学优先;
- 良好的学术调研能力,良好的逻辑和数据分析能力,有高质量论文、开源项目、ACM竞赛经历、相关学术会议组织的权威比赛获奖经历或落地项目产出者优先;
- 有良好的自我学习能力及自驱力,对前沿领域有强探索欲和好奇心、善于独立思考并反思总结;具备良好的沟通能力和团队协作能力;
- 有VLM/LLM 训练经验,打比赛(例如kaggle)取得好成绩优先;
- 至少实习6个月,优先考虑可以尽快入职的同学。