岗位职责
- 理解模型训练:参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的视频理解能力。
- SFT专项迭代:跟踪学术界与工业界前沿进展,方向包括但不限于鲁棒视觉表征与视觉特征编解码、多模态模型的RLVR 与 RLHF、Synthetic Data、视觉审美与视觉品质评估等,持续打磨模型对视觉世界的"体感",对构图、布局、风格、细节的直觉判断力。
- 实验与复盘:设计与开发高效的分布式训练与数据系统,优化大规模多模态模型的训练流程与数据处理链路,支撑海量多模态数据的高效存储、检索、清洗与迭代,保障上述方向的快速落地
职位要求
- 计算机、人工智能、数学、自动化、电子信息等相关专业的优秀本科生、研究生和博士生。
- 有大模型、视频生成、多模态模型或视觉模型相关的训练 / 微调项目经验者优先。
- 熟悉至少一种主流的开源 LLM/VLM RL 训练框架(如 verl、AReaL、steptron等),有在其上做二次开发或定制化训练流程的实战经验。
- 具备较强的问题分析和 Debug 能力,能够从训练日志、Loss、模型输出及实验结果中定位问题。对模型效果有较强敏感度,能够将实验现象转化为明确的分析结论。
- 具备良好的通能力和团队协作精神,能独立解决复杂技术问题 【加分项】
- 在顶级会议/期刊(NeurIPS、ICML、CVPR、ACL、ICLR 等) 发表过相关论文。
- 参与过开源大模型项目的贡献。
- 有算法竞赛教练或培训经历,ACM-ICPC等编程竞赛获奖经历