岗位职责
- 主导大模型的算法研究、训练调优及工程化落地,提升模型性能和效率;
- 主导大模型压缩、分布式训练、推理加速等技术落地(如量化、MoE、FlashAttention等);
- 结合业务场景(如对话系统、内容生成、知识推理)设计模型优化方案,解决数据稀疏性、幻觉抑制等挑战;
- 跟踪学术界与工业界最新进展,推动技术成果转化;
- 主导技术方案输出,协同工程团队实现高性能服务部署;
- 参与Agent架构设计,完成整体Agent项目落地。
职位要求
- 2年以上大模型研发经验,5年以上算法研发经验,3年以上海外工作经验;
- 精通PyTorch/TensorFlow框架,熟悉分布式训练工具;
- 深入掌握Transformer架构及衍生技术,有丰富的大模型调优经验;
- 熟练掌握大模型微调、蒸馏、强化学习等训练技术;
- 具备完整的大模型训练-部署全链路经验;
- 熟练掌握Agent架构;
- 积极拥抱大模型等创新技术,有顶会论文发表者优先。