岗位职责
- 优化视觉大模型训练流水线,全面提升训练效率、速度和可扩展性;
- 开发并改进分布式训练策略(如数据并行、模型并行、流水线并行及通信优化),加速模型训练过程;
- 对深度学习模型进行基准测试和性能剖析,精准识别性能瓶颈并优化计算资源的利用率。
职位要求
- 计算机、电子、人工智能等相关专业,本科及以上学历;
- 2年以上大模型训练加速或性能优化经验;
- 具备扎实的软件工程技能,熟练掌握Python和C++;能熟练使用主流深度学习框架,如PyTorch;
- 具备深度学习相关的开发经验,了解基本的模型训练流程;
- 了解常见的生成式AI模型架构,如Transformers或Diffusion models。 加分项:
- 精通分布式训练框架底层原理,如Megatron和Deepspeed;
- 具备分布式训练核心技术的丰富实操经验,能熟练处理数据并行、张量并行、序列并行和流水线并行,并擅长解决通信及显存瓶颈;
- 熟练掌握CUDA编程,具备GPU硬件架构理解与算子级性能调优经验。