岗位职责
- 负责构建和优化大规模预训练框架,支持多模态理解、视频生成模型的高效预训练;
- 支持超长上下文训练,深入优化长序列场景下的分布式训练效率;
- 深入优化分布式训练框架效率,提升算力利用率与模型吞吐性能;
- 跟踪前沿研究趋势,探索高效预训练策略,如混合精度训练、稀疏训练等;
- 与算法、数据、平台团队协作,形成从数据处理到训练部署的全流程自动化解决方案。
职位要求
- 计算机科学、人工智能、模式识别、计算语言学等相关专业硕士及以上学历;
- 精通一种或多种主流深度学习框架(PyTorch、JAX、TensorFlow),具备大规模分布式训练经验;
- 熟悉LLM/DiT等模型的训练流程,有 Megatron、DeepSpeed、FSDP等大规模训练框架使用经验者优先;
- 具备扎实的工程实现能力与代码规范意识,熟悉CUDA优化、参数并行、流水线并行等技术。