岗位职责
- 负责设计与开发分布式模型训练系统,支持千亿参数的PS架构和万亿参数的Transformer架构,优化算力异构集群;
- 设计开发高性能模型推理服务,优化低延迟、高并发、高稳定性的推理系统,满足搜广推场景毫秒级响应需求;
- 优化训练和推理中的性能瓶颈,通过升级架构、算子优化、访存优化、量化技术等压榨硬件算力;
- 优化大模型的训练和推理速度,调研开发DeepSeek、Megatron、DeepSpeed、vLLM等模型和框架的落地;
- 与算法团队紧密合作,针对业务需求(CTR/CVR、大语言模型、强化学习等),推动新技术在场景中的应用。
职位要求
- 熟悉Linux开发环境,精通C++/Python,具备扎实编程基础,具备高性能系统开发经验;
- 具备主流深度学习TensorFlow、PyTorch、ONNX Runtime、vLLM等任一框架的使用、开发经验
- 熟悉CPU/GPU架构和高性能计算技术,有CUDA、cuBLAS、cutlass、AVX指令集等开发优化经验;
- 工作认真负责,对技术有极强的追求和好奇心,能够将前沿技术转化为实际工程优化,有较好的沟通协作能力。