岗位职责
- 负责超大规模机器学习系统架构的设计开发,解决系统高并发、高可靠性、高可扩展性等技术难关;
- 负责大模型分布式推理任务性能优化,流量调度,池化部署等,涵盖LLM/MLLM/Diffusion等多个场景;
- 与算法部门深度合作,进行算法与系统的联合优化;
- 国产硬件的适配和性能优化。
职位要求
- 代码能力、数据结构和基础算法功底,熟练掌握Linux环境下的C/C++、Python;
- 熟悉至少一种机器学习框架(PyTorch/TensorFlow/PaddlePaddle/Mindspore等训练框架),以及对应框架相应技术生态;
- 熟悉大模型推理框架(如vLLM/SGLang/TRT-LLM等框架);
- 掌握分布式系统原理,参与过分布式系统的设计、开发和维护;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;
- 较强的自驱学习能力,对端到端系统设计、编码规范和系统优化有高标准要求。 加分项:
- 熟悉LLM、MLLM、NLP、CV、语音相关的算法和技术,熟悉大模型推理、模型压缩技术等;
- 熟悉高性能编程,例如CUDA、向量化、并行化;或具有AI编译器相关经验;
- 熟悉国产异构硬件并有相关训练框架或高性能算子调优经验。