岗位职责
- 设计实现电商场景通用的大模型推理引擎,适用于在线实时推理和近离线批量推理等多个场景,并推广到电商各个场景中应用;
- 针对电商LLM/MLLM/AIGC等多种模型,进行针对性的推理性能优化,解决系统高并发、高可靠性、高可扩展性等技术难关;
- 面向全球多地域大规模GPU算力集群,通过弹性调度、GPU超卖、任务编排等方式不断提升算力利用率;
- 与算法部门深度合作,进行算法与系统的联合优化。
职位要求
- 本科及以上学历,计算机、软件工程、人工智能等相关专业优先,熟练掌握Linux环境下的C/C++与Python语言;
- 熟练掌握至少一种机器学习框架(TensorFlow/PyTorch/MxNet或其他自研框架);
- 熟悉LLM/VLM/SD/Dit等主流深度学习模型,并有实际模型推理优化经验,比如蒸馏能力;
- 熟练掌握常用的大模型推理引擎,如vLLM/SGLang/TRT-LLM等,了解原理;
- 有以下至少一项的背景知识与经验:GPU编程,编译器,高性能网络,分布式存储,集群调度;
- 具有独立解决问题的能力,良好的团队合作精神,有强烈的工作责任心,较好的学习能力、沟通能力和自驱力。 加分项:
- 理解GPU硬件架构,理解GPU软件栈(CUDA、cuDNN),具备GPU性能分析的经验;
- 有软硬件联合设计的经验;
- 深入研究过至少一种机器学习框架(Tensorflow/PyTorch/MxNet或其他自研框架)的底层架构和机制。