岗位职责
- 从传统模型到深度模型, 从LLM到多模态Agent, 负责面向不同业务线的不同模型的在线推理系统, 是工程与算法的深度交融的舞台
- 基于K8S的云原生在线生态系统, 承接大规模分布式系统的运维挑战, 提供产品化一站式的服务能力
- 参与传统框架(tensorflow/pytorch/xgb)到LLM框架(vllm/sglang/lmdeploy), 以及编译优化(MLIR/TVM/Triton) 的持续研发与调优工作
- 负责从底层算子调优, 模型编译, 框架调度, RDMA, PD分离部署, 多卡协同 等各个领域的研发与创新
职位要求
- 计算机,通信相关专业本科以上学历,3年以上后端服务开发经验
- 精通Linux平台下的C/C++/Python语言, 具备扎实的编程功底与技术设计品味
- 精通高性能计算, 熟悉CUDA/OpenMPI的编程, 熟悉tensorflow/pytorch/vllm/sglang 等框架的研发与使用
- 有分布式系统相关研发背景, 有高吞吐高并发的在线服务研发背景
- 热爱学习与探索, 拥抱与探索新的技术方向, 具有强烈的责任心与自驱能力 加分项
- 对主流机器学习框架与大模型推理框架 有深入了解和贡献的优先
- 对模型编译方向, cuda kernel, 算子融合等有深入了解和贡献的优先
- 有端到端的, 从训练到推理全技术栈开发经验的优先