岗位职责
- 负责机器学习系统推理架构和产品的设计开发,支持火山方舟大模型平台和机器学习平台的产品业务;
- 负责深度模型推理任务为核心的在线架构设计与优化,充分利用各种异构计算(GPU、CPU、其他异构硬件)、存储(各种云存储)、网络(VPC、RDMA)等资源,构建多租环境下的稳定性、观测体系,实现高并发、高吞吐的大规模在线系统;
- 负责推理系统的产品化落地,打造稳定、可观测、体验一流的公有云推理平台。
职位要求
- 熟练掌握Linux环境下的Go/Java/Python等1-2种语言;
- 具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
- 熟悉至少一种主流的机器学习框架(TensorFlow / PyTorch 或其他自研框架);
- 熟悉 Kubernetes 架构和生态,有丰富的云原生机器学习系统实践和开发经验,对在线服务治理、 部署架构有深入理解和落地经验;
- 掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护;
- 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动;
- 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。 加分项:
- 有在线GPU推理系统的工程架构落地经验,熟悉常见的在线推理优化手段(Batch、量化、分布式推理等),熟悉GPU、大模型相关软硬件技术栈;
- 熟悉公有云推理产品架构,对该领域用户画像和用户故事有深入理解,有打造世界级产品的热情;
- 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture (GPU, Accelerators, Networking),ML for System,Distributed Storage。