岗位职责
- 深入分析字节跳动大规模AI集群(大模型、推广搜、语音/视觉/内容理解等场景)性能瓶颈和需求,结合业务演进趋势,支持GPU定制选型、AI基础设施(服务器/互联/超节点)的架构设计和优化;
- 基于真实业务构建AI Benchmark,抽象AI模型,支持AI集群的建模和性能仿真;
- 研发AI业务性能分析工具和平台,对业务进行全链路性能分析和优化;
- 端到端支持AI服务器产品设计需求输入、性能评估、上线性能优化。
职位要求
- 深入理解计算机体系结构,熟悉Linux内核和容器化技术,掌握C/C++、Python编程;
- 熟悉GPU架构和编程框架,对GPU高速互联、集合通信、C2C一致性、超节点有较深理解;
- 对LLM模型、推荐系统模型结构有较深理解,熟悉PD分离、KV Cache、模型并行等技术;
- 熟悉常见AI推理引擎、训练框架,有推理或训练加速经验,了解算子融合、通信库加速、编译优化等相关技术;
- 熟悉GPU和CPU常用性能分析方法和工具,对AI集群有实际性能分析和调优经验;
- 具有优秀的沟通协作能力、问题分析解决能力。