岗位职责
1)训练底座:建设数千卡级别高性能训练集群,支持Dense/MoE、Long Context、RLHF 多阶段训练,解决网络、IO、Checkpoint 瓶颈,实现故障秒级恢复,训练效率提升。 2)推理引擎:自研或深度改造推理框架(vLLM/SGLang),实现连续批处理、KV-Cache 压缩、投机解码、量化、动态插拔 LoRA,提升线上吞吐,降低P99 延迟。 3)稳定性与可观测:构建全链路监控(GPU掉卡、NCCL超时、显存泄漏、token级延迟),实现1分钟发现、5分钟定位、10分钟恢复;建设混沌工程,每周主动注入故障,保障
- 99%可用性。 4)前沿技术落地:跟进FlashAttention-
- Ring-Attention、PD分离、RDMA动态拓扑等前沿技术,完成验证并上线收益。
职位要求
1)计算机、人工智能、数学、统计学等相关专业,硕士及以上学历 2)2年以上分布式系统或高性能计算经验,其中至少1年专注大模型训练或推理。 3)熟悉GPU体系结构,理解Tensor Core、NVLink、RDMA、GDR,能用Nsight/NCCL-tests快速定位性能瓶颈。 4)精通Python/C++,熟悉PyTorch底层(Storage/ProcessGroup/Custom Op),能写CUDA Kernel或Triton Kernel加分。 5)掌握分布式训练框架Megatron-LM/Deepspeed/Pipeline并行/Zero冗余优化器,有百亿/千亿模型训练调优实战加分。 6)掌握Linux内核调度、内存管理、容器cgroup、设备隔离,有K8s Operator开发经验,能独立维护CRD+Admission Webhook。 7)具备强烈的Ownership,曾主导过跨团队(算法、框架、硬件、运维)复杂项目,从需求澄清到上线复盘全流程闭环。 加分项 1)开源贡献:vLLM、SGLang、DeepSpeed、Transformers、Triton、KubeFlow 等核心PR被合并。 2)学术成果:MLSys、OSDI、SC、ICPP、IPDPS 发表过大模型系统相关论文。 3)业务结果:在日均10亿+调用量的场景,把单卡吞吐提升3倍以上并保持99.9% SLA。