岗位职责
- 负责飞书AI类业务稳定性保障,包括飞书相关业务在大规模GPU集群上的稳定可靠运行,建立完善的AI类业务SLI/SLO体系,保障大模型开发、训练、部署各环节的高可用性,将业务中断风险降至最低,MTTR保持行业领先水平;
- 负责飞书GPU资源成本管理与优化,包括GPU资源的全生命周期管理,探索各种技术手段提升GPU资源利用率,优化单位有效TFLOPS成本,推动算力成本压降,实现“业务需求、稳定性与成本”的平衡;
- 设计、开发SRE相关平台和AI能力,包括稳定性架构治理、监控报警、预案与演练、定位与止损、资源与成本等相关方向;
- 跨团队协同与技术落地,与算法、模型、深度协作,理解业务需求,从稳定性与成本角度给出专业意见,推动技术方案落地;与基础设施团队深度合作,跟进领域前沿技术,探索在稳定性、成本方向的技术创新及业务价值落地。
职位要求
- 本科及以上学历,计算机、软件工程、电子信息等相关专业,2年及以上GPU相关SRE或运维开发经验,主导过AI类业务或GPU集群的稳定性治理或成本优化项目;
- 熟悉常见GPU硬件架构,熟悉GPU集群部署、调试与性能优化,有GPU集群运维经验;
- 熟悉AI模型训练/推理流程,了解TensorFlow/PyTorch等框架,能从系统层面优化模型算力占用与执行效率;
- 熟练掌握至少一种编程语言(Python/Go/Shell)及Vibe coding工具、技巧,能独立开发运维自动化工具或平台组件;
- 有丰富的生产环境故障排查和性能调优经验,能够快速定位和解决问题;
- 具备强烈的责任心与问题驱动意识,具备优秀的沟通和协作能力。