岗位职责
我们关注模型训练系统,为深度学习模型训练和超大规模训练提供算力基座,包括但不限于以下职责:
- 基于阿里云原生底座,设计实现数万卡规模的多租户、多种异构硬件、高性能计算集群的调度系统;
- 研发轻量级的训练重启、故障备份迁移、代码-依赖分发系统,面向有效训练时间极致优化;
- 针对基座模型训练,打造全面的可观测、可视化系统,洞察全生命周期软硬件故障动态;
- 结合大规模分布式训练框架、前沿的异构硬件,分析并解决预训练、后训练过程中软硬件缺陷;
- 构建大模型的模型训练、模型评测、模型管理、模型交付在内的MLOps平台;
- 平台化的支撑多模态生成模型的训练、迭代,以及在AIGC场景的生产化落地应用。
职位要求
- 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具;
- 有极佳的工程实现能力,精通Java、Go、Python之一;
- 有调度系统开发经验者优先,有MLOps系统开发经验者优先;
- 有AI服务器架构、异构计算系统、网络系统优化经验者优先;
- 有TensorFlow/PyTorch全链路算法开发、交付经验者优先;
- 勤于动手,善于动脑,乐于挑战的同学优先。