岗位职责
- 负责亿级参数规模深度模型的训练优化与工程落地,涉及召粗精全链路模型,包括训练速度、模型体积、Serving耗时等,助力穿山甲模型训练效率提升;与算法团队紧密协作,实现模型快速迭代与规模化上线,持续提升模型效果与训练效率;
- 通过量化压缩、优化器、混合精度训练、特征淘汰等技术优化模型体积,为模型的进一步复杂化提供空间;
- 深入优化训练流程全链路性能,包括数据预处理、模型并行策略、梯度同步、通信优化、CUDA算子加速等关键环节;从硬件(GPU/TPU)、网络通信、内存管理、计算图执行等多个维度进行系统级调优;
- 基于PyTorch框架进行模型训练系统的定制化开发与性能调优,支持混合精度训练、量化压缩、特征淘汰、模型蒸馏等技术手段,提升训练吞吐与资源利用率;
- 结合长序列、LLM等复杂化应用,提供更个性化的Training&Serving的效率与耗时优化,帮助更高效的落地。
职位要求
- 本科及以上学历,具备优秀的编码能力,扎实的数据结构和算法功底,熟悉主流深度学习编程框架;
- 熟悉至少一门主流编程语言(如C++、Python、Go或Java);
- 对以下至少一个领域有深入理解:深度学习和统计机器学习、机器学习平台、分布式训练框架;
- 优秀的分析问题和解决问题的能力,对解决具有挑战性的业务问题充满激情;
- 加分项:在搜广推场景有丰富的深度模型/大模型实践经验,或者有模型效率优化背景。