岗位职责
- 负责百炼平台后训练技术架构设计与性能优化,建设 LLM/MLLM 及 AIGC (DiT) 场景的生产级微调与对齐能力。
- 负责十亿至万亿级参数模型分布式训练的工程落地,定位计算、显存、通信与系统瓶颈,提升 MFU 并降低训练成本。
- 主导数据管线(数据合成、效果评测、数据回流)与高鲁棒 Rubric/Reward 体系的架构设计与开发,牵引模型持续迭代。
- 负责分布式训练容错及弹性架构,优化端到端后训练性能与稳定性,保障生产级 SLA。
职位要求
- 计算机、人工智能相关专业硕士及以上学历,精通 Python/C++/Rust 等至少一种编程语言,具备扎实的系统架构设计能力。
- 深入理解深度学习框架(PyTorch/DeepSpeed 等);具备大规模 GPU 集群训练排错(如网络死锁、显存 OOM、容灾恢复)与性能调优经验。
- 熟悉 LLM/MLLM 或 AIGC (DiT) 后训练算法流程(SFT、PRM、Agentic RL 等),具备后训练框架二次开发、深度定制或自研经验者优先。
- 具备良好的沟通协调能力、项目推动力与团队合作精神,有复杂业务场景工程落地成功经验者优先。