部门介绍
字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位;目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户;第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。
- 该岗位面向超大规模AI加速卡集群,负责豆包Seed自研LLM模型训练任务的性能优化与稳定性建设,深度参与训练框架、通信链路、算子库和集群调度等核心环节,支撑万卡规模训练任务高效、稳定运行;
- 训练框架优化:优化数据并行、张量并行、流水并行、专家并行和混合并行策略,提升端到端训练吞吐与扩展效率;
- 集群性能与稳定性:围绕计算、通信、显存、调度、Checkpoint、容错恢复等链路,解决静默数据错误、网络抖动、通信瓶颈和异常定位问题;
- 软硬件协同优化:推动训练框架、算子库、通信网络、编译栈和计算架构协同,使超大规模AI加速卡集群稳定承载LLM训练。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机、软件工程、人工智能、电子信息、微电子等相关专业优先;
- 熟悉Linux环境下的C/C++或Python,具备扎实的编程能力和工程习惯;
- 熟悉计算机体系结构、芯片微架构、高性能计算、分布式系统、并行计算中的至少一个方向;
- 了解PyTorch、Megatron、DeepSpeed、FSDP、TorchTitan等训练框架或分布式训练系统中的至少一种;
- 关注训练中的吞吐、显存、通信、扩展效率、任务稳定性和异常定位问题。 加分项:
- 有GPU/NPU集群LLM训练优化、分布式训练框架、通信库优化经验;
- 熟悉NCCL、HCCL、RDMA、RoCE、集合通信、通信计算融合或网络性能分析;
- 了解MoE训练、混合精度训练、ZeRO、Checkpoint优化、容错恢复、长周期稳定训练相关技术;
- 有静默数据错误定位、硬件故障分析、集群稳定性建设、训练任务调优经验;
- 有OI/ACM、HPC竞赛、系统竞赛、科研项目或开源项目经历。