部门介绍
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
- 分布式编排调度,解决服务/模型训练、推理任务的分布式部署: 1)使用/二次开发诸如Kubernetes,Yarn,Mesos,Celery等分布式调度框架,并可以在不同的业务场景下合理选型;依据各框架的特点进行集群的利用率/均匀性的调度策略优化; 2)对接/扩展各框架在水平/垂直扩展甚至AutoScaling的工作;参与多集群混合调度(类似Kubernetes中Federation)的适配工作;负责不同优先级服务的抢占/驱逐功能;负责不同集群不同类型资源间的拆借/混部对接工作;负责多机房、多地域、多云场景的调度/负载适配;
- 资源撮合层,解决多角色之间的资源联合分配问题:从全局角度进行分配率和资源运营效率的优化;解决各种CPU/GPU/其他异构硬件/模型数据/样本数据/外部调用资源间的容量协调和联合匹配;感知拓扑限制,进行微拓扑优化,从而优化整体网络带宽使用;海量资源和多租户的预算/交付联动;保障性资源/预算外资源,以及混部/超卖的场景对接;
- 参与训练场景的流程/功能需求,诸如阶段性编排,批流阶段封装;提升训练单副本服务的稳定性,如Failover保护;更多的备份点策略;可观测性、可操作性、鲁棒性以及用户体验优化;
- 参与包括离线到在线同步,数据一致性和更新时效性优化;也包括在线服务多副本的异构资源/稳定性预案的流量调度;模型与服务的动态在线编排和集群间坐落编排。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 2027届本科及以上学历在读,计算机、软件工程等相关专业优先;
- 熟练掌握Linux环境下的Go/Python至少1种编程语言,有良好的编程习惯及编码能力;
- 熟悉分布式系统原理,有机器学习系统相关实践和开发经验优先;
- 熟悉开源的分布式调度框架,诸如Kubernetes(K8S),Yarn(Flink,MapReduce),Mesos,Celery,对其中之一有实践积累者优先;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应和行动。