部门介绍
Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
- 负责统一中台系统的通用性架构设计,支撑多业务在低成本、高可用性、高吞吐、高性能、大空间等不同场景的诉求;
- 攻克多级/分级存储的架构复杂度难题,覆盖显存、内存、外存等全存储层级;
- 跟进前沿软件与硬件架构的演进方向,并开展技术尝试;
- 负责站内中台多代际、多机房、多套餐及不同库存资源的规划与利用率优化,实现基于模型规模与服务流量的自动、动态调优;
- 统筹多个子系统的多目标优化,包括训练模块的功能性、可用性、容错性,Serving模块的成本、容量、性能,以及系统同步模块的数据一致性、实效性、带宽容量;
- 深耕索引与存储结构的极致优化,探索无锁化、渐进式数据结构等技术方向,挑战CAP定理边界。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 2027届获得本科及以上学历,计算机、软件工程等相关专业优先;
- 熟练掌握Linux环境下的C++/Python编程语言的使用;
- 掌握分布式系统原理,参与过分布式系统的设计、开发、维护和持续优化,能够识别复杂分布式系统中的潜在问题;
- 参与过推荐/搜索/机器学习等分布式系统工作,涉及过诸如资源调度、任务编排、模型训练、模型推理、特征抽取、MLSys、AIOps等内容;
- 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分,具备良好的团队合作精神;
- 具备工作责任心、学习能力、沟通能力、自驱力和执行力,有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。 加分项
- 参与过类似ParameterServer系统优化,或者搜索系统的索引结构优化;
- 参与过KVCache类系统(如Mooncake等)开发或优化;
- 了解Redis、LevelDB/RocksDB、Mongo等开源存储类项目;或者有HDFS、Ceph等分布式存储系统使用/优化经历;
- 熟悉主流的机器学习框架(TensorFlow/PyTorch/MXNet);
- 有以下某一方向领域的经验:AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking),Machine Learning Frameworks,ML for System,Distributed Storage。