岗位职责
- 参与设计与研发快手服务亿级用户的端到端机器学习平台,构建高性能、分布式、可扩展的AI数据计算/存储引擎,通过数据驱动模型生产,支撑包括推荐、广告、搜索、大模型等核心AI算法业务的高效迭代;
- 打造业界领先的AI数据引擎,包括高性能实时/离线分布式计算系统、流批一体化的AI数据湖存储系统、SQL化DSL描述的下一代数据处理平台,为百万核规模、EB级数据的高效计算、存储、迭代提供易用可靠的基础设施;
- 与算法工程师、研究员团队紧密配合,深刻理解端到端的AI模型研发流程,探索业界前沿的Data4AI技术,负责模型研究中数据工程方案的架构设计、实现、持续迭代和稳定性维护。
职位要求
- 至少熟练掌握Java/C++中的一门编程语言,具备扎实的计算机基础功底,编码能力强;
- 熟悉 Hive/Flink/Spark/Hudi/Iceberg/HDFS/Calcite等大数据系统的基本原理,或其他的分布式计算/存储系统,有源码级开发经验者优先;
- 有算法模型研发/数据领域经验优先:熟悉推荐/大模型领域主流模型结构,了解TensorFlow/Pytorch 等深度学习框架;
- 对前沿技术保持学习热情,对未知挑战有探索意愿,有强烈的责任心和自驱精神;
- 在计算机体系结构、数据挖掘、推荐系统、大模型等相关领域会议的论文发表者优先。