岗位职责
- 负责智能创作AI平台数据工程的架构设计和持续演进,满足视觉大模型(Seedance、Seedream、Seed VLM)后训练数据生产需求;
- 构建离线批量推理系统,深入优化性能和硬件资源使用效率,提升系统的性能、可靠性和扩展性;
- 与后训练平台团队深度合作,提供数据处理和后训练基础设施高效结合的技术方案,加速后训练模型生产过程;
- 与算法同学密切配合,理解视觉大模型研发流程,前沿模型研究中数据解决方案的架构设计和演进;
- 持续探索业界前沿的多模态数据处理技术,设计并实现到自研数据平台中。
职位要求
- 硕士学位及以上,计算机、人工智能等专业优先;
- 扎实的编程基础、良好的编程风格,熟悉多线程编程、分布式计算、网络通信、内存管理、设计模式;
- 熟悉多项大数据处理的工具/框架,例如Hadoop、HDFS、Hive、MapReduce、Spark、Presto、ClickHouse、Ray、数据湖等;
- 具备分布式系统的研发经验,有优化系统性能问题的能力和经验;
- 具备优秀的分析问题和解决问题能力,勇于挑战困难问题,注重细节;具备良好的团队协作意识。 【加分项】
- 有生成式大模型性能优化经验,熟悉训练、部署链路优化技术;
- 熟悉Ray内核或者Ray相关框架应用;
- 有GPU资源调度、负载均衡实战经验积累;
- 有RL数据处理、训练经验。