岗位职责
- 聚焦集团研发提效场景,负责Code大模型训练数据的生产与管理;
- 深入研究大模型训练各阶段数据需求,设计和开发多类型数据的加工处理链路;
- 设计和建设Code数据合成方案,支持数据Scale等工作;
- 根据Code大模型训练数据特点,抽象并开发高效、可靠的数据加工框架&引擎,提升数据处理工程效率;
- 探索使用Agent、Self-Evolve的方式来构建下一代更高效的Pretrain数据Pipeline。
职位要求
- 熟悉至少一种编程语言,如Go、Python、Java等;
- 对大数据技术有深入的理解加分,熟练掌握如Spark、Flink、Kafka、Hive、HDFS等工具加分;
- 有数据中台、机器学习相关的系统平台开发经验加分;
- 有大模型Pretrain、CT训练或者数据相关经验加分;
- 有面对技术挑战的热情,能独立思考,具有好奇心和快速学习能力。