岗位职责
- 负责百灵大语言模型后训练数据生产,深入探索前沿数据生成前沿方法,主导 agentic 数据的规模化合成与自动化生产,包括代码、搜索、金融等方向,并持续提升后训练数据质量。
- 熟练应用 prompt 工程、sft 等技术等,对业界的数据合成、数据优化等新前沿数据处理方法保持持续的追踪,建立针对大模型的数据质量和效果评估方法,持续提高数据质量和多样性,安全性,有用性。
职位要求
- 熟悉分布式计算、gpu 性能调优,良好的思维能力、独立思考和解决问题的能力,良好的沟通能力。
- 在复杂推理(Reasoning)、代码生成或智能体(Agent)等特定垂直领域有深入的后训练经验。
- 加分项:在 ACL、EMNLP、ICLR、NeurIPS 等 AI 顶会发表过大模型相关的高质量论文。