岗位职责
- 评测数据挖掘 (1) 针对预训练(含mid-training,下同)模型在coding,cowork,长尾知识,长文本能力等方面的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集。
- 评测数据治理 (1)整合高质量公开评测集和私有评测集。为不同训练阶段、不同领域、不同优化目标(模型结构/数据配比/主线模型迭代)定制评测方案,挑选质量最高、领域最合适、区分度最好的评测数据与指标。
- 评测基建完善 (1)与工程团队合作提高评测系统的效率与稳定性,完善评测故障分析与检测,并推动文本评测与Agent评测的自动化与可视化。
- 预训练-后训练评测一致性探索 (1)设计Pretrain + LightSFT的数据配比和训练策略并搭建相关pipeline,实时检测预训练模型的agentic潜力。 (2)设计面向后训练agent能力导向的预训练评测范式,挖掘高预测性的external metrics以及internal indicators,寻找上限更高、潜力更强的预训练基座。
职位要求
- 计算机、人工智能、数学等相关专业本科及以上在读,可实习六个月及以上。
- 优秀的数据sense,扎实的算法基础和 (vibe-) coding动手能力。
- 具备对基础模型与Agent研发的热情,认同评测对模型优化的巨大价值。
- 加分项: (1)有基础模型团队实习经历; (2)LLM评测/Benchmark构建/数据合成经验; (3)相关顶会论文。