岗位职责
本岗位聚焦 Data × Model,研究训练数据、模型内部机制、参数更新与能力表现之间的关系,建立模型感知的数据价值评估方法,并将其应用于数据发现、合成、筛选、配比、训练和评测,形成模型反馈驱动的自动 dataloop。我们寻找的不是只负责生产或清洗数据的工程师,而是能够回答什么数据对当前模型的什么能力有效、为什么有效,并将研究结论转化为规模化数据系统和模型增益的人。 主要职责包括:
- 数据与模型关系建模 - 面向知识、推理、代码、Agentic 等能力,定义模型行为、能力缺口和数据价值; - 基于激活表征、稀疏特征、Transcoder、Attribution Graph 等方法,分析数据触发的内部特征与计算路径; - 结合 Loss、Gradient、Fisher Information 和影响函数近似,研究训练样本对参数更新及目标能力的潜在贡献; - 建立以“模型 × checkpoint × 目标能力”为条件的数据指纹、价值评分与归因体系; - 通过模型干预、反事实样本和稳定性分析,识别能力路径、数据捷径与伪相关信号。
- 模型反馈驱动的数据生产与筛选 - 根据模型评测结果、失败样例和内部机制分析,发现能力缺口并自动生成数据需求; - 建设覆盖 SWE、知识检索和通用 Agent 等场景的可验证数据合成方法; - 融合规则、Bradley、多样性、难度、机制一致性和梯度信息,构建分层级联的数据筛选体系; - 在固定 token 与算力预算下,优化数据覆盖度、新颖性、冗余度和能力配比; - 探索模型反馈驱动的课程学习、动态采样和数据配方演进策略。
- 自动训练与验证闭环 - 打通种子合成、环境构建、轨迹蒸馏、数据注册、模型训练和自动评测全流程; - 构建受控数据分桶实验,验证数据评分与真实训练收益之间的关系; - 设计多随机种子、跨分布、反事实和能力回退评测,排除数据泄漏、格式捷径及 benchmark 过拟合; - 建立数据、轨迹、训练配置、checkpoint 与评测结果之间的完整 lineage; - 将训练结果自动反馈至数据评分器、合成策略和数据配方,形成持续演进的 dataloop。
- 前沿研究与规模化落地 - 跟进 Mechanistic Interpretability、Data Valuation、Active Learning、Curriculum Learning 等前沿方向; - 研究数据价值在不同模型、训练阶段和能力之间的迁移规律与 Scaling Laws; - 将研究原型接入百灵数据和训练基础设施,验证其工业规模下的成本、稳定性和模型收益; - 推动相关成果形成高质量技术报告、开源项目及顶级会议论文。
职位要求
- 计算机、人工智能、数学、统计学或相关专业博士及以上学历,面向应届毕业生;
- 熟悉 Transformer、语言模型训练和常见后训练方法,能够使用 PyTorch 完成模型实验与分析;
- 具备良好的线性代数、概率统计和优化基础,理解反向传播、梯度、Hessian 或 Fisher Information 等基本概念;
- 具备扎实的 Python 编程能力,能够独立完成数据处理、算法实现、实验分析和工程化交付;
- 具备严谨的实验意识,能够设计对照组、识别混杂因素,并根据实验结果修正技术假设;
- 在以下至少一个方向具有课程、论文、竞赛、实习或开源项目经验: - 机制可解释性、稀疏自编码器、Transcoder、特征归因或模型干预; - 数据选择、主动学习、课程学习、影响函数、梯度匹配或数据估值; - 大模型预训练/后训练、Agent 数据合成、轨迹蒸馏或强化学习; - 分布式数据处理、训练平台、自动评测或实验管理系统;
- 在CCF-A类顶会论文工作、开源社区或真实模型训练项目中取得可验证成果者优先。