岗位职责
负责语言及多模态基座模型的全链路数据能力建设。我们致力于通过 Data-centric(以数据为中心)的理念与技术,打造业界一流的大模型底座。在这里,你将深度参与模型进化的核心环节,持续提升数据对模型能力、任务成功率和评测有效性的支撑效率:
- 全链路数据构建与优化:负责大模型各阶段训练语料的优化工作,涵盖预训练数据、后训练数据、Agent 轨迹数据和评测数据的挖掘、清洗、去重、筛选、标注、合成与质量分析;
- 数据驱动的核心能力突破:针对性地提升基座模型在知识、推理、Agent及多模态等维度的关键能力;具体工作包括扩充各能力相关的语料、定义并迭代优化数据质量、针对性地合成相关语料、优化高质量数据筛选策略、优化各阶段数据配比及训练策略、优化评测方式等;
- 数据资产与迭代机制建设:研发高效可复用的数据处理链路与基础设施,探索自动化标注策略与规则/模型结合的筛选机制;建设数据效果评估与归因体系,探索数据特征与模型表现的深层关联;
- 前沿技术跟踪与探索:紧跟大模型领域的前沿技术发展,深入研究高质量数据合成、强化学习数据流建设、知识增强等方向,并推动创新技术在基座模型中的工程化落地。
职位要求
基础要求
- 学历背景:计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制。
- 编程功底:熟练掌握 Python 编程语言,熟悉主流深度学习框架(如 PyTorch);熟悉常用的大数据处理框架(如 Spark、Hadoop 等)。
- 理论基础:具备扎实的机器学习、深度学习理论基础,了解自然语言处理(NLP)或多模态大模型的基本架构与原理。 专业能力
- 数据处理分析:具备扎实的数据处理、统计分析和实验设计能力;熟悉海量多模态数据(文本、代码、图像、轨迹等)的清洗、去重、过滤、切分和采样方法。
- 大模型数据认知:深刻了解大模型常见数据形态及用途,包括但不限于 Pretraining corpus, Instruction data, Tool-use / Trajectory data, Benchmark / Eval data 等。
- 数据构建技术:熟悉数据构建与优化的常见前沿方法,能够熟练运用规则与模型结合进行数据筛选,了解合成数据生成、自动化标注策略及数据配比调优。 能力特质
- 技术热情:热爱人工智能领域,对通过“数据驱动模型效果提升”抱有极大的兴趣,对探索未知和前沿事物充满热情。
- 问题解决:具备优秀的逻辑思维与洞察力,能够独立思考、设计实验并解决复杂的、非标准化的技术问题。
- 团队协作:具备良好的沟通表达能力与团队合作精神,能够与算法、工程、产品等团队紧密配合,推动项目从实验到落地的闭环。 加分项:
- 项目实战:有大规模数据处理、数据合成、复杂标注策略设计或数据效果归因的实际项目经验;有大模型预训练、SFT/RLHF 实操经验者优先。
- 顶级竞赛:参加过国内外知名算法竞赛(如 Kaggle、ICPC、ACM等)或信息学、数学、物理等学科奥林匹克竞赛,并取得优异成绩。
- 学术视野:在顶级国际会议/期刊(如 NeurIPS、ICML、ICLR、ACL、CVPR 等)以主要作者身份发表过 AI 相关论文。
- 开源贡献:有算法工程化落地经验,在主流大模型开源社区或算法库(如 HuggingFace、Megatron 等)有代码开发、维护或 PR 贡献经历。