部门介绍
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。 AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。
- 参与Seed基础模型Coding Agent方向的训练数据管线建设,负责后训练数据的设计、构建、清洗、挖掘与质量标准制定,覆盖SFT、RLVR、RLIF等数据形态;
- 分析Coding Agent在训练和评测过程中的数据短板,定位数据缺陷,并针对性设计数据迭代策略,扩充高价值训练样本;
- 围绕代码生成、代码修复、仓库级任务、工具调用、多轮开发轨迹等Coding场景,探索高质量合成数据与回流数据利用方案;
- 探索Coding Agent在World Knowledge、Harness、Synthetic Data、Benchmark等方向的数据构造与评估方法,推动模型在真实软件工程任务中的能力提升;
- 参与数据质量评估、自动化筛选规则、训练样本构造策略和Benchmark分析,沉淀可复用的数据生产规范与工具链。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 本科及以上学历在读,计算机科学与技术、软件工程、人工智能、自然语言处理等相关专业优先;
- 对NLP、大模型后训练、Synthetic Data、RLVR/RLIF、Coding Agent等方向有浓厚兴趣,有相关研究或工程经验者优先,有大规模数据处理经验,熟悉Pandas、PyArrow、Spark、HDFS等工具优先;
- 具备扎实的编程基础,熟悉至少一门主流编程语言,如Python、C/C++、JavaScript、Go等,理解基础代码逻辑和常见软件开发场景,熟悉或愿意深入了解大模型训练数据构造、数据清洗、数据挖掘、自动化评测等工作,对真实软件工程任务有理解,参与过开源项目、工程研发或复杂代码库维护者优先;
- 有较强的问题分析能力和工程落地能力,能够从模型表现和评测结果中发现数据问题,并提出可执行的改进方案,有Code LLM、Coding Agent、Bugfixing、代码生成、Repo-level Benchmark、Agent Tool Use等相关项目经验优先;
- 有OpenClaw、大模型Harness、代码评测框架、自动化数据处理Pipeline等相关经验者优先;有AI顶会发表经历,或ACM/ICPC、CCPC等程序设计竞赛获奖经历者优先;每周可实习4天及以上,连续实习3个月及以上优先。