部门介绍
AI数据与安全团队为Seed基座模型及AI原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与Seed研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决AI前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和AI产品的一手用户。
- 深度参与Coding Agent训练所需代码、工程数据的生产及标注全流程,基于模型能力边界与训练目标,输出代码数据标注策略及标准(包括代码补全、代码生成、Bug修复、代码评审、Agentic任务轨迹等场景),支撑代码与工程数据资产的规模化交付;
- 对接数据标注团队(含资深开发者、算法工程师标注员),明确任务需求,把控任务交付进度及质量,独立完成项目交付;设计并优化高质量多场景(自然语言、代码、命令行轨迹、工具调用、Repo级上下文)数据集的构建流程,主导清洗、标注、SFT及RLHF/RLVR的数据策略设计;
- 基于实际研发、架构设计、代码评审、DevOps或开源项目贡献等实操经验,完成代码片段、Issue/PR、执行轨迹、错误日志的标准化处理及标注,搭建自动化数据处理链路(含静态分析、单测执行、沙箱评测),探索合成数据(Self-Instruct、Execution-Feedback、Repo-Level Synthesis)的生成策略;
- 具备扎实的代码能力,能够利用Python或其他编程语言实现标注辅助工具(如AST解析、代码差异提取、可执行性校验、数据质检、格式归一化、轨迹回放等),提升人工标注效率与一致性,推动标注流程工程化;
- 结合Coding Agent场景,参与Prompt与任务模板设计、Tool-Use行为规范制定与效果验证,提升模型在多轮代码任务、长上下文工程项目、Agentic工作流中的可控性、可执行性与意图对齐度。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 计算机相关专业本科及以上学历,1-3年软件研发或数据交付经验;
- 熟练掌握至少一门主流编程语言(Python/Go/Java/TypeScript等),具备完整项目交付经验;
- 熟悉Git/GitHub工作流、CI/CD、容器化与沙箱执行环境;
- 了解LLM、Coding Agent、SFT/RLHF/RLVR基本原理者优先;
- 有大模型数据标注、评测集构建、开源社区贡献或Agent框架(如SWE-Agent、OpenHands、Cursor、Claude Code等)使用经验者优先;
- 具备良好的项目管理能力、跨团队沟通能力与质量意识。