部门介绍
国际化内容安全平台团队致力于为字节跳动国际化产品的用户维护安全可信赖环境,通过开发、迭代机器学习模型和信息系统以更早、更快发掘风险、监控风险、响应紧急事件,以人工智能技术支持业务发展,力求更高效、更敏捷、更全能地维护站内生态安全。
- 训练推理稳定性体系建设:负责大模型训练、推理及配套基础链路的稳定性目标与度量体系(SLI/SLO)设计,建立风险预防、异常发现、应急响应、复盘闭环的全生命周期管理机制,持续降低故障发生率与业务恢复时长;
- 架构风险前置与高可用建设:深入训练与推理研发全周期,参与关键架构方案评审(如PD分离、多机多卡分布式推理、Checkpoint与断点续训等),前置识别单点、容量和容灾风险,推动可观测性、故障隔离、限流降级和弹性伸缩能力落地;
- 变更管控与发布质量:建设面向大模型平台的变更与发布管控机制,落地灰度发布、配置变更审批、危险操作拦截和快速回滚能力,把「可观测、可灰度、可回滚」变成研发默认动作,降低人为变更引发故障的概率和影响面;
- 重大事件与业务高峰保障:负责突发风险事件、全球性重点活动、模型大版本上线等关键节点的稳定性预案、端到端压测、混沌演练和重点值守,保障国际化内容安全审核链路在流量高峰和风险突增时持续可用;
- AI驱动的稳定性运营与工具建设:建设故障智能分析能力,设计故障标签体系、自动化打标、根因推荐和Runbook自动化执行,沉淀知识库、故障案例库和应急演练机制,把个人经验转化为可复用的平台能力和组织资产。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 本科及以上学历,计算机、通信、电子信息科学等相关专业,3年以上SRE/稳定性工程/AI Infra/云平台运维研发相关工作经验;
- 熟练掌握Python/Go/Java/C++中至少一种编程语言,具备较强的工程实现能力,能独立建设稳定性平台和自动化工具;
- 熟悉Linux、Kubernetes、容器和云原生技术体系,理解分布式系统与服务治理,具备扎实的可观测性(Metrics/Logging/Tracing)、性能分析和线上问题定位能力;
- 有大模型训练或推理服务稳定性保障经验者优先,例如GPU异构算力运维、分布式训练与断点续训、vLLM/SGLang等推理引擎、容量规划或混沌工程实践;
- 具备优秀的全局视角、跨团队沟通和推动能力,责任心强,能在复杂协作场景中把稳定性机制真正落地;对用AI/Agent重构稳定性运维保持热情者优先。