岗位职责
- 负责抖音推荐链路的系统架构设计与演进,深入理解业务需求,推动架构持续升级,提升系统的可扩展性、可维护性和整体性能;
- 构建并完善抖音全链路稳定性保障体系,主导跨机房容灾、弹性伸缩、流量治理和降级策略的设计与落地,确保系统在极端压力下持续稳定;
- 负责抖音App的性能与成本优化,持续挖掘并解决系统瓶颈,通过技术手段(如带宽优化、资源调度、缓存策略等)实现性能与成本的最佳平衡;
- 完善抖音App可观测性与实验支持体系,建设高标准的监控、日志、追踪系统,并为A/B实验平台提供高效、可靠的架构支持,加速业务创新迭代;
- 解决抖音技术难题攻关与知识沉淀,针对解决大规模分布式系统中的疑难杂症,推动新技术和新方案的预研与落地,并通过文档、分享等方式在团队内传播最佳实践。
职位要求
- 扎实的计算机科学与分布式系统基础,对数据结构、算法、操作系统、网络协议有深入的理解,并具备大规模分布式系统的设计与实践经验;
- 精通至少一门后端编程语言,包括但不限于Go、Java、C++、Python等;
- 熟悉微服务架构,对RPC框架、服务网格(Service Mesh)、缓存、消息队列、KV存储等有深入的应用和理解;
- 能够快速定位并解决复杂的线上问题,具备系统化的故障排查和性能调优能力;
- 具备良好的沟通与协作能力,能够清晰地表达技术理念,与产品、算法、运营等不同角色的同事高效协作,共同推动项目落地。 具备以下条件者优先:
- 拥有面向亿级日活用户的核心系统稳定性治理经验;
- 具备流量调度、A/B实验平台、全链路压测、自动化演练等领域的实践经验;
- 主导过跨机房、跨地域容灾项目,并有实际的演练与落地成果;
- 在服务性能优化,特别是带宽治理、内存优化、字段压缩等方面有成功案例;
- 对推荐系统(召回、排序、重排)的业务逻辑有一定理解,热衷于通过技术驱动业务增长。