岗位职责
- 参与推荐系统的稳定性优化工作,确保系统在高并发、高负载场景下的稳定性和可靠性;
- 通深入理解推荐引擎的工作原理,掌握稳定性相关技术,并为大规模分布式系统贡献力量;
- 监控和告警系统建设,协助搭建和优化监控系统,配置指标采集和告警规则;
- 参与日常故障排查,分析日志,定位问题根源,协助进行性能测试和优化,提升系统的响应速度和吞吐量;
- 开发或优化稳定性相关的工具和脚本(如自动化测试工具、日志分析工具), 编写技术文档,整理故障案例和最佳实践。
职位要求
- 计算机科学、软件工程、电子信息等相关专业本科或研究生在读;
- 熟悉至少一种编程语言(如 C++、Python、Go),了解 Linux 操作系统和常用命令,对分布式系统、网络通信有一定了解;
- 良好的学习能力和问题解决能力,较强的沟通能力和团队协作精神,对技术有热情,愿意深入研究和探索;
- 加分项:了解推荐引擎的基本原理和架构,熟悉限流、熔断、降级等稳定性技术,有监控系统(如 Prometheus、Grafana)或日志分析工具(如 ELK)的使用经验,有性能测试(如 JMeter)或混沌测试(如 Chaos Monkey)的经验。