岗位职责
- 探索基于强化学习的智能运维(SRE)Agent技术,通过模拟复杂故障场景训练决策策略,构建具备根因诊断、自主决策的智能系统,结合推理规划、多轮工具调用、因果推断与反事实推理等前沿技术,推动运维智能化的突破性进展。
- 参与核心算法设计与系统开发,探索结合因果建模与反事实推理方法,解决动态环境下的根因诊断与决策优化问题。
- 基于真实生产数据或开源数据集,搭建故障模拟环境并定义多维度奖励函数,实现多轮工具调用能力(如日志分析、指标监控、配置管理API),构建端到端的智能运维原型系统,设计对比实验评估Agent性能,撰写技术报告并参与论文或专利撰写。
职位要求
- 计算机科学、人工智能、数学、统计学或相关专业硕士及以上学历,博士或有国际顶会论文发表者优先。
- 精通Python,熟悉PyTorch深度学习框架,对LLM、Agent领域有深入研究,有AI Agent相关研发经验(如多智能体协作、决策优化、强化学习与SFT结合等)。
- 了解因果图建模、反事实推理,熟悉强化学习算法,如PPO、GRPO、DAPO等主流策略优化算法。
- 了解SRE/故障注入技术,有智能运维(AIOps)、故障预测、根因分析(RCA)相关项目经验优先。
- 对复杂系统建模与优化有强烈兴趣,具备跨学科能力,思维严谨,能通过实验快速验证假设。