岗位职责
针对行为风控场景高度对抗、动态演化、目标稀疏、决策链路极长的问题,探索通过多轮交互、跨源证据关联、链路还原与路径推演、多层级结果验证的Agentic技术方案。
- Agent 训练环境与任务合成 面向风控场景场景,研究可scale,可verify的Agent训练环境与沙箱:环境抽象与工具接口设计、任务自动合成与难度分级、课程学习与"能力边界"自适应采样、执行结果驱动的自动化校验,探索环境规模化对 Agent 泛化能力的 scaling 规律。
- 长程任务的强化学习与信用分配 围绕多轮、长时序、稀疏奖励的复杂风控任务,研究 Agentic RL 的训练稳定性与有效性问题:轨迹级/步骤级信用分配、过程奖励与结果奖励的耦合设计、Reward System 与可验证奖励(verifiable reward)构建、长轨迹下的方差控制与熵坍塌抑制、多轮 rollout 的采样效率优化,以及自我博弈(self-play)在动态对抗场景中的应用。
- Agent 自我进化与自动化协议工程 研究智能体的自动化演进机制,探索从人工提示工程向自动化协议工程的范式迁移;结合失败案例的自动归因、弱点聚类与定向数据生成,构建可持续自我改进的智能体系统。
- 评测体系与 Benchmark 建设 针对长程 Agentic 风控任务设计系统化评测方案:任务分级、能力解构、过程可信度与结果正确性的联合度量、对抗鲁棒性评估;沉淀高质量 Benchmark 与评测基础设施,推动研究结论可复现、可比较。
职位要求
- 博士在读优;计算机、人工智能、自动化、软件工程、信息安全、数学、统计等相关专业硕士以上学历;
- 具备扎实的科研训练与研究品味:在 NeurIPS / ICML / ICLR / ACL / EMNLP / KDD / WWW / AAAI / IJCAI / USENIX Security / CCS 等国际顶级会议或期刊以第一作者/共同一作发表论文者优先;有高质量 arXiv 预印本、开源项目(可观 Star 数)或竞赛成绩者同等考量;
- 熟悉大模型后训练与强化学习技术栈:SFT / DPO / PPO / GRPO 及其变体、RLHF / RLVR、奖励建模、Agentic RL;熟悉至少一种主流 RL 训练框架(如 verl、OpenRLHF、TRL、AReaL、slime 等);
- 熟悉主流 Agent 框架与范式(如 ReAct、Tool Calling、Multi-Agent 编排、MCP 等),具备从零搭建 Agent 系统或训练环境的实践经验;
- 编程基础扎实,精通 Python,熟练使用 PyTorch,具备多机多卡分布式训练调试与工程排障能力;
- 具备独立推动课题的能力:能够独立完成文献综述、问题定义、方案设计、实验验证与结果归因,具备良好的英文科技写作与学术表达能力。