岗位职责
构建强化学习环境:将真实的代码工程与网络安全场景转化为可训练的 RL 环境,设计合理的奖励信号,与算法研究员紧密合作,探索不同环境设计对模型 Agent 能力的影响。 评估模型的 Agent 能力:在擅长的方向上设计高质量评测任务与端到端测试用例,从任务完成度、代码规范、工程质量等多维度,量化模型在复杂真实场景中的表现,并持续迭代评测标准以跟进业界前沿。 合成高质量训练数据:围绕 repository-level 代码修复、漏洞复现与利用等场景,自动化构建复杂任务与指令数据,并编写基于 AST 解析、静态规则或沙箱运行结果的清洗与过滤脚本,从海量合成数据中筛选出高质、可用的正 / 负样本。 数据与评测管线工程化:将"环境构建 → 数据合成 → 沙箱执行 → 自动评测 → 质量过滤"闭环脚本集成与 Pipeline 工具化,保障数据生产与评测的稳定性与吞吐效率。
职位要求
- 计算机、软件工程相关专业,熟练掌握 Python,能独立编写数据处理、评测脚本等工具;熟悉 Linux / Docker 者优先。
- 自驱力强,能独立发现、定义并推动解决问题;善于跨团队协作沟通。
- 具备 Claude Code、Cursor、Codex 等 AI 编程工具的重度使用经验,对 LLM 辅助开发有自己的理解与思考。