岗位职责
- 安全推理数据构建:设计并构建覆盖多语言、多模态、多场景的安全对齐训练数据体系,包括安全指令微调数据、偏好对比数据、对抗性攻防数据等,建立数据质量评估与迭代机制,为安全对齐提供高质量数据基础。
- 安全代答模型研发:研究并构建安全代答(Safe Refusal / Safe Response)模型,使模型在面对高风险请求时能够生成既安全又有帮助的回复,实现安全性与有用性的最优平衡,避免过度拒绝或生硬拒答。
- 前沿安全风险治理:深入研究 CBRN(化学、生物、放射性、核)等高危领域的安全防护策略,探索 Agent 场景下的安全风险(如工具滥用、权限越界、Prompt Injection、间接注入攻击等),构建系统化的风险识别与缓解方案。
- 安全评测与红队测试:建立自动化与人工相结合的安全评测体系,设计多维度、多层次的 Red Teaming 方案,覆盖越狱攻击、对抗性 Prompt、多轮诱导、多模态攻击等场景,持续发现模型安全盲区并驱动修复闭环。
- Guard 防护体系研发:设计并实现实时安全护栏(Guard)系统,包括输入过滤、输出检测、对话级风险拦截等模块,支持高并发、低延迟的在线安全防护,保障模型在生产环境中的安全运行。
职位要求
- 计算机、机器学习、人工智能、信息安全等相关专业,硕士及以上学历。
- 具有大模型安全对齐(Safety Alignment)、内容安全、对抗鲁棒性等方向的实践经验,熟悉 RLHF / DPO / Constitutional AI 等对齐技术。
- 精通 Python 及 PyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据构建、模型训练到在线部署的全链路工作。
- 具备优秀的对抗性思维与风险敏感度,能够从攻击者视角系统性地发现和评估模型安全隐患。 加分项:
- 在 AI 安全、对抗攻击与防御、可信 AI 等方向有深入研究,曾在 NeurIPS、ICLR、ICML、ACL、USENIX Security、IEEE S&P 等顶级会议或期刊发表论文。
- 熟悉主流 Red Teaming 框架与方法论,有实际攻防对抗经验。
- 具备 Agent 安全、工具调用安全、多模态安全等新兴安全方向的研究或落地经验。
- 拥有知名安全相关开源项目贡献经历,或在 AI 安全社区具有较好的影响力。