岗位职责
- 构建覆盖Prompt Injection、越权调用、数据泄露、上下文污染、模型幻觉、滥用自动化能力等风险的系统性评估数据集与基准,形成面向飞书内大模型的安全评测标准;
- 针对具备“数字分身”能力的Agent(如OpenClaw类自动化工具),构建Agent运行时行为特征体系(Tool调用图谱、API调用频率分布、会话节奏、上下文压缩模式等),设计Agent风险检测算法,通过实时拦截、分级管控与审计溯源保障Agent安全;
- 研究模型在攻击扰动下的一致性、稳定性与安全边界,探索SFT/RLHF/DPO等对齐技术在安全决策场景中的有效性与局限,提升模型在复杂交互场景中的可控性与风险收敛能力;
- 建立大模型Red Team机制,系统性设计攻击向量(Prompt注入、工具劫持、记忆污染、RAG检索污染、多轮诱导攻击等),持续发现模型和Agent系统的结构性弱点,并推动工程侧闭环优化。
职位要求
- 两年以上算法研发经历,计算机相关专业本科及以上学历;
- 编程能力强,至少精通一种编程语言(Python/Go等),熟悉LangChain/AutoGPT/Hadoop/Spark/Flink等框架;
- 熟悉Transformer架构及主流训练范式(SFT、RLHF、DPO、PPO等),理解Reward Model、对齐机制与安全约束建模;对Prompt Injection、防越权机制、模型幻觉治理等方向有深入认知;理解Agent工具调用链、函数调用、Memory机制、RAG架构;具备运行时行为检测、异常检测、时序建模经验者优先;
- 了解当前主流的AI安全问题与攻防方法,包括但不限于Prompt Injection(直接注入与间接注入)、Jailbreak、数据投毒、模型逆向、对抗样本、模型滥用及越权调用第三方服务等攻击手段与防御思路;安全攻防或威胁建模经验:具备一定的安全研究、渗透测试、红队演练或威胁建模经验,能够从攻击者视角系统性地分析复杂系统的安全风险面。 加分项
- 在AI安全、对抗机器学习、系统安全等领域发表过高质量学术论文(如顶会S&P、USENIX Security、CCS、NeurIPS、ICML、ACL等),或在相关开源项目中有持续贡献;
- 有大模型应用或智能体系统的安全研究、攻防测试或安全治理的实战经验,曾主导或深度参与过相关安全项目。