岗位职责
- 参与大模型安全对抗演练:协助开展大模型全链路(SFT/RLHF/推理部署)的安全风险排查、漏洞挖掘与红蓝对抗样本建设。
- 协助研发自动化红队工具:参与设计并实现针对大模型/多模态模型的自动化越狱、提示词注入和对抗性扰动生成算法,协助进行安全边界压力测试。
- 参与大模型安全对齐与防御算法研发:辅助进行基于RLAIF、DPO等前沿对齐技术的算法实验;参与优化输入/输出内容安全过滤模型与多维风险评估机制。
- 开展前沿安全威胁与防御研究:针对间接提示词注入、数据投毒、偏好劫持等前沿安全威胁进行算法复现与评测,探索前沿防御方案。
- 负责安全数据建设与评测闭环:协助构建和维护多维度的安全评测Benchmark,参与编写自动化评测脚本,协助实现“攻击生成-防御阻断-模型评估”的迭代闭环。
职位要求
- 计算机、网络安全、人工智能等相关专业在读硕士或博士,对大模型安全、AI对抗样本、密码学或传统Web安全有浓厚兴趣。
- 具备扎实的深度学习基础:熟练掌握PyTorch等深度学习框架,熟悉Transformer架构,有大模型微调(PEFT/SFT)或强化学习(RL)基础实验经验者优先。
- 对大模型安全漏洞有一定认知,了解常见的大模型安全问题(如提示词注入、越狱攻击),有关注或复现过国内外主流大模型越狱/攻击方法的经历。
- 具备良好的代码功底与工程实践能力:精通Python,熟悉Linux开发环境,有良好的编码习惯,对分布式训练或海量数据特征处理有一定了解。
- 强烈的技术好奇心与自驱力:具备优秀的快速学习能力和极客精神,乐于钻研前沿技术,有良好的团队协作和沟通能力。
- 在安全或人工智能顶级会议/期刊(CVPR,NeurIPS,ICLR,ACL等)发表过高水平安全对抗/AI安全方向论文,或在知名AI比赛、大模型安全挑战赛中获得优异成绩,或有大型开源AI安全项目贡献经历者优先。