岗位职责
- 参与智能体(AI Agent)及其应用场景的安全风险研究,探索智能体在复杂交互环境中的攻击面、威胁建模与防御机制。
- 协助开展大模型安全攻防实验,包括越狱攻击、提示注入、对抗样本构造等,评测不同智能体架构在任务执行中的鲁棒性与防御能力。
- 研究智能体决策过程中的风险建模方法(如基于马尔可夫决策过程的行为建模),并设计相应的安全护栏与防御算法。
- 跟踪前沿研究进展,调研智能体安全、可信 AI 与大模型内容安全相关的学术论文与技术方案,为团队提供前沿洞察。
- 协助构建安全评测基准与工具链,形成可复现的安全评测流程,支持团队在多任务、多场景下的风险分析与能力验证。
职位要求
- 计算机科学、人工智能、网络安全、数学等相关专业在读博士,具备AI安全、强化学习或大模型相关研究背景。
- 熟悉大语言模型(如GPT、LLaMA、Qwen 等)的基本原理,熟悉深度学习框架(如PyTorch、TensorFlow)。
- 对AI安全攻防有浓厚兴趣,熟悉常见攻击方式(提示注入、对抗样本、数据投毒等)或防御技术(鲁棒优化、内容安全检测、代理模型防御等)。
- 具备良好的研究能力和论文阅读能力,精通Python/C++/Java中至少一门语言,具备扎实的数据结构、算法基础及工程化能力,能够快速理解前沿工作并复现相关实验。
- 具备良好的团队协作意识与沟通能力,能够在导师指导下推进课题研究。
- 在 AI 安全、智能体或机器学习相关领域有论文发表(如ACL、CCS、NeurIPS、ICLR等)、竞赛获奖或开源项目经验者优先。