岗位职责
研究领域: 大模型 项目简介: 岗位描述 本岗位聚焦大语言模型内生安全研究,从模型架构、训练机制与推理过程层面构建本质安全能力。核心研究内容包括但不限于: • 对齐与价值观内化:RLHF/DPO/IPO/Constitutional AI 等对齐方法的改进与鲁棒性分析 • 安全表征与可解释性:理解模型内部安全行为的可解释性表征机制 • 越狱攻防与鲁棒对齐:对抗攻击、越狱攻击的成因分析与内生防御机制设计 • 前沿安全风险分析:围绕前沿大模型安全、Agent安全等风险进行攻击面挖掘与分析
职位要求
1 计算机、电子信息、网络安全、人工智能等相关专业硕士或博士在读; 2 扎实的深度学习基础,有 Transformer 模型训练或微调经验,熟悉前沿深度学习算法框架,有相应的代码实践经验或开源项目经验优先; 3 在以下方向中至少有一项研究或实践经验: • 对齐训练与模型可解释性分析 • 对抗攻防与安全评测 4 良好的英文文献阅读与论文写作能力,实习时长 6 个月及以上 5 在机器学习、AI安全等相关领域有文章发表或人工智能、CTF等领域竞赛获奖者优先。