岗位职责
- 参与大模型端到端安全评测体系建设,围绕内容安全、对抗鲁棒性、越狱攻击、防御有效性等方向设计并执行系统化评测方案,推动模型安全能力量化与评估标准完善。
- 参与大模型隐层表征风险感知能力研究,构建面向风险识别/安全判别的内部表征分析框架,探索模型在不同语义空间下的风险感知与决策机制。
- 参与大模型可解释性与模型探针(Model Probing)研究与落地,基于探针技术分析模型内部知识编码、风险表征分布及安全行为形成机制,提升模型安全决策透明度与可解释能力。
- 参与面向语言理解及多模态理解场景的低侵入式插件化原生安全围栏算法研发,探索轻量、高效、可插拔的安全防护机制,提升大模型原生安全能力与部署灵活性。
- 参与大模型原生安全增强技术的探索与落地,研究以低侵入、最小打扰方式提升目标模型解码阶段安全性的关键技术路径,在保障模型安全性的同时平衡生成质量与用户体验。
- 跟踪国内外大模型安全、模型可解释性及 Runtime Safety Alignment等前沿研究进展,复现相关论文与开源方案,推动研究成果在实际业务场景中的落地应用。
职位要求
- 硕士及以上学历在读,计算机、人工智能、网络安全、数学等相关专业优先。
- 具备扎实的深度学习基础,熟悉 Qwen、DeepSeek、GLM、Gemma 等主流大模型架构及训练/推理机制。
- 熟悉深度学习框架(PyTorch)和主流大模型推理框架(vLLM、SGLang),具备较强的算法实现与实验能力。
- 了解模型安全、模型可解释性、Representation Learning、Alignment/Guardrail 等相关AI安全研究方向,有相关项目、研究经验和顶会论文者优先。
- 具备良好的论文阅读与复现能力,能够跟踪并理解前沿学术研究工作。
- 熟练掌握 Python 编程,具备良好的工程实现能力和代码规范意识。
- 具备较强的逻辑分析能力、学习能力和问题拆解能力,对大模型安全研究有浓厚兴趣。
- 工作地点杭州,每周至少实习4天,持续3个月以上。