岗位职责
- 针对模型合规及伦理风险,包括特殊群体保护、AI意识与过拟人化、危机干预等,结合自身科研研究,明确风险定义,平衡模型安全性和有用性。
- 建设伦理风险相关知识库与风险画像体系,沉淀人类弱势群体画像、敏感场景分类、AI影响人类认知/情绪/决策/行为的风险类型与表现、风险触发机制、干预策略及案例库,为评测、红队、模型对齐和产品治理提供系统化知识支撑。
- 构建科学、全面的伦理评测集。设计并落地覆盖多维度风险场景的伦理评测基准(Benchmark),融合黑盒评测与白盒神经元分析,深入解析模型“为何如此回答”,实现从“发现问题”到“理解根源”的跃迁。
- 负责A2A评测实验环境搭建及实验实施,将传统纯LLM评测拓展至Agent、多智能体交互、工具调用、端到端任务链路等复杂场景,设计可复现的实验流程、观测指标与风险判定标准,评估模型在真实任务环境中的伦理安全性、稳定性和行为边界。
职位要求
- 硕士及以上学历,人工智能、计算机科学、认知科学、哲学、社会学、心理学、法学等相关专业背景;
- 对AI伦理、AI安全、模型对齐(Alignment)有浓厚兴趣或研究经验,熟悉主流大模型风险类型,如歧视、滥用、意识幻觉、过拟人化、心理/行为影响等;
- 具备扎实的分析能力,能独立设计实验、构建评测集,并擅长从数据、案例和模型行为中提炼洞察;
- 熟悉LLM、Agent、多智能体交互、工具调用或端到端任务评测者优先;有A2A评测环境搭建、自动化评测平台、模型红队或安全评测经验者优先;
- 有伦理风险知识库、风险分类体系、用户/群体画像、行为影响分析、社会心理学或人机交互研究经验者优先;
- 具备出色的跨团队协作与组织能力,能推动专家网络协同,有学术或行业影响力者优先;
- 心怀敬畏,关注技术的社会影响,致力于构建可信赖、负责任的AI。