岗位职责
研究领域: 人工智能安全 项目简介: 大模型安全护栏作为数科商业化产品蚁天鉴的核心能力,其本质是利用大模型对模型输入、输出内容进行准确识别(即LLM-as-classifier)。 当前主流的大模型安全防护机制多采用统一的过滤规则或后置的内容审核策略,缺乏对不同应用场景、用户群体、内容类型和风险等级的精细化区分。这种“一刀切”的安全策略往往导致过度审查或防护不足,难以兼顾安全性与可用性。尤其在面对复杂多变的应用生态时,亟需一种更具适应性、可解释性和可管理性的安全分类体系及快速分类技术。 在此背景下,提出“大模型层次化分类”作为安全护栏构建的关键技术路径具有重要意义。层次化分类旨在依据内容敏感性、应用领域、用户身份、输出影响等级等多维特征,构建一个结构清晰、动态可调的安全分类框架。通过将大模型的输入输出划分为不同安全层级(如公开级、受限级、机密级等),并针对不同层级配置差异化的安全策略(如审核强度、访问权限、日志记录、响应限制等),实现由粗到细、逐层递进的安全管控。
职位要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作