岗位职责
- 多样性用户模拟,用于训练、测试数据的生成以及多轮RL的轨迹生成。
- APO技术,开源基座模型的复杂指令遵循能力有待提升,通过APO精简prompt。
- 多轮RL后训练,优化reward shaping以及轮次奖励方法提升RL稳定性。
- 欺诈叫醒手法素材库建设,利用举报案件库中通过算法聚类和图文生成方法建设有针对性的素材。
- 用户行为理解,通过用户行为和举报案件特征的表征匹配,实现个性化的素材推荐。
职位要求
- 有大模型后训练经验,SFT、DPO、GRPO等。
- 有智能体Tool调用、记忆压缩的优化经验。
- 熟练掌握PyTorch、Tensorflow开发工具。
- 在ACL、EMNLP、ICML等顶会有论文发表者优先。