岗位职责
- 构建 Uplift Model(R/X-Learner),从“反事实”视角量化赔付策略对 GMV/留存/用户满意度的绝对增量,拒绝无效补贴。
- 负责大模型在纠纷场景下的 SFT与 RLHF,运用 GRPO、DPO 等算法提升模型对复杂平台规则的逻辑推演能力。探索 CoT与 PRM 技术,确保模型在定责与赔付建议上的高度一致性与可解释
- 强化学习:探索 Agent 架构与过程奖励模型,在动态博弈环境下优化赔付路径,实现长期 ROI 最大化。
职位要求
- 学历背景:硕士及以上学历,计算机、人工智能、信号处理、模式识别等相关专业,优秀本科生可放宽条件;
- 熟悉机器学习常用算法模型原理,有一定的实践经验,包括但不限于LR,XGB,S-learner,X-learner、uplift tree等;
- 具备 NLP / CV 技术应用经验,包括但不限于语义分析、检索模型、知识库构建、视觉大模型、多模态大模型等; 编程能力:
- 熟练掌握 Python/C++/Java 等至少一门编程语言;
- 有扎实的算法基础和代码实现能力,能独立完成复杂系统开发; 加分项:
- 深入理解强化学习的核心算法(如 PPO、DPO、GRPO)以及常用框架(ray、verl、openrlhf),有相关项目实践经验;
- 有个性化优惠券、智能补贴、push算法、智能投放等领域经验者优
- 在顶级会议(如 ACL、NeurIPS、ICLR 等)发表过相关论文,或高水平竞赛取得优秀名次;