岗位职责
- 面向投研、估值和金融建模等真实工作流,将金融专家的分析过程表示为可执行、可审计的长程推理轨迹;
- 研究多源信息检索与交叉验证、时序一致性、数值推理、可信度控制、可验证奖励与长程信用分配,并通过 Agentic RL、Multi-Teacher On-Policy Distillation(MOPD)等方法,推动金融专项能力与通用推理能力协同演进。
职位要求
- 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
- 了解业界主流语言大模型相关基础结构和优化方法;
- 熟悉GPU,存储,分布式集群等相关基础知识;
- 熟悉大模型基本后训练流程以及相关算法原理;
- 能从第一性原理建模问题,有较好的动手能力;
- 有较好的团队协同能力,思路敏捷,沟通效率。 加分项:
- 有100B MOE模型以上的后训练时间经验;
- 有强化学习,SFT,OPD相关的顶会论文发表;
- 有训练,推理,评测效率优化以及与算法协同开发经验;
- 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
- 有跨学科背景(数理化生 / 金融 / 法律等);
- 各类高水平竞赛金牌选手。