岗位职责
研究智能系统如何利用任务结果、环境反馈和评测信号,持续优化推理策略、记忆机制、Agent Harness 与训练数据,并进一步演化任务生成、能力诊断、验证信号和优化策略,以跨代能力增益、分布外泛化、非退化约束和单位计算收益为标准,探索可验证、可持续的 Recursive Self-Improvement。
职位要求
- 理论基础扎实:深厚的深度学习与优化理论功底,能从第一性原理建模问题;
- 架构深入理解:熟悉 Transformer、MoE 及主流大模型底层实现;
- 精通后训练范式:SFT、RLHF/DPO/PPO 等对齐算法,理解 Alignment 原理与挑战;
- Agentic 实战经验:具备复杂 Agentic 系统(Tool-use / Reasoning / Planning)的训练与搭建经验;
- 科学实验素养:能独立设计实验、严谨验证,在复杂工程约束下做出算法决策。 加分项:
- 顶会论文发表或高水平竞赛金牌;
- MoE 或新型 Attention 设计经验;
- 长上下文(100K+)训练经验;
- 100B+ 参数规模模型训练经验;
- 数据分布建模与 Scaling 经验。