部门介绍
灵光APP是一款原生多模态的AGI助手,团队致力于构建有竞争力的AGI产品体验。算法团队以用户体验为牵引,为灵光助手构建后训练体系和模型。驱动灵光在智能体验上保持业界领先。
岗位职责
- 可训练+连续性+协作:怎么让AI受用户的控制、持续稳定的受用户的控制,怎么去代用户接物待人,按照用户的意愿处理事情;
- 复杂工具管理:工具越来越多,怎么编排、怎么调用、怎么不串;
- 模型后训练:怎么让中小杯在特定场景可以逼近SOTA结果并提升SOTA覆盖不到的能力;
- 快速Demo开发:想法快速转化为可交互产品原型。原型先于文档,新模型发布=重访旧功能。 方向一:可训练+连续性+协作 结合harness方案,实现用户反馈驱动的Agent进化。核心挑战:单轨迹偏好学习(用户只走一条路,构不成偏好对)、纠正泛化(一次纠正如何迁移到相关场景)、防误训练(区分随手说""不要""vs真正偏好)、跨场景偏好迁移。多个Agent替用户协商。 方向二:复杂工具管理 设计工具编排与调用架构,解决工具数量增长带来的挑战。核心挑战:工具路由准确率(百级工具如何精准召回)、调用链可靠性(多步调用如何不串)、工具冲突检测(多个工具如何协调)、工具使用可解释性(用户能理解Agent为什么选这个工具)。 方向三:模型后训练 用RL/SFT控制成本、提升SOTA覆盖不到的能力。核心挑战:用户中心对齐(对齐对象是""这个用户""而非""所有人"")、成本控制(何时用大模型何时用小模型)、能力补齐(SOTA做不到的怎么通过后训练补上)、在线学习(如何持续从用户反馈中学习)。
职位要求
- 深入理解Transformer、大模型原理,熟练掌握Python;
- Agent实战经验:独立实现过Agent架构,理解长期记忆、工具调用准确率、多步规划等核心挑战。踩过Agent的坑——比如工具调用串了、记忆召回了一堆无关的、规划到第三步就崩了;
- 模型后处理能力:熟悉采样策略、结果校验等幻觉缓解手段,精通Prompt Engineering。熟悉数据处理、SFT/RL技术。理解GRPO及各种变种等核心概念,熟悉RL全链路,熟练使用Slime、OpenRLHF、verl等框架。知道RL在用户中心Agent场景下怎么用;
- 重度AI用户:高频使用各类大模型,对各模型能力边界如数家珍。 加分项(模型×Agent联合优化成果):
- 在模型与Agent的交叉领域有过充分实践优先:
- 顶会论文:NeurIPS/ICML/ICLR/ACL等与Agent/对齐/RLHF相关论文;
- 开源项目:为知名开源社区项目贡献核心代码,或有高star自主项目;
- 线上系统:参与过真实上线的AI系统,有可量化的效果指标;
- 技术影响力:高质量博客/竞赛奖项/有用户的Side Project。