岗位职责
我们希望把“理解用户”从一次性标签升级为可持续学习、可验证、可审计的智能体能力。你将基于海量数据,参与产品的用户记忆和个性化算法研发,让系统在跨会话、跨月度的长期交互中持续理解用户,并把记忆转化为有用、及时、可信的个性化服务。 具体职责包括以下相关方向的一项或多项: ● 长周期智能体记忆:研究并实现记忆抽取、写入、检索、整合、压缩、冲突消解与选择性遗忘;区分客观事实、短期状态与稳定偏好,处理信息漂移、错误固化和灾难性遗忘; ● 用户建模与个性化决策:融合对话、行为、持仓/交易等多源信号,构建可解释、带时效和来源的用户表征,支持个性化推荐、用户决策逻辑、理财档案及 Agent 任务规划,并探索主动服务的介入时机与打扰成本; ● 学习型策略优化:探索将记忆操作和个性化策略建模为序列决策,在稀疏、延迟、含噪反馈下开展 SFT、偏好优化、Agentic RL、Bandit 或因果实验,研究长时程信用分配与稳定性—可塑性权衡; ● 用户模拟与数据飞轮:基于真实日志构建可校准的用户模拟器、合成轨迹与难例环境,衡量并修正 sim-to-real gap,用真实线上反馈持续校准 Agent。
职位要求
基础要求: ● 计算机、人工智能、数学、统计学等相关专业优先; ● 具备扎实的机器学习、深度学习与概率统计基础,熟练使用 Python 和 PyTorch,具备良好的算法实现、实验复现与工程调试能力。 专业能力: ● 至少在以下一个方向有深入研究或项目实践:LLM/Agent Memory、用户建模与推荐系统、持续学习、强化学习/Contextual Bandit、生成式用户模拟、信息检索或表示学习; ● 理解 Transformer 与主流 LLM 训练、推理范式;有 SFT、偏好优化、Agentic RL、轨迹数据构建或大规模行为序列建模经验者优先; ● 能围绕真实业务问题完成“问题形式化—数据构建—算法设计—离线评测—线上实验—误差归因”的完整闭环;熟悉 A/B 测试、因果推断或反事实评估者优先; ● 具备良好的代码与系统能力,能独立完成可复现原型;有大规模数据处理、向量检索、推荐/检索服务或分布式训练经验者加分。 重点优先: ● 在 NeurIPS、ICML、ICLR、ACL、EMNLP、KDD、WWW、SIGIR、RecSys 等相关顶会发表过论文,研究方向与智能体记忆、个性化/推荐、用户模拟、强化学习或持续学习相关; ● 为相关高影响力开源项目的核心贡献者,熟悉DeepSeek Harness等常见Harness框架。 能力特质: ● 研究品味与问题意识:有创新意识且能做出高水平的研究,重视严谨对照、负结果和可复现性; ● 强自驱与动手能力:能快速阅读前沿论文、复现关键结论,并将研究原型推进到可评测、可迭代的系统; ● 用户同理心与责任感:尊重用户隐私与金融场景边界,对个性化结果的准确性、可解释性与潜在伤害保持敏感。