岗位职责
- 负责 Agent 评估框架(Harness Engineering)的设计与开发,构建覆盖任务完成度、对话质量、工具调用准确性等多维度的自动化评测体系;
- 负责 Agent 自进化(Self-Evolution)方向的研究与落地,基于评估信号驱动 Agent 自动优化、自我纠错与能力迭代,探索无人工干预下的持续进化闭环;
- 负责基于 Agent 的用户主动感知与推荐系统研究,包括用户意图建模、跨会话记忆利用、主动提问策略与个性化推荐,提升 Agent 的主动服务能力;
- 基于 Agent 记忆系统,负责多模态感知应用能力的研究与落地,包括图像、人脸、声纹等识别能力与用户记忆的深度结合,实现跨会话的人物识别、声纹记忆与个性化感知应用,提升 Agent 对用户的长期理解与主动服务能力;
- 与产品和工程团队紧密合作,推进评估与自进化能力在相关业务中的部署和落地。
职位要求
- 计算机、电子工程、数学或机器学习相关专业方向硕士及以上学历;
- 熟悉 PyTorch/transformers 等框架,具备大模型应用开发与微调经验;
- 深入了解以下至少一个方向:Agent 自动化评测与 benchmark 构建、RLHF/RLAIF 与 Self-Play、RAG 与记忆检索、用户意图建模与推荐系统,具备独立探索前沿方向技术的能力;
- 具备良好的系统设计能力,能针对具体业务场景合理设计评估与训练流水线,兼顾性能、可扩展性与工程落地;
- 优秀的工程能力、逻辑思维和沟通表达能力;优秀的 vibe coding 能力。