岗位职责
(1)商家Agent全链路算法优化:负责商家Agent系统的算法设计与持续优化,覆盖意图理解、任务规划、上下文治理、记忆机制、长程规划等核心环节,构建具备自主决策与动态规划能力的端到端智能系统。 (2)Agent Harness优化:主导Agent Harness的设计与迭代,包括系统提示词与指令体系、上下文窗口管理、工具集编排、多轮交互管理、反思与纠错机制等,系统性提升Agent在复杂经营任务上的任务成功率与执行效率。 (3)领域模型后训练:主导SFT/DPO/RLHF/GRPO等后训练方法在商家经营场景的落地,包括领域指令数据与偏好数据构造、奖励设计、训练与评测全流程,持续提升模型对商家经营领域知识的理解、生成与决策能力。 (4)商家经营知识挖掘:面向装修、商品、经营分析等场景,从内外部知识库、商家行为数据、经营数据、交易数据等海量数据中挖掘经营知识与领域规则,构建可持续更新的商家经营知识库,增强Agent的领域专业性与回答可靠性。 (5)评测能力建设:构建多维度、科学、高置信度的Agent评测体系,覆盖任务成功率、工具调用准确率、业务流程完成率、回答质量、稳定性、成本与延迟等指标,建设自动化评测与数据飞轮,基于线上真实反馈打通"评测—数据—训练"闭环。 (6)业务落地与前沿探索:与工程、产品等团队紧密协作,将算法能力产品化、平台化,支撑商家经营助手持续迭代;跟踪Agentic RL、多智能体协作、Skill自进化、推理成本优化等前沿方向,推动可落地的技术转化。 (1)Agent真实落地场景:商家经营是Agent天然的高价值落地场景——高频刚需、决策链路长、工具调用密集、多目标博弈,配合海量真实商家数据,构成极高的场景与数据壁垒,算法效果与业务收益强挂钩; (2)全栈技术闭环:覆盖Agent Harness、领域模型后训练、知识挖掘、评测体系的完整算法链路,从数据、评测、架构到模型全流程,快速成长为Agent领域技术专家; (3)个人成长空间大:优秀同学科可任算法主R,与业界一流团队并肩前行,参与前沿技术与业务的双重探索,获得快速成长与能力提升机会。
职位要求
(1)本科及以上学历,计算机、人工智能、机器学习、自然语言处理等相关专业优先; (2)具备扎实的算法理论基础,熟悉机器学习/深度学习/NLP,掌握Transformer、Embedding、向量检索、生成式模型等基本原理,熟悉主流大模型及其技术范式; (3)对LLM应用有深入理解与实践经验,理解RAG、Prompt Engineering、Function Calling、Agent Planning、Tool Use等技术机制,有Agent系统或对话系统完整项目经验者优先; (4)熟悉Python,熟练使用PyTorch/Transformers/vLLM等常见工具或框架;有大模型后训练(SFT/DPO/RLHF等)实战经验者优先; (5)具备较强的实验设计与问题分析能力,能够通过数据、评测和实验定位模型效果问题,并在算法效果、工程复杂度、推理成本和业务收益之间做合理权衡; (6)有好奇心,敢想敢做,责任心强;具备较强的团队协作与沟通能力,有较强的学习能力和业务分析及问题解决能力。