岗位职责
- 参与蚂蚁国际商服平台智能客服机器人的算法设计与研发,负责商服基座大模型的后训练与持续优化,包括监督微调(SFT)、偏好对齐、强化学习(RLHF/RLAIF)等,提升模型在真实业务场景中的回答质量、指令遵循和复杂问题解决能力,并推动模型高效落地。
- 负责大模型 Agent 能力建设,围绕多轮对话、任务规划、知识检索、工具选择与调用、上下文保持、异常恢复等关键能力开展训练与优化,提升 Agent 在复杂商服任务中的自主决策和端到端任务完成能力。
- 建设基于业务反馈的模型持续优化闭环,对线上 bad case 进行分析归因、数据构造、训练迭代和效果回归,将可复用的业务知识与服务经验持续沉淀到模型中。
- 参与智能坐席助手的算法设计与研发,面向坐席服务全流程,建设文本总结、观点挖掘、模拟对话、语义搜索、话术推荐和智能质检等能力,提升坐席人员的服务效率、服务质量与覆盖范围。
- 持续跟进大模型后训练、强化学习和 Agent 领域的前沿技术,结合业务需求开展算法创新、实验验证和工程落地。
职位要求
- 计算机、人工智能、统计学或相关专业,熟练掌握 Python、Java 中至少一种主流编程语言,具备扎实的算法和工程开发能力。
- 具备扎实的机器学习、深度学习和自然语言处理基础,熟悉 Transformer 架构及大语言模型的训练与推
- 熟练掌握至少一种主流深度学习或大模型训练框架,如 PyTorch、DeepSpeed、Megatron-LM、LLaMA-Factory 等。
- 熟悉大模型后训练技术,包括 SFT、偏好数据构造、奖励模型、RLHF/RLAIF,以及 PPO、DPO、GRPO 等对齐或强化学习方法;具有实际训练、调优和效果评估经验者优先。
- 熟悉大模型 Agent 技术,包括多轮任务规划、RAG、工具调用、函数调用、长上下文管理、环境反馈和错误恢复等;具有 Agent 训练或复杂任务能力增强经验者优先。
- 具备数据驱动的模型持续优化能力,能够完成线上问题归因、训练数据建设、评测体系设计、模型迭代和回归分析。
- 具备良好的沟通协作能力,能够与产品、工程和业务团队共同推进新技术在实际