岗位职责
负责元宝通用后训练/搜索问答/教育/微信元宝、生态及创新业务等场景的后训练算法优化,为用户打造准确、高效、智能的信息获取体验,让元宝真正成为用户日常生活与工作中值得依赖的智能助手。
- 参与元宝核心大模型能力的算法研发:围绕对话质量、指令遵循、事实性、长上下文、多轮一致性等核心指标,负责从问题定义、数据方案设计、训练/评测实验到线上灰度的完整闭环,对指标结果直接负责;
- 主导或深度参与至少一个元宝后训练优化算法方向;
- 构建可复用的数据与评测基础设施:设计高质量训练数据,建设可信的自动评测集与人工评测规范;
- 推动算法成果的线上化落地:与工程、产品、数据团队协同完成模型上线;
- 参与前沿技术的跟踪、复现与判断:对业界新方法做快速最小成本验证,输出"是否值得投入"的技术判断
职位要求
- 计算机、人工智能、机器学习、自然语言处理等相关专业,熟悉深度学习及大语言模型基本原理;
- 熟练使用Python、PyTorch等常用开发与深度学习框架,具备较强的模型训练、实验分析和工程实践能力,能够熟练使用主流AI编程工具开展研发工作;
- 在SFT、RLHF/RL、Agent、Tool Use等方向具有研究或项目经验者优先,熟悉PPO、GRPO等Post-training方法或具有相关实践经验者优先;
- 具备较强的模型行为分析能力,能够从实际问题出发定义可验证指标、设计优化方案,并通过实验持续迭代;
- 具备较强的论文阅读、独立思考和实验分析能力,持续关注大模型推理优化与Agentic RL前沿研究;
- 具备良好的沟通协作能力和Owner意识,能够主动推动开放性研究课题取得实质进展,具备高质量论文撰写能力。