部门介绍
数科致力于打造适合to B业务的大模型,围绕业务实际需求,通过Mid/post training提升模型的关键核心能力如数据分析、长文本推理、agentic coding、安全,将模型应用于数科众多商业化业务场景。
岗位职责
- 大规模预训练与中期训练:参与模型架构设计和优化,提升分布式训练稳定性与效率;负责中期连续训练(Mid-training)的数据配比与能力增强,提升模型基座能力;
- 有监督微调与多模态对齐:设计和优化高质量SFT数据流程,提升指令遵循能力;
- 强化学习与人类反馈:研发和优化大规模强化学习算法(PPO、DPO等),解决RL训练收敛难题;构建精细奖励模型(如PRM),提升复杂推理任务表现;
- 数据驱动与模型评测:建立数据与模型效果的反馈闭环,探索数据筛选与合成技术;设计精细评测体系,衡量模型在真实场景中的智能水平。
职位要求
- 学历背景: 计算机科学、人工智能、数学等相关专业硕士研究生及以上。
- 编程能力:熟练掌握Python,精通PyTorch深度学习框架。 加分项:
- 有分布式训练经验(Megatron-LM/DeepSpeed),熟悉CUDA编程等,能优化底层算子 。学术/竞赛产出(需至少满足一项):
- 论文: 在NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ICCV等CCF-A类会议或期刊以第一作者发表过论文 ;
- 竞赛: 在Kaggle、KDD Cup、ACM-ICPC等国际顶尖赛事中取得突出成绩;
- 深度参与过千亿/万亿参数大模型的全流程训练(不仅仅是微调);
- 对强化学习(eg. RLHF/PPO/GRPO)有深入理解和实战经验;
- 熟悉多模态模型架构(eg. Diffusion Model)或有相关的项目落地经验 ;
- 重要的开源项目贡献者(如PyTorch、HuggingFace Transformers、vLLM等)。