岗位职责
- 负责大模型(LLM)的核心算法研发,包括预训练、指令微调(SFT)、RLHF、对齐优化、推理增强等;
- 探索高效的模型调优策略、高质量数据建设方法,研究MoE稀疏化、Latent Attention等前沿模型结构;
- 支持大模型在搜索、推荐、对话、AIGC、语音、网盘文库、出海等多元业务场景的应用落地与效果优化;
- 负责量化、投机推理(MTP / Eagle / DFlash/DSpark)等训练–推理协同优化方案的设计与落地;
- 设计、实现并优化大规模分布式训练与推理框架,提升训练稳定性和推理效率;
- 参与大模型平台化建设,推动模型能力向创新产品转化。
职位要求
- 计算机、人工智能、数学等相关专业硕士及以上学历;
- 具备机器学习/深度学习/自然语言处理等扎实的理论背景与实践经验;
- 精通Transformer、GPT、BERT等主流模型架构,熟练掌握Python及PyTorch/TensorFlow/PaddlePaddle等深度学习框架;
- 有大规模预训练、SFT、RLHF、模型调优等实战经验者优先;
- 熟悉分布式训练框架(如Megatron、DeepSpeed)及大数据处理工具(Hadoop、Spark)者优先;
- 在NeurIPS、ICML、ACL、CVPR等顶会发表论文或有开源项目贡献者优先;
- 具有较强的团队合作与问题解决能力,拥抱技术变化,敢于挑战核心难题。 【加分项】
- 有量化感知训练(QAT)或 MTP 训练 实践经验;
- 熟悉 EAGLE / Medusa / MTP variants(如DeepSeek MTP、MiMo MTP) 等投机推理或高效推理方案。 招聘部门:大模型算法部、健康事业部、PSIG策略部、应用模型技术部、预训练部、自动驾驶技术部、千帆策略部、数字人产研和视频Agent组、数字人直播和互动技术组