岗位职责
面向下一代通用模型能力边界,围绕语言、多模态、语音与音频等方向,探索基础模型架构、训练范式和关键算法创新,推动前沿技术在真实场景中的持续演进与落地。重点关注 Diffusion Large Language Model(DLLM) 等新型生成架构,以及模型在生成、推理、多模态理解、语音交互与 Agent 扩展等方向的能力上限。 具体职责包括以下相关方向的一项或多项:
- DLLM 与基础模型架构研究。参与下一代 Diffusion Large Language Model(DLLM)等前沿模型的核心架构设计、训练范式探索与全流程研发,推动基础模型在生成质量、推理能力与可扩展性上的持续演进。
- 多模态理解与生成研究。围绕图像、视频、文本、语音等多模态内容,探索统一建模、跨模态对齐、理解与生成融合、交互式生成等方向,提升模型在复杂场景中的理解、生成与交互能力。
- 语音与音频智能研究。 围绕语音识别、语音合成、音频理解、音乐生成、语音对话等方向开展算法研究,提升模型在准确率、自然度、实时性、鲁棒性与多轮交互体验上的表现。
- 数据飞轮与训练体系建设。参与高质量数据管线与训练体系建设,覆盖语言、多模态、语音音频等场景下的数据采集、清洗、配比、标注、质检与实验设计,支撑模型持续迭代优化。
- 解码、推理与表征学习创新。设计并实现创新的解码、采样、推理与表征学习方法,探索高效概率建模、跨模态表征和生成策略,提升模型效果、多样性与推理效率。
- 理论与系统结合的算法创新。将扩散模型、随机过程、最优化、信号处理等理论与系统工程相结合,推动前沿算法方案在真实训练与推理环境中的高效落地。
- 研究协作与成果产出。与研究、工程和产品团队协作,围绕基础模型能力边界中的关键问题开展研究,沉淀可复用的方法、实验结论与技术成果。
职位要求
- 计算机、人工智能、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制;
- 具备扎实的深度学习、概率论、最优化等理论基础,理解 Transformer、LLM 及扩散模型的核心原理与能力边界;
- 对扩散模型(Diffusion Models / Diffusion LLM)有较深入理解,有相关研究或实践经验者优先;
- 备良好的数据 sense,理解大模型训练中的数据构建、清洗、配比与质量评估机制,有数据管线实操经验者优先;
- 熟悉大模型训练与实验流程,能够独立完成算法设计、实验分析、效果归因与迭代优化;
- 熟练掌握 Python 与 PyTorch,具备较强的实验与工程实现能力;
- 具备优秀的研究能力与学术判断,能够从实际问题中提炼研究命题并持续推进;
- 目标导向,敢于承担前沿探索中的不确定性,能在前沿问题上保持深入思考与执行力;
- 具备良好的协作能力,能够与研究、工程和应用团队共同推动技术突破与落地。 加分项:
- 有顶会论文(NeurIPS、ICLR、ICML、ACL、CVPR 等)、高影响项目或开源贡献者加分;
- 对 Agent、多模态扩展、生成策略、推理机制等前沿方向有研究兴趣或实践经验者优先。